想本地跑大模型,不想把数据发到云端、不想烧 API 钱?Ollama 是目前最简单的一条路——一行命令装好,就能跑开源模型。这篇把"要什么硬件、怎么选模型、日常怎么用"一次讲清。
为什么本地跑
- 隐私:数据不出本机,适合笔记、文档、本地知识库
- 零 API 费:只要电费
- 离线可用:断网也能用
- 可微调折腾:开源权重随便研究
代价是:你的显卡(或内存)决定体验上限。
硬件门槛(真实参考)
跑小模型(1~4B)普通电脑就能跑;跑 7~8B 需要 16GB 内存(纯 CPU 能跑但慢);想跑 30B+ 或速度流畅,建议 RTX 30/40 系 12GB+ 显存,或者用 Ollama 的量化版本把压力降到内存上。
| 模型规模 | 最低要求 | 体验 |
|---|---|---|
| 1~3B(如 Qwen2.5-3B) | 8GB 内存 | 快,够日常问答 |
| 7~8B(如 Qwen2.5-7B) | 16GB 内存 / 8GB 显存 | 水桶,推荐起点 |
| 14B | 16GB 显存 | 更强但更吃硬件 |
| 70B / 400B | 企业级 | 消费级别想了 |
三步上手(真保姆级)
- 去 ollama.com 下载安装(Windows/mac/Linux 都有)
- 终端执行:
ollama pull qwen2.5(把模型拉到本地) - 跑起来:
ollama run qwen2.5,然后直接聊天
想用 API?Ollama 默认在本机 11434 端口提供 OpenAI 兼容接口,各种工具直接填 http://localhost:11434/v1 就能接。
怎么选模型
- 中文场景:Qwen(通义千问开源版) 中文最好
- 通用/英文:Llama 3 生态最全
- 要推理/数学:DeepSeek-R1 蒸馏版(1.5B~70B),开源可跑
- 记关键词:模型名字里的数字基本就是参数量,越大越聪明也越吃配置
几个避坑点
- 模型下载动辄几个 GB,磁盘留够(7B 量化约 4~5GB)
- 量化越高阶越省内存(Q4/Q8 是主流),牺牲一点精度换能跑
- 别拿 7B 本地模型和 GPT/Claude 比"全能",本地模型的强项是私有数据和零成本,不是天花板智力
一句话
想要数据私密、零 API 费、还能折腾研究的,本地跑 Ollama + Qwen2.5 是最省心的起步配置;对模型能力有高要求、又不差钱的,还是老实走云端 API。
(模型参数与硬件建议为公开资料整理,以 Ollama 官网与各模型发布说明为准。)
暂无评论