中国吧 · 原创文章
本地跑大模型教程:Ollama 一键部署开源 LLM
(本文为中文深度解读。点击右上角 中 / EN 按钮可切换查看英文概要)
为什么要在本地跑大模型
本地部署开源 LLM 的四类理由:
- 私密:数据不出设备,适合处理敏感文档
- 免费:无按 token 计费,跑得多也不花钱
- 离线:断网也能用
- 可控:模型权重、温度、上下文都由你定
代价是:需要一定硬件(内存/显存),且能力上限普遍低于商用大模型(如 GPT、Claude)。
Ollama 是什么
Ollama 是开源(Apache/类似 MIT 风)的本地 LLM 管理器,把下载->量化->运行->API 全包了,一条命令拉起模型,还自带 OpenAI 兼容的 /v1/chat/completions 接口。
安装(三大平台)
| 平台 | 安装方式 | 备注 |
|---|---|---|
| macOS | 官网 .zip 或 brew install ollama | Apple Silicon 跑量化模型很香 |
| Windows | 官网安装包 .exe | 建议配合 24GB+ 显存显卡 |
| Linux | curl -fsSL https://ollama.com/install.sh | sh | 或用 docker docker run ollama/ollama |
常用模型选型表
| 模型 | 参数 | 建议显存/内存 | 定位 |
|---|---|---|---|
| qwen2.5:7b | 7B | 8GB 起 | 中文能力强,入门首选 |
| llama3.1:8b | 8B | 8GB 起 | 英文综合,经典入门 |
| gemma2:9b | 9B | 8-12GB | Google 出品,指令遵循好 |
| mistral:7b | 7B | 8GB 起 | 欧洲轻量,速度优先 |
| deepseek-r1:7b | 7B | 8GB 起 | 带推理(thinking),可尝试 |
| qwen2.5:14b | 14B | 16GB 起 | 中文更强,需中高配置 |
| llama3.1:70b | 70B | 48GB+ | 旗舰,需多卡或高显存 |
提示:内存不足也能跑,系统会自动用 CPU+SWAP,但速度明显变慢。
三步跑起第一个模型
# 1) 拉取模型(以 qwen2.5:7b 为例) ollama pull qwen2.5:7b # 2) 直接对话 ollama run qwen2.5:7b >>> 你好,介绍一下自己 # 3) 退出对话 /bye
用 API 接入(OpenAI 兼容)
启动默认在 127.0.0.1:11434,可用 OpenAI 格式调用:
curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5:7b", "messages":[{"role":"user","content":"写一句欢迎语"}]}'
这意味着你写的 Python(Pip 安装 openai 库即可把 base_url 指向它)或已有 OpenAI 工具,只要改一行 base_url 就能切换到本地模型。
常用技巧
- 换模型不换流程:pull 新模型名即可切换
- 控制上下文:运行时加
--num-ctx 8192等参数 - 保存自定义角色:
ollama create mybot -f Modelfile定制 system prompt - VSCode/工具接入:把扩展里的 Base URL 填
http://localhost:11434/v1
提示:首次 pull 模型需要下载几个 GB,请确保网络稳定;家用无独显跑 7B 可接受,14B+ 建议
--num-ctx 调小以提速。更多部署经验可参考AI 工具导航收录的本地部署工具。常见问题 FAQ
没有显卡能跑大模型吗?
能。纯 CPU 跑 7B 可用但慢(数 token/秒),CPU+足够内存(16GB+)即可跑轻量模型。有 8GB+ 显存则体验明显更好。
7B、14B、70B 差别大吗?
参数越多能力越强,但需求成倍增加。7B 适合常规问答/写作,14B 中文理解更好,70B 接近顶级但需 48GB+ 显存。按硬件选即可。
Ollama 是免费的吗?
Ollama 软件本身免费开源,模型多为开源权重(MIT/Apache 等)。没有订阅费用,只有你的电费和电费对应的算力。
本地模型能替代 ChatGPT 吗?
对常规写作/问答/轻推理,本地 7-14B 可替代大半场景;但复杂推理、长文档、最新资讯,商用云端模型仍更强。建议本地跑敏感+离线场景,难任务交给云端。