zgba 中国吧

中国吧 · 原创文章

本地跑大模型教程:Ollama 一键部署开源 LLM

(本文为中文深度解读。点击右上角 中 / EN 按钮可切换查看英文概要)

为什么要在本地跑大模型

本地部署开源 LLM 的四类理由:

  • 私密:数据不出设备,适合处理敏感文档
  • 免费:无按 token 计费,跑得多也不花钱
  • 离线:断网也能用
  • 可控:模型权重、温度、上下文都由你定

代价是:需要一定硬件(内存/显存),且能力上限普遍低于商用大模型(如 GPT、Claude)。

Ollama 是什么

Ollama 是开源(Apache/类似 MIT 风)的本地 LLM 管理器,把下载->量化->运行->API 全包了,一条命令拉起模型,还自带 OpenAI 兼容的 /v1/chat/completions 接口。

安装(三大平台)

平台安装方式备注
macOS官网 .zip 或 brew install ollamaApple Silicon 跑量化模型很香
Windows官网安装包 .exe建议配合 24GB+ 显存显卡
Linuxcurl -fsSL https://ollama.com/install.sh | sh或用 docker docker run ollama/ollama

常用模型选型表

模型参数建议显存/内存定位
qwen2.5:7b7B8GB 起中文能力强,入门首选
llama3.1:8b8B8GB 起英文综合,经典入门
gemma2:9b9B8-12GBGoogle 出品,指令遵循好
mistral:7b7B8GB 起欧洲轻量,速度优先
deepseek-r1:7b7B8GB 起带推理(thinking),可尝试
qwen2.5:14b14B16GB 起中文更强,需中高配置
llama3.1:70b70B48GB+旗舰,需多卡或高显存

提示:内存不足也能跑,系统会自动用 CPU+SWAP,但速度明显变慢。

三步跑起第一个模型

# 1) 拉取模型(以 qwen2.5:7b 为例)
ollama pull qwen2.5:7b

# 2) 直接对话
ollama run qwen2.5:7b
>>> 你好,介绍一下自己

# 3) 退出对话
/bye

用 API 接入(OpenAI 兼容)

启动默认在 127.0.0.1:11434,可用 OpenAI 格式调用:

curl http://127.0.0.1:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen2.5:7b", "messages":[{"role":"user","content":"写一句欢迎语"}]}'

这意味着你写的 Python(Pip 安装 openai 库即可把 base_url 指向它)或已有 OpenAI 工具,只要改一行 base_url 就能切换到本地模型。

常用技巧

  • 换模型不换流程:pull 新模型名即可切换
  • 控制上下文:运行时加 --num-ctx 8192 等参数
  • 保存自定义角色:ollama create mybot -f Modelfile 定制 system prompt
  • VSCode/工具接入:把扩展里的 Base URL 填 http://localhost:11434/v1
提示:首次 pull 模型需要下载几个 GB,请确保网络稳定;家用无独显跑 7B 可接受,14B+ 建议 --num-ctx 调小以提速。更多部署经验可参考AI 工具导航收录的本地部署工具

常见问题 FAQ

没有显卡能跑大模型吗?

能。纯 CPU 跑 7B 可用但慢(数 token/秒),CPU+足够内存(16GB+)即可跑轻量模型。有 8GB+ 显存则体验明显更好。

7B、14B、70B 差别大吗?

参数越多能力越强,但需求成倍增加。7B 适合常规问答/写作,14B 中文理解更好,70B 接近顶级但需 48GB+ 显存。按硬件选即可。

Ollama 是免费的吗?

Ollama 软件本身免费开源,模型多为开源权重(MIT/Apache 等)。没有订阅费用,只有你的电费和电费对应的算力。

本地模型能替代 ChatGPT 吗?

对常规写作/问答/轻推理,本地 7-14B 可替代大半场景;但复杂推理、长文档、最新资讯,商用云端模型仍更强。建议本地跑敏感+离线场景,难任务交给云端。

BOT WELCOME