主题
🦙 Ollama 本地推理入门
一条命令跑大模型——新手零门槛进入 AI 推理世界
什么是 Ollama
Ollama 是一个本地运行大模型的工具,装它、下模型、跑推理,三步搞定。不需要配 CUDA、不需要写代码。
支持的开源模型:Qwen、DeepSeek、LLaMA、Mistral、Gemma 等几十种。
安装
Linux
bash
curl -fsSL https://ollama.com/install.sh | sh一行完成。自动检测 GPU,有 NVIDIA 卡就用 GPU 加速,没有就用 CPU。
验证
bash
ollama --version
# ollama version is 0.3.x下载并运行第一个模型
bash
# 下载 Qwen2.5 7B(约 4GB)
ollama pull qwen2.5:7b
# 直接对话
ollama run qwen2.5:7b
# >>> 你好,请用中文回答推荐模型清单
| 模型 | 大小 | 显存需求 | 适合场景 |
|---|---|---|---|
| qwen2.5:7b | 4GB | 6GB+ | 通用对话、代码 |
| qwen2.5:14b | 8GB | 12GB+ | 复杂推理 |
| qwen2.5:32b | 18GB | 24GB+ | 接近 GPT-4 水平 |
| deepseek-r1:7b | 4GB | 6GB+ | 逻辑推理强 |
| deepseek-r1:14b | 8GB | 12GB+ | 深度思考 |
| llama3.2:3b | 2GB | 4GB+ | 轻量快速 |
常用命令
bash
# 列出已下载的模型
ollama list
# 查看模型详情
ollama show qwen2.5:7b
# 删除模型
ollama rm qwen2.5:7b
# 查看运行日志
journalctl -u ollama -f提供 API 服务
Ollama 默认在 11434 端口提供 REST API:
bash
# 测试 API
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5:7b",
"prompt": "一句话解释什么是机器学习",
"stream": false
}'返回:
json
{
"model": "qwen2.5:7b",
"response": "机器学习是让计算机通过数据自动学习规律和模式的技术。",
"done": true
}允许外部访问
默认只监听 127.0.0.1,要让其他机器访问:
bash
# 设置环境变量
sudo systemctl edit ollama.service
# 添加:
[Service]
Environment="OLLAMA_HOST=0.0.0.0"
# 重启
sudo systemctl daemon-reload
sudo systemctl restart ollama安全提示
把 OLLAMA_HOST 设为 0.0.0.0 后任何人都能调你的模型。务必配合防火墙限制 IP,或者前面套一层 nginx 反代 + 鉴权。
多模型管理
同时加载多个模型
Ollama 按需加载——请求某个模型时才加载到显存,空闲一段时间自动卸载:
bash
# 设置空闲卸载时间(默认 5 分钟)
OLLAMA_KEEP_ALIVE=10m ollama serve显存不足时
bash
# 限制并发请求数
OLLAMA_NUM_PARALLEL=1 ollama serve
# 或降低量化精度
ollama pull qwen2.5:7b-q4_K_M # 4-bit 量化,显存减半常见问题
下载模型慢
Ollama 默认从国外下载,国内可能很慢。设置代理或换镜像:
bash
# 或者直接从 ModelScope 下载 GGUF 文件
# 然后用 Ollama 的 Modelfile 导入模型回答乱码
大概率是量化版本太低。换 q4_K_M 或 q8_0 精度。
🎯 本章要点
- Ollama 三步走:安装→pull→run,零配置跑大模型
- API 默认在 localhost:11434,开放外网要加防火墙+鉴权
- 按需加载+空闲自动卸载,显存管理省心
- 模型量化选 q4_K_M 平衡质量和显存,乱码就换更高精度
加载练习题中...