Skip to content

🦙 Ollama 本地推理入门

一条命令跑大模型——新手零门槛进入 AI 推理世界

什么是 Ollama

Ollama 是一个本地运行大模型的工具,装它、下模型、跑推理,三步搞定。不需要配 CUDA、不需要写代码。

支持的开源模型:Qwen、DeepSeek、LLaMA、Mistral、Gemma 等几十种。


安装

Linux

bash
curl -fsSL https://ollama.com/install.sh | sh

一行完成。自动检测 GPU,有 NVIDIA 卡就用 GPU 加速,没有就用 CPU。

验证

bash
ollama --version
# ollama version is 0.3.x

下载并运行第一个模型

bash
# 下载 Qwen2.5 7B(约 4GB)
ollama pull qwen2.5:7b

# 直接对话
ollama run qwen2.5:7b
# >>> 你好,请用中文回答

推荐模型清单

模型大小显存需求适合场景
qwen2.5:7b4GB6GB+通用对话、代码
qwen2.5:14b8GB12GB+复杂推理
qwen2.5:32b18GB24GB+接近 GPT-4 水平
deepseek-r1:7b4GB6GB+逻辑推理强
deepseek-r1:14b8GB12GB+深度思考
llama3.2:3b2GB4GB+轻量快速

常用命令

bash
# 列出已下载的模型
ollama list

# 查看模型详情
ollama show qwen2.5:7b

# 删除模型
ollama rm qwen2.5:7b

# 查看运行日志
journalctl -u ollama -f

提供 API 服务

Ollama 默认在 11434 端口提供 REST API:

bash
# 测试 API
curl http://localhost:11434/api/generate -d '{
  "model": "qwen2.5:7b",
  "prompt": "一句话解释什么是机器学习",
  "stream": false
}'

返回:

json
{
  "model": "qwen2.5:7b",
  "response": "机器学习是让计算机通过数据自动学习规律和模式的技术。",
  "done": true
}

允许外部访问

默认只监听 127.0.0.1,要让其他机器访问:

bash
# 设置环境变量
sudo systemctl edit ollama.service

# 添加:
[Service]
Environment="OLLAMA_HOST=0.0.0.0"

# 重启
sudo systemctl daemon-reload
sudo systemctl restart ollama

安全提示

把 OLLAMA_HOST 设为 0.0.0.0 后任何人都能调你的模型。务必配合防火墙限制 IP,或者前面套一层 nginx 反代 + 鉴权。


多模型管理

同时加载多个模型

Ollama 按需加载——请求某个模型时才加载到显存,空闲一段时间自动卸载:

bash
# 设置空闲卸载时间(默认 5 分钟)
OLLAMA_KEEP_ALIVE=10m ollama serve

显存不足时

bash
# 限制并发请求数
OLLAMA_NUM_PARALLEL=1 ollama serve

# 或降低量化精度
ollama pull qwen2.5:7b-q4_K_M  # 4-bit 量化,显存减半

常见问题

下载模型慢

Ollama 默认从国外下载,国内可能很慢。设置代理或换镜像:

bash
# 或者直接从 ModelScope 下载 GGUF 文件
# 然后用 Ollama 的 Modelfile 导入

模型回答乱码

大概率是量化版本太低。换 q4_K_Mq8_0 精度。


🎯 本章要点

  • Ollama 三步走:安装→pull→run,零配置跑大模型
  • API 默认在 localhost:11434,开放外网要加防火墙+鉴权
  • 按需加载+空闲自动卸载,显存管理省心
  • 模型量化选 q4_K_M 平衡质量和显存,乱码就换更高精度
加载练习题中...

有问题或补充?欢迎留言