本地部署实践:Ollama / vLLM / llama.cpp 对比与保姆级教程

在本地或小服务器跑大模型的三大工具对比,含安装、量化选型、消费级显卡(RTX 3060/4090)跑 7B/13B 的实战指南。

#本地部署#Ollama#vLLM#llama.cpp#量化更新于 2026-08-12
📑 本页目录

想在自己电脑/服务器跑大模型?先想清楚:你是要“最快上手”,还是要“最高吞吐”,还是要“极致轻量/省资源”? 三个答案对应三个工具。

三巨头对比

维度 Ollama vLLM llama.cpp
定位 一键上手,开发者友好 高并发推理服务 极致轻量、边缘/量化
上手难度 ⭐ 最简单 ⭐⭐⭐ ⭐⭐
推理框架 底层 llama.cpp PagedAttention(高吞吐) C++ 原生
适合场景 个人/开发/聊天 生产 API 服务 嵌入式/低配/量化
显存占用 中高 最低

选择建议:

  • 个人日常用、想快速跑起来 → Ollama
  • 要对外提供高并发 API → vLLM
  • 显存极小、边缘设备、要极致省 → llama.cpp

保姆级:Ollama 上手(最推荐入门)

Ollama 一条命令就能跑模型,自动处理量化、下载、运行。

# 1. 安装(macOS/Linux)
curl -fsSL https://ollama.com/install.sh | sh

# 2. 拉取并运行模型(7B 对话)
ollama run qwen2.5:7b

# 3. 查看已安装模型
ollama list

# 4. 作为 API 服务(默认端口 11434)
ollama serve
curl http://localhost:11434/api/generate -d '{"model":"qwen2.5:7b","prompt":"你好"}'

关键:Ollama 背后就是 llama.cpp 的量化能力,对新手零门槛。

模型量化:怎么选 GGUF / AWQ

大模型参数是 FP16(每参数 2 字节)。量化就是把精度降低、换显存。

量化 精度 7B 显存约 适用
FP16 ~14GB 显存充裕
Q8 ~8GB 权衡好
Q4_K_M 中高 ~4.5GB 性价比之王,首选
Q2 ~2.5GB 显存极限
  • GGUF:llama.cpp/Ollama 的量化格式,量化在文件层
  • AWQ:另一种量化算法,精度略好,配 vLLM/特定引擎

消费级显卡实战

RTX 3060 12GB:

  • 推荐跑 7B 模型 Q4(约 4.5GB,轻松)
  • 13B Q4(约 8GB)勉强可跑,速度一般
  • 命令:ollama run qwen2.5:7b(Ollama 自动选 Q4)

RTX 4090 24GB:

  • 可跑 13B Q8 / 14B,甚至 32B Q4
  • 13B Q4 全速无压力
# 指定量化版本拉取
ollama run qwen2.5:7b-q4_K_M

搭建 Web 聊天界面

Open WebUI(功能全,带 RAG/多用户):

# Docker 一键起(若装 Docker)
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  --name open-webui --restart always ghcr.io/open-webui/open-webui:main

NextChat(轻量,直接配 API):前端填 http://localhost:11434 即可对话。

一句话总结

本地跑模型 = 选对工具(个人用 Ollama / 生产用 vLLM / 极省用 llama.cpp)+ 选对量化(无脑 Q4_K_M 起步)+ 量好显存。3060 跑 7B、4090 跑 13B-32B,都能流畅跑起来。