本地跑大模型,显卡到底怎么选?先把显存这笔账算清楚
想在自己的电脑上跑大模型,你搜一圈攻略,大概率会看到一堆显卡型号:RTX 3060、3090、4090、A6000……看得人头晕。
📑 本页目录
想在自己的电脑上跑大模型,你搜一圈攻略,大概率会看到一堆显卡型号:RTX 3060、3090、4090、A6000……看得人头晕。
但今天我想先拦你一下:别急着选显卡,先回答一个问题——你打算跑多大的模型?
这个问题才是决定一切的前提。显卡的显存大小,决定了你能跑多大的模型;显存带宽,决定跑得快不快。模型大小和显存,是这整件事的两条主线。
一、先把显存这笔账算明白
模型文件需要多大的显存,有个大概的换算公式:
| 精度 | 每 10 亿参数约占用 |
|---|---|
| FP16 | 2GB |
| INT8 | 1GB |
| INT4 | 0.5GB |
举个直观的例子:
- 7B 模型 INT4 量化:约 4-5GB 显存
- 14B 模型 INT4 量化:约 8-10GB 显存
- 70B 模型 INT4 量化:约 40GB 显存
另外,上下文越长,额外显存占用越多——通常还要预留 1-4GB 给 KV Cache(就是模型“记住前面说过的话”所需要的缓存)。
一句话记住:显存大小决定你能跑多大的模型,显存带宽决定跑得快不快。
二、按需求分三档,对号入座

入门档:跑 7B-14B 量化模型
推荐显卡:
- RTX 3060 12GB
- RTX 4060 Ti 16GB
- 二手 RTX 3090 24GB(性价比很高)
能做什么: 流畅跑 Llama 3 8B、Qwen2.5 7B、Mistral 7B;16GB 显存可以跑 14B 模型 INT4 量化。适合体验、聊天、本地助手、简单代码补全。
整机建议: i5/R5 CPU、32GB DDR5 内存、1TB NVMe SSD、650W-850W 电源。
中端主力:跑 14B-34B 量化模型
推荐显卡:
- RTX 3090 24GB
- RTX 4090 24GB
- RTX 4080 Super 16GB
24GB 显存是甜点配置。
能做什么: 7B/8B/14B 非常流畅;20B-34B 模型 INT4 量化能跑;70B INT4 比较勉强(INT2/INT3 能试但质量下降明显)。适合本地知识库、长文本摘要、代码助手、Agent。
整机建议: i7/R7 CPU、64GB DDR5、2TB NVMe SSD、电源 1000W(尤其 4090)。
高端多卡:跑 70B 或更大
推荐方案:
- 2 × RTX 3090 24GB = 48GB 显存
- 2 × RTX 4090 24GB = 48GB 显存
- 4 × RTX 3090/4090 = 96GB 显存
能做什么: 48GB 舒服跑 70B INT4;96GB 跑 70B 更高质量量化或 Mixtral 8x7B 这类 MoE 模型;也可以尝试 120B 低比特量化。
注意事项: 主板 PCIe 通道要够(尽量选支持双卡 x8/x16 的主板或工作站平台);电源 1600W 以上;注意散热和机箱空间;日常用 llama.cpp、vLLM 支持多卡张量并行。
三、另一条路线:Apple Silicon
如果你不想折腾多卡,Mac 是另一个选择:
推荐:
- Mac Studio M2 Ultra 128GB / 192GB
- MacBook Pro M3 Max 64GB / 128GB
优势: 192GB 统一内存可以跑 70B 甚至 120B 量化版;安静、省电、不用折腾多卡;适合长期开机做本地服务。
劣势: 推理速度通常不如高端 NVIDIA 显卡;软件生态略弱(不过 llama.cpp、Ollama 支持已经不错了);价格较高。
四、预算最低方案:CPU + 大内存
手上暂时没有好显卡,也可以跑——只是慢:
- 128GB DDR5 双通道或四通道
- AMD Threadripper / EPYC 多通道内存平台更合适
- 用 llama.cpp 的 CPU 推理
能跑 70B INT4 模型,但速度可能只有每秒几个 token。适合验证、测试,不适合日常流畅使用。
五、如果你要微调 / 训练模型
只做推理,上面配置够用了。但想微调:
- 24GB 显存起步
- 用 LoRA / QLoRA 微调 7B/14B 模型
- 全参微调 7B 至少 24GB 以上
- 全参微调 70B——基本要多张 A100/H100 服务器级 GPU
专业卡参考:RTX A6000 48GB、RTX 6000 Ada 48GB、A100 80GB、H100 80GB。
六、我的个人推荐
只选一个配置: RTX 3090 24GB 或 RTX 4090 24GB + 64GB 内存 + 2TB NVMe SSD。本地玩大模型最平衡的配置,7B-34B 通吃,70B 低量化也能体验。
预算紧张: RTX 4060 Ti 16GB + 32GB 内存。跑 7B/14B 量化,完全够入门。
想跑 70B: 双 RTX 3090/4090(48GB 显存),或者 Mac Studio 192GB 统一内存。
最后泼盆冷水:像 DeepSeek-R1 671B 这种超大 MoE 模型,就算 INT4 量化也需要约 350-400GB 显存——家用单机基本不现实。普通人本地跑的主流区间就是 7B-70B 的开源模型或蒸馏版。
买之前,先想清楚你要跑多大的模型,再决定花多少钱。 别一上来就冲 4090——4060 Ti 可能就是你的答案。