主题
🎯 GPU 选型指南
选对显卡,算力中心就成功了一半
核心指标
GPU 选型看三个数字:显存 > 算力 > 功耗。
1. 显存(VRAM)
这是最重要的指标。模型能不能跑起来,不取决于算力,取决于塞不塞得进显存。
| 模型规模 | 推理最低显存 | 微调最低显存 |
|---|---|---|
| 7B(Qwen/LLaMA) | 6GB | 16GB |
| 13B | 10GB | 24GB |
| 34B | 20GB | 48GB(至少双卡) |
| 70B | 40GB | 80GB(A100 级别) |
量化可以降低需求——4-bit 量化后显存约降至原来的 1/4。
2. 算力(TFLOPS / TOPS)
影响生成速度。同显存下,算力越高每秒生成的 token 越多。
3. 功耗与散热
显卡满载功耗 200W~450W 不等,电源功率要留 30% 余量。风冷足够的场合不建议上水冷。
推荐型号
入门(推理为主)
| 型号 | 显存 | 功耗 | 价格 | 适合 |
|---|---|---|---|---|
| RTX 3060 12GB | 12GB | 170W | 2k左右 | 7B 推理 |
| RTX 4060 Ti 16GB | 16GB | 165W | 3k左右 | 7B 推理+轻量微调 |
中端(推理 + 轻量微调)
| 型号 | 显存 | 功耗 | 价格 | 适合 |
|---|---|---|---|---|
| RTX 3090 24GB | 24GB | 350W | 6k左右(二手) | 13B 微调 |
| RTX 4090 24GB | 24GB | 450W | 13k左右 | 34B 推理+13B微调 |
| RTX 5090 32GB | 32GB | 575W | 待定 | 34B 微调 |
3090 二手性价比最高,24GB 显存能跑大多数开源模型微调。
专业级(微调 + 训练)
| 型号 | 显存 | 适合 |
|---|---|---|
| A100 80GB | 80GB | 70B 模型全参数微调 |
| H100 80GB | 80GB | 同上,速度快 2-3 倍 |
| A6000 48GB | 48GB | 34B 微调,单卡更灵活 |
二手显卡避坑
- 矿卡识别:核心发黄、PCB 板油腻、散热鳍片积灰严重
- 测试:到手跑 FurMark 30 分钟,温度不超过 85°C,无花屏无掉驱动
- 保修:二手 3090 尽量买带店保的,GDDR6X 显存温度偏高是老毛病
- 显存检测:用
nvidia-smi或 OCCT 做显存压力测试
多卡 vs 单卡
- 能单不双:多卡并行有通信开销(PCIe 带宽瓶颈),单卡强于双卡
- 真要双卡:选同型号,NVLink 桥接能减少通信损耗
- 主板要求:确认 PCIe 插槽数量和间距,双卡至少隔一个槽位散热
小结
- 显存第一,算力第二
- 入门选 4060 Ti 16GB,主力选 3090 24GB
- 能单卡不双卡
- 二手先测后买
🎯 本章要点
- GPU 选型看显存→算力→功耗,显存决定模型能不能跑起来
- 7B 模型推理 6GB+,微调 16GB+;量化可降低 75% 显存需求
- 3090 二手性价比最高,24GB 显存能覆盖大多数微调场景
- 多卡选同型号,优先单卡;二手卡先测温度+显存
加载练习题中...