训练和部署大模型,GPU 怎么选?
目录
一句话原则
选 GPU 之前先记住:训练和推理,要的东西不一样。
- 训练吃三样:算力(FLOPS)+ 显存 + 卡间互联。算力决定训得多快,显存决定能训多大,互联决定多卡效率。
- 推理吃两样:显存容量 + 显存带宽。容量决定能装多大的模型,带宽决定生成 token 的速度——很多时候推理快慢就是被带宽卡住的。
所以「哪张卡好」没有统一答案,取决于你在哪个环节用。
先分清:训练阶段 vs 推理阶段
做「自己的模型」,你同时会有训练和推理两种负载,但它们的频次和成本性质完全不同:
| 阶段 | 属于 | 频次 | 典型负载 | 成本性质 |
|---|---|---|---|---|
| 数据准备(清洗、重建样本) | 数据工程 | 周期性 | CPU、内存 | 便宜 |
| SFT / DPO 微调 | 训练 | 偶发(每次几天) | GPU 算力密集 | 可租、用完即停 |
| 用户聊天问答 | 推理 | 7×24 持续 | 显存带宽密集 | 持续、固定开销 |
两个关键认知:
- 微调也是训练(LoRA/QLoRA 只是参数高效训练)。你要「训自己的模型」,就绕不开训练。
- 推理才是长期开销的大头,训练是阶段性的一次性投入。
这也直接决定两者的 GPU 策略不同:训练按需租用、跑完就退;推理要长期在线、精打细算成本。
一、显存是硬门槛
一切从显存开始。模型权重占多少显存,先用这个公式估:
显存 ≈ 参数量 × 每参数字节数
不同精度的字节数:
| 精度 | 每参数字节 | 27B 模型权重 |
|---|---|---|
| FP16 / BF16 | 2 | ~54 GB |
| FP8 / INT8 | 1 | ~27 GB |
| INT4 | 0.5 | ~14 GB |
除了权重,还要加 KV Cache(对话越长越大) 和激活值。经验上推理还要预留 20%~40% 显存。
结论:27B BF16 需要单卡 ≥80GB;量化到 8bit 后 48GB 卡也能跑。
二、显存 → 能力对照表
| 显存 | 典型卡 | 能做什么 |
|---|---|---|
| 24GB | RTX 4090 | QLoRA 微调 7B~14B;小模型单用户推理 |
| 32GB | RTX 5090 | QLoRA 微调到 14B;小模型推理更宽裕 |
| 48GB | L40S / RTX 6000 Ada / A6000 | 27B 量化后推理;LoRA 微调 7B~14B |
| 80GB | A100 / H100 | 27B BF16 推理;全量微调 7B~14B |
| 96GB | H20(中国特供) | 大模型推理友好,但算力弱,训练不划算 |
| 141GB | H200 | 70B 级推理;大批量高吞吐 |
| 180GB | B200 | 顶级训练/推理,也最贵 |
如果你的基座选的是 MoE(混合专家) 架构,比如总参 26B、激活仅 3.8B 的模型,显存和吞吐都会友好很多——这是聊天类产品规模化的高性价比选择。
三、分场景选型
1)实验 / 起步:先验证流程
目标是跑通「基座 + 数据 + SFT」这条链路:
- 1× RTX 4090 24G(或 5090 32G)就能做 QLoRA + 小模型推理;
- 但这个阶段最省钱的方式是租,别急着买。
2)小团队训推一体
- 2× L40S 48G 或 1× A100 80G;
- 27B 量化推理 + LoRA 微调,一张卡兼顾训练和上线验证。
3)生产 / 规模化
- 4~8× H100 / H200(带 NVLink):高 QPS 推理 + 全量微调;
- 要跑几百 B 的巨型 MoE,得上 8 卡 H20/H200 级别的集群。
互联是隐藏杀手:多卡做张量并行(TP)时,没有 NVLink 会严重掉速。同型号尽量选带 NVLink 的整机或模组。
四、租还是买:先租后买
这是最容易被忽略、也最影响成本的一条。
- 自购 GPU 是固定成本,跑不满就是纯浪费;
- 选型、实验、临时训练用完即停,云上按小时计费最划算;
- 只有当 GPU 长期高利用率(经验值 >60%~70%)时,自购才可能回本。
租用渠道参考:
- 国内:AutoDL(便宜,4090/A100 资源多)、阿里云、火山引擎、腾讯云
- 海外:RunPod、Lambda、Vast.ai
建议:整个选型和 SFT 阶段全部租用;等业务稳定、利用率可预测了,再考虑自建。
五、中国可买型号的注意点
- H20:显存大(96G)适合推理,但算力被阉割,做训练性价比差,别拿它当微调主力;
- RTX 4090 / 5090:消费卡,性价比高,适合个人/小团队起步,但不适合多卡大规模训练;
- A800 / H800 等:看供应渠道和价格;
- 国产加速卡:生态仍在追赶,选之前务必确认训练/推理框架(vLLM、LLaMA-Factory 等)的支持情况。
六、给你的默认答案
- 只想验证链路 → 租 1× A100 80G(或 2× L40S 48G),27B 量化推理 + LoRA 微调一次搞定;
- 要上生产 → 4× H100/H200 起步,按并发和 QPS 扩;
- 预算极紧的个人 → RTX 4090/5090 配上云 GPU 兜底。
小结
- 训练看算力+显存+互联,推理看显存容量+带宽;
- 27B BF16 要单卡 ≥80GB,量化后 48GB 可跑;
- 先租后买,只在高利用率时才自购;
- 多卡训练必须考虑 NVLink;
- MoE 与量化是降本的两个关键杠杆。
一句话:别问”哪张卡最强”,先问”我在哪个环节、要跑多大的模型、利用率多高”。
相关推荐
聊天场景如何选基座?一份可执行的选型清单
做聊天/陪伴类 AI 产品,选基座比选模型更重要。本文给出六个选型维度、要避开的“助手腔”陷阱、当前主流开源候选对比,以及一套三天选型对测方法。
SFT 是什么?搞懂监督微调:从数据集到训练自己的模型
SFT 是训练自己模型的第一步,也是最关键的一步。本文讲清 SFT 在训练流程中的位置、数据集格式、只对 assistant 算 loss、全量与 LoRA 的取舍,以及常见踩坑。
如何训练一个大模型?从预训练到微调的完整路径
训练大模型不只是喂数据。本文讲清预训练、微调、对齐三个阶段,以及从零预训练、继续预训练、LoRA、QLoRA、RLHF、DPO、蒸馏等主流方式,帮你选对路线。