Logo Vincent
返回文章列表

训练和部署大模型,GPU 怎么选?

大模型
训练和部署大模型,GPU 怎么选?
目录

一句话原则

选 GPU 之前先记住:训练和推理,要的东西不一样。

  • 训练吃三样:算力(FLOPS)+ 显存 + 卡间互联。算力决定训得多快,显存决定能训多大,互联决定多卡效率。
  • 推理吃两样:显存容量 + 显存带宽。容量决定能装多大的模型,带宽决定生成 token 的速度——很多时候推理快慢就是被带宽卡住的。

所以「哪张卡好」没有统一答案,取决于你在哪个环节用。

先分清:训练阶段 vs 推理阶段

做「自己的模型」,你同时会有训练和推理两种负载,但它们的频次和成本性质完全不同:

阶段属于频次典型负载成本性质
数据准备(清洗、重建样本)数据工程周期性CPU、内存便宜
SFT / DPO 微调训练偶发(每次几天)GPU 算力密集可租、用完即停
用户聊天问答推理7×24 持续显存带宽密集持续、固定开销

两个关键认知:

  • 微调也是训练(LoRA/QLoRA 只是参数高效训练)。你要「训自己的模型」,就绕不开训练。
  • 推理才是长期开销的大头,训练是阶段性的一次性投入。

这也直接决定两者的 GPU 策略不同:训练按需租用、跑完就退;推理要长期在线、精打细算成本。

一、显存是硬门槛

一切从显存开始。模型权重占多少显存,先用这个公式估:

显存 ≈ 参数量 × 每参数字节数

不同精度的字节数:

精度每参数字节27B 模型权重
FP16 / BF162~54 GB
FP8 / INT81~27 GB
INT40.5~14 GB

除了权重,还要加 KV Cache(对话越长越大) 和激活值。经验上推理还要预留 20%~40% 显存。

结论:27B BF16 需要单卡 ≥80GB;量化到 8bit 后 48GB 卡也能跑。

二、显存 → 能力对照表

显存典型卡能做什么
24GBRTX 4090QLoRA 微调 7B~14B;小模型单用户推理
32GBRTX 5090QLoRA 微调到 14B;小模型推理更宽裕
48GBL40S / RTX 6000 Ada / A600027B 量化后推理;LoRA 微调 7B~14B
80GBA100 / H10027B BF16 推理;全量微调 7B~14B
96GBH20(中国特供)大模型推理友好,但算力弱,训练不划算
141GBH20070B 级推理;大批量高吞吐
180GBB200顶级训练/推理,也最贵

如果你的基座选的是 MoE(混合专家) 架构,比如总参 26B、激活仅 3.8B 的模型,显存和吞吐都会友好很多——这是聊天类产品规模化的高性价比选择。

三、分场景选型

1)实验 / 起步:先验证流程

目标是跑通「基座 + 数据 + SFT」这条链路:

  • 1× RTX 4090 24G(或 5090 32G)就能做 QLoRA + 小模型推理;
  • 但这个阶段最省钱的方式是租,别急着买。

2)小团队训推一体

  • 2× L40S 48G 或 1× A100 80G;
  • 27B 量化推理 + LoRA 微调,一张卡兼顾训练和上线验证。

3)生产 / 规模化

  • 4~8× H100 / H200(带 NVLink):高 QPS 推理 + 全量微调;
  • 要跑几百 B 的巨型 MoE,得上 8 卡 H20/H200 级别的集群。

互联是隐藏杀手:多卡做张量并行(TP)时,没有 NVLink 会严重掉速。同型号尽量选带 NVLink 的整机或模组。

四、租还是买:先租后买

这是最容易被忽略、也最影响成本的一条。

  • 自购 GPU 是固定成本,跑不满就是纯浪费;
  • 选型、实验、临时训练用完即停,云上按小时计费最划算;
  • 只有当 GPU 长期高利用率(经验值 >60%~70%)时,自购才可能回本。

租用渠道参考:

  • 国内:AutoDL(便宜,4090/A100 资源多)、阿里云、火山引擎、腾讯云
  • 海外:RunPod、Lambda、Vast.ai

建议:整个选型和 SFT 阶段全部租用;等业务稳定、利用率可预测了,再考虑自建。

五、中国可买型号的注意点

  • H20:显存大(96G)适合推理,但算力被阉割,做训练性价比差,别拿它当微调主力;
  • RTX 4090 / 5090:消费卡,性价比高,适合个人/小团队起步,但不适合多卡大规模训练;
  • A800 / H800 等:看供应渠道和价格;
  • 国产加速卡:生态仍在追赶,选之前务必确认训练/推理框架(vLLM、LLaMA-Factory 等)的支持情况。

六、给你的默认答案

  • 只想验证链路 → 租 1× A100 80G(或 2× L40S 48G),27B 量化推理 + LoRA 微调一次搞定;
  • 要上生产 → 4× H100/H200 起步,按并发和 QPS 扩;
  • 预算极紧的个人 → RTX 4090/5090 配上云 GPU 兜底。

小结

  • 训练看算力+显存+互联,推理看显存容量+带宽;
  • 27B BF16 要单卡 ≥80GB,量化后 48GB 可跑;
  • 先租后买,只在高利用率时才自购;
  • 多卡训练必须考虑 NVLink;
  • MoE 与量化是降本的两个关键杠杆。

一句话:别问”哪张卡最强”,先问”我在哪个环节、要跑多大的模型、利用率多高”。

© 2026 vincentqiao.com . 保留所有权利。