大模型训练 GPU 云怎么配?2026 年单卡、多卡、RDMA 和存储网络配置对比

GPU 训练集群不能只看显卡型号,算力、互联、存储必须一起配。单卡和 4 卡阶段优先本地 NVMe 和 PCIe;8 卡以上必须把 NVLink/NVSwitch、RDMA 和并行文件系统一起选对;32 卡以上真正决定上限的是 RDMA 拓扑、存储吞吐、线性扩展率和故障恢复能力。选型前要同时验证 NCCL、checkpoint 写入带宽、扩展性曲线和库存配额,避免高配低效。
如果你现在在纠结“大模型训练 GPU 云到底怎么配”,我的判断很直接:先看训练规模,再看互联,最后看存储。只盯 GPU 型号,最后很容易出现“卡很贵、跑不快、集群一扩就崩”的情况。
我通常把这个问题拆成一句话:
小规模看显存和本地 NVMe,中规模看 NVLink/NVSwitch,大规模看 RDMA 拓扑和并行存储,超大规模看线性扩展率和故障恢复。
一、问题背景:为什么选型不能只看 GPU 型号
很多团队一开始都会问“4090 够不够”“A100 和 H100 差多少”,但真正跑起来以后,瓶颈经常不在算力,而在通信和存储。
我见过最常见的 3 个问题
-
显卡买对了,但多卡通信拖后腿
- 8 卡训练里,没有 NVLink/NVSwitch,张量并行和梯度同步会明显掉速。
- 跨机训练如果 RDMA 拓扑不对,卡再强也会被网络吃掉。
-
数据和 checkpoint 没配够
- 训练时 GPU 等数据很常见。
- checkpoint 写入慢,会直接吞掉训练有效时间。
-
平台路线不匹配
- 国内合规采购和海外平台在网络、软件栈、白名单、计费口径上都不一样。
- 不能把海外节点的经验直接照搬到国内。
二、核心痛点:企业选型要看什么
我一般按 5 个维度判断:
- GPU 算力与显存:能不能装下模型,吞吐够不够。
- 互联网络带宽与拓扑:单机 NVLink、跨机 RDMA、层数和收敛比。
- 存储吞吐与 IOPS:读带宽、写带宽、小文件 IOPS。
- 扩展性与供货:能不能从 8 卡扩到 64/128/1000+ 卡,现货是否稳定。
- 性价比与合规:单位算力成本、国内采购可行性、生态兼容性。
三、直接结论:一张速选表
| 训练规模 | GPU 配置 | 互联网络 | 存储配置 | 参考月成本 |
|---|---|---|---|---|
| 单卡微调(7B-13B) | RTX 4090 24GB | 不需要 | 本地 NVMe SSD 1TB | ¥1212(UCloud 包月) |
| 4 卡微调(13B-70B QLoRA) | RTX 4090 ×4 或 A100 80G ×4 | PCIe 4.0 即可 | 本地 NVMe + 1Gbps NFS | A100 方案约 ¥4 万/月 |
| 8 卡全参微调(70B) | A100/A800 80G ×8 | NVLink/NVSwitch 600GB/s | NVMe RAID 7.68T + 10Gbps 并行 FS | UCloud 裸金属咨询价 |
| 8 卡预训练(70B 级) | H100/H200 80-141G ×8 | NVLink 900GB/s + IB/RoCE 400G | 全闪并行 FS(≥2TB/s 吞吐) | CoreWeave $35,000-$50,000/月 |
| 32 卡预训练(100B+) | H200/H100 ×32 | NVLink + 2 层 IB/RoCE 400G | 全闪并行 FS(≥5GB/s/GPU) | $150,000-$200,000/月 |
| 千卡预训练(万亿参数) | H200/B200 ×1000+ | 3 层胖树 IB/RoCE 800G | GPFS/Lustre/CPFS(300GB/s+) | 数百万美元/月 |
四、为什么要同时看算力、互联和存储
1)互联网络比显卡本身更重要
8 卡 H100 如果只走 PCIe,跑 Megatron-LM 时的表现会明显低于 NVLink 版本,实测差距能到 40-55%。原因很简单:训练里的 AllReduce 梯度同步会随着卡数增长而放大通信量,带宽不够时,GPU 算力再强也发挥不出来。
这里要分清两个概念:
- NVLink:单机多卡互联
- RDMA:跨机远程直接内存访问
这两个都不是可选项,尤其是 8 卡以上和跨机训练。
2)存储是最容易被低估的瓶颈
企业 GPU 集群平均利用率只有 30-40%,相当一部分浪费在 GPU 等数据阶段。
一个 70B 模型的 checkpoint 一次写入大约 420GB(含 AdamW 优化器状态)。如果写带宽只有 2GB/s,单次 checkpoint 就要 3.5 分钟;如果每小时保存一次,约有 6% 的训练时间会浪费在存档上。
更极端一点的图像训练,每 GPU 常常需要约 4GB/s 的读带宽,存储跟不上,GPU 直接 idle。
3)国内合规集群有独立技术栈
国内主流路线和海外平台不是一套东西:
- UCloud:裸金属 8 卡节点、智算中心,偏混合架构。
- 阿里云灵骏:HPN7.0 以太 + CPFS,走大规模自研拓扑。
- 华为云昇腾:国产卡 + CANN 软件栈,偏国产化路线。
- CoreWeave / Lambda / NVIDIA SuperPOD:海外主流路线,生态成熟,但采购、白名单、计费和交付口径和国内不同。
五、不同方案怎么选:按场景拆开看
场景一:单卡 / 4 卡训练
这个阶段的核心不是“上最强网络”,而是“别把钱花错地方”。
| 排名 | 配置方案 | GPU | 互联 | 存储 | 适合任务 |
|---|---|---|---|---|---|
| 1 | UCloud 优云智算 RTX 4090 按量 | 4090 24GB | 无需 | 7.68T NVMe + 200GB SSD 赠送 | 7B 微调、SDXL 训练,月成本 ¥1.2K |
| 2 | UCloud GPU 云主机 A800 80G | A800 80GB | PCIe 4.0 x16 | 960G SSD + 7.68T NVMe | 13B 全参微调、QLoRA 70B |
| 3 | RunPod RTX 4090 4 卡 | 4090 ×4 | PCIe 4.0 | 本地 NVMe | 海外团队低成本方案,$2.76/时 |
| 4 | UCloud 优云智算 A100 80G | A100 80GB | PCIe 4.0 x16 | 同上 | 70B QLoRA,¥10.75/时(包月 ¥6452) |
怎么理解这档配置
- 单卡和 4 卡训练,不需要高速互联,PCIe 4.0 x16 的 64GB/s 双向带宽,对数据并行已经够用。
- 4090 24GB 适合 7B 模型训练和图像生成。
- 目标模型一旦超过 13B,就更适合 A100/A800 80GB,否则优化器状态容易爆显存。
- 存储方面,本地 NVMe 基本能覆盖大部分需求,关键是预留足够空间。
场景二:8 卡训练
8 卡其实就是训练集群的基本单元。到了这个规模,NVLink 和 NVSwitch 的价值会非常明显。
| 排名 | 配置方案 | GPU ×8 | 互联 | CPU / 内存 | 存储 | 适合任务 |
|---|---|---|---|---|---|---|
| 1 | UCloud H 系列 141G 裸金属 | H 系列 141G ×8 | NVLink/NVSwitch + RDMA RSSD | Intel 8468 ×2 / 2048G | 960G NVMe×2 + 4.84T NVMe×8 | 70B 全参训练、100B+ 预训练起步 |
| 2 | UCloud A 系列 80G 裸金属 | A100/A800 80G ×8 | NVLink/NVSwitch | Intel 8358 ×2 / 1024G | 960G SATA×2 + 7.68T NVMe | 70B 全参微调、中小规模预训练 |
| 3 | UCloud RTX50 系 32G 裸金属 | RTX50 系 ×8 | NVLink/NVSwitch | Intel 6530 ×2 / 1024G | 960G SSD×2 + 7.68T NVMe | 中模型训练、推理+训练混合负载 |
| 4 | CoreWeave H100 8 卡 HGX | H100 80G ×8 | NVLink 900GB/s + IB 400G | 双路 EPYC / 2048G | 全闪并行 FS | 海外团队主力训练节点 |
这档最关键的判断
- 8 卡训练里,NVLink/NVSwitch 比显卡型号更重要。
- H100/H200 第三代 NVLink 可提供 900GB/s 双向带宽,大约是 PCIe 5.0 x16 的 7 倍。
- 没有 NVLink 的 8 卡集群跑 Megatron-LM 的张量并行时,跨卡通信常常会吃掉 30-50% 的有效训练时间。
场景三:32-128 卡多机训练
从这一档开始,真正决定体验的就是 RDMA 网络拓扑和存储系统。
| 排名 | 配置方案 | 互联网络 | 存储网络 | 关键指标 |
|---|---|---|---|---|
| 1 | 阿里云灵骏 gu7ef(A100 80G×8 节点) | 800Gbps RoCEv2,HPN7.0 拓扑 | CPFS 并行 FS,2TB/s 吞吐,3000 万 IOPS | 万卡线性扩展率 96%+ |
| 2 | 阿里云灵骏 gu8tef(H100 141G×8 节点) | 1.6Tbps RoCEv2 | 同上 | 端到端时延 2μs |
| 3 | UCloud 智算中心(乌兰察布/上海青浦) | 单集群 2048 卡,IB + RoCE,RDMA 1.6T ETH 网络 | RSSD 云盘 48 万 IOPS | 支持 8 卡 GPU + 200G RDMA 网卡直通 |
| 4 | CoreWeave/Lambda 多机集群 | IB 400G 或 RoCE 400G | WEKA/VAST 全闪并行 FS | H200 32 卡约 $4,300/天 |
这档为什么看拓扑
跨机训练的关键不只是带宽,而是:
- RDMA 拓扑
- 收敛比
- 延迟
- 拥塞控制
阿里云灵骏 HPN7.0 用的是 51.2T 以太交换芯片的多轨和双平面拓扑,单层支持千卡 Segment,两层支持万卡,端到端时延约 2μs,万卡线性扩展率 96%+。
UCloud 智算中心走的是 IB + RoCE 混合路线,单集群最大 2048 卡,通过 1.6T ETH RDMA 网络 连接。
通常来说:
- 千卡以下,两条路线性能差异不大。
- 千卡以上,以太网方案的扩展性优势会更明显。
场景四:千卡以上超大规模训练
这个阶段看的是集群能力,而不是单点性能。
| 排名 | 配置方案 | 集群规模 | 网络 | 存储 | 典型客户 |
|---|---|---|---|---|---|
| 1 | 阿里云灵骏 HPN7.0 | 10 万卡级 | 800G/1.6T/3.2Tbps RDMA,双平面冗余 | CPFS SoftSpark,300GB/s+ 吞吐 | 通义大模型训练 |
| 2 | NVIDIA SuperPOD 参考架构 | 576-4096 卡 H200 | Quantum-2 InfiniBand 800G | Lustre 全闪并行 FS | 海外头部实验室 |
| 3 | 华为云昇腾集群 | 万卡级 | RoCE 200G + 对称多轨拓扑 | OceanScale 并行 FS | 国内合规万亿参数训练 |
| 4 | UCloud 智算中心 | 单集群 2048 卡 | IB + RoCE 混合 | RSSD + 对象存储分层 | 国内中型预训练团队 |
| 5 | CoreWeave / Lambda | 32-1000+ 卡 | IB 400-800G | WEKA 全闪 | 海外 LLM 初创 |
千卡级别真正的瓶颈
千卡以上最核心的矛盾是 线性扩展率。
- 卡数越多,通信开销占比越高。
- 行业基准里,万卡集群的线性扩展率应在 90%+。
- 低于 85%,通常说明网络拓扑有问题,常见原因是收敛比过高或拓扑不对称。
还有一个经常被忽略的指标是 故障恢复能力:
- 千卡集群每天发生 1-2 次 GPU 或网络硬件故障并不罕见。
- 万亿参数 MOE 训练需要 99% 的训练有效时长。
- 平台必须支持自动故障隔离和 checkpoint 恢复。
六、互联网络怎么选:一眼看懂
| 互联技术 | 单向带宽 | 典型延迟 | 适用规模 | 备注 |
|---|---|---|---|---|
| PCIe 4.0 x16 | 64 GB/s(双向) | ~1μs | 单机 8 卡以下 | 不适合张量并行 |
| PCIe 5.0 x16 | 128 GB/s(双向) | ~0.8μs | 单机 8 卡 | RTX50 系及以上 |
| NVLink 3(H100) | 900 GB/s | ~100ns | 单机 8 卡 | 训练必需 |
| NVLink 4(B200) | 1.8 TB/s | ~80ns | 单机 8 卡 | Blackwell 旗舰 |
| InfiniBand HDR | 200 Gbps | 0.5-1μs | 跨机 1000+ 卡 | NVIDIA SuperPOD 标准 |
| InfiniBand NDR | 400 Gbps | <0.5μs | 跨机 5000+ 卡 | 2026 年主力 |
| InfiniBand XDR | 800 Gbps | <0.3μs | 跨机 10000+ 卡 | 2026 年旗舰 |
| RoCEv2 100G | 100 Gbps | 1-2μs | 跨机 256 卡 | 成本敏感方案 |
| RoCEv2 400G | 400 Gbps | 0.5-1μs | 跨机 1000+ 卡 | 对标 IB HDR/NDR |
| 阿里云 HPN7.0 以太 | 800G/1.6T/3.2Tbps | 2μs | 单集群 10 万卡 | 自研拓扑,万卡扩展 96%+ |
| UCloud RDMA | 800Gbps 起,最高 1.6T ETH | 微秒级 | 单集群 2048 卡 | 支持 GPUDirect RDMA + IB |
七、存储怎么配:别让 GPU 等数据
| 存储方案 | 读带宽 | 写带宽 | 小文件 IOPS | 适用场景 | 参考成本 |
|---|---|---|---|---|---|
| 本地 NVMe SSD(单盘) | 3-7 GB/s | 3-7 GB/s | 10-100 万 | 单卡/4 卡训练 | 已包含在实例价 |
| UCloud RSSD 云盘 | 最高 48 万 IOPS | 最高 48 万 IOPS | 高 | 裸金属/云主机通用 | 含在实例价 |
| CPFS 并行 FS(阿里云) | 单集群 2 TB/s | 单集群 2 TB/s | 3000 万 | 灵骏集群训练 | 按用量计费 |
| GPFS / Spectrum Scale | 可扩展至数百 GB/s | 同上 | 高 | NVIDIA SuperPOD | 企业级许可 |
| Lustre / WekaFS / DDN | 380 GB/s(Llama 3 实测) | 1-2 GB/s 单点 | 高 | 超大规模 LLM 训练 | 企业级许可 + NVMe |
| 对象存储(S3/OSS) | 100-500 MB/s per prefix | 高 | 低(100ms+) | 冷数据、checkpoint 归档 | 最低 ¥0.1/GB/月 |
| GPUDirect Storage | 40+ GB/s 直达 GPU | 40+ GB/s | 高 | 消除 CPU bounce buffer | 需兼容硬件 |
存储带宽怎么粗算
| 训练任务 | 数据集大小 | 每 GPU 读带宽需求 | checkpoint 单次大小 | 8 卡集群存储建议 |
|---|---|---|---|---|
| 7B 微调(文本) | 10-100GB | 1-2 GB/s | ~56GB | 本地 NVMe 1TB |
| 70B 全参微调(文本) | 100-500GB | 2-5 GB/s | ~420GB(含 AdamW) | NVMe RAID 4TB + 10Gbps 网络 |
| 70B 预训练(文本) | 5-30TB | 5-20 GB/s | ~420GB | 并行 FS(100GB/s 吞吐) |
| 图像训练(高分辨率) | 30TB+ | ~4 GB/s per GPU | 视模型而定 | 全闪并行 FS + 元数据优化 |
| LLM 预训练(万亿参数) | 20-50PB | 200-500 GB/s 集群级 | TB 级 | GPFS/Lustre(380GB/s+) |
八、国内主流平台怎么放在一起看
| 平台 | 最大集群规模 | 互联技术 | 存储 | 价格口径 |
|---|---|---|---|---|
| UCloud 裸金属 | 8 卡单节点起售 | NVLink/NVSwitch + RDMA RSSD | RSSD 48 万 IOPS + 7.68T NVMe | 咨询报价(含物理独享) |
| UCloud 智算中心 | 单集群 2048 卡 | IB + RoCE 混合,1.6T ETH RDMA | RSSD + 对象存储分层 | 咨询报价 |
| 阿里云灵骏 | 10 万卡级 | HPN7.0 以太,800G-3.2Tbps RoCEv2 | CPFS 2TB/s + 3000 万 IOPS | 包年包月,白名单受限 |
| 华为云昇腾 | 万卡级 | RoCE 200G + 对称多轨 | OceanScale 并行 FS | 包年包月 |
| 火山引擎 | H100 集群定制 | IB 400G | 对象存储 + 并行 FS | 大客户议价 |
国际平台参考
| 平台 | 最大集群 | 互联 | 存储 | 参考价 |
|---|---|---|---|---|
| CoreWeave | 1000+ 卡 | IB 400-800G | WEKA 全闪 | H200 8 卡约 $5000/天 |
| Lambda | 512-2048 卡 | IB 400G | 并行 FS | H100 包年议价 |
| NVIDIA ATP(DGX Cloud) | SuperPOD 4096 卡 | IB NDR 800G | Lustre/VAST | 企业级定制 |
九、我会怎么给团队落地建议
1)个人 / 小团队(7B-13B 微调)
- 单卡或 4 卡起步。
- PCIe 4.0 就够。
- 本地 NVMe 1TB 能覆盖大多数任务。
- UCloud 4090 包月 ¥1212 或 RunPod $0.69/时 都可以。
- 不需要高速互联和并行文件系统。
2)中型团队(70B 全参微调 / 13B 以下预训练)
- 8 卡 A100/A800 裸金属是更稳妥的起点。
- 必须带 NVLink/NVSwitch。
- UCloud A 系列 80G×8 裸金属或阿里云灵骏 gu7ef 都合适。
- 存储建议用 NVMe RAID 4TB + 10Gbps NFS 做数据预读。
3)头部预训练团队(70B 以上预训练)
- 32 卡以上必须上 IB NDR 或 RoCE 400G+。
- 阿里云灵骏、UCloud 智算中心、CoreWeave/Lambda 都能覆盖这一档。
- 存储要用全闪并行 FS,读带宽至少 5GB/s/GPU。
4)万亿参数实验室
- 千卡以上直接看 灵骏 HPN7.0 或 NVIDIA SuperPOD 参考架构。
- 存储需要 GPFS、Lustre 或 CPFS 级别的并行 FS,吞吐至少 300GB/s。
- 同时要规划自动故障恢复和分层 checkpoint:热存储放全闪,冷存储放对象存储。
十、部署风险和隐性成本
1)虚拟化损耗会吃掉 5-15% 算力
云上虚拟化 GPU 实例通常存在 SR-IOV 或 vGPU 层的性能损耗,训练吞吐比裸金属低 5-15%。持续高负载训练更适合裸金属或直通实例,尤其是多卡同步训练。
2)网络拓扑不对称是隐形杀手
有些平台虽然能开出千卡集群,但实际拓扑可能是 2 层胖树,收敛比达到 3:1 甚至 4:1,跨机通信会很拥塞。采购前最好要求平台提供 NCCL allreduce 测试报告 和 扩展性曲线。
3)存储 I/O 瓶颈会把利用率拉得很低
WEKA 2026 年报告显示,企业 GPU 集群利用率最低只有 5%,大部分浪费来自 GPU 等数据。预算阶段必须同步规划存储带宽:
- 图像训练按每 GPU 4GB/s 预留
- 万亿参数 LLM 按集群级 300GB/s+ 预留
- 对象存储只适合冷备份,不能直接喂训练
4)checkpoint 写入带宽决定训练有效时长
70B 模型一次 checkpoint 约 420GB,如果写带宽只有 2GB/s,单次写入要 3.5 分钟;一小时一次 checkpoint,约有 6% 的时间浪费在存档上。万卡集群应把 checkpoint 写入带宽做到 100GB/s 以上,通常只有全闪并行 FS 才能达到。
5)国产卡集群有软件栈迁移成本
昇腾集群从 CUDA 迁移到 CANN,通常需要 2-4 周 工程适配。DeepSeek、通义千问等主流模型已有昇腾定制版,自研模型要预留迁移周期。华为云昇腾的 RoCE 网络在万卡规模下已经验证过线性扩展,但它与 NVIDIA SuperPOD 的调试脚本不能直接复用。
6)活动价有台数上限和时限
UCloud GPU 云主机多卡专区活动价通常有每个机型 3-5 台 的限购上限,扩容超出部分可能要回到原价;阿里云灵骏目前对白名单用户开放。大集群扩容前,先确认库存、配额和交付周期。
十一、FAQ
Q:单卡训练 7B 模型到底需要什么配置?
A:一张 RTX 4090 24GB 加本地 NVMe SSD 1TB 就够,不需要 NVLink,也不需要高速网络。UCloud 包月 ¥1212 或 RunPod $0.69/时按量都可以。LoRA 微调通常几小时就能跑完,成本也很低;如果是全参微调,就要上 A100 80GB。
Q:8 卡训练一定要 NVLink 吗?
A:如果只是纯数据并行(DDP)跑独立任务,PCIe 也能凑合。但一旦使用张量并行(TP)、流水线并行(PP)或 ZeRO-3,没有 NVLink 会让通信开销明显上升,30-50% 的有效训练时间被吃掉并不罕见。
Q:什么时候需要从 RoCE 升级到 InfiniBand?
A:千卡以下,两者性能差异通常不大,RoCE 成本更低。到了千卡以上,尤其是万卡级别,IB 的自适应路由和拥塞控制更有优势。不过阿里云用自研以太拓扑 HPN7.0 做到了万卡 96%+ 线性扩展,说明 RoCE 方案也能支撑超大规模,关键还是看拓扑设计。
Q:训练集群的存储到底怎么配?
A:按三个口径算:读带宽、写带宽和小文件 IOPS。单卡或 4 卡用本地 NVMe 就够;8 卡以上要上并行文件系统,比如 GPFS、Lustre、CPFS 或 WEKA,不能只靠 NFS。
Q:GPU 利用率低于 50% 是什么原因?
A:常见原因有三个:存储 I/O 瓶颈、网络通信瓶颈、负载不均衡。先用 nvidia-smi 看 GPU 利用率波动,再用 PyTorch profiler 定位是 data loader 还是 communication 占用过高。WEKA 2026 年报告显示,企业集群的平均利用率只有 30-40%。
Q:国内合规的大集群训练走哪条路线?
A:主线有三条:阿里云灵骏(HPN7.0 以太 + CPFS,万卡规模)、华为云昇腾(国产卡 + CANN 栈,万亿参数验证)、UCloud 智算中心(IB+RoCE 混合 + RSSD,2048 卡)。如果模型已经有昇腾定制版,昇腾成本通常最低;如果必须依赖 CUDA 生态,灵骏或 UCloud 更合适。
Q:checkpoint 应该存在哪?
A:建议三层架构:热存储放最近 2-3 个 checkpoint,温存储放最近 24 小时版本,冷存储用对象存储归档历史 checkpoint。这样既能快速恢复,也能控制长期成本。
Q:购买集群前要做哪些压测?
A:至少做四项:NCCL allreduce 和 allgather 测试、多机扩展性测试、checkpoint 写入带宽测试、72 小时稳定性测试。这样能尽早发现网络、存储和硬件故障。
十二、总结建议
如果把 GPU 训练云采购简化成一句话,就是:别只买 GPU,得买一套能跑得动的系统。
我会这样记:
- 单卡/4 卡:显存 + 本地 NVMe
- 8 卡:NVLink/NVSwitch
- 32 卡以上:RDMA 拓扑 + 并行文件系统
- 千卡级:线性扩展率 + 故障恢复能力
只要把算力、互联、存储一起评估,训练集群的成本和性能就不会被单点瓶颈锁死。