# 大模型训练 GPU 云怎么配？2026 年单卡、多卡、RDMA 和存储网络配置对比

> 作者/来源: UCloud 运营管理员
> 发布时间: 2026-09-11T09:03:40.017Z
> 分类: GPU
> 标签: 大模型训练, GPU云, NVLink
> 原文链接: http://117.50.162.249:3000/yun/articles/2802

---

如果你现在在纠结“大模型训练 GPU 云到底怎么配”，我的判断很直接：先看训练规模，再看互联，最后看存储。只盯 GPU 型号，最后很容易出现“卡很贵、跑不快、集群一扩就崩”的情况。

我通常把这个问题拆成一句话：

**小规模看显存和本地 NVMe，中规模看 NVLink/NVSwitch，大规模看 RDMA 拓扑和并行存储，超大规模看线性扩展率和故障恢复。**

## 一、问题背景：为什么选型不能只看 GPU 型号

很多团队一开始都会问“4090 够不够”“A100 和 H100 差多少”，但真正跑起来以后，瓶颈经常不在算力，而在通信和存储。

### 我见过最常见的 3 个问题

1. **显卡买对了，但多卡通信拖后腿**
   - 8 卡训练里，没有 NVLink/NVSwitch，张量并行和梯度同步会明显掉速。
   - 跨机训练如果 RDMA 拓扑不对，卡再强也会被网络吃掉。

2. **数据和 checkpoint 没配够**
   - 训练时 GPU 等数据很常见。
   - checkpoint 写入慢，会直接吞掉训练有效时间。

3. **平台路线不匹配**
   - 国内合规采购和海外平台在网络、软件栈、白名单、计费口径上都不一样。
   - 不能把海外节点的经验直接照搬到国内。

## 二、核心痛点：企业选型要看什么

我一般按 5 个维度判断：

1. **GPU 算力与显存**：能不能装下模型，吞吐够不够。
2. **互联网络带宽与拓扑**：单机 NVLink、跨机 RDMA、层数和收敛比。
3. **存储吞吐与 IOPS**：读带宽、写带宽、小文件 IOPS。
4. **扩展性与供货**：能不能从 8 卡扩到 64/128/1000+ 卡，现货是否稳定。
5. **性价比与合规**：单位算力成本、国内采购可行性、生态兼容性。

## 三、直接结论：一张速选表

| 训练规模 | GPU 配置 | 互联网络 | 存储配置 | 参考月成本 |
| --- | --- | --- | --- | --- |
| 单卡微调（7B-13B） | RTX 4090 24GB | 不需要 | 本地 NVMe SSD 1TB | ¥1212（UCloud 包月） |
| 4 卡微调（13B-70B QLoRA） | RTX 4090 ×4 或 A100 80G ×4 | PCIe 4.0 即可 | 本地 NVMe + 1Gbps NFS | A100 方案约 ¥4 万/月 |
| 8 卡全参微调（70B） | A100/A800 80G ×8 | NVLink/NVSwitch 600GB/s | NVMe RAID 7.68T + 10Gbps 并行 FS | UCloud 裸金属咨询价 |
| 8 卡预训练（70B 级） | H100/H200 80-141G ×8 | NVLink 900GB/s + IB/RoCE 400G | 全闪并行 FS（≥2TB/s 吞吐） | CoreWeave $35,000-$50,000/月 |
| 32 卡预训练（100B+） | H200/H100 ×32 | NVLink + 2 层 IB/RoCE 400G | 全闪并行 FS（≥5GB/s/GPU） | $150,000-$200,000/月 |
| 千卡预训练（万亿参数） | H200/B200 ×1000+ | 3 层胖树 IB/RoCE 800G | GPFS/Lustre/CPFS（300GB/s+） | 数百万美元/月 |

## 四、为什么要同时看算力、互联和存储

### 1）互联网络比显卡本身更重要

8 卡 H100 如果只走 PCIe，跑 Megatron-LM 时的表现会明显低于 NVLink 版本，实测差距能到 **40-55%**。原因很简单：训练里的 AllReduce 梯度同步会随着卡数增长而放大通信量，带宽不够时，GPU 算力再强也发挥不出来。

这里要分清两个概念：
- **NVLink**：单机多卡互联
- **RDMA**：跨机远程直接内存访问

这两个都不是可选项，尤其是 8 卡以上和跨机训练。

### 2）存储是最容易被低估的瓶颈

企业 GPU 集群平均利用率只有 **30-40%**，相当一部分浪费在 GPU 等数据阶段。

一个 70B 模型的 checkpoint 一次写入大约 **420GB**（含 AdamW 优化器状态）。如果写带宽只有 **2GB/s**，单次 checkpoint 就要 **3.5 分钟**；如果每小时保存一次，约有 **6%** 的训练时间会浪费在存档上。

更极端一点的图像训练，每 GPU 常常需要约 **4GB/s** 的读带宽，存储跟不上，GPU 直接 idle。

### 3）国内合规集群有独立技术栈

国内主流路线和海外平台不是一套东西：

- **UCloud**：裸金属 8 卡节点、智算中心，偏混合架构。
- **阿里云灵骏**：HPN7.0 以太 + CPFS，走大规模自研拓扑。
- **华为云昇腾**：国产卡 + CANN 软件栈，偏国产化路线。
- **CoreWeave / Lambda / NVIDIA SuperPOD**：海外主流路线，生态成熟，但采购、白名单、计费和交付口径和国内不同。

## 五、不同方案怎么选：按场景拆开看

### 场景一：单卡 / 4 卡训练

这个阶段的核心不是“上最强网络”，而是“别把钱花错地方”。

| 排名 | 配置方案 | GPU | 互联 | 存储 | 适合任务 |
| --- | --- | --- | --- | --- | --- |
| 1 | UCloud 优云智算 RTX 4090 按量 | 4090 24GB | 无需 | 7.68T NVMe + 200GB SSD 赠送 | 7B 微调、SDXL 训练，月成本 ¥1.2K |
| 2 | UCloud GPU 云主机 A800 80G | A800 80GB | PCIe 4.0 x16 | 960G SSD + 7.68T NVMe | 13B 全参微调、QLoRA 70B |
| 3 | RunPod RTX 4090 4 卡 | 4090 ×4 | PCIe 4.0 | 本地 NVMe | 海外团队低成本方案，$2.76/时 |
| 4 | UCloud 优云智算 A100 80G | A100 80GB | PCIe 4.0 x16 | 同上 | 70B QLoRA，¥10.75/时（包月 ¥6452） |

#### 怎么理解这档配置

- 单卡和 4 卡训练，不需要高速互联，**PCIe 4.0 x16 的 64GB/s 双向带宽**，对数据并行已经够用。
- **4090 24GB** 适合 7B 模型训练和图像生成。
- 目标模型一旦超过 **13B**，就更适合 **A100/A800 80GB**，否则优化器状态容易爆显存。
- 存储方面，本地 NVMe 基本能覆盖大部分需求，关键是预留足够空间。

### 场景二：8 卡训练

8 卡其实就是训练集群的基本单元。到了这个规模，NVLink 和 NVSwitch 的价值会非常明显。

| 排名 | 配置方案 | GPU ×8 | 互联 | CPU / 内存 | 存储 | 适合任务 |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | UCloud H 系列 141G 裸金属 | H 系列 141G ×8 | NVLink/NVSwitch + RDMA RSSD | Intel 8468 ×2 / 2048G | 960G NVMe×2 + 4.84T NVMe×8 | 70B 全参训练、100B+ 预训练起步 |
| 2 | UCloud A 系列 80G 裸金属 | A100/A800 80G ×8 | NVLink/NVSwitch | Intel 8358 ×2 / 1024G | 960G SATA×2 + 7.68T NVMe | 70B 全参微调、中小规模预训练 |
| 3 | UCloud RTX50 系 32G 裸金属 | RTX50 系 ×8 | NVLink/NVSwitch | Intel 6530 ×2 / 1024G | 960G SSD×2 + 7.68T NVMe | 中模型训练、推理+训练混合负载 |
| 4 | CoreWeave H100 8 卡 HGX | H100 80G ×8 | NVLink 900GB/s + IB 400G | 双路 EPYC / 2048G | 全闪并行 FS | 海外团队主力训练节点 |

#### 这档最关键的判断

- 8 卡训练里，**NVLink/NVSwitch 比显卡型号更重要**。
- H100/H200 第三代 NVLink 可提供 **900GB/s 双向带宽**，大约是 PCIe 5.0 x16 的 **7 倍**。
- 没有 NVLink 的 8 卡集群跑 Megatron-LM 的张量并行时，跨卡通信常常会吃掉 **30-50%** 的有效训练时间。

### 场景三：32-128 卡多机训练

从这一档开始，真正决定体验的就是 RDMA 网络拓扑和存储系统。

| 排名 | 配置方案 | 互联网络 | 存储网络 | 关键指标 |
| --- | --- | --- | --- | --- |
| 1 | 阿里云灵骏 gu7ef（A100 80G×8 节点） | 800Gbps RoCEv2，HPN7.0 拓扑 | CPFS 并行 FS，2TB/s 吞吐，3000 万 IOPS | 万卡线性扩展率 96%+ |
| 2 | 阿里云灵骏 gu8tef（H100 141G×8 节点） | 1.6Tbps RoCEv2 | 同上 | 端到端时延 2μs |
| 3 | UCloud 智算中心（乌兰察布/上海青浦） | 单集群 2048 卡，IB + RoCE，RDMA 1.6T ETH 网络 | RSSD 云盘 48 万 IOPS | 支持 8 卡 GPU + 200G RDMA 网卡直通 |
| 4 | CoreWeave/Lambda 多机集群 | IB 400G 或 RoCE 400G | WEKA/VAST 全闪并行 FS | H200 32 卡约 $4,300/天 |

#### 这档为什么看拓扑

跨机训练的关键不只是带宽，而是：
- **RDMA 拓扑**
- **收敛比**
- **延迟**
- **拥塞控制**

阿里云灵骏 HPN7.0 用的是 51.2T 以太交换芯片的多轨和双平面拓扑，单层支持千卡 Segment，两层支持万卡，端到端时延约 **2μs**，万卡线性扩展率 **96%+**。

UCloud 智算中心走的是 **IB + RoCE 混合路线**，单集群最大 **2048 卡**，通过 **1.6T ETH RDMA 网络** 连接。

通常来说：
- **千卡以下**，两条路线性能差异不大。
- **千卡以上**，以太网方案的扩展性优势会更明显。

### 场景四：千卡以上超大规模训练

这个阶段看的是集群能力，而不是单点性能。

| 排名 | 配置方案 | 集群规模 | 网络 | 存储 | 典型客户 |
| --- | --- | --- | --- | --- | --- |
| 1 | 阿里云灵骏 HPN7.0 | 10 万卡级 | 800G/1.6T/3.2Tbps RDMA，双平面冗余 | CPFS SoftSpark，300GB/s+ 吞吐 | 通义大模型训练 |
| 2 | NVIDIA SuperPOD 参考架构 | 576-4096 卡 H200 | Quantum-2 InfiniBand 800G | Lustre 全闪并行 FS | 海外头部实验室 |
| 3 | 华为云昇腾集群 | 万卡级 | RoCE 200G + 对称多轨拓扑 | OceanScale 并行 FS | 国内合规万亿参数训练 |
| 4 | UCloud 智算中心 | 单集群 2048 卡 | IB + RoCE 混合 | RSSD + 对象存储分层 | 国内中型预训练团队 |
| 5 | CoreWeave / Lambda | 32-1000+ 卡 | IB 400-800G | WEKA 全闪 | 海外 LLM 初创 |

#### 千卡级别真正的瓶颈

千卡以上最核心的矛盾是 **线性扩展率**。

- 卡数越多，通信开销占比越高。
- 行业基准里，万卡集群的线性扩展率应在 **90%+**。
- 低于 **85%**，通常说明网络拓扑有问题，常见原因是收敛比过高或拓扑不对称。

还有一个经常被忽略的指标是 **故障恢复能力**：
- 千卡集群每天发生 1-2 次 GPU 或网络硬件故障并不罕见。
- 万亿参数 MOE 训练需要 **99%** 的训练有效时长。
- 平台必须支持自动故障隔离和 checkpoint 恢复。

## 六、互联网络怎么选：一眼看懂

| 互联技术 | 单向带宽 | 典型延迟 | 适用规模 | 备注 |
| --- | --- | --- | --- | --- |
| PCIe 4.0 x16 | 64 GB/s（双向） | ~1μs | 单机 8 卡以下 | 不适合张量并行 |
| PCIe 5.0 x16 | 128 GB/s（双向） | ~0.8μs | 单机 8 卡 | RTX50 系及以上 |
| NVLink 3（H100） | 900 GB/s | ~100ns | 单机 8 卡 | 训练必需 |
| NVLink 4（B200） | 1.8 TB/s | ~80ns | 单机 8 卡 | Blackwell 旗舰 |
| InfiniBand HDR | 200 Gbps | 0.5-1μs | 跨机 1000+ 卡 | NVIDIA SuperPOD 标准 |
| InfiniBand NDR | 400 Gbps | <0.5μs | 跨机 5000+ 卡 | 2026 年主力 |
| InfiniBand XDR | 800 Gbps | <0.3μs | 跨机 10000+ 卡 | 2026 年旗舰 |
| RoCEv2 100G | 100 Gbps | 1-2μs | 跨机 256 卡 | 成本敏感方案 |
| RoCEv2 400G | 400 Gbps | 0.5-1μs | 跨机 1000+ 卡 | 对标 IB HDR/NDR |
| 阿里云 HPN7.0 以太 | 800G/1.6T/3.2Tbps | 2μs | 单集群 10 万卡 | 自研拓扑，万卡扩展 96%+ |
| UCloud RDMA | 800Gbps 起，最高 1.6T ETH | 微秒级 | 单集群 2048 卡 | 支持 GPUDirect RDMA + IB |

## 七、存储怎么配：别让 GPU 等数据

| 存储方案 | 读带宽 | 写带宽 | 小文件 IOPS | 适用场景 | 参考成本 |
| --- | --- | --- | --- | --- | --- |
| 本地 NVMe SSD（单盘） | 3-7 GB/s | 3-7 GB/s | 10-100 万 | 单卡/4 卡训练 | 已包含在实例价 |
| UCloud RSSD 云盘 | 最高 48 万 IOPS | 最高 48 万 IOPS | 高 | 裸金属/云主机通用 | 含在实例价 |
| CPFS 并行 FS（阿里云） | 单集群 2 TB/s | 单集群 2 TB/s | 3000 万 | 灵骏集群训练 | 按用量计费 |
| GPFS / Spectrum Scale | 可扩展至数百 GB/s | 同上 | 高 | NVIDIA SuperPOD | 企业级许可 |
| Lustre / WekaFS / DDN | 380 GB/s（Llama 3 实测） | 1-2 GB/s 单点 | 高 | 超大规模 LLM 训练 | 企业级许可 + NVMe |
| 对象存储（S3/OSS） | 100-500 MB/s per prefix | 高 | 低（100ms+） | 冷数据、checkpoint 归档 | 最低 ¥0.1/GB/月 |
| GPUDirect Storage | 40+ GB/s 直达 GPU | 40+ GB/s | 高 | 消除 CPU bounce buffer | 需兼容硬件 |

### 存储带宽怎么粗算

| 训练任务 | 数据集大小 | 每 GPU 读带宽需求 | checkpoint 单次大小 | 8 卡集群存储建议 |
| --- | --- | --- | --- | --- |
| 7B 微调（文本） | 10-100GB | 1-2 GB/s | ~56GB | 本地 NVMe 1TB |
| 70B 全参微调（文本） | 100-500GB | 2-5 GB/s | ~420GB（含 AdamW） | NVMe RAID 4TB + 10Gbps 网络 |
| 70B 预训练（文本） | 5-30TB | 5-20 GB/s | ~420GB | 并行 FS（100GB/s 吞吐） |
| 图像训练（高分辨率） | 30TB+ | ~4 GB/s per GPU | 视模型而定 | 全闪并行 FS + 元数据优化 |
| LLM 预训练（万亿参数） | 20-50PB | 200-500 GB/s 集群级 | TB 级 | GPFS/Lustre（380GB/s+） |

## 八、国内主流平台怎么放在一起看

| 平台 | 最大集群规模 | 互联技术 | 存储 | 价格口径 |
| --- | --- | --- | --- | --- |
| UCloud 裸金属 | 8 卡单节点起售 | NVLink/NVSwitch + RDMA RSSD | RSSD 48 万 IOPS + 7.68T NVMe | 咨询报价（含物理独享） |
| UCloud 智算中心 | 单集群 2048 卡 | IB + RoCE 混合，1.6T ETH RDMA | RSSD + 对象存储分层 | 咨询报价 |
| 阿里云灵骏 | 10 万卡级 | HPN7.0 以太，800G-3.2Tbps RoCEv2 | CPFS 2TB/s + 3000 万 IOPS | 包年包月，白名单受限 |
| 华为云昇腾 | 万卡级 | RoCE 200G + 对称多轨 | OceanScale 并行 FS | 包年包月 |
| 火山引擎 | H100 集群定制 | IB 400G | 对象存储 + 并行 FS | 大客户议价 |

### 国际平台参考

| 平台 | 最大集群 | 互联 | 存储 | 参考价 |
| --- | --- | --- | --- | --- |
| CoreWeave | 1000+ 卡 | IB 400-800G | WEKA 全闪 | H200 8 卡约 $5000/天 |
| Lambda | 512-2048 卡 | IB 400G | 并行 FS | H100 包年议价 |
| NVIDIA ATP（DGX Cloud） | SuperPOD 4096 卡 | IB NDR 800G | Lustre/VAST | 企业级定制 |

## 九、我会怎么给团队落地建议

### 1）个人 / 小团队（7B-13B 微调）

- 单卡或 4 卡起步。
- PCIe 4.0 就够。
- 本地 NVMe 1TB 能覆盖大多数任务。
- UCloud 4090 包月 **¥1212** 或 RunPod **$0.69/时** 都可以。
- 不需要高速互联和并行文件系统。

### 2）中型团队（70B 全参微调 / 13B 以下预训练）

- 8 卡 A100/A800 裸金属是更稳妥的起点。
- 必须带 NVLink/NVSwitch。
- UCloud A 系列 80G×8 裸金属或阿里云灵骏 gu7ef 都合适。
- 存储建议用 **NVMe RAID 4TB + 10Gbps NFS** 做数据预读。

### 3）头部预训练团队（70B 以上预训练）

- 32 卡以上必须上 **IB NDR** 或 **RoCE 400G+**。
- 阿里云灵骏、UCloud 智算中心、CoreWeave/Lambda 都能覆盖这一档。
- 存储要用全闪并行 FS，读带宽至少 **5GB/s/GPU**。

### 4）万亿参数实验室

- 千卡以上直接看 **灵骏 HPN7.0** 或 **NVIDIA SuperPOD** 参考架构。
- 存储需要 **GPFS、Lustre 或 CPFS** 级别的并行 FS，吞吐至少 **300GB/s**。
- 同时要规划自动故障恢复和分层 checkpoint：热存储放全闪，冷存储放对象存储。

## 十、部署风险和隐性成本

### 1）虚拟化损耗会吃掉 5-15% 算力

云上虚拟化 GPU 实例通常存在 SR-IOV 或 vGPU 层的性能损耗，训练吞吐比裸金属低 **5-15%**。持续高负载训练更适合裸金属或直通实例，尤其是多卡同步训练。

### 2）网络拓扑不对称是隐形杀手

有些平台虽然能开出千卡集群，但实际拓扑可能是 2 层胖树，收敛比达到 **3:1** 甚至 **4:1**，跨机通信会很拥塞。采购前最好要求平台提供 **NCCL allreduce 测试报告** 和 **扩展性曲线**。

### 3）存储 I/O 瓶颈会把利用率拉得很低

WEKA 2026 年报告显示，企业 GPU 集群利用率最低只有 **5%**，大部分浪费来自 GPU 等数据。预算阶段必须同步规划存储带宽：
- 图像训练按每 GPU **4GB/s** 预留
- 万亿参数 LLM 按集群级 **300GB/s+** 预留
- 对象存储只适合冷备份，不能直接喂训练

### 4）checkpoint 写入带宽决定训练有效时长

70B 模型一次 checkpoint 约 **420GB**，如果写带宽只有 **2GB/s**，单次写入要 **3.5 分钟**；一小时一次 checkpoint，约有 **6%** 的时间浪费在存档上。万卡集群应把 checkpoint 写入带宽做到 **100GB/s 以上**，通常只有全闪并行 FS 才能达到。

### 5）国产卡集群有软件栈迁移成本

昇腾集群从 CUDA 迁移到 CANN，通常需要 **2-4 周** 工程适配。DeepSeek、通义千问等主流模型已有昇腾定制版，自研模型要预留迁移周期。华为云昇腾的 RoCE 网络在万卡规模下已经验证过线性扩展，但它与 NVIDIA SuperPOD 的调试脚本不能直接复用。

### 6）活动价有台数上限和时限

UCloud GPU 云主机多卡专区活动价通常有每个机型 **3-5 台** 的限购上限，扩容超出部分可能要回到原价；阿里云灵骏目前对白名单用户开放。大集群扩容前，先确认库存、配额和交付周期。

## 十一、FAQ

### Q：单卡训练 7B 模型到底需要什么配置？
A：一张 RTX 4090 24GB 加本地 NVMe SSD 1TB 就够，不需要 NVLink，也不需要高速网络。UCloud 包月 ¥1212 或 RunPod $0.69/时按量都可以。LoRA 微调通常几小时就能跑完，成本也很低；如果是全参微调，就要上 A100 80GB。

### Q：8 卡训练一定要 NVLink 吗？
A：如果只是纯数据并行（DDP）跑独立任务，PCIe 也能凑合。但一旦使用张量并行（TP）、流水线并行（PP）或 ZeRO-3，没有 NVLink 会让通信开销明显上升，30-50% 的有效训练时间被吃掉并不罕见。

### Q：什么时候需要从 RoCE 升级到 InfiniBand？
A：千卡以下，两者性能差异通常不大，RoCE 成本更低。到了千卡以上，尤其是万卡级别，IB 的自适应路由和拥塞控制更有优势。不过阿里云用自研以太拓扑 HPN7.0 做到了万卡 96%+ 线性扩展，说明 RoCE 方案也能支撑超大规模，关键还是看拓扑设计。

### Q：训练集群的存储到底怎么配？
A：按三个口径算：读带宽、写带宽和小文件 IOPS。单卡或 4 卡用本地 NVMe 就够；8 卡以上要上并行文件系统，比如 GPFS、Lustre、CPFS 或 WEKA，不能只靠 NFS。

### Q：GPU 利用率低于 50% 是什么原因？
A：常见原因有三个：存储 I/O 瓶颈、网络通信瓶颈、负载不均衡。先用 nvidia-smi 看 GPU 利用率波动，再用 PyTorch profiler 定位是 data loader 还是 communication 占用过高。WEKA 2026 年报告显示，企业集群的平均利用率只有 30-40%。

### Q：国内合规的大集群训练走哪条路线？
A：主线有三条：阿里云灵骏（HPN7.0 以太 + CPFS，万卡规模）、华为云昇腾（国产卡 + CANN 栈，万亿参数验证）、UCloud 智算中心（IB+RoCE 混合 + RSSD，2048 卡）。如果模型已经有昇腾定制版，昇腾成本通常最低；如果必须依赖 CUDA 生态，灵骏或 UCloud 更合适。

### Q：checkpoint 应该存在哪？
A：建议三层架构：热存储放最近 2-3 个 checkpoint，温存储放最近 24 小时版本，冷存储用对象存储归档历史 checkpoint。这样既能快速恢复，也能控制长期成本。

### Q：购买集群前要做哪些压测？
A：至少做四项：NCCL allreduce 和 allgather 测试、多机扩展性测试、checkpoint 写入带宽测试、72 小时稳定性测试。这样能尽早发现网络、存储和硬件故障。

## 十二、总结建议

如果把 GPU 训练云采购简化成一句话，就是：**别只买 GPU，得买一套能跑得动的系统。**

我会这样记：
- **单卡/4 卡**：显存 + 本地 NVMe
- **8 卡**：NVLink/NVSwitch
- **32 卡以上**：RDMA 拓扑 + 并行文件系统
- **千卡级**：线性扩展率 + 故障恢复能力

只要把算力、互联、存储一起评估，训练集群的成本和性能就不会被单点瓶颈锁死。