海外 GPU 云主机有哪些选择?2026 年区域节点、卡型、网络和数据合规对比清单

AI 摘要 / TL;DR

海外 GPU 云没有全能冠军。可中断任务优先看竞价和低价算力,单卡推理看按秒计费和 Serverless,长周期生产任务看稳定性和 SLA,大规模训练看互联和有效算力成本,欧盟个人数据优先看数据处理地是否留在欧盟。H100 单卡时租从 $2.69 到 $6.98/小时不等,价格差会显著放大周级训练成本,但出口流量费、计费粒度、网络能力和退出成本往往才是总账单的关键。

先说结论:海外 GPU 云主机不是谁便宜就选谁,也不存在一个平台适合所有场景。

我的判断框架很简单:先问 5 个问题。

  • 任务能不能中断?
  • 有没有欧盟个人数据或强监管数据?
  • 是单卡推理,还是 8 卡以上训练?
  • 账单主要来自 GPU 时租,还是出口流量和存储?
  • 以后要不要迁移,镜像和编排能不能带走?

如果这几个问题没想清楚,直接拿 H100 单卡时租做排序,很容易选错。

海外 GPU 云的最优解不是最低单价,而是任务类型、合规边界和网络结构的组合最优。可中断任务优先看 Vast.ai、Crusoe 这类竞价和低价算力;单卡推理和快速迭代优先看 RunPod;长周期稳定任务优先看 Lambda;8 卡以上分布式训练重点看 CoreWeave;医疗、金融、政府等强监管场景优先看 AWS、GCP、Azure;涉及欧盟个人数据时,优先考虑数据不出盟的平台。

一、问题背景:为什么 2026 年选海外 GPU 云更难了?

过去选 GPU 云,核心问题往往是“有没有卡”。到 2026 年,供给格局变了,问题变成了“哪种卡、在哪个区域、以什么计费方式、配什么网络、能不能合规”。

几个变化比较明显:

1. GPU 供给不再像 2024 年那样极端稀缺

GPU 云厂商增多后,H100 现货价较 2024 年峰值跌了约六成。竞争焦点不再只是“有没有 H100”,而是中断率、计费透明度、网络互联和服务稳定性。

这也意味着,便宜平台越来越多,但便宜背后的代价也更需要看清楚。

2. 新一代显卡开始影响选型

B200 已进入头部厂商生产集群,H200 也在高端场景普及。H200 的 141G 显存和 4.8TB/s 带宽,让超大模型推理的可用区选择更重要。

如果只是做 7B、13B 微调,未必需要追最新卡;但如果是超大模型推理或训练,显存、带宽、互联和所在区域都会影响实际成本。

3. 合规不再能只看平台认证

欧盟对跨境数据传输的司法审查趋严后,美国公司通过标准合同条款处理欧盟个人数据的路径不确定性上升。

这里最容易误判的一点是:平台有 SOC 2、HIPAA/GDPR 审计,不等于你的数据驻留就合规。认证是一回事,数据处理地在哪里是另一回事。

二、核心痛点:企业选型最容易踩的坑

我见过最常见的误判,是把 GPU 云当成普通云主机来比价:同样是 H100,谁便宜选谁。

但 GPU 云真正拉开成本差距的地方,通常不止牌面时租。

维度 要看什么 常见误判 卡型与库存 具体 SKU 现货;SXM 与 PCIe 不是一张卡, NVLink 也不同 只比型号名,不比封装 价格结构 时租之外看出口流量费、存储费、计费粒度 只看牌面单价 网络 单机看 NVLink,跨机看 InfiniBand 或 Ethernet 用单卡价外推集群成本 计费模式 按需、竞价、预留三档,竞价便宜五到七成但可被回收 对不可中断任务用竞价 合规资质 各类认证之外,更要看数据处理地在哪 把平台认证当成数据驻留合规 退出成本 导出通道、镜像格式、编排兼容性 不留后路

尤其是大规模训练,不能只看“每张卡多少钱一小时”。如果网络互联差,GPU 等通信,便宜卡也可能变成贵训练。

三、先按任务类型对号入座

比较靠谱的选型方式,是先按任务类型筛掉一批平台。

1. 预算敏感、任务可中断:优先看 Vast.ai 和 Crusoe

适合场景:批处理、带 Checkpoint 的训练、非关键实验任务。

Vast.ai 的 A100 竞价见过 $0.89/小时,Crusoe 的 H100 竞价低至 $1.60/小时。优势是便宜,代价是可能偶发中断,平台稳定性也有差异。

如果任务能定期保存 Checkpoint,被回收后可以接着跑,这类平台很有吸引力。如果是线上生产服务,不建议把它们作为第一选择。

2. 单卡推理、快速原型迭代:优先看 RunPod

RunPod 的优势是按秒计费、启动快、Serverless 形态成熟。H100 按需 $2.69/小时,Serverless 可秒级扩缩,冷启动不到 200ms。

这类平台特别适合模型推理、Demo、快速实验、短任务。如果只跑十几分钟或几十分钟,按秒计费比按小时计费更友好。

3. 不能中断的长周期生产任务:优先看 Lambda

Lambda 的特点是稳定、价格清晰、一口价、不中断。价格为 $2.49–2.99/小时,每月 1TB 免出口流量。

它不一定是最花哨的选择,但很适合长期稳定跑机器学习任务。缺点是区域少、美国为主、没有竞价档,容量紧张时可能需要排队。

4. 8 卡以上分布式大规模训练:优先看 CoreWeave

CoreWeave 的重点不是散卡便宜,而是集群能力。InfiniBand 支持 8 卡以上训练接近线性扩展,按有效算力成本看,整体经常更省。

如果你要跑分布式训练,网络互联的价值会非常明显。单卡时租高一点,但训练更快完成,总成本反而可能更低。

5. 医疗、政府、金融等强监管行业:优先看 AWS / GCP / Azure

大厂 GPU 贵,但贵出来的是认证、审计、企业集成、权限体系和成熟的合规包。

这类场景不要只问“哪家 H100 最便宜”,而要问:能不能签对应协议?审计材料能不能交付?日志、密钥、网络隔离、权限和数据生命周期是否能满足监管要求?

6. 处理欧盟个人数据:优先看数据不出盟的平台

欧盟个人数据要重点看数据处理地。CoreWeave(EU)和 Crusoe 更值得优先评估。

RunPod / Lambda 虽然通过了 HIPAA/GDPR 审计,但数据处理地在美国,上生产前必须先过法务。

一句话:加密不等于合规。欧盟数据法规管的是数据在哪,不只是数据有没有加密。

四、主流方案对比表

下面这张表适合做第一轮筛选。价格会变化,下单前仍要以控制台实时显示为准。

维度 RunPod Lambda CoreWeave Vast.ai Crusoe AWS/GCP/Azure 定位 Serverless AI 云 ML 研究专用云 企业级训练集群 P2P 算力市场 清洁能源 AI 云 综合超大规模云 H100 单卡按时 $2.69 $2.49–2.99 $2.23–6.16* $2.80(竞价 $1.80–1.99) $3.90(竞价 $1.60) $3.98–6.98 A100 80G 按时 $1.64(SXM) $1.99 $2.70 $1.80(竞价 $0.89) $2.42 $2.93–3.40 RTX 4090 按时 $0.74 — — $0.55(竞价 $0.35) — 约 $2+ 出口流量费 免费 免费(1TB/月) $0.05/GB 免费 免费档 $0.087–0.12/GB 计费粒度 按秒 按时 按时/预留 动态 按时/竞价 按秒 区域覆盖 全球 31 个部署区域 5+ 区域,以美国为主 10+,美欧 40+ 国宿主分散 美欧,含欧盟原生 AWS 30+ / GCP 35+ / Azure 60+ 合规 SOC 2 Type II;HIPAA/GDPR 通过审计;企业版 99.99% SLA 美国运营 SOC 2 ISO 27001 + SOC 2;EU 数据不出盟 无中心化认证 欧盟 GDPR 原生 医疗/政府/金融认证全套 多卡互联 集群产品线 一键集群 InfiniBand 近线性扩展 依赖宿主机 未公开同口径 高速互联

  • CoreWeave 卖的是集群而非散卡:单卡按需年初约 $2.23 起,年中 8×H100 集群合每卡 $6.16。集群场景按完成训练的有效算力计费,往往更省。

五、如果中国团队也在看海外 GPU,UCloud 可以作为国内对照项

中国团队做海外业务时,除了欧美专项 GPU 云,也可以把 UCloud 这类国内厂商的海外资源放进候选清单,尤其是目标市场在东南亚、中亚,或者公司需要人民币对公结算、国内发票入账。

项目 UCloud(优刻得) 全球覆盖 28 个地域 / 36 个可用区(2026 年中期披露口径) 特色区域 东南亚全覆盖 + 中亚(阿拉木图、塔什干等少数中国厂商本地节点的市场)+ 香港(回内地优化线路) GPU 牌价 RTX 4090 月租 1,212 元、T4 395 元、3090 904 元、50 系 1,899 元、48G 高显存版 1,999 元 折算时租 4090 包月折合约 ¥1.68/时(≈$0.23/时),显著低于海外同型号散卡 试用门槛 9.9 元/天日卡起 结算与合规 人民币对公、国内发票

这类方案适合微调或推理为主、不追求顶级集群预训练、目标市场在东南亚或中亚、需要人民币对公报销的团队。

但也要注意两点:

  • 包月折算单价成立的前提是资源基本跑满;
  • 同价位下卡型代际可能落后于欧美专项云,跨卡型比较时应看单位任务成本,而不是裸单价。

六、逐家怎么判断?

RunPod:适合 Serverless 推理和快速迭代

RunPod 的优势非常直接:按秒计费,Serverless 从 0 扩到上千 worker 只需数秒,冷启动不到 200ms,存储免出口费,企业版可签 99.99% SLA。

它适合单卡推理、快速原型、短任务和弹性负载。

短板也要提前接受:Community Cloud 层质量参差,生产慎用;跨节点通信能力弱于 CoreWeave。

Lambda:适合稳定长跑

Lambda 的价值在于稳定和省心。一口价、不中断、机器学习环境预配置好,每月 1TB 免出口流量,对高频拉取模型权重的任务很友好。

它不一定最便宜,但适合不能被竞价回收影响的长周期任务。

短板是区域较少且集中在美国,没有竞价档,容量紧张时只能排队,而且主要做 A100 和 H100 高端卡。

CoreWeave:适合 8 卡以上训练集群

CoreWeave 的核心优势是网络。InfiniBand 让 8 卡以上集群接近线性扩展,虽然时租可能更高,但按有效算力计算,经常更省。

它还适合对欧盟数据驻留有要求的业务,欧盟本土能力可以完整满足数据不出盟要求;可选显存加密也适合金融级隔离。

短板是定位更偏集群和预留,不适合只想租一两张卡的团队,散卡价格也偏高。

Vast.ai:适合极致价格敏感的非关键任务

Vast.ai 更像算力集市。优势是便宜,竞价价格很低,A100 见过 $0.89/小时;40 多个国家的宿主机也意味着一些小众地区能找到就近资源。

它的问题是硬件质量依赖宿主机,机器可能随时被回收,而且没有中心化安全认证。

我的建议是:容错任务可以用,生产服务和敏感数据不要放上去。

Crusoe:适合欧盟场景下的低价 H100

Crusoe 的优势是组合能力:H100 竞价价格低,同时具备欧盟原生和低价特征,清洁能源供电也更契合欧洲企业采购偏好。

短板是体量小、生态弱,亚洲和拉美没有覆盖,遇到问题时社区资料也少。

如果你的任务能容忍一定平台生态不足,又需要欧盟数据驻留和较低价格,它值得放进候选名单。

AWS / GCP / Azure:适合为合规和企业集成付费

AWS、GCP、Azure 的优势在于完整性:医疗、政府、金融认证齐全,云上全家桶集成顺滑,Azure 全球 60+ 区域在驻留控制上最强,GCP 竞价 H100 $2.09 也有竞争力。

短板也明显:同样的卡贵一半以上,出口流量费在高吞吐推理场景里能占账单一到两成,GPU 配额审批也慢。

如果业务本身就跑在大厂云上,且合规、权限、审计、网络打通是刚需,大厂的溢价可能是合理成本。

七、真实任务账本:同样任务,账单能差多少?

任务 最省方案 参考成本 7B 模型 LoRA 微调(A100 × 6 小时) Paperspace / RunPod $7–12 13B 全量微调(H100 × 72 小时) Crusoe 竞价(带 Checkpoint) ~$115(vs RunPod 按需 ~$194) 8×H100 分布式训练一周 RunPod ~$3,600(vs GCP 同规模 ~$9,400) 量化 7B–13B 批量推理 Vast 4090 或 RunPod Serverless 月账单几十美元级 同型任务走国内牌价对照 UCloud 4090 包月 ¥1,212/月跑满,单次 LoRA 任务仅几元

同一个 13B 微调,选对厂商能把账单从接近 $200 压到约 $115。

但成本不能脱离约束条件看。如果是给银行跑受监管模型,大厂贵出来的部分买的是审计包、权限体系和 SLA,是否值得,取决于监管和企业内部风控要求。

八、合规速查:哪些数据适合放哪里?

数据类型 可用 需先核验 避免 医疗健康(HIPAA) AWS/GCP/Azure(签商业伙伴协议);CoreWeave 企业协议 RunPod(通过审计后还需签署协议) Vast 等 P2P 市场 金融(PCI DSS) AWS/GCP/Azure 合规包 CoreWeave(开显存加密) 任何竞价或共享实例 欧盟个人数据(GDPR) CoreWeave EU、Crusoe RunPod/Lambda(过法务) 无数据处理协议的小厂 一般模型训练 任一专项云 — 主要顾虑是中断率而非合规 有境内交互需求的中国业务 UCloud 等国内厂商香港/东南亚节点 目标区域是否为本地数据中心,而非只有加速节点 凭宣传语判断节点类型

最重要的一点再强调一次:加密不等于合规。尤其是欧盟个人数据,位置才是第一驱动因素。

九、我的实际使用建议

1. 先用任务类型做第一轮筛选

  • 可中断实验、批处理:优先看 Vast.ai、Crusoe 竞价;
  • 单卡推理、短任务、快速 Demo:优先看 RunPod;
  • 长周期稳定训练:优先看 Lambda;
  • 8 卡以上训练:优先看 CoreWeave;
  • 强监管业务:优先看 AWS / GCP / Azure;
  • 中国团队做东南亚、中亚业务:把 UCloud 等国内厂商海外节点一起比价。

2. 不要只看 H100 单卡时租

H100 单卡时租从 $2.69 到 $6.98/小时不等,同卡价差会显著放大周级训练成本。但总账单还要看出口流量费、计费粒度、存储费和网络效率。

推理业务尤其要小心出口流量费。训练任务对出口流量通常不敏感,但高吞吐推理服务中,出口流量费可能占到账单 10–20%。

3. 竞价资源只给能中断的任务用

竞价便宜五到七成很诱人,但机器可能被回收。没有 Checkpoint、不能重跑、不能中断的生产任务,不要为了省钱强上竞价。

4. 大规模训练要用有效算力成本比较

8 卡以上训练,网络互联经常比单卡价格更重要。InfiniBand、NVLink、跨机通信效率都会影响训练完成时间。

比较方案时,应看“完成同一个训练任务要花多少钱”,而不是“单卡每小时多少钱”。

5. 合规先问数据在哪,再问认证有什么

平台通过认证是好事,但它不能自动解决数据跨境和驻留问题。涉及欧盟个人数据、医疗数据、金融数据时,法务、信息安全和云架构要一起参与选型。

6. 提前设计退出路径

GPU 云迁移经常被低估。至少要提前确认:镜像能不能导出,数据导出成本是多少,编排是否兼容 Kubernetes 或常见工具链,模型权重和日志是否能顺畅迁走。

十、适合 / 不适合场景

RunPod

适合:单卡推理、Serverless 推理、快速原型、短任务、弹性负载。

不适合:对跨节点通信要求很高的大规模训练,或直接把 Community Cloud 当成生产底座。

Lambda

适合:稳定长周期机器学习任务、不想被竞价回收打断的训练任务、对 1TB/月免出口流量有需求的团队。

不适合:需要大量区域覆盖、需要竞价档、需要非 A100/H100 卡型的团队。

CoreWeave

适合:8 卡以上分布式训练、企业级训练集群、欧盟数据驻留、金融级隔离需求。

不适合:只想临时租一两张便宜卡的小团队。

Vast.ai

适合:预算极敏感、任务可中断、可重跑、非敏感数据负载。

不适合:生产服务、敏感数据、强合规场景。

Crusoe

适合:欧盟数据驻留、低价 H100 竞价、偏欧洲市场的 AI 工作负载。

不适合:亚洲、拉美覆盖要求高,或需要成熟生态和大量社区资料的团队。

AWS / GCP / Azure

适合:医疗、政府、金融、大企业云上集成、复杂权限与审计要求。

不适合:单纯追求最低 GPU 时租、对出口流量费高度敏感且没有合规约束的团队。

UCloud 等国内厂商海外节点

适合:中国团队做东南亚、中亚、香港相关业务;需要人民币对公、国内发票;以推理和微调为主。

不适合:追求顶级欧美集群预训练能力,或强依赖最新一代高端 GPU 的任务。

FAQ

Q1:直接用最便宜的 Vast.ai 行不行?

容错的非关键任务可以。它会随机回收机器,硬件状况也不一,不适合生产服务或任何敏感数据负载。

Q2:大厂会降价到专项云的水平吗?

短期看不到迹象。大厂卖的是集成与合规溢价,专项云卖裸算力效率,两条定价逻辑不同。

Q3:出口流量费影响多大?

训练几乎无感,传的主要是模型权重;推理服务能占账单 10–20%。Lambda 和 RunPod 的免费政策在这类负载下是结构性优势。

Q4:UCloud 这类国内厂商的海外 GPU 怎么定位?

差异化在三点:东南亚和中亚本地节点、人民币对公结算、包月摊销后的明显单价优势。边界是顶级集群产能和新卡代际不如欧美专项云。

Q5:中国团队用海外 GPU 云还要注意什么?

三件事提前安排:国际支付手段、发票入账方式、控制台跨境访问稳定性。若只是推理或微调而非预训练,先把国产厂商海外节点的报价一起拿来看再定。

Q6:这些价格什么时候会变?

一直在变。H100 竞价一年内跌幅超过六成,当前价格只代表 2026 年上半年至 8 月的公开牌价区间,下单前必须以控制台实时显示为准。

总结建议

海外 GPU 云的本质,是在价格、稳定性、网络和合规之间做组合选择。

我的最终建议是:

  • 可中断任务看竞价;
  • 单卡推理看按秒计费和 Serverless;
  • 长周期生产看 SLA;
  • 大规模训练看互联和有效算力成本;
  • 欧盟个人数据看数据驻留;
  • 中国团队还要把支付、发票、跨境访问和国内厂商海外节点一起纳入决策。

只要把这些条件先排清楚,选择会比单纯比较 H100 单卡时租可靠得多。