链接已复制!

380亿美元的赌注:OpenAI转向AWS芯片

OpenAI正在通过与AWS高达380亿美元的合作来多样化其基础设施,这标志着它正在摆脱对纯Microsoft Azure和NVIDIA CUDA的依赖。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

数据中心内未来主义微芯片上OpenAI和AWS徽标的赛博朋克可视化。

“单一云”人工智能垄断时代正式结束。 2025 年 11 月 3 日,微软 Azure 生态系统皇冠上的明珠 OpenAI 与亚马逊网络服务 (AWS) 签署了为期七年、价值 380 亿美元的基础设施合作伙伴关系,这一消息震惊了整个行业。这不仅仅是产能的扩张;这是全球人工智能力量版图的根本性重组。

多年来,OpenAI 的发展一直是 Azure 计算集群的代名词。但随着对前沿模型的需求从数十亿个参数转变为数万亿个参数,Azure-NVIDIA 关系的局限性变得显而易见。通过将大部分训练和推理工作负载转移到 AWS,OpenAI 所做的不仅仅是购买服务器;它押注于AWS的定制芯片,特别是Trainium和Inferentia系列,以打破十年来定义人工智能经济的“CUDA税”。

亮点:为什么 380 亿美元现在很重要

2025年底,人工智能行业达到了“效率墙”。训练下一代模型(想想 GPT-6 及更高版本)不再只需要更多的 GPU;它需要更“高效”的 GPU。 NVIDIA 的 H100 和 Blackwell 芯片以其性能而闻名,但它们也因其功耗和价格而闻名。每个芯片的成本为 30,000 美元到 40,000 美元,扩展到百万个 GPU 集群所产生的资本支出甚至连 OpenAI 的支持者都感到畏惧。

进入价值 380 亿美元的 AWS 交易。该合同不适用于标准 NVIDIA 实例。依赖 AWS Trainium2 和最近发布的 Trainium3 (Trn3) Ultraservers 是一项战略举措。通过转向 AWS 定制芯片,OpenAI 的目标是将性价比比基于标准 GPU 的集群提高 40-50%。这使得 OpenAI 能够以相同的成本运行更多次训练迭代,这是与 Anthropic 和 Google 竞争的关键优势。

技术深入探讨:打破 CUDA 垄断

要理解 OpenAI 为什么会放弃 NVIDIA 的 CUDA 生态系统,您必须看看芯片本身。多年来,NVIDIA 的优势在于软件堆栈。 CUDA(统一计算设备架构)使研究人员可以轻松编写在 GPU 上快速运行的代码。但 AWS 一直在悄悄构建一个反堆栈:Neuron。

Trainium2 的架构

AWS Trainium2 芯片是本次交易的支柱,其设计目的只有一个:大规模的高性能深度学习训练。与通用 GPU 不同,Trainium 删除了 AI 不需要的“传统”图形硬件,完全专注于张量处理。

  1. 内存带宽:Trainium2 每个芯片具有 192GB HBM3 内存。虽然原始 TOPS(每秒万亿次运算)可与 NVIDIA 的 H100 竞争,但其秘诀在于互连。 AWS 的 Elastic Fabric Adapter (EFA) 允许这些芯片相互通信,就像它们是单个巨型处理器一样。
  2. 能源效率:热量是数据中心的敌人。据报告,Trainium2 集群每 FLOP 的功耗比同等的 Hopper 集群低 25-30%。当您为单次训练运行消耗 100 兆瓦时,功率降低 30% 就是成功释放和局部电网故障之间的区别。
  3. Neuron SDK:AWS 的 Neuron 编译器已达到成熟水平,它可以自动将 OpenAI 使用的框架 PyTorch 和 JAX 模型映射到 Trainium 芯片上,只需最少的手动调整。这降低了工程师此前被 NVIDIA 束缚的“移植成本”。

Trainium3 的崛起

2025 年 12 月,AWS 宣布 Trainium3 (Trn3) Ultraservers 现已全面上市,将这一点提升到了一个新的水平。这些装置将 64 个 Trainium3 芯片封装到一个全液冷机箱中,提供超过 100 Petaflops 的 FP8 性能。至关重要的是,Trainium3 的性能比其前身提高了4 倍,同时保持了比 Blackwell 级 GPU 显着的能效领先优势。据报道,OpenAI 是这些 Ultraserver 的主要租户,利用它们在太大而无法容纳最大单服务器内存池的模型上开创“分布式推理”。

背景历史:Azure-微软-OpenAI 的紧张关系

要了解 AWS 枢轴,您必须了解“金手铐”的历史。 2019 年,微软向 OpenAI 投资了 10 亿美元,随后又追加了数十亿美元。这项投资主要以Azure 积分的形式进行。 OpenAI 本质上是被迫在微软的云上构建的。

这是多年来的共生关系。微软独家了解了世界上最好的人工智能,而 OpenAI 则获得了几乎无底洞的计算。然而,随着 2024 年进入 2025 年,摩擦点出现了:

  • 容量限制:即使微软积极进行扩建,OpenAI 仍发现自己正在与微软内部的“Copilot”团队争夺 H100。
  • 主权人工智能趋势:随着国家和小公司开始构建自己的主权云,锁定单一提供商的想法成为 OpenAI 的战略风险。
  • Anthropic 和 Apple 因素:Anthropic 从一开始就是 AWS 合作伙伴。此外,Apple 在 2024 年底公开使用 Trainium2 进行模型训练,这也是一次大规模的行业验证。通过观察这些同行的成功,OpenAI 意识到他们可能正在缴纳竞争对手正在逃避的“微软税”。

这笔 AWS 交易并不意味着 OpenAI 将离开微软。这意味着 OpenAI 正在成为多云。在企业技术领域,单一云是一种负担。分析表明,到 2026 年,OpenAI 将实施“三重云”战略:Azure 作为消费产品的主要家园,AWS 用于前沿研究和大规模培训,并可能使用 Google Cloud 或 Oracle 来执行专门的边缘推理任务。

前瞻分析:“硅主权”时代

380亿美元的赌注是“硅主权”时代倒下的第一张多米诺骨牌。该行业正在摆脱一家公司(NVIDIA)设计芯片、三家公司(亚马逊、微软、谷歌)出租芯片的世界。过渡是朝着垂直整合。

“CUDA 差距”的未来

NVIDIA 并没有停滞不前,Blackwell B200 系列仍然是原始、未优化工作负载的性能之王。然而,对于 OpenAI 规模的公司来说,“CUDA 差距”(NVIDIA 的软件优势)正在缩小。当您拥有 2,000 名精英工程师时,如果可以节省 100 亿美元的云成本,那么花费六个月的时间优化 AWS 芯片是值得的。

接下来会发生什么?

  1. 价格战:预计AWS将向其他一级实验室提供“OpenAI级别的定价”,以积极吸引他们离开Azure。如果 Anthropic 和 OpenAI 都在 AWS 上,那么人工智能研究人员对 AWS 的吸引力将变得几乎不可抗拒。
  2. 微软的回应:关注微软加速推出自家“Maia”AI芯片。如果微软无法与 AWS 的芯片效率相媲美,他们就有可能成为“哑巴管道”,以实验室无法承担的利润转售 NVIDIA 硬件。
  3. “能源之门”:下一个瓶颈不是芯片,而是芯片。它是变压器,特别是电气变压器,而不是人工智能变压器。 AWS 协议包括可再生能源采购条款,并承认只有在有能够处理负载的电网的情况下才能花费 380 亿美元。

您的底线

如果您是投资者或技术领导者,那么要点很明确:计算多元化是新的生存策略。 将一切押注于单一硬件供应商或单一云提供商的时代已经结束。 OpenAI 迁移到 AWS 是一个信号,表明人工智能基础设施市场最终走向成熟,进入竞争激烈的多供应商格局。

380 亿美元的赌注不仅关乎 OpenAI 的未来,还关乎 OpenAI 的未来。这是人工智能革命下一阶段如何融资和推动的蓝图。 “云战争”刚刚进入核心阶段。


有关人工智能基础设施的更多技术深入探讨,请参阅 Google 的 TPU 策略 如何挑战现状。

实时:现在排名第一的 AI 模型是哪个? LMArena 盲测对决排行榜、每个模型每百万 token 的价格,以及本月新发布。每日更新。 查看排行榜 →

资料来源 (4)

Advertisement
Advertisement
Advertisement

Coloring books · All ages

Calm books for noisy days

Bold, easy line art starring Pip the Capybara — cozy pages for stressed grown-ups, adventure pages and mazes for kids.

See the books Free printable pages →

Scan with your phone camera

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...