链接已复制!

硅谷之战:谷歌 TPU 对阵英伟达 Blackwell

谷歌的新 Trillium 和 Ironwood TPU 以卓越的效率和更低的成本挑战了英伟达 Blackwell 的主导地位。我们将分析规格、经济效益和最终赢家。

🌐
机器翻译

本文由英文原文自动翻译而成。 阅读英文原文

分屏显示,左侧为 Google TPU 服务器机架,右侧为 Nvidia Blackwell 机架

关键要点

  • 成本效益:Google的TPU v6(Trillium)在推理任务上比Nvidia H100/Blackwell提供4.7倍更好的每美元性能
  • 能效之王:Google的TPU在相同工作负载下消耗少67%的电力,随着数据中心能源需求飙升,这是一个关键因素。
  • 新挑战者:Google的”Ironwood”(TPU v7)在保持卓越效率的同时,与Blackwell的原始性能相匹敌。
  • 结论:Nvidia仍然统治训练领域,但Google正在赢得大规模AI推理的战争。

在过去三年里,“AI硬件”一直是一个名字的同义词:Nvidia。该公司的H100及后续的Blackwell芯片一直是黄金标准,为从ChatGPT到Gemini的一切提供动力。但随着AI行业从”训练”(构建模型)转向”推理”(运行模型),这个算计正在改变。

Google登场。当全世界都在争夺Nvidia的配额时,Google一直在悄悄完善自己的定制芯片:张量处理单元(TPU)。随着**Trillium(v6)和即将推出的Ironwood(v7)**架构的发布,Google不只是提供一个替代方案;他们声称在对超大规模计算商最重要的指标上占据优势:成本和能源。

这不仅仅是一场规格表之战。这是两种哲学的碰撞:通用灵活性(Nvidia)对专业化效率(Google)。这个选择将定义AI时代的经济学。

背景:来龙去脉

Nvidia的垄断

Nvidia的统治地位并非偶然。他们的CUDA软件生态系统创造了一条”护城河”,让开发者极难转换。如果你想训练一个前沿模型,你就用Nvidia GPU。就这样。这使Nvidia能够获得巨额利润,Blackwell机架的成本高达300万美元以上。

Google的持久战

Google走了一条不同的路。十多年前就意识到标准CPU和GPU无法跟上他们的AI需求,他们开始专门为自己的工作负载(搜索、地图,以及现在的Gemini)构建TPU。多年来,这些一直是内部机密。现在,它们是Google Cloud AI产品的支柱。

理解硬件

Nvidia Blackwell(B200/GB200)

Nvidia的Blackwell是一头猛兽。它被设计成”包办一切”的芯片。

  • 优势:巨大的内存带宽、令人难以置信的原始计算能力,以及处理任何类型AI工作负载(训练、推理、科学模拟)的能力。
  • 劣势:耗电且极其昂贵。这就像开一辆一级方程式赛车去杂货店,快,但对许多任务来说是杀鸡用牛刀。

Google Trillium(TPU v6)与Ironwood(TPU v7)

Google的TPU是精密仪器。它们剥离了GPU的图形渲染遗产,纯粹专注于矩阵数学(AI的核心)。

  • 优势:极致的能源效率、光学互连(允许数千个芯片作为一台”超级计算机”协同工作),以及更低的成本。
  • 劣势:编程难度更高(需要JAX/TensorFlow专业知识),对非AI任务的灵活性较差。

数据:用数字说话

这些数字为企业买家描绘了一幅鲜明的图景。

成本比较(3年TCO)

指标Nvidia H100/Blackwell集群Google TPU v6 Pod赢家
硬件成本~$100M~$52MTPU (-48%)
电力成本~$47M~$16MTPU (-66%)
总成本~$147M~$68MTPU (-54%)

来源:AINewsHub、CloudOptimo

性能指标

  • 推理:TPU v6比Nvidia当前一代提供4.7倍更好的每美元性能
  • 效率:在特定的transformer工作负载中,Google的芯片提供100%更好的每瓦性能

行业影响

向推理的转变

随着Gemini 3和GPT-5等模型成为数十亿人使用的产品,行业支出正从训练(制造模型)转向推理(服务模型)。这正中Google下怀。Nvidia的芯片在训练方面非常出色,但对于每天服务数百万次查询来说,它们是昂贵的过度配置。

“围墙花园”效应

Google的TPU只能通过Google Cloud获得。你不能买一个TPU放在自己的数据中心里。这迫使公司做出选择:与Nvidia保持灵活性(在AWS、Azure或本地部署),还是为了更好的经济性锁定在Google的生态系统中。

挑战与限制

尽管有这些规格,Nvidia不会消失。

  1. CUDA护城河:Nvidia的软件生态系统仍然遥遥领先。大多数AI研究人员是在CUDA上学习的。将代码移植到Google的JAX或TensorFlow可能是一件头疼的事。
  2. 可用性:你几乎可以从任何云提供商那里租用Nvidia GPU。TPU只有Google提供。
  3. 多功能性:如果你的工作负载发生变化,GPU大概能应对。TPU是专家工具;如果你的模型架构不契合其优势,性能可能会下降。

这对你意味着什么

如果你是AI初创公司:

  • 研发和训练坚持使用Nvidia。灵活性值这个价钱。
  • 如果达到规模,考虑将部署转移到TPU。50%的成本节约可能是盈利与破产之间的差别。

如果你是投资者:

  • 随着推理成为主导工作负载,Nvidia的利润率可能面临压力。
  • Google Cloud拥有尚未被完全定价的巨大结构性成本优势。

底线

这场”硅之战”不是一个芯片杀死另一个的问题;而是关于专业化。Nvidia Blackwell仍然是训练领域无可争议的王者,是创新的引擎。但Google的TPU已经征服了推理,即经济的引擎。

进入2026年,预计将看到一个分叉的市场:Nvidia拥有企业和研究云,而Google、AWS(Trainium)和Meta(MTIA)拥有超大规模计算商的内部工作负载。就目前而言,Google已经打响了一记96亿美元的警告:效率,而不仅仅是原始算力,才是AI的未来。

资料来源 (3)

Advertisement

🦋 Bluesky 讨论

在 Bluesky 上讨论

正在搜索帖子...