リンクをコピーしました!

グーグルの核オプション:Nvidiaの支配を打ち破るためにTPUを販売

Googleは、MetaとAppleにTPUを直接販売することで、「閉鎖された庭」ルールを破っています。この分析では、Trillium OCSアーキテクチャ、Metaとの取引、そしてこのシフトがNvidiaの独占を脅かす理由について説明します。

🌐
機械翻訳

この記事は英語の原文から自動翻訳されています。 英語の原文を読む

青く光るGoogle TPUラックがガラスの壁を破って、緑色のNvidiaモノリスに挑戦する

「ウォールド・ガーデン」は正式に崩壊した。 10 年間、Google の Tensor Processing Unit (TPU) は AI の世界における禁断の果実でした。 Google Cloud 内でそれらをレンタルし、AlphaGo や Gemini を訓練するときにその力を遠くから観察することはできますが、それらを所有することはできません。確かに、自社のデータセンターにそれらをインストールすることはできません。

そのルールが壊れてしまったのです。

兆ドル規模の AI 市場の構造変化を示唆する動きとして、新たな報道によると、Google は TPU を Meta と、場合によっては Apple に直接レンタルし、最終的には販売する契約を締結しているとのことです。これは単なるサプライヤー契約ではありません。これは Nvidia の鎧の最初の本当のひび割れであり、Google が自社のソフトウェア エコシステムを救おうとした必死の素晴らしい行動です。

Nvidia 株を保有している場合、または AI インフラストラクチャ戦略を構築している場合は、この決定を引き起こした物理学、経済学、およびソフトウェア戦争を理解する必要があります。

ニュース: 奇妙なベッド仲間たち

戦略的な連携は明らかだ。 Meta (Facebook) は世界で最も貪欲な Nvidia H100 の消費者であり、600,000 台を超える Nvidia H100 を蓄積しています。しかし、マーク・ザッカーバーグ氏は、CUDA ロックインと利益率の高いハードウェアに支払われるプレミアムである「NVIDIA 税」から解放されたいという願望を公言しています。

業界の深い噂やレポートによると、次のようになります。

  • 取引: Meta は、当初 Google によってホストされていたが、Google のパブリック クラウドから完全に分割されていた「ベアメタル」TPU インスタンス (おそらく Trillium v6) にアクセスできるようになります。
  • ロードマップ: 2027 年までに、このフレームワークにより、Meta は TPU ポッドを完全に購入して、Google 以外の自社のデータ センターに設置できるようになります。
  • Apple の要因: Apple についても同様の議論が行われています。Apple は、「Apple Intelligence」のために大規模なコンピューティングを必要としていますが、Microsoft などの競合他社に依存したり、Nvidia にマージンを支払ったりすることにアレルギーがあることで有名です。

これにより、需要と供給の関係が一夜にして変化します。 Meta が TPU に切り替えたことを理由に Nvidia の供給量の 20% の購入を中止した場合、Nvidia の価格決定力を支える希少性は蒸発します。

技術的な詳細: 光の物理学と銅の物理学

Nvidia Blackwell B200 が「世界で最も強力なチップ」であるにもかかわらず、Meta はなぜ TPU を必要とするのでしょうか?答えはチップ自体にあるのではなく、ワイヤーにあります。あるいはむしろ、それらが不足しているのです。

OCS の利点 (光回路スイッチング)

Nvidia の SuperPOD は、非常に高速だが従来型の電気スイッチング ネットワークである InfiniBand に依存しています。 100,000 個の GPU を接続するには、何マイルもの銅線と、電子を光子に変換し、またその逆に常に変換するアクティブな電気スイッチが必要です。

TPU v4 以降に導入された Google の秘密兵器は、光回路スイッチ (OCS) をベースにした Palomar (そして現在は Jupiter) です。

デジタル パケット スイッチングの代わりに、ルーターがパケットを読み取ってバッファリングし、送信先を決定して再送信します。Google は MEMS (Micro-Electro-Mechanical Systems) を使用します。これらは、物理的に回転して光ビームをあるサーバーから別のサーバーに反射する小さな微細なミラーです。

物理学の勝利:

  1. 光の速度: 光から電気への変換はありません。光が反射するだけです。
  2. 電力ゼロ: ミラーがその位置を保持するために必要な電力は ゼロ です。移動(再構成)するときのみ電力を消費します。電気スイッチは、ポートをアクティブに保つためだけに 24 時間年中無休で大量のワット数を消費します。
  3. トポロジに依存しない: Google はミリ秒単位でネットワークを物理的に再配線できます。トレーニング ジョブ A には「トーラス」形状が適しており、推論ジョブ B には「ドラゴンフライ」形状が適している場合、ミラーが傾くだけで、スーパーコンピューターは物理的に再配線されます。

効率の計算

Nvidia が生の FLOP を追いかける一方で、Google は パフォーマンス/TCO を追いかけています。 Trillium (v6) TPU は、主にこの相互接続効率により、v5e と比較して 67% エネルギー効率が向上すると主張しています。

理論的な冷却の計算を見てみましょう。電気スイッチは熱を発生します。その熱を冷やさなければなりません。 OCS スイッチはほとんど熱を発生しません。

Total Power=Compute Power+Cooling Power+Networking Power\text{Total Power} = \text{Compute Power} + \text{Cooling Power} + \text{Networking Power}

Nvidia クラスターでは、ネットワーク電力がクラスター全体の消費量の 15 ~ 20% になる可能性があります。 TPU ポッドでは、OCS によりネットワーク消費電力がほぼ 95% 削減されます。 100MW データセンターでは、その効率デルタは、同じ電力エンベロープ内に 30% 多くのコンピューティングを適用できることを意味します。メタにとって、ラマ 5 を訓練することは数十億ドルの価値があります。

Advertisement

ソフトウェア戦争: JAX 対 CUDA

これはウォール街が見逃している部分だ。 Googleはハードウェア収入が欲しいからチップを売っているだけではない。 JAX を救うためにチップを販売しています。

CUDA 堀

Nvidia の独占はハードウェアではありません。それはソフトウェアです。全員が CUDA でコーディングします (PyTorch 経由)。誰もが CUDA を使用しているため、誰もが Nvidia を購入します。それは自己強化ループです。

Google の JAX

Google の内部言語である JAX は、高度な物理学や複雑な数学においては間違いなく優れています。 XLA (Accelerated Linear Algebra) コンパイラ用に自動的に最適化されます。しかし、DeepMind と専門の研究者以外では、採用率は低いです。

TPU を Meta の手に渡すことで、Google は、Google 以外では世界最高の Meta のエンジニアに PyTorch for XLA の最適化を強制しています。

  • PyTorch が TPU 上で (XLA 経由で) 完全に動作する場合、「CUDA モート」は砂で埋められます。
  • 突然、AMD チップ (XLA/ROCm も実行される) が実行可能になります。
  • Intel Gaudi が実行可能になります。
  • エコシステム全体が Nvidia から切り離されます。

文脈の歴史: 10 年間の秘密

Google は 2017 年に Transformer アーキテクチャ (GPT の「T」) を発明しました。彼らは 2015 年に最初の TPU を構築しました。彼らは何年も先を行っていました。なぜ彼らは負けたのでしょうか?

  • 2016 (TPU v1): 純粋に推論用に構築されています (AlphaGo を実行)。
  • 2018 (TPU v2/v3): 訓練中の獣。液体を冷却した。しかし、Google はそれらをクラウドに閉じ込めたままにしました。 「チップが欲しいなら、クラウドを使わなければなりません。」
  • 2020-2023 (ハブリス): Google はハードウェアの優位性が無限であると想定していました。チップスは売っていませんでした。
  • 2024 (パニック): Microsoft と OpenAI が Nvidia GPU を使用して主導権を握りました。 AWS は Trainium を構築しました。
  • 2025 (ピボット): Google は、「クラウド独占」が死刑宣告であることを認識しました。開発者はチップがあるところへ行きます。チップがどこにもない場合、開発者は去ります。

今回の売却は戦略の失敗を認めたものの、回復においては天才的な一打だった。

財務分析: 「NVIDIA 税」の計算

なぜMetaがこの取引に応じたのか、数字を計算してみましょう。

Nvidia マークアップ:

  • H100 製造コスト (TSMC + CoWoS + HBM): ~\3,000 - $4,000
  • H100 販売価格: ~$25,000 - $30,000
  • マージン: ~85%

TPU の経済学: Google は TPU を社内で設計し、バックエンドの設計には Broadcom を使用しています。メタに対して 85% のマージンを確保する必要はありません。彼らは TPU を \15,000 で販売し、50% の健全な利益を上げながら、Meta に Nvidia と比較して 50% 割引を提供できます。

100,000 チップのクラスターの場合:

  • NVIDIA のコスト: 30 億ドル
  • TPU コスト: 15 億ドル

節約: 15 億ドル。これにより、データセンターの冷却インフラストラクチャ全体の費用が賄えます。

将来を見据えた分析: チップ アライアンス

この動きは事実上「反NVIDIA同盟」を創設することになる。

  1. Google: ハードウェア収益をもたらし、JAX 関連性を節約し、最大のライバル (Nvidia) に損害を与えます。
  2. メタ/アップル: Nvidia との値下げ交渉の推進力を獲得し、サプライ チェーンの効率を多様化します。
  3. Amazon: すでに Trainium がありますが、非 Nvidia パスの検証が行われるようになりました。

市場への影響: 業界は 独占 (Nvidia が 90% シェア) から 寡占 (Nvidia、Google、AWS、AMD) に移行しつつあります。

  • 短期 (1 ~ 2 年): Nvidia が王であり続けます。供給のバックログが長すぎるため、ソフトウェアの移植に時間がかかります。
  • 中期 (3 ~ 5 年): 利益率は圧縮されます。この具体的なニュースは、Nvidia が享受している 80% の粗利益率がピークに達している可能性が高いことを示しています。

評決: ハードウェアは本物です。物理学 (OCS) は、特定のワークロードに対して優れています。 Google が供給できれば、「Code Red」はもはや Google だけのものではなく、ジェンセン ファンのものになります。

出典 (4)

Advertisement

🦋 Bluesky での議論

Bluesky で議論する

投稿を検索中...