リンクをコピーしました!

CXL:「無限RAM」のグリッチ

RAMの制限に達した場合、唯一の選択肢は「ごまかす」ことです。業界の不足に対する解決策は、単に「より多くのチップを製造する」ことではなく、サーバーに「より多くのRAMをダウンロード」する機能をついに提供するCXLと呼ばれる新しいプロトコルです。

🌐
機械翻訳

この記事は英語の原文から自動翻訳されています。 英語の原文を読む

サーバーラックを接続する光るデータストリームを備えたCXLメモリープーリングの未来的な視覚化

重要なポイント

  • 「RAM のダウンロード」の現実: CXL 3.0 では、サーバーが PCIe のようなバスを介して共有プールからメモリを借用できるため、物理スロットの制限が効果的に解決されます。
  • 25% の無駄を解決: 必要のない CPU にロックされているため、データセンターのメモリの最大 4 分の 1 がアイドル状態 (「孤立」) になっています。 CXL はこの容量を解放します。
  • 光の物理速度: PCIe 6.0 PHY と PAM-4 シグナリングを使用することで、CXL 3.0 は 64 GT/s を達成し、リモート メモリがローカルに感じられるほど高速になります。
  • マザーボードの終わり: 業界は、CPU、RAM、ストレージが光と銅線で接続された個別のアプライアンスである「分離コンピューティング」に移行しています。

何十年もの間、「RAM のダウンロード使用量」というミームは、コンピューター リテラシーを問う究極のリトマス試験紙でした。ハードウェアをダウンロードすることはできません。 RAM はシリコンとコンデンサの物理的な棒で、光の速度が遅すぎて他の場所に置くことができないため、CPU の隣にはんだ付けまたはスロットで直接取り付けられます。

しかし、2025 年には、そのジョークが現実になりつつあります。業界は壁にぶつかっています。CPU コア数は爆発的に増加していますが、エンジニアがマザーボードに搭載できるメモリ チャネルの数は増加していません。プロセッサーが不足しています。

Compute Express Link (CXL)、具体的には 3.0 リビジョンを入力します。これは、エンジニアが従来のサーバー アーキテクチャの法則を破ることを可能にするプロトコルです。 CXL では、メモリを CPU から切り離し、共有「プール」に配置することで、1 台のサーバーが、ソフトウェアが違いを見分けられないほどローカル DRAM に近い速度で、別のドロワー (または別のラック) に物理的に配置されたメモリにアクセスできるようになります。

これは、データセンターが「Infinite RAM」の不具合に最も近い状況です。ここでは、この 10 年間で最も重要なハードウェアの変化の背後にある物理学、経済学、エンジニアリングについて説明します。

背景: 「記憶喪失」危機

CXL を理解するには、最新のハイパースケーラー (Google、AWS、Azure など) の経済的悪夢を理解する必要があります。

25%の税金

従来のサーバーでは、CPU を購入し、スロットに RAM を埋め込みます。そのサーバーが CPU を 100% 使用し、RAM を 10% しか使用しない計算負荷の高いタスクを実行すると、RAM の 90% が無駄になります。それは「立ち往生」です。メモリ不足でクラッシュしている隣のサーバーに貸すことはできません。

Microsoft と Marvell の調査によると、常に 全データセンター メモリの約 25% が取り残されています。

Wasted Capital=Total DRAM Spend×0.25\text{Wasted Capital} = \text{Total DRAM Spend} \times 0.25

サーバー DRAM の売上高は 2028 年までに 400 億ドルに達すると予測されており、これは 年間 80 億ドルの損失となります。 AI モデルのサイズが数か月ごとに 2 倍になる時代において、それだけの容量を残しておくことは受け入れられません。

CXL 3.0 を理解する: 不正行為の物理学

CXL は新しいケーブルではありません。これは、PCIe 電気インターフェイスの上に乗るプロトコルです。 PCIe が道路だとすると、CXL は車 (データ) が衝突することなくフェラーリの速度で走行できるようにする交通ルールです。

仕組み: 「一貫性」の作成

CXL の魅力は キャッシュ コヒーレンシーです。

通常、デバイス (GPU や SSD など) がメモリに書き込みを行っても、CPU はそれを即座に認識しません。 CPU は、そのデータの古いコピーを L1/L2 キャッシュに保持している可能性があります。この不一致によりバグが発生します。 CXL では、これを解決するために 3 つのプロトコルを導入しています。

  1. CXL.io: 検出と構成 (基本的な PCIe のもの)。
  2. CXL.cache: デバイスが CPU のキャッシュをスヌープできるようにします。
  3. CXL.mem: CPU がデバイスのメモリをシステム RAM であるかのように読み書きできるようにします。

CXL 3.0 では、メモリ プーリング によりこれをさらに一歩進めています。

帯域幅の計算

CXL 3.0 は通常、PCIe 6.0 物理層を使用します。これは PAM-4 (パルス振幅変調 4 レベル) シグナリングに依存します。 0 と 1 (NRZ) を送信する代わりに、4 つの電圧レベル (00、01、10、11) を送信し、クロックあたりのスループットを効果的に 2 倍にします。

Advertisement

Throughput=64 GT/s×16 lanes×256242(FEC overhead)128 GB/s\text{Throughput} = 64 \text{ GT/s} \times 16 \text{ lanes} \times \frac{256}{242} (\text{FEC overhead}) \approx 128 \text{ GB/s}

これは絶対最速のローカル DDR5 (複数のチャネルで 200 GB/秒以上を押し上げることができる) より遅いですが、「拡張メモリ」(ローカル割り当てがいっぱいになったときに使用される RAM 層) にとっては十分な速度です。

進化: CXL 3.0 が「グリッチ」である理由

CXL 3.0 が革命である理由を理解するには、その前任者を分析する必要があります。

  • CXL 1.0/1.1 は単純なポイントツーポイント接続でした。これにより、メモリ拡張カードをサーバーに挿入できるようになり、CPU がそれを認識できるようになります。便利ですが、静的です。 「メモリ容量」の問題は解決されましたが、「取り残されたメモリ」問題は解決されませんでした。
  • CXL 2.0 ではスイッチングが導入されました。ネットワーク スイッチと同様に、エンジニアは複数のデバイスを 1 つのホストに接続したり、デバイスをホスト間で分割したりできます。これはプーリングの誕生でしたが、それは単一の「ファンアウト」階層に限定されていました。
  • CXL 3.0 では、物理学が面白くなります。 「ファブリック」のご紹介です。単純なツリー構造の代わりに、デバイスはピアツーピア メッシュで相互に通信できます。 GPU は、CPU をウェイクアップせずに CXL メモリ スティックと直接通信できます。これにより、レイテンシーが短縮され、ローカライズされたクラスターの「無限 RAM」の動作が模倣されます。データセンター全体を 1 つの巨大なマザーボードに変えます。

詳細: 分解と製造

これがもたらす影響は単にお金を節約するだけではありません。サーバーの構築方法が変わります。

マザーボードの死

従来、マザーボードは、2 つの CPU ソケット、32 個の DIMM スロットという厳密なマップになっています。あなたはその地図に従って生き、そして死ぬのです。 CXL では、「マザーボード」が「バックプレーン」になります。

  • ドロワー 1: CPU (コンピューティング) のみ。
  • ドロワー 2: RAM (メモリ プール) のみ。
  • ドロワー 3: GPU (アクセラレータ) のみ。

CXL スイッチを介して接続します。現在、サーバー A が大規模なデータベースのコンパイルのために 1TB の RAM を必要としている場合、スイッチはそれを割り当てます。明日 32GB だけが必要な場合、スイッチはその RAM を再利用し、AI トレーニングのためにサーバー B に渡します。

マルチ論理デバイス (MLD)

CXL 3.0 では MLD が導入されており、単一の CXL メモリ スティックをスライスして最大 16 台のホスト間で同時に共有できるようになります。 メモリ コントローラーの内部では、チャネル管理ユニット (CHMU) と呼ばれるユニットが交通警察として機能し、ホスト A がアドレス 0x100 に書き込むときに、同じ物理アドレスにあるホスト B のデータが上書きされないようにします (意図的にデータを共有している場合を除き、CXL もサポートしています)。

業界への影響

AI トレーニングへの影響

AI トレーニングはメモリに依存します。 H100 および B200 GPU は強力ですが、データが不足していることがよくあります。 CXL を使用すると、大幅に大きなモデルの重みを「ニアメモリ」に保持できるため、低速な NVMe SSD からデータをフェッチする必要性が減ります。

クラウドの価格への影響

この効率性は、「スポット RAM」インスタンスにつながる可能性があります。 AWS でスポット EC2 インスタンスを購入できるのと同じように、すぐに、隣のラックの空き容量を使用して、1 ドルで RAM 容量を動的にバーストできるようになるかもしれません。

課題と限界

  1. レイテンシーペナルティ: 物理学は頑固です。スイッチと数フィートのケーブルを追加すると、ナノ秒が追加されます。 CXL メモリの遅延は約 170~250ns ですが、ローカル DRAM の遅延は 80~100ns です。これは「Tier 2」メモリであり、SSD より高速ですが、ローカル RAM よりは低速です。
  2. シグナルインテグリティ: PAM-4 シグナリングは脆弱です。 64 GT/s では、わずか数インチの PCB トレースの後で信号が低下します。複雑なリタイマーと高品質のケーブル配線が必要となり、初期費用が高くなります。
  3. ソフトウェア サポート: オペレーティング システムは「CXL 対応」である必要があります。 OS カーネルは、「ホット」データをローカル RAM に配置し、「ウォーム」データを CXL RAM に配置できるほど賢くなければなりません (階層化)。

将来予測分析: 5 年間の見通し

短期: ハイブリッド時代 (2025-2026)

市場には「CXL Expanders」、つまり SSD のように見えるが RAM を搭載したアドイン カードが登場することになります。これらは標準サーバーに接続され、512 GB または 1 TB の安価な容量を追加します。

中期: ラックスケール アーキテクチャ (2027 年以降)

サーバーシャーシが消えます。ハイパースケーラーは「コンピューティング・ブリック」と「メモリー・ブリック」を購入することになる。データセンターは、ピザの箱が並んでいるというよりは、細分化されたリソースが液冷で冷却された巨大な巣箱のように見えるでしょう。

「無限の記憶」の地平線

最終的には、アプリケーションはメモリがどこにあるのか分からなくなります。アプリケーションは 100 TB の RAM を要求する可能性があり、CXL ファブリックはデータセンター フロア全体で不足している容量からそれをまとめます。

結論

CXL は、ピンとワイヤに関するムーアの法則が終わったことを業界が認めたことを意味します。エンジニアは、CPU ソケットにこれ以上のワイヤを詰め込むことはできません。そのため、メーカーはパイプを大きくすることをやめ、代わりによりスマートな配管システムを構築しました。

平均的なユーザーにとって、これはより安価で高速なクラウド サービスを意味します。エンジニアにとって、これは「メモリ不足」エラーがなくなることを意味します。 RAM は無限ではありませんが、歴史上初めて、最終的には流動的になります。

出典 (4)

Advertisement

🦋 Bluesky での議論

Bluesky で議論する

投稿を検索中...