링크가 복사되었습니다!

구글의 핵 옵션: 엔비디아의 지배력을 깨기 위해 TPU 판매

구글은 메타와 애플에 직접 TPU를 판매하여 '폐쇄된 정원' 규칙을 깨고 있습니다. 이 분석에서는 Trillium OCS 아키텍처, 메타와의 거래, 그리고 이러한 변화가 엔비디아의 독점력을 위협하는 이유를 다룹니다.

🌐
기계 번역

이 기사는 영어 원문에서 자동 번역되었습니다. 영어 원문 읽기

파란색으로 빛나는 구글 TPU 랙이 유리 벽을 깨고 나와 녹색 엔비디아 거석에 도전합니다.

“Walled Garden”이 공식적으로 무너졌습니다. 10년 동안 Google의 TPU(텐서 처리 장치)는 AI 세계에서 금지된 과일이었습니다. Google Cloud 내에서 빌려서 AlphaGo와 Gemini를 훈련시키는 동안 멀리서 그들의 힘을 관찰할 수는 있지만 결코 소유할 수는 없습니다. 확실히 자신의 데이터 센터에 설치할 수는 없습니다.

그 규칙이 깨졌습니다.

1조 달러 규모의 AI 시장의 구조적 변화를 알리는 움직임으로, 새로운 보고서에 따르면 Google은 TPU를 임대하고 궁극적으로 Meta 및 잠재적으로 Apple에 직접 판매하는 계약을 마무리하고 있다고 합니다. 이는 단순한 공급업체 계약이 아닙니다. 이는 Nvidia의 갑옷에 대한 최초의 실제 균열이자 Google의 자체 소프트웨어 생태계를 구하기 위한 필사적이고 눈부신 움직임입니다.

Nvidia 주식을 보유하고 있거나 AI 인프라 전략을 구축하고 있다면 이 결정을 이끈 물리학, 경제, 소프트웨어 전쟁을 이해해야 합니다.

뉴스: 이상한 동료들

전략적 정렬이 명확합니다. Meta(Facebook)는 세계에서 가장 열렬한 Nvidia H100 소비자였으며 600,000개 이상의 제품을 축적했습니다. 그러나 Mark Zuckerberg는 CUDA 잠금 및 고마진 하드웨어에 지불되는 프리미엄인 “Nvidia 세금”에서 벗어나고 싶다는 열망을 공개적으로 밝혔습니다.

업계의 깊은 속삭임과 보고서에 따르면:

  • 거래: Meta는 처음에는 Google에서 호스팅했지만 Google의 공용 클라우드에서 완전히 분할된 ‘베어메탈’ TPU 인스턴스(예: Trillium v6)에 액세스할 수 있게 됩니다.
  • 로드맵: 2027년까지 프레임워크를 통해 Meta는 Google이 아닌 자체 데이터 센터에 설치하기 위해 TPU Pod를 완전히 구매할 수 있습니다.
  • 애플 요인: “Apple Intelligence”를 위한 대규모 컴퓨팅이 필요하지만 Microsoft와 같은 경쟁업체에 의존하거나 Nvidia의 마진을 지불하는 데 알레르기가 있는 것으로 유명한 Apple에서도 유사한 논의가 진행되고 있습니다.

이로 인해 공급/수요 방정식이 하룻밤 사이에 변경됩니다. Meta가 TPU로 전환했기 때문에 Nvidia 공급량의 20% 구매를 중단하면 Nvidia의 가격 결정력을 뒷받침하는 희소성이 증발합니다.

Advertisement

기술 심층 분석: 빛과 구리의 물리학

Nvidia Blackwell B200이 “세계에서 가장 강력한 칩”인데 왜 Meta가 TPU를 원하겠습니까? 답은 칩 자체에 있는 것이 아니라 전선에 있습니다. 아니면 오히려 그것들이 부족합니다.

OCS의 장점(광회로 스위칭)

Nvidia의 SuperPOD는 매우 빠르지만 전통적인 전기 스위칭 네트워크인 InfiniBand를 사용합니다. 100,000개의 GPU를 연결하려면 전자를 광자로 지속적으로 변환하는 수 마일의 구리와 활성 전기 스위치가 필요합니다.

TPU v4 이후 배포된 Google의 비밀 무기는 **광 회로 스위치(OCS)**를 기반으로 하는 Palomar(현재는 Jupiter)입니다.

라우터가 패킷을 읽고 버퍼링한 후 어디로 가는지 결정하고 다시 전송하는 디지털 패킷 교환 대신 Google에서는 **MEMS(Micro-Electro-Mechanical Systems)**를 사용합니다. 이는 한 서버에서 다른 서버로 광선을 반사시키기 위해 물리적으로 회전하는 작고 미세한 거울입니다.

물리학의 승리:

  1. 빛의 속도: 광-전기 변환이 없습니다. 빛이 튀기만 합니다.
  2. 전력 제로: 거울의 위치를 ​​유지하려면 제로 전력이 필요합니다. 이동(재구성)할 때만 전력을 소비합니다. 전기 스위치는 포트를 활성 상태로 유지하기 위해 연중무휴 24시간 엄청난 전력을 소비합니다.
  3. 토폴로지에 구애받지 않음: Google은 밀리초 안에 네트워크를 물리적으로 다시 연결할 수 있습니다. 훈련 작업 A에 “토러스” 모양이 더 좋고 추론 작업 B에 “잠자리” 모양이 더 나은 경우 거울은 기울어지고 슈퍼컴퓨터는 물리적으로 다시 배선됩니다.

효율성 수학

Nvidia가 원시 FLOP를 쫓는 반면 Google은 성능/TCO를 쫓습니다. Trillium(v6) TPU는 주로 이러한 상호 연결 효율성 덕분에 v5e에 비해 67% 에너지 효율성이 향상되었다고 주장합니다.

이론적인 냉각 수학을 살펴보겠습니다. 전기 스위치는 열을 발생시킵니다. 그 열기를 식혀야 합니다. OCS 스위치는 열이 거의 발생하지 않습니다.

Total Power=Compute Power+Cooling Power+Networking Power\text{Total Power} = \text{Compute Power} + \text{Cooling Power} + \text{Networking Power}

Nvidia 클러스터에서 네트워킹 성능은 전체 클러스터 사용량의 15-20%가 될 수 있습니다. TPU Pod에서 OCS는 네트워킹 전력 소비를 거의 95% 줄입니다. 100MW 데이터 센터에서 이러한 효율성 차이는 동일한 전력 범위에 30% 더 많은 컴퓨팅을 적용할 수 있음을 의미합니다. Meta의 경우 Llama 5를 교육하는 것은 수십억 달러의 가치가 있습니다.

소프트웨어 전쟁: JAX 대 CUDA

월스트리트가 놓치고 있는 부분이 바로 이것이다. 구글은 단지 하드웨어 수익을 원하기 때문에 칩을 판매하는 것이 아닙니다. JAX를 구하기 위해 칩을 판매하고 있습니다.

Advertisement

CUDA 해자

Nvidia의 독점은 하드웨어가 아닙니다. 그것은 소프트웨어입니다. 모두가 CUDA로 코드를 작성합니다(PyTorch를 통해). 모두가 CUDA를 사용하기 때문에 모두가 Nvidia를 구입합니다. 그것은 자기 강화 루프입니다.

Google의 JAX

Google의 내부 언어인 JAX는 고급 물리학 및 어려운 수학 분야에서 틀림없이 우수합니다. XLA(Accelerated Linear Algebra) 컴파일러에 맞게 자동으로 최적화됩니다. 그러나 DeepMind와 전문 연구자 외에는 채택률이 낮습니다.

TPU를 Meta의 손에 넘겨줌으로써 Google은 Google 외부 세계 최고인 Meta의 엔지니어들에게 XLA용 PyTorch를 최적화하도록 강요하고 있습니다.

  • PyTorch가 TPU(XLA를 통해)에서 완벽하게 실행되면 “CUDA Moat”가 모래로 채워집니다.
  • 갑자기 AMD 칩(XLA/ROCm도 실행)이 실행 가능해졌습니다.
  • Intel Gaudi가 실행 가능해졌습니다.
  • 전체 생태계는 Nvidia에서 분리됩니다.

맥락적 역사: 10년의 비밀

Google은 2017년에 Transformer 아키텍처(GPT의 “T”)를 발명했습니다. 그들은 2015년에 최초의 TPU를 구축했습니다. 몇 년 앞서 있었습니다. 그들은 왜 졌습니까?

  • 2016(TPU v1): 순수 추론용으로 제작되었습니다(AlphaGo 실행).
  • 2018(TPU v2/v3): 훈련의 짐승. 액체 냉각. 하지만 구글은 이를 클라우드에 묶어두었습니다. “칩을 원한다면 클라우드를 사용해야 합니다.”
  • 2020-2023(The Hubris): Google은 하드웨어 이점이 무한하다고 가정했습니다. 그들은 칩을 팔지 않았습니다.
  • 2024(The Panic): Microsoft와 OpenAI가 Nvidia GPU를 사용하여 선두를 차지했습니다. AWS는 Trainium을 구축했습니다.
  • 2025(The Pivot): Google은 ‘클라우드 독점’이 사형 선고임을 깨달았습니다. 개발자는 칩이 있는 곳으로 갑니다. 칩이 어디에나 있지 않으면 개발자는 떠납니다.

이번 매각은 전략 실패를 인정한 것이지만 회복에는 천재적인 일격이다.

재무 분석: “Nvidia 세금” 계산

Meta가 이 거래를 수락하는 이유에 대해 숫자로 살펴보겠습니다.

Nvidia 마크업:

  • H100 제조원가(TSMC + CoWoS + HBM) : ~$3,000 - $4,000
  • H100 세일가격 : ~$25,000 - $30,000
  • 마진: ~85%

TPU 경제학: Google은 TPU를 자체적으로 설계하고 백엔드 설계에 Broadcom을 사용합니다. 그들은 메타에서 85%의 마진을 만들 필요가 없습니다. 그들은 TPU를 $15,000에 판매하고, 50%의 건전한 수익을 창출하면서도 여전히 Nvidia에 비해 50% 할인을 Meta에 제공할 수 있습니다.

100,000개 칩 클러스터의 경우:

  • Nvidia 비용: $30억
  • TPU 비용: 15억 달러

절감: 15억 달러. 이는 데이터 센터의 전체 냉각 인프라에 대한 비용을 지불합니다.

미래 예측 분석: 칩 얼라이언스

이러한 움직임은 효과적으로 “반 Nvidia 동맹”을 형성합니다.

  1. Google: 하드웨어 수익 창출 + JAX 관련성 유지 + 최대 라이벌(Nvidia)에 타격을 입힙니다.
  2. 메타/애플: Nvidia와 더 낮은 가격을 협상하기 위한 견인력을 얻고 공급망 효율성을 다각화합니다.
  3. Amazon: 이미 Trainium이 있으며 이제 Nvidia가 아닌 경로의 유효성이 확인됩니다.

시장 영향: 업계는 독점(Nvidia가 90% 점유율)에서 과점(Nvidia, Google, AWS, AMD)으로 이동하고 있습니다.

  • 단기(1~2년): Nvidia가 여전히 왕입니다. 공급 잔고가 너무 길고 소프트웨어 포팅에 시간이 걸립니다.
  • 중기(3-5년): 마진이 압축됩니다. 이 특정 뉴스는 Nvidia가 누리고 있는 80%의 총 마진이 정점에 도달할 가능성이 높다는 신호입니다.

평결: 하드웨어는 실제입니다. 물리(OCS)는 특정 워크로드에 탁월합니다. Google이 공급품을 제공할 수 있다면 “Code Red”는 더 이상 Google만을 위한 것이 아닙니다. Jensen Huang을 위한 것입니다.

출처 (4)

Advertisement

🦋 Bluesky 토론

Bluesky에서 토론하기

게시물 검색 중...