O “Jardim Murado” caiu oficialmente. Por uma década, as Unidades de Processamento Tensor (TPUs) do Google foram o fruto proibido do mundo da IA. Você poderia alugá-los dentro do Google Cloud, observar seu poder à distância enquanto treinavam AlphaGo e Gemini, mas nunca poderia possuí-los. Você certamente não poderia instalá-los em seu próprio data center.
Essa regra simplesmente quebrou.
Em um movimento que sinaliza uma mudança estrutural no mercado de IA de trilhões de dólares, relatórios emergentes indicam que o Google está finalizando acordos para alugar e eventualmente vender TPUs diretamente para a Meta e potencialmente para a Apple. Este não é apenas um acordo com fornecedores; é a primeira brecha real na armadura da Nvidia e uma jogada desesperada e brilhante do Google para salvar seu próprio ecossistema de software.
Se você possui ações da Nvidia ou está construindo uma estratégia de infraestrutura de IA, precisa entender a física, a economia e as guerras de software que impulsionaram essa decisão.
As notícias: companheiros estranhos
O alinhamento estratégico é claro. Meta (Facebook) tem sido o consumidor mais voraz do mundo de Nvidia H100s, acumulando mais de 600.000 deles. Mas Mark Zuckerberg tem sido aberto sobre seu desejo de se libertar do “imposto Nvidia”: o prêmio pago pelo aprisionamento CUDA e hardware de alta margem.
De acordo com rumores e relatórios profundos da indústria:
- O acordo: Meta terá acesso a instâncias de TPU “bare metal” (provavelmente Trillium v6) inicialmente hospedadas pelo Google, mas completamente particionadas da nuvem pública do Google.
- O roteiro: até 2027, a estrutura permitirá que a Meta compre pods de TPU diretamente para instalação em seus próprios data centers que não sejam do Google.
- O Fator Apple: Discussões semelhantes estão ocorrendo com a Apple, que precisa de computação massiva para a “Inteligência Apple”, mas é notoriamente alérgica a confiar em concorrentes como a Microsoft ou a pagar as margens da Nvidia.
Isto muda a equação oferta/demanda da noite para o dia. Se a Meta parar de comprar 20% do fornecimento da Nvidia porque mudou para TPUs, a escassez que sustenta o poder de precificação da Nvidia evaporará.
Aprofundamento Técnico: A Física da Luz versus Cobre
Por que a Meta iria querer um TPU quando a Nvidia Blackwell B200 é o “chip mais poderoso do mundo”? A resposta não está no chip em si: está nos fios. Ou melhor, a falta deles.
A vantagem OCS (comutação de circuito óptico)
Os SuperPODs da Nvidia contam com InfiniBand, uma rede de comutação elétrica extremamente rápida, mas tradicional. Para conectar 100.000 GPUs, você precisa de quilômetros de cobre e interruptores elétricos ativos que convertem constantemente elétrons em fótons e vice-versa.
A arma secreta do Google, implantada desde a TPU v4, é Palomar (e agora Júpiter), baseada em Optical Circuit Switches (OCS).
Em vez de comutação digital de pacotes: onde um roteador lê um pacote, armazena-o em buffer, decide para onde ele vai e o retransmite: o Google usa MEMS (sistemas microeletromecânicos). Estes são pequenos espelhos microscópicos que giram fisicamente para refletir um feixe de luz de um servidor para outro.
A Física vence:
- Velocidade da Luz: Não há conversão óptica para elétrica. A luz simplesmente salta.
- Potência Zero: Um espelho requer potência zero para manter sua posição. Ele só consome energia quando se move (reconfigura). Um interruptor elétrico consome muita potência 24 horas por dia, 7 dias por semana, apenas para manter as portas ativas.
- Topologia Agnóstica: o Google pode reconectar fisicamente a rede em milissegundos. Se uma forma de “Toro” for melhor para o Trabalho de Treinamento A, e uma forma de “Libélula” for melhor para o Trabalho de Inferência B, os espelhos apenas se inclinam e o supercomputador é fisicamente reconectado.
A matemática da eficiência
Enquanto a Nvidia busca FLOPs brutos, o Google busca Desempenho/TCO. A TPU Trillium (v6) afirma uma melhoria de 67% na eficiência energética em relação à v5e, em grande parte devido a essa eficiência de interconexão.
Vejamos a matemática teórica do resfriamento. Interruptores elétricos geram calor. Esse calor deve ser resfriado. Os interruptores OCS quase não geram calor.
Em um cluster Nvidia, o poder da rede pode ser de 15 a 20% do consumo total do cluster. Em um pod de TPU, o OCS reduz o consumo de energia da rede em quase 95%. Em um data center de 100 MW, esse delta de eficiência significa que você pode encaixar 30% mais computação no mesmo envelope de energia. Para Meta, treinar Llama 5 vale bilhões.
A guerra do software: JAX vs.
Esta é a parte que Wall Street sente falta. O Google não está vendendo chips apenas porque deseja receita com hardware. É vender fichas para economizar JAX.
O fosso CUDA
O monopólio da Nvidia não é hardware; é um software. Todos codificam em CUDA (via PyTorch). Como todo mundo usa CUDA, todo mundo compra Nvidia. É um ciclo de auto-reforço.
JAX do Google
A linguagem interna do Google, JAX, é indiscutivelmente superior para física avançada e matemática pesada. Ele otimiza automaticamente para o compilador XLA (Accelerated Linear Algebra). Mas fora da DeepMind e de pesquisadores especializados, a adoção é baixa.
Ao colocar TPUs nas mãos da Meta, o Google está forçando os engenheiros da Meta, os melhores do mundo fora do Google, a otimizar o PyTorch para XLA.
- Se o PyTorch funcionar perfeitamente em TPUs (via XLA), o “CUDA Moat” se encherá de areia.
- De repente, os chips AMD (que também rodam XLA/ROCm) tornam-se viáveis.
- Intel Gaudi torna-se viável.
- Todo o ecossistema se separa da Nvidia.
História Contextual: Uma Década de Segredos
O Google inventou a arquitetura Transformer (o “T” em GPT) em 2017. Eles construíram a primeira TPU em 2015. Eles estavam anos à frente. Por que eles perderam?
- 2016 (TPU v1): Construído exclusivamente para inferência (executando AlphaGo).
- 2018 (TPU v2/v3): As feras do treinamento. Resfriado por líquido. Mas o Google os manteve trancados na nuvem. “Se alguém quer o chip, deve usar a nuvem”.
- 2020-2023 (The Hubris): O Google presumiu que sua vantagem de hardware era infinita. Eles não venderam as fichas.
- 2024 (The Panic): Microsoft e OpenAI assumiram a liderança usando GPUs Nvidia. AWS construiu o Trainium.
- 2025 (The Pivot): O Google percebe que “Exclusividade na nuvem” é uma sentença de morte. Os desenvolvedores vão onde estão os chips. Se os chips não estiverem em todos os lugares, os desenvolvedores vão embora.
Esta venda é uma admissão de fracasso estratégico, mas um golpe de gênio na recuperação.
Análise Financeira: O Cálculo do “Imposto Nvidia”
Vamos analisar por que a Meta está aceitando esse acordo.
A marcação da Nvidia:
- Custo de fabricação do H100 (TSMC + CoWoS + HBM): ~$3.000 - $4.000
- Preço de venda do H100: ~$25.000 - $30.000
- Margem: ~85%
A Economia da TPU: O Google projeta a TPU internamente e usa a Broadcom para design de back-end. Eles não precisam ter uma margem de 85% no Meta. Eles podem vender a TPU por $15.000, obter um lucro saudável de 50% e ainda oferecer à Meta um desconto de 50% em relação à Nvidia.
Para um cluster de 100.000 fichas:
- Custo da Nvidia: $3 bilhões
- Custo de TPU: \US$ 1,5 bilhão
Economia: \US$ 1,5 bilhão. Isso paga toda a infraestrutura de refrigeração do data center.
Análise prospectiva: The Chip Alliance
Este movimento cria efetivamente uma “Aliança Anti-Nvidia”.
- Google: resulta em receita de hardware + economiza relevância JAX + prejudica seu maior rival (Nvidia).
- Meta/Apple: ganha força para negociar preços mais baixos com a Nvidia e diversifica a eficiência da cadeia de suprimentos.
- Amazon: Já tem Trainium, agora vê validação do caminho não-Nvidia.
O impacto no mercado: A indústria está passando de um Monopólio (a Nvidia tem 90% de participação) para um oligopólio (Nvidia, Google, AWS, AMD).
- Curto Prazo (1-2 anos): A Nvidia continua rei. A lista de pendências de fornecimento é muito longa e o software leva tempo para ser transferido.
- Médio Prazo (3-5 anos): Margens comprimidas. Esta notícia específica é o sinal de que as margens brutas de 80% de que a Nvidia desfruta estão provavelmente atingindo o pico.
Veredicto: O hardware é real. A física (OCS) é superior para cargas de trabalho específicas. Se o Google puder entregar o fornecimento, o “Código Vermelho” não será mais apenas para o Google – será para Jensen Huang.
Fontes (4)
- datacenterdynamics.com Google Offers TPUs to AI Cloud Providers
- cloud.google.com Google Trillium Architecture
- cloud.google.com TPU v4 Enables Performance, Energy, and CO2e Efficiency Gains
- newsletter.semianalysis.com Analysis: The Nvidia Tax and Custom Silicon
🦋 Discussão no Bluesky
Discutir no Bluesky