Link copiado!

CXL: A Falha de "RAM Infinita"

Se os limites de RAM forem atingidos, a única opção é "trapacear". A solução da indústria para a escassez não é apenas "fazer mais chips", mas sim um novo protocolo chamado CXL que finalmente dá aos servidores a capacidade de 'baixar mais RAM'.

🌐
Tradução automática

Este artigo foi traduzido automaticamente do original em inglês. Ler o original em inglês

Visualização futurística do agrupamento de memória CXL com fluxos de dados brilhantes conectando racks de servidores

Principais conclusões

  • A realidade do “download de RAM”: o CXL 3.0 permite que os servidores peguem emprestada memória de um pool compartilhado por meio de um barramento semelhante ao PCIe, resolvendo efetivamente as limitações de slots físicos.
  • Resolvendo o desperdício de 25%: até um quarto da memória do data center fica ociosa (“presa”) porque está bloqueada para uma CPU que não precisa dela. CXL libera essa capacidade. Física da Velocidade da Luz: Ao usar a sinalização PCIe 6.0 PHY e PAM-4, o CXL 3.0 atinge 64 GT/s, tornando a memória remota rápida o suficiente para parecer local.
  • O fim da placa-mãe: A indústria está caminhando em direção à “computação desagregada”, onde CPU, RAM e armazenamento são dispositivos separados conectados por luz e cobre.

Por décadas, o meme “download de uso de RAM” tem sido o teste definitivo para o conhecimento de informática. Você não pode baixar hardware. RAM é um stick físico de silício e capacitores, soldado ou encaixado diretamente ao lado da CPU porque a velocidade da luz é muito lenta para ser colocada em qualquer outro lugar.

Mas em 2025, a piada está se tornando realidade. A indústria atingiu um obstáculo: a contagem de núcleos de CPU está explodindo, mas o número de canais de memória que os engenheiros podem inserir em uma placa-mãe não está. Os processadores estão morrendo de fome.

Advertisement

Digite Compute Express Link (CXL), especificamente a revisão 3.0. É um protocolo que permite aos engenheiros quebrar as leis da arquitetura tradicional de servidores. Ao desacoplar a memória da CPU e colocá-la em um “pool” compartilhado, o CXL permite que um servidor acesse a memória localizada fisicamente em outra gaveta (ou mesmo em outro rack) em velocidades próximas o suficiente da DRAM local para que o software não consiga perceber a diferença.

É o mais próximo que os data centers chegarão de uma falha de “RAM infinita”. Aqui estão a física, a economia e a engenharia por trás da mudança de hardware mais importante da década.

Antecedentes: A crise da “memória perdida”

Para entender o CXL, você precisa entender o pesadelo econômico dos hiperescaladores modernos (como Google, AWS e Azure).

O imposto de 25%

Em um servidor tradicional, você compra uma CPU e preenche os slots com RAM. Se esse servidor executar uma tarefa de computação pesada que use 100% da CPU, mas apenas 10% da RAM, 90% dessa RAM será desperdiçada. Está “encalhado”. Ele não pode ser emprestado ao servidor vizinho que está travando porque ficou sem memória.

De acordo com uma pesquisa da Microsoft e da Marvell, aproximadamente 25% de toda a memória do data center fica ociosa a qualquer momento.

Wasted Capital=Total DRAM Spend×0.25\text{Wasted Capital} = \text{Total DRAM Spend} \times 0.25

Com as vendas de DRAM de servidor projetadas para atingir \US$ 40 bilhões até 2028, isso representa uma perda anual de \US$ 8 bilhões. Numa era em que os modelos de IA duplicam de tamanho a cada poucos meses, deixar tanta capacidade em cima da mesa é inaceitável.

Compreendendo o CXL 3.0: a física da trapaça

CXL não é um cabo novo; é um protocolo que funciona sobre a interface elétrica PCIe. Se PCIe é a estrada, CXL são as regras de trânsito que permitem que os carros (dados) dirijam na velocidade da Ferrari sem bater.

Advertisement

Como funciona: criando “coerência”

A mágica do CXL é Coerência de cache.

Normalmente, se um dispositivo (como uma GPU ou SSD) grava na memória, a CPU não sabe disso instantaneamente. A CPU pode estar mantendo uma cópia antiga desses dados em seu cache L1/L2. Essa incompatibilidade causa bugs. CXL apresenta três protocolos para corrigir isso:

  1. CXL.io: Descoberta e configuração (coisas PCIe básicas).
  2. CXL.cache: permite que dispositivos espionem o cache da CPU.
  3. CXL.mem: Permite que a CPU leia/grave na memória do dispositivo como se fosse a RAM do sistema.

O CXL 3.0 vai um passo além com Memory Pooling.

A matemática da largura de banda

O CXL 3.0 normalmente usa a camada física PCIe 6.0. Isso se baseia na sinalização PAM-4 (modulação de amplitude de pulso de 4 níveis). Em vez de enviar 0s e 1s (NRZ), ele envia quatro níveis de tensão (00, 01, 10, 11), efetivamente dobrando a taxa de transferência por clock.

Throughput=64 GT/s×16 lanes×256242(FEC overhead)128 GB/s\text{Throughput} = 64 \text{ GT/s} \times 16 \text{ lanes} \times \frac{256}{242} (\text{FEC overhead}) \approx 128 \text{ GB/s}

Embora seja mais lento do que o DDR5 local mais rápido (que pode enviar mais de 200 GB/s em vários canais), é rápido o suficiente para “memória de expansão” - a camada de RAM usada quando a alocação local é preenchida.

A Evolução: Por que o CXL 3.0 é a “Glitch”

Para entender por que o CXL 3.0 é uma revolução, a análise deve olhar para os seus antecessores.

  • CXL 1.0/1.1 era uma conexão ponto a ponto simples. Ele permitiu uma placa expansora de memória em um servidor e a CPU a veria. Útil, mas estático. Resolveu o problema da “capacidade de memória”, mas não o problema da “memória encalhada”.
  • CXL 2.0 introduziu a comutação. Como um switch de rede, os engenheiros poderiam conectar vários dispositivos a um único host ou particionar um dispositivo entre hosts. Este foi o nascimento do pooling, mas foi limitado a uma única hierarquia de “fan-out”.
  • CXL 3.0 é onde a física fica interessante. Ele apresenta “Tecidos”. Em vez de uma estrutura de árvore simples, os dispositivos podem se comunicar entre si em uma malha ponto a ponto. Uma GPU pode se comunicar diretamente com um cartão de memória CXL sem ativar a CPU. Isso reduz a latência e imita o comportamento de “RAM infinita” de um cluster localizado. Ele transforma todo o data center em uma placa-mãe gigante.

O mergulho profundo: desagregação e fabricação

As implicações disso vão além de apenas economizar dinheiro. Isso muda a forma como os servidores são construídos.

Advertisement

A morte da placa-mãe

Tradicionalmente, uma placa-mãe é um mapa estrito: 2 soquetes de CPU, 32 slots DIMM. Você vive e morre por esse mapa. Com o CXL, a “placa-mãe” se torna um “backplane”.

  • Gaveta 1: Apenas CPUs (Computação).
  • Gaveta 2: Apenas RAM (pool de memória).
  • Gaveta 3: Apenas GPUs (aceleradores).

Eles se conectam através de um switch CXL. Se o Servidor A precisar de 1 TB de RAM hoje para uma compilação massiva de banco de dados, o Switch o atribui. Se precisar de apenas 32 GB amanhã, o Switch recupera essa RAM e a entrega ao Servidor B para treinamento de IA.

Dispositivos Multilógicos (MLDs)

O CXL 3.0 introduz MLDs, permitindo que um único stick de memória CXL seja dividido e compartilhado entre até 16 hosts simultaneamente. Dentro do controlador de memória, uma unidade chamada Channel Management Unit (CHMU) atua como guarda de trânsito, garantindo que quando o Host A grava no endereço 0x100, ele não sobrescreve os dados do Host B no mesmo endereço físico (a menos que eles estejam compartilhando dados intencionalmente, que o CXL também suporta).

Impacto na indústria

Impacto no treinamento de IA

O treinamento de IA está vinculado à memória. As GPUs H100 e B200 são feras, mas muitas vezes estão famintas por dados. O CXL permite que pesos de modelo significativamente maiores sejam mantidos na “memória próxima”, reduzindo a necessidade de buscar dados de SSDs NVMe lentos.

Impacto nos preços da nuvem

Essa eficiência provavelmente levará a instâncias de “Spot RAM”. Assim como você pode comprar instâncias EC2 spot na AWS, em breve você poderá estourar dinamicamente sua capacidade de RAM por centavos de dólar, usando a capacidade ociosa do rack próximo a você.

Desafios e Limitações

  1. Penalidade de latência: A física é teimosa. Adicionar um switch e alguns metros de cabo adiciona nanossegundos. A memória CXL tem cerca de 170-250ns de latência, em comparação com 80-100ns para DRAM local. É uma memória “Tier 2” – mais rápida que os SSDs, mas mais lenta que a RAM local.
  2. Integridade do Sinal: A sinalização PAM-4 é frágil. A 64 GT/s, um sinal degrada após apenas alguns centímetros de rastreamento de PCB. São necessários retimers complexos e cabeamento de alta qualidade, aumentando o custo inicial.
  3. Suporte de software: Os sistemas operacionais precisam ser “compatíveis com CXL”. O kernel do sistema operacional deve ser inteligente o suficiente para colocar dados “quentes” na RAM local e dados “quentes” na RAM CXL (Tiering).

Análise prospectiva: a perspectiva de 5 anos

Curto Prazo: A Era Híbrida (2025-2026)

O mercado verá “Expansores CXL” – placas complementares que parecem SSDs, mas contêm RAM. Eles serão conectados a servidores padrão para adicionar 512 GB ou 1 TB de capacidade barata.

Médio Prazo: Arquitetura em Escala de Rack (2027+)

O chassi do servidor desaparecerá. Os hiperscaladores comprarão “Compute Bricks” e “Memory Bricks”. Os data centers se parecerão menos com fileiras de caixas de pizza e mais com enormes colmeias de recursos desagregados refrigerados a líquido.

O Horizonte da “Memória Infinita”

Eventualmente, os aplicativos não saberão onde está sua memória. Um aplicativo pode solicitar 100 TB de RAM, e a estrutura CXL irá remendá-lo a partir da capacidade ociosa em todo o piso do data center.

O resultado final

CXL é a admissão da indústria de que a Lei de Moore para pinos e fios terminou. Os engenheiros não conseguem enfiar mais fios em um soquete de CPU. Assim, os fabricantes pararam de tentar aumentar o tubo e, em vez disso, construíram um sistema de encanamento mais inteligente.

Para o usuário médio, isso significa serviços em nuvem mais baratos e rápidos. Para o engenheiro, significa o fim dos erros de “Sem Memória”. A RAM não é infinita, mas pela primeira vez na história é finalmente fluida.

Fontes (4)

Advertisement

🦋 Discussão no Bluesky

Discutir no Bluesky

Procurando publicações...