HeadlinesBriefing favicon HeadlinesBriefing.com

Acelerador AI NVIDIA Rubin CPX com memória HBM4

TechPowerUp News •
×

NVIDIA reviveu seu projeto de acelerador AI Rubin CPX, agora com memória HBM4 em vez da GDDR7 planejada anteriormente. O analista de cadeia de suprimentos Ming Chi Kuo relatou o redesign, observando que o Rubin CPX foi pausado após a NVIDIA anunciar seus planos para um acelerador especializado derivado da família de GPUs Rubin para cargas de IA agentic em grande escala. O Rubin CPX redesignado possui 168 GB de memória HBM4, uma melhoria em relação ao plano original de 128 GB GDDR7.

Este SKU de GPU está alojado em um rack separado com configurações variando de 64 a 256 GPUs CPX independentes por rack. Esta GPU é dedicada a cargas de prefill, alimentando racks que gerenciam o contexto de entrada para LLMs e processamento de cache KV. A NVIDIA está separando as tarefas de prefill e decode, com GPUs CPX tratando do prefill e GPUs Rubin normais gerenciando o decode.

Uma bandeja de rack com oito GPUs CPX pode lidar com 1,34 TB de prefill de contexto longo e o cache KV associado. Como o design anterior não exigia integração de HBM4, a NVIDIA redesenhou o pacote, provavelmente usando o Co Wo S-S ou Co Wo S-L da TSMC para embalagem. O chip delivers 30 Peta FLOPS de desempenho de computação NVFP4 em um die monolítico.

Inclui quatro codificadores NVENC e quatro decodificadores NVDEC de vídeo integrados diretamente no chip. Para LLMs agora contendo trilhões de parâmetros, ter racks dedicados ao prefill enquanto outros tratam do decode permite uma entrega de tokens muito mais rápida. A NVIDIA também recomenda manter uma razão de 1:1 entre GPUs CPX e GPUs normais no rack de decode.