HeadlinesBriefing favicon HeadlinesBriefing.com

NVIDIA Rubin CPX AI Accelerator con memoria HBM4

TechPowerUp News •
×

NVIDIA ha revive su proyecto de acelerador AI Rubin CPX, ahora con memoria HBM4 en lugar de la GDDR7 planeada anteriormente. El analista de la cadena de suministro Ming Chi Kuo informó sobre el rediseño, señalando que el Rubin CPX fue pausado después de que NVIDIA anunciara sus planes para un acelerador especializado derivado de la familia de GPUs Rubin para cargas de IA agénticas a gran escala. El Rubin CPX rediseñado cuenta con 168 GB de memoria HBM4, una actualización respecto al plan original de 128 GB GDDR7.

Este SKU de GPU está alojado en un rack separado con configuraciones que van de 64 a 256 GPUs CPX independientes por rack. Esta GPU está dedicada a cargas de prefill, alimentando racks que gestionan el contexto de entrada para LLMs y el procesamiento de caché KV. NVIDIA está separando las tareas de prefill y decode, con las GPUs CPX manejando el prefill y las GPUs Rubin normales gestionando el decode.

Una bandeja de rack con ocho GPUs CPX puede manejar 1.34 TB de prefill de contexto largo y la caché KV asociada. Dado que el diseño anterior no requería la integración de HBM4, NVIDIA ha rediseñado el paquete, usando probablemente el Co Wo S-S o Co Wo S-L de TSMC para el empaquetado. La chipette delivers 30 Peta FLOPS de rendimiento de compute NVFP4 en un die monolítico.

Incluye cuatro codificadores NVENC y cuatro decodadores NVDEC de video integrados directamente en el chip. Para LLMs que ahora contienen trillones de parámetros, tener racks dedicados al prefill mientras otros manejan el decode permite una entrega de tokens mucho más rápida. NVIDIA también recomienda mantener una proporción 1:1 de GPUs CPX a GPUs normales en el rack de decode.