HeadlinesBriefing favicon HeadlinesBriefing.com

Accélérateur AI NVIDIA Rubin CPX avec mémoire HBM4

TechPowerUp News •
×

NVIDIA a relancé son projet d'accélérateur AI Rubin CPX, maintenant avec de la mémoire HBM4 à la place de la GDDR7 initialement planifiée. L'analyste de la chaîne d'approvisionnement Ming Chi Kuo a signalé la refonte, notant que le Rubin CPX avait été mis en pause après que NVIDIA a annoncé ses plans pour un accélérateur dérivé de la famille de GPUs Rubin pour les charges de travail IA agentic à grande échelle. Le Rubin CPX refait comporte 168 Go de mémoire HBM4, une amélioration par rapport au plan original de 128 Go GDDR7.

Ce SKU GPU est logé dans un rack séparé avec des configurations allant de 64 à 256 GPUs CPX indépendants par rack. Ce GPU est dédié aux charges de prefill, alimentant les racks qui gèrent le contexte d'entrée pour les LLMs et le traitement du cache KV. NVIDIA sépare les tâches de prefill et de decode, avec les GPUs CPX qui gèrent le prefill et les GPUs Rubin normaux qui gèrent le decode.

Un plateau de rack avec huit GPUs CPX peut gérer 1,34 To de prefill de long context et le cache KV associé. Puisque la conception précédente ne nécessitait pas d'intégration HBM4, NVIDIA a redessiné l'emballage, utilisant probablement TSMC's Co Wo S-S ou Co Wo S-L pour l'emballage. Le puce delivers 30 Peta FLOPS de performance de calcul NVFP4 sur un die monolithique.

Il comprend quatre encodeurs NVENC et quatre décodeurs NVDEC de video intégrés directement sur la puce. Pour les LLMs contenant maintenant des trillions de paramètres, avoir des racks dédiés au prefill pendant que d'autres gèrent le decode permet une livraison de tokens beaucoup plus rapide. NVIDIA recommande également de maintenir un ratio de 1:1 entre GPUs CPX et GPUs normaux dans le rack de decode.