HeadlinesBriefing favicon HeadlinesBriefing.com

AI-ускоритель NVIDIA Rubin CPX с памятью HBM4

TechPowerUp News •
×

NVIDIA возродила свой проект AI-ускорителя Rubin CPX, теперь с памятью HBM4 вместо ранее запланированной GDDR7. Известный аналитик цепочки поставок Ming Chi Kuo сообщил о redesign, отметив, что Rubin CPX был приостановлен после того, как NVIDIA анонсировала планы по созданию специализированного ускорителя, производного от семейства GPU Rubin, для масштабных агентных AI-нагрузок. Переработанный Rubin CPX имеет 168 ГБ памяти HBM4, что является улучшением по сравнению с первоначальным планом на 128 ГБ GDDR7. Этот GPU SKU housed в отдельном стойке с конфигурациями от 64 до 256 автономных GPU CPX на стойку. Этот GPU предназначен для нагрузок prefill, powering стойки, которые управляют входным контекстом для LLM и обработкой KV-кэша. NVIDIA разделяет задачи prefill и decode, при этом GPU CPX обрабатывают prefill, а обычные GPU Rubin управляют decode. Лоток стойки с восемью GPU CPX может обработать 1,34 ТБ prefill длинного контекста и связанный с ним KV-кэш. Поскольку предыдущий design не требовал интеграции HBM4, NVIDIA переработала упаковку, вероятно, используя TSMC's Co Wo S-S или Co Wo S-L для упаковки. Чип delivers 30 Peta FLOPS производительности NVFP4 на монолитной подложке. Он включает четыре интегрированных NVENC и четыре NVDEC видеокодера прямо на чипе. Для LLM, теперь содержащих триллионы параметров, наличие специализированных стоек для prefill, в то время как другие обрабатывают decode, позволяет добиться гораздо более быстрой доставки токенов. NVIDIA также рекомендует поддерживать соотношение 1:1 GPU CPX к обычным GPU в decode-стоеке.