top of page
IG.png

La GPU «Rubin CPX» de NVIDIA renace con memoria HBM4; se descarta la GDDR7

Foto del escritor: Masterbitz
Masterbitz
1 sept
2 min de lectura

Según los informes, NVIDIA ha revivido su proyecto de acelerador de IA "Rubin CPX", que anteriormente se había suspendido. Hoy, el conocido analista de la cadena de suministro Ming Chi Kuo informó que NVIDIA está reintroduciendo el "CPX de Rubin", que ahora presenta memoria HBM4 en lugar del GDDR7 previamente planeado. A finales del año pasado, NVIDIA Anunciado Sus planes para desarrollar un acelerador especializado derivado de la familia de GPU "Rubin", diseñado para cargas de trabajo de IA agente a gran escala. Después del anuncio, el proyecto se detuvo, pero NVIDIA ahora ha rediseñado la arquitectura de memoria. Anteriormente, la "Rubin CPX" estaba programada para tener 128 GB de memoria GDDR7, pero ahora incluirá 168 GB de memoria HBM4. Este SKU de GPU se encuentra en un rack separado con configuraciones que van desde 64 a 256 GPU CPX independientes por rack.



Esta GPU está dedicada a prellenar cargas de trabajo, alimentando racks que administran el contexto de entrada para los LLM y el procesamiento de caché KV. Esencialmente, NVIDIA está separando el prellenado de las tareas de decodificación, con las GPU CPX que manejan el prellenado y las GPU "Rubin" regulares que administran la decodificación. Una bandeja de rack con ocho GPU CPX puede manejar 1,34 TB de prelleno de contexto largo y la caché KV asociada, todas utilizando memoria HBM4 para un procesamiento más rápido y un mayor ancho de banda. Dado que el diseño anterior no requería la integración de HBM4, NVIDIA ha rediseñado el paquete, probablemente utilizando CoWoS-S o CoWoS-L de TSMC para el embalaje.

 

El chip ofrece 30 PetaFLOPS de rendimiento de computación NVFP4 en una matriz monolítica. Incluye cuatro NVENC integrados y cuatro codificadores de vídeo NVDEC directamente en el chip, lo que permite flujos de trabajo multimedia optimizados sin necesidad de procesamiento externo. Para los LLM que ahora contienen billones de parámetros, tener racks dedicados para el precargado, mientras que otros manejan la decodificación permite una entrega de tokens mucho más rápida. NVIDIA también recomienda mantener una relación 1:1 de GPUs CPX a GPUs regulares en el rack de decodificación.


Fuente: Ming Chi Kuo

Comentarios


Aplus_MARS_2107_Eng(1).png
undefined - Imgur(1).jpg

Siguenos

  • Facebook
  • Twitter
  • YouTube
  • Instagram
gaming

© 2016 Derechos Reservados a MasterbitzReviewHN

bottom of page