top of page
IG.png

El ASIC Jalapeño de primera generación de OpenAI deja a la competencia muy por detrás, ya que realiza entre 1,5 y 1,9 veces más trabajo por kilovatio que los chips Blackwell de NVIDIA,

  • Foto del escritor: Masterbitz
    Masterbitz
  • hace 5 minutos
  • 5 min de lectura

OpenAI parece haber utilizado su actual serie de modelos que se ejecutan en las GPU NVIDIA para diseñar el chip Jalapeno, y luego lo emparejaron con su propio lenguaje de programación del kernel de Gluon, atreviéndose así a amenazar el legendario foso CUDA de NVIDIA. ¡Cómo se han vuelto las mesas!



La arquitectura del chip Jalapeno de OpenAI

SemiAnalysis acaba de proporcionar un desglose detallado de Jalapeno ASIC de OpenAI, que describe una arquitectura algo novedosa que ofrece economías de escala sustanciales.



Como tal, el Jalapeno combina una sola matriz de cálculo del tamaño de una retícula, construida en el nodo N3P de TSMC, con un chiplet de E/S de N3E y memoria HBM4 (probablemente de Samsung), que ofrece 15,4 TB/s de ancho de banda de memoria por paquete.

Los núcleos y la memoria se dividen en "rebanadas" coincidentes, lo que le da a cada segmento de núcleo una vista local de baja latencia de su propio segmento de HBM asignado, vinculado a través de una red colectiva de alto ancho de banda.


Ahora, los modelos de IA no suelen procesar datos línea por línea. En cambio, procesan miles de millones de números organizados en cuadrículas o matrices. Como tal, el motor de matriz es el "elevador pesado" construido únicamente para acelerar estos problemas matemáticos basados en la red.


Por supuesto, las matemáticas tradicionales de IA utilizan números estándar de 16 bits u 8 bits. Jalapeno, sin embargo, utiliza formatos numéricos MXFP. Para el beneficio de aquellos que podrían no ser conscientes, los formatos MX comprimen aún más los datos matemáticos de IA, hasta 4 bits en MXFP4. Esta compresión se realiza agrupando números y haciéndolos compartir un solo factor de escala (exponente), reduciendo así la cantidad de memoria necesaria para almacenar y mover datos.


Los motores de matriz del Jalapeno cuentan con una matriz sistólica estacionaria de peso. En una CPU estándar, el chip tiene que leer constantemente los datos de la memoria, realizar un cálculo y escribir el resultado en la memoria. Esto crea un cuello de botella. Una matriz sistólica, por otro lado, funciona como un corazón humano que bombea sangre: los datos fluyen hacia una red de células de procesamiento estrechamente conectadas, pasando directamente de una célula a la siguiente sin detenerse constantemente a leer / escribir a la memoria externa.


Además, los cálculos de IA generalmente implican multiplicar los datos entrantes (como su mensaje) por valores internos fijos (los pesos del modelo). Sin embargo, los motores de matriz del Jalapeno son estacionarios de peso, lo que significa que el chip carga los pesos del modelo en la rejilla de procesamiento una vez y luego los bloquea en su lugar (estacionario).


Por lo tanto, al congelar los pesados pesos de IA en su lugar (peso estacionario), bombear datos sin problemas a través de la red (matriz sistólica) y comprimir los números (MXFP), Jalapeño elimina los cuellos de botella de viaje de datos.


Además de los motores de matriz, el chip Jalapeno de OpenAI también tiene núcleos escalares de 64 bits para ejecutar el código de control, administrar la memoria y orquestar toda la operación. Estos núcleos escalares tienen canalizaciones de ejecución fuera de orden (OoO) y vienen emparejados con una caché L1. Esto evita que estos núcleos se detengan mientras esperan los datos. Como tal, los núcleos escalares fuera de orden funcionan por delante de los motores matemáticos: transmiten datos en colas de hardware especializadas para que cuando la matriz rígida en orden y los núcleos vectoriales estén listos, los números ya estén alineados esperándolos.


Finalmente, el chip cuenta con núcleos vectoriales FP32/INT32, que pueden aplicar una sola instrucción a una fila completa de números simultáneamente, interviniendo para casos que requieren matemáticas de alta precisión y donde la compresión de los motores de matriz arruinaría los resultados. Esto es útil para finalizar las probabilidades de la siguiente palabra (capas softmax) o normalizar las capas de datos.

Por supuesto, OpenAI no solo está construyendo el chip Jalapeno, sino también una solución completa a escala de rack que consiste en:


  1. El rack host de la CPU (Katsu): Este rack alberga 16 bandejas de CPU host distintas. Cada bandeja individual de Katsu está equipada con dos procesadores AMD EPYC de clase Turín, 1.5TB de memoria de sistema DRAM estándar, almacenamiento SSD NVMe local y enlaces de red frontend 400G.

  2. El rack de acelerador ASIC (Vindaloo): situado directamente a la derecha de la cremallera principal, contiene 16 bandejas de acelerador correspondientes. Cada bandeja de Vindaloo alberga 8 ASIC de Jalapeno, con un total de 128 chips de Jalapeno por despliegue de un solo rack.

  3. Para conectar los dos racks, 8 cables externos de alta velocidad de PCIe Direct Attach Copper (DAC) se ejecutan horizontalmente en la parte frontal de los gabinetes del servidor, uniendo cada bandeja de host Katsu directamente a su bandeja Vindaloo ASIC a juego.

  4. Cada rack ASIC de 128 chips ofrece hasta 1.7 ExaFLOPs de potencia de procesamiento de 4 bits (MXFP4), y contiene 27,5 TB de memoria HBM4 de próxima generación por rack, con cada paquete Jalapeno individual utilizando seis pilas de HBM4 de 12 altos para lograr un asombroso ancho de banda de memoria de 15.4 TB/s.


El chip Jalapeno de OpenAI sorprende a la competencia

Según los resultados compartidos por SemiAnalysis, el Jalapeno es, con mucho, el chip más eficiente para las cargas de trabajo de inferencia. En la suite de referencia InferenceX, entregó 1.5x a 1.9x más trabajo de IA por vatio en el rendimiento máximo y 1.7x a 3.6x menor latencia de extremo a extremo que los mejores resultados de NVIDIA GB200/GB300 disponibles en el momento de las pruebas. Críticamente, no está específicamente optimizado para una sola familia de modelos, y aparentemente puede ejecutar cualquier modelo con facilidad.



Según SemiAnalysis, el Jalapeno "entrega 13,4 PFLOP de MXFP4 en una sola matriz de cálculo del tamaño de una retícula que se fabrica en el N3P de TSMC. Esto se compara con 17,5 PFLOP de Rubin NVFP4 denso para una sola matriz de computación Rubin que es de tamaño similar y en el mismo nodo.


Además, mientras que OpenAI ha calificado a Jalapeno en un TDP de 700W, su consumo de energía sostenido generalmente se mantiene en o por debajo de 550W durante las cargas de trabajo de IA activa.


Críticamente, el Jalapeno logra esta hazaña mientras usa una arquitectura de predicción de un solo token (STP), donde el modelo toma un mensaje, lo procesa y predice exactamente un token (una palabra o pieza de palabra) a la vez. Esto significa que el ASIC no se basó en trucos arquitectónicos como la predicción multi-token (MTP) o la decodificación especulativa para inflar sus números de rendimiento. Tenga en cuenta que la decodificación especulativa agrega alrededor de una mejora de 3x en el costo por token.


Como advertencia final, tenga en cuenta que el Jalapeno tiene HBM4, mientras que los sistemas GB200 y GB300 tienen HBM3E. Esto apila la cubierta ligeramente a favor del ASIC de OpenAI.


Fuente: Wccftech

Comentarios


Aplus_MARS_2107_Eng(1).png
undefined - Imgur(1).jpg

Siguenos

  • Facebook
  • Twitter
  • YouTube
  • Instagram
gaming

© 2016 Derechos Reservados a MasterbitzReviewHN

bottom of page