Las GPU AMD Instinct MI355X superan el millón de tokens por segundo en MLPerf 6.0
- Masterbitz

- 1 abr
- 12 min de lectura
En su presentación de MLPerf Inference 6.0, AMD no simplemente volvió a visitar puntos de referencia familiares con una GPU más rápida. Se expandió a cargas de trabajo por primera vez, cruzó el umbral de 1 millón de tokens por segundo a escala de múltiples nodos y mostró que los socios pueden reproducir los resultados en un ecosistema más amplio. Esa combinación es importante porque nuestros clientes ya no evalúan las plataformas de inferencia en una sola métrica. Quieren un rendimiento competitivo de un solo nodo, una escalada eficiente, una recuperación más rápida de los nuevos modelos, resultados reproducibles en todos los sistemas asociados y la confianza de que la pila de software puede mantener el ritmo. MLPerf Inference 6.0 vamos a mostrar todo eso en una sola presentación.
Igual de importantes, hemos demostrado que estos resultados no están aislados. Un amplio ecosistema de socios presentado a través de cuatro tipos de GPU AMD Instinct que reprodujeron estrechamente los números presentados por AMD y la primera presentación heterogénea de MLPerf de tres GPU demostró que el hardware de AMD y el software AMD ROCm pueden orquestar un rendimiento significativo de inferencia incluso en sistemas en diferentes geografías.
GPUs AMD Instinct MI355X: diseñadas para la inferencia desde cero
Las GPU AMD Instinct MI355X se basan en la arquitectura AMD CDNA 4 con un proceso de 3 nm, traen 185 mil millones de transistores, agregan soporte para FP4 y FP6 y combinan todo eso con hasta 288 GB de memoria HBM3E.
Con hasta 10 petaflops de rendimiento FP4 y FP6, soporte para modelos de hasta 520 mil millones de parámetros en una sola GPU y un nodo UBB8 estándar de la industria disponible en configuraciones refrigeradas por aire y refrigeradas por líquido directa, las GPU AMD Instinct MI355X están diseñadas para ofrecer más que velocidad. También están diseñados para ofrecer una capacidad de gran modelo y una preparación para la implementación en una plataforma.
Definición de momentos de la presentación de AMD MLPerf Inference 6.0
Los resultados de MLPerf Inference 6.0 de AMD van mucho más allá de un único punto de prueba, revelando un progreso significativo en el rendimiento, la cobertura del modelo, la escala y la reproducibilidad. Varios avances se destacan:
1. AMD rompe la barrera de tokens/sec de 1M en la inferencia de MLPerf
Uno de los mayores hitos en esta ronda es que, por primera vez, AMD superó los 1 millón de tokens por segundo en el punto de referencia de MLPerf Inference. AMD cruzó ese umbral en Llama 2 70B en los puntos de referencia de servidor y fuera de línea, y en GPT-OSS-120B en línea, todo a escala de múltiples nodos en las GPU MI355X de AMD Instinct.
La industria evalúa cada vez más la inferencia a escala de clúster, donde el rendimiento agregado y el tiempo de servicio determinan si la infraestructura está lista para su implementación. Superar 1 millón de tokens por segundo demuestra el rendimiento de inferencia de la clase de producción.
Para los clientes, este hito tiene claros beneficios:
Mayor rendimiento agregado para servir a grandes poblaciones de usuarios y modelos más grandes.
Un punto de prueba claro de que las GPU AMD Instinct MI355X pueden mantener el rendimiento cuando las implementaciones se mueven más allá de una sola caja.
Validación de que las cargas de trabajo por primera vez como GPT-OSS se pueden habilitar rápidamente y aún así escalar a una producción significativa.
Una base más sólida para la próxima generación de implementaciones de inferencia a escala de múltiples nodos y racks.
2. Las GPU AMD Instinct MI355X ofrecen un salto generacional claro vs. Gen Anterior
AMD también demostró una importante elevación generacional en el servidor Llama 2 70B. La GPU AMD Instinct MI355X entregó 100,282 tokens por segundo, mostrando 3.1x más rendimiento que los resultados de la GPU AMD Instinct MI325X presentada anteriormente.
Uno de los mayores hitos en esta ronda es que, por primera vez, AMD superó los 1 millón de tokens por segundo en el punto de referencia de MLPerf Inference. AMD cruzó ese umbral en Llama 2 70B en los puntos de referencia de servidor y fuera de línea, y en GPT-OSS-120B en línea, todo a escala de múltiples nodos en las GPU MI355X de AMD Instinct.
La industria evalúa cada vez más la inferencia a escala de clúster, donde el rendimiento agregado y el tiempo de servicio determinan si la infraestructura está lista para su implementación. Superar 1 millón de tokens por segundo demuestra el rendimiento de inferencia de la clase de producción.
Ese es un salto significativo en seis meses, y refleja el poder de la pila completa: arquitectura AMD CDNA 4, alta densidad de computación, soporte para FP4 y FP6, gran capacidad HBM3E y optimizaciones de software AMD ROCm sintonizadas para la inferencia moderna del modelo de lenguaje grande.
3. Llama 2 70B muestra una amplia competitividad de un solo nodo
En Llama 2 70B, el punto de referencia de modelo de lenguaje grande más reconocido en MLPerf, la plataforma AMD Instinct MI355X ofreció resultados de un solo nodo altamente competitivos frente a las GPU NVIDIA B200 y B300. Contra B200, la plataforma AMD Instinct MI355X empatada en Offline, entregó el 97% del rendimiento del servidor y alcanzó el 119% del rendimiento de referencia interactivo. Contra el sencillo B300, la plataforma AMD Instinct MI355X alcanzó el 93% en Server, el 92% en Offline y el 104% en Interactive.
Especialmente importante es la amplitud de los resultados. Esta no es una historia de un solo escenario. AMD muestra competitividad a través del rendimiento por lotes en Offline, rendimiento sostenido en el servidor y capacidad de respuesta en Interactive.
4. GPT-OSS-120B demuestra una rápida presentación de modelos por primera vez
GPT-OSS-120B se encuentra entre las partes más emocionantes de esta presentación de Inference 6.0 porque fue una carga de trabajo en MLPerf por primera vez. La habilitación del modelo por primera vez es difícil: el modelo debe ser elevado, optimizado, validado para la precisión y empujado al rendimiento competitivo dentro de la sincronización de MLPerf.
Incluso con esa complejidad, la plataforma AMD Instinct MI355X entregó el 111% del rendimiento B200 Offline y el 115% del rendimiento de un solo nodo NVIDIA B200 Server. Contra NVIDIA B300 de un solo nodo, la plataforma AMD Instinct MI355X alcanzó un 91% competitivo en Offline y un 82% en Server.
5. Wan-2.2-t2v extiende AMD a la nueva inferencia de texto a video
MLPerf Inference 6.0 también permite a AMD expandir más allá de los modelos de lenguaje grande (LLM) en la generación de texto a video con una presentación por primera vez en Wan-2.2-t2v. Este punto de referencia tiene dos pruebas: Offline y Single Stream. Para esta presentación, centramos nuestro esfuerzo en el escenario de la corriente única y, como resultado, nuestra presentación está en la categoría abierta en lugar de cerrada (lo que requiere tanto fuera de línea como de flujo único). Sin embargo, nuestra ejecución de Single Stream cumplió con las reglas de envío cerrado y, por lo tanto, se puede comparar directamente con los puntajes en la división cerrada.
Aun así, el resultado es impresionante para un esfuerzo de AMD por primera vez en una nueva categoría de carga de trabajo: la plataforma AMD Instinct MI355X logró el 93% del rendimiento de un solo nodo NVIDIA B200 y el 87% del rendimiento de un solo nodo NVIDIA B300 en Single Stream. Después de la fecha límite, la sintonización adicional movió Single Stream al 108% de B200 y la paridad con B300, mientras que los resultados no oficiales Offline alcanzaron el 111% de B200 y el 88% de B300. Los números posteriores a la fecha límite no fueron parte de la presentación oficial de MLPerf y no fueron verificados por MLCommons, pero muestran claramente la rapidez con la que el rendimiento mejoró una vez que tuvimos más tiempo para sintonizar.
Para los clientes, la importancia de este resultado va más allá de los propios porcentajes. Muestra que AMD está expandiendo la cobertura del modelo de los LLM a nuevas cargas de trabajo de video multimodales y generativas y lo hace con un rendimiento competitivo del día uno.
Eso importa porque la IA generativa no se detiene. Los modelos que los clientes quieren implementar se están volviendo más amplios, más multimodales, más especializados y AMD está demostrando que puede mantener el ritmo.
6. Inferencia de múltiples nodos muestra una escalada eficiente
El interés en la inferencia de múltiples nodos está aumentando a medida que los modelos se hacen más grandes, las implementaciones se vuelven más exigentes y la industria sienta las bases para los sistemas a escala de rack, como la solución AMD Helios. Nuestra presentación de MLPerf Inference 6.0 muestra que el AMD Instinct MI355X está listo para esa transición.
En Llama 2 70B, escalamos de un nodo a 11 nodos y nos mantuvimos notablemente cerca de la escala lineal ideal.
Con 11 nodos y 87 GPU AMD Instinct MI355X, entregamos 1.042.110 tokens por segundo en Offline, 1.016.380 tokens por segundo en Server y 785.522 tokens por segundo en Interactive. La eficiencia de escala-out alcanzó el 93% en Offline, el 93% en Server y el 98% en Interactive. La escala-out fuera de línea es la ruta más estándar, pero Server e Interactive son más difíciles porque deben mantener los requisitos de latencia a medida que el clúster crece, lo que hace que estos resultados sean especialmente convincentes.
Este es exactamente el tipo de trampolín que necesitamos a medida que la inferencia se mueve hacia AMD Helios y futuras implementaciones a escala de rack.
Los resultados de los multinodos continúan en GPT-OSS-120B. Estos resultados se vuelven aún más interesantes, ya que esta fue nuestra primera presentación multinodo GPT-OSS. La pregunta no era solo si podíamos habilitar el modelo, sino si podíamos escalarlo de manera eficiente a través de un clúster real. Con 12 nodos y 94 GPU AMD Instinct MI355X, entregamos 1.031.070 tokens por segundo en Offline y 900.054 tokens por segundo en Server. Igual de importante, nos mantuvimos cerca de la escala ideal de 12x, con un 92% de eficiencia en Offline y un 93% en Servidor. Eso convirtió a GPT-OSS en el segundo modelo en el que cruzamos la marca de 1 millón de tokens por segundo a escala de múltiples nodos.
Para los clientes, estos resultados de escalada proporcionan puntos de prueba importantes:
La escala de multinodos predecibles hace crecer los clústeres de inferencia sin perder eficiencia a medida que aumentan las cargas de trabajo y los tamaños de los modelos.
La fuerte eficiencia a escala de servidor genera confianza para la inferencia en tiempo real, no solo el procesamiento por lotes de alto rendimiento.
Una mayor eficiencia de escalabilidad mejora la utilización de la GPU, ayudando a reducir el costo por token y maximizando la inversión en infraestructura.
El rendimiento probado de los múltiples nodos ofrece a los clientes un camino más sólido desde las implementaciones piloto hasta la infraestructura de inteligencia artificial a escala de producción
Escala de ecosistemas y reproducibilidad en los envíos de socios
Otro punto culminante importante para AMD en la presentación de MLPerf Inference 6.0 es el impulso del ecosistema. Esta ronda resultó en un empate para la mayoría de los socios que se envían en el hardware de AMD Instinct con nueve: Cisco, Dell, Giga Computing, HPE, MangoBoost, MiTAC, Oracle, Supermicro y Red Hat.
Esos envíos abarcaron cuatro tipos de GPU AMD Instinct: MI300X, MI325X, MI350X y MI355X. Muestra que el ecosistema no se limita a una configuración insignia; cubre múltiples generaciones y múltiples modelos de implementación en plataformas OEM, ODM y de estilo cloud.
Esta reproducibilidad es especialmente poderosa. En las GPU AMD Instinct MI355X, los resultados de los socios cayeron dentro del 4% de la presentación realizada por AMD, y algunos aterrizaron dentro del 1%, incluso en cargas de trabajo ejecutadas por primera vez. Esa es una señal muy fuerte de que estos números no son frágiles artefactos de laboratorio; son reproducibles en sistemas reales de socios gracias al hardware AMD predecible y al software AMD ROCm.
Para los clientes, eso significa más que opciones. Significa que la confianza que demuestra el rendimiento que AMD demuestra se puede recrear en todo el ecosistema en general, reduciendo el riesgo de implementación y acelerando el tiempo de producción.
La primera presentación heterogénea de 3 GPU demuestra una inferencia flexible a través de las geografías
Uno de los resultados más prospectivos es el primer envío heterogéneo de MLPerf construido a través de tres tipos de GPU AMD Instinct: MI300X, MI325X y MI355X. Enviada por Dell y MangoBoost, la configuración alcanzó 141.521 tokens por segundo en el servidor Llama 2 70B y 151,843 tokens por segundo en Llama 2 70B Offline.
Un detalle especialmente importante es la geografía. La plataforma AMD Instinct MI355X se encontraba en el laboratorio de Dell en los Estados Unidos, mientras que las plataformas Instinct MI300X y MI325X estaban en Corea. Eso hace que esto sea más que una historia de inferencia de generación mixta, también es un punto de prueba para la orquestación a través de sistemas en diferentes geografías.
Para los clientes, el valor es evidente:
Las implementaciones de GPU AMD Instinct existentes se pueden extender en lugar de arrancar y reemplazar.
El hardware de generación mixta se puede orquestar de manera inteligente para preservar la utilización y el rendimiento.
El software AMD ROCm ayuda a que los entornos no uniformes sean más prácticos, predecibles y rentables.
AMD está demostrando un camino hacia una infraestructura flexible y preparada para el futuro en lugar de ciclos de actualización de una sola toma.
Cómo el software AMD ROCm impulsa el rendimiento, la escala y la habilitación de modelos
Cada resultado importante en el envío de AMD MLPerf Inference 6.0 está conectado por un hilo común: el software AMD ROCm. Convirtió el hardware MI355X de AMD Instinct en una plataforma desplegable para la inferencia competitiva de una sola GPU, el rendimiento a escala de clúster, la orquestación heterogénea y la creación de modelos por primera vez.
En la presentación, el software AMD ROCm ayudó a permitir la ejecución eficiente de FP4, la comunicación optimizada de GPU a GPU para el escalado multinodo, la distribución dinámica de la carga de trabajo para la inferencia heterogénea y la preparación del modelo de día cero para modelos como Llama, Wan y GPT-OSS.
Para los clientes, el software AMD ROCm ofrece varias ventajas prácticas:
Rendimiento optimizado del modelo para los tipos de datos de IA generativa modernos y los núcleos de inferencia.
Escalado multinodo sin costuras con comunicación y orquestación eficientes.
Distribución heterogénea de la carga de trabajo a través de las generaciones de GPU AMD Instinct.
Más rápida la preparación para los modelos emergentes y las nuevas categorías de carga de trabajo.
Es por eso que el software ROCm es una parte tan importante de la historia de AMD. No se limita a ayudar a AMD a publicar un sólido resultado de referencia, sino que permite el rendimiento, la escalabilidad, la flexibilidad y la reproducibilidad en toda la cartera de Instinct.
La Cadencia Anual Se Está Construyendo Hacia La Serie AMD Instinct MI400 Y Las Soluciones A Escala De Rack Helios
El contexto más amplio detrás de estos resultados es el impulso. AMD está ejecutando una cadencia anual para las GPU Instinct, y esa consistencia es importante. Las GPU AMD Instinct MI300X establecieron un fuerte punto de apoyo de IA generativa en 2023. Las GPU MI325X de instinto AMD extendieron esa base en 2024 con mayor computación y HBM3E. En 2025, la serie AMD instinto MI350, incluida la GPU MI355X, hizo avanzar la plataforma nuevamente con nuevos tipos de datos de inteligencia artificial, una mayor capacidad de modelo y las ganancias de inferencia mostradas a lo largo de esta presentación.
Y en 2026, AMD planea avanzar a las GPU de la serie AMD Instinct MI400 basadas en la arquitectura AMD CDNA 5 de próxima generación, ampliando esta cadencia anual a la próxima era de la IA a escala de rack y sentando las bases para la solución a escala de rack de AMD Helios. Para los clientes, eso proporciona confianza en que AMD no solo está entregando un resultado sólido hoy en día, sino que construye una plataforma de inferencia a largo plazo que puede escalar con el tamaño del modelo, la diversidad de carga de trabajo y los requisitos de implementación de producción.
Última comida para llevar
La presentación de AMD MLPerf Inference 6.0 marca un gran paso adelante para AMD y su historia de IA generativa. A través de nuevas cargas de trabajo, las GPU AMD Instinct MI355X ofrecieron resultados de un solo nodo altamente competitivos, un rendimiento de escalado de múltiples nodos increíblemente eficiente, un número de modelos por primera vez en GPT-OSS-120B y Wan-2.2-t2v, y un hito de entregar más de 1 millón de tokens por segundo a escala de clúster.
En el centro de todo esto está el software AMD ROCm, y una disciplinada cadencia de hoja de ruta anual. Desde la GPU AMD Instinct MI300X hasta la GPU MI325X y la serie MI350 con la GPU AMD Instinct MI355X, AMD se mueve rápidamente, expandiendo el soporte del modelo y construyendo la base de software y sistemas necesarias para futuras implementaciones de IA a escala de rack. Con la solución a escala de rack AMD Helios impulsada por la serie AMD Instinct MI400 y las futuras generaciones de AMD Instinct en el horizonte, MLPerf Inference 6.0 refuerza un mensaje claro: AMD no solo participa en la transición generativa de la inferencia de IA, sino que está ayudando a definir cómo es la infraestructura GenAI lista para la producción.
Para los lectores interesados en la historia técnica más profunda detrás de estos resultados, dos nuevos blogs de AMD ROCm proporcionan detalles adicionales sobre la presentación de MLPerf Inference v6.0. "GPUs de instinto AMD MLPerf Inferencia v6.0 Envío" explora el trabajo de hardware y software detrás de estos resultados, mientras que "Reproducir el resultado de la presentación de AMD MLPerf Inference v6.0" camina sobre cómo replicar los puntos de referencia en el hardware de AMD Instinct, reforzando el compromiso de AMD con la apertura, la transparencia y la reproducibilidad en la inferencia de la IA.
Fuente: Blog de AMD











.png)



Comentarios