top of page
IG.png

Google presenta su octava generación de procesadores Tensor personalizados

  • Foto del escritor: Masterbitz
    Masterbitz
  • 22 abr
  • 7 min de lectura

Hoy en Google Cloud Next, presentamos la octava generación de la Unidad de Procesadores de Tensor (TPU) personalizada de Google, que pronto llegará con dos arquitecturas distintas y especialmente diseñadas para la capacitación y la inferencia: TPU 8t y TPU 8i. Estos dos chips están diseñados para alimentar nuestras supercomputadoras personalizadas, para impulsar todo, desde la capacitación de modelos de vanguardia y el desarrollo de agentes, hasta cargas de trabajo de inferencia masivas. Los TPUs han estado impulsando modelos de base líderes, incluido Géminis, durante años. Estos TPU de octava generación juntos ofrecerán escala, eficiencia y capacidades a través de cargas de trabajo de capacitación, servicio y agentes.

En esta era de los agentes de IA, los modelos deben razonar a través de problemas, ejecutar flujos de trabajo de varios pasos y aprender de sus propias acciones en bucles continuos. Esto impone un nuevo conjunto de demandas a la infraestructura, y TPU 8t y TPU 8i fueron diseñados en asociación con Google DeepMind para asumir las cargas de trabajo de inteligencia artificial más exigentes y adaptarse a la evolución de las arquitecturas de modelos a escala.

   

Los TPU establecen el estándar para una serie de componentes de supercomputación ML que incluyen numéricos personalizados, refrigeración líquida, interconexiones personalizadas y más, y nuestros TPU de octava generación son la culminación de más de una década de desarrollo. La visión clave detrás del diseño original de TPU continúa manteniendo hoy en día: al personalizar y co-diseñar silicio con hardware, redes y software, incluidos los requisitos de arquitectura de modelos y aplicaciones, podemos ofrecer una eficiencia energética y un rendimiento absoluto.


Estamos encantados de ver cómo una década de innovación se traduce en avances en el mundo real. Hoy en día, las organizaciones pioneras como Citadel Securities están empujando los límites de lo que es posible, eligiendo TPUs para alimentar sus cargas de trabajo de inteligencia artificial de vanguardia:

Hemos sido capaces de ejecutar nuestras cargas de trabajo más exigentes dos a cuatro veces más rápido y a un costo un 30% menor con los TPUs de hierro de séptima generación de Google Cloud. Nuestro equipo se complace en aprovechar el hipercomputador AI de Google Cloud con las arquitecturas TPU 8t y TPU 8i de próxima generación para transformar aún más nuestra economía de capacitación y ampliar los límites de la escalabilidad. Josh Woods, CTO, Citadel Securities


Dos fichas para encontrar el momento

Los ciclos de desarrollo de hardware son mucho más largos que el software. Con cada generación de TPU, debemos considerar qué tecnologías y demandas existirán en el momento en que se lleven al mercado. Hace varios años, anticipamos una creciente demanda de inferencia de los clientes a medida que los modelos de IA fronteriza se implementan en la producción y a escala. Y con el auge de los agentes de IA, determinamos que la comunidad se beneficiaría de chips especializados individualmente para las necesidades de capacitación y servicio.


TPU 8t brilla en cargas de trabajo masivas de entrenamiento intensivo en computación diseñadas con mayor rendimiento de computación y más ancho de banda de escalamiento. TPU 8i está diseñado con más ancho de banda de memoria para servir a las cargas de trabajo de inferencia más sensibles a la latencia, lo cual es fundamental porque las interacciones entre agentes a escala magnifican incluso pequeñas ineficiencias.


Es importante destacar que ambos chips pueden ejecutar varias cargas de trabajo, pero la especialización desbloquea eficiencias y ganancias significativas.



TPU 8t: La potencia de entrenamiento


TPU 8t está construido para reducir el ciclo de desarrollo del modelo fronterizo de meses a semanas. Al equilibrar el mayor rendimiento de computación posible, la memoria compartida y el ancho de banda de interchip con la mejor eficiencia energética posible y el tiempo de cálculo productivo, hemos creado un sistema que ofrece casi 3x el rendimiento de cómputo por pod durante la generación anterior, lo que permite una innovación más rápida para garantizar que nuestros clientes continúen marcando el ritmo para la industria.

  • Escala masiva: Un único superpod de TPU 8t ahora escala a 9.600 chips y dos petabytes de memoria de ancho de banda alto compartido, con el doble de ancho de banda de interchip de la generación anterior. Esta arquitectura ofrece 121 ExaFlops de computación y permite que los modelos más complejos aprovechen un único grupo masivo de memoria.

  • Utilización máxima: al integrar también 10x acceso de almacenamiento más rápido, combinado con TPUDirect para extraer datos directamente en el TPU, TPU 8t ayuda a garantizar la máxima utilización del sistema de extremo a extremo.

  • Escalamiento casi lineal: nuestra nueva red Virgo, combinada con JAX y nuestro software Pathways, significa que TPU 8t puede proporcionar un escalado casi lineal de hasta un millón de chips en un solo clúster lógico.


Además del rendimiento bruto, TPU 8t está diseñado para apuntar a más del 97% de "buena contribución", una medida del tiempo de cálculo útil y productivo, a través de un conjunto completo de capacidades de confiabilidad, disponibilidad y capacidad de servicio (RAS). Estos incluyen telemetría en tiempo real a través de decenas de miles de chips, detección automática y redireccionamiento alrededor de enlaces ICI defectuosos sin interrumpir un trabajo, y conmutación de circuitos ópticos (OCS) que reconfigura el hardware alrededor de fallas sin intervención humana.


Cada fallo de hardware, parada de red o reinicio de punto de control es el tiempo que el clúster no está entrenando, y a escala de entrenamiento de frontera, cada punto porcentual puede traducirse en días de tiempo de entrenamiento activo.

 

En la era agencial, los usuarios esperan poder hacer preguntas, delegar tareas y obtener resultados. TPU 8i está diseñado para manejar el intrincado trabajo colaborativo e iterativo de muchos agentes especializados, a menudo "enjambrando" juntos en flujos complejos para ofrecer soluciones y conocimientos para las tareas más desafiantes. Rediseñamos la pila para eliminar el efecto de "sala de espera" a través de cuatro innovaciones clave:


  • Rompiendo la "pared de memoria": Para evitar que los procesadores se queden inactivos, TPU 8i empareja 288 GB de memoria de alto ancho de banda con 384 MB de SRAM en chip, 3 veces más que la generación anterior, manteniendo el conjunto de trabajo activo de un modelo completamente en chip.

  • Eficiencia impulsada por Axion: duplicamos los hosts de CPU físicos por servidor, pasando a nuestras CPU personalizadas basadas en Axion Arm. Mediante el uso de una arquitectura de memoria no uniforme (NUMA) para el aislamiento, hemos optimizado el sistema completo para un rendimiento superior.

  • Escala de modelos MoE: Para los modelos modernos de Mixture of Expert (MoE), duplicamos el ancho de banda de Interconnect (ICI) a 19.2 Tb/s. Nuestra nueva arquitectura Boardfly reduce el diámetro máximo de la red en más del 50%, asegurando que el sistema funcione como una unidad cohesiva y de baja latencia.

  • Eliminar el retraso: Nuestro nuevo motor de aceleración de colectivos en chip (CAE) descarga operaciones globales, lo que reduce la latencia en el chip hasta 5x, minimizando el retraso.


Estas innovaciones ofrecen un 80% de mejor rendimiento por dólar en comparación con la generación anterior, lo que permite a las empresas servir casi el doble del volumen del cliente al mismo costo.

  


Co-diseñado para Géminis, abierto para todos

Esta TPU de octava generación es también la última expresión de nuestra filosofía de co-diseño, donde cada especificación está construida para resolver los mayores obstáculos de la IA.

  • La topología Boardfly fue diseñada específicamente para las demandas de comunicación de los modelos de razonamiento más capaces de la actualidad.

  • La capacidad de SRAM en TPU 8i fue dimensionada para la huella de caché KV de los modelos de razonamiento a escala de producción.

  • Los objetivos de ancho de banda de Virgo Network se derivaron de los requisitos de paralelismo del entrenamiento de billones de parámetros.

Y por primera vez, ambos chips se ejecutan en el propio host de CPU basado en Axion Arm de Google, lo que nos permite optimizar el sistema completo, no solo el chip, para el rendimiento y la eficiencia.


Ambas plataformas son compatibles con JAX, MaxText, PyTorch, SGLang y vLLM nativos, y los frameworks que los desarrolladores ya utilizan, y ofrecen acceso a metales desnudos, lo que brinda a los clientes acceso directo a hardware sin la sobrecarga de la virtualización. Las contribuciones de código abierto, incluidas las implementaciones de referencia de MaxText y Tunix para el aprendizaje de refuerzo, admiten rutas de acceso entre la capacidad y la implementación de producción.


Diseño para la eficiencia energética a escala

En los centros de datos actuales, la energía, no solo el suministro de chips, es una restricción vinculante. Para resolver esto, hemos optimizado la eficiencia en toda la pila, con una gestión de energía integrada que ajusta dinámicamente el consumo de energía en función de la demanda en tiempo real. TPU 8t y TPU 8i ofrecen hasta dos veces mejor rendimiento por vatio con respecto a la generación anterior, Ironwood.


Pero la eficiencia en Google no es solo una métrica a nivel de chip; también es un compromiso a nivel de sistema que va desde el silicio hasta el centro de datos. Por ejemplo, integramos la conectividad de red con el cómputo en el mismo chip, reduciendo significativamente los costos de potencia de los datos en movimiento a través del pod de TPU. Incluso nuestros centros de datos están co-diseñados con nuestros TPU. Innovamos en hardware y software para permitir que nuestros centros de datos entreguen seis veces más potencia informática por unidad de electricidad que hace cinco años.


TPU 8t y TPU 8i continúan esa trayectoria. Ambos están respaldados por nuestra tecnología de refrigeración líquida de cuarta generación que mantiene las densidades de rendimiento que la refrigeración por aire no puede. Al poseer la pila completa, desde el host Axion hasta el acelerador, podemos optimizar la eficiencia energética a nivel del sistema de maneras que simplemente no se pueden lograr cuando el host y el chip se diseñan de forma independiente.

 


Infraestructura para la era agencial

Cada transición informática importante ha requerido avances en la infraestructura, y la era agente no es diferente. La infraestructura debe evolucionar para satisfacer las demandas de los agentes autónomos que operan en bucles continuos de razonamiento, planificación, ejecución y aprendizaje.


TPU 8t y TPU 8i son nuestra respuesta a este desafío: dos arquitecturas especializadas construidas para redefinir lo que es posible en la IA, desde la construcción de los modelos de IA más capaces, hasta enjambres de agentes perfectamente orquestados, hasta la gestión de las tareas de razonamiento más complejas. Ambos chips estarán disponibles generalmente a finales de este año, y se pueden utilizar como parte del hipercomputador AI de Google, que reúne hardware especialmente diseñado (cómputo, almacenamiento, redes), software abierto (marcos, motores de inferencia) y consumo flexible (orquestación, gestión de clústeres y modelos de entrega) en una pila unificada.


La computación agrética redefinirá lo que es posible. Estamos encantados de anunciar la última encarnación de nuestra implacable innovación para impulsar esta transformación, TPU 8i y 8t. Los clientes interesados pueden solicitar más información.

Fuente: Google

Comentarios


Aplus_MARS_2107_Eng(1).png
undefined - Imgur(1).jpg

Siguenos

  • Facebook
  • Twitter
  • YouTube
  • Instagram
gaming

© 2016 Derechos Reservados a MasterbitzReviewHN

bottom of page