AMD ha presentado la Instinct MI455X, su GPU para centros de datos con arquitectura CDNA 5 diseñada para entrenamiento de IA a gran escala, inferencia y sistemas de tipo rack. El acelerador incluye 432 GB de memoria HBM4 y ofrece un ancho de banda de memoria pico de hasta 23,3 TB/s.
AMD habla de nada menos que 320.000 millones de transistores y un nodo de fabricación de 2 nm de TSMC. El empaquetado combina varias tecnologías de fabricación en lugar de utilizar un único nodo para cada chiplet.

Ocho teselas de computación y doce stacks de memoria HBM4
La MI455X utiliza ocho teselas Complex (Accelerator Complex Dies) fabricadas en el nodo N2 de TSMC. Estos chiplets proporcionan 256 procesadores Work Group activos. AMD también utiliza dos teselas de interconexión y caché en N3P y dos teselas de E/S (I/O) con tecnología de fabricación TSMC N3P.
Los doce stacks HBM4 se conectan a través de una interfaz de memoria de 192 canales. La GPU cuenta con 192 MB de caché L2 global, dividida en dos secciones de 96 MB. Su configuración de E/S admite dos enlaces PCIe Gen 6 o tres tarjetas de red para IA de AMD (AMD AI-NICs) mediante UALink.

Hasta 40,26 PFLOPS de rendimiento en precisión MXFP4
AMD habla de la MI455X como capaz de ofrecer un rendimiento pico de cálculo de 20,13 PFLOPS en precisión MXFP8 y MXFP6. El rendimiento en MXFP4 alcanza los 40,26 PFLOPS. En comparación con la Instinct MI355X, AMD afirma ofrecer hasta 1,5 veces más memoria, 2,9 veces más ancho de banda de memoria y un rendimiento cuatro veces mayor en MXFP8 y MXFP4.

CDNA 5 añade un Tensor Data Mover para transferencias asíncronas directas entre la memoria global y el almacenamiento de datos local. AMD también ha añadido agrupación de grupos de trabajo (work-group clustering), transferencias multidifusión (multicast), precaptura de datos (data prefetching), barreras divididas (split barriers) y un nuevo procesador de comandos diseñado para reducir la dispatch latency.
La MI455X puede funcionar como una, dos o hasta ocho particiones. El modo NPS1 entrelaza direcciones en las doce pilas de memoria HBM4, mientras que NPS2 divide la GPU en dos dominios con seis pilas cada uno y evita transferencias entre los dos grupos principales de teselas.
AMD también ha anunciado la Instinct MI430X para computación científica, IA soberana y cargas de trabajo combinadas de IA y supercomputación (AI-HPC). AMD habla de hasta 288 TFLOPS de rendimiento por hardware en FP64 para ese modelo, pero no ha revelado su configuración completa de memoria ni su precio.
Fuente: AMD