La red global de conocimiento para profesionales de la energía e industria

Cerebras lanza el CS-4 y redefine la arquitectura para acelerar la inferencia de IA

¿Cuánto cómputo útil puede entregar el sistema por unidad de energía, con qué latencia y durante cuánto tiempo puede mantener esa capacidad disponible?
Cerebras presenta el CS-4 para acelerar la inferencia de IA

Cerebras Systems presentó el CS-4, una nueva plataforma de cómputo para centros de datos diseñada específicamente para acelerar la inferencia de inteligencia artificial, es decir, la etapa en la que un modelo entrenado procesa una consulta y genera una respuesta.

La compañía estadounidense, competidora de NVIDIA en infraestructura especializada para IA, construyó el nuevo sistema alrededor de tres procesadores Wafer Scale Engine 3 Turbo (WSE-3T) y de una nueva arquitectura de rack denominada Nexus.

El objetivo no es solamente aumentar la capacidad de cálculo, sino reducir las pérdidas de rendimiento asociadas al movimiento de datos, la alimentación eléctrica y la interconexión entre procesadores.

Cerebras afirma que el CS-4 puede alcanzar hasta 30 veces más velocidad de inferencia que sistemas basados en GPU en determinadas cargas de trabajo y que proporciona hasta diez veces más rendimiento por vatio que su generación CS-3. Estas cifras corresponden a las pruebas y condiciones especificadas por la compañía, por lo que no deben interpretarse como una ventaja universal para cualquier modelo de IA.

El nuevo chip lleva la computación a escala de oblea

El elemento central del CS-4 es el WSE-3 Turbo, fabricado mediante el proceso de 5 nanómetros de TSMC.

Cada procesador integra aproximadamente 4 billones de transistores y 900.000 núcleos optimizados para IA sobre una superficie de silicio de 46.225 mm², además de 44 GB de memoria SRAM integrada directamente en la oblea. Cerebras afirma que el WSE-3T alcanza hasta 250 PFLOPS de cómputo de IA por oblea y 43,2 PB/s de ancho de banda de memoria.

El CS-4 reúne tres de estos procesadores en un sistema de rack, alcanzando hasta 750 PFLOPS, 7,2 Tb/s de entrada/salida y 129,6 PB/s de ancho de banda de memoria. La comunicación entre obleas puede reducir su latencia hasta aproximadamente 2 microsegundos.

Cuando un modelo de grandes dimensiones se distribuye entre varios procesadores, los datos tienen que desplazarse constantemente entre ellos. Cada transferencia introduce latencia y consumo energético. Reducir esa comunicación permite que una mayor proporción del tiempo de cálculo se dedique realmente a generar resultados.

Cerebras afirma que esta arquitectura permite superar los 1.000 tokens por segundo en determinados modelos con más de 10 billones de parámetros.

La potencia eléctrica también forma parte del procesador

El CS-4 no trata el suministro eléctrico como un subsistema independiente situado lejos del procesador. Cerebras ha rediseñado la entrega de potencia para aproximar la conversión eléctrica al WSE-3T.

La compañía señala que la distancia entre el procesador y la conversión de potencia pasa de aproximadamente 50 milímetros en una arquitectura convencional de GPU a unos 0,5 milímetros en su nueva configuración. Es decir, una reducción de aproximadamente 100 veces en la distancia física.

La razón es eléctrica: cuanto mayor es la distancia recorrida por corrientes elevadas entre la conversión de potencia y la carga, mayores son las pérdidas asociadas al sistema de distribución.

Al acercar la conversión al procesador, Cerebras afirma que puede entregar aproximadamente el doble de potencia al WSE-3T, permitiendo elevar las frecuencias de operación y aumentar la generación de tokens.

Menos componentes para acelerar los centros de datos

El CS-4 introduce la plataforma Nexus, organizada alrededor de tres elementos: cómputo, potencia y entrada/salida (I/O). Cada uno puede configurarse como un módulo independiente y posteriormente integrarse en el sistema completo.

Uno de los componentes es el denominado Wafer-Scale Backpack, una estructura modular que integra alrededor de la oblea la conversión de potencia, refrigeración líquida directa, electrónica de control y conexiones de alta velocidad.

Cerebras afirma que esta configuración utiliza 50 % menos componentes que la generación anterior y que incorpora un 60 % más de fabricación automatizada. La empresa sostiene que el concepto permite reducir los tiempos de despliegue de días a horas. La importancia de este cambio va más allá de la fabricación.

Menos componentes pueden significar menos puntos potenciales de fallo, menor complejidad de ensamblaje y una arquitectura modular que facilita sustituciones y actualizaciones. Para los centros de datos que pretenden instalar grandes cantidades de aceleradores, estas variables pueden terminar siendo tan importantes como la capacidad de cómputo individual.

La refrigeración se integra con la arquitectura

La elevada densidad de potencia de estos sistemas también introduce un problema térmico. Cerebras incorpora refrigeración líquida directa dentro de la arquitectura modular que rodea a cada procesador.

Esto responde a una tendencia cada vez más evidente en centros de datos para IA: aumentar la densidad de cómputo implica aumentar simultáneamente la densidad térmica.

No basta con instalar procesadores más rápidos.

La infraestructura debe ser capaz de: suministrar la potencia, convertirla con pérdidas mínimas para entregar corriente al procesador y así extraer el calor al  transferir los datos logrando mantener la disponibilidad del sistema.

Si cualquiera de estos subsistemas se convierte en una restricción, el aumento de capacidad de cálculo deja de traducirse directamente en mayor rendimiento útil. Por eso Cerebras plantea el CS-4 como una arquitectura completa y no simplemente como un nuevo chip.

FUENTE: https://www.reuters.com/

FOTO: https://www.cerebras.ai/cs4

Escrito por
Autor Verificado

Cuenta con mas de 40 años en la industria del petróleo y gas, es un experto en mantenimiento e inspección de Ultrasonido Nivel I. Su compromiso con la excelencia asegura la confiabilidad de equipos críticos. Destaca por su vasta experiencia, comprensión integral de metodologías y adaptabilidad a nuevas tecnologías.