Cerebras vs NVIDIA: el chip a escala de oblea que desafía el reinado de las GPUs en IA

Durante más de una década, el entrenamiento y la ejecución de modelos de inteligencia artificial ha girado en torno a un protagonista casi indiscutible: la GPU de NVIDIA. Sin embargo, una empresa llamada Cerebras Systems ha decidido replantear el problema desde la raíz con una idea tan ambiciosa como contraintuitiva: en lugar de fabricar muchos chips pequeños y conectarlos entre sí, ¿por qué no convertir una oblea de silicio entera en un único procesador gigante? El resultado es el Wafer-Scale Engine, y representa una de las apuestas arquitectónicas más radicales que ha visto el sector del cómputo para IA.

El enfoque tradicional de NVIDIA: muchas GPUs trabajando en equipo

El modelo de NVIDIA parte de una premisa clásica de la industria de los semiconductores. De cada oblea de silicio se recortan decenas de chips individuales (las GPUs), cada uno con su propio encapsulado, su memoria de alto ancho de banda (HBM) y sus interfaces de comunicación. Una GPU moderna como la H100 o la B200 de la familia Blackwell concentra una enorme potencia en un solo paquete, pero para entrenar modelos de gran tamaño hace falta conectar cientos o miles de ellas.

Esa interconexión es precisamente donde NVIDIA ha construido buena parte de su ventaja. Tecnologías como NVLink, NVSwitch e InfiniBand permiten que muchas GPUs se comuniquen a gran velocidad, mientras que el ecosistema de software CUDA actúa como pegamento que une todo y facilita a los desarrolladores aprovechar ese hardware. El reto inherente a este diseño es que, cuando los datos tienen que viajar de un chip a otro a través de cables y conmutadores, se introduce latencia y se consume energía. A escala de miles de GPUs, esa comunicación entre dispositivos se convierte en uno de los principales cuellos de botella.

La propuesta de Cerebras: un solo chip del tamaño de una oblea

Cerebras da la vuelta al planteamiento. En lugar de trocear la oblea, la mantiene entera y la convierte en un único procesador descomunal. Según la propia compañía, su tercera generación, el WSE-3, mide unos 46.225 mm² y alberga alrededor de 4 billones de transistores junto a 900.000 núcleos optimizados para IA, ofreciendo 125 petaflops de cómputo. Para poner esas cifras en contexto, Cerebras afirma que su chip tiene «19× más transistores y 28× más cómputo que la NVIDIA B200».

La gran ventaja de mantener todo en una sola pieza de silicio es que la comunicación entre núcleos ocurre dentro del propio chip, a velocidades muy superiores a las de cualquier cableado externo. Toda la memoria está integrada en la oblea y muy cerca de las unidades de cómputo, lo que dispara el ancho de banda y elimina gran parte de la latencia asociada a mover datos entre dispositivos separados. En la práctica, un problema que en el mundo GPU requiere coordinar muchísimas tarjetas, en el mundo Cerebras puede resolverse con la simplicidad de un único dispositivo.

El problema del rendimiento de fabricación

La objeción evidente a fabricar un chip del tamaño de una oblea es el rendimiento productivo. En cualquier proceso de fabricación de semiconductores aparecen defectos, y en un chip tan enorme la probabilidad de que existan imperfecciones es prácticamente del 100%. La solución de Cerebras no consiste en evitar los defectos, sino en diseñar para convivir con ellos: incorpora núcleos de cómputo redundantes, rutas de comunicación redundantes y una arquitectura «fail-in-place» capaz de aislar las zonas defectuosas y redirigir el trabajo a su alrededor.

¿En qué se traduce todo esto?

Donde más se nota la diferencia es en la inferencia, es decir, en la ejecución de modelos ya entrenados. Cerebras sostiene que su plataforma en la nube puede ser hasta 15 veces más rápida que las GPUs en este tipo de tareas, algo especialmente relevante para aplicaciones interactivas, asistentes conversacionales, flujos de trabajo con agentes y sistemas de razonamiento que encadenan muchas llamadas al modelo. Cuando cada respuesta llega en una fracción del tiempo habitual, no solo mejora la experiencia de usuario, sino que se abre la puerta a ejecutar más pasos de razonamiento dentro del mismo presupuesto de latencia.

Conviene matizar que las cifras de comparación proceden del propio fabricante y dependen mucho del modelo, la carga de trabajo y el escenario concreto. Además, NVIDIA mantiene una ventaja difícil de igualar en madurez de ecosistema, disponibilidad, herramientas y comunidad de desarrolladores gracias a CUDA y a años de adopción masiva.

Dos filosofías para el mismo objetivo

En el fondo, Cerebras y NVIDIA persiguen lo mismo (más potencia de cómputo para la IA), pero parten de filosofías opuestas. NVIDIA escala «hacia fuera», sumando muchos chips potentes y perfeccionando la red que los conecta, apoyándose en un ecosistema de software dominante. Cerebras escala «hacia dentro», concentrando una cantidad descomunal de cómputo y memoria en una única pieza de silicio para minimizar la comunicación entre dispositivos.

En la práctica, esta divergencia se traduce en escenarios de uso distintos. El enfoque de NVIDIA encaja especialmente bien donde importan la flexibilidad, la portabilidad del software y la posibilidad de desplegar cargas muy variadas sobre una misma plataforma, desde el entrenamiento a gran escala hasta la inferencia de propósito general. El enfoque de Cerebras, en cambio, brilla cuando el objetivo es minimizar la latencia y exprimir al máximo la velocidad de inferencia de un modelo concreto, evitando el coste de coordinar y sincronizar muchos dispositivos.

Hay además un factor que suele quedar en segundo plano pero que pesa cada vez más: la complejidad operativa y el consumo energético. Concentrar el cómputo en una única pieza de silicio reduce la cantidad de interconexiones, cableado y nodos que hay que alimentar, refrigerar y mantener sincronizados. Para ciertas organizaciones, esa simplicidad de despliegue puede ser tan determinante como las cifras brutas de rendimiento.

No está claro que un enfoque tenga que eliminar al otro. Lo más probable es que convivan, cada uno destacando en los escenarios que mejor se adaptan a su diseño. Pero la mera existencia de un competidor capaz de cuestionar el paradigma dominante es una buena noticia para todo el sector: la innovación en hardware de IA está lejos de haberse estancado, y la competencia entre estas dos visiones promete acelerar todavía más el ritmo de avance. La pregunta ya no es si las GPUs seguirán siendo el estándar, sino cuánto espacio sabrán ganarse arquitecturas alternativas como la oblea completa de Cerebras a medida que la demanda de cómputo para IA siga creciendo.

Por admin

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *