Cerebras presenta el CS-4 con tres WSE-3 Turbo y promete 30 veces la velocidad de un sistema GPU

Cerebras presenta el CS-4 con tres WSE-3 Turbo y promete 30 veces la velocidad de un sistema GPU
Fuente: cerebras.ai

Cerebras ha presentado el CS-4, la cuarta generación de su computador de IA. Monta tres procesadores Wafer Scale Engine 3 Turbo sobre su plataforma rack-scale Nexus, y la compañía afirma que ofrece hasta 30 veces más velocidad de inferencia que un sistema basado en GPU.

Los primeros envíos empiezan este trimestre. No hay precio publicado ni clientes anunciados.

Las cifras

Lo que da Cerebras:

  • Más de 1.000 tokens por segundo en modelos de más de 10 billones de parámetros.
  • 2 microsegundos de latencia entre obleas.
  • Hasta 10 veces más rendimiento por vatio que el CS-3.
  • Ancho de banda de entrada/salida doblado frente a la generación anterior.
  • 50% menos componentes que el CS-3.
  • Despliegue en horas, no en días.

La compañía entrega el doble de potencia a los procesadores que en sistemas anteriores y sitúa la conversión de energía cien veces más cerca del chip que en una placa de GPU. Eso, en un centro de datos, es tan importante como el rendimiento bruto: la energía y la refrigeración son la restricción real.

Lo que no publica: número de transistores, número de núcleos, capacidad de memoria y ancho de banda concreto. Para una comparación seria con Nvidia esos datos hacen falta, y no están.

Dónde encaja Cerebras

La apuesta de Cerebras siempre ha sido la misma: en vez de trocear una oblea de silicio en muchos chips y luego conectarlos, usar la oblea entera como un solo procesador. Eso elimina la comunicación entre chips, que es donde se pierde tiempo en inferencia.

Funciona para lo que funciona: velocidad de generación de tokens. No para todo.

Y aquí está el contexto que da sentido al lanzamiento. Hace unos días cubrimos que [OpenAI estrenó Ultrafast con Cerebras](/openai-ultrafast-gpt-5-6-sol-cerebras-750-tokens/), sirviendo GPT-5.6 Sol a 750 tokens por segundo. Es decir: Cerebras ya tiene un cliente de referencia visible y esta generación es la respuesta a esa demanda.

Por qué la velocidad se ha vuelto una categoría de producto

Durante dos años el hardware de IA se vendía por capacidad de entrenamiento. Ahora se vende por velocidad de inferencia, y el motivo son los agentes.

Un chatbot que responde a una persona puede tardar tres segundos sin que a nadie le importe: el humano lee más despacio de lo que el modelo escribe. Un agente que encadena veinte llamadas para completar una tarea multiplica esos tres segundos por veinte, y ahí sí duele.

Cuando el consumidor de tokens deja de ser un humano leyendo y pasa a ser otro proceso esperando, la latencia se convierte en el cuello de botella del producto entero. Eso es lo que Cerebras está vendiendo, y por eso el dato de los 2 microsegundos entre obleas importa tanto como los 1.000 tokens por segundo.

Qué mirar si esto te afecta

Casi nadie va a comprar un CS-4. Pero mucha gente va a consumir inferencia servida sobre uno, sin saberlo, a través de un proveedor.

Lo práctico: si tienes agentes en producción, mide cuánto de su tiempo total es latencia de modelo y cuánto es tu propio código esperando. En bastantes montajes que he visto, el modelo no es el problema: lo son las llamadas secuenciales que podrían ir en paralelo. Cambiar de proveedor rápido no arregla una arquitectura que espera de una en una.

Primero mide, luego paga por velocidad.


Relacionado