> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# Cerebras presenta el CS-4 con tres WSE-3 Turbo y promete 30 veces la velocidad de un sistema GPU
- URL: https://www.digitalbrain.news/noticias/cerebras-cs-4-wse-3-turbo/
- Published: 2026-08-20T14:18:14.000Z
- Updated: 2026-08-21T07:42:57.000Z
- Description: Cerebras ha presentado el CS-4, la cuarta generación de su computador de IA. Monta tres procesadores Wafer Scale Engine 3 Turbo sobre su plataforma…
- Author: Ramón Pérez Coronado
- Tags: #noticias, cerebras, semiconductores, infraestructura-ia, hardware

Cerebras ha presentado el CS-4, la cuarta generación de su computador de IA. Monta tres procesadores Wafer Scale Engine 3 Turbo sobre su plataforma rack-scale Nexus, y la compañía afirma que ofrece hasta 30 veces más velocidad de [inferencia](https://www.digitalbrain.news/glosario/#inferencia) que un sistema basado en [GPU](https://www.digitalbrain.news/glosario/#gpu).

Los primeros envíos empiezan este trimestre. No hay precio publicado ni clientes anunciados.

## Las cifras

Lo que da Cerebras:

- **Más de 1.000** [**tokens**](https://www.digitalbrain.news/guias/que-es-un-token-en-ia/) **por segundo** en modelos de más de 10 billones de parámetros.
- **2 microsegundos** de latencia entre obleas.
- **Hasta 10 veces más rendimiento por vatio** que el CS-3.
- Ancho de banda de entrada/salida **doblado** frente a la generación anterior.
- **50% menos componentes** que el CS-3.
- Despliegue en horas, no en días.

La compañía entrega el doble de potencia a los procesadores que en sistemas anteriores y sitúa la conversión de energía cien veces más cerca del chip que en una placa de GPU. Eso, en un centro de datos, es tan importante como el rendimiento bruto: la energía y la refrigeración son la restricción real.

Lo que no publica: número de transistores, número de núcleos, capacidad de memoria y ancho de banda concreto. Para una comparación seria con [Nvidia](https://www.digitalbrain.news/glosario/#nvidia) esos datos hacen falta, y no están.

## Dónde encaja Cerebras

La apuesta de Cerebras siempre ha sido la misma: en vez de trocear una oblea de silicio en muchos chips y luego conectarlos, usar la oblea entera como un solo procesador. Eso elimina la comunicación entre chips, que es donde se pierde tiempo en inferencia.

Funciona para lo que funciona: velocidad de generación de tokens. No para todo.

Y aquí está el contexto que da sentido al lanzamiento. Hace unos días cubrimos que \[[OpenAI](https://www.digitalbrain.news/glosario/#openai) estrenó Ultrafast con Cerebras\](/openai-ultrafast-gpt-5-6-sol-cerebras-750-tokens/), sirviendo [GPT-5.6](https://www.digitalbrain.news/glosario/#gpt) Sol a 750 tokens por segundo. Es decir: Cerebras ya tiene un cliente de referencia visible y esta generación es la respuesta a esa demanda.

## Por qué la velocidad se ha vuelto una categoría de producto

Durante dos años el hardware de IA se vendía por capacidad de [entrenamiento](https://www.digitalbrain.news/glosario/#entrenamiento). Ahora se vende por velocidad de inferencia, y el motivo son los agentes.

Un [chatbot](https://www.digitalbrain.news/glosario/#chatbot) que responde a una persona puede tardar tres segundos sin que a nadie le importe: el humano lee más despacio de lo que el modelo escribe. Un agente que encadena veinte llamadas para completar una tarea multiplica esos tres segundos por veinte, y ahí sí duele.

Cuando el consumidor de tokens deja de ser un humano leyendo y pasa a ser otro proceso esperando, la latencia se convierte en el cuello de botella del producto entero. Eso es lo que Cerebras está vendiendo, y por eso el dato de los 2 microsegundos entre obleas importa tanto como los 1.000 tokens por segundo.

## Qué mirar si esto te afecta

Casi nadie va a comprar un CS-4\. Pero mucha gente va a consumir inferencia servida sobre uno, sin saberlo, a través de un proveedor.

Lo práctico: si tienes agentes en producción, mide cuánto de su tiempo total es latencia de modelo y cuánto es tu propio código esperando. En bastantes montajes que he visto, el modelo no es el problema: lo son las llamadas secuenciales que podrían ir en paralelo. Cambiar de proveedor rápido no arregla una arquitectura que espera de una en una.

Primero mide, luego paga por velocidad.

---

**Relacionado**

[![OpenAI estrena Ultrafast con Cerebras: GPT-5.6 Sol a 750 tokens por segundo y 14 veces más rápido](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/openai-ultrafast-gpt-5-6-sol-cerebras-750-tokens.png)OpenAI estrena Ultrafast con Cerebras: GPT-5.6 Sol a 750 tokens por segundo y 14 veces más rápido](https://www.digitalbrain.news/noticias/openai-ultrafast-gpt-5-6-sol-cerebras-750-tokens/)[![Las empresas chinas entrenan con GB300 de Nvidia desde el sudeste asiático y el control de exportaciones no lo cubre](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/china-nvidia-gb300-nubes-sudeste-asiatico.jpg)Las empresas chinas entrenan con GB300 de Nvidia desde el sudeste asiático y el control de exportaciones no lo cubre](https://www.digitalbrain.news/noticias/china-nvidia-gb300-nubes-sudeste-asiatico/)[![Ramp lanza Router, su propio enrutador de modelos, gratis hasta final de 2026](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/ramp-router-enrutador-modelos-gratis.jpg)Ramp lanza Router, su propio enrutador de modelos, gratis hasta final de 2026](https://www.digitalbrain.news/noticias/ramp-router-enrutador-modelos-gratis/)