OpenAI ha abierto Ultrafast, un nivel de servicio de su API que corre GPT-5.6 Sol a hasta 750 tokens de salida por segundo, catorce veces la velocidad del mismo modelo en el nivel estándar. Lo mueve hardware de Cerebras, y de momento solo lo ven un grupo reducido de clientes.
Puntos clave
- Hasta 750 tokens de salida por segundo con GPT-5.6 Sol, el mismo modelo, sin versión reducida.
- 14 veces la velocidad del nivel estándar. 11 veces más rápido que Fable 5 y 5 veces más que Opus 4.8 en modo rápido, según Cerebras.
- Humanity's Last Exam completo, 2.500 preguntas de nivel doctorado, en 11 horas y 11 minutos. Fable 5 tardó 78 horas y 27 minutos.
- 5,6 veces de aceleración de extremo a extremo en GDP-Val, la prueba de tareas con valor económico, sin pérdida de calidad.
Qué hay debajo
La pieza de hardware es el Wafer-Scale Engine de Cerebras, un chip del tamaño de una oblea entera con 44 GB de SRAM a bordo. Los pesos del modelo viven en el propio chip, así que la inferencia no pasa por el trayecto que estrangula a una GPU: ir a buscar los pesos a la memoria externa en cada paso.
Eso explica por qué la ganancia está en tokens por segundo y no en calidad. Es el mismo GPT-5.6 Sol corriendo sobre un sustrato distinto. OpenAI lo dice sin adornos en su anuncio: hasta ahora, tener velocidad en tiempo real significaba bajar a un modelo más pequeño o especializado.
El dato de Humanity's Last Exam es el que mejor se entiende. Once horas contra setenta y ocho para el mismo examen de 2.500 preguntas. Siete veces menos tiempo de reloj. Si tu proceso es un agente que encadena cientos de llamadas, esa diferencia no es comodidad, es si el proceso cabe en una jornada o no.
Los casos que OpenAI pone por delante
El anuncio y la cobertura de TechCrunch coinciden en el tipo de trabajo: informes de ingeniería, escritos legales, modelos financieros, respuesta a incidentes en producción, detección de amenazas, atención al cliente, análisis de mercado y comercio electrónico.
El patrón común no es el volumen, es la latencia. Todos son casos donde una respuesta que llega en tres segundos vale y una que llega en cuarenta ya no sirve para nada. Un agente de soporte que tarda medio minuto en cada turno no es un agente de soporte.
Lo que no se sabe
No hay precio publicado. Tampoco límites de contexto para el nivel Ultrafast, ni cuotas, ni fecha de apertura general. OpenAI dice que ampliará el acceso a medida que crezca la capacidad, que es la forma habitual de decir que el hardware es el límite.
Ese silencio en el precio es la incógnita real. Un nivel de servicio premium sobre hardware escaso rara vez sale al mismo coste por token que el estándar, y sin ese número no se puede decidir nada. En un mercado que empieza a medir el coste por tarea completada en lugar del coste por token, catorce veces más rápido puede salir a cuenta incluso pagando más por millón. O puede no salir.
Por qué importa
Si tienes un caso de uso que descartaste por lento, esta es la noticia que lo reabre. Todo lo que quedó fuera porque el modelo bueno tardaba demasiado y el modelo rápido no acertaba entra otra vez en la lista: un agente que atiende en directo, un análisis que tiene que estar antes de que acabe la llamada, una revisión que se hace mientras el cliente espera.
Lo práctico ahora es preparar la prueba, no pedir el acceso y esperar. Ten identificado qué proceso concreto pondrías en Ultrafast, cuántas llamadas hace y cuánto tarda hoy de extremo a extremo. Cuando salga el precio, esa comparación se hace en una tarde. Sin ella, se hace en tres semanas.
Relacionado


