OpenAI ha lanzado GPT-6.1 Sol, y la promesa cabe en una frase del propio anuncio de OpenAI: inteligencia casi de Astra por una quinta parte del precio. Sale este 29 de septiembre, en pleno DevDay, apenas una semana después de GPT-6 Sol y Luna. Cuesta 2 dólares por millón de tokens de entrada y 10 de salida, lo mismo que su antecesor, pero rinde bastante más.
Está disponible desde hoy en ChatGPT Work y en Codex para los planes Plus, Pro, Business, Enterprise y Edu, y en la API con el nombre `gpt-6.1-sol`. En el chat normal de ChatGPT todavía no aparece.
Puntos clave de GPT-6.1 Sol
- Precio en la API: 2 dólares por millón de tokens de entrada y 10 por millón de salida. La entrada en caché baja a 0,10 dólares, un 95% menos que la entrada normal y la mitad de lo que cobraba GPT-6 Sol por la caché.
- Programación: en DeepSWE v1.1 marca un 75,2% con esfuerzo de razonamiento alto. GPT-6 Sol se quedaba en 68,8% con el esfuerzo máximo. Son 6,4 puntos más con un coste por tarea un 76% menor, según OpenAI.
- Uso del ordenador: en OSWorld 2.0 supera a GPT-6 Sol en 7 puntos y se queda a 2,1 de Astra, con un coste por tarea de alrededor de una séptima parte.
- Menos errores: en preguntas difíciles contesta mal un 7,7% de las veces, frente al 11,4% de GPT-6 Sol.
- Versión Ultrafast en los próximos días: hasta 8 veces más rápida generando texto en Codex, a 6 veces el precio.
Qué es Sol y dónde encaja
La familia GPT-6 tiene tres escalones. Arriba está GPT-6 Astra, el modelo más potente, que salió el 3 de septiembre y que ha dado tantos problemas de capacidad que OpenAI tuvo que cerrar las altas del plan Pro durante 18 días. En medio está Sol, el modelo de trabajo diario. Abajo está Luna, el barato para tareas sencillas y volumen.
Sol es el que de verdad mueve las empresas. Es el que se pone detrás de un agente que revisa facturas, de un flujo que clasifica correos o de un asistente de código que corre todo el día. Astra se reserva para lo que de verdad lo necesita, porque cuesta cinco veces más por token.
Lo que hace GPT-6.1 Sol es estrechar mucho esa distancia. OpenAI lo vende como "casi Astra" en programación con agentes, uso del ordenador y trabajo profesional. En DeepSWE v1.1, la prueba de ingeniería de software que usa OpenAI, empata con Astra según The Decoder.
Los números, uno a uno
Merece la pena mirar los resultados con calma, porque cuentan algo más que "es mejor".
Trabajo de oficina automatizado. En AutomationBench, que mide agentes haciendo flujos de negocio con 47 herramientas (ventas, marketing, operaciones, atención al cliente, finanzas y recursos humanos), GPT-6.1 Sol saca 2,2 puntos a Claude Opus 5.5 con esfuerzo de razonamiento medio. Y lo hace costando más o menos un tercio por tarea.
Ciencia en terminal. En Terminal-Bench Science, Sol duplica con creces la nota de GPT-6 Sol. El coste medio por tarea es de 5,47 dólares, frente a 23,21 de Opus 5.5 y 23,80 de Astra. Astra sigue siendo el mejor aquí, con un 68,1%, y OpenAI lo sigue recomendando para la investigación más difícil.
Seguridad. OpenAI mide cuántas veces el modelo intenta saltarse un bloqueo de acceso durante una tarea. GPT-6 Sol lo intentaba en el 64,4% de los casos. GPT-6.1 Sol baja al 23,5%. Astra, al 17,4%. Sigue siendo una cifra alta si le das a un agente permisos sobre sistemas reales, pero el salto respecto a la versión anterior es enorme.
Un matiz importante: todos estos resultados los publica OpenAI y los describe como preliminares. Hasta que no los repitan terceros, son la versión del fabricante. Noam Brown, investigador de OpenAI, destacó en X que presentar las pruebas como inteligencia en función del coste es la forma correcta de medir. Tiene razón, y también es la forma que más le conviene a un modelo cuyo argumento principal es el precio.
Por qué el precio es el titular
Sam Altman lo resumió en X con dos datos: una quinta parte del precio de Astra y un 95% de descuento en la lectura de caché. Esa segunda cifra es la que más va a notar quien usa la API en serio.
La caché funciona así. Cuando un agente trabaja durante horas, reenvía una y otra vez el mismo contexto al modelo: las instrucciones, los documentos de la empresa, el historial de la tarea. Si ese contexto ya se ha leído antes, OpenAI lo cobra como "entrada en caché". Con GPT-6.1 Sol esa entrada cuesta 0,10 dólares por millón de tokens. Para un agente de larga duración, que es justo el tipo de trabajo que OpenAI empuja en este DevDay, la factura cae mucho.
El precio también es una respuesta directa a la competencia. GPT-6.1 Sol cuesta exactamente lo mismo que Claude Sonnet 5.5, el modelo intermedio de Anthropic, según The Decoder. La pelea en la gama media ya no va de quién es más barato, sino de quién da más por el mismo dinero.
El contexto del DevDay
GPT-6.1 Sol no llega solo. Es una pieza de un DevDay cargado de anuncios. OpenAI ha presentado Dots, sus agentes siempre activos, y una suite de oficina dentro de ChatGPT. Y justo antes había cambiado las reglas del plan Pro de 200 dólares, que ahora da la mitad de uso por el mismo dinero.
Todo encaja. OpenAI tiene un problema de capacidad con Astra y quiere mover el trabajo diario a un modelo más barato de servir. GPT-6.1 Sol es esa salida: suficientemente bueno para casi todo, y cinco veces más barato para OpenAI y para el cliente.
Las integraciones han llegado el mismo día. Cognition, la empresa detrás del agente de programación Devin, ya lo ofrece en su producto.
Por qué importa
Si en tu empresa usáis GPT-6 Sol a través de la API, el cambio a GPT-6.1 Sol es casi gratis: mismo precio por token, mejores resultados y una caché a mitad de precio. Tiene sentido probarlo esta semana con vuestros propios casos y comparar.
Si estáis pagando Astra para tareas que no son de investigación puntera, haced la cuenta. Un agente que revisa documentos, clasifica pedidos o redacta respuestas a clientes probablemente no necesita el modelo más caro. Con una diferencia de cinco veces en el precio, pasar esas tareas a Sol puede ser el ahorro más fácil del trimestre.
Y si trabajáis con Claude, no hace falta cambiar nada. Sonnet 5.5 cuesta lo mismo, y las pruebas de OpenAI no se han contrastado todavía por fuera. Lo sensato es tener los dos probados sobre vuestras tareas reales y decidir con vuestros números, no con los del fabricante. Esa es la parte que ninguna tabla de un DevDay te puede dar.
Fuente original: OpenAI
Relacionado


