OpenAI confirma que Sol hizo el post-entrenamiento de Luna, trabajo de un investigador senior

OpenAI confirma que Sol hizo el post-entrenamiento de Luna, trabajo de un investigador senior
Ilustración: Digital Brain

El equipo de investigacion de OpenAI ha confirmado en una entrevista exclusiva con The Deep View que uso GPT-5.6 Sol, su modelo insignia, para ejecutar el post-entrenamiento de GPT-5.6 Luna, el ligero de la familia. El dato importa por el nivel del trabajo: segun la propia OpenAI, esas tareas las haria normalmente un investigador con experiencia, no uno junior.

Puntos clave

  • Sol monto el run de post-entrenamiento de Luna, lo monitorizo, reparo problemas tecnicos por el camino, corrio las evals y superviso el flujo de punta a punta.
  • Tejal Patwardhan, responsable de post-training en OpenAI: "que Sol ayude a post-entrenar a Luna es un asunto serio. No es el tipo de tarea que le dariamos a un becario".
  • Hace un ano OpenAI prometio un "becario de investigacion automatizado" para septiembre de 2026. Con esto se ha adelantado a su propio calendario en la parte que mas cuesta: encadenar todas las piezas de un entrenamiento real.
  • La siguiente promesa del calendario es un "investigador de IA automatizado" para marzo de 2028.

Del truco puntual al flujo completo

Usar un modelo para ayudar a entrenar otro tiene precedente en la propia OpenAI: en febrero de 2026 presento GPT-5.3-Codex como "el primer modelo que fue instrumental en crearse a si mismo", y Sam Altman conto lo rapido que salio esa version usando el propio 5.3-Codex.

La diferencia esta en el alcance. Katy Shi, que lidera el equipo de investigacion de Codex, lo resume asi: antes se le podia pedir al modelo una pieza suelta del proceso. Juntar todas las piezas hasta llegar a un run de entrenamiento que termina bien es otro nivel, y eso es lo que Sol hizo con Luna menos de seis meses despues.

Patwardhan anade el matiz que separa esto de una demo: "la diferencia es la magnitud de la capacidad, la cantidad de trabajo, lo senior que tiene que ser la persona que normalmente lo hace y cuanto contexto requiere".

OpenAI lo distingue del auto-mejoramiento recursivo, ese escenario donde los modelos construyen a los modelos siguientes sin humanos en el medio. Aqui los investigadores siguieron decidiendo que se entrenaba y por que. Y tampoco se elimino a nadie del equipo: segun Shi, "el 80% del trabajo de un investigador a veces es solo conseguir que el experimento arranque". Sol se comio esa parte, la de lanzar, depurar y vigilar, y los investigadores dedicaron ese tiempo a disenar experimentos.

El movimiento no se queda en Luna: OpenAI dice que va a repasar todo su pipeline de investigacion para ver que otras partes puede acelerar con sus propios modelos. Encaja con lo que ya se ha visto este mes, con Sol reescribiendo los kernels de GPU de OpenAI y recortando un 20% el coste de servir el modelo.

Por qué te importa aunque no entrenes modelos

La lectura util para un founder u operador va mas alla del titular de laboratorio. Lo que OpenAI describe es el patron de delegar a un modelo un flujo largo con supervision, errores intermedios y criterio tecnico, y que el flujo termine bien. Si eso funciona para un entrenamiento de varios dias, funciona para un cierre contable, una migracion de datos o un proceso de compras.

Fijate en la frase de Shi: el 80% del trabajo era arrancar y vigilar el experimento. En la mayoria de empresas pasa igual con los procesos internos. La parte creativa es pequena; la grande es lanzar, comprobar, corregir y volver a lanzar. Esa es exactamente la parte que estos sistemas empiezan a hacer solos.

La cautela tambien viene en la propia entrevista: esto salio de un equipo que conoce su infraestructura al milimetro y que superviso el resultado con evals. Delegar un flujo critico sin esa capa de verificacion sigue siendo mala idea, en un laboratorio y en una pyme.


Relacionado