OpenAI ha entrenado a GPT-6 Astra con tareas reales de Ironclad, el software de gestión de contratos. En 11 tareas de configuración legal y de compras, Astra cumple de media un 55% de los criterios, frente al 41,6% de GPT-5.6 Sol, y tarda unos 19 minutos por intento en vez de 37.
Ironclad es el primer socio de un programa nuevo: OpenAI busca empresas de software que le traigan tareas profesionales que los agentes de hoy no saben hacer bien, para convertirlas en material de entrenamiento.
Puntos clave de la colaboración
- 11 tareas de trabajo legal, comercial y de compras dentro de Ironclad. A un usuario con experiencia le llevan entre 30 y 40 minutos cada una.
- Evaluación fina: cada tarea se puntúa con entre 8 y 50 criterios, según su complejidad.
- Resultado: Astra (con razonamiento Max) saca un 55,0% de media; GPT-5.6 Sol (con razonamiento High), un 41,6%. Es un 32% más de puntuación.
- Tiempo: de 37,0 a 19,2 minutos estimados por intento, un 48% menos. Un modelo interno que se usó para desarrollar Astra llega ya al 63,7%.
Qué tareas le han puesto al agente
El ejemplo que da OpenAI es muy de oficina. Un equipo legal monta el proceso para comprar software: Finanzas aprueba por encima de cierto importe, Seguridad revisa algunas peticiones y Legal mira los contratos con cláusulas fuera de lo estándar.
Quien lo configura tiene que convertir esa lista en un formulario de entrada, plantillas de documentos, reglas de aprobación y un registro del contrato final. El agente tiene que hacer lo mismo moviéndose por la interfaz de Ironclad, y luego comprobar que una petición por encima del umbral va por un camino y una por debajo, por otro.
Esto es lo que OpenAI llama computer use: el agente maneja el programa como lo haría una persona, leyendo la pantalla, rellenando campos y pulsando botones, sin una API hecha a medida. Cuando presentó GPT-6 Astra ya enseñó al modelo preparando documentos y probando webs. El paso siguiente que declara es el software especializado, donde cada empresa tiene sus reglas de negocio y un error de configuración no se ve hasta que una compra se aprueba sin pasar por Finanzas.
Las 11 tareas las eligieron empleados de Ironclad y gente de OpenAI que usa Ironclad a diario. Entre ellas: montar acuerdos de confidencialidad (NDA), crear procesos de aprobación de compras y actualizar una cláusula reutilizable para que cambie según la jurisdicción que elige quien la pide.
Cómo lo han entrenado
Ironclad puso entornos alojados de su producto para que el modelo practicara. Los investigadores de OpenAI crearon tareas sintéticas parecidas a las reales y entrenaron con aprendizaje por refuerzo: el modelo intenta, recibe nota contra los criterios y mejora.
El detalle que más me tranquiliza es el de los datos. Según la nota al pie de OpenAI, las tareas sintéticas salen de contratos públicos de EDGAR, la base de datos de la SEC estadounidense, filtrados para quitar información personal. No usaron datos de clientes de OpenAI, ni contratos internos, ni contratos de clientes de Ironclad.
En uno de los vídeos de la demo se ve la diferencia en una misma tarea: Astra cumple cerca del 94% de los criterios en unos 20 minutos estimados y GPT-5.6 Sol, cerca del 85% en 32.
La letra pequeña de las cifras
OpenAI pone dos avisos, y conviene tenerlos presentes antes de citar el 48%:
- Los resultados cubren solo esas 11 tareas, no todo lo que se hace en Ironclad.
- Los tiempos son estimaciones simuladas, calculadas a partir de velocidades supuestas de procesamiento del modelo. No es ahorro de tiempo medido en clientes reales.
Hay un tercer matiz que la nota no comenta. La comparación es contra GPT-5.6 Sol, cuando OpenAI ya lanzó GPT-6 Sol el 22 de septiembre y GPT-6.1 Sol una semana después. Medir contra el modelo de la generación anterior hace que el salto parezca más grande.
Y un 55% de criterios cumplidos quiere decir que casi la mitad siguen fallando. La propia Sunita Verma, CTO de Ironclad, lo dice a su manera: un agente útil en contratos tiene que entender el ciclo completo sin saltarse los controles de los que depende el negocio.
Qué gana Ironclad
Para Ironclad, el trato es meter sus problemas en la fase en la que se entrena el modelo, en vez de sufrir lo que salga. Si un agente pierde una regla a mitad de tarea, limita lo que un fabricante de software puede pedirle con confianza.
OpenAI ha abierto la puerta a más empresas. Pide un ejemplo concreto de lo que el agente no sabe hacer, pruebas de dónde falla y cómo se juzgaría un buen resultado, además de expertos en ese trabajo, un entorno seguro para probar y datos que se puedan usar para investigar. Encaja con lo que ya hizo con Astra for Law para bufetes: modelos afinados por vertical, con el software de cada sector como campo de prácticas.
Por qué importa
Si en tu empresa alguien configura flujos de aprobación en un software de contratos, un ERP o un CRM, esto es un adelanto de lo que viene: agentes entrenados dentro de la herramienta concreta que usas.
Mi lectura práctica es doble. Primero, el agente rinde mejor donde el fabricante ha trabajado con el laboratorio, así que pregunta a tus proveedores de software si están en algún programa de este tipo. Segundo, con un 55% de acierto, cualquier flujo que monte un agente necesita una persona que lo revise y lo pruebe con casos reales antes de ponerlo en marcha. Igual que harías con un becario nuevo.
Fuente original: OpenAI
Relacionado

