OpenAI publica 722 manuscritos de matemáticas escritos por su IA

OpenAI publica 722 manuscritos de matemáticas escritos por su IA
Fuente: openai.com

OpenAI ha publicado 722 manuscritos de matemáticas producidos por un modelo interno que todavía no ha lanzado. Están agrupados en 372 familias de resultados y salen en un repositorio de GitHub, con muchas de las demostraciones comprobadas por ordenador en Lean.

Es la entrega que OpenAI llevaba semanas anunciando. En septiembre dijo que su modelo había resuelto más de 100 problemas abiertos. Ahora enseña el material completo, con cifras de cómputo y resúmenes del razonamiento incluidos.

Puntos clave del lote

  • 722 manuscritos en 372 familias. Una familia agrupa un resultado principal con sus argumentos complementarios, consecuencias o demostraciones alternativas.
  • Unos 4.000 problemas planteados al modelo durante la evaluación. De ahí, tras exigir un nivel mínimo de relevancia, salen los 722 papers.
  • 3 horas de ChatGPT Pro de media por resultado. Es la forma que ha elegido OpenAI de medir el cómputo, en equivalente a lo que pensaría su plan más caro.
  • Lean, en parte. Muchas pruebas están formalizadas y verificadas por máquina, pero no todas. El propio repositorio avisa de que algunos resultados sin formalizar podrían tener fallos.

Qué hay dentro del repositorio

El repositorio tiene tres capas. Una carpeta con los preprints (PDF, código fuente y cómo citarlos), un mapa para localizar cada manuscrito y una librería de Lean, el lenguaje de programación que permite que un ordenador compruebe una demostración paso a paso.

OpenAI publica además resúmenes abreviados del razonamiento del modelo en un puñado de resultados. Los títulos dan una idea del alcance: las conjeturas de Mahler, la conjetura de Kaplansky sobre finitud directa en característica dos, la fórmula de Mézard-Parisi para vidrios de espín diluidos o el sistema de Vlasov-Maxwell relativista en tres dimensiones.

Hay dos excepciones al procedimiento estándar, y son las que más ruido van a hacer. Una es una región libre de ceros para la función zeta de Riemann (la parte con Re(s) > 11/12), cuyo texto editaron personas para que se leyera mejor. La otra es una demostración de la conjetura de Hodge para variedades abelianas CM. Ojo: es un caso particular de la conjetura de Hodge, uno de los problemas del Milenio, y no la conjetura completa.

Las versiones quedan guardadas. Si hay que corregir algo, sale como versión nueva y la anterior sigue accesible. Para un lote de este tamaño con partes sin verificar, es lo mínimo.

Cómo se ha llegado aquí

Llevamos un mes de culebrón entre OpenAI y los matemáticos, y este lote es la respuesta a las críticas.

Ese consejo es el AGMAI (Advisory Group on Mathematics and Artificial Intelligence), alojado en el Institute for Advanced Study de Princeton. A finales de septiembre publicó sus primeras recomendaciones, según recoge The Verge: publicar rápido y por canales académicos cuando se pueda, decir qué modelo se ha usado, con qué prompts y cuánto cómputo, y no usar los resultados como herramienta de marketing.

¿Cumple OpenAI lo que le pidieron los matemáticos?

En parte. Publica el cómputo (las 3 horas de Pro), las estadísticas de intentos (unos 4.000 problemas) y resúmenes del razonamiento. También ha montado protocolos de revisión y de cita, que es lo que necesita cualquier matemático que quiera construir sobre un resultado.

Lo que no da es el nombre del modelo. Habla de "un modelo interno de frontera" que dice estar preparando para lanzar de forma responsable. Y el canal es GitHub, no una revista ni arXiv. OpenAI reconoce que sigue buscando alternativas alojadas por la comunidad que cumplan las pautas del AGMAI.

Según The Verge, el propio AGMAI dice que el lote contiene soluciones a "cientos" de preguntas abiertas. El impacto real tardará meses en verse: cada resultado tiene que leerlo y comprobarlo alguien que entienda ese rincón concreto de las matemáticas, y hay 722.

OpenAI tampoco está sola. The Verge recuerda que este lote se suma a un montón creciente de resultados de OpenAI y de rivales como Anthropic, con trabajos que tocan incluso un problema del Milenio. La comunidad matemática todavía está digiriendo lo de septiembre, y le llega encima un repositorio de 722 papers.

OpenAI ha prometido además financiar talleres, congresos y programas para entender los resultados importantes producidos por IA. Todavía sin fechas ni cifras.

Qué cambia técnicamente

La cifra que más me interesa es la proporción. Unos 4.000 problemas planteados para 722 manuscritos. Aunque los números no son comparables uno a uno (un problema puede dar varios papers de la misma familia), dice que el modelo no acierta siempre y que OpenAI filtra mucho antes de publicar.

La otra cifra es el coste. Tres horas de ChatGPT Pro por resultado es mucho cómputo para una consulta, y muy poco para un resultado de investigación que a un equipo humano le llevaría meses. Y Lean es lo que hace creíble el volumen: una demostración formalizada no depende de que alguien se fíe del modelo, porque la comprueba un programa.

Por qué importa

Para una empresa que usa ChatGPT o Claude, el modelo que ha hecho esto todavía no está disponible, así que mañana no cambia nada en tu día a día.

Lo que sí deja es un patrón que vale fuera de las matemáticas. El problema de la IA en trabajo serio es fiarse del resultado, y aquí la respuesta es que una máquina verifique lo que hace otra máquina. En tu empresa, el equivalente son los tests automáticos sobre el código que escribe Claude Code o las validaciones que cruzan lo que extrae un agente contra el ERP. Si un agente produce y nadie verifica, tienes el problema que los matemáticos le han señalado a OpenAI durante todo septiembre.

Fuente original: OpenAI


Relacionado