OpenAI y Microsoft sabían que abrían un doom loop en la web

OpenAI y Microsoft sabían que abrían un doom loop en la web
Fuente: theverge.com

OpenAI y Microsoft escribieron por dentro que su producto estaba abriendo un "doom loop" en la web y siguieron adelante igual. Lo dice un documento de 92 páginas del pleito del New York Times contra las dos empresas, desprecintado el 18 de septiembre, en el que un directivo de Microsoft llama a la recolección de datos de entrenamiento "el mayor robo de trabajo de la historia de la humanidad".

Puntos clave

  • Documento de 92 páginas del caso del New York Times contra OpenAI y Microsoft, desprecintado el 18 de septiembre de 2026.
  • Un escrito interno de Microsoft describe su estrategia de contenido con IA como un "doom loop" que perjudica a la vez a sus propios modelos y a toda la web.
  • Los peritos de la propia OpenAI estiman que las referencias desde buscadores han caído hasta un 60% por los resúmenes de IA.
  • Empleados de OpenAI reconocían que GPT-4 iba a ser "increíblemente bueno regurgitando" material con derechos.
  • Microsoft se desmarca y dice que las frases más duras son la opinión individual de un empleado.

Lo que se decía dentro de Microsoft

La cita que da título a todo esto sale de un documento interno de Microsoft: "Nuestra estrategia de contenido con IA ha iniciado un 'doom loop' que va a dañar el rendimiento de nuestros modelos y el de toda la web al mismo tiempo. Es muy inusual que un producto final amenace los cimientos económicos de sus proveedores esenciales, pero esa es la situación que hemos creado para nuestro negocio de LLM respecto a su cadena de suministro de contenido".

En otro punto del mismo escrito la cosa se dice todavía más corta: los LLM son "un producto que destruye su propia cadena de suministro".

Las frases más afiladas vienen de Brent Hecht, director de ciencia aplicada de Microsoft. Según el documento, Hecht calificó la recolección de datos de ChatGPT y Copilot como "el mayor robo de trabajo de la historia de la humanidad" y dijo que la defensa de su empresa hacía "una burla completa de la idea de uso legítimo".

Satya Nadella aparece reconociendo que los chatbots han sustituido a la búsqueda y han quitado la necesidad de ir a la fuente. Nick Turley, responsable de ChatGPT, lo formula con más filo todavía: una vez que tienes la respuesta del chatbot, "no hay buena razón para hacer clic" en el enlace de origen.

Lo que sabían sobre la memorización

Puertas adentro, en OpenAI tenían claro que sus modelos reproducen material protegido de forma literal. El escrito cita a empleados diciendo que GPT-4 "memorizó un montón de datos y por eso va a ser increíblemente bueno regurgitando", y eso pese a reconocer que evitar la memorización era importante para "minimizar las violaciones de copyright".

A continuación el documento enumera ejemplos de ChatGPT escupiendo párrafos largos tal cual de artículos del Times, del Mercury News, de The Denver Post, de LifeHacker y de Eurogamer.

Con el contenido de pago el contraste es incómodo. Nadella dice que "todo lo que esté tras un muro de pago debería licenciarse", y un representante de OpenAI declaró que desconocía cualquier esfuerzo por detectar o retirar contenido de pago de los datos de entrenamiento.

Microsoft también admite en el documento que sabía cómo se iba a percibir el rastreo masivo de internet: "casi nadie pretendía que el contenido que creó se usara de esta forma, ni se les compensa por su uso".

La cifra que importa para cualquiera con una web

El dato duro del documento son los peritos de la propia OpenAI. Sus expertos en medios y economía atribuyen la caída del tráfico de referencia de sitios como el Times directamente a los resúmenes de IA, incluidos los AI Overviews de Google, y manejan bajadas de hasta el 60%.

Es OpenAI reconociendo ante un tribunal que el Google Zero del que llevan dos años hablando los editores se puede medir.

En paralelo, Jack Clark, director de política de OpenAI, aparece diciendo que estaban "creando sistemas que sustituyen el trabajo de las personas que definen la cultura de una sociedad". Y Greg Brockman, cofundador, hablando de los "gazillones" de dólares que podía dar el negocio comercial. Documentos internos describían ChatGPT como "el quiosco moderno".

Microsoft intenta separarse de sus propios correos

La empresa lleva días poniendo distancia. Su portavoz, Alex Haurek, dijo a The Verge que los comentarios de Hecht "reflejan la perspectiva individual de un empleado, no son un análisis legal y no representan la posición de la compañía".

En otro escrito judicial, Jordan Usdan, general manager de estrategia y operaciones de datos en Microsoft AI, describe el papel de Hecht como adversarial por diseño: sostiene que está contratado para aportar "puntos de vista asimétricos, futuristas y académicos" y que no habla por Microsoft sobre el efecto de la IA en los creadores de contenido.

Sobre Nadella, Haurek añadió que su testimonio y la posición de Microsoft en el caso son "perfectamente consistentes", que habló de principios generales y que esas observaciones no deben confundirse con conclusiones sobre las cuestiones de copyright que tiene delante el tribunal.

El pleito viene de largo y con el viento institucional de cara para OpenAI: a principios de septiembre el gobierno de Estados Unidos se posicionó a favor de OpenAI en este mismo caso.

Por qué importa

Si tu empresa tiene una web que captaba visitas desde Google, este documento es la confirmación por escrito de que el motor que te las mandaba se apagó a propósito y con conocimiento de causa. La estimación del 60% de caída en referencias la firman los peritos de la propia OpenAI, no un despacho de los editores.

Para el trabajo del lunes hay dos consecuencias prácticas. El tráfico orgánico de artículos que responden preguntas simples no vuelve, así que dejar de producirlos ahorra dinero. Y el valor se desplaza hacia lo que un resumen no puede servir en su respuesta: datos propios, herramientas, comunidad y correo directo al buzón.

Es exactamente el motivo por el que llevamos un año empujando la newsletter por encima del blog. El correo llega sin pasar por el algoritmo de nadie.

Fuente original: The Verge


Relacionado