OpenAI ha cortado una campaña de destilación contra sus modelos y señala a Moonshot AI, la empresa china detrás de Kimi, como responsable del núcleo del ataque. Lo cuenta la propia OpenAI en un informe de seguridad publicado el 30 de septiembre: desde el 1 de julio, miles de cuentas intentaron sacar el razonamiento interno de sus modelos, ese que ChatGPT no te enseña, para usarlo en entrenar otro modelo.
Es la primera vez que OpenAI pone nombre y apellidos a una acusación de este tipo. Anthropic lo hizo hace tres semanas con Alibaba, Moonshot y DeepSeek. Ahora Moonshot aparece en los dos informes.
Puntos clave
- Cuándo. La actividad empezó el 1 de julio con poco volumen. El 24 y el 25 de julio hubo picos de 16.000 peticiones con un patrón de extracción, lanzadas desde más de 4.000 usuarios.
- Cuánto. Tirando del hilo, OpenAI encontró un grupo de más de 15.000 usuarios con patrones de petición relacionados. Dice que lo desmontó del todo el 28 de julio.
- Quién. OpenAI atribuye "un núcleo" de la actividad a personas vinculadas a Moonshot AI. Admite que no tiene claro si todo venía de un solo actor.
- Qué no pasó. Nadie rompió el cifrado, entró en una base de datos ni leyó conversaciones guardadas de usuarios. Las cifras son de intentos de extracción, no de extracciones conseguidas, según aclara la propia OpenAI en una nota al pie.
Qué es la destilación y por qué persiguen el razonamiento
Destilar un modelo es usarlo de profesor. Le haces muchísimas preguntas, guardas lo que responde y entrenas tu modelo con esas respuestas. Sale bastante más barato que entrenar desde cero, porque parte del trabajo caro ya lo pagó otro. Cuando se hace con el modelo de un competidor y saltándose sus condiciones de uso, OpenAI lo llama destilación adversaria.
Lo que buscaban aquí era más valioso que la respuesta final. Los modelos de OpenAI que razonan piensan antes de contestar. Ese proceso queda en un registro interno que OpenAI llama razonamiento protegido. El usuario ve el resultado y, como mucho, un resumen. El paso a paso completo se queda guardado y cifrado.
Ese paso a paso es oro para quien quiere copiar. Con él no solo sabes qué contesta el modelo, sabes cómo llega a la respuesta. Y según OpenAI, además puede contener información que se retiene a propósito de la respuesta final.
Cómo lo hacían
El truco que describe el informe es ingenioso. Los atacantes copiaban el razonamiento cifrado de una conversación y, en otra conversación distinta, le pedían al modelo que lo descifrara y lo transcribiera. El modelo tenía delante un bloque que sí sabía leer, y lo pasaba a texto visible.
Es primo hermano del rodeo que contó Anthropic en su informe de septiembre. Ahí las campañas le pedían a Claude que "tradujera" su memoria de trabajo a japonés. En los dos casos nadie pide el razonamiento directamente: se pide una tarea inocente que obliga al modelo a sacarlo a la luz.
OpenAI reconoce además que investigadores de seguridad independientes le avisaron, por la vía de la divulgación responsable, de fallos relacionados. Uno entre modelos distintos y otro al compactar conversaciones largas (cuando el sistema resume la conversación para que quepa en memoria). OpenAI confirma que esas vías de ataque eran reales.
Cómo ha respondido OpenAI
El informe enumera las medidas, y son de tres tipos:
- Cuentas. Ha cerrado o limitado las cuentas fraudulentas, ha endurecido el alta y la infraestructura, y vigila más las redes de cuentas relacionadas.
- Técnica. Ha cerrado la vía que permitía a alguien con el razonamiento cifrado de otro usuario reproducirlo y recuperar su contenido. Y ha añadido controles que detectan y retienen las respuestas en streaming que puedan destapar razonamiento.
- Coordinación. Cuando la actividad pasaba por servicios de terceros, trabajó con esos proveedores para tumbar las cuentas. Y compartió lo que sabía con el Frontier Model Forum (el grupo donde se coordinan los grandes laboratorios en seguridad) y con canales de información de gobiernos.
El propio informe dice que el trabajo no está terminado. Las versiones de sus modelos que sirven otros, como los proveedores de nube, necesitan las mismas protecciones que ChatGPT, y ahí siguen trabajando.
De "es pronto para saberlo" a poner nombre
Hay un detalle de calendario que explica por qué esto llama la atención. El 22 de julio, Greg Brockman, presidente de OpenAI, dijo a Bloomberg que Kimi K3 era "un modelo bastante bueno" y que era "demasiado pronto" para saber si Moonshot había destilado los de OpenAI. Kimi K3 había salido días antes y se había quedado a tres puntos de Claude Fable 5.
Dos días después de esas declaraciones llegaron los picos del 24 y 25 de julio. Y el 28 la campaña ya estaba desmontada. Ahora, dos meses más tarde, OpenAI firma la atribución. El informe no dice qué modelo de Moonshot se habría beneficiado ni si la campaña llegó a tiempo de alimentar a Kimi K3, así que eso queda en el aire.
Lo que sí es un patrón es la frecuencia con la que sale el mismo nombre. Anthropic atribuyó a Moonshot unas 300.000 peticiones en 10 días desde una red de más de 5.000 cuentas. Y China abrió una investigación a DeepSeek y Moonshot por posibles fugas de datos de sus usuarios a Claude, según adelantó The Information. Moonshot, por su parte, aspira a 2.000 millones de dólares de ingresos anualizados a final de año con modelos de pesos abiertos, un negocio de márgenes muy estrechos.
A la hora de publicar esto no hemos encontrado una respuesta pública de Moonshot a la acusación de OpenAI.
Por qué importa si usas IA en tu empresa
La lectura directa es geopolítica y va de laboratorios. Pero hay dos cosas que tocan a cualquier empresa que trabaje con estos modelos.
La primera es de confianza en el proveedor. OpenAI insiste en que no se tocaron conversaciones guardadas de usuarios. Aun así, el informe menciona una vía para recuperar el razonamiento cifrado de otro usuario si ya lo tenías en tu poder, y esa vía estaba abierta hasta que la cerraron. Si tu empresa usa la API con datos sensibles, conviene saber dónde queda guardado ese razonamiento y quién puede reenviarlo. Es una pregunta para el equipo técnico o para quien te monte la integración.
La segunda es de precios y elección de modelo. Los modelos chinos de pesos abiertos, como Kimi, DeepSeek o GLM, son baratos y cada vez más buenos, y muchas empresas los prueban por eso. Cuando parte de ese nivel sale de copiar a otro, el precio bajo tiene truco. Y si Estados Unidos acaba regulando la destilación, puede haber restricciones sobre qué modelos se pueden usar en según qué sectores.
Yo, a día de hoy, no dejaría de usar ningún modelo por esto. Pero si eliges uno por precio, mira también de dónde viene y qué dice su proveedor sobre cómo trata tus datos. Esa conversación se va a repetir en los próximos meses.
Fuente original: OpenAI
Relacionado


