La censura que traen de fabrica los modelos chinos no sobrevive a la destilacion, segun una investigacion de CTGT publicada por Semafor. Preguntado por los campos de internamiento uigures, DeepSeek V4 Flash respondia que no hay evidencia de que existieran. El modelo destilado a partir de el reconocia "instalaciones de tipo internamiento".
Puntos clave
- La investigacion la firma CTGT, un laboratorio de IA de San Francisco fundado por Cyril Gorlla.
- Metodologia: 152 pares de prompts, cada par con una version sobre temas sensibles para China y una de control. Entre los temas, los campos de internamiento uigures y Tiananmen.
- Las respuestas fueron evaluadas por modelos de xAI, Google, OpenAI y Anthropic, para no dejar el juicio en manos de una sola casa.
- El modelo destilado a partir de DeepSeek perdio el sesgo del original. Se compararon tambien Kimi de Moonshot y el modelo abierto americano Inkling como referencia.
- Cyril Gorlla: "Muchas empresas estan mirando cosas asi, pero hay mucha incertidumbre sobre si esos rasgos se transfieren de verdad".
Qué es destilar y por que el resultado sorprende
Destilar un modelo es entrenar uno mas pequeno, el alumno, usando las salidas de uno grande, el profesor. Es la tecnica estandar para conseguir modelos baratos que se parecen a los caros, y es la razon por la que un modelo abierto de frontera es tan valioso: cualquiera puede destilar de el.
La suposicion habitual era que si destilas de un modelo censurado, heredas la censura, porque estas aprendiendo de sus respuestas. Lo que encuentra CTGT es que no. El alumno aprende la capacidad general y pierde el condicionamiento politico especifico.
La explicacion probable es de proporcion. El sesgo sobre temas sensibles vive en una fraccion minuscula del comportamiento del modelo, mientras que la capacidad general esta en todo. Cuando destilas sobre un conjunto amplio de prompts, la mayoria de los cuales no tocan esos temas, la senal de censura se diluye y la de capacidad se transmite.
El argumento politico que esto rompe
Jane Horvath, del despacho Gibson Dunn, lo dice sin rodeos en la nota de Semafor: "La investigacion cuestiona si tiene sentido prohibir estos modelos. Son materia prima. Es software".
Ese es el punto que importa, porque Washington lleva meses sopesando restringir los modelos de IA chinos con el argumento de que llevan dentro los valores del regimen que los produjo. Si ese contenido se pierde en cuanto alguien destila el modelo, la prohibicion protege menos de lo que anuncia y a la vez encarece el acceso a modelos buenos.
Es tambien el argumento que Zuckerberg defendio esta semana en su articulo del WSJ, donde dijo que vetar los modelos abiertos chinos es poco probable que funcione. Y llega en la misma semana en que Moonshot cerraba 3.500 millones a una valoracion de 35.000, con un fondo estatal chino liderando.
Lo que la investigacion no dice
Conviene no estirarla. Que la censura se caiga al destilar no significa que un modelo chino usado directamente sea neutral: DeepSeek V4 Flash sin tocar seguia negando los campos uigures. Tampoco dice nada sobre otros riesgos, como donde acaban los datos si usas la API del proveedor original en lugar de correr los pesos en tu casa.
Son 152 pares de prompts, un tamano razonable para una senal y pequeno para una conclusion definitiva. Y la evaluacion la hacen modelos, no personas, con las limitaciones que eso tiene.
Por qué importa
Si has descartado los modelos chinos por miedo a sesgos incrustados, este dato reabre la conversacion en un punto concreto: usar los pesos abiertos para destilar o afinar tu propio modelo es menos arriesgado de lo que parecia, porque el sesgo no viaja bien.
Lo que no cambia es el resto del calculo, y es el que suele decidir. Si corres los pesos en tu propia infraestructura, resuelves la parte de datos y de sesgo, y te queda el riesgo regulatorio, que no controlas. Si usas la API del proveedor chino, sigues teniendo la conversacion de que sale de tu empresa y hacia donde.
En la practica, y para una empresa espanola, la puerta que abre esto es estrecha pero real: tareas internas, sin datos de cliente, donde el coste por token pesa mucho y una diferencia de dos puntos en capacidad no cambia nada. Clasificar tickets, extraer campos de documentos, resumir. Para el nucleo del negocio, la estabilidad del proveedor sigue valiendo mas que el ahorro.
Relacionado


