Zhang Yiming, fundador de ByteDance, ha dicho al equipo Seed que la empresa no va a usar destilación para mejorar sus modelos de IA, aunque eso la deje por detrás de rivales chinos como DeepSeek y Qwen. Lo adelantó The Information y lo han confirmado medios chinos. La instrucción se dio en una reunión interna el mes pasado.
Puntos clave
- La destilación consiste en usar las salidas de un modelo potente para entrenar o mejorar uno más pequeño. Es rápido, barato y legalmente turbio.
- Zhang pidió al equipo estar dispuesto a sacrificar ganancias a corto plazo por objetivos a largo.
- La razón principal es el riesgo político. ByteDance carga con TikTok y con la vigilancia permanente de Washington.
- Es información de fuentes internas trasladada por un medio, no un comunicado de ByteDance.
Qué es destilar y por qué se ha vuelto un campo de minas
Un modelo grande responde. Un modelo pequeño mira esas respuestas y aprende a imitarlas. Sale un modelo barato que rinde muy por encima de lo que le tocaría por tamaño.
El problema es que casi todas las condiciones de uso de los laboratorios estadounidenses prohíben explícitamente entrenar modelos competidores con sus salidas. Cuando DeepSeek reventó el mercado a principios de 2025, la acusación de haber destilado modelos de OpenAI fue inmediata y nunca se cerró del todo.
Desde entonces la destilación dejó de ser una decisión técnica para convertirse en una decisión geopolítica. Y ByteDance es la empresa china con más que perder en ese terreno.
Lo que le cuesta esta decisión
Bastante. ByteDance ha ido rápido este año: liberó DeerFlow 2.0, un agente con licencia MIT y ha ido sacando modelos de vídeo e imagen a buen ritmo. Renunciar al atajo significa entrenar desde cero contra competidores que igual no renuncian.
También es una apuesta a que el escrutinio estadounidense sobre TikTok no se va a relajar. Zhang está pagando una prima de seguro con capacidad de modelo.
La lectura estratégica
Hay una lectura menos noble y probablemente más real: si ByteDance quiere que sus modelos se usen fuera de China, necesita una historia de procedencia limpia. Un modelo que puedes demostrar que no está destilado de nadie es un modelo que un comité de compras europeo puede aprobar.
Es el mismo movimiento que hicieron varios fabricantes de hardware cuando la cadena de suministro se politizó. La trazabilidad pasó de ser papeleo a ser argumento comercial.
Y hay un tercer motivo, más práctico. Un modelo destilado hereda los límites del modelo del que copia: sus sesgos, sus fallos y su techo. Nunca va a superar al maestro en aquello que aprendió imitándolo. Si tu plan es competir en la frontera dentro de tres años, cada atajo de hoy es deuda técnica que se paga entonces.
Lo que hace el resto del sector
DeepSeek y Qwen han ido a otro ritmo y con otra tolerancia al riesgo. Alibaba lleva meses publicando pesos abiertos a cadencia alta y DeepSeek ha convertido el precio en su arma principal. Ninguna de las dos tiene una aplicación con cientos de millones de usuarios estadounidenses en la cuerda floja.
Esa es la asimetría que explica la decisión de Zhang. La misma jugada tiene coste distinto según quién la haga.
Por qué importa
Para una empresa española que elige proveedor de IA, esto apunta a una pregunta que todavía casi nadie hace: con qué datos se entrenó el modelo que estoy metiendo en mi proceso.
Importa por dos motivos concretos. Si el modelo arrastra un pleito de propiedad intelectual, tu proveedor puede tener que retirarlo o cambiar condiciones de un mes para otro, y tú te quedas con la integración a medias. Y si trabajas para clientes en sectores regulados, cada vez es más habitual que el cuestionario de proveedor pregunte por el origen del modelo.
No hace falta convertirse en experto. Basta con guardar en algún sitio, junto al contrato, qué modelo usas para qué proceso y cuál sería el sustituto si mañana desaparece. Esa hoja vale más que cualquier debate sobre benchmarks.
Relacionado


