ByteDance está pre-entrenando un modelo de hasta 10 billones de parámetros, una cifra que lo dejaría cerca del Mythos de Anthropic, según el Financial Times citando a personas con conocimiento del asunto. Reuters recoge el reporte y añade una línea que conviene no saltarse: no ha podido verificarlo.
Es un scoop de prensa, no un anuncio. La empresa declinó comentar.
Puntos clave
- 10 billones de parámetros para el modelo que ByteDance tiene en pre-entrenamiento.
- Más del triple que el Kimi K3 de Moonshot, que se quedó en 2,8 billones.
- Las estimaciones de industria ponen Mythos 5 en unos 8 billones y Fable 5 en unos 5.
- La fase de pre-entrenamiento dura de tres a seis meses antes del ajuste fino, así que el modelo no sale mañana.
Lo que 10 billones de parámetros no te dicen
El número gordo del titular es el que menos información da. En una arquitectura de expertos dispersa, que es lo que usa todo el mundo a esta escala, el total de parámetros y los que se activan en cada petición son cosas distintas.
El ejemplo lo tenemos a mano. Qwen3.8-Max de Alibaba tiene 2,4 billones de parámetros totales y activa unos 95.000 millones por token, alrededor de un 4%. El coste de servirlo se parece más a ese 4% que al total.
Aplicado a ByteDance: 10 billones dice cuánto han gastado entrenando, no cuánto costará usarlo ni si será mejor. Son dos preguntas separadas y solo la primera tiene respuesta hoy.
Y esa segunda pregunta es la que aprieta. Reuters lo resume en una línea: los laboratorios chinos están acelerando sus ciclos de lanzamiento para no descolgarse de los americanos, con la condición de que los modelos no salgan prohibitivamente caros de servir. Entrenar a 10 billones y luego tener que activar solo una fracción en cada petición es justo la manera de cumplir las dos cosas a la vez. La escala se anuncia, la dispersión se cobra.
Encaja con lo que ByteDance lleva un mes haciendo
La noticia no llega sola. Hace un día contamos que Zhang Yiming prohibió la destilación en los modelos de la casa, aunque eso les cueste quedarse atrás en el corto plazo.
Las dos cosas encajan. Si renuncias a destilar de los modelos ajenos, la única salida es entrenar tú desde cero y a lo grande. Un modelo de 10 billones de parámetros es exactamente lo que hace una empresa que se ha quitado el atajo.
Y no es una casa sin producción. En las últimas cinco semanas ByteDance ha soltado DeerFlow 2.0, un agente con licencia MIT y Seedance 2.5, que genera 30 segundos de vídeo en una toma. Vídeo, imagen, agentes y ahora un modelo de lenguaje de frontera.
El contexto geopolítico va por otro lado
La comparación con Mythos llega en una semana rara. China prepara opciones de sanciones contra Anthropic por el propio Mythos de cara a la cumbre entre Trump y Xi.
O sea que el modelo que Pekín estudia sancionar es el mismo que su campeón nacional usa de vara de medir. Eso pasa cuando el mercado y la política van a velocidades distintas.
Por qué importa
Para una empresa española que ya tiene Claude o ChatGPT metido en sus procesos, esto no cambia nada esta semana. Ni siquiera el trimestre que viene, porque el modelo sigue en pre-entrenamiento.
Lo que sí cambia, si el reporte se confirma, es la cuenta del año que viene. Cada laboratorio chino que se planta en el rango de los frontera americanos aprieta el precio por token de los americanos. Esa es la parte que acaba llegando a tu factura.
Mi lectura: apúntalo, no lo uses todavía para nada. Es un reporte de una fuente que Reuters no ha podido verificar, sobre un modelo que no existe fuera de un cluster de entrenamiento. Cuando salga la tabla de benchmarks y el precio por millón de tokens, entonces sí toca hacer números.
Relacionado


