Ant Group lanza Ling-3.0-Flash: 124.000 millones de parámetros y solo 5.100 activos

Ant Group lanza Ling-3.0-Flash: 124.000 millones de parámetros y solo 5.100 activos
Fuente: x.com

Ant Group ha presentado Ling-3.0-Flash, un modelo pensado para ejecutar flujos de agentes en producción. La cifra que lo define es la relación entre sus parámetros: 124.000 millones en total, de los que solo 5.100 millones se activan por token. Y según el anuncio, los pesos se liberarán después del 3 de agosto.

Puntos clave

  • 124.000 millones de parámetros totales, 5.100 millones activos por token.
  • Ant dice que iguala o supera a modelos de dos o tres veces su escala en razonamiento, seguimiento de instrucciones y contexto largo.
  • Trae un sistema de caché jerárquico a nivel de cluster que reduce el tiempo hasta el primer token entre un 60% y más de un 80% en entradas largas.
  • Está en OpenRouter y Vercel AI Gateway con API gratuita hasta el 3 de agosto; después se abren los pesos.

Qué significa esa relación de parámetros

Un modelo de mezcla de expertos no ejecuta toda su red en cada consulta. Enruta cada token a un subconjunto de sus componentes. Por eso hay dos cifras: el tamaño total, que determina cuánta memoria hace falta para cargarlo, y los parámetros activos, que determinan cuánto cuesta cada respuesta.

En Ling-3.0-Flash esa relación es de 24 a 1. Traducido a factura: se paga cómputo de un modelo de 5.100 millones de parámetros y se obtiene el conocimiento de uno de 124.000 millones. Ese es el motivo real por el que los laboratorios chinos han empujado tanto esta arquitectura, y es la misma jugada que se ve en las últimas familias abiertas.

Para una empresa que ejecuta agentes en bucle, donde una tarea puede encadenar 40 o 50 llamadas al modelo, esa relación decide si el caso de uso sale rentable.

Lo que hay alrededor del modelo

La parte que Ant enseña con más orgullo no es el modelo, es la infraestructura que lo acompaña. El caché jerárquico a nivel de cluster elimina cómputo repetido en conversaciones largas y en interacciones de varios turnos, y con eso reducen el tiempo hasta el primer token entre un 60% y más de un 80% cuando la entrada es larga.

Ese dato es más relevante de lo que parece. En un agente que arrastra un contexto grande de 30.000 tokens y hace muchas llamadas, casi todo el contexto se repite en cada una. Cachearlo bien es la diferencia entre una respuesta que tarda ocho segundos y una que tarda dos.

También incluyen una arquitectura de colaboración multiagente donde distintos agentes se reparten el trabajo y validan los resultados de los demás, para reducir el riesgo de que un solo modelo se equivoque sin que nadie lo detecte.

La estrategia del calendario

El movimiento comercial es interesante. API gratis hasta el 3 de agosto en OpenRouter y Vercel AI Gateway, y después apertura de pesos. Es decir: primero consiguen que los desarrolladores lo prueben sin fricción ni tarjeta, y cuando ya está integrado en los proyectos, liberan los pesos para que quien quiera se lo lleve a su propia infraestructura.

Encaja con el patrón del mes. Moonshot liberó los pesos de Kimi K3 hace días, y toda la discusión regulatoria en Washington sobre qué hacer con los modelos abiertos chinos va de esto exactamente.

Por qué importa a un operador

Si tienes automatizaciones que hacen muchas llamadas por tarea, este es el tipo de modelo que conviene tener en la lista de pruebas. No para sustituir al modelo bueno en lo que importa, sino para las tareas de volumen donde el coste manda: clasificar correos, extraer campos de documentos, resumir tickets, normalizar datos.

La forma sensata de probarlo es con la API gratuita antes del 3 de agosto y con tus propios casos. Coge 50 ejemplos reales de una tarea que ya resuelves con un modelo caro, pásalos por este, y compara resultado y coste. Si el resultado aguanta, la diferencia de factura en un proceso de volumen alto se nota a fin de mes.

Y si el resultado no aguanta, has perdido una tarde y has aprendido dónde está el límite. Eso también vale.


Relacionado