Liquid AI recupera el 97% de la precisión perdida al cuantizar sus modelos LFM2.5 a 4 bits

Liquid AI recupera el 97% de la precisión perdida al cuantizar sus modelos LFM2.5 a 4 bits
Fuente: huggingface.co

Liquid AI ha publicado versiones cuantizadas a 4 bits de sus modelos LFM2.5 que recuperan hasta el 97,4% de la precisión que normalmente se pierde al comprimir un modelo, según explica en su blog en Hugging Face. La técnica se llama Quantization-Aware Distillation y ataca el problema más molesto de correr modelos en local.

Puntos clave

  • Cuatro variantes con checkpoint Q4_0 nuevo: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct y LFM2.5-2.6B.
  • Recuperan entre el 96,5% y el 97,4% de la precisión BF16 perdida en la cuantización, según el modelo.
  • En hardware edge real dan entre un 4% y un 33% más de throughput de decodificación que Q5_K_M, y entre un 3% y un 14% más que Q4_K_M en los modelos grandes.
  • Mantienen la huella de memoria baja de los GGUF Q4_0.
  • Están en Hugging Face bajo la organización LiquidAI, con sufijo -GGUF, y funcionan con llama.cpp o cualquier runtime que soporte artefactos GGUF Q4_0.

Qué es cuantizar y por qué se pierde calidad

Un modelo se entrena guardando cada peso con mucha precisión numérica, típicamente 16 bits. Cuantizar es reescribir esos pesos con menos bits, normalmente cuatro, para que el modelo ocupe la cuarta parte y corra en un móvil o en un portátil sin GPU dedicada.

El coste es que el modelo se vuelve algo más tonto. Al redondear los números pierde matiz, y eso se nota en tareas que exigen seguir instrucciones con exactitud o razonar varios pasos.

La forma habitual de hacerlo es cuantización posterior al entrenamiento: entrenas normal y comprimes al final. Es rápido y es lo que hace casi todo el mundo, pero el modelo nunca ha visto el formato comprimido durante su entrenamiento.

Quantization-Aware Distillation cambia el orden. Se usa el modelo de alta precisión como profesor y se destila su comportamiento en un modelo alumno que ya vive en el formato cuantizado. El alumno aprende a compensar la pérdida de precisión mientras se entrena, en vez de sufrirla al final.

Los números en contexto

Recuperar el 97% de lo que se pierde es una mejora sustancial, no un matiz de benchmark. Con cuantización tradicional, la caída en un modelo pequeño puede ser suficiente para que deje de servir en producción.

La ganancia de velocidad es la parte que sorprende. Q4_0 es un formato más simple que Q5_K_M o Q4_K_M, y esa simplicidad se traduce en más throughput: hasta un 33% más rápido decodificando frente a Q5_K_M. Antes había que elegir entre calidad y velocidad. Aquí el formato rápido deja de penalizar tanto.

Liquid AI lleva meses empujando en esta dirección. Ya publicó LFM2.5-2.6B para agentes locales con 128K de contexto y LFM2.5-VL-3B, su modelo de visión para edge. El patrón es consistente: modelos pequeños pensados para correr donde está el dato, no en un centro de datos.

Por qué importa

Si has descartado los modelos locales porque los que probaste eran demasiado torpes, esto merece una segunda mirada. Un LFM2.5-2.6B cuantizado a 4 bits corre en un portátil corriente y ahora rinde cerca de su versión completa.

El caso de uso donde esto se paga solo es el mismo de siempre: procesos que tocan datos que no quieres mandar fuera. Clasificar correos entrantes, extraer campos de facturas, etiquetar tickets de soporte. Tareas de volumen alto y complejidad media donde pagar por token a un proveedor externo no compensa y donde el dato es sensible.

Hay una lectura de coste que casi nadie hace. Si tienes un proceso que dispara diez mil llamadas al día a un modelo grande para hacer algo mecánico, estás pagando capacidad de razonamiento que la tarea no necesita. Mover eso a un modelo pequeño en local es de las pocas optimizaciones de IA que se notan en la factura del mes siguiente.

Y encaja bien con lo que están haciendo los grandes esta semana con la privacidad. Cuando el proveedor cambia sus políticas de retención o de acceso geográfico de un mes para otro, un modelo que corre en tu máquina es la única versión del problema que no tiene esa dependencia.


Relacionado