PrismML comprime un modelo de 27.000 millones de parámetros para correr en un iPhone

PrismML comprime un modelo de 27.000 millones de parámetros para correr en un iPhone
Fuente: cnbc.com

PrismML ha conseguido meter un modelo de IA de 27.800 millones de parámetros dentro de un iPhone. Según su anuncio, Bonsai 27B es un modelo multimodal (texto e imagen) que corre entero en el dispositivo, sin llamar a la nube, gracias a una técnica de compresión que lo encoge hasta unas 14 veces sin tirar por tierra su rendimiento.

Qué es Bonsai 27B

  • Parte de Qwen3.6 27B, el modelo abierto de Alibaba, y lo comprime a pesos de 1 bit (binario) y de 1,58 bits (ternario).
  • Pasa de unos 54 GB en precisión completa (FP16) a 3,9 GB en la versión de 1 bit o 5,9 GB en la ternaria.
  • Corre en un iPhone 17 Pro a 11 tokens por segundo, y también en portátiles y CPU de consumo.
  • Es gratis, con licencia Apache 2.0, desde el 14 de julio. Está en Hugging Face, GitHub, la app iOS Locally AI y la API de Together.ai.

El truco: cuánto pierdes al comprimir

La gracia de todo esto no es el tamaño, es cuánto rendimiento sobrevive al recorte. Normalmente, cuando aplastas un modelo a 1 bit por peso, pierdes calidad de golpe. PrismML dice que su versión de 1 bit conserva más del 90% del rendimiento del modelo original en los benchmarks, y la ternaria (1,58 bits) sube por encima del 95%. Si esas cifras aguantan en uso real, tienes casi la capacidad del modelo grande ocupando una fracción del espacio.

El mecanismo es representar cada peso de la red con muchísima menos información. Un modelo estándar guarda cada parámetro con 16 bits. Bonsai lo baja a 1 o a poco más de 1, lo que reduce el peso del archivo de forma brutal y, de paso, la memoria y la energía que hace falta para ejecutarlo. Por eso cabe en un teléfono en vez de en un servidor con GPU.

Por qué Apple está mirando

Aquí está la parte de mercado. Según recogió Superhuman, el CEO de PrismML, Babak Hassibi, contó a CNBC que Apple está evaluando la tecnología. No hay confirmación de Apple ni se sabe adónde llevará, así que conviene cogerlo como lo que es: un movimiento reportado, no un acuerdo cerrado. Pero el interés tiene lógica. Apple lleva tiempo apostando por que la IA corra en el dispositivo, por privacidad y por coste, y un método que mete un modelo de 27.000 millones de parámetros en un iPhone sin mandar nada a la nube encaja de lleno en esa estrategia.

Que Bonsai se apoye en Qwen, un modelo chino abierto, también dice algo del momento. Los mejores modelos abiertos vienen en buena parte de China, y empresas de fuera los están cogiendo como base para construir encima. La compresión es la capa que convierte esos modelos gigantes en algo que cabe en un bolsillo.

Por qué importa

Para una empresa, un modelo capaz corriendo en el propio dispositivo cambia dos cosas: el coste y la privacidad. Si el modelo vive en el móvil o el portátil del empleado, no pagas por cada llamada a una API y los datos no salen del aparato. Para casos con información sensible (salud, legal, datos de cliente) eso es la diferencia entre poder usar IA o no poder tocarla por cumplimiento. Bonsai todavía es un modelo de 27.000 millones de parámetros corriendo a 11 tokens por segundo, no un rayo, pero marca la dirección: cada vez más capacidad va a caber fuera de la nube. Y cuando eso pasa, la cuenta de qué IA te puedes permitir se recalcula entera.


Relacionado