> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# PrismML comprime un modelo de 27.000 millones de parámetros para correr en un iPhone
- URL: https://www.digitalbrain.news/noticias/prismml-bonsai-27b-modelo-27000-millones-iphone/
- Published: 2026-07-16T13:04:15.000Z
- Updated: 2026-08-06T19:39:19.000Z
- Description: PrismML ha conseguido meter un modelo de IA de 27.800 millones de parámetros dentro de un iPhone. [Según su…
- Author: Ramón Pérez Coronado
- Tags: #noticias, prismml, bonsai, qwen, apple, modelos-abiertos

PrismML ha conseguido meter un modelo de IA de 27.800 millones de parámetros dentro de un iPhone. [Según su anuncio](https://prismml.com/news/prismml-releases-bonsai-27b?ref=digitalbrain.news), Bonsai 27B es un modelo [multimodal](https://www.digitalbrain.news/glosario/#multimodal) (texto e imagen) que corre entero en el dispositivo, sin llamar a la nube, gracias a una técnica de compresión que lo encoge hasta unas 14 veces sin tirar por tierra su rendimiento.

## Qué es Bonsai 27B

- Parte de [Qwen3.6](https://www.digitalbrain.news/glosario/#qwen) 27B, el modelo abierto de [Alibaba](https://www.digitalbrain.news/glosario/#alibaba), y lo comprime a pesos de 1 bit (binario) y de 1,58 bits (ternario).
- Pasa de unos 54 GB en precisión completa (FP16) a 3,9 GB en la versión de 1 bit o 5,9 GB en la ternaria.
- Corre en un iPhone 17 Pro a 11 [tokens](https://www.digitalbrain.news/guias/que-es-un-token-en-ia/) por segundo, y también en portátiles y CPU de consumo.
- Es gratis, con licencia Apache 2.0, desde el 14 de julio. Está en [Hugging Face](https://www.digitalbrain.news/glosario/#hugging-face), GitHub, la app iOS Locally AI y la API de Together.ai.

## El truco: cuánto pierdes al comprimir

La gracia de todo esto no es el tamaño, es cuánto rendimiento sobrevive al recorte. Normalmente, cuando aplastas un modelo a 1 bit por peso, pierdes calidad de golpe. PrismML dice que su versión de 1 bit conserva más del 90% del rendimiento del modelo original en los [benchmarks](https://www.digitalbrain.news/glosario/#benchmark), y la ternaria (1,58 bits) sube por encima del 95%. Si esas cifras aguantan en uso real, tienes casi la capacidad del modelo grande ocupando una fracción del espacio.

El mecanismo es representar cada peso de la red con muchísima menos información. Un modelo estándar guarda cada parámetro con 16 bits. Bonsai lo baja a 1 o a poco más de 1, lo que reduce el peso del archivo de forma brutal y, de paso, la memoria y la energía que hace falta para ejecutarlo. Por eso cabe en un teléfono en vez de en un servidor con [GPU](https://www.digitalbrain.news/glosario/#gpu).

## Por qué Apple está mirando

Aquí está la parte de mercado. Según recogió Superhuman, el CEO de PrismML, Babak Hassibi, contó a CNBC que Apple está evaluando la tecnología. No hay confirmación de Apple ni se sabe adónde llevará, así que conviene cogerlo como lo que es: un movimiento reportado, no un acuerdo cerrado. Pero el interés tiene lógica. Apple lleva tiempo apostando por que la IA corra en el dispositivo, por privacidad y por coste, y un método que mete un modelo de 27.000 millones de parámetros en un iPhone sin mandar nada a la nube encaja de lleno en esa estrategia.

Que Bonsai se apoye en Qwen, un modelo chino abierto, también dice algo del momento. Los mejores modelos abiertos vienen en buena parte de China, y empresas de fuera los están cogiendo como base para construir encima. La compresión es la capa que convierte esos modelos gigantes en algo que cabe en un bolsillo.

## Por qué importa

Para una empresa, un modelo capaz corriendo en el propio dispositivo cambia dos cosas: el coste y la privacidad. Si el modelo vive en el móvil o el portátil del empleado, no pagas por cada llamada a una API y los datos no salen del aparato. Para casos con información sensible (salud, legal, datos de cliente) eso es la diferencia entre poder usar IA o no poder tocarla por cumplimiento. Bonsai todavía es un modelo de 27.000 millones de parámetros corriendo a 11 tokens por segundo, no un rayo, pero marca la dirección: cada vez más capacidad va a caber fuera de la nube. Y cuando eso pasa, la cuenta de qué IA te puedes permitir se recalcula entera.

---

**Relacionado**

[![PrismML sale del stealth con Bonsai 8B: un modelo de 8.000 millones que cabe en un iPhone](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/2026/07/prismml-bonsai-8b-open-source-consumo.png)PrismML sale del stealth con Bonsai 8B: un modelo de 8.000 millones que cabe en un iPhone](https://www.digitalbrain.news/noticias/prismml-bonsai-8b-open-source-consumo/)[![Alibaba lanza Qwen-Image-3.0 sin pesos ni benchmarks y rompe con lo abierto](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/2026/07/alibaba-qwen-image-3-sin-pesos-benchmarks.png)Alibaba lanza Qwen-Image-3.0 sin pesos ni benchmarks y rompe con lo abierto](https://www.digitalbrain.news/noticias/alibaba-qwen-image-3-sin-pesos-benchmarks/)[![Apple manda cartas legales a unos 40 ex empleados que ahora trabajan en OpenAI](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/2026/07/apple-cartas-legales-ex-empleados-openai.jpg)Apple manda cartas legales a unos 40 ex empleados que ahora trabajan en OpenAI](https://www.digitalbrain.news/noticias/apple-cartas-legales-ex-empleados-openai/)