Google ha publicado EmbeddingGemma 2, un modelo abierto de 740 millones de parámetros que entiende texto, código, imágenes, vídeo y audio y que funciona en un portátil, un móvil o el navegador. Sirve para buscar dentro de tus propios archivos sin mandarlos a ningún servidor. El mismo día ha empezado a desplegar Nano Banana 2.1, la nueva versión de su modelo de imagen, en casi todas las plataformas de Gemini.
Son dos lanzamientos muy distintos. Uno es para quien construye herramientas internas, el otro para quien hace imágenes cada día. Vamos por partes.
Puntos clave
- EmbeddingGemma 2 tiene 740 millones de parámetros, licencia Apache 2.0 (se puede usar en productos comerciales) y está construido sobre la arquitectura de Gemma 4.
- Es modular: para trabajar solo con texto bastan 270 millones de parámetros, y se le pueden añadir el módulo de visión (170 millones) y el de audio (300 millones).
- Cabe en un móvil. Cuantizado, en un Pixel 11 Pro ocupa unos 191 MB de RAM en modo texto y unos 567 MB con todo.
- Nano Banana 2.1 mejora el diseño visual, la edición y la coherencia de un mismo personaje entre imágenes, según lo anunció Google en X.
¿Qué es EmbeddingGemma 2 y para qué sirve?
Es un modelo que convierte contenido en "embeddings": listas de números que representan el significado de un texto, una foto o un trozo de audio. Dos cosas que hablan de lo mismo acaban con números parecidos, y eso permite buscar por significado en vez de por palabras exactas.
Lo nuevo es que mete todos los formatos en el mismo espacio. Con un solo modelo puedes escribir una frase y encontrar el momento concreto de un vídeo, o buscar en horas de grabaciones de audio a partir de una nota de voz. Hasta ahora esto pedía un modelo por formato, o mandar los archivos a la nube de alguien.
La primera versión, que salió hace un año y solo hacía texto, pasó de 20 millones de descargas. Google dice que la gente la usó sobre todo para buscadores locales y para sistemas de RAG (la técnica de darle a un modelo tus documentos para que conteste con ellos) que no sacan los datos del dispositivo.
Qué cambia técnicamente
Los números del anuncio de Google DeepMind, firmado por los ingenieros Sahil Dua y Henrique Schechter Vera:
- Contexto de 8.000 tokens, cuatro veces más que la primera versión. En una sola pasada procesa hasta 5,5 minutos de audio, 29 imágenes, 58 fotogramas de vídeo o una mezcla de todo.
- Código mucho mejor. En la prueba MTEB Code pasa de 68,76 a 78,68 puntos, casi 10 puntos más. Eso lo hace útil para indexar un repositorio en local y que un agente de programación encuentre la función que busca.
- Vectores recortables. Con una técnica llamada Matryoshka, el resultado se puede reducir de 768 dimensiones a 512, 256 o 128. Google calcula hasta 6 veces menos almacenamiento en la base de datos de vectores.
- El mejor de su tamaño, según Google, entre los modelos multimodales de menos de 1.000 millones de parámetros en pruebas como MTEB Code y MAEB (audio), y por encima de algunos modelos especializados que le doblan en tamaño.
Como comparte tokenizador y codificador de audio con Gemma 4, los dos modelos pueden correr juntos en el mismo dispositivo gastando menos memoria que por separado. EmbeddingGemma 2 encuentra los archivos y Gemma 4 razona sobre ellos, todo sin conexión.
Los pesos están ya en Hugging Face y Kaggle, y funciona con las herramientas habituales: transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama y LM Studio. La disponibilidad en la plataforma de agentes de Google Cloud llegará más adelante. La familia Gemma ya superó los mil millones de descargas en agosto, y esta pieza le da algo que no tenía: búsqueda en todos los formatos.
Nano Banana 2.1, la parte visible
Nano Banana es el nombre comercial de los modelos de imagen de Gemini. Nano Banana 2 (técnicamente Gemini 3.1 Flash Image) salió en febrero, y en julio Google añadió Nano Banana 2 Lite, una versión que saca una imagen en 4 segundos por 0,034 dólares.
La 2.1 se ha anunciado con poco detalle. Google ha dicho en X que se despliega en la mayoría de plataformas de Gemini con mejoras en tres frentes: diseño visual, edición de imágenes y coherencia de personajes, es decir, que una misma persona o producto salga igual en varias imágenes seguidas. No ha publicado precios nuevos de API ni comparativas.
La coherencia es lo que más le importa a un equipo de marketing. Si haces una campaña con la misma modelo en diez escenarios, o el mismo producto en veinte fondos distintos, cada imagen que cambia la cara o la etiqueta es una imagen que tiras. Para sacarle partido, Google mantiene una guía de instrucciones para la familia Nano Banana en su blog de Cloud, con ejemplos de cómo pedir cámara, lente, luz y texto dentro de la imagen.
Por qué importa
Lo de Nano Banana se nota mañana en la app de Gemini. Lo de EmbeddingGemma 2 tarda más en verse, pero creo que es lo más interesante del día para una empresa.
Un buscador que corre en el portátil o en un servidor propio permite montar búsqueda sobre documentos internos (contratos, grabaciones de reuniones, fotos de producto, el repositorio de código) sin subirlos a la nube de nadie. Para cualquier equipo con datos sensibles eso cambia la conversación con el responsable de seguridad: no hay que justificar a dónde van los datos, porque no salen.
Y con licencia Apache 2.0, un modelo de 740 millones de parámetros y las herramientas de siempre, no hace falta un equipo de investigación para probarlo. Si tenéis a alguien técnico en casa, una tarde basta para tener un buscador de las grabaciones de reuniones del último trimestre.
Fuente original: Google
Relacionado


