> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# NVIDIA saca Nemotron 3 Embed, el modelo de búsqueda abierto que lidera el ranking RTEB con un 78,5%
- URL: https://www.digitalbrain.news/noticias/nvidia-nemotron-3-embed-rteb-busqueda/
- Published: 2026-07-17T05:30:00.000Z
- Updated: 2026-08-31T09:05:01.000Z
- Description: NVIDIA ha publicado Nemotron 3 Embed, una familia de modelos de búsqueda abiertos que ya lidera el ranking de referencia del sector. [Según el anuncio en…
- Author: Ramón Pérez Coronado
- Tags: #noticias, nvidia, rag, modelos-abiertos, hugging-face, embedding

NVIDIA ha publicado [Nemotron](https://www.digitalbrain.news/glosario/#nemotron) 3 Embed, una familia de modelos de búsqueda abiertos que ya lidera el ranking de referencia del sector. [Según el anuncio en Hugging Face](https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb?ref=digitalbrain.news), el modelo grande de 8.000 millones de parámetros marca un 78,5% general en RTEB (el Retrieval Text [Embedding](https://www.digitalbrain.news/guias/que-es-un-embedding/) [Benchmark](https://www.digitalbrain.news/glosario/#benchmark)) y se coloca primero de la tabla. Suena técnico, pero es una pieza que afecta directo a cualquier empresa que esté montando IA sobre sus propios documentos.

## Qué son los embeddings y por qué importan

Un modelo de embeddings no escribe respuestas. Convierte tus documentos en números para que un sistema de IA encuentre el fragmento correcto cuando le preguntas algo. Es el buscador que va por debajo de casi toda IA aplicada a datos de empresa: los sistemas [RAG](https://www.digitalbrain.news/guias/que-es-rag-en-ia/) (donde la IA responde consultando tus documentos), la memoria de un agente, la búsqueda de código. Si esa búsqueda falla, la IA responde con la información equivocada por muy bueno que sea el modelo de lenguaje que tenga encima.

- El modelo insignia de 8B lidera RTEB con un 78,5%, por delante del resto de opciones abiertas y cerradas.
- Trae una [ventana de contexto](https://www.digitalbrain.news/guias/que-es-la-ventana-de-contexto/) de 32.000 [tokens](https://www.digitalbrain.news/guias/que-es-un-token-en-ia/), así que indexa documentos y ficheros de código largos sin trocearlos a lo bruto.
- Es multilingüe y sabe buscar sobre código, no solo texto plano.
- Los pesos son abiertos, con recetas de [fine-tuning](https://www.digitalbrain.news/guias/que-es-fine-tuning/) para adaptarlo a tu dominio.

## El detalle que ahorra dinero en agentes

NVIDIA vende esto con un argumento de coste, no de marketing. Cuando una búsqueda encuentra el dato correcto a la primera, el [agente de IA](https://www.digitalbrain.news/guias/que-es-un-agente-de-ia/) no tiene que dar vueltas: no repite búsquedas, no gasta turnos de [razonamiento](https://www.digitalbrain.news/guias/que-es-un-modelo-de-razonamiento-en-ia/) de más, no quema tokens buscando algo que ya debería haber encontrado. En sus palabras, una mejor recuperación devuelve la evidencia relevante antes y evita las ineficiencias que se acumulan en cada consulta.

Traducido: en un flujo de trabajo con agentes, el modelo de búsqueda malo te sale caro aunque parezca gratis, porque hace trabajar de más al modelo caro que tiene detrás. Ahí es donde un embedding mejor mueve la factura.

## Tres tamaños y hardware Blackwell

La familia viene en tres versiones para no obligarte a pagar el modelo grande cuando no hace falta: el de 8B para cuando la precisión manda, uno de 1B para producción sensible a coste y latencia, y una variante 1B con cuantización NVFP4 pensada para exprimir el máximo throughput. Esa cuantización dobla el rendimiento sobre hardware Blackwell de NVIDIA, que no por casualidad es el que la empresa quiere vender.

Todo se despliega desde [Hugging Face](https://www.digitalbrain.news/glosario/#hugging-face), los microservicios NVIDIA NIM, vLLM y socios como Baseten, DeepInfra y Friendli AI. Se llevan tanto a tu propia infraestructura como a una API gestionada.

## Por qué importa

Si tu empresa está montando un sistema que responde a partir de sus documentos (soporte, ventas, base de conocimiento interna), el modelo de embeddings es la parte que casi nadie mira y la que más determina si funciona. Un buscador que lidera RTEB, es abierto y se puede afinar con tus datos significa mejores respuestas y menos gasto en tokens del modelo grande. Y al ser abierto, lo corres donde quieras sin mandar tus documentos a la nube de un tercero. Para quien maneja datos sensibles, esa es la diferencia entre poder usarlo o no.

Fuente original: [Hugging Face](https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb?ref=digitalbrain.news)

---

**Relacionado**

[![Nvidia usa su propia CPU Vera para diseñar sus siguientes chips y acelera la verificación un 50%](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/2026/07/nvidia-vera-cpu-eda-diseno-chips.jpg)Nvidia usa su propia CPU Vera para diseñar sus siguientes chips y acelera la verificación un 50%](https://www.digitalbrain.news/noticias/nvidia-vera-cpu-eda-diseno-chips/)[![MCP vs RAG: cuándo usar cada uno](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/2026/07/mcp-vs-rag.png)MCP vs RAG: cuándo usar cada uno](https://www.digitalbrain.news/guias/mcp-vs-rag/)[![El CEO de Hugging Face pide a OpenAI las trazas del agente que le hackeó y 100 millones en cómputo](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/2026/07/hugging-face-delangue-openai-trazas-100-millones-computo.jpg)El CEO de Hugging Face pide a OpenAI las trazas del agente que le hackeó y 100 millones en cómputo](https://www.digitalbrain.news/noticias/hugging-face-delangue-openai-trazas-100-millones-computo/)