Mistral saca Agentic Search y pasa del 26,7% al 86% de acierto sobre 368 informes de la SEC

Mistral saca Agentic Search y pasa del 26,7% al 86% de acierto sobre 368 informes de la SEC
Fuente: mistral.ai

Mistral ha publicado Agentic Search, un sistema de recuperación que cambia cómo un modelo busca dentro de documentos. En vez de traer un puñado de fragmentos de una sola vez y responder con eso, el modelo busca, abre, navega, lee y vuelve a buscar hasta que tiene lo que necesita.

Los números que publica son de los que hacen levantar la ceja, así que conviene mirarlos con cuidado.

Lo que mide

En FinanceBench (368 informes presentados ante la SEC, 150 preguntas), Mistral Medium 3.5 pasa del 26,7% con RAG de un solo paso al 86% con Agentic Search. Casi 60 puntos.

En el mismo test, GLM-5.2 de Z.ai pasa de alrededor del 34% al 86,6%.

En OfficeQA Pro (696 boletines del Tesoro, 133 preguntas), el salto es más modesto pero sigue siendo grande: Mistral Medium 3.5 de un 24% aproximado al 51,1%, y GLM-5.2 del 6,3% al 51,9%.

Y lo que sorprende: sale más barato y más rápido. El consumo de tokens baja entre un 23,9% y un 33,7%. La latencia P90 pasa de 255 a 154 segundos, y la media de 108 a 71.

Eso es contraintuitivo. Un sistema que hace varias vueltas debería gastar más. Gasta menos porque no arrastra 40 fragmentos irrelevantes en cada petición: encuentra el sitio correcto y lee solo ahí.

Cómo funciona

Mistral le da al modelo cinco herramientas: `search`, `open`, `navigate`, `read` y `grep`.

La frase que resume el cambio es suya: "En vez de responder solo desde los resultados iniciales, el modelo puede inspeccionar lo que encuentra, refinar su búsqueda, abrir documentos relevantes, navegar a secciones específicas y leer el material fuente antes de responder".

Y hay un detalle de diseño que importa más que los benchmarks: "Estas herramientas no requieren fine-tuning ni entrenamiento específico por modelo. A medida que los modelos mejoran en razonamiento y uso de herramientas, las recuperaciones mejoran sin cambios de infraestructura".

Es decir, el sistema no envejece con el modelo. Cambias de modelo y el montaje sigue en pie.

Dónde no lo uses

Mistral, para su crédito, dice también dónde su producto no es la respuesta.

La recuperación indexada clásica sigue siendo mejor para consultas directas sobre documentos cortos, para búsqueda semántica o por palabra clave de alto volumen, y para preguntas simples y predecibles.

Agentic Search brilla en documentos largos (contratos, informes regulatorios, manuales), en comparación entre documentos, cuando la respuesta es numérica y hay que poder rastrearla hasta la fuente, y con tablas, PDFs escaneados y documentos estructurados.

Esa distinción es la que casi nadie hace. Montar un sistema de varias vueltas para responder "¿cuál es el horario de la tienda?" es tirar dinero y tiempo.

Lo que esto significa si tienes un RAG montado

Y mucha gente lo tiene, porque fue lo primero que casi todas las empresas construyeron con IA en 2024 y 2025.

Si tu sistema responde bien a preguntas cuya respuesta cabe en un párrafo y falla en cuanto la pregunta requiere cruzar dos secciones de un mismo documento largo, ese es exactamente el fallo que ataca esto. El RAG clásico trae los k mejores fragmentos y ya no puede hacer nada más; si la respuesta estaba en el fragmento k+1, no hay segunda oportunidad.

En un contrato de 80 páginas o en unas cuentas anuales, la respuesta casi nunca está en un fragmento. Está en la relación entre tres sitios distintos del documento.

Antes de reconstruir nada, merece la pena hacer una cosa: coger las 30 preguntas que tu sistema falla y clasificarlas. Si la mayoría falla porque el trozo correcto no se recuperó, esto lo arregla. Si falla porque el documento no estaba indexado o porque la pregunta era ambigua, esto no arregla nada.

No hay precio publicado. Se distribuye vía Mistral Search Toolkit, integrado en Studio y Vibe, y con una app de arranque que indexa en local.


Relacionado