> ## Content Index
> Fetch the complete content index at: https://www.digitalbrain.news/llms.txt
> Use this file to discover other available public pages before exploring further.

# Un Qwen3-235B afinado supera a toda la frontera en tareas financieras por 13,8 veces menos coste
- URL: https://www.digitalbrain.news/noticias/thinking-machines-qwen3-235b-finanzas-supera-frontera/
- Published: 2026-08-14T14:40:25.000Z
- Updated: 2026-08-26T09:05:13.000Z
- Description: Thinking Machines ha publicado un trabajo en el que un Qwen3-235B afinado con anotaciones de expertos alcanza un 84,7% de precisión media en seis tareas…
- Author: Ramón Pérez Coronado
- Tags: #noticias, thinking-machines, qwen, modelos-abiertos, fine-tuning, finanzas

Thinking Machines ha publicado [un trabajo](https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/?ref=digitalbrain.news) en el que un [Qwen3-](https://www.digitalbrain.news/glosario/#qwen)235B afinado con anotaciones de expertos alcanza un 84,7% de precisión media en seis tareas de filtrado de documentos financieros, frente al 78,2% del mejor modelo frontera probado. Comete un 29,8% menos de errores y cuesta 13,8 veces menos por tarea.

## Puntos clave

- Modelo base: Qwen3-235B, de [pesos abiertos](https://www.digitalbrain.news/glosario/#pesos).
- Resultado: 84,7% de precisión media frente al 78,2% del mejor frontera evaluado.
- Frontera evaluada: [Gemini](https://www.digitalbrain.news/guias/que-es-gemini/) 3.1 Pro, [Claude](https://www.digitalbrain.news/guias/que-es-claude-ia/) Opus 4.6 y 4.8, y [GPT](https://www.digitalbrain.news/glosario/#gpt) 5.2, 5.4 y 5.5.
- Coste: 13,8 veces menos por tarea de [inferencia](https://www.digitalbrain.news/glosario/#inferencia).

## Qué tarea es exactamente

No es análisis financiero. Es triaje: decidir si un artículo es relevante, interpretar documentos de bancos centrales, detectar cuándo un texto viene truncado. Seis tareas de filtrado que en una gestora hace una persona con criterio, muchas veces al día, y que consumen horas sin producir nada visible.

Ese matiz importa porque explica por qué funciona. El juicio experto en tareas acotadas y repetitivas se puede copiar con datos. El juicio experto en decisiones abiertas, no.

Las etiquetas vienen de inversores de Bridgewater. El equipo partió de anotaciones no expertas y montó un esquema de verificación que enviaba los casos discutidos a anotadores expertos. Es decir, invirtieron en limpiar el dato antes de entrenar nada. Que es donde está el trabajo de verdad en cualquier proyecto de este tipo.

## La receta, en tres partes

Thinking Machines desglosa la mejora, y eso es lo más aprovechable del paper para quien quiera replicarlo:

- **Batching intercalado:** 12,1 puntos de mejora en precisión.
- **Pérdida CISPO con recorte asimétrico:** 10,1 puntos.
- [**Destilación**](https://www.digitalbrain.news/glosario/#destilacion) **on-policy con profesores fuertes:** 3,1 puntos.

Lo llamativo es el orden. Las dos primeras técnicas, que son de mecánica de [entrenamiento](https://www.digitalbrain.news/glosario/#entrenamiento), aportan siete veces más que la destilación desde modelos grandes. La intuición popular dice que lo que hace bueno a un modelo pequeño es aprender de uno grande. Aquí el grueso viene de cómo se entrena, no de a quién se copia.

El laboratorio lleva meses en esta línea. Ya sacó [Inkling, su primer modelo abierto de 975.000 millones de parámetros](https://www.digitalbrain.news/noticias/thinking-machines-inkling-modelo-abierto-975b/), y después [Inkling-Small con 12.000 millones de parámetros activos](https://www.digitalbrain.news/noticias/thinking-machines-inkling-small-12b-activos/). El hilo conductor es el mismo: sacar rendimiento de frontera de modelos que no cuestan lo que cuesta la frontera.

## El dato de 13,8 veces

Es la cifra que hay que mirar dos veces. Un 6,5% más de precisión es una mejora buena pero no espectacular. Pagar 13,8 veces menos por conseguirla cambia la ecuación entera.

Puesto en contexto de lo que las empresas gastan de verdad: el [índice de Ramp de agosto](https://www.digitalbrain.news/noticias/ramp-ai-index-agosto-fable-5-gasto-empresas/) muestra que el modelo más caro del mercado apenas se usa precisamente por precio. Un afinado que gana a ese modelo caro por una fracción del coste ataca el problema desde el otro lado.

Va en la misma dirección que [la apuesta de AT&T por los modelos abiertos](https://www.digitalbrain.news/noticias/att-modelos-abiertos-25-por-ciento-uso-ia/), que ya cubren el 25% de su uso de IA.

## Por qué importa

Este es el patrón que más veces he visto funcionar y del que menos se habla. Coges una tarea aburrida, repetitiva y con criterio, la etiquetas bien durante unas semanas y afinas un modelo abierto. El resultado gana a GPT y a Claude en esa tarea concreta y cuesta una décima parte.

La condición es la que nadie quiere oír: hacen falta las etiquetas. Aquí las puso Bridgewater con sus propios inversores. En una empresa mediana eso significa que alguien con criterio dedique tiempo a marcar ejemplos, y ese tiempo es real.

Mi regla práctica: si una tarea se repite más de 500 veces al mes y siempre la resuelve la misma persona de la misma manera, es candidata. Si se repite 20 veces al mes, sale más barato pagar el modelo caro y olvidarse. El [fine-tuning](https://www.digitalbrain.news/guias/que-es-fine-tuning/) no es una mejora general, es una inversión que se amortiza con volumen.

Fuente original: [thinkingmachines.ai](https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/?ref=digitalbrain.news)

---

**Relacionado**

[![Thinking Machines saca Inkling-Small: 12.000 millones de parámetros activos que superan al modelo grande](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/07/thinking-machines-inkling-small-12b-activos.png)Thinking Machines saca Inkling-Small: 12.000 millones de parámetros activos que superan al modelo grande](https://www.digitalbrain.news/noticias/thinking-machines-inkling-small-12b-activos/)[![Los laboratorios chinos publican los modelos abiertos más grandes y Qwen se lleva 2.045 millones de descargas](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/hugging-face-informe-modelos-abiertos-verano-2026.png)Los laboratorios chinos publican los modelos abiertos más grandes y Qwen se lleva 2.045 millones de descargas](https://www.digitalbrain.news/noticias/hugging-face-informe-modelos-abiertos-verano-2026/)[![AT&T ya mueve el 25% de su IA con modelos abiertos y apunta al 70-80%](https://storage.ghost.io/c/6d/e3/6de31f63-d0a8-45df-9c6a-481016520347/content/images/size/w300/format/webp/2026/08/att-open-weights.jpg)AT&T ya mueve el 25% de su IA con modelos abiertos y apunta al 70-80%](https://www.digitalbrain.news/noticias/att-modelos-abiertos-25-por-ciento-uso-ia/)