Neon y Castform han publicado una prueba en la que un modelo abierto de 4.000 millones de parámetros iguala a GPT-5.6 Sol buscando en una base de conocimiento propia, con un coste 100 veces menor. El truco no está en el modelo base, está en post-entrenarlo con aprendizaje por refuerzo contra la base de datos concreta.
Puntos clave
- El modelo tiene 4.000 millones de parámetros y parte de pesos abiertos. Castform lo post-entrena con refuerzo para la tarea de recuperación agéntica.
- Empata en acierto con GPT-5.6 Sol en búsqueda sobre bases de conocimiento propietarias.
- La referencia del frontera: más de 10 segundos por búsqueda de varias vueltas y en torno a 0,03 dólares por petición de extremo a extremo.
- Debajo está Lakebase, el Postgres de Neon con extensiones de búsqueda, combinando BM25 con similitud vectorial.
Qué es la recuperación agéntica y por qué es cara
Cuando un asistente busca en la documentación de tu empresa, no hace una consulta y responde. Hace una, lee, se da cuenta de que le falta contexto, reformula, vuelve a buscar y así varias vueltas hasta que tiene material suficiente.
Cada una de esas vueltas es una llamada al modelo. Con un modelo frontera, cinco vueltas son cinco facturas y diez segundos de espera. Multiplicado por 500 empleados haciendo tres consultas al día, sale una cifra que ya no es de experimento.
Ahí es donde un modelo pequeño y afinado gana. La tarea de decidir la siguiente consulta es estrecha: no hace falta un modelo que sepa de derecho romano, hace falta uno que entienda cómo está organizado tu corpus.
Cómo lo entrenan
La parte interesante del montaje es la de las ramas de base de datos. Cada tanda de entrenamiento por refuerzo necesita ejecutar consultas reales contra datos reales, y necesita que el estado no se contamine entre intentos. Neon permite ramificar la base de datos como se ramifica un repositorio de código, así que cada rollout corre contra su copia aislada y se descarta después.
La búsqueda es híbrida: BM25 para coincidencia léxica, vectores para semántica. Nada exótico. Lo que aporta el refuerzo es enseñar al modelo pequeño a manejar bien esas dos herramientas sobre ese corpus.
El escalado de cómputo es automático porque el patrón de carga del entrenamiento va a ráfagas.
Lo que la prueba no dice
Es una prueba de concepto de dos empresas que venden justo esto, con lo cual conviene leerla con la ceja levantada. No hay fecha de disponibilidad general, y el conjunto de evaluación es el suyo.
Tampoco cuenta el coste del post-entrenamiento en sí. Un factor de 100 en inferencia se come rápido si montar y mantener el pipeline de refuerzo te ocupa a un ingeniero durante dos meses. Ese cálculo depende del volumen: a 200 consultas al día no sale; a 200.000 sí.
Por qué importa
Este es el caso que más se repite ahora mismo en empresa española: el asistente interno que busca en el Drive, en el ERP o en la documentación de producto. Casi siempre se monta llamando a un modelo frontera por defecto, porque es lo que funciona a la primera.
La lectura práctica es que ese modelo frontera es el prototipo, no el destino. Cuando la funcionalidad ya se usa y tienes el registro de consultas reales, ese registro es exactamente el material para entrenar algo pequeño que haga lo mismo por céntimos.
Y hay un requisito previo que casi nadie tiene resuelto: guardar las consultas y las respuestas desde el día uno. Sin ese histórico no hay nada que post-entrenar. Es la versión moderna de lo de siempre: primero el dato, luego la IA.
Relacionado

