Xiaomi libera MiMo-V2.6-Pro, el modelo abierto mejor puntuado
Xiaomi ha publicado MiMo-V2.6-Pro con licencia MIT, y desde el 21 de septiembre es el modelo de pesos abiertos mejor puntuado del Intelligence Index…
Newsletter
Tag
Benchmarks de IA leídos con lupa: qué miden de verdad, quién los lidera y cuándo una cifra récord no significa nada.
Xiaomi ha publicado MiMo-V2.6-Pro con licencia MIT, y desde el 21 de septiembre es el modelo de pesos abiertos mejor puntuado del Intelligence Index…
SpaceXAI ha lanzado Grok 4.7 este 21 de septiembre, su modelo más capaz para programar y para trabajo de oficina, al mismo precio que Grok 4.6: 2 dólares…
Bottleneck Labs dio 300 dólares y 72 horas a siete modelos de frontera para que montaran un negocio de verdad, con cuenta bancaria, Stripe y correo.
El primer benchmark independiente de GPT-6 Astra moviendo brazos robóticos reales ya está publicado, y el resultado es contundente en una tarea…
OpenAI ha lanzado GPT-6 Astra y el número que lo resume está en el informe de ARC Prize: 99,9% en ARC-AGI-3 usando el adaptador del proveedor.
Google DeepMind ha lanzado el primer piloto de evaluación a doble ciego de un modelo de IA propietario. Los evaluadores externos no ven los pesos del…
Instinct ha cerrado una serie B de 250 millones de dólares que eleva su financiación total a 350 millones y su valoración a 2.500, con Index Ventures y…
Z.ai ha reconocido que Ox Alpha, el modelo anónimo que lidera varios benchmarks, es suyo. Apareció sin firma en OpenRouter, se puso por delante de los…
Nvidia ha publicado una investigación en la que Claude Opus 5 pasa del 30% al 100% de acierto en ARC-AGI-3 sin cambiar de modelo. Lo único que cambia es…
Alibaba ha publicado Qwen3.8-27B bajo licencia Apache 2.0, con 61,7% en SWE-bench Pro y 73,0 en Terminal-Bench 2.1. Son 27.780 millones de parámetros en…
OpenAI y Anthropic están empujando a sus clientes a dejar de comparar precios por millón de tokens y medir el coste por tarea completada. Con esa vara,…
Google ha lanzado Gemini 3.7 Flash con un salto de 16 puntos en DeepSWE v1.1, de 49,0% a 65,3%, y un precio de estreno de 0,75 dólares por millón de…
Un usuario dio a Claude Opus 5 acceso a Unreal Engine durante 24 horas y le pidió que construyera un clon de GTA 6 por su cuenta. El resultado se parece…
SpaceXAI ha lanzado Grok 4.6 el 12 de agosto a 2 dolares por millon de tokens de entrada y 6 por millon de salida, y empata con GPT-5.6 Sol Max en el…
Trapit Bansal, investigador de Meta, ha anunciado que los modelos de la casa han alcanzado nivel de medalla de oro en cinco olimpiadas científicas…
Cuatro días después de que Alibaba publicara la tabla donde Qwen3.8-Max supera a Claude Opus 4.8 y a Fable 5 en uso agéntico, el índice de BenchLM lo…
Prime Intellect ha liberado Prime Agent, un harness de programación de código abierto que se modifica a sí mismo mientras trabaja. Con Opus 5 por debajo…
Claude Opus 4.7 ha reimplementado desde cero un programa de bioinformática de unas 16.000 líneas de código, sin ver el original, y ha pasado 2.000 de los…
DeepSeek ha puesto en beta pública la API de V4-Flash con la build 0731, y el resultado incomoda a su propio catálogo: el modelo pequeño supera al grande…
Andrej Karpathy le dio a Claude Opus 5 el primer párrafo de El Señor de los Anillos, un presupuesto de un millón de tokens (unos 10 dólares) y una…
Alibaba ha puesto números a Qwen3.8-Max. Tres semanas después de enseñar el modelo en preview sin una sola cifra, la compañía ha publicado resultados que…
Un grupo de 24 investigadores dio a agentes de frontera seis días y miles de dólares en cómputo para responder la pregunta central de dos artículos…
OpenAI ha publicado algo que parece una nota tecnica menor y es la lectura mas util de la semana para cualquiera que este montando agentes: dos ajustes…
Andon Labs puso a tres modelos a competir gestionando maquinas expendedoras durante un ano simulado, con email para hablar entre ellos, y Claude Opus 5…