Un test con 1.100 casos clínicos reales encuentra el mismo fallo en las cuatro IA médicas
Un benchmark independiente llamado NOHARM ha pasado 1.100 casos clínicos reales por las cuatro principales IA médicas y ha recogido unas 13.000…
Newsletter
Tag
Benchmarks de IA leídos con lupa: qué miden de verdad, quién los lidera y cuándo una cifra récord no significa nada.
Un benchmark independiente llamado NOHARM ha pasado 1.100 casos clínicos reales por las cuatro principales IA médicas y ha recogido unas 13.000…
OpenAI ha auditado SWE-Bench Pro, uno de los exámenes de código más usados para medir a los modelos de IA, y ha llegado a una conclusión que incomoda a…
El Remote Labor Index acaba de poner numero a algo que se intuia: la IA ha dado…
OpenAI ha presentado la familia GPT-5.6 con tres modelos: Sol (el flagship), Terra (equilibrado, rendimiento de GPT-5.5 al doble de eficiencia en coste)…
Anthropic liberó ayer Claude Fable 5, la primera versión pública de un modelo en la clase Mythos. Hasta el lunes, Mythos solo estaba accesible para 150…
Los mejores modelos del mundo puntúan por debajo del 1% en un test que cualquier persona resuelve al 100%. La ARC Prize Foundation lanzó ARC-AGI-3 el 25…