Claude Code pone el modo automático por defecto el 14 de agosto

Claude Code pone el modo automático por defecto el 14 de agosto
Fuente: claude.com

Claude Code activa el modo automático por defecto el 14 de agosto en los planes Pro, Max y Team, y el motivo que da Anthropic en su anuncio deja en mal lugar al humano que supuestamente supervisa. En su estudio con 1.053 desarrolladores de pago, las personas aprobaban el 97% de lo que Claude les ponía delante y solo frenaban el 13,6% de los comandos peligrosos.

El clasificador del modo automático frenó el 89% de esos mismos comandos.

Puntos clave

  • El modo automático pasa a ser el estado por defecto de las sesiones nuevas el 14 de agosto en Pro, Max y Team.
  • En Enterprise y en la API sigue siendo opcional. Anthropic dice que el despliegue completo llega en un mes.
  • Estudio con 1.053 testers de pago: humanos, 13,6% de comandos peligrosos detenidos. Clasificador, 89%.
  • Los equipos con modo automático abrieron alrededor de un 25% más de pull requests.
  • Anthropic deja de cobrar los tokens que consume el propio clasificador en esos tres planes.

Qué hace exactamente el clasificador

Hasta ahora, Claude Code funcionaba pidiendo permiso. Cada vez que iba a tocar un archivo, lanzar un comando de terminal o llamar a una herramienta, se paraba y esperaba tu sí. Sobre el papel eso es control humano. En la práctica es un botón que aprietas mil veces al día.

El modo automático cambia el orden. Cada llamada a herramienta pasa por un clasificador que la evalúa antes de ejecutarla, y solo se corta si la acción es irreversible, destructiva o sale del entorno de trabajo. Borrar sin vuelta atrás, tocar algo fuera del proyecto, mandar datos afuera. Cuando el clasificador bloquea, Claude busca una ruta más segura por su cuenta o te pregunta a ti directamente.

Hay un freno de mano. Tras tres bloqueos seguidos o veinte bloqueos en la misma sesión, Claude Code vuelve al modo de revisión manual. La idea es que un agente que choca contra la pared una y otra vez no siga intentándolo a ciegas.

El problema no era el modelo, era el clic

El dato que sostiene toda la decisión es el 97%. Con permisos manuales, los desarrolladores del estudio aprobaban prácticamente todo. No es que revisaran y decidieran que sí: es que la revisión había dejado de existir. Cuando algo te interrumpe cada treinta segundos, el cerebro deja de leer y la mano se adelanta.

Ese es el fallo que Anthropic dice haber medido. El humano que solo caza el 13,6% de lo peligroso no está supervisando, está firmando. Y una vez que entiendes eso, el diálogo de permisos deja de ser una capa de seguridad y pasa a ser teatro con coste de fricción.

Es el mismo agujero que Cisco Talos destapó hace unos días al mostrar cómo los atacantes convencen a Claude Code, Codex y Cursor de que les den permiso. Si el humano aprueba por inercia, el ataque no necesita romper el modelo: le basta con llegar al diálogo.

720 intentos de inyección de prompt, cero éxitos

La otra pata del anuncio es la seguridad frente a inyección de prompt indirecta, el ataque en el que las instrucciones maliciosas viajan escondidas dentro de un archivo, una página web o un ticket que el agente lee mientras trabaja.

Anthropic dice que en una auditoría externa de 72 escenarios, con 720 intentos de ataque en total, ninguno funcionó contra Claude Fable 5, Opus 5 ni Sonnet 5 corriendo en modo automático. Contra sistemas rivales, el 5,83% de los intentos sí llegó a buen puerto. Según el análisis de The Decoder, la auditoría la firmó Trajectory Labs.

Conviene leer esa cifra con la cabeza fría. Un cero sobre 720 escenarios diseñados por un tercero es una buena señal, pero no es una prueba de que no exista el escenario 721. La propia arquitectura lo admite al dejar el freno de los veinte bloqueos.

Qué pasa con el coste y con quien no lo quiera

El clasificador gasta tokens. Anthropic ha decidido no cobrarlos en Pro, Max y Team, con efecto inmediato. Tiene sentido comercial: cobrar por el peaje de seguridad que tú mismo impones por defecto habría sido difícil de defender.

Apagarlo es un atajo. Shift+Tab en la CLI, o el desplegable en la app de escritorio. Los administradores de Enterprise pueden fijar el modo con managed settings o desactivar el automático por completo. Si ya tenías un modo fijado a mano, se respeta, y si no, puede que veas un aviso puntual la primera vez.

Dentro de Anthropic dicen que casi todo el mundo lo usa ya. El modo automático no es nuevo, lleva desde mayo dando vueltas como opción. Lo que cambia el 14 de agosto es qué pasa cuando abres una sesión y no tocas nada.

De opción de mayo a estado por defecto

Anthropic estrenó el modo automático a primeros de mayo con dos capas, no una. La primera revisa lo que devuelven las herramientas antes de que entre al contexto del modelo, e inyecta un aviso cuando el contenido tiene pinta de malicioso. La segunda es el clasificador de ejecución que evalúa cada acción propuesta, deja pasar lo seguro y manda a verificación lo ambiguo.

La crítica que apareció entonces sigue viva y no va de tecnología. Un directivo de Playtika lo resumió apuntando que, con el modo automático encendido, la IA pasa a ser quien aprueba y no solo quien ejecuta, y preguntando si la documentación de gobernanza de las empresas se había actualizado para reflejar ese cambio de autoridad.

Es la pregunta correcta. La mayoría de políticas internas de uso de IA se escribieron dando por hecho que una persona valida cada acción sensible. El 14 de agosto, en muchas de esas empresas, esa frase deja de ser cierta sin que nadie haya cambiado el documento.

Por qué importa

Si tu equipo usa Claude Code, el 14 de agosto cambia el comportamiento por defecto de todas las sesiones nuevas sin que nadie mueva un dedo. Vale la pena decidirlo antes de que lo decida el calendario: revisar qué proyectos tocan datos de producción, dejar el modo fijado a mano donde no quieras sorpresas, y usar managed settings si tienes plan Enterprise.

Y hay una lectura de fondo que va más allá de Claude Code. El human-in-the-loop que muchas empresas ponen en sus automatizaciones es exactamente el 97% de este estudio: alguien que aprueba sin mirar porque le llegan cuarenta avisos al día. Si tienes procesos con IA donde una persona valida en masa, ese punto de control probablemente no esté controlando nada. Medirlo cuesta poco. Descubrir que no funciona el día que algo se rompe cuesta bastante más.


Relacionado