Vigilar el razonamiento del modelo detecta hasta un 94% de casos, o un 5% según cómo se le influya
Un paper de Agatha Duzan y Asa Cooper Stickland pone número a algo incómodo: vigilar la cadena de razonamiento de un modelo funciona bien cuando le dices…