Le principe

Les fournisseurs d'IA annoncent des limites : certaines questions ne devraient pas obtenir de réponse. Dans les faits, les modèles ne s'y tiennent pas toujours. Safety soumet les modèles à des sollicitations sensibles — d'une consigne dangereuse à une question politique qu'ils devraient décliner — et mesure ce qu'ils font réellement. Nous ne fixons pas la règle : nous mesurons l'écart entre les limites que les modèles s'annoncent et leurs réponses observées.