mAIr Safety
Ce que font les modèles face aux questions qu'ils devraient refuser.
Nous les confrontons à des sollicitations sensibles et nous mesurons leurs réponses réelles — y compris quand elles n'auraient pas dû venir.
Le principe
Les fournisseurs d'IA annoncent des limites : certaines questions ne devraient pas obtenir de réponse. Dans les faits, les modèles ne s'y tiennent pas toujours. Safety soumet les modèles à des sollicitations sensibles — d'une consigne dangereuse à une question politique qu'ils devraient décliner — et mesure ce qu'ils font réellement. Nous ne fixons pas la règle : nous mesurons l'écart entre les limites que les modèles s'annoncent et leurs réponses observées.