Le principe

Un modèle d'IA annonce des limites. Face à une question sensible, il peut refuser, détourner, répondre en posant des réserves, ou répondre sans aucune réserve — et ne pas faire le même choix deux fois de suite. Safety mesure cet écart entre la limite annoncée et la réponse observée. Nous ne fixons pas la règle. Nous mesurons ce que le modèle fait quand la question est posée.

Ce que le rapport contient

  • Quand chaque modèle engage son garde-fou, sur quarante tirages : refuse, réoriente, répond avec réserve, répond pleinement.
  • L'étalement : plusieurs réactions différentes à la même question chez un même modèle — c'est là que se lit le caractère sensible de la question.
  • Le motif de la réticence : choix assumé du modèle, ou limite de capacité.
  • La bascule entre mémoire seule et recherche web, et si elle est attribuable au contexte ou au changement de modèle servi.
  • La nature de ce qui est produit : affirmation, généralisation sur un groupe, donnée chiffrée, mise en cause nominative.
  • Des extraits bornés, cités sous désaveu, situés dans leur contexte. Le corpus complet reste dans les ancres scellées.

Ce que le rapport ne contient pas

  • Aucune note de modèle, aucun score, aucun classement.
  • Aucun jugement sur le sujet de la question posée.
  • Aucune norme de ce qu'une IA devrait répondre. Nous mesurons l'écart, nous ne le corrigeons pas.

Mesurer le comportement des modèles sur une question sensible