Comment nous mesurons ce que les modèles d’IA répondent — et ce que nous ne faisons jamais. Sans jargon.
Ce que nous observons du comportement des modèles : ce qu’ils répondent, à quelle fréquence, selon qu’ils puisent dans leur mémoire ou consultent le web — et pourquoi il faut répéter la mesure.
Les frontières que nous nous imposons : ni sondage, ni classement, ni note, ni interprétation — et comment nous rapportons les propos sensibles sans les reprendre à notre compte.
Ce qui rend une mesure opposable : un sceau cryptographique, un horodatage — et le fait qu’une mesure n’est vraie qu’à sa date.