Pourquoi répéter la même question ?

En bref

Une IA ne répond pas deux fois exactement pareil à la même question. Poser la question une seule fois ne dit rien de fiable : on tombe sur une réponse parmi d'autres, sans savoir si elle est représentative ou marginale. Répéter la question — 40 fois par modèle — transforme une impression en mesure : on voit alors ce qui revient souvent, ce qui apparaît rarement, et ce qui ne sort qu'une seule fois.

Une réponse unique ne prouve rien

Quand vous interrogez une IA, vous obtenez une réponse qui paraît définitive. Elle ne l'est pas. Reposez la même question quelques minutes plus tard : la formulation change, les exemples changent, parfois les noms cités changent. Ce n'est pas un défaut, c'est le fonctionnement normal de ces modèles — ils génèrent, ils ne récitent pas.

Conséquence directe : un coup d'œil dans ChatGPT ou dans un autre modèle ne constitue pas une mesure. Vous voyez une réponse, pas le comportement du modèle. Vous ne savez pas si ce que vous lisez est ce qu'il répond neuf fois sur dix, ou une réponse qu'il ne donnera qu'une seule fois.

Ce que la répétition révèle

En posant la même question un grand nombre de fois, un motif apparaît. Certaines réponses reviennent presque à chaque fois : elles sont stables, elles caractérisent le modèle. D'autres n'apparaissent qu'occasionnellement. D'autres encore ne sortent qu'une seule fois sur l'ensemble.

Cette distribution est la mesure. Elle ne dit pas si une réponse est vraie — elle dit à quelle fréquence un modèle la produit. Une réponse donnée 18 fois sur 20 caractérise le comportement du modèle ; une réponse donnée 1 fois sur 20 est réelle mais marginale. Les deux sont des faits, et il faut les distinguer.

Pourquoi 40, et pas 2 ou 3

Deux raisons.

D'abord, deux comportements à mesurer, pas un. Une IA ne répond pas de la même manière selon qu'elle puise dans sa mémoire ou qu'elle consulte le web en direct. Ce sont deux régimes différents. Nous mesurons les deux séparément : 20 fois sans recherche web, 20 fois avec. D'où 40.

Ensuite, parce que le rare compte. Une réponse qui n'apparaît qu'une fois sur vingt n'est pas du bruit à jeter : c'est une réponse qu'environ 5 % des utilisateurs recevront réellement. À l'échelle des millions de personnes qui interrogent ces modèles, 5 %, ce sont des dizaines ou des centaines de milliers de gens. Mesurer trop peu, c'est ne jamais voir cette réponse — et rendre invisible ce qui touche pourtant beaucoup de monde. Vingt tirages par régime suffisent à faire apparaître ce qui existe autour du seuil des 5 %.

Mesurer peu, c'est ne voir que le sommet. Nous mesurons assez pour voir aussi ce qui est rare — parce que le rare arrive quand même.

Ce que nous en faisons — et ce que nous n'en faisons pas

Nous rapportons chaque réponse avec sa fréquence : ce que le modèle a dit, et dans combien de tirages. Nous ne moyennons pas, nous ne lissons pas, nous ne décidons pas qu'une réponse « compte » et qu'une autre « ne compte pas ». Une réponse à 1/20 est affichée comme telle, à côté d'une réponse à 18/20.

La fréquence indique la constance d'un modèle, pas la vérité de son propos. Que le modèle répète une chose vingt fois ne la rend pas vraie — cela la rend stable pour ce modèle. C'est cette distinction que nous mesurons, et c'est à vous d'en tirer les conclusions.