En bref
Une IA répond de deux façons très différentes : soit de mémoire, à partir de ce qu'elle a appris à l'entraînement, soit en consultant le web en direct au moment de la question. Ces deux régimes ne donnent pas les mêmes réponses — ni les mêmes noms, ni les mêmes faits, ni les mêmes sources. Les confondre fausserait la mesure. Nous les mesurons séparément.
Deux façons de répondre
Quand un modèle répond de mémoire, il puise dans ce qu'il a intégré pendant son entraînement. Cette connaissance est figée à une date : le modèle ignore ce qui s'est passé depuis, et il peut restituer des informations datées comme si elles étaient actuelles. Ses réponses sont souvent plus générales, parfois vagues, et elles ne s'appuient sur aucune source vérifiable — le modèle ne peut pas vous dire d'où il tient ce qu'il affirme.
Quand un modèle répond avec recherche web, il interroge des pages en direct au moment de la question, puis compose sa réponse à partir de ce qu'il trouve. Les noms cités changent, les faits sont plus récents, et surtout le modèle peut citer ses sources — on peut alors mesurer sur quoi il s'appuie.
Ce sont deux comportements distincts du même modèle. Mélanger leurs réponses dans une seule mesure reviendrait à additionner deux choses qui ne se comparent pas.
Pourquoi l'écart compte
L'écart entre les deux régimes est lui-même une information. Un modèle qui, de mémoire, ne cite aucun nom stable, mais qui, avec le web, en cite plusieurs de façon récurrente, nous apprend quelque chose : sa connaissance propre du sujet est faible, et ce qu'il en dit dépend presque entièrement de ce qu'il trouve en ligne à l'instant T.
À l'inverse, un modèle qui produit beaucoup de matière de mémoire connaît le sujet de lui-même — ce qu'il dira sera plus stable dans le temps, mais aussi plus difficile à corriger si cette connaissance est datée ou incomplète.
Ni l'un ni l'autre n'est « mieux ». Ce sont deux profils de comportement, et c'est précisément ce contraste que nous rendons visible.
Stock et flux
On peut résumer la distinction ainsi : la mémoire, c'est le stock — ce que le modèle porte en lui, stable mais figé. La recherche web, c'est le flux — ce qu'il capte à l'instant, actuel mais mouvant.
Le stock ne se laisse pas observer de l'extérieur : personne ne peut lire directement ce qu'un modèle « sait ». On ne peut le mesurer qu'en l'interrogeant, de façon répétée, sans lui donner accès au web. Le flux, lui, dépend des sources disponibles au moment de la mesure et peut changer d'un jour à l'autre.
Mesurer les deux séparément, c'est la seule façon de distinguer ce qui vient du modèle lui-même de ce qui vient de ce qu'il a lu à l'instant.
Ce que nous en faisons
Chaque mesure Liren traite les deux régimes à part : 20 tirages sans recherche web, 20 tirages avec. Pour chacun, nous rapportons ce que le modèle a répondu, à quelle fréquence, et — dans le régime web — quelles sources il a citées.
Nous ne fusionnons jamais les deux en un chiffre unique, et nous ne disons pas lequel des deux « a raison ». Nous montrons ce que chaque régime produit, côte à côte. Ce que révèle l'écart entre les deux, vous en tirez vos propres conclusions.