La DdC — Le magazine de la Duchesse
Deux IA face à une langue qu’elles ne connaissent pas
Technologie7 octobre 2026

Deux IA face à une langue qu’elles ne connaissent pas

Article Technique sur une expérience comparant deux IA confrontées au vocabulaire inconnu mais cohérent de Crestignac, puis à son Dico. Angle: plausibilité vs vérité, grounding, hallucination, inférence, traçabilité et confiance.

La DdC5 min de lecture

Chapô

Que fait un modèle génératif lorsqu’il rencontre des mots dont il ignore réellement la signification? Une expérience menée avec le vocabulaire de Crestignac montre deux stratégies très différentes et pose une question essentielle: comment distinguer, dans une réponse, ce qui vient de la source, de l’inférence ou de l’invention?

Une expérience volontairement simple

La même image a été soumise à deux intelligences artificielles, sans aucune information complémentaire.

Elle représente une manifestation de jeunes Crestignaciens interrogés par des journalistes. Plusieurs pancartes sont visibles et deux manifestants s’expriment:

« Fako, ça raille sa mousse mon style: qu’ils se balibulasent tous les matins, on n’est pas à deux ou trois Crestins.»

et:

« Fako, ça suinte la foujarmine qui sent du crâne de ministre.»

Pour un modèle qui ne connaît pas Crestignac, plusieurs éléments sont donc inconnus: Fako, balibulasent, Crestins, foujarmine ou encore l’expression sentir du crâne de ministre.

Mais l’image fournit énormément de contexte: une manifestation, des uniformes, des journalistes, des revendications, des jeunes qui parlent et une institution mentionnée.

Autrement dit, le modèle ignore le sens des mots, mais dispose de suffisamment d’indices pour fabriquer une interprétation plausible.

C’est précisément là que l’expérience devient intéressante.

Un corpus construit plutôt qu’une suite de mots inventés

Le vocabulaire utilisé pour cette expérience n’est pas une succession de mots générés aléatoirement pour piéger les modèles.

Il provient du Dictionnaire de la Duchesse, le dictionnaire de Crestignac:

https://dico.crestignac.com

Sa particularité est de se construire progressivement avec l’univers. Un mot peut apparaître dans un article, une situation, un personnage ou un usage. Il est ensuite défini, réutilisé, parfois décliné et entre progressivement en relation avec d’autres notions.

Le Dico n’est donc pas construit avant Crestignac: il se constitue avec lui.

Les usages produisent les mots; les mots sont fixés dans le dictionnaire; ils peuvent ensuite revenir dans d’autres situations et contribuer à de nouveaux usages.

Cette mécanique produit progressivement une cohérence interne.

Un Crestin n’est pas seulement un mot à consonance crestignacienne: c’est une unité monétaire. Phaco / Fako possède un usage particulier dans le parler des jeunes Crestignaciens. Une foujarmine possède sa propre définition. De même, « sentir du crâne de ministre» appartient à un ensemble d’expressions dont le sens s’est constitué à l’intérieur de cet univers.

Quelques entrées permettent de consulter directement cette source de vérité:

Dictionnaire: https://dico.crestignac.com

Phaco: https://dico.crestignac.com/mot/phaco

Phacochérisme: https://dico.crestignac.com/mot/phacocherisme

Les autres termes cités dans l’expérience doivent être liés à leur fiche du Dico lors de la publication dès lors que leur URL canonique est disponible.

Cette construction est essentielle pour l’expérience.

Une IA peut produire une interprétation différente de celle du dictionnaire et néanmoins construire autour d’elle un ensemble extrêmement cohérent.

Elle ne produit alors pas nécessairement une absurdité.

Elle produit une autre cohérence.

L’existence d’une cohérence dans la réponse du modèle ne démontre donc pas qu’il a retrouvé la cohérence du corpus.

IA A: reconnaître l’incertitude

La première IA identifie assez rapidement le problème.

Elle propose certaines interprétations à partir du contexte, mais signale que plusieurs termes lui sont inconnus et qu’elle ne peut pas leur attribuer une signification certaine.

Dans un second temps, l’adresse de Crestignac et l’existence de son dictionnaire lui sont indiquées.

Elle recherche alors les termes, retrouve plusieurs définitions et corrige une partie de son analyse initiale.

Tout n’est pas parfait. Certaines associations restent erronées et quelques interprétations continuent à dépasser ce que dit réellement la source.

Mais sa stratégie change: l’incertitude initiale devient une information à traiter.

IA B: compléter immédiatement le monde

Deux IA face à une langue qu’elles ne connaissent pas

La seconde IA adopte une stratégie très différente.

Face aux mêmes termes inconnus, elle cherche immédiatement à les rattacher à un système linguistique qu’elle connaît déjà.

À partir de cette première hypothèse, elle construit progressivement tout un cadre explicatif: origine supposée des mots, significations, usages et contexte culturel.

L’ensemble est remarquablement cohérent.

Le problème est que la prémisse initiale est fausse.

Les mots appartiennent au vocabulaire de Crestignac et disposent, pour plusieurs d’entre eux, de définitions précises dans son dictionnaire.

L’IA n’a donc pas retrouvé leur signification.

Elle a construit un système capable de leur en donner une.

Et ce système est suffisamment cohérent pour rendre l’erreur difficile à percevoir.

Donner accès à la source ne règle pas nécessairement le problème

La seconde partie de l’expérience est peut-être la plus intéressante.

Une fois la véritable source indiquée, IA B abandonne son hypothèse initiale. Elle consulte le corpus et retrouve plusieurs éléments exacts.

On pourrait penser le problème résolu.

Il ne l’est que partiellement.

Car entre les informations effectivement présentes dans le corpus, le modèle continue parfois à établir des relations qui, elles, n’y figurent pas.

Il ne fabrique plus nécessairement les données elles-mêmes.

Il fabrique les liens entre les données.

C’est une distinction importante lorsqu’on parle de grounding.

Connecter un modèle à une base documentaire, un moteur de recherche, un RAG ou une source métier ne garantit pas que l’intégralité de la réponse produite provienne de cette source.

La source peut fournir les éléments A et B.

Le modèle peut ensuite décider que A implique B, alors que cette relation n’a jamais été établie dans le corpus.

Plausibilité et vérité

Cette expérience utilise volontairement un vocabulaire construit.

C’est ce qui la rend particulièrement observable: puisque les significations ont été définies dans un corpus identifiable, il devient possible de comparer ce que dit le modèle avec ce qui existe réellement dans la source.

Mais le mécanisme observé dépasse largement Crestignac.

Un modèle génératif est extrêmement performant lorsqu’il s’agit de produire une continuité cohérente à partir d’éléments incomplets.

C’est précisément l’une de ses qualités.

C’est également l’une de ses difficultés.

Une explication peut être parfaitement structurée sans être fondée.

Plus elle est cohérente, documentée en apparence et linguistiquement convaincante, plus il devient difficile pour l’utilisateur de distinguer une information retrouvée d’une relation inférée ou d’un élément inventé.

De la bonne réponse à la réponse traçable

Dans un usage occasionnel de l’intelligence artificielle, on peut se contenter de vérifier si une réponse paraît correcte.

Dans un système professionnel, cette approche atteint rapidement ses limites.

Lorsque l’IA intervient dans l’analyse d’un dossier, la synthèse documentaire, l’aide à la décision ou l’exploitation de données métier, une autre question devient essentielle.

Il ne suffit plus nécessairement de demander:

« L’IA a-t-elle donné une bonne réponse?»

Il faut également pouvoir demander:

« Puis-je retracer ce qui, dans sa réponse, vient de la source, de l’inférence… ou de l’invention?»

Cette distinction touche directement au grounding, à l’hallucination, à la traçabilité et, finalement, à la confiance que l’on peut accorder à un système génératif.

L’enjeu n’est peut-être donc pas uniquement de construire des IA qui répondent juste.

Il est aussi de construire des systèmes dans lesquels nous pouvons savoir pourquoi nous considérons leur réponse comme juste.

Illustration: image de la manifestation crestignacienne utilisée pour le test avec les deux jeunes interviewés et leurs bulles de dialogue.

CrestignacIATechniqueDicogroundinghallucinationtraçabilitéexpérience
Partager