IA pour PME

Hallucination IA : l’outil ne ment pas, il complète, et voici mes trois ratés de septembre

L’IA ne ment pas, elle complète. Mes trois ratés datés de septembre 2026, les tribunaux qui les paient, et trois gestes qu’une PME copie lundi.

Cinq cartes de papier alignées à pas régulier sur une bande de carton gris, quatre blanches et une verte à la quatrième place, sur fond papier beige, une seule ombre nette vers le bas à droite

Une hallucination IA, c’est une réponse fausse que l’outil vous donne avec exactement le même ton, la même mise en page et la même assurance qu’une réponse juste. Wikipédia la définit comme « une réponse fausse ou trompeuse qui est présentée comme un fait certain ». OpenAI, dans la version française de son billet du 5 septembre 2025, écrit que « les modèles hallucinent, car les entraînements et évaluations classiques récompensent davantage les réponses aléatoires que l’admission d’une incertitude ». Ma façon de le dire : l’IA ne ment pas, elle complète. Quand elle ne sait pas, elle fabrique une réponse qui a la forme d’une bonne réponse, parce qu’on l’a dressée à répondre plutôt qu’à se taire. Comme un élève qui coche au hasard plutôt que de laisser la case blanche.

Je ne vous raconte pas ça de loin. Ce site est fabriqué avec des outils d’IA tous les jours, et mon journal de fabrication porte trois ratés datés de septembre 2026 : une transcription qui a posé des mots dans mes silences (17 septembre) ; trois statistiques inventées retirées d’un brouillon d’article (2 septembre), puis, dans un autre brouillon, mises sur le dos de ChatGPT alors qu’elles venaient de ma propre chaîne (21 septembre) ; et une étude déformée en « aucun participant n’a compris » là où la source disait autre chose (19 septembre). Aucun n’est sorti, parce qu’une relecture était posée avant la sortie. L’outil, lui, ne s’est corrigé à aucun moment.

Ce que ça coûte quand personne ne relit, les tribunaux le racontent mieux que moi : trois juridictions françaises ont écrit, en décembre 2025, que des jurisprudences citées devant elles n’existaient pas ; aux États-Unis, des avocats ont été condamnés en 2023 à 5 000 dollars d’amende pour un mémoire bâti sur des décisions inventées par ChatGPT ; et la base qui recense ces affaires dans le monde en comptait 2 046 au 21 septembre 2026.

La règle de maison tient en trois gestes, détaillés plus bas, qu’une PME peut copier telle quelle. Le risque ne disparaît pas. Il se gère une fois, à l’échelle de l’entreprise, et non à chaque consigne tapée dans l’outil (ce qu’on appelle un prompt).

C’est quoi l’hallucination en IA ?

Une hallucination IA est une affirmation plausible mais fausse, produite par un modèle de langage et livrée sans aucun signal d’alerte. Le mot est mal choisi : l’outil ne voit rien, il ne délire pas. Il complète un texte avec la suite la plus probable, et cette suite est parfois fausse. Le danger, c’est qu’une réponse inventée a exactement la même tête qu’une réponse vraie.

Les deux définitions les plus courtes que j’ai relues le 22 septembre 2026 disent la même chose. Wikipédia : « une réponse fausse ou trompeuse qui est présentée comme un fait certain ». Le billet d’OpenAI du 5 septembre 2025, dans sa version française : « Les hallucinations sont des affirmations plausibles, mais fausses, des modèles de langage. » Le mot qui compte est « plausibles ». Une hallucination ne ressemble pas à une faute de frappe. Elle ressemble à un fait.

Pour un dirigeant, le point utile est celui-ci : le mot « hallucination » décrit un comportement normal de l’outil, pas une panne. L’outil ne dispose pas d’un compteur interne « vrai / faux » qu’il aurait oublié de consulter. Il n’a que des probabilités de mots. Quand la question porte sur un fait rare, précis et vérifiable (une date, un numéro de décision, un montant, le nom d’un fournisseur), la suite la plus probable est souvent une invention bien formée. C’est exactement là que le risque d’entreprise commence.

Pourquoi ChatGPT hallucine ?

ChatGPT hallucine parce qu’il a été entraîné à produire le texte le plus probable, pas le texte vrai, puis évalué par des tests qui donnent un point à une bonne réponse et zéro à un « je ne sais pas ». Un système noté ainsi apprend à toujours répondre. C’est la thèse d’OpenAI dans son étude de septembre 2025, et elle vaut pour tous les modèles du marché, pas seulement pour ChatGPT.

L’étude d’OpenAI « Why Language Models Hallucinate », signée Kalai, Nachum, Vempala et Zhang et soumise le 4 septembre 2025, le dit en une phrase : les modèles hallucinent « because the training and evaluation procedures reward guessing over acknowledging uncertainty », c’est-à-dire parce que l’entraînement et l’évaluation récompensent la devinette plutôt que l’aveu d’incertitude. L’analogie des auteurs est celle de l’examen : « When uncertain, students may guess on multiple-choice exams and even bluff on written exams, submitting plausible answers in which they have little confidence. Language models are evaluated by similar tests. » En français : quand ils doutent, les élèves devinent au QCM et bluffent à l’écrit, en rendant des réponses plausibles auxquelles ils croient peu ; les modèles de langage sont notés par des tests du même genre.

Le billet grand public d’OpenAI, publié le lendemain, donne la version arithmétique. Si vous ignorez la réponse, tenter au hasard peut rapporter le point ; ne pas répondre garantit le zéro. Sur une date d’anniversaire inconnue, répondre « 10 septembre » a une chance sur 365 de tomber juste ; répondre « je ne sais pas » en a zéro dans le barème classique. Un modèle optimisé sur ce barème apprend donc à inventer une date. Une précision sur la fraîcheur : ce billet a un peu plus de douze mois au moment où j’écris ; c’est la publication qui accompagne l’étude, pas la dernière communication d’OpenAI sur le sujet, et je n’ai pas lu de texte plus récent qui la contredise.

Le même billet ajoute deux choses utiles pour un dirigeant. D’abord, pendant l’entraînement de base, « il n’y a pas d’étiquette “vrai/faux” associée à chaque affirmation » : le modèle voit des exemples de langage bien formé et apprend à en produire, rien d’autre. Ensuite, les faits arbitraires à faible fréquence (une date de naissance, un numéro de dossier) ne suivent aucune régularité qu’un modèle pourrait apprendre, quelle que soit sa taille. OpenAI en tire une conclusion qui vaut d’être gardée sous les yeux : « l’exactitude des modèles n’atteindra jamais 100 % ». Le prochain modèle ne changera pas cette phrase, et celui d’après non plus.

Pouvez-vous donner un exemple d’hallucination de l’IA ?

Oui, trois de chez moi, datés, tirés du journal de fabrication de ce site, plus un de chez OpenAI. Dans les trois cas, l’outil a produit quelque chose de bien formé, confiant, et faux. Dans les trois cas, c’est une relecture posée avant la sortie qui a attrapé l’erreur, jamais l’outil lui-même.

17 septembre 2026, montage de la vidéo B2 de ma série « IA en PME ». J’enregistre ma voix, puis whisper, un logiciel de transcription automatique qui tourne sur ma machine, découpe le fichier mot à mot pour caler les coupes. Sur ce texte, tout est propre : aucune répétition, aucun mot coupé. Sauf que la transcription avait posé des mots dans mes blancs et fusionné un faux départ avec la bonne prise : « Vous avez… Vous avez bien entendu » lu comme une seule phrase, même en réécoutant le passage isolé. Résultat, un premier rendu avec un trou d’une à deux secondes à 1 min 04, que j’ai entendu à la première écoute. La lecture qui a fini par faire foi n’est pas la transcription : en lisant le volume sonore plutôt que le texte, le faux départ et le blanc apparaissent tels quels. Vidéo refaite le soir même. L’outil n’a pas menti : il a complété mes silences avec les mots les plus probables.

2 septembre 2026, brouillon de l’article « Comment créer un agent IA ». Ma chaîne de rédaction passe par une relecture systématique qui cherche la faute avant toute publication. Sur ce brouillon, elle a retiré trois statistiques inventées (« c’est l’étape que 90 % des tutoriels sautent », « c’est ici que la moitié des projets s’arrêtent », « l’étape de tri compte pour la moitié du travail »), qu’aucune source ne rattachait à rien. Aucune n’est sortie. Puis, le 21 septembre 2026, sur l’article Claude ou ChatGPT pour une PME, la même relecture a attrapé une seconde couche : le brouillon mettait ces statistiques inventées sur le dos de ChatGPT, alors qu’elles venaient de ma propre chaîne, qui tourne sur Claude. Une invention, puis une fausse attribution de l’invention. Corrigé avant publication.

19 septembre 2026, article « Chatbot définition ». Le brouillon affirmait qu’« aucun participant » d’une étude du Nielsen Norman Group n’avait compris à quoi servaient les chatbots testés. J’ai relu la source : elle dit que les participants les utilisaient rarement, ne les remarquaient souvent pas, et peinaient à voir ce qu’ils apportaient. Ce n’est pas la même phrase. Corrigé avant publication ; la version en ligne de ce que fait vraiment un chatbot sur un site porte la formulation exacte.

L’exemple d’OpenAI. Dans l’étude citée plus haut, les auteurs demandent à DeepSeek-V3 la date de naissance d’Adam Kalai, l’un d’eux. Le modèle rend trois dates différentes sur trois essais, toutes fausses. Le billet ajoute qu’interrogé sur le titre de sa thèse, un chatbot très répandu « a fourni avec assurance trois titres différents, tous faux ». Trois réponses confiantes, et pas une seule hésitation : c’est le comportement ordinaire de l’outil, pas une exception.

Quel est le taux d’hallucination avec l’IA ?

Il n’existe pas un taux d’hallucination de l’IA. Le chiffre dépend du modèle, du type de question et de la manière de mesurer : dans les deux séries publiées ci-dessous, il va de 1,8 % à 75 % selon la tâche et le modèle. Deux séries de chiffres publiés, avec leur périmètre, valent mieux qu’un pourcentage rond. Quiconque vous donne « l’IA se trompe dans X % des cas » sans dire sur quelle tâche vous vend quelque chose.

Un grand carton gris punaisé à plat sur fond blanc, recouvert aux deux tiers par une feuille de calque punaisée en haut, et un petit rectangle de papier vert punaisé dans la zone restée nue

Première série, citée par OpenAI dans son billet du 5 septembre 2025, à partir de la fiche système de GPT-5 sur le test SimpleQA (des questions factuelles courtes) :

  • gpt-5-thinking-mini : 52 % d’abstention (le modèle dit qu’il ne sait pas), 22 % de réponses exactes, 26 % d’erreurs.
  • OpenAI o4-mini, plus ancien : 1 % d’abstention, 24 % de réponses exactes, 75 % d’erreurs.

Ces deux lignes se lisent ensemble. Le modèle qui « répond mieux » (24 % contre 22 %) se trompe trois fois plus souvent, parce qu’il ne s’abstient presque jamais. Un modèle qui accepte de dire « je ne sais pas » la moitié du temps produit moins de faux. Pour un dirigeant, l’exactitude brute est un indicateur trompeur si on ne lit pas le taux d’erreur à côté.

Seconde série, le classement Vectara des hallucinations en résumé, mis à jour le 11 mai 2026. Ici la tâche est cadrée : le modèle reçoit un document et doit le résumer sans rien ajouter ; un modèle évaluateur vérifie que le résumé ne contient rien d’absent du texte. Sur cette tâche, le modèle le mieux classé (antgroup/finix_s1_32b) reste à 1,8 % d’hallucination, et les derniers du tableau montent à 24,2 %. Entre les deux, des modèles que vos équipes utilisent : gemini-2.5-pro à 7,0 %, gpt-4o à 9,6 %, claude-sonnet-4-5 à 12,0 %, gpt-5-high à 15,1 %.

Deux lectures à ne pas faire. Ce 1,8 % ne vaut que pour un résumé avec le document sous les yeux : ce n’est pas un taux d’erreur en conversation libre, et encore moins en recherche de jurisprudence, tâche qui n’est mesurée nulle part dans ces tableaux. Et même dans le cas le plus favorable, avec la source fournie et une consigne stricte, le meilleur modèle n’est pas à zéro. Le risque se réduit avec le modèle et le cadrage. Il ne disparaît pas.

L’IA peut-elle halluciner sur des données de mon entreprise ?

Oui, et c’est le cas le plus dangereux, parce qu’une invention sur vos propres chiffres est celle que personne à l’extérieur ne peut repérer. L’outil ne sait pas ce qu’il ignore de votre entreprise. Si votre grille tarifaire n’est pas dans ce qu’il lit, il en produira une plausible. Si le nom du client n’est pas dans le document, il en choisira un qui sonne juste.

Le mécanisme est le même que pour la date de naissance d’Adam Kalai : un fait rare, précis, absent de ce que le modèle a vu, et une consigne implicite de répondre quand même. Sauf qu’ici, la conséquence dépasse une ligne fausse sur un blog. C’est un devis avec un délai que vous ne tenez pas, un mail client avec une condition de garantie qui n’existe pas dans vos CGV, un tableau de bord avec un chiffre d’affaires « estimé » que personne n’a mesuré. Sur mes propres pages, ce site tourne avec deux règles écrites : « les chiffres viennent des mesures » et « jamais de chiffre inventé, case vide plutôt que faux chiffre ». Elles existent parce que le contraire s’est produit.

Chez les entreprises que j’accompagne, le risque n’est pas réparti uniformément. Voici la grille que j’applique chez moi et que je pose chez mes clients :

  • Risque faible, relecture légère : brainstorm, plan d’un document, premier jet d’un texte que vous allez de toute façon réécrire, reformulation d’un mail dont vous avez écrit le fond, résumé d’un document que vous avez sous les yeux. Une erreur se voit tout de suite, et elle ne sort pas de votre bureau.
  • Risque élevé, relecture obligatoire ligne à ligne : tout chiffre (prix, délai, marge, effectif, date), tout nom propre (client, fournisseur, personne, produit), toute référence juridique ou réglementaire (article, décision, norme, date d’application), toute donnée client (contrat, historique, coordonnées), tout ce qui engage votre signature.
  • Interdit sans document fourni : demander à l’outil un fait sur votre entreprise qu’il n’a pas sous les yeux. Si l’information n’est pas dans le texte que vous lui donnez, il ne la connaît pas, et il répondra quand même.

Le guide d’Anthropic pour réduire les hallucinations donne le cadrage technique de cette troisième ligne : restreindre l’outil aux documents fournis, lui demander des citations mot pour mot avant toute analyse, surtout sur un document long, et retirer toute affirmation qui ne s’appuie sur aucune citation. Trois lignes de consigne, que n’importe qui écrit une fois et réutilise.

Un dirigeant peut-il être tenu responsable d’une hallucination de l’IA ?

Je ne suis pas juriste, donc je ne vous dirai pas ce que dit le droit. Je vous dis ce que les décisions montrent : dans chaque affaire publiée, c’est la personne qui a signé le document qui a répondu de son contenu, jamais l’outil. Aucune juridiction n’a mis en cause le logiciel. La responsabilité suit la signature. Si le devis part sous votre nom, le chiffre inventé est le vôtre.

Les faits, tels que je les ai relus le 22 septembre 2026. Aux États-Unis, dans l’affaire Mata v. Avianca, le juge P. Kevin Castel, tribunal fédéral du district sud de New York, a infligé le 22 juin 2023 une amende de 5 000 dollars aux avocats qui avaient déposé un mémoire citant des décisions inventées par ChatGPT. C’est l’affaire fondatrice. La sanction est tombée sur les personnes qui ont signé le mémoire, et la décision porte leurs noms, en accès public, depuis 2023.

En France, Le Monde Informatique a recensé le 22 janvier 2026 trois décisions de décembre 2025. Tribunal administratif de Grenoble, 3 décembre 2025 : un requérant sans avocat, des références jugées « fantaisistes », un outil qualifié de « totalement inadapté à cet usage ». Tribunal judiciaire de Périgueux, 18 décembre 2025 : des références de jurisprudence introuvables, et le requérant et son conseil invités à vérifier qu’il ne s’agit pas d’hallucinations. Tribunal administratif d’Orléans, fin décembre 2025 : des jurisprudences citées qui n’existent pas, des numéros qui ne correspondent pas aux dates, et le tribunal qui invite à vérifier qu’il ne s’agit pas d’« hallucination » ou de « confabulation ». À cette date, aucune sanction en France : des mises en garde écrites, dans des décisions publiques, au nom des personnes concernées.

Pour mesurer l’ampleur, la base « AI Hallucination Cases » de Damien Charlotin recense les décisions de justice dans le monde où une IA générative a produit du contenu halluciné. À sa mise à jour du 21 septembre 2026, elle comptait 2 046 affaires, dont 815 impliquant un avocat, 1 175 un justiciable sans avocat, et une cinquantaine d’autres cas (juges, experts, procureurs). 815 professionnels du droit dans la base : le problème dépasse les néophytes. Et le compteur a passé les deux mille en un peu plus de trois ans depuis Avianca : ce n’est plus une anecdote.

Pour votre PME, le même mécanisme donne ceci. Un devis, une réponse à un appel d’offres, un courrier de mise en demeure, une fiche produit avec une norme citée : chacun porte votre nom, pas celui du logiciel. La question utile est « qui a relu avant l’envoi ». Si la réponse est « personne », vous avez déjà la réponse à celle de la responsabilité.

Comment éviter les hallucinations de l’IA ?

On les attrape avant qu’elles sortent. Trois gestes suffisent, et ils ne demandent aucune compétence technique : une source datée pour tout chiffre, sinon la case reste vide ; une relecture humaine avant tout envoi, tout devis, toute conclusion ; « je ne sais pas » accepté comme réponse et demandé explicitement à l’outil. C’est ma règle de maison.

Une pile épaisse de cartes de papier blanc vue du dessus, dont la carte verte du dessus est poussée sur le côté et dépasse du bord de la pile, une seule ombre nette

Geste 1 : une source datée pour tout chiffre, sinon la case reste vide. Chaque nombre qu’un outil vous propose est traité comme un nombre inventé jusqu’à preuve du contraire. La preuve, c’est une source que vous pouvez ouvrir, avec une date. Pas de source, pas de chiffre : la case reste vide, ou vous écrivez « à mesurer ». C’est ce qui a retiré trois statistiques de mon brouillon le 2 septembre 2026. C’est aussi ce qui protège un devis : un délai de livraison qu’aucun fournisseur n’a confirmé n’a rien à faire dans un document signé.

Geste 2 : relecture humaine avant tout envoi, tout devis, toute conclusion. L’outil prépare, une personne envoie. Jamais l’inverse. La relecture ne porte pas sur le style, elle porte sur la liste des risques élevés de la section précédente : chaque chiffre, chaque nom propre, chaque référence, chaque donnée client, ligne par ligne, source ouverte à côté. Chez moi, ça prend entre une et trois minutes par document selon sa longueur ; je ne l’ai mesuré nulle part ailleurs. C’est la relecture que les avocats de Mata v. Avianca n’ont pas faite.

Geste 3 : « je ne sais pas » accepté comme réponse, et demandé explicitement. Le guide d’Anthropic « Reduce hallucinations » le formule ainsi : « Allow Claude to say “I don’t know”: Explicitly give Claude permission to admit uncertainty. This simple technique can drastically reduce false information. » En français : autorisez l’outil à dire « je ne sais pas », donnez-lui explicitement la permission d’admettre l’incertitude ; cette technique simple réduit fortement les fausses informations. Concrètement, une phrase dans vos consignes : « Si l’information n’est pas dans le document, réponds “je ne sais pas”, n’invente pas. » Et de votre côté, une règle d’équipe : un « je ne sais pas » de l’outil n’est jamais une mauvaise réponse, c’est la meilleure qu’il puisse donner quand il ne sait pas. Les 52 % d’abstention de gpt-5-thinking-mini contre 1 % pour o4-mini le montrent : le modèle qui s’abstient est celui qui se trompe le moins.

Le même guide d’Anthropic ajoute une phrase à garder face aux discours de vente : « while these techniques significantly reduce hallucinations, they don’t eliminate them entirely. Always validate critical information. » Ces techniques réduisent fortement les hallucinations, elles ne les éliminent pas ; vérifiez toujours l’information critique. L’éditeur de l’outil vous le dit lui-même.

Pour une PME de dix à cinquante personnes, ces trois gestes ne se posent pas consigne par consigne. Ils se posent une fois, par usage : quels documents on confie à l’IA, avec quelle source, qui relit quoi avant quel envoi, et où l’outil a le droit de dire « je ne sais pas ». C’est un cadrage qui se fait avec quelqu’un qui connaît vos documents, pas avec une charte générique téléchargée. C’est ce que je fais quand une entreprise me demande de cadrer ses usages de l’IA poste par poste : on part de vos devis, de vos mails et de vos tableaux, on classe chaque usage en risque faible ou élevé, et on écrit qui relit quoi. L’audit IA en est la version courte, une journée de sept heures, quand vous voulez d’abord un état des lieux ; la formation IA en entreprise sert ensuite à ce que vos équipes sachent repérer un chiffre inventé sur leurs propres documents. Dans les trois cas, le but est le même : poser ces trois gestes dans l’entreprise, pas acheter un outil de plus.

Que faites-vous lundi matin ?

Une hallucination IA est un risque de décision, de client ou de conformité, parce que l’outil répond toujours avec le même aplomb, qu’il ait raison ou qu’il invente. Vous ne changerez pas ce comportement, OpenAI vous a dit que l’exactitude n’atteindra jamais 100 %. Vous pouvez changer ce qui se passe entre la réponse de l’outil et votre signature.

Lundi, trois choses. Listez les usages de l’IA dans votre entreprise, ceux que vous connaissez et ceux que vos équipes ne vous ont pas dits. Classez chacun en risque faible ou élevé avec la grille de cet article. Pour les usages à risque élevé, nommez la personne qui relit, et écrivez la phrase « je ne sais pas » dans les consignes de l’outil. Une PME peut copier ces trois gestes lundi ; si vous voulez le faire avec quelqu’un qui a déjà attrapé ses propres inventions, vous savez où me trouver.

Sources

Questions fréquentes

Une hallucination IA, c’est un bug qu’une mise à jour va corriger ?

Non. OpenAI écrit dans son billet du 5 septembre 2025 que « l’exactitude des modèles n’atteindra jamais 100 % », parce que certains faits rares (une date, un numéro de dossier) ne suivent aucune régularité qu’un modèle puisse apprendre. Le risque se réduit avec le modèle et le cadrage, il ne disparaît pas. Ce qui change l’issue, c’est la relecture posée entre la réponse de l’outil et votre signature.

Comment demander à ChatGPT ou à Claude de ne pas inventer ?

Écrivez la permission dans la consigne : « Si l’information n’est pas dans le document, réponds “je ne sais pas”, n’invente pas. » Le guide d’Anthropic « Reduce hallucinations » indique que donner explicitement cette permission « peut réduire drastiquement les fausses informations », tout en précisant que ces techniques ne les éliminent pas entièrement. Fournissez le document source, demandez des citations mot pour mot sur les documents longs, et retirez toute affirmation sans citation.

Dans quels usages le risque d’hallucination est-il faible pour une PME ?

Brainstorm, plan d’un document, premier jet que vous allez réécrire, reformulation d’un mail dont vous avez écrit le fond, résumé d’un document que vous avez sous les yeux : l’erreur se voit tout de suite et ne sort pas du bureau. Le risque devient élevé dès qu’il y a un chiffre, un nom propre, une référence juridique ou une donnée client : là, relecture ligne à ligne, source ouverte à côté.

Un avocat a-t-il déjà été sanctionné en France pour une jurisprudence inventée par l’IA ?

Au 22 janvier 2026, d’après Le Monde Informatique, non : trois tribunaux (Grenoble le 3 décembre 2025, Périgueux le 18 décembre, Orléans fin décembre) ont relevé des références inexistantes et prononcé des mises en garde, sans sanction. Aux États-Unis, dans Mata v. Avianca, le juge Castel a infligé 5 000 dollars d’amende aux avocats le 22 juin 2023. La base de Damien Charlotin comptait 2 046 affaires dans le monde au 21 septembre 2026.