GelişimStrateji
0

Comment apprendre des erreurs de l’IA : transformer les erreurs des modèles en gains de compétences

A woman at a sunlit desk reviewing and correcting handwritten notes beside an open laptop

TL;DR. Les erreurs de l’IA sont assez fréquentes dans le travail réel pour constituer une réserve régulière de matière d’entraînement, et la plupart des gens jettent cette matière. Dans une expérience de terrain randomisée menée auprès de près d’un millier de lycéens en mathématiques (Bastani et ses collègues, PNAS, 2025), une simple interface GPT-4 a augmenté les scores d’entraînement de 48 %, mais ces élèves ont obtenu des résultats inférieurs de 17 % à ceux du groupe témoin une fois l’outil retiré. Ce même outil ne donnait une réponse correcte que 51 % du temps. Une évaluation de Stanford et Yale a montré que les principaux outils de recherche juridique hallucinent entre 17 et 33 % du temps. Du côté de l’apprentissage, une méta-analyse de 24 études sur la formation à la gestion des erreurs a mis en évidence un effet moyen positif de d = 0,44, qui monte à d = 0,80 pour le transfert vers des tâches structurellement nouvelles. Le geste du CEO : tenir un Journal des erreurs d’IA et une politique de vérification écrite, afin que les erreurs deviennent un risque géré plutôt qu’une surprise. Le geste de l’étudiant : traiter chaque erreur repérée comme une répétition d’entraînement, la classer, la retravailler sans l’outil et relire le journal chaque semaine.

Cet article fait partie du cluster consacré à l’évaluation. Commencez par la page pilier, la compétence d’évaluation : juger les sorties d’IA, pour la méthode d’ensemble. Pour la mécanique qui se cache derrière les erreurs, voir pourquoi l’IA hallucine et comment détecter tôt les erreurs des modèles. Pour décider du niveau de contrôle que mérite une tâche, voir le calibrage de la confiance : quand se fier aux recommandations de l’IA.

Pourquoi traiter une erreur de l’IA comme une donnée d’entraînement plutôt que comme une nuisance ?

La réaction habituelle face à une erreur de modèle consiste à la corriger et à passer à autre chose. Cela règle la question du résultat et gaspille la leçon. Deux corpus de recherche suggèrent un meilleur usage.

Le premier est la psychologie de l’apprentissage par l’erreur. La revue de Janet Metcalfe dans l’Annual Review of Psychology (2017) résume les preuves de laboratoire en une phrase : « l’apprentissage par l’erreur suivi d’un retour correctif est bénéfique à l’apprentissage. » Elle ajoute une condition qui compte pour toute personne travaillant avec l’IA : « Le retour correctif, y compris l’analyse du raisonnement qui a conduit à l’erreur, est crucial. » Corriger un chiffre faux ne suffit pas. Le gain vient du fait de comprendre pourquoi il était faux.

Le second est l’ensemble des preuves sur ce qui se passe lorsque les gens utilisent l’IA sans cette analyse. Les auteurs de l’expérience de terrain publiée dans PNAS énoncent le risque sans détour. Parce que l’IA générative est faillible, « les utilisateurs doivent vérifier ses résultats avec vigilance et corriger les problèmes éventuels ; s’ils n’acquièrent pas les compétences sous-jacentes, ils risquent de ne pas disposer de l’expertise nécessaire pour le faire. » La compétence de vérifier dépend de la compétence de faire. Si l’usage de l’IA érode la seconde, la première disparaît avec elle.

Chaque mauvaise réponse d’un modèle est soit une petite taxe payée puis oubliée, soit un problème accompagné de son retour correctif. C’est le regard du CEO et de l’étudiant appliqué à un seul objet. Un dirigeant ne traite pas un défaut comme de la malchance ; le défaut est consigné, classé et rattaché à un processus. Un bon étudiant ne traite pas une mauvaise réponse comme une source d’embarras ; la mauvaise réponse est l’élément le plus instructif de la page. Le Journal des erreurs d’IA décrit plus bas est les deux à la fois.

À quelle fréquence l’IA se trompe-t-elle réellement ?

La réponse honnête est qu’il n’existe pas de taux unique. Les taux d’erreur publiés varient de plus d’un ordre de grandeur selon la tâche. Les chiffres ci-dessous sont repris tels qu’ils figurent dans leurs sources.

Tâche et système testé Chiffre publié Source
Résumé d’un document d’actualité fourni, meilleurs modèles du classement HHEM Taux d’hallucination le plus bas : 1,3 % (deux modèles à égalité), puis 1,4 % et 1,5 % Stanford HAI, AI Index Report 2025
Questions factuelles courtes (SimpleQA, plus de 4 000 questions) Le modèle le plus performant a répondu avec succès à 42,7 % des questions Stanford HAI, AI Index Report 2025
Exercices de mathématiques de lycée, GPT-4 derrière une simple interface de chat Réponse correcte 51 % du temps ; erreurs logiques 42 % ; erreurs arithmétiques 8 % Bastani et al., PNAS, 2025
Questions de recherche juridique, outils commerciaux avec récupération de documents (202 requêtes) Hallucination entre 17 % et 33 % du temps Magesh et al., prépublication 2024
Questions directes et vérifiables sur des affaires de tribunaux fédéraux, modèles généralistes Hallucination entre 58 % (ChatGPT 4) et 88 % (Llama 2) du temps Dahl et al., 2024

Sources : Stanford Institute for Human-Centered AI, AI Index Report 2025, chapitre 3 ; Bastani et al., PNAS 122, 2025 ; Magesh et al., prépublication arXiv 2405.20362, 2024 ; Dahl et al., arXiv 2401.01301, à paraître dans le Journal of Legal Analysis. Tous les chiffres décrivent les modèles et les dates précis des tests et ne constituent pas des taux actuels pour un produit quelconque.

Trois constats découlent du tableau.

Premièrement, le taux dépend bien davantage de la tâche que de la marque. L’expérience de la Harvard Business School et du Boston Consulting Group a donné un nom à cette irrégularité. Son résumé décrit une « frontière technologique en dents de scie », où l’assistance de l’IA « améliore la performance pour certaines tâches mais la dégrade pour d’autres, y compris au sein d’un même flux de travail intellectuel et à un niveau de difficulté apparemment similaire. »

Deuxièmement, les outils spécialisés réduisent les erreurs sans les supprimer. L’étude juridique a testé des produits dont les éditeurs avaient annoncé la fin des hallucinations. Les auteurs rapportent que Lexis+ AI a répondu avec exactitude à 65 % des requêtes, que l’outil AI-Assisted Research de Westlaw était exact 42 % du temps, et que « plus d’une sur six » des requêtes a conduit Lexis+ AI et Ask Practical Law AI à répondre par des informations trompeuses ou fausses. Leur définition est utile pour tout journal d’erreurs : une réponse est considérée comme hallucinée « si elle est soit incorrecte, soit mal fondée ».

Troisièmement, les modèles sont de mauvais juges de leurs propres erreurs. Dahl et ses collègues concluent que les modèles « peinent à prédire leurs propres hallucinations et acceptent souvent sans esprit critique les hypothèses juridiques incorrectes des utilisateurs. » Un ton assuré n’est pas une preuve.

Que se passe-t-il quand on n’apprend pas des erreurs de l’IA ?

L’expérience publiée dans PNAS en est la preuve la plus nette, car elle a mesuré à la fois la performance assistée et la performance sans assistance ensuite. L’étude s’est déroulée dans un lycée en Turquie au semestre d’automne de l’année scolaire 2023-2024, sur quatre séances de 90 minutes et une cinquantaine de classes. Les élèves se sont entraînés avec l’un des deux outils GPT-4 ou uniquement avec des manuels, puis ont passé un examen à livre fermé.

Mesure Groupe témoin (manuels uniquement) GPT Base (simple interface de chat) GPT Tutor (prompts conçus par des enseignants)
Score d’entraînement assisté, écart par rapport au groupe témoin (sur 1) Moyenne 0,28 +0,137 +0,361
Amélioration à l’entraînement telle que publiée – 48 % 127 %
Examen sans assistance, écart par rapport au groupe témoin (sur 1) – -0,054 -0,004
Effet sur l’examen tel que publié – Baisse de 17 % Statistiquement indiscernable du groupe témoin

Source : Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R, PNAS 122, e2422633122, 2025.

Deux détails en font plus qu’un avertissement concernant des écoliers. Les auteurs ont audité l’outil simple en lui soumettant dix fois chacun des 57 exercices d’entraînement. Il « ne donne une réponse correcte que 51 % du temps en moyenne », avec des erreurs logiques 42 % du temps et des erreurs arithmétiques 8 % du temps. Les élèves s’entraînaient avec un tuteur qui se trompait environ une fois sur deux, et l’examen sans assistance montre qu’ils n’ont pas converti ces erreurs en apprentissage.

Ils ne s’en sont pas non plus rendu compte. Les élèves du groupe GPT Base « n’ont pas eu le sentiment d’avoir moins bien réussi ou moins appris. » Le sentiment de progresser et le fait de progresser se sont dissociés.

L’expérience menée dans le conseil montre le même schéma dans le travail professionnel. Parmi 758 travailleurs du savoir, ceux qui utilisaient GPT-4 sur 18 tâches situées à l’intérieur de la frontière ont accompli 12,2 % de tâches en plus et les ont terminées 25,1 % plus vite. Sur une tâche choisie pour se situer hors de la frontière, ils étaient « 19 % moins susceptibles de produire des solutions correctes que ceux qui n’avaient pas d’IA. » L’outil n’annonçait pas de quel côté de la frontière se trouvait une tâche. Seuls ceux qui vérifiaient pouvaient le savoir.

Des recherches plus anciennes sur les systèmes d’aide à la décision expliquent le mécanisme. Une revue systématique du biais d’automatisation, parue dans le Journal of the American Medical Informatics Association, a passé au crible 13 821 articles et en a retenu 74. Dans son analyse groupée de quatre études, le rapport de risque était de 1,26 (IC à 95 % : 1,11 à 1,44) : lorsque le conseil du système était erroné, il « augmentait de 26 % le risque qu’une décision incorrecte soit prise. » La revue décrit deux types d’erreur humaine : la commission, qui consiste à suivre un conseil incorrect, et l’omission, qui consiste à ne pas agir parce que le système ne l’a pas suggéré. Les deux ont leur place dans un journal d’erreurs, car les deux sont les vôtres, pas celles du modèle.

Que dit la science de l’apprentissage sur les erreurs corrigées ?

Si les erreurs non corrigées nuisent, la recherche sur les erreurs corrigées va dans l’autre sens. Les chiffres sont repris tels qu’ils figurent dans chaque source.

Résultat Base de preuves Taille d’effet telle que publiée
Formation à la gestion des erreurs, effet global (Keith et Frese, 2008) 24 études, N = 2 183 d de Cohen = 0,44
Idem, transfert après la formation Analyse de modérateurs d = 0,56
Idem, tâches structurellement distinctes (transfert adaptatif) Analyse de modérateurs d = 0,80
Résolution de problèmes avant l’enseignement (Sinha et Kapur, 2021) 53 études, 166 comparaisons g de Hedges 0,36, IC à 95 % : 0,20 à 0,51
Idem, forte fidélité aux principes de l’échec productif Sous-ensemble g de Hedges entre 0,37 et 0,58

Sources : Keith N, Frese M, Journal of Applied Psychology 93(1), 2008 ; Sinha T, Kapur M, Review of Educational Research 91(5), 2021. Les deux n’ont été lus qu’au niveau du résumé.

Quatre résultats se traduisent directement en pratique avec l’IA.

Les erreurs aident surtout sur les problèmes nouveaux. Keith et Frese ont trouvé l’effet le plus important pour le transfert adaptatif, 0,80 contre 0,44 globalement, soit environ 1,8 fois la moyenne. La formation fondée sur l’erreur est « mieux adaptée que les méthodes de formation évitant l’erreur pour favoriser le transfert vers des tâches nouvelles. » Or les tâches nouvelles sont ce dont un emploi de l’ère de l’IA est de plus en plus constitué.

Essayer d’abord compte, même quand la tentative échoue. Kornell, Hays et Bjork ont mené six expériences dans lesquelles les participants devaient deviner des réponses qu’ils ne pouvaient pas connaître avant de les voir. Leur conclusion : « Les tentatives de récupération infructueuses ont amélioré l’apprentissage avec les deux types de matériel. » L’implication pour l’usage de l’IA est une règle d’ordonnancement. Formez votre propre réponse, estimation ou plan avant de lire celui du modèle.

Les erreurs commises avec assurance sont les plus faciles à corriger. Butterfield et Metcalfe s’attendaient à ce que les erreurs à forte confiance soient les plus difficiles à corriger. Ils ont constaté l’inverse : « les erreurs commises avec une grande confiance étaient les plus susceptibles d’être corrigées lors d’un nouveau test ultérieur. » C’est pourquoi le journal présenté plus bas consigne votre confiance avant la vérification. Les entrées où vous étiez sûr de vous et dans l’erreur sont les plus précieuses.

Le retour correctif doit inclure le raisonnement. La condition de Metcalfe, citée plus haut, exclut la version paresseuse du journal d’erreurs. Une liste de résultats faux apprend peu. Une liste de résultats faux accompagnée de la cause et du contrôle qui l’aurait repérée est un programme d’études.

Une réserve : Sinha et Kapur rapportent que, pour « l’apprentissage de compétences générales, non spécifiques à un domaine », les tailles d’effet favorisaient l’enseignement en premier. Vérifier les sorties de l’IA est en partie une compétence générale ; apprenez donc aussi les contrôles de manière explicite. La taxonomie ci-dessous est cet enseignement.

Quelle compétence humaine chaque type d’erreur de l’IA exerce-t-il ?

Cadre éditorial CEOtudent : la taxonomie des erreurs de l’IA. Les six premières lignes sont des erreurs du côté du modèle ; les deux dernières sont des erreurs du côté humain, tirées de la littérature sur le biais d’automatisation. La correspondance avec les compétences est un jugement éditorial, non un résultat mesuré.

Code Type d’erreur À quoi elle ressemble Compétence humaine exercée La répétition
F Source ou fait inventé Une référence, une affaire, une citation ou une statistique qui n’existe pas Vérification des sources Ouvrir l’original et trouver la ligne exacte avant de l’utiliser
M Affirmation mal fondée Une source réelle citée pour quelque chose qu’elle ne dit pas Lecture attentive Comparer l’affirmation avec le passage cité, mot à mot
L Erreur logique Des étapes plausibles qui ne s’enchaînent pas, ou la mauvaise méthode Raisonnement et structuration des problèmes Refaire seul les deux premières étapes, puis trouver où les chemins divergent
A Erreur d’arithmétique ou d’unité Bonne méthode, mauvais chiffre Estimation Écrire une estimation d’ordre de grandeur avant de lire la réponse
P Fausse prémisse acceptée Le modèle construit sur une hypothèse erronée contenue dans le prompt Formulation des questions Poser la même question en énonçant la prémisse de façon neutre
S Dérive du périmètre ou réponse incomplète Répond à une question voisine, ou omet une partie requise Rédaction de briefs Réécrire le brief avec une définition de ce qui est terminé, puis relancer
C Commission (humaine) Vous avez accepté un résultat faux sans vérifier Discipline de vérification Nommer le contrôle qui a été sauté et l’ajouter à la politique
O Omission (humaine) Vous avez manqué quelque chose parce que le modèle ne l’a pas soulevé Examen indépendant Lister ce qu’une bonne réponse doit contenir avant de rédiger le prompt

Les codes suivent des distinctions établies dans les sources : réponses incorrectes contre réponses mal fondées dans l’étude juridique, erreurs logiques contre erreurs arithmétiques dans l’audit de PNAS (42 contre 8 %), fausses prémisses acceptées chez Dahl et ses collègues, et commission contre omission dans la revue sur le biais d’automatisation.

Un motif récurrent dans les codes est un diagnostic. De nombreuses entrées S signifient que les briefs sont faibles. De nombreuses entrées C signifient que la politique de vérification n’est pas suivie. De nombreuses entrées F et M dans un même domaine signifient que l’outil a dépassé sa frontière pour cette tâche. Pour le versant rédaction de briefs de cette boucle, voir le guide du management de l’IA.

Que doit contenir un Journal des erreurs d’IA ?

Cadre éditorial CEOtudent : le modèle de Journal des erreurs d’IA. Une ligne par erreur repérée. Un tableur ou un fichier de notes suffit.

Colonne Ce qu’il faut écrire Pourquoi elle est là
Date et tâche Ce qui était en cours de production, et pour qui Montre quels flux de travail génèrent des erreurs
Enjeux Faibles, moyens ou élevés Relie l’entrée à la politique de vérification
Outil et mode Modèle, avec ou sans recherche ou documents Les taux d’erreur varient selon la tâche et la configuration
L’erreur, citée La phrase ou le chiffre faux, à l’identique Évite les souvenirs flous
Code F, M, L, A, P, S, C ou O Rend possible le décompte hebdomadaire
Comment elle a été repérée Quel contrôle, ou qui l’a trouvée en aval Montre quels contrôles méritent le temps qu’ils prennent
Confiance avant la vérification De 0 à 100 que le résultat était juste Fait ressortir les ratés commis avec assurance, les plus faciles à corriger
Cause du côté humain Brief faible, contexte manquant, contrôle sauté, domaine peu familier Déplace la leçon du modèle vers l’utilisateur
Réponse correcte et source Le correctif, avec l’endroit où il a été vérifié Le retour correctif lui-même
Changement de règle La ligne ajoutée à la politique de vérification, ou « aucun » Transforme l’erreur en changement de processus
Date de retest Quand retravailler cet élément sans aide Planifie la répétition d’entraînement

Deux colonnes font l’essentiel du travail. Les entrées repérées en aval par un collègue, un client ou un relecteur sont des échappées ; leur part dans l’ensemble des entrées montre si la vérification fonctionne. La colonne de confiance protège contre l’écart de perception observé dans l’étude de PNAS : un chiffre écrit avant la vérification ne peut pas être révisé après coup.

Pour le même format avant-après appliqué aux choix, voir le modèle et le protocole du journal de décision.

Quelle quantité de matière d’entraînement y a-t-il ?

Analyse CEOtudent des taux publiés ci-dessus. Le tableau convertit chaque taux publié en ce que rencontrerait une personne qui vérifie chaque résultat. Il suppose que chaque résultat est un tirage indépendant au taux publié, ce qui est une simplification : les erreurs réelles se regroupent par type de tâche.

Contexte et taux publié Erreurs attendues pour 20 résultats Probabilité d’au moins une erreur sur 10 résultats Une erreur en moyenne tous les Erreurs rencontrées en 50 semaines à 20 résultats vérifiés par semaine
Résumés de documents, meilleurs modèles, 1,3 % 0,3 12,3 % 76,9 résultats 13
Outils de recherche juridique, bas de la fourchette, 17 % 3,4 84,5 % 5,9 résultats 170
Outils de recherche juridique, haut de la fourchette, 33 % 6,6 98,2 % 3,0 résultats 330
Réponses de mathématiques de GPT-4 simple, 49 % (100 moins 51) 9,8 99,9 % 2,0 résultats 490
Chatbot généraliste sur des questions de jurisprudence, bas de la fourchette, 58 % 11,6 plus de 99,9 % 1,7 résultat 580

Source : calculs CEOtudent (calc.py) à partir des taux publiés dans l’AI Index Report 2025, Magesh et al. 2024, Bastani et al. 2025 et Dahl et al. 2024. À titre illustratif, il ne s’agit pas d’une prévision pour un outil actuel.

À un taux de 17 %, une personne qui accepte dix résultats sans vérifier a 84,5 % de chances qu’au moins l’un d’eux soit faux. Le même taux, avec vérification, fournit environ 170 exemples travaillés avec retour correctif en un an. Le bas de la fourchette du chatbot généraliste représente 3,4 fois celui des outils spécialisés : le choix de l’outil modifie donc la charge sans la supprimer.

À 1,3 %, une erreur survient environ une fois tous les 77 résultats, la condition dans laquelle l’attention se relâche. Les tâches à faible taux d’erreur exigent une règle d’échantillonnage fixe dans la politique, et non de la vigilance.

Comment mener la revue hebdomadaire ?

Protocole éditorial CEOtudent : 20 minutes, une fois par semaine. Sur 50 semaines, cela représente environ 16,7 heures.

  1. Compter et classer (5 minutes). Faites le décompte des entrées de la semaine par code. Notez les échappées, c’est-à-dire les entrées que quelqu’un d’autre a repérées.
  2. Retravailler une erreur sans aide (5 minutes). Prenez l’entrée dont la confiance avant la vérification était la plus élevée. Sans l’outil, produisez la réponse correcte ou la méthode correcte. C’est la tentative de récupération ; elle fonctionne même quand elle échoue, à condition que la réponse correcte soit relue ensuite.
  3. Remonter à la cause (5 minutes). Pour les deux codes les plus fréquents, écrivez une phrase sur la cause du côté humain. Utilisez la condition de Metcalfe comme test : la note doit décrire le raisonnement qui a conduit au raté, et pas seulement le raté.
  4. Changer une règle (3 minutes). Ajoutez, resserrez ou supprimez une ligne de la politique de vérification. Un changement par semaine suffit ; au-delà, il ne sera pas suivi.
  5. Planifier le retest (2 minutes). Fixez une date pour retravailler à nouveau l’élément de cette semaine, et retravaillez l’élément d’une semaine antérieure arrivé à échéance.

Une fois par mois, vérifiez que la part des échappées diminue et que la répartition des codes s’éloigne de C et de S.

À quoi ressemble le versant CEO : la politique de vérification ?

Un journal sans politique est un journal intime. La politique est un court document écrit qui indique le niveau de contrôle que reçoit chaque catégorie de travail avant de quitter vos mains. La recherche sur le biais d’automatisation plaide pour la mettre par écrit. La revue du JAMIA cite « la formation et l’insistance sur la responsabilité de l’utilisateur » parmi les facteurs d’atténuation, et rapporte une étude dans laquelle les personnes qui se percevaient comme tenues de rendre des comptes commettaient moins d’erreurs de biais d’automatisation. Parasuraman et Manzey sont moins optimistes et concluent que le biais d’automatisation « ne peut être évité ni par la formation ni par des consignes. » Les deux revues s’accordent sur le point pratique : les bonnes intentions ne sont pas un contrôle. Un responsable désigné et une procédure fixe en sont un.

Cadre éditorial CEOtudent : une politique de vérification à trois niveaux.

Niveau Travail typique Contrôle minimal
1. Enjeux faibles, réversible Brouillons, brainstorming, notes internes Lire une fois ; contrôler par sondage un fait par document
2. Enjeux moyens Texte destiné aux clients, analyse qui éclaire une décision, code qui sera exécuté Vérifier chaque chiffre, nom, date et référence auprès d’une source ; refaire les calculs de façon indépendante
3. Enjeux élevés ou hors de votre expertise Contenu juridique, médical, financier ou de sécurité ; tout ce qui est signé ou publié Contrôles du niveau 2 plus relecture par une personne qualifiée ; pas de source, pas d’affirmation

Deux règles maintiennent l’honnêteté de la politique. Chaque échappée fait monter ce type de tâche d’un niveau jusqu’à ce qu’un mois s’écoule sans nouvelle échappée. Et chaque règle nomme son contrôle, non une intention (« ouvrir la page citée », et non « faire attention »).

L’enquête de Lee et de ses collègues de Microsoft Research et de Carnegie Mellon montre pourquoi la politique ne peut pas reposer sur le ressenti. Parmi 319 travailleurs du savoir ayant partagé 936 exemples d’utilisation de l’IA générative au travail, « une confiance plus élevée dans l’IA générative est associée à moins de pensée critique, tandis qu’une confiance en soi plus élevée est associée à davantage de pensée critique. » La confiance dans l’outil réduisait la vérification précisément là où la vérification était le seul garde-fou. L’écart entre la confiance dans l’outil et la confiance en soi est le sujet de l’écart de discernement.

Apprenez-vous des erreurs de l’IA ? Une grille d’évaluation en 8 questions

Grille d’évaluation éditoriale CEOtudent. Notez chaque question 0 (non), 1 (parfois) ou 2 (systématiquement). Maximum 16.

  1. Formez-vous votre propre estimation, plan ou réponse avant de lire celui du modèle ?
  2. Consignez-vous quelque part les erreurs repérées, avec le texte faux exact ?
  3. Classez-vous chaque erreur par type ?
  4. Notez-vous votre confiance avant de vérifier ?
  5. Notez-vous la cause du côté humain, et pas seulement la faute du modèle ?
  6. Retravaillez-vous au moins une erreur sans aide chaque semaine ?
  7. Disposez-vous d’une politique de vérification écrite, avec des niveaux selon les enjeux ?
  8. Suivez-vous les erreurs que quelqu’un d’autre a repérées après vous ?
Score Lecture Étape suivante
0-6 Les erreurs sont corrigées puis oubliées Commencer le journal avec cinq colonnes : tâche, erreur, code, cause, correctif
7-11 Les erreurs sont captées, pas encore converties Ajouter la colonne de confiance et la reprise hebdomadaire sans aide
12-16 Les erreurs forment un programme d’études opérationnel Suivre la part mensuelle des échappées et élaguer les règles qui ne se déclenchent jamais

Ce que cela ne veut pas dire

Les erreurs de l’IA ne sont pas une bonne chose, et davantage d’erreurs n’est pas mieux. La recherche sur l’apprentissage porte sur des erreurs corrigées dans des contextes à faibles enjeux. La revue de Metcalfe recommande de laisser les erreurs se produire « tant qu’elles surviennent dans des situations d’apprentissage à faibles enjeux », et non dans un travail qui parvient à un client ou à un tribunal.

Le lien entre les erreurs de l’IA et la compétence humaine est une inférence. Les études sur l’apprentissage citées ici examinent les erreurs propres aux personnes, principalement dans des salles de classe, des laboratoires et des formations. Aucune étude ouverte pour cet article n’a testé si le fait de consigner les erreurs d’un modèle améliore le jugement de l’utilisateur. Le cadre applique des principes établis à un contexte nouveau ; ce n’est pas un effet mesuré.

Les taux d’erreur sont des instantanés. Ils décrivent des modèles précis testés en 2023 et 2024. Les auteurs de l’étude juridique avertissent que leur estimation « n’est pas censée être une estimation non biaisée » du taux d’hallucinations dans l’ensemble des requêtes adressées à l’IA juridique. Les outils actuels peuvent faire mieux ou moins bien sur une tâche donnée.

Le tableau de la matière d’entraînement relève de l’arithmétique, pas de la prédiction. Il suppose des erreurs indépendantes à un taux constant et que chaque erreur est repérée.

Questions fréquentes

Combien d’erreurs faut-il avant qu’un journal soit utile ?
Une poignée. Le protocole hebdomadaire fonctionne avec une seule entrée, car l’étape 2 n’a besoin que d’un élément à retravailler. Les motifs dans les codes demandent généralement quelques semaines d’entrées.

Faut-il consigner les erreurs quand les enjeux étaient insignifiants ?
Oui, brièvement. Les erreurs à faibles enjeux sont la matière d’entraînement la plus sûre, et elles révèlent les mêmes faiblesses dans les briefs et les contrôles que celles qui causent les erreurs à enjeux élevés.

Vaut-il la peine de consigner les erreurs qui étaient la faute de l’utilisateur ?
Ce sont les entrées les plus utiles. Les codes C et O existent parce que la littérature sur le biais d’automatisation traite le fait de suivre un mauvais conseil et celui de manquer des problèmes non signalés comme des erreurs humaines.

Un meilleur modèle rend-il le journal inutile ?
Non. Des taux d’erreur plus bas rendent chaque erreur plus rare et donc plus facile à manquer. Le journal passe alors d’une source d’entraînement à un registre d’échantillonnage qui montre que les contrôles sont toujours effectués.

Quel est le premier pas le plus rapide ?
Avant la prochaine réponse de l’IA sur un sujet qui compte, écrivez en une ligne une estimation de ce que la réponse devrait être. Puis comparez. Cette seule habitude applique le résultat sur la récupération et rend la première entrée du journal facile à écrire.

Sources

  1. Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R. Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences 122, e2422633122, 2025. Un correctif de 2025 ne concerne que l’affiliation d’un auteur.
  2. Magesh V, Surani F, Dahl M, Suzgun M, Manning CD, Ho DE. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. Prépublication arXiv 2405.20362, 2024.
  3. Dahl M, Magesh V, Suzgun M, Ho DE. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. arXiv 2401.01301, 2024, à paraître dans le Journal of Legal Analysis.
  4. Maslej N, et al. The AI Index 2025 Annual Report. AI Index Steering Committee, Institute for Human-Centered AI, Stanford University, avril 2025. Chapitre 3, Responsible AI.
  5. Dell’Acqua F, McFowland E, Mollick E, Lifshitz-Assaf H, Kellogg KC, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science 37(2): 403-423, 2026. Résumé uniquement.
  6. Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association 19(1): 121-127, 2012.
  7. Parasuraman R, Manzey DH. Complacency and Bias in Human Use of Automation: An Attentional Integration. Human Factors 52(3): 381-410, 2010. Résumé uniquement.
  8. Lee HP, Sarkar A, Tankelevitch L, et al. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI Conference on Human Factors in Computing Systems, 2025.
  9. Metcalfe J. Learning from Errors. Annual Review of Psychology 68: 465-489, 2017. Résumé uniquement.
  10. Keith N, Frese M. Effectiveness of Error Management Training: A Meta-Analysis. Journal of Applied Psychology 93(1): 59-69, 2008. Résumé uniquement.
  11. Sinha T, Kapur M. When Problem Solving Followed by Instruction Works: Evidence for Productive Failure. Review of Educational Research 91(5): 761-798, 2021. Résumé uniquement.
  12. Kornell N, Hays MJ, Bjork RA. Unsuccessful Retrieval Attempts Enhance Subsequent Learning. Journal of Experimental Psychology: Learning, Memory, and Cognition 35(4): 989-998, 2009.
  13. Butterfield B, Metcalfe J. Errors Committed With High Confidence Are Hypercorrected. Journal of Experimental Psychology: Learning, Memory, and Cognition 27(6): 1491-1494, 2001. Résumé uniquement.

Les tableaux de données reprennent les chiffres tels qu’ils figurent dans leurs sources. La taxonomie des erreurs, le modèle de Journal des erreurs, le tableau de la matière d’entraînement, le protocole de revue hebdomadaire, la politique de vérification et la grille d’évaluation sont des analyses ou des cadres éditoriaux CEOtudent ; les multiples 1,8 et 3,4 sont des calculs CEOtudent. Non utilisés : la version document de travail de l’expérience menée dans le conseil, qui n’a pas pu être ouverte ; les valeurs de l’étude juridique pour GPT-4, disponibles uniquement sous forme de graphique ; l’estimation de 0,87 corrigée du biais chez Sinha et Kapur ; et les affirmations populaires selon lesquelles les chatbots se trompent une part fixe du temps, qu’aucune source ouverte ici ne vient étayer.


Ce contenu a été compilé avec le soutien de l’IA à la suite d’une recherche approfondie, puis rédigé et préparé pour publication par l’équipe éditoriale de CEOtudent.

This post is also available in: Türkçe English Español Deutsch

Benzer içerikler