{"id":326438,"date":"2026-10-10T12:37:32","date_gmt":"2026-10-10T09:37:32","guid":{"rendered":"https:\/\/ceotudent.com\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences"},"modified":"2026-10-10T12:37:32","modified_gmt":"2026-10-10T09:37:32","slug":"comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences","status":"publish","type":"post","link":"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences","title":{"rendered":"Comment apprendre des erreurs de l&rsquo;IA : transformer les erreurs des mod\u00e8les en gains de comp\u00e9tences"},"content":{"rendered":"<p><strong>TL;DR.<\/strong> Les erreurs de l&rsquo;IA sont assez fr\u00e9quentes dans le travail r\u00e9el pour constituer une r\u00e9serve r\u00e9guli\u00e8re de mati\u00e8re d&rsquo;entra\u00eenement, et la plupart des gens jettent cette mati\u00e8re. Dans une exp\u00e9rience de terrain randomis\u00e9e men\u00e9e aupr\u00e8s de pr\u00e8s d&rsquo;un millier de lyc\u00e9ens en math\u00e9matiques (Bastani et ses coll\u00e8gues, PNAS, 2025), une simple interface GPT-4 a augment\u00e9 les scores d&rsquo;entra\u00eenement de 48 %, mais ces \u00e9l\u00e8ves ont obtenu des r\u00e9sultats inf\u00e9rieurs de 17 % \u00e0 ceux du groupe t\u00e9moin une fois l&rsquo;outil retir\u00e9. Ce m\u00eame outil ne donnait une r\u00e9ponse correcte que 51 % du temps. Une \u00e9valuation de Stanford et Yale a montr\u00e9 que les principaux outils de recherche juridique hallucinent entre 17 et 33 % du temps. Du c\u00f4t\u00e9 de l&rsquo;apprentissage, une m\u00e9ta-analyse de 24 \u00e9tudes sur la formation \u00e0 la gestion des erreurs a mis en \u00e9vidence un effet moyen positif de d = 0,44, qui monte \u00e0 d = 0,80 pour le transfert vers des t\u00e2ches structurellement nouvelles. Le geste du CEO : tenir un Journal des erreurs d&rsquo;IA et une politique de v\u00e9rification \u00e9crite, afin que les erreurs deviennent un risque g\u00e9r\u00e9 plut\u00f4t qu&rsquo;une surprise. Le geste de l&rsquo;\u00e9tudiant : traiter chaque erreur rep\u00e9r\u00e9e comme une r\u00e9p\u00e9tition d&rsquo;entra\u00eenement, la classer, la retravailler sans l&rsquo;outil et relire le journal chaque semaine.<\/p>\n<p>Cet article fait partie du cluster consacr\u00e9 \u00e0 l&rsquo;\u00e9valuation. Commencez par la page pilier, <a href=\"\/fr\/la-competence-d-evaluation-juger-les-sorties-d-ia\">la comp\u00e9tence d&rsquo;\u00e9valuation : juger les sorties d&rsquo;IA<\/a>, pour la m\u00e9thode d&rsquo;ensemble. Pour la m\u00e9canique qui se cache derri\u00e8re les erreurs, voir <a href=\"\/fr\/pourquoi-lia-hallucine-mecanique-erreurs-modeles-detecter-tot\">pourquoi l&rsquo;IA hallucine et comment d\u00e9tecter t\u00f4t les erreurs des mod\u00e8les<\/a>. Pour d\u00e9cider du niveau de contr\u00f4le que m\u00e9rite une t\u00e2che, voir <a href=\"\/fr\/calibrage-de-la-confiance-quand-se-fier-aux-recommandations-ia\">le calibrage de la confiance : quand se fier aux recommandations de l&rsquo;IA<\/a>.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_84 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Table of Contents<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Pourquoi-traiter-une-erreur-de-lIA-comme-une-donnee-dentrainement-plutot-que-comme-une-nuisance\" >Pourquoi traiter une erreur de l&rsquo;IA comme une donn\u00e9e d&rsquo;entra\u00eenement plut\u00f4t que comme une nuisance ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#A-quelle-frequence-lIA-se-trompe-t-elle-reellement\" >\u00c0 quelle fr\u00e9quence l&rsquo;IA se trompe-t-elle r\u00e9ellement ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Que-se-passe-t-il-quand-on-napprend-pas-des-erreurs-de-lIA\" >Que se passe-t-il quand on n&rsquo;apprend pas des erreurs de l&rsquo;IA ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Que-dit-la-science-de-lapprentissage-sur-les-erreurs-corrigees\" >Que dit la science de l&rsquo;apprentissage sur les erreurs corrig\u00e9es ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Quelle-competence-humaine-chaque-type-derreur-de-lIA-exerce-t-il\" >Quelle comp\u00e9tence humaine chaque type d&rsquo;erreur de l&rsquo;IA exerce-t-il ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Que-doit-contenir-un-Journal-des-erreurs-dIA\" >Que doit contenir un Journal des erreurs d&rsquo;IA ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Quelle-quantite-de-matiere-dentrainement-y-a-t-il\" >Quelle quantit\u00e9 de mati\u00e8re d&rsquo;entra\u00eenement y a-t-il ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Comment-mener-la-revue-hebdomadaire\" >Comment mener la revue hebdomadaire ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#A-quoi-ressemble-le-versant-CEO-la-politique-de-verification\" >\u00c0 quoi ressemble le versant CEO : la politique de v\u00e9rification ?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Apprenez-vous-des-erreurs-de-lIA-Une-grille-devaluation-en-8-questions\" >Apprenez-vous des erreurs de l&rsquo;IA ? Une grille d&rsquo;\u00e9valuation en 8 questions<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Ce-que-cela-ne-veut-pas-dire\" >Ce que cela ne veut pas dire<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-12\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Questions-frequentes\" >Questions fr\u00e9quentes<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-13\" href=\"https:\/\/ceotudent.com\/fr\/comment-apprendre-des-erreurs-de-l-ia-transformer-les-erreurs-de-modele-en-competences\/#Sources\" >Sources<\/a><\/li><\/ul><\/nav><\/div>\n<h2 id=\"pourquoi-traiter-une-erreur-de-lia-comme-une-donne-dentrainement-plutt-que-comme-une-nuisance\"><span class=\"ez-toc-section\" id=\"Pourquoi-traiter-une-erreur-de-lIA-comme-une-donnee-dentrainement-plutot-que-comme-une-nuisance\"><\/span>Pourquoi traiter une erreur de l&rsquo;IA comme une donn\u00e9e d&rsquo;entra\u00eenement plut\u00f4t que comme une nuisance ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La r\u00e9action habituelle face \u00e0 une erreur de mod\u00e8le consiste \u00e0 la corriger et \u00e0 passer \u00e0 autre chose. Cela r\u00e8gle la question du r\u00e9sultat et gaspille la le\u00e7on. Deux corpus de recherche sugg\u00e8rent un meilleur usage.<\/p>\n<p>Le premier est la psychologie de l&rsquo;apprentissage par l&rsquo;erreur. La revue de Janet Metcalfe dans l&rsquo;Annual Review of Psychology (2017) r\u00e9sume les preuves de laboratoire en une phrase : \u00ab l&rsquo;apprentissage par l&rsquo;erreur suivi d&rsquo;un retour correctif est b\u00e9n\u00e9fique \u00e0 l&rsquo;apprentissage. \u00bb Elle ajoute une condition qui compte pour toute personne travaillant avec l&rsquo;IA : \u00ab Le retour correctif, y compris l&rsquo;analyse du raisonnement qui a conduit \u00e0 l&rsquo;erreur, est crucial. \u00bb Corriger un chiffre faux ne suffit pas. Le gain vient du fait de comprendre pourquoi il \u00e9tait faux.<\/p>\n<p>Le second est l&rsquo;ensemble des preuves sur ce qui se passe lorsque les gens utilisent l&rsquo;IA sans cette analyse. Les auteurs de l&rsquo;exp\u00e9rience de terrain publi\u00e9e dans PNAS \u00e9noncent le risque sans d\u00e9tour. Parce que l&rsquo;IA g\u00e9n\u00e9rative est faillible, \u00ab les utilisateurs doivent v\u00e9rifier ses r\u00e9sultats avec vigilance et corriger les probl\u00e8mes \u00e9ventuels ; s&rsquo;ils n&rsquo;acqui\u00e8rent pas les comp\u00e9tences sous-jacentes, ils risquent de ne pas disposer de l&rsquo;expertise n\u00e9cessaire pour le faire. \u00bb La comp\u00e9tence de v\u00e9rifier d\u00e9pend de la comp\u00e9tence de faire. Si l&rsquo;usage de l&rsquo;IA \u00e9rode la seconde, la premi\u00e8re dispara\u00eet avec elle.<\/p>\n<p>Chaque mauvaise r\u00e9ponse d&rsquo;un mod\u00e8le est soit une petite taxe pay\u00e9e puis oubli\u00e9e, soit un probl\u00e8me accompagn\u00e9 de son retour correctif. C&rsquo;est le regard du CEO et de l&rsquo;\u00e9tudiant appliqu\u00e9 \u00e0 un seul objet. Un dirigeant ne traite pas un d\u00e9faut comme de la malchance ; le d\u00e9faut est consign\u00e9, class\u00e9 et rattach\u00e9 \u00e0 un processus. Un bon \u00e9tudiant ne traite pas une mauvaise r\u00e9ponse comme une source d&rsquo;embarras ; la mauvaise r\u00e9ponse est l&rsquo;\u00e9l\u00e9ment le plus instructif de la page. Le Journal des erreurs d&rsquo;IA d\u00e9crit plus bas est les deux \u00e0 la fois.<\/p>\n<h2 id=\"quelle-frquence-lia-se-trompe-t-elle-rellement\"><span class=\"ez-toc-section\" id=\"A-quelle-frequence-lIA-se-trompe-t-elle-reellement\"><\/span>\u00c0 quelle fr\u00e9quence l&rsquo;IA se trompe-t-elle r\u00e9ellement ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La r\u00e9ponse honn\u00eate est qu&rsquo;il n&rsquo;existe pas de taux unique. Les taux d&rsquo;erreur publi\u00e9s varient de plus d&rsquo;un ordre de grandeur selon la t\u00e2che. Les chiffres ci-dessous sont repris tels qu&rsquo;ils figurent dans leurs sources.<\/p>\n<table>\n<thead>\n<tr>\n<th>T\u00e2che et syst\u00e8me test\u00e9<\/th>\n<th>Chiffre publi\u00e9<\/th>\n<th>Source<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>R\u00e9sum\u00e9 d&rsquo;un document d&rsquo;actualit\u00e9 fourni, meilleurs mod\u00e8les du classement HHEM<\/td>\n<td>Taux d&rsquo;hallucination le plus bas : 1,3 % (deux mod\u00e8les \u00e0 \u00e9galit\u00e9), puis 1,4 % et 1,5 %<\/td>\n<td>Stanford HAI, AI Index Report 2025<\/td>\n<\/tr>\n<tr>\n<td>Questions factuelles courtes (SimpleQA, plus de 4 000 questions)<\/td>\n<td>Le mod\u00e8le le plus performant a r\u00e9pondu avec succ\u00e8s \u00e0 42,7 % des questions<\/td>\n<td>Stanford HAI, AI Index Report 2025<\/td>\n<\/tr>\n<tr>\n<td>Exercices de math\u00e9matiques de lyc\u00e9e, GPT-4 derri\u00e8re une simple interface de chat<\/td>\n<td>R\u00e9ponse correcte 51 % du temps ; erreurs logiques 42 % ; erreurs arithm\u00e9tiques 8 %<\/td>\n<td>Bastani et al., PNAS, 2025<\/td>\n<\/tr>\n<tr>\n<td>Questions de recherche juridique, outils commerciaux avec r\u00e9cup\u00e9ration de documents (202 requ\u00eates)<\/td>\n<td>Hallucination entre 17 % et 33 % du temps<\/td>\n<td>Magesh et al., pr\u00e9publication 2024<\/td>\n<\/tr>\n<tr>\n<td>Questions directes et v\u00e9rifiables sur des affaires de tribunaux f\u00e9d\u00e9raux, mod\u00e8les g\u00e9n\u00e9ralistes<\/td>\n<td>Hallucination entre 58 % (ChatGPT 4) et 88 % (Llama 2) du temps<\/td>\n<td>Dahl et al., 2024<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Sources : Stanford Institute for Human-Centered AI, AI Index Report 2025, chapitre 3 ; Bastani et al., PNAS 122, 2025 ; Magesh et al., pr\u00e9publication arXiv 2405.20362, 2024 ; Dahl et al., arXiv 2401.01301, \u00e0 para\u00eetre dans le Journal of Legal Analysis. Tous les chiffres d\u00e9crivent les mod\u00e8les et les dates pr\u00e9cis des tests et ne constituent pas des taux actuels pour un produit quelconque.<\/em><\/p>\n<p>Trois constats d\u00e9coulent du tableau.<\/p>\n<p>Premi\u00e8rement, le taux d\u00e9pend bien davantage de la t\u00e2che que de la marque. L&rsquo;exp\u00e9rience de la Harvard Business School et du Boston Consulting Group a donn\u00e9 un nom \u00e0 cette irr\u00e9gularit\u00e9. Son r\u00e9sum\u00e9 d\u00e9crit une \u00ab fronti\u00e8re technologique en dents de scie \u00bb, o\u00f9 l&rsquo;assistance de l&rsquo;IA \u00ab am\u00e9liore la performance pour certaines t\u00e2ches mais la d\u00e9grade pour d&rsquo;autres, y compris au sein d&rsquo;un m\u00eame flux de travail intellectuel et \u00e0 un niveau de difficult\u00e9 apparemment similaire. \u00bb<\/p>\n<p>Deuxi\u00e8mement, les outils sp\u00e9cialis\u00e9s r\u00e9duisent les erreurs sans les supprimer. L&rsquo;\u00e9tude juridique a test\u00e9 des produits dont les \u00e9diteurs avaient annonc\u00e9 la fin des hallucinations. Les auteurs rapportent que Lexis+ AI a r\u00e9pondu avec exactitude \u00e0 65 % des requ\u00eates, que l&rsquo;outil AI-Assisted Research de Westlaw \u00e9tait exact 42 % du temps, et que \u00ab plus d&rsquo;une sur six \u00bb des requ\u00eates a conduit Lexis+ AI et Ask Practical Law AI \u00e0 r\u00e9pondre par des informations trompeuses ou fausses. Leur d\u00e9finition est utile pour tout journal d&rsquo;erreurs : une r\u00e9ponse est consid\u00e9r\u00e9e comme hallucin\u00e9e \u00ab si elle est soit incorrecte, soit mal fond\u00e9e \u00bb.<\/p>\n<p>Troisi\u00e8mement, les mod\u00e8les sont de mauvais juges de leurs propres erreurs. Dahl et ses coll\u00e8gues concluent que les mod\u00e8les \u00ab peinent \u00e0 pr\u00e9dire leurs propres hallucinations et acceptent souvent sans esprit critique les hypoth\u00e8ses juridiques incorrectes des utilisateurs. \u00bb Un ton assur\u00e9 n&rsquo;est pas une preuve.<\/p>\n<h2 id=\"que-se-passe-t-il-quand-on-napprend-pas-des-erreurs-de-lia\"><span class=\"ez-toc-section\" id=\"Que-se-passe-t-il-quand-on-napprend-pas-des-erreurs-de-lIA\"><\/span>Que se passe-t-il quand on n&rsquo;apprend pas des erreurs de l&rsquo;IA ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>L&rsquo;exp\u00e9rience publi\u00e9e dans PNAS en est la preuve la plus nette, car elle a mesur\u00e9 \u00e0 la fois la performance assist\u00e9e et la performance sans assistance ensuite. L&rsquo;\u00e9tude s&rsquo;est d\u00e9roul\u00e9e dans un lyc\u00e9e en Turquie au semestre d&rsquo;automne de l&rsquo;ann\u00e9e scolaire 2023-2024, sur quatre s\u00e9ances de 90 minutes et une cinquantaine de classes. Les \u00e9l\u00e8ves se sont entra\u00een\u00e9s avec l&rsquo;un des deux outils GPT-4 ou uniquement avec des manuels, puis ont pass\u00e9 un examen \u00e0 livre ferm\u00e9.<\/p>\n<table>\n<thead>\n<tr>\n<th>Mesure<\/th>\n<th>Groupe t\u00e9moin (manuels uniquement)<\/th>\n<th>GPT Base (simple interface de chat)<\/th>\n<th>GPT Tutor (prompts con\u00e7us par des enseignants)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Score d&rsquo;entra\u00eenement assist\u00e9, \u00e9cart par rapport au groupe t\u00e9moin (sur 1)<\/td>\n<td>Moyenne 0,28<\/td>\n<td>+0,137<\/td>\n<td>+0,361<\/td>\n<\/tr>\n<tr>\n<td>Am\u00e9lioration \u00e0 l&rsquo;entra\u00eenement telle que publi\u00e9e<\/td>\n<td>&#8211;<\/td>\n<td>48 %<\/td>\n<td>127 %<\/td>\n<\/tr>\n<tr>\n<td>Examen sans assistance, \u00e9cart par rapport au groupe t\u00e9moin (sur 1)<\/td>\n<td>&#8211;<\/td>\n<td>-0,054<\/td>\n<td>-0,004<\/td>\n<\/tr>\n<tr>\n<td>Effet sur l&rsquo;examen tel que publi\u00e9<\/td>\n<td>&#8211;<\/td>\n<td>Baisse de 17 %<\/td>\n<td>Statistiquement indiscernable du groupe t\u00e9moin<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Source : Bastani H, Bastani O, Sungu A, Ge H, Kabakc\u0131 \u00d6, Mariman R, PNAS 122, e2422633122, 2025.<\/em><\/p>\n<p>Deux d\u00e9tails en font plus qu&rsquo;un avertissement concernant des \u00e9coliers. Les auteurs ont audit\u00e9 l&rsquo;outil simple en lui soumettant dix fois chacun des 57 exercices d&rsquo;entra\u00eenement. Il \u00ab ne donne une r\u00e9ponse correcte que 51 % du temps en moyenne \u00bb, avec des erreurs logiques 42 % du temps et des erreurs arithm\u00e9tiques 8 % du temps. Les \u00e9l\u00e8ves s&rsquo;entra\u00eenaient avec un tuteur qui se trompait environ une fois sur deux, et l&rsquo;examen sans assistance montre qu&rsquo;ils n&rsquo;ont pas converti ces erreurs en apprentissage.<\/p>\n<p>Ils ne s&rsquo;en sont pas non plus rendu compte. Les \u00e9l\u00e8ves du groupe GPT Base \u00ab n&rsquo;ont pas eu le sentiment d&rsquo;avoir moins bien r\u00e9ussi ou moins appris. \u00bb Le sentiment de progresser et le fait de progresser se sont dissoci\u00e9s.<\/p>\n<p>L&rsquo;exp\u00e9rience men\u00e9e dans le conseil montre le m\u00eame sch\u00e9ma dans le travail professionnel. Parmi 758 travailleurs du savoir, ceux qui utilisaient GPT-4 sur 18 t\u00e2ches situ\u00e9es \u00e0 l&rsquo;int\u00e9rieur de la fronti\u00e8re ont accompli 12,2 % de t\u00e2ches en plus et les ont termin\u00e9es 25,1 % plus vite. Sur une t\u00e2che choisie pour se situer hors de la fronti\u00e8re, ils \u00e9taient \u00ab 19 % moins susceptibles de produire des solutions correctes que ceux qui n&rsquo;avaient pas d&rsquo;IA. \u00bb L&rsquo;outil n&rsquo;annon\u00e7ait pas de quel c\u00f4t\u00e9 de la fronti\u00e8re se trouvait une t\u00e2che. Seuls ceux qui v\u00e9rifiaient pouvaient le savoir.<\/p>\n<p>Des recherches plus anciennes sur les syst\u00e8mes d&rsquo;aide \u00e0 la d\u00e9cision expliquent le m\u00e9canisme. Une revue syst\u00e9matique du biais d&rsquo;automatisation, parue dans le Journal of the American Medical Informatics Association, a pass\u00e9 au crible 13 821 articles et en a retenu 74. Dans son analyse group\u00e9e de quatre \u00e9tudes, le rapport de risque \u00e9tait de 1,26 (IC \u00e0 95 % : 1,11 \u00e0 1,44) : lorsque le conseil du syst\u00e8me \u00e9tait erron\u00e9, il \u00ab augmentait de 26 % le risque qu&rsquo;une d\u00e9cision incorrecte soit prise. \u00bb La revue d\u00e9crit deux types d&rsquo;erreur humaine : la commission, qui consiste \u00e0 suivre un conseil incorrect, et l&rsquo;omission, qui consiste \u00e0 ne pas agir parce que le syst\u00e8me ne l&rsquo;a pas sugg\u00e9r\u00e9. Les deux ont leur place dans un journal d&rsquo;erreurs, car les deux sont les v\u00f4tres, pas celles du mod\u00e8le.<\/p>\n<h2 id=\"que-dit-la-science-de-lapprentissage-sur-les-erreurs-corriges\"><span class=\"ez-toc-section\" id=\"Que-dit-la-science-de-lapprentissage-sur-les-erreurs-corrigees\"><\/span>Que dit la science de l&rsquo;apprentissage sur les erreurs corrig\u00e9es ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Si les erreurs non corrig\u00e9es nuisent, la recherche sur les erreurs corrig\u00e9es va dans l&rsquo;autre sens. Les chiffres sont repris tels qu&rsquo;ils figurent dans chaque source.<\/p>\n<table>\n<thead>\n<tr>\n<th>R\u00e9sultat<\/th>\n<th>Base de preuves<\/th>\n<th>Taille d&rsquo;effet telle que publi\u00e9e<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Formation \u00e0 la gestion des erreurs, effet global (Keith et Frese, 2008)<\/td>\n<td>24 \u00e9tudes, N = 2 183<\/td>\n<td>d de Cohen = 0,44<\/td>\n<\/tr>\n<tr>\n<td>Idem, transfert apr\u00e8s la formation<\/td>\n<td>Analyse de mod\u00e9rateurs<\/td>\n<td>d = 0,56<\/td>\n<\/tr>\n<tr>\n<td>Idem, t\u00e2ches structurellement distinctes (transfert adaptatif)<\/td>\n<td>Analyse de mod\u00e9rateurs<\/td>\n<td>d = 0,80<\/td>\n<\/tr>\n<tr>\n<td>R\u00e9solution de probl\u00e8mes avant l&rsquo;enseignement (Sinha et Kapur, 2021)<\/td>\n<td>53 \u00e9tudes, 166 comparaisons<\/td>\n<td>g de Hedges 0,36, IC \u00e0 95 % : 0,20 \u00e0 0,51<\/td>\n<\/tr>\n<tr>\n<td>Idem, forte fid\u00e9lit\u00e9 aux principes de l&rsquo;\u00e9chec productif<\/td>\n<td>Sous-ensemble<\/td>\n<td>g de Hedges entre 0,37 et 0,58<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Sources : Keith N, Frese M, Journal of Applied Psychology 93(1), 2008 ; Sinha T, Kapur M, Review of Educational Research 91(5), 2021. Les deux n&rsquo;ont \u00e9t\u00e9 lus qu&rsquo;au niveau du r\u00e9sum\u00e9.<\/em><\/p>\n<p>Quatre r\u00e9sultats se traduisent directement en pratique avec l&rsquo;IA.<\/p>\n<p><strong>Les erreurs aident surtout sur les probl\u00e8mes nouveaux.<\/strong> Keith et Frese ont trouv\u00e9 l&rsquo;effet le plus important pour le transfert adaptatif, 0,80 contre 0,44 globalement, soit environ 1,8 fois la moyenne. La formation fond\u00e9e sur l&rsquo;erreur est \u00ab mieux adapt\u00e9e que les m\u00e9thodes de formation \u00e9vitant l&rsquo;erreur pour favoriser le transfert vers des t\u00e2ches nouvelles. \u00bb Or les t\u00e2ches nouvelles sont ce dont un emploi de l&rsquo;\u00e8re de l&rsquo;IA est de plus en plus constitu\u00e9.<\/p>\n<p><strong>Essayer d&rsquo;abord compte, m\u00eame quand la tentative \u00e9choue.<\/strong> Kornell, Hays et Bjork ont men\u00e9 six exp\u00e9riences dans lesquelles les participants devaient deviner des r\u00e9ponses qu&rsquo;ils ne pouvaient pas conna\u00eetre avant de les voir. Leur conclusion : \u00ab Les tentatives de r\u00e9cup\u00e9ration infructueuses ont am\u00e9lior\u00e9 l&rsquo;apprentissage avec les deux types de mat\u00e9riel. \u00bb L&rsquo;implication pour l&rsquo;usage de l&rsquo;IA est une r\u00e8gle d&rsquo;ordonnancement. Formez votre propre r\u00e9ponse, estimation ou plan avant de lire celui du mod\u00e8le.<\/p>\n<p><strong>Les erreurs commises avec assurance sont les plus faciles \u00e0 corriger.<\/strong> Butterfield et Metcalfe s&rsquo;attendaient \u00e0 ce que les erreurs \u00e0 forte confiance soient les plus difficiles \u00e0 corriger. Ils ont constat\u00e9 l&rsquo;inverse : \u00ab les erreurs commises avec une grande confiance \u00e9taient les plus susceptibles d&rsquo;\u00eatre corrig\u00e9es lors d&rsquo;un nouveau test ult\u00e9rieur. \u00bb C&rsquo;est pourquoi le journal pr\u00e9sent\u00e9 plus bas consigne votre confiance avant la v\u00e9rification. Les entr\u00e9es o\u00f9 vous \u00e9tiez s\u00fbr de vous et dans l&rsquo;erreur sont les plus pr\u00e9cieuses.<\/p>\n<p><strong>Le retour correctif doit inclure le raisonnement.<\/strong> La condition de Metcalfe, cit\u00e9e plus haut, exclut la version paresseuse du journal d&rsquo;erreurs. Une liste de r\u00e9sultats faux apprend peu. Une liste de r\u00e9sultats faux accompagn\u00e9e de la cause et du contr\u00f4le qui l&rsquo;aurait rep\u00e9r\u00e9e est un programme d&rsquo;\u00e9tudes.<\/p>\n<p>Une r\u00e9serve : Sinha et Kapur rapportent que, pour \u00ab l&rsquo;apprentissage de comp\u00e9tences g\u00e9n\u00e9rales, non sp\u00e9cifiques \u00e0 un domaine \u00bb, les tailles d&rsquo;effet favorisaient l&rsquo;enseignement en premier. V\u00e9rifier les sorties de l&rsquo;IA est en partie une comp\u00e9tence g\u00e9n\u00e9rale ; apprenez donc aussi les contr\u00f4les de mani\u00e8re explicite. La taxonomie ci-dessous est cet enseignement.<\/p>\n<h2 id=\"quelle-comptence-humaine-chaque-type-derreur-de-lia-exerce-t-il\"><span class=\"ez-toc-section\" id=\"Quelle-competence-humaine-chaque-type-derreur-de-lIA-exerce-t-il\"><\/span>Quelle comp\u00e9tence humaine chaque type d&rsquo;erreur de l&rsquo;IA exerce-t-il ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Cadre \u00e9ditorial CEOtudent : la taxonomie des erreurs de l&rsquo;IA.<\/strong> Les six premi\u00e8res lignes sont des erreurs du c\u00f4t\u00e9 du mod\u00e8le ; les deux derni\u00e8res sont des erreurs du c\u00f4t\u00e9 humain, tir\u00e9es de la litt\u00e9rature sur le biais d&rsquo;automatisation. La correspondance avec les comp\u00e9tences est un jugement \u00e9ditorial, non un r\u00e9sultat mesur\u00e9.<\/p>\n<table>\n<thead>\n<tr>\n<th>Code<\/th>\n<th>Type d&rsquo;erreur<\/th>\n<th>\u00c0 quoi elle ressemble<\/th>\n<th>Comp\u00e9tence humaine exerc\u00e9e<\/th>\n<th>La r\u00e9p\u00e9tition<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>F<\/td>\n<td>Source ou fait invent\u00e9<\/td>\n<td>Une r\u00e9f\u00e9rence, une affaire, une citation ou une statistique qui n&rsquo;existe pas<\/td>\n<td>V\u00e9rification des sources<\/td>\n<td>Ouvrir l&rsquo;original et trouver la ligne exacte avant de l&rsquo;utiliser<\/td>\n<\/tr>\n<tr>\n<td>M<\/td>\n<td>Affirmation mal fond\u00e9e<\/td>\n<td>Une source r\u00e9elle cit\u00e9e pour quelque chose qu&rsquo;elle ne dit pas<\/td>\n<td>Lecture attentive<\/td>\n<td>Comparer l&rsquo;affirmation avec le passage cit\u00e9, mot \u00e0 mot<\/td>\n<\/tr>\n<tr>\n<td>L<\/td>\n<td>Erreur logique<\/td>\n<td>Des \u00e9tapes plausibles qui ne s&rsquo;encha\u00eenent pas, ou la mauvaise m\u00e9thode<\/td>\n<td>Raisonnement et structuration des probl\u00e8mes<\/td>\n<td>Refaire seul les deux premi\u00e8res \u00e9tapes, puis trouver o\u00f9 les chemins divergent<\/td>\n<\/tr>\n<tr>\n<td>A<\/td>\n<td>Erreur d&rsquo;arithm\u00e9tique ou d&rsquo;unit\u00e9<\/td>\n<td>Bonne m\u00e9thode, mauvais chiffre<\/td>\n<td>Estimation<\/td>\n<td>\u00c9crire une estimation d&rsquo;ordre de grandeur avant de lire la r\u00e9ponse<\/td>\n<\/tr>\n<tr>\n<td>P<\/td>\n<td>Fausse pr\u00e9misse accept\u00e9e<\/td>\n<td>Le mod\u00e8le construit sur une hypoth\u00e8se erron\u00e9e contenue dans le prompt<\/td>\n<td>Formulation des questions<\/td>\n<td>Poser la m\u00eame question en \u00e9non\u00e7ant la pr\u00e9misse de fa\u00e7on neutre<\/td>\n<\/tr>\n<tr>\n<td>S<\/td>\n<td>D\u00e9rive du p\u00e9rim\u00e8tre ou r\u00e9ponse incompl\u00e8te<\/td>\n<td>R\u00e9pond \u00e0 une question voisine, ou omet une partie requise<\/td>\n<td>R\u00e9daction de briefs<\/td>\n<td>R\u00e9\u00e9crire le brief avec une d\u00e9finition de ce qui est termin\u00e9, puis relancer<\/td>\n<\/tr>\n<tr>\n<td>C<\/td>\n<td>Commission (humaine)<\/td>\n<td>Vous avez accept\u00e9 un r\u00e9sultat faux sans v\u00e9rifier<\/td>\n<td>Discipline de v\u00e9rification<\/td>\n<td>Nommer le contr\u00f4le qui a \u00e9t\u00e9 saut\u00e9 et l&rsquo;ajouter \u00e0 la politique<\/td>\n<\/tr>\n<tr>\n<td>O<\/td>\n<td>Omission (humaine)<\/td>\n<td>Vous avez manqu\u00e9 quelque chose parce que le mod\u00e8le ne l&rsquo;a pas soulev\u00e9<\/td>\n<td>Examen ind\u00e9pendant<\/td>\n<td>Lister ce qu&rsquo;une bonne r\u00e9ponse doit contenir avant de r\u00e9diger le prompt<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Les codes suivent des distinctions \u00e9tablies dans les sources : r\u00e9ponses incorrectes contre r\u00e9ponses mal fond\u00e9es dans l&rsquo;\u00e9tude juridique, erreurs logiques contre erreurs arithm\u00e9tiques dans l&rsquo;audit de PNAS (42 contre 8 %), fausses pr\u00e9misses accept\u00e9es chez Dahl et ses coll\u00e8gues, et commission contre omission dans la revue sur le biais d&rsquo;automatisation.<\/p>\n<p>Un motif r\u00e9current dans les codes est un diagnostic. De nombreuses entr\u00e9es S signifient que les briefs sont faibles. De nombreuses entr\u00e9es C signifient que la politique de v\u00e9rification n&rsquo;est pas suivie. De nombreuses entr\u00e9es F et M dans un m\u00eame domaine signifient que l&rsquo;outil a d\u00e9pass\u00e9 sa fronti\u00e8re pour cette t\u00e2che. Pour le versant r\u00e9daction de briefs de cette boucle, voir <a href=\"\/fr\/guide-management-ia-diriger-evaluer-ameliorer\">le guide du management de l&rsquo;IA<\/a>.<\/p>\n<h2 id=\"que-doit-contenir-un-journal-des-erreurs-dia\"><span class=\"ez-toc-section\" id=\"Que-doit-contenir-un-Journal-des-erreurs-dIA\"><\/span>Que doit contenir un Journal des erreurs d&rsquo;IA ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Cadre \u00e9ditorial CEOtudent : le mod\u00e8le de Journal des erreurs d&rsquo;IA.<\/strong> Une ligne par erreur rep\u00e9r\u00e9e. Un tableur ou un fichier de notes suffit.<\/p>\n<table>\n<thead>\n<tr>\n<th>Colonne<\/th>\n<th>Ce qu&rsquo;il faut \u00e9crire<\/th>\n<th>Pourquoi elle est l\u00e0<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Date et t\u00e2che<\/td>\n<td>Ce qui \u00e9tait en cours de production, et pour qui<\/td>\n<td>Montre quels flux de travail g\u00e9n\u00e8rent des erreurs<\/td>\n<\/tr>\n<tr>\n<td>Enjeux<\/td>\n<td>Faibles, moyens ou \u00e9lev\u00e9s<\/td>\n<td>Relie l&rsquo;entr\u00e9e \u00e0 la politique de v\u00e9rification<\/td>\n<\/tr>\n<tr>\n<td>Outil et mode<\/td>\n<td>Mod\u00e8le, avec ou sans recherche ou documents<\/td>\n<td>Les taux d&rsquo;erreur varient selon la t\u00e2che et la configuration<\/td>\n<\/tr>\n<tr>\n<td>L&rsquo;erreur, cit\u00e9e<\/td>\n<td>La phrase ou le chiffre faux, \u00e0 l&rsquo;identique<\/td>\n<td>\u00c9vite les souvenirs flous<\/td>\n<\/tr>\n<tr>\n<td>Code<\/td>\n<td>F, M, L, A, P, S, C ou O<\/td>\n<td>Rend possible le d\u00e9compte hebdomadaire<\/td>\n<\/tr>\n<tr>\n<td>Comment elle a \u00e9t\u00e9 rep\u00e9r\u00e9e<\/td>\n<td>Quel contr\u00f4le, ou qui l&rsquo;a trouv\u00e9e en aval<\/td>\n<td>Montre quels contr\u00f4les m\u00e9ritent le temps qu&rsquo;ils prennent<\/td>\n<\/tr>\n<tr>\n<td>Confiance avant la v\u00e9rification<\/td>\n<td>De 0 \u00e0 100 que le r\u00e9sultat \u00e9tait juste<\/td>\n<td>Fait ressortir les rat\u00e9s commis avec assurance, les plus faciles \u00e0 corriger<\/td>\n<\/tr>\n<tr>\n<td>Cause du c\u00f4t\u00e9 humain<\/td>\n<td>Brief faible, contexte manquant, contr\u00f4le saut\u00e9, domaine peu familier<\/td>\n<td>D\u00e9place la le\u00e7on du mod\u00e8le vers l&rsquo;utilisateur<\/td>\n<\/tr>\n<tr>\n<td>R\u00e9ponse correcte et source<\/td>\n<td>Le correctif, avec l&rsquo;endroit o\u00f9 il a \u00e9t\u00e9 v\u00e9rifi\u00e9<\/td>\n<td>Le retour correctif lui-m\u00eame<\/td>\n<\/tr>\n<tr>\n<td>Changement de r\u00e8gle<\/td>\n<td>La ligne ajout\u00e9e \u00e0 la politique de v\u00e9rification, ou \u00ab aucun \u00bb<\/td>\n<td>Transforme l&rsquo;erreur en changement de processus<\/td>\n<\/tr>\n<tr>\n<td>Date de retest<\/td>\n<td>Quand retravailler cet \u00e9l\u00e9ment sans aide<\/td>\n<td>Planifie la r\u00e9p\u00e9tition d&rsquo;entra\u00eenement<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Deux colonnes font l&rsquo;essentiel du travail. Les entr\u00e9es rep\u00e9r\u00e9es en aval par un coll\u00e8gue, un client ou un relecteur sont des \u00e9chapp\u00e9es ; leur part dans l&rsquo;ensemble des entr\u00e9es montre si la v\u00e9rification fonctionne. La colonne de confiance prot\u00e8ge contre l&rsquo;\u00e9cart de perception observ\u00e9 dans l&rsquo;\u00e9tude de PNAS : un chiffre \u00e9crit avant la v\u00e9rification ne peut pas \u00eatre r\u00e9vis\u00e9 apr\u00e8s coup.<\/p>\n<p>Pour le m\u00eame format avant-apr\u00e8s appliqu\u00e9 aux choix, voir <a href=\"\/fr\/journal-de-decision-modele-et-protocole-pour-ameliorer-son-jugement\">le mod\u00e8le et le protocole du journal de d\u00e9cision<\/a>.<\/p>\n<h2 id=\"quelle-quantit-de-matire-dentrainement-y-a-t-il\"><span class=\"ez-toc-section\" id=\"Quelle-quantite-de-matiere-dentrainement-y-a-t-il\"><\/span>Quelle quantit\u00e9 de mati\u00e8re d&rsquo;entra\u00eenement y a-t-il ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Analyse CEOtudent des taux publi\u00e9s ci-dessus.<\/strong> Le tableau convertit chaque taux publi\u00e9 en ce que rencontrerait une personne qui v\u00e9rifie chaque r\u00e9sultat. Il suppose que chaque r\u00e9sultat est un tirage ind\u00e9pendant au taux publi\u00e9, ce qui est une simplification : les erreurs r\u00e9elles se regroupent par type de t\u00e2che.<\/p>\n<table>\n<thead>\n<tr>\n<th>Contexte et taux publi\u00e9<\/th>\n<th>Erreurs attendues pour 20 r\u00e9sultats<\/th>\n<th>Probabilit\u00e9 d&rsquo;au moins une erreur sur 10 r\u00e9sultats<\/th>\n<th>Une erreur en moyenne tous les<\/th>\n<th>Erreurs rencontr\u00e9es en 50 semaines \u00e0 20 r\u00e9sultats v\u00e9rifi\u00e9s par semaine<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>R\u00e9sum\u00e9s de documents, meilleurs mod\u00e8les, 1,3 %<\/td>\n<td>0,3<\/td>\n<td>12,3 %<\/td>\n<td>76,9 r\u00e9sultats<\/td>\n<td>13<\/td>\n<\/tr>\n<tr>\n<td>Outils de recherche juridique, bas de la fourchette, 17 %<\/td>\n<td>3,4<\/td>\n<td>84,5 %<\/td>\n<td>5,9 r\u00e9sultats<\/td>\n<td>170<\/td>\n<\/tr>\n<tr>\n<td>Outils de recherche juridique, haut de la fourchette, 33 %<\/td>\n<td>6,6<\/td>\n<td>98,2 %<\/td>\n<td>3,0 r\u00e9sultats<\/td>\n<td>330<\/td>\n<\/tr>\n<tr>\n<td>R\u00e9ponses de math\u00e9matiques de GPT-4 simple, 49 % (100 moins 51)<\/td>\n<td>9,8<\/td>\n<td>99,9 %<\/td>\n<td>2,0 r\u00e9sultats<\/td>\n<td>490<\/td>\n<\/tr>\n<tr>\n<td>Chatbot g\u00e9n\u00e9raliste sur des questions de jurisprudence, bas de la fourchette, 58 %<\/td>\n<td>11,6<\/td>\n<td>plus de 99,9 %<\/td>\n<td>1,7 r\u00e9sultat<\/td>\n<td>580<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Source : calculs CEOtudent (calc.py) \u00e0 partir des taux publi\u00e9s dans l&rsquo;AI Index Report 2025, Magesh et al. 2024, Bastani et al. 2025 et Dahl et al. 2024. \u00c0 titre illustratif, il ne s&rsquo;agit pas d&rsquo;une pr\u00e9vision pour un outil actuel.<\/em><\/p>\n<p>\u00c0 un taux de 17 %, une personne qui accepte dix r\u00e9sultats sans v\u00e9rifier a 84,5 % de chances qu&rsquo;au moins l&rsquo;un d&rsquo;eux soit faux. Le m\u00eame taux, avec v\u00e9rification, fournit environ 170 exemples travaill\u00e9s avec retour correctif en un an. Le bas de la fourchette du chatbot g\u00e9n\u00e9raliste repr\u00e9sente 3,4 fois celui des outils sp\u00e9cialis\u00e9s : le choix de l&rsquo;outil modifie donc la charge sans la supprimer.<\/p>\n<p>\u00c0 1,3 %, une erreur survient environ une fois tous les 77 r\u00e9sultats, la condition dans laquelle l&rsquo;attention se rel\u00e2che. Les t\u00e2ches \u00e0 faible taux d&rsquo;erreur exigent une r\u00e8gle d&rsquo;\u00e9chantillonnage fixe dans la politique, et non de la vigilance.<\/p>\n<h2 id=\"comment-mener-la-revue-hebdomadaire\"><span class=\"ez-toc-section\" id=\"Comment-mener-la-revue-hebdomadaire\"><\/span>Comment mener la revue hebdomadaire ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Protocole \u00e9ditorial CEOtudent : 20 minutes, une fois par semaine.<\/strong> Sur 50 semaines, cela repr\u00e9sente environ 16,7 heures.<\/p>\n<ol>\n<li><strong>Compter et classer (5 minutes).<\/strong> Faites le d\u00e9compte des entr\u00e9es de la semaine par code. Notez les \u00e9chapp\u00e9es, c&rsquo;est-\u00e0-dire les entr\u00e9es que quelqu&rsquo;un d&rsquo;autre a rep\u00e9r\u00e9es.<\/li>\n<li><strong>Retravailler une erreur sans aide (5 minutes).<\/strong> Prenez l&rsquo;entr\u00e9e dont la confiance avant la v\u00e9rification \u00e9tait la plus \u00e9lev\u00e9e. Sans l&rsquo;outil, produisez la r\u00e9ponse correcte ou la m\u00e9thode correcte. C&rsquo;est la tentative de r\u00e9cup\u00e9ration ; elle fonctionne m\u00eame quand elle \u00e9choue, \u00e0 condition que la r\u00e9ponse correcte soit relue ensuite.<\/li>\n<li><strong>Remonter \u00e0 la cause (5 minutes).<\/strong> Pour les deux codes les plus fr\u00e9quents, \u00e9crivez une phrase sur la cause du c\u00f4t\u00e9 humain. Utilisez la condition de Metcalfe comme test : la note doit d\u00e9crire le raisonnement qui a conduit au rat\u00e9, et pas seulement le rat\u00e9.<\/li>\n<li><strong>Changer une r\u00e8gle (3 minutes).<\/strong> Ajoutez, resserrez ou supprimez une ligne de la politique de v\u00e9rification. Un changement par semaine suffit ; au-del\u00e0, il ne sera pas suivi.<\/li>\n<li><strong>Planifier le retest (2 minutes).<\/strong> Fixez une date pour retravailler \u00e0 nouveau l&rsquo;\u00e9l\u00e9ment de cette semaine, et retravaillez l&rsquo;\u00e9l\u00e9ment d&rsquo;une semaine ant\u00e9rieure arriv\u00e9 \u00e0 \u00e9ch\u00e9ance.<\/li>\n<\/ol>\n<p>Une fois par mois, v\u00e9rifiez que la part des \u00e9chapp\u00e9es diminue et que la r\u00e9partition des codes s&rsquo;\u00e9loigne de C et de S.<\/p>\n<h2 id=\"quoi-ressemble-le-versant-ceo-la-politique-de-vrification\"><span class=\"ez-toc-section\" id=\"A-quoi-ressemble-le-versant-CEO-la-politique-de-verification\"><\/span>\u00c0 quoi ressemble le versant CEO : la politique de v\u00e9rification ?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un journal sans politique est un journal intime. La politique est un court document \u00e9crit qui indique le niveau de contr\u00f4le que re\u00e7oit chaque cat\u00e9gorie de travail avant de quitter vos mains. La recherche sur le biais d&rsquo;automatisation plaide pour la mettre par \u00e9crit. La revue du JAMIA cite \u00ab la formation et l&rsquo;insistance sur la responsabilit\u00e9 de l&rsquo;utilisateur \u00bb parmi les facteurs d&rsquo;att\u00e9nuation, et rapporte une \u00e9tude dans laquelle les personnes qui se percevaient comme tenues de rendre des comptes commettaient moins d&rsquo;erreurs de biais d&rsquo;automatisation. Parasuraman et Manzey sont moins optimistes et concluent que le biais d&rsquo;automatisation \u00ab ne peut \u00eatre \u00e9vit\u00e9 ni par la formation ni par des consignes. \u00bb Les deux revues s&rsquo;accordent sur le point pratique : les bonnes intentions ne sont pas un contr\u00f4le. Un responsable d\u00e9sign\u00e9 et une proc\u00e9dure fixe en sont un.<\/p>\n<p><strong>Cadre \u00e9ditorial CEOtudent : une politique de v\u00e9rification \u00e0 trois niveaux.<\/strong><\/p>\n<table>\n<thead>\n<tr>\n<th>Niveau<\/th>\n<th>Travail typique<\/th>\n<th>Contr\u00f4le minimal<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>1. Enjeux faibles, r\u00e9versible<\/td>\n<td>Brouillons, brainstorming, notes internes<\/td>\n<td>Lire une fois ; contr\u00f4ler par sondage un fait par document<\/td>\n<\/tr>\n<tr>\n<td>2. Enjeux moyens<\/td>\n<td>Texte destin\u00e9 aux clients, analyse qui \u00e9claire une d\u00e9cision, code qui sera ex\u00e9cut\u00e9<\/td>\n<td>V\u00e9rifier chaque chiffre, nom, date et r\u00e9f\u00e9rence aupr\u00e8s d&rsquo;une source ; refaire les calculs de fa\u00e7on ind\u00e9pendante<\/td>\n<\/tr>\n<tr>\n<td>3. Enjeux \u00e9lev\u00e9s ou hors de votre expertise<\/td>\n<td>Contenu juridique, m\u00e9dical, financier ou de s\u00e9curit\u00e9 ; tout ce qui est sign\u00e9 ou publi\u00e9<\/td>\n<td>Contr\u00f4les du niveau 2 plus relecture par une personne qualifi\u00e9e ; pas de source, pas d&rsquo;affirmation<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Deux r\u00e8gles maintiennent l&rsquo;honn\u00eatet\u00e9 de la politique. Chaque \u00e9chapp\u00e9e fait monter ce type de t\u00e2che d&rsquo;un niveau jusqu&rsquo;\u00e0 ce qu&rsquo;un mois s&rsquo;\u00e9coule sans nouvelle \u00e9chapp\u00e9e. Et chaque r\u00e8gle nomme son contr\u00f4le, non une intention (\u00ab ouvrir la page cit\u00e9e \u00bb, et non \u00ab faire attention \u00bb).<\/p>\n<p>L&rsquo;enqu\u00eate de Lee et de ses coll\u00e8gues de Microsoft Research et de Carnegie Mellon montre pourquoi la politique ne peut pas reposer sur le ressenti. Parmi 319 travailleurs du savoir ayant partag\u00e9 936 exemples d&rsquo;utilisation de l&rsquo;IA g\u00e9n\u00e9rative au travail, \u00ab une confiance plus \u00e9lev\u00e9e dans l&rsquo;IA g\u00e9n\u00e9rative est associ\u00e9e \u00e0 moins de pens\u00e9e critique, tandis qu&rsquo;une confiance en soi plus \u00e9lev\u00e9e est associ\u00e9e \u00e0 davantage de pens\u00e9e critique. \u00bb La confiance dans l&rsquo;outil r\u00e9duisait la v\u00e9rification pr\u00e9cis\u00e9ment l\u00e0 o\u00f9 la v\u00e9rification \u00e9tait le seul garde-fou. L&rsquo;\u00e9cart entre la confiance dans l&rsquo;outil et la confiance en soi est le sujet de <a href=\"\/fr\/ecart-de-discernement-production-ia-pensee-humaine\">l&rsquo;\u00e9cart de discernement<\/a>.<\/p>\n<h2 id=\"apprenez-vous-des-erreurs-de-lia-une-grille-dvaluation-en-8-questions\"><span class=\"ez-toc-section\" id=\"Apprenez-vous-des-erreurs-de-lIA-Une-grille-devaluation-en-8-questions\"><\/span>Apprenez-vous des erreurs de l&rsquo;IA ? Une grille d&rsquo;\u00e9valuation en 8 questions<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Grille d&rsquo;\u00e9valuation \u00e9ditoriale CEOtudent.<\/strong> Notez chaque question 0 (non), 1 (parfois) ou 2 (syst\u00e9matiquement). Maximum 16.<\/p>\n<ol>\n<li>Formez-vous votre propre estimation, plan ou r\u00e9ponse avant de lire celui du mod\u00e8le ?<\/li>\n<li>Consignez-vous quelque part les erreurs rep\u00e9r\u00e9es, avec le texte faux exact ?<\/li>\n<li>Classez-vous chaque erreur par type ?<\/li>\n<li>Notez-vous votre confiance avant de v\u00e9rifier ?<\/li>\n<li>Notez-vous la cause du c\u00f4t\u00e9 humain, et pas seulement la faute du mod\u00e8le ?<\/li>\n<li>Retravaillez-vous au moins une erreur sans aide chaque semaine ?<\/li>\n<li>Disposez-vous d&rsquo;une politique de v\u00e9rification \u00e9crite, avec des niveaux selon les enjeux ?<\/li>\n<li>Suivez-vous les erreurs que quelqu&rsquo;un d&rsquo;autre a rep\u00e9r\u00e9es apr\u00e8s vous ?<\/li>\n<\/ol>\n<table>\n<thead>\n<tr>\n<th>Score<\/th>\n<th>Lecture<\/th>\n<th>\u00c9tape suivante<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>0-6<\/td>\n<td>Les erreurs sont corrig\u00e9es puis oubli\u00e9es<\/td>\n<td>Commencer le journal avec cinq colonnes : t\u00e2che, erreur, code, cause, correctif<\/td>\n<\/tr>\n<tr>\n<td>7-11<\/td>\n<td>Les erreurs sont capt\u00e9es, pas encore converties<\/td>\n<td>Ajouter la colonne de confiance et la reprise hebdomadaire sans aide<\/td>\n<\/tr>\n<tr>\n<td>12-16<\/td>\n<td>Les erreurs forment un programme d&rsquo;\u00e9tudes op\u00e9rationnel<\/td>\n<td>Suivre la part mensuelle des \u00e9chapp\u00e9es et \u00e9laguer les r\u00e8gles qui ne se d\u00e9clenchent jamais<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2 id=\"ce-que-cela-ne-veut-pas-dire\"><span class=\"ez-toc-section\" id=\"Ce-que-cela-ne-veut-pas-dire\"><\/span>Ce que cela ne veut pas dire<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Les erreurs de l&rsquo;IA ne sont pas une bonne chose, et davantage d&rsquo;erreurs n&rsquo;est pas mieux.<\/strong> La recherche sur l&rsquo;apprentissage porte sur des erreurs corrig\u00e9es dans des contextes \u00e0 faibles enjeux. La revue de Metcalfe recommande de laisser les erreurs se produire \u00ab tant qu&rsquo;elles surviennent dans des situations d&rsquo;apprentissage \u00e0 faibles enjeux \u00bb, et non dans un travail qui parvient \u00e0 un client ou \u00e0 un tribunal.<\/p>\n<p><strong>Le lien entre les erreurs de l&rsquo;IA et la comp\u00e9tence humaine est une inf\u00e9rence.<\/strong> Les \u00e9tudes sur l&rsquo;apprentissage cit\u00e9es ici examinent les erreurs propres aux personnes, principalement dans des salles de classe, des laboratoires et des formations. Aucune \u00e9tude ouverte pour cet article n&rsquo;a test\u00e9 si le fait de consigner les erreurs d&rsquo;un mod\u00e8le am\u00e9liore le jugement de l&rsquo;utilisateur. Le cadre applique des principes \u00e9tablis \u00e0 un contexte nouveau ; ce n&rsquo;est pas un effet mesur\u00e9.<\/p>\n<p><strong>Les taux d&rsquo;erreur sont des instantan\u00e9s.<\/strong> Ils d\u00e9crivent des mod\u00e8les pr\u00e9cis test\u00e9s en 2023 et 2024. Les auteurs de l&rsquo;\u00e9tude juridique avertissent que leur estimation \u00ab n&rsquo;est pas cens\u00e9e \u00eatre une estimation non biais\u00e9e \u00bb du taux d&rsquo;hallucinations dans l&rsquo;ensemble des requ\u00eates adress\u00e9es \u00e0 l&rsquo;IA juridique. Les outils actuels peuvent faire mieux ou moins bien sur une t\u00e2che donn\u00e9e.<\/p>\n<p><strong>Le tableau de la mati\u00e8re d&rsquo;entra\u00eenement rel\u00e8ve de l&rsquo;arithm\u00e9tique, pas de la pr\u00e9diction.<\/strong> Il suppose des erreurs ind\u00e9pendantes \u00e0 un taux constant et que chaque erreur est rep\u00e9r\u00e9e.<\/p>\n<h2 id=\"questions-frquentes\"><span class=\"ez-toc-section\" id=\"Questions-frequentes\"><\/span>Questions fr\u00e9quentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Combien d&rsquo;erreurs faut-il avant qu&rsquo;un journal soit utile ?<\/strong><br \/>\nUne poign\u00e9e. Le protocole hebdomadaire fonctionne avec une seule entr\u00e9e, car l&rsquo;\u00e9tape 2 n&rsquo;a besoin que d&rsquo;un \u00e9l\u00e9ment \u00e0 retravailler. Les motifs dans les codes demandent g\u00e9n\u00e9ralement quelques semaines d&rsquo;entr\u00e9es.<\/p>\n<p><strong>Faut-il consigner les erreurs quand les enjeux \u00e9taient insignifiants ?<\/strong><br \/>\nOui, bri\u00e8vement. Les erreurs \u00e0 faibles enjeux sont la mati\u00e8re d&rsquo;entra\u00eenement la plus s\u00fbre, et elles r\u00e9v\u00e8lent les m\u00eames faiblesses dans les briefs et les contr\u00f4les que celles qui causent les erreurs \u00e0 enjeux \u00e9lev\u00e9s.<\/p>\n<p><strong>Vaut-il la peine de consigner les erreurs qui \u00e9taient la faute de l&rsquo;utilisateur ?<\/strong><br \/>\nCe sont les entr\u00e9es les plus utiles. Les codes C et O existent parce que la litt\u00e9rature sur le biais d&rsquo;automatisation traite le fait de suivre un mauvais conseil et celui de manquer des probl\u00e8mes non signal\u00e9s comme des erreurs humaines.<\/p>\n<p><strong>Un meilleur mod\u00e8le rend-il le journal inutile ?<\/strong><br \/>\nNon. Des taux d&rsquo;erreur plus bas rendent chaque erreur plus rare et donc plus facile \u00e0 manquer. Le journal passe alors d&rsquo;une source d&rsquo;entra\u00eenement \u00e0 un registre d&rsquo;\u00e9chantillonnage qui montre que les contr\u00f4les sont toujours effectu\u00e9s.<\/p>\n<p><strong>Quel est le premier pas le plus rapide ?<\/strong><br \/>\nAvant la prochaine r\u00e9ponse de l&rsquo;IA sur un sujet qui compte, \u00e9crivez en une ligne une estimation de ce que la r\u00e9ponse devrait \u00eatre. Puis comparez. Cette seule habitude applique le r\u00e9sultat sur la r\u00e9cup\u00e9ration et rend la premi\u00e8re entr\u00e9e du journal facile \u00e0 \u00e9crire.<\/p>\n<h2 id=\"sources\"><span class=\"ez-toc-section\" id=\"Sources\"><\/span>Sources<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ol>\n<li>Bastani H, Bastani O, Sungu A, Ge H, Kabakc\u0131 \u00d6, Mariman R. Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences 122, e2422633122, 2025. Un correctif de 2025 ne concerne que l&rsquo;affiliation d&rsquo;un auteur.<\/li>\n<li>Magesh V, Surani F, Dahl M, Suzgun M, Manning CD, Ho DE. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. Pr\u00e9publication arXiv 2405.20362, 2024.<\/li>\n<li>Dahl M, Magesh V, Suzgun M, Ho DE. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. arXiv 2401.01301, 2024, \u00e0 para\u00eetre dans le Journal of Legal Analysis.<\/li>\n<li>Maslej N, et al. The AI Index 2025 Annual Report. AI Index Steering Committee, Institute for Human-Centered AI, Stanford University, avril 2025. Chapitre 3, Responsible AI.<\/li>\n<li>Dell&rsquo;Acqua F, McFowland E, Mollick E, Lifshitz-Assaf H, Kellogg KC, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science 37(2): 403-423, 2026. R\u00e9sum\u00e9 uniquement.<\/li>\n<li>Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association 19(1): 121-127, 2012.<\/li>\n<li>Parasuraman R, Manzey DH. Complacency and Bias in Human Use of Automation: An Attentional Integration. Human Factors 52(3): 381-410, 2010. R\u00e9sum\u00e9 uniquement.<\/li>\n<li>Lee HP, Sarkar A, Tankelevitch L, et al. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI Conference on Human Factors in Computing Systems, 2025.<\/li>\n<li>Metcalfe J. Learning from Errors. Annual Review of Psychology 68: 465-489, 2017. R\u00e9sum\u00e9 uniquement.<\/li>\n<li>Keith N, Frese M. Effectiveness of Error Management Training: A Meta-Analysis. Journal of Applied Psychology 93(1): 59-69, 2008. R\u00e9sum\u00e9 uniquement.<\/li>\n<li>Sinha T, Kapur M. When Problem Solving Followed by Instruction Works: Evidence for Productive Failure. Review of Educational Research 91(5): 761-798, 2021. R\u00e9sum\u00e9 uniquement.<\/li>\n<li>Kornell N, Hays MJ, Bjork RA. Unsuccessful Retrieval Attempts Enhance Subsequent Learning. Journal of Experimental Psychology: Learning, Memory, and Cognition 35(4): 989-998, 2009.<\/li>\n<li>Butterfield B, Metcalfe J. Errors Committed With High Confidence Are Hypercorrected. Journal of Experimental Psychology: Learning, Memory, and Cognition 27(6): 1491-1494, 2001. R\u00e9sum\u00e9 uniquement.<\/li>\n<\/ol>\n<p><em>Les tableaux de donn\u00e9es reprennent les chiffres tels qu&rsquo;ils figurent dans leurs sources. La taxonomie des erreurs, le mod\u00e8le de Journal des erreurs, le tableau de la mati\u00e8re d&rsquo;entra\u00eenement, le protocole de revue hebdomadaire, la politique de v\u00e9rification et la grille d&rsquo;\u00e9valuation sont des analyses ou des cadres \u00e9ditoriaux CEOtudent ; les multiples 1,8 et 3,4 sont des calculs CEOtudent. Non utilis\u00e9s : la version document de travail de l&rsquo;exp\u00e9rience men\u00e9e dans le conseil, qui n&rsquo;a pas pu \u00eatre ouverte ; les valeurs de l&rsquo;\u00e9tude juridique pour GPT-4, disponibles uniquement sous forme de graphique ; l&rsquo;estimation de 0,87 corrig\u00e9e du biais chez Sinha et Kapur ; et les affirmations populaires selon lesquelles les chatbots se trompent une part fixe du temps, qu&rsquo;aucune source ouverte ici ne vient \u00e9tayer.<\/em><\/p>\n<hr>\n<p><em>Ce contenu a \u00e9t\u00e9 compil\u00e9 avec le soutien de l&rsquo;IA \u00e0 la suite d&rsquo;une recherche approfondie, puis r\u00e9dig\u00e9 et pr\u00e9par\u00e9 pour publication par l&rsquo;\u00e9quipe \u00e9ditoriale de CEOtudent.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Dans une exp\u00e9rience de terrain men\u00e9e aupr\u00e8s de pr\u00e8s d&rsquo;un millier de lyc\u00e9ens, une simple interface GPT-4 a augment\u00e9 les scores d&rsquo;entra\u00eenement de 48 %, puis a laiss\u00e9 les \u00e9l\u00e8ves 17 % moins bons \u00e0 l&rsquo;examen sans assistance, alors que l&rsquo;outil lui-m\u00eame ne donnait la bonne r\u00e9ponse que 51 % du temps. Les taux d&rsquo;erreur publi\u00e9s vont de 1,3 % pour les r\u00e9sum\u00e9s de documents \u00e0 une fourchette de 17 \u00e0 33 % pour les outils de recherche juridique. Ce guide transforme ces erreurs en mati\u00e8re d&rsquo;entra\u00eenement : une taxonomie des erreurs reli\u00e9e \u00e0 la comp\u00e9tence humaine que chaque type exerce, un mod\u00e8le de Journal des erreurs d&rsquo;IA, une revue hebdomadaire de 20 minutes et une grille d&rsquo;\u00e9valuation en 8 questions.<\/p>\n","protected":false},"author":1,"featured_media":326440,"comment_status":"open","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[4599,18],"tags":[],"class_list":["post-326438","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-gelisim","category-strateji"],"_links":{"self":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts\/326438","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/comments?post=326438"}],"version-history":[{"count":0,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts\/326438\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/media\/326440"}],"wp:attachment":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/media?parent=326438"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/categories?post=326438"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/tags?post=326438"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}