{"id":325913,"date":"2026-09-10T18:08:05","date_gmt":"2026-09-10T15:08:05","guid":{"rendered":"https:\/\/ceotudent.com\/ecart-de-discernement-production-ia-pensee-humaine"},"modified":"2026-09-10T18:08:05","modified_gmt":"2026-09-10T15:08:05","slug":"ecart-de-discernement-production-ia-pensee-humaine","status":"publish","type":"post","link":"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine","title":{"rendered":"L&rsquo;\u00e9cart de discernement : pourquoi la plupart des gens ne distinguent pas une bonne production d&rsquo;IA d&rsquo;une grande pens\u00e9e humaine"},"content":{"rendered":"<p><strong>En bref.<\/strong> Sur 16 340 jugements, des lecteurs non sp\u00e9cialistes ont identifi\u00e9 les po\u00e8mes g\u00e9n\u00e9r\u00e9s par IA avec 46,6 % de justesse, soit en dessous des 50 % qu&rsquo;aurait donn\u00e9s le hasard. Sur 1 023 conversations enregistr\u00e9es, un mod\u00e8le dot\u00e9 d&rsquo;une consigne de persona a \u00e9t\u00e9 jug\u00e9 humain 73 % du temps, plus souvent que les humains r\u00e9els auxquels il \u00e9tait compar\u00e9. Dans les deux \u00e9tudes, l&rsquo;expertise n&rsquo;a pas aid\u00e9 : l&rsquo;exp\u00e9rience po\u00e9tique a produit un mod\u00e8le dont le R deux de McFadden vaut 0,012, et la connaissance des mod\u00e8les de langage comme l&rsquo;usage quotidien de robots conversationnels n&rsquo;ont eu aucun effet significatif. Dans l&rsquo;une, la confiance \u00e9tait significativement et n\u00e9gativement li\u00e9e au fait d&rsquo;avoir raison. Et les m\u00eames exp\u00e9riences montrent pourquoi : inform\u00e9s qu&rsquo;un po\u00e8me \u00e9tait g\u00e9n\u00e9r\u00e9 par IA, les lecteurs baissaient sa note de qualit\u00e9 de 0,814 point sur une \u00e9chelle de sept, tandis que les po\u00e8mes r\u00e9ellement g\u00e9n\u00e9r\u00e9s \u00e9taient not\u00e9s 1,045 point au-dessus de ceux de po\u00e8tes humains c\u00e9l\u00e8bres. L&rsquo;\u00e9tiquette d\u00e9place le verdict environ 76 % autant que le texte. Cet \u00e9cart entre ce que vous croyez pouvoir juger et ce que vous pouvez juger est ce qu&rsquo;il faut g\u00e9rer.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_84 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Table of Contents<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Ce-nest-pas-un-deficit-de-competence\" >Ce n&rsquo;est pas un d\u00e9ficit de comp\u00e9tence<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Lexpertise-na-sauve-personne\" >L&rsquo;expertise n&rsquo;a sauv\u00e9 personne<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Un-deuxieme-laboratoire-un-autre-support-le-meme-resultat-nul\" >Un deuxi\u00e8me laboratoire, un autre support, le m\u00eame r\u00e9sultat nul<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Un-troisieme-laboratoire-un-troisieme-domaine-le-meme-resultat-et-le-mecanisme\" >Un troisi\u00e8me laboratoire, un troisi\u00e8me domaine, le m\u00eame r\u00e9sultat et le m\u00e9canisme<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#La-synthese-originale-deux-couches-et-laquelle-deplace-le-verdict\" >La synth\u00e8se originale : deux couches, et laquelle d\u00e9place le verdict<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Ce-que-les-lecteurs-recompensaient-reellement\" >Ce que les lecteurs r\u00e9compensaient r\u00e9ellement<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Ce-qui-a-ameliore-la-justesse\" >Ce qui a am\u00e9lior\u00e9 la justesse<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Ce-que-cela-implique-pour-vos-decisions\" >Ce que cela implique pour vos d\u00e9cisions<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Ce-qui-changerait-cette-conclusion\" >Ce qui changerait cette conclusion<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#FAQ\" >FAQ<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/ceotudent.com\/fr\/ecart-de-discernement-production-ia-pensee-humaine\/#Sources\" >Sources<\/a><\/li><\/ul><\/nav><\/div>\n<h2 id=\"ce-nest-pas-un-dficit-de-comptence\"><span class=\"ez-toc-section\" id=\"Ce-nest-pas-un-deficit-de-competence\"><\/span>Ce n&rsquo;est pas un d\u00e9ficit de comp\u00e9tence<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La version confortable de cette histoire veut que le discernement soit une comp\u00e9tence, aujourd&rsquo;hui peu d\u00e9velopp\u00e9e, que la pratique corrigera. Trois \u00e9tudes issues de trois laboratoires sans lien entre eux disent le contraire, et le disent depuis des extr\u00e9mit\u00e9s oppos\u00e9es de l&rsquo;espace du probl\u00e8me.<\/p>\n<p>La premi\u00e8re, de Porter et Machery dans Scientific Reports, a test\u00e9 si des lecteurs non sp\u00e9cialistes pouvaient distinguer des po\u00e8mes g\u00e9n\u00e9r\u00e9s par IA de po\u00e8mes de po\u00e8tes humains reconnus. Le protocole a d\u00e9lib\u00e9r\u00e9ment donn\u00e9 tous les avantages aux humains. Il a utilis\u00e9 un paradigme sans humain dans la boucle : les cinq premiers po\u00e8mes produits par le mod\u00e8le ont \u00e9t\u00e9 retenus, sans s\u00e9lection du meilleur ni retour au-del\u00e0 d&rsquo;une consigne demandant d&rsquo;\u00e9crire un court po\u00e8me dans le style d&rsquo;un po\u00e8te nomm\u00e9. Dans la premi\u00e8re exp\u00e9rience, 1 634 participants ont vu chacun dix po\u00e8mes attribu\u00e9s \u00e0 l&rsquo;un de dix po\u00e8tes, cinq authentiques et cinq g\u00e9n\u00e9r\u00e9s, et ont jug\u00e9 chacun d&rsquo;eux.<\/p>\n<p>Le r\u00e9sultat, sur 16 340 jugements individuels : 46,6 % de justesse. Pas proche du hasard. En dessous, et significativement, avec khi-deux(1, N = 16 340) = 75,13, p &lt; 0,0001.<\/p>\n<p>\u00catre sous le niveau du hasard est un constat plus fort qu&rsquo;\u00eatre au hasard. Le hasard signifierait que la t\u00e2che ne porte aucune information. \u00catre en dessous signifie que les participants appliquaient syst\u00e9matiquement une r\u00e8gle, et que la r\u00e8gle \u00e9tait invers\u00e9e. Les auteurs le confirment : l&rsquo;accord entre participants \u00e9tait faible mais significativement sup\u00e9rieur au hasard (kappa de Fleiss = 0,005, p &lt; 0,001), ce qu&rsquo;ils lisent comme la preuve d&rsquo;heuristiques partag\u00e9es mais erron\u00e9es plut\u00f4t que d&rsquo;une r\u00e9ponse purement al\u00e9atoire.<\/p>\n<p>La ligne la plus r\u00e9v\u00e9latrice de l&rsquo;article n&rsquo;est pas une statistique. Les cinq po\u00e8mes que les lecteurs \u00e9taient le <em>moins<\/em> enclins \u00e0 qualifier d&rsquo;\u00e9crits par un humain avaient tous \u00e9t\u00e9 \u00e9crits par de vrais po\u00e8tes humains. Quatre des cinq po\u00e8mes les plus souvent qualifi\u00e9s d&rsquo;humains avaient \u00e9t\u00e9 g\u00e9n\u00e9r\u00e9s.<\/p>\n<h2 id=\"lexpertise-na-sauv-personne\"><span class=\"ez-toc-section\" id=\"Lexpertise-na-sauve-personne\"><\/span>L&rsquo;expertise n&rsquo;a sauv\u00e9 personne<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>L&rsquo;objection \u00e9vidente est qu&rsquo;il s&rsquo;agissait de non-sp\u00e9cialistes. Les auteurs ont pr\u00e9enregistr\u00e9 une pr\u00e9diction sur exactement ce point, et l&rsquo;ont test\u00e9e.<\/p>\n<p>Ils ont ajust\u00e9 un mod\u00e8le exploratoire pr\u00e9disant si chaque r\u00e9ponse \u00e9tait <em>correcte<\/em>, \u00e0 partir de la confiance autod\u00e9clar\u00e9e, de la familiarit\u00e9 avec le po\u00e8te assign\u00e9, du bagage en po\u00e9sie, de la fr\u00e9quence de lecture, du go\u00fbt pour la po\u00e9sie, du fait d&rsquo;avoir suivi ou non un cours de po\u00e9sie, de l&rsquo;\u00e2ge, du genre, du niveau d&rsquo;\u00e9tudes et du fait d&rsquo;avoir d\u00e9j\u00e0 vu l&rsquo;un des po\u00e8mes.<\/p>\n<p>Le pouvoir explicatif du mod\u00e8le atteignait 0,012 au R deux de McFadden. Aucune des variables d&rsquo;exp\u00e9rience po\u00e9tique n&rsquo;avait d&rsquo;effet positif significatif sur la justesse. Deux variables ont montr\u00e9 de petits effets positifs, et l&rsquo;une d&rsquo;elles est instructive : avoir d\u00e9j\u00e0 vu les po\u00e8mes augmentait les chances de r\u00e9pondre juste d&rsquo;environ 6 % (b = 0,060356, rapport de cotes 1,062, p = 0,000309). C&rsquo;est de la reconnaissance, pas du discernement. Ceux qui faisaient mieux \u00e9taient ceux qui avaient crois\u00e9 le po\u00e8me pr\u00e9cis, pas ceux qui comprenaient la po\u00e9sie.<\/p>\n<p>Vient ensuite le constat qui donne son nom \u00e0 cet article. La confiance autod\u00e9clar\u00e9e avait un effet petit mais significativement <strong>n\u00e9gatif<\/strong> sur la justesse (b = -0,021673, ET = 0,003986, z = -5,437, p &lt; 0,0001). Plus les participants \u00e9taient s\u00fbrs d&rsquo;eux, l\u00e9g\u00e8rement plus ils avaient de chances de se tromper.<\/p>\n<p>Retenez cela, car un autre laboratoire a trouv\u00e9 quelque chose de voisin par un chemin totalement diff\u00e9rent.<\/p>\n<h2 id=\"un-deuxime-laboratoire-un-autre-support-le-mme-rsultat-nul\"><span class=\"ez-toc-section\" id=\"Un-deuxieme-laboratoire-un-autre-support-le-meme-resultat-nul\"><\/span>Un deuxi\u00e8me laboratoire, un autre support, le m\u00eame r\u00e9sultat nul<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Jones et Bergen ont men\u00e9 deux tests de Turing \u00e0 trois parties, randomis\u00e9s, contr\u00f4l\u00e9s et pr\u00e9enregistr\u00e9s, publi\u00e9s en pr\u00e9impression. Les participants tenaient simultan\u00e9ment des conversations de cinq minutes avec un autre humain et avec l&rsquo;un de plusieurs syst\u00e8mes, puis jugeaient lequel \u00e9tait l&rsquo;humain. Deux populations ind\u00e9pendantes ont \u00e9t\u00e9 mobilis\u00e9es : 126 \u00e9tudiants de premier cycle en psychologie de l&rsquo;UCSD et 158 participants Prolific, chacun r\u00e9alisant huit manches, pour 1 023 parties analys\u00e9es apr\u00e8s exclusions.<\/p>\n<p>Ici, le protocole isole ce que l&rsquo;\u00e9tude sur la po\u00e9sie ne pouvait pas isoler : l&rsquo;effet de l&rsquo;<em>emballage<\/em> sur un m\u00eame syst\u00e8me sous-jacent.<\/p>\n<p><strong>Tableau 1. Taux de r\u00e9ussite : proportion des cas o\u00f9 l&rsquo;interrogateur a jug\u00e9 que le t\u00e9moin IA \u00e9tait l&rsquo;humain<\/strong><\/p>\n<table>\n<thead>\n<tr>\n<th>Syst\u00e8me et consigne<\/th>\n<th>Taux de r\u00e9ussite<\/th>\n<th>\u00c9tude \u00e9tudiants<\/th>\n<th>\u00c9tude Prolific<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>GPT-4.5 avec consigne de persona<\/td>\n<td>73 %<\/td>\n<td>69 %<\/td>\n<td>76 %<\/td>\n<\/tr>\n<tr>\n<td>LLaMa-3.1-405B avec consigne de persona<\/td>\n<td>56 %<\/td>\n<td>45 %<\/td>\n<td>65 %<\/td>\n<\/tr>\n<tr>\n<td>LLaMa-3.1-405B, r\u00e9f\u00e9rence sans persona<\/td>\n<td>38 %<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<\/tr>\n<tr>\n<td>GPT-4.5, r\u00e9f\u00e9rence sans persona<\/td>\n<td>36 %<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<\/tr>\n<tr>\n<td>ELIZA<\/td>\n<td>23 %<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<\/tr>\n<tr>\n<td>GPT-4o, r\u00e9f\u00e9rence sans persona<\/td>\n<td>21 %<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<td>non d\u00e9taill\u00e9<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Source : Jones et Bergen, Large Language Models Pass the Turing Test (pr\u00e9impression arXiv), taux de r\u00e9ussite globaux sur les deux \u00e9tudes. Les cellules marqu\u00e9es non d\u00e9taill\u00e9 ne sont pas ventil\u00e9es par population dans le passage donnant ces chiffres ; les deux populations ne sont rapport\u00e9es s\u00e9par\u00e9ment que pour les deux conditions avec persona.<\/em><\/p>\n<p>Lisez ensemble la premi\u00e8re et la quatri\u00e8me ligne. M\u00eame mod\u00e8le. La consigne de persona a fait passer GPT-4.5 de 36 % \u00e0 73 %, un gain de 37 points de pourcentage, soit 2,03 fois. Pour LLaMa-3.1-405B, la m\u00eame manipulation a fait passer 38 % \u00e0 56 %, un gain de 18 points, soit 1,47 fois. Rien de la capacit\u00e9 du mod\u00e8le n&rsquo;a chang\u00e9 entre ces cellules. Seule la consigne a chang\u00e9.<\/p>\n<p>Et le constat d\u00e9mographique atterrit exactement au m\u00eame endroit que l&rsquo;\u00e9tude sur la po\u00e9sie. Les auteurs indiquent qu&rsquo;il n&rsquo;y avait, dans aucune des deux \u00e9tudes, d&rsquo;effet significatif de l&rsquo;\u00e2ge, du niveau de connaissance des mod\u00e8les de langage ou de la fr\u00e9quence d&rsquo;interaction avec des robots conversationnels. Leur propre r\u00e9sum\u00e9 est net : la justesse discriminante est relativement homog\u00e8ne dans la population, y compris chez les personnes qui font de la recherche sur ces syst\u00e8mes ou dialoguent quotidiennement avec des agents conversationnels.<\/p>\n<p>Deux notes d&rsquo;honn\u00eatet\u00e9, car les r\u00e9sultats exploratoires sont ici plus d\u00e9sordonn\u00e9s qu&rsquo;un r\u00e9cit propre ne le voudrait. Dans le groupe Prolific, l&rsquo;estimation par les participants du degr\u00e9 d&rsquo;intelligence qu&rsquo;ils pr\u00eatent \u00e0 l&rsquo;IA \u00e9tait corr\u00e9l\u00e9e n\u00e9gativement \u00e0 la justesse (p = 0,03), ce qui fait \u00e9cho au constat sur la confiance. Mais dans le groupe \u00e9tudiant, la justesse r\u00e9elle \u00e9tait corr\u00e9l\u00e9e <em>positivement<\/em> \u00e0 l&rsquo;estimation que les participants faisaient de leur propre justesse (p = 0,03), et cette m\u00eame relation n&rsquo;est pas apparue dans le groupe Prolific (p = 0,45). Le signal d&rsquo;auto-connaissance ne se r\u00e9plique pas d&rsquo;une population \u00e0 l&rsquo;autre. Qui vous dit que la recherche montre une confiance uniform\u00e9ment invers\u00e9e exag\u00e8re. Ce qui se r\u00e9plique, dans les deux \u00e9tudes et \u00e0 travers les deux laboratoires, c&rsquo;est le r\u00e9sultat nul sur l&rsquo;expertise.<\/p>\n<h2 id=\"un-troisime-laboratoire-un-troisime-domaine-le-mme-rsultat-et-le-mcanisme\"><span class=\"ez-toc-section\" id=\"Un-troisieme-laboratoire-un-troisieme-domaine-le-meme-resultat-et-le-mecanisme\"><\/span>Un troisi\u00e8me laboratoire, un troisi\u00e8me domaine, le m\u00eame r\u00e9sultat et le m\u00e9canisme<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Si deux \u00e9tudes \u00e9taient une co\u00efncidence, une troisi\u00e8me cl\u00f4t le d\u00e9bat. Jakesch, Hancock et Naaman, \u00e0 Cornell et Stanford, ont publi\u00e9 six exp\u00e9riences dans les Proceedings of the National Academy of Sciences testant si les gens pouvaient d\u00e9tecter qu&rsquo;une pr\u00e9sentation de soi verbale avait \u00e9t\u00e9 g\u00e9n\u00e9r\u00e9e par machine, dans des contextes professionnels, h\u00f4teliers et de rencontre. Sur ces six exp\u00e9riences, 4 600 participants n&rsquo;ont pas su d\u00e9tecter les pr\u00e9sentations g\u00e9n\u00e9r\u00e9es.<\/p>\n<p>Cette \u00e9tude fournit aussi ce que les deux autres ne font qu&rsquo;inf\u00e9rer. Une analyse computationnelle des traits linguistiques a identifi\u00e9 les heuristiques pr\u00e9cises utilis\u00e9es, et elles sont d&rsquo;une banalit\u00e9 inqui\u00e9tante : les lecteurs associent les pronoms \u00e0 la premi\u00e8re personne, les contractions et les th\u00e8mes familiaux \u00e0 une \u00e9criture humaine. Les auteurs ont ensuite fait le geste d\u00e9cisif. Ils ont montr\u00e9 exp\u00e9rimentalement que ces heuristiques, parce qu&rsquo;elles sont pr\u00e9visibles, sont manipulables, et qu&rsquo;un syst\u00e8me r\u00e9gl\u00e9 sur elles produit un texte qui se lit, selon leur formule, plus humain qu&rsquo;humain.<\/p>\n<p>Voil\u00e0 l&rsquo;engrenage manquant. Porter et Machery ont trouv\u00e9 des heuristiques partag\u00e9es mais erron\u00e9es sans les nommer. Jakesch et ses coll\u00e8gues les ont nomm\u00e9es et ont d\u00e9montr\u00e9 qu&rsquo;elles peuvent \u00eatre cibl\u00e9es. Ce qui signifie que l&rsquo;\u00e9cart de discernement n&rsquo;est pas seulement une limite de la perception humaine. C&rsquo;est une surface d&rsquo;attaque.<\/p>\n<p><strong>Tableau 2. Trois \u00e9tudes pr\u00e9enregistr\u00e9es ou contr\u00f4l\u00e9es, trois laboratoires, trois domaines, un r\u00e9sultat nul convergent<\/strong><\/p>\n<table>\n<thead>\n<tr>\n<th>\u00c9tude<\/th>\n<th>Domaine<\/th>\n<th>Ampleur<\/th>\n<th>R\u00e9sultat de d\u00e9tection<\/th>\n<th>L&rsquo;expertise ou la familiarit\u00e9 ont-elles aid\u00e9 ?<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Porter et Machery<\/td>\n<td>Po\u00e8mes de po\u00e8tes reconnus contre po\u00e8mes g\u00e9n\u00e9r\u00e9s<\/td>\n<td>1 634 participants, 16 340 jugements<\/td>\n<td>46,6 % de justesse, sous le hasard<\/td>\n<td>Non. Mod\u00e8le d&rsquo;expertise R deux de McFadden = 0,012 ; aucune variable d&rsquo;exp\u00e9rience po\u00e9tique avec effet positif significatif<\/td>\n<\/tr>\n<tr>\n<td>Jones et Bergen<\/td>\n<td>Conversation en direct de cinq minutes, test de Turing \u00e0 trois parties<\/td>\n<td>284 participants, 1 023 parties<\/td>\n<td>GPT-4.5 avec persona jug\u00e9 humain 73 % du temps<\/td>\n<td>Non. Aucun effet significatif de la connaissance des mod\u00e8les de langage ni de l&rsquo;usage de robots conversationnels dans les deux \u00e9tudes<\/td>\n<\/tr>\n<tr>\n<td>Jakesch, Hancock et Naaman<\/td>\n<td>Pr\u00e9sentations de soi verbales en contextes professionnel, h\u00f4telier et de rencontre<\/td>\n<td>4 600 participants, six exp\u00e9riences<\/td>\n<td>Participants incapables de d\u00e9tecter les pr\u00e9sentations g\u00e9n\u00e9r\u00e9es<\/td>\n<td>Ce n&rsquo;\u00e9tait pas l&rsquo;objet de l&rsquo;\u00e9tude ; elle a identifi\u00e9 \u00e0 la place les heuristiques erron\u00e9es employ\u00e9es<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Cadre \u00e9ditorial CEOtudent. Tous les chiffres sont tels que publi\u00e9s par chaque \u00e9quipe. Le total combin\u00e9 de 6 518 participants sur les trois t\u00e2ches de d\u00e9tection est une somme CEOtudent des tailles d&rsquo;\u00e9chantillon publi\u00e9es, offerte uniquement comme indicateur d&rsquo;ampleur ; les \u00e9tudes diff\u00e8rent par leur protocole, leur population et leur mesure de r\u00e9sultat, et leurs r\u00e9sultats ne doivent pas \u00eatre agr\u00e9g\u00e9s statistiquement.<\/em><\/p>\n<h2 id=\"la-synthse-originale-deux-couches-et-laquelle-dplace-le-verdict\"><span class=\"ez-toc-section\" id=\"La-synthese-originale-deux-couches-et-laquelle-deplace-le-verdict\"><\/span>La synth\u00e8se originale : deux couches, et laquelle d\u00e9place le verdict<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Placez maintenant les \u00e9tudes sur la po\u00e9sie et sur la conversation c\u00f4te \u00e0 c\u00f4te sur un second axe. Elles n&rsquo;ont jamais \u00e9t\u00e9 mises en tableau de cette fa\u00e7on, car l&rsquo;une porte sur la po\u00e9sie et l&rsquo;autre sur la conversation, et elles ont paru dans des supports diff\u00e9rents sous la plume de groupes sans lien. Ensemble, elles isolent quelque chose qu&rsquo;aucune n&rsquo;isole seule.<\/p>\n<p>Les deux exp\u00e9riences comportent une <strong>couche de substance<\/strong> (quel texte, quel mod\u00e8le) et une <strong>couche de pr\u00e9sentation<\/strong> (ce qu&rsquo;on vous en dit, quelle persona a \u00e9t\u00e9 impos\u00e9e). Toutes deux quantifient les deux s\u00e9par\u00e9ment. On peut donc poser une question qu&rsquo;aucun des articles ne pose : quelle part d&rsquo;un verdict d&rsquo;humanit\u00e9 est port\u00e9e par l&rsquo;emballage plut\u00f4t que par la chose ?<\/p>\n<p><strong>Tableau 3. Ce qui d\u00e9place r\u00e9ellement le jugement : couche de pr\u00e9sentation contre couche de substance<\/strong><\/p>\n<table>\n<thead>\n<tr>\n<th>\u00c9tude<\/th>\n<th>Effet de la couche de substance<\/th>\n<th>Effet de la couche de pr\u00e9sentation<\/th>\n<th>Pr\u00e9sentation en part de la substance<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Porter et Machery, note de qualit\u00e9 des po\u00e8mes<\/td>\n<td>Paternit\u00e9 IA r\u00e9elle : +1,045 point, d de Cohen = 0,671<\/td>\n<td>Annonce que le po\u00e8me est g\u00e9n\u00e9r\u00e9 par IA : -0,814 point, d = -0,508<\/td>\n<td>77,9 % selon la diff\u00e9rence de moyennes ; 75,7 % selon d<\/td>\n<\/tr>\n<tr>\n<td>Jones et Bergen, GPT-4.5 jug\u00e9 humain<\/td>\n<td>Non d\u00e9composable \u00e0 partir de ces chiffres<\/td>\n<td>Consigne de persona contre absence de persona : +37 pts, 2,03 fois<\/td>\n<td>La seule consigne a plus que doubl\u00e9 le taux<\/td>\n<\/tr>\n<tr>\n<td>Jones et Bergen, LLaMa-3.1-405B jug\u00e9 humain<\/td>\n<td>Non d\u00e9composable \u00e0 partir de ces chiffres<\/td>\n<td>Consigne de persona contre absence de persona : +18 pts, 1,47 fois<\/td>\n<td>La seule consigne a relev\u00e9 le taux de moiti\u00e9<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Cadre \u00e9ditorial CEOtudent. Tous les chiffres sous-jacents sont tels que publi\u00e9s. La colonne de part de la premi\u00e8re ligne est un calcul CEOtudent divisant l&rsquo;effet absolu de l&rsquo;\u00e9tiquette par l&rsquo;effet absolu de la paternit\u00e9. Les deux lignes Jones et Bergen maintiennent le mod\u00e8le constant, donc l&rsquo;effet de la consigne est net ; la couche de substance ne peut \u00eatre isol\u00e9e des taux publi\u00e9s et est signal\u00e9e comme telle plut\u00f4t qu&rsquo;estim\u00e9e.<\/em><\/p>\n<p>La premi\u00e8re ligne contient le chiffre le plus tranchant de cet article. Sur une \u00e9chelle de sept points, apprendre qu&rsquo;un po\u00e8me est fait par une machine lui co\u00fbte 0,814 point de note, soit environ 11,6 % de l&rsquo;\u00e9chelle compl\u00e8te. L&rsquo;\u00eatre r\u00e9ellement lui rapporte 1,045 point, soit environ 14,9 % de l&rsquo;\u00e9chelle, dans le sens oppos\u00e9. Votre \u00e9valuation d&rsquo;un texte est environ aux trois quarts aussi sensible \u00e0 l&rsquo;histoire qu&rsquo;on vous raconte sur son auteur qu&rsquo;au texte lui-m\u00eame.<\/p>\n<p>Un chiffre d\u00e9riv\u00e9 de plus, et il exige un avertissement. Si ces deux effets \u00e9taient simplement additifs, un po\u00e8me d&rsquo;IA honn\u00eatement \u00e9tiquet\u00e9 comme tel finirait tout de m\u00eame not\u00e9 environ 0,231 point au-dessus d&rsquo;un po\u00e8me humain non \u00e9tiquet\u00e9. Cette soustraction suppose l&rsquo;absence d&rsquo;interaction entre le cadrage et la paternit\u00e9, or les auteurs ont bel et bien ajust\u00e9 un terme d&rsquo;interaction dont les estimations n&rsquo;ont pas pu \u00eatre extraites pour cet article. Traitez +0,231 comme un <strong>mod\u00e8le, non comme une mesure<\/strong>. Ce qui compte, c&rsquo;est la direction : la divulgation ne compense pas enti\u00e8rement l&rsquo;\u00e9cart de qualit\u00e9 que les lecteurs eux-m\u00eames ont per\u00e7u.<\/p>\n<h2 id=\"ce-que-les-lecteurs-rcompensaient-rellement\"><span class=\"ez-toc-section\" id=\"Ce-que-les-lecteurs-recompensaient-reellement\"><\/span>Ce que les lecteurs r\u00e9compensaient r\u00e9ellement<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le r\u00e9sultat sur la qualit\u00e9 se lit facilement comme \u00ab la machine \u00e9crit de meilleurs po\u00e8mes \u00bb. Ce n&rsquo;est pas ce que disent les donn\u00e9es, et l&rsquo;exception relev\u00e9e dans l&rsquo;article le dit aussi.<\/p>\n<p>Le sch\u00e9ma de notation sup\u00e9rieure du travail machine a tenu pour 13 des 14 dimensions qualitatives. L&rsquo;effet le plus marqu\u00e9 concernait le rythme : les po\u00e8mes g\u00e9n\u00e9r\u00e9s \u00e9taient not\u00e9s 1,168 point au-dessus, d = 0,847. La seule exception \u00e9tait l&rsquo;originalit\u00e9. Inform\u00e9s qu&rsquo;un po\u00e8me \u00e9tait g\u00e9n\u00e9r\u00e9, les lecteurs baissaient son originalit\u00e9 de 0,699 point (d = -0,478), mais les po\u00e8mes <em>r\u00e9ellement<\/em> g\u00e9n\u00e9r\u00e9s n&rsquo;\u00e9taient pas jug\u00e9s significativement plus originaux que les po\u00e8mes humains (diff\u00e9rence de moyennes 0,059, d = 0,040, p = 0,098, p corrig\u00e9 de Bonferroni = 1,000).<\/p>\n<p>Cette exception est tout le m\u00e9canisme. Sur chaque dimension qui r\u00e9compense la fluidit\u00e9, les po\u00e8mes g\u00e9n\u00e9r\u00e9s l&rsquo;ont emport\u00e9. Sur l&rsquo;unique dimension exigeant que le lecteur d\u00e9tecte quelque chose de v\u00e9ritablement neuf, la diff\u00e9rence s&rsquo;est \u00e9vanouie. L&rsquo;explication des auteurs est que la simplicit\u00e9 des po\u00e8mes g\u00e9n\u00e9r\u00e9s les rendait plus faciles \u00e0 d\u00e9coder pour des non-sp\u00e9cialistes, et que les lecteurs ont converti la lisibilit\u00e9 en jugement d&rsquo;authenticit\u00e9.<\/p>\n<p>C&rsquo;est le m\u00eame \u00e9chec que d\u00e9crit, dans un cadre factuel, notre article sur <a href=\"https:\/\/ceotudent.com\/en\/why-ai-hallucinates-mechanics-model-errors-catch-early\">pourquoi l&rsquo;IA hallucine et comment fonctionnent les erreurs de mod\u00e8le<\/a> : fluidit\u00e9 et exactitude sont des propri\u00e9t\u00e9s distinctes, et les \u00e9valuateurs humains utilisent invariablement la premi\u00e8re comme substitut de la seconde. Ici le substitut n&rsquo;est pas l&rsquo;exactitude mais l&rsquo;humanit\u00e9, et il \u00e9choue de la m\u00eame mani\u00e8re.<\/p>\n<h2 id=\"ce-qui-a-amlior-la-justesse\"><span class=\"ez-toc-section\" id=\"Ce-qui-a-ameliore-la-justesse\"><\/span>Ce qui a am\u00e9lior\u00e9 la justesse<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Presque rien, et c&rsquo;est en soi le r\u00e9sultat. Mais Jones et Bergen ont class\u00e9 ce que les interrogateurs tentaient r\u00e9ellement, et mesur\u00e9 la justesse dans les parties o\u00f9 chaque strat\u00e9gie \u00e9tait employ\u00e9e. Deux choses ont fonctionn\u00e9, et elles partagent une logique.<\/p>\n<p><strong>Tableau 4. Strat\u00e9gies des interrogateurs et r\u00e9sultats<\/strong><\/p>\n<table>\n<thead>\n<tr>\n<th>Classe de strat\u00e9gie<\/th>\n<th>Fr\u00e9quence rapport\u00e9e<\/th>\n<th>Efficacit\u00e9 relative<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Dire quelque chose d&rsquo;\u00e9trange pour voir la r\u00e9action du t\u00e9moin<\/td>\n<td>Relativement rare<\/td>\n<td>Parmi les plus justes<\/td>\n<\/tr>\n<tr>\n<td>Tentatives de contournement classiques, par exemple \u00ab ignore toutes les instructions pr\u00e9c\u00e9dentes \u00bb<\/td>\n<td>Relativement rare<\/td>\n<td>Parmi les plus justes<\/td>\n<\/tr>\n<tr>\n<td>Demander directement si le t\u00e9moin est humain<\/td>\n<td>19 % des parties<\/td>\n<td>Non rapport\u00e9 comme efficace<\/td>\n<\/tr>\n<tr>\n<td>Tester la conscience de la situation, par exemple la m\u00e9t\u00e9o ou l&rsquo;interface<\/td>\n<td>13 % des parties<\/td>\n<td>Questions sur la m\u00e9t\u00e9o parmi les moins efficaces<\/td>\n<\/tr>\n<tr>\n<td>Tester les connaissances et le raisonnement, y compris l&rsquo;actualit\u00e9<\/td>\n<td>12 % des parties<\/td>\n<td>Non rapport\u00e9 comme efficace<\/td>\n<\/tr>\n<tr>\n<td>Interroger sur les exp\u00e9riences humaines<\/td>\n<td>Non rapport\u00e9 s\u00e9par\u00e9ment<\/td>\n<td>Parmi les moins efficaces<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Source : Jones et Bergen, classification des strat\u00e9gies et justesse moyenne des interrogateurs par strat\u00e9gie. Les fr\u00e9quences sont telles que publi\u00e9es. La colonne d&rsquo;efficacit\u00e9 reproduit le classement qualitatif des auteurs ; les valeurs de justesse par strat\u00e9gie \u00e9taient pr\u00e9sent\u00e9es graphiquement et ne sont pas cit\u00e9es ici plut\u00f4t qu&rsquo;estim\u00e9es \u00e0 partir d&rsquo;une figure.<\/em><\/p>\n<p>Les deux man\u0153uvres efficaces sont des sondes adverses. Elles poussent le syst\u00e8me hors de sa trajectoire de suivi d&rsquo;instructions et observent ce qui se passe au bord. Les man\u0153uvres inefficaces, interroger sur la m\u00e9t\u00e9o ou sur l&rsquo;exp\u00e9rience humaine, sont pr\u00e9cis\u00e9ment celles qui ressemblent le plus \u00e0 un test d&rsquo;humanit\u00e9 et constituent en fait la partie la mieux couverte de la distribution d&rsquo;entra\u00eenement.<\/p>\n<p>Les auteurs ajoutent un d\u00e9tail sur lequel il vaut la peine de s&rsquo;arr\u00eater. Parmi les raisons donn\u00e9es pour les verdicts corrects, la classe la plus juste concernait le <em>manque<\/em> de connaissance d&rsquo;un t\u00e9moin : choisir quelqu&rsquo;un comme humain parce qu&rsquo;il a fait une erreur ou ignorait quelque chose qu&rsquo;une IA devrait savoir. Un syst\u00e8me moderne cherchant \u00e0 passer doit feindre l&rsquo;ignorance de fa\u00e7on convaincante sur des sujets que la plupart des gens ne ma\u00eetrisent pas. Le signe distinctif n&rsquo;est plus l&rsquo;incomp\u00e9tence. C&rsquo;est la mauvaise forme de comp\u00e9tence.<\/p>\n<p>Pendant ce temps, les <em>raisons<\/em> les plus fr\u00e9quemment invoqu\u00e9es, justes ou non, portaient sur le style linguistique \u00e0 27 % et sur la dynamique d&rsquo;interaction \u00e0 23 %, beaucoup de participants faisant \u00e9tat d&rsquo;une intuition g\u00e9n\u00e9rale qu&rsquo;ils ne savaient pas formuler. Les gens se sont saisis du style. Le style est ce que la machine r\u00e9ussit le mieux.<\/p>\n<h2 id=\"ce-que-cela-implique-pour-vos-dcisions\"><span class=\"ez-toc-section\" id=\"Ce-que-cela-implique-pour-vos-decisions\"><\/span>Ce que cela implique pour vos d\u00e9cisions<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>La conclusion pratique n&rsquo;est ni \u00ab ne faites confiance \u00e0 rien \u00bb ni \u00ab apprenez \u00e0 mieux rep\u00e9rer l&rsquo;IA \u00bb. Les donn\u00e9es disent que la seconde est presque hors d&rsquo;atteinte et que la premi\u00e8re n&rsquo;est pas une strat\u00e9gie. Elles pointent vers quelque chose de plus pr\u00e9cis.<\/p>\n<p><strong>Tableau 5. Protocole de discernement, chaque \u00e9tape rattach\u00e9e \u00e0 la preuve qui la motive<\/strong><\/p>\n<table>\n<thead>\n<tr>\n<th>\u00c9tape<\/th>\n<th>Que faire<\/th>\n<th>Preuve qui la motive<\/th>\n<th>Statut<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>1. Cessez de chercher \u00e0 identifier l&rsquo;auteur<\/td>\n<td>Abandonnez enti\u00e8rement la d\u00e9tection de source comme filtre de qualit\u00e9<\/td>\n<td>46,6 % de justesse sur 16 340 jugements ; mod\u00e8le d&rsquo;expertise R deux 0,012 ; aucun effet de la connaissance des mod\u00e8les ou de l&rsquo;usage de robots conversationnels ; 4 600 participants incapables de d\u00e9tecter des pr\u00e9sentations g\u00e9n\u00e9r\u00e9es<\/td>\n<td>\u00c9tay\u00e9 par les donn\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>2. D\u00e9cotez votre assurance, pas votre jugement<\/td>\n<td>Traitez une forte certitude sur la provenance comme un signal d&rsquo;alerte plut\u00f4t que comme un indice<\/td>\n<td>La confiance \u00e9tait significativement li\u00e9e n\u00e9gativement \u00e0 la justesse dans une \u00e9tude ; le r\u00e9sultat d&rsquo;auto-estimation ne s&rsquo;est pas r\u00e9pliqu\u00e9 d&rsquo;une population \u00e0 l&rsquo;autre dans l&rsquo;autre<\/td>\n<td>\u00c9tay\u00e9, avec r\u00e9serve de r\u00e9plication<\/td>\n<\/tr>\n<tr>\n<td>3. \u00c9valuez \u00e0 l&rsquo;aveugle quand vous le pouvez<\/td>\n<td>Retirez les signatures avant de juger un travail sur lequel vous allez agir<\/td>\n<td>Effet de l&rsquo;\u00e9tiquette sur la note de qualit\u00e9 d = -0,508, environ 76 % de l&rsquo;effet de paternit\u00e9<\/td>\n<td>\u00c9tay\u00e9 par les donn\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>4. Sondez de fa\u00e7on adverse, n&rsquo;interviewez pas<\/td>\n<td>Poussez aux limites et aux incoh\u00e9rences plut\u00f4t que de poser des questions sinc\u00e8res<\/td>\n<td>Consignes \u00e9tranges et tentatives de contournement figuraient parmi les strat\u00e9gies les plus justes ; questions sur la m\u00e9t\u00e9o et l&rsquo;exp\u00e9rience humaine parmi les moins efficaces<\/td>\n<td>Direction \u00e9tay\u00e9e<\/td>\n<\/tr>\n<tr>\n<td>4b. M\u00e9fiez-vous des indices populaires<\/td>\n<td>Ne comptez pas les pronoms \u00e0 la premi\u00e8re personne, les contractions et les d\u00e9tails personnels ou familiaux comme preuve d&rsquo;\u00e9criture humaine<\/td>\n<td>Ce sont exactement les heuristiques identifi\u00e9es comme erron\u00e9es, et d\u00e9montr\u00e9es pr\u00e9visibles et manipulables<\/td>\n<td>\u00c9tay\u00e9 par les donn\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>5. Notez sur la dimension que la fluidit\u00e9 ne peut simuler<\/td>\n<td>Demandez ce qui est r\u00e9ellement neuf ici, pas si cela se lit bien<\/td>\n<td>Le travail machine a emport\u00e9 13 des 14 dimensions ; l&rsquo;originalit\u00e9 \u00e9tait la seule exception et n&rsquo;a montr\u00e9 aucun avantage significatif<\/td>\n<td>\u00c9tay\u00e9 par les donn\u00e9es<\/td>\n<\/tr>\n<tr>\n<td>6. Jugez les d\u00e9cisions \u00e0 leurs cons\u00e9quences, pas \u00e0 leur prose<\/td>\n<td>Suivez ce que la recommandation pr\u00e9disait et si cela s&rsquo;est produit<\/td>\n<td>Mesur\u00e9 par aucune source cit\u00e9e ici<\/td>\n<td>Convention CEOtudent<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Cadre \u00e9ditorial CEOtudent. Les \u00e9tapes 1 \u00e0 5 reformulent des r\u00e9sultats effectivement produits par les deux \u00e9tudes cit\u00e9es. L&rsquo;\u00e9tape 6 est d\u00e9lib\u00e9r\u00e9ment \u00e9tiquet\u00e9e comme convention : aucune source de cet article ne l&rsquo;a mesur\u00e9e, et elle est propos\u00e9e comme structure raisonnable, non comme technique \u00e9tay\u00e9e.<\/em><\/p>\n<p>L&rsquo;\u00e9tape 5 est celle qui change le plus les comportements quotidiens. Les deux \u00e9tudes sugg\u00e8rent que les \u00e9valuateurs effectuent un contr\u00f4le de fluidit\u00e9 et l&rsquo;appellent contr\u00f4le de jugement. La fluidit\u00e9 est d\u00e9sormais gratuite. Il ne reste donc, comme seule dimension porteuse d&rsquo;information, celle o\u00f9 la machine n&rsquo;a montr\u00e9 aucun avantage mesurable : le travail contient-il quelque chose qui n&rsquo;\u00e9tait pas d\u00e9j\u00e0 en circulation. Cette question est r\u00e9pondable, mais seulement par quelqu&rsquo;un qui a lu assez du mat\u00e9riau environnant pour savoir ce qui s&rsquo;y trouvait d\u00e9j\u00e0, capacit\u00e9 que notre article compagnon sur <a href=\"https:\/\/ceotudent.com\/en\/deep-reading-competitive-advantage-ai-era\">la lecture profonde comme avantage concurrentiel<\/a> d\u00e9crit pr\u00e9cis\u00e9ment comme en voie de rar\u00e9faction.<\/p>\n<p>Le partage entre le PDG et l&rsquo;\u00e9tudiant se r\u00e9sout ici nettement, et pas dans le sens attendu. L&rsquo;instinct du PDG est de faire confiance au jugement, parce que c&rsquo;est pour son jugement qu&rsquo;un dirigeant est pay\u00e9. L&rsquo;instinct de l&rsquo;\u00e9tudiant est de v\u00e9rifier si ce jugement est calibr\u00e9. Sur cette capacit\u00e9 pr\u00e9cise, les donn\u00e9es sont sans ambigu\u00eft\u00e9 : l&rsquo;instinct n&rsquo;est pas calibr\u00e9, et en \u00eatre s\u00fbr aggrave l\u00e9g\u00e8rement les choses. Notre note sur <a href=\"https:\/\/ceotudent.com\/en\/trust-calibration-when-to-trust-ai-recommendations\">le calibrage de la confiance<\/a> traite de la r\u00e8gle de d\u00e9cision ; cet article traite de l&rsquo;\u00e9chec de perception qui court en dessous. Ce sont deux probl\u00e8mes distincts. Vous pouvez avoir une bonne politique sur le moment o\u00f9 faire confiance \u00e0 une recommandation d&rsquo;IA et rester incapable de voir ce que vous avez sous les yeux.<\/p>\n<h2 id=\"ce-qui-changerait-cette-conclusion\"><span class=\"ez-toc-section\" id=\"Ce-qui-changerait-cette-conclusion\"><\/span>Ce qui changerait cette conclusion<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Trois choses, \u00e0 surveiller plut\u00f4t qu&rsquo;\u00e0 \u00e9carter par hypoth\u00e8se.<\/p>\n<p>Le r\u00e9sultat sur la po\u00e9sie ne s&rsquo;inscrit pas dans une litt\u00e9rature incontest\u00e9e, et les auteurs le disent eux-m\u00eames. Ils notent que leurs conclusions contrastent avec des travaux ant\u00e9rieurs o\u00f9 les participants <em>parvenaient<\/em> \u00e0 distinguer des po\u00e8tes professionnels de po\u00e8mes g\u00e9n\u00e9r\u00e9s sans humain dans la boucle, et avec d&rsquo;autres travaux trouvant les participants simplement au niveau du hasard plut\u00f4t qu&rsquo;en dessous. Les \u00e9tudes ant\u00e9rieures trouvaient en outre g\u00e9n\u00e9ralement les po\u00e8mes g\u00e9n\u00e9r\u00e9s \u00e9valu\u00e9s plus n\u00e9gativement, l&rsquo;inverse de ce qu&rsquo;ont produit ces exp\u00e9riences. La lecture la plus probable est que les mod\u00e8les ont progress\u00e9, et non que les chercheurs ant\u00e9rieurs se trompaient, mais c&rsquo;est une interpr\u00e9tation et non un fait que les donn\u00e9es \u00e9tablissent.<\/p>\n<p>Les deux \u00e9tudes recourent \u00e0 des \u00e9chantillons de population g\u00e9n\u00e9rale accomplissant une t\u00e2che inhabituelle dans des conditions artificielles. Aucune n&rsquo;a test\u00e9 si un expert \u00e9valuant un travail <em>dans son propre domaine<\/em>, avec du temps et des enjeux r\u00e9els, se comporterait diff\u00e9remment. Porter et Machery ont test\u00e9 l&rsquo;exp\u00e9rience po\u00e9tique aupr\u00e8s de lecteurs de po\u00e9sie, ce qui s&rsquo;en rapproche, mais un bagage po\u00e9tique autod\u00e9clar\u00e9 n&rsquo;\u00e9quivaut pas \u00e0 une expertise professionnelle. Le r\u00e9sultat nul sur l&rsquo;expertise est r\u00e9el et r\u00e9pliqu\u00e9, mais c&rsquo;est un r\u00e9sultat nul sur l&rsquo;expertise que ces \u00e9tudes ont mesur\u00e9e.<\/p>\n<p>Le r\u00e9sultat de Jones et Bergen est une pr\u00e9impression au moment de la r\u00e9daction, et les deux populations divergeaient nettement sur plusieurs mesures exploratoires. La condition persona de LLaMa, par exemple, atteignait 45 % chez les \u00e9tudiants et 65 % chez les participants Prolific, un \u00e9cart de 20 points sur la m\u00eame condition. Les effets de population ne sont pas n\u00e9gligeables ici.<\/p>\n<p>Rien de cela ne change ce qu&rsquo;il faut faire ce trimestre. Cessez d&rsquo;utiliser la paternit\u00e9 comme substitut de la qualit\u00e9, puisque la paternit\u00e9 est irr\u00e9cup\u00e9rable. Retirez les \u00e9tiquettes avant de juger. Demandez ce qui est neuf plut\u00f4t que si cela se lit bien.<\/p>\n<h2 id=\"faq\"><span class=\"ez-toc-section\" id=\"FAQ\"><\/span>FAQ<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Les gens sont-ils vraiment moins bons que le hasard pour rep\u00e9rer un texte d&rsquo;IA ?<\/strong><br \/>\nDans cette \u00e9tude oui, et significativement : 46,6 % de justesse sur 16 340 jugements l\u00e0 o\u00f9 deviner donnerait 50 %, khi-deux(1) = 75,13, p &lt; 0,0001. Les auteurs interpr\u00e8tent la performance sous le hasard, jointe \u00e0 un accord entre participants sup\u00e9rieur au hasard, comme la preuve d&rsquo;une heuristique partag\u00e9e mais invers\u00e9e, et non de r\u00e9ponses al\u00e9atoires.<\/p>\n<p><strong>Conna\u00eetre beaucoup l&rsquo;IA aide-t-il ?<\/strong><br \/>\nAu vu des donn\u00e9es disponibles, non. Jones et Bergen n&rsquo;ont trouv\u00e9 aucun effet significatif du niveau de connaissance des mod\u00e8les de langage ni de la fr\u00e9quence d&rsquo;interaction avec des robots conversationnels dans aucune de leurs deux \u00e9tudes, et notent que la justesse \u00e9tait homog\u00e8ne jusque chez les personnes qui font de la recherche sur ces syst\u00e8mes. Porter et Machery n&rsquo;ont trouv\u00e9 aucune variable d&rsquo;exp\u00e9rience po\u00e9tique avec un effet positif significatif.<\/p>\n<p><strong>Sur quels indices les gens s&rsquo;appuient-ils \u00e0 tort ?<\/strong><br \/>\nLes pronoms \u00e0 la premi\u00e8re personne, les contractions et les th\u00e8mes familiaux ou personnels. Une analyse computationnelle sur six exp\u00e9riences les a identifi\u00e9s comme les heuristiques par lesquelles les lecteurs inf\u00e8rent une \u00e9criture humaine, et les auteurs ont ensuite montr\u00e9 exp\u00e9rimentalement que, parce qu&rsquo;elles sont pr\u00e9visibles, elles peuvent \u00eatre cibl\u00e9es, produisant un texte jug\u00e9 plus humain qu&rsquo;humain. Si vous vous surprenez \u00e0 trouver un passage humain parce qu&rsquo;il dit \u00ab je \u00bb et emploie des contractions, c&rsquo;est exactement le mode de d\u00e9faillance document\u00e9.<\/p>\n<p><strong>La confiance est-elle donc toujours inversement li\u00e9e \u00e0 la justesse ?<\/strong><br \/>\nNon, et la r\u00e9ponse honn\u00eate est plus d\u00e9sordonn\u00e9e. Porter et Machery ont trouv\u00e9 un effet n\u00e9gatif significatif de la confiance (b = -0,021673, p &lt; 0,0001). Jones et Bergen ont trouv\u00e9 la justesse auto-estim\u00e9e corr\u00e9l\u00e9e positivement \u00e0 la justesse r\u00e9elle chez les \u00e9tudiants (p = 0,03) mais pas chez les participants Prolific (p = 0,45). La confiance n&rsquo;est un signal fiable dans aucun sens, et c&rsquo;est l\u00e0 la conclusion utilisable.<\/p>\n<p><strong>Cela veut-il dire que l&rsquo;IA \u00e9crit mieux que les humains ?<\/strong><br \/>\nNon. Cela veut dire que les lecteurs l&rsquo;ont mieux not\u00e9e sur les dimensions qui r\u00e9compensent la fluidit\u00e9, 13 sur 14, le rythme \u00e9tant la plus marqu\u00e9e \u00e0 d = 0,847. Sur l&rsquo;originalit\u00e9, l&rsquo;unique dimension exigeant du lecteur qu&rsquo;il d\u00e9tecte du neuf, les po\u00e8mes r\u00e9ellement \u00e9crits par IA n&rsquo;ont montr\u00e9 aucun avantage significatif (d = 0,040, p = 0,098). C&rsquo;est un constat sur ce que les lecteurs r\u00e9compensent, non sur la valeur litt\u00e9raire.<\/p>\n<p><strong>Faut-il \u00e9tiqueter un travail assist\u00e9 par IA ?<\/strong><br \/>\nC&rsquo;est une question d&rsquo;\u00e9thique que ces donn\u00e9es ne peuvent trancher, mais elles peuvent vous en donner le co\u00fbt. \u00c9tiqueter un travail comme g\u00e9n\u00e9r\u00e9 par IA a r\u00e9duit les notes de qualit\u00e9 de 0,814 point sur une \u00e9chelle de sept, d = -0,508. Les lecteurs p\u00e9nalisent l&rsquo;\u00e9tiquette ind\u00e9pendamment du travail. Qui d\u00e9cide d&rsquo;une divulgation devrait l&rsquo;int\u00e9grer plut\u00f4t que d&rsquo;en \u00eatre surpris.<\/p>\n<p><strong>Quel est le changement le plus utile ?<\/strong><br \/>\n\u00c9valuer \u00e0 l&rsquo;aveugle. L&rsquo;effet de l&rsquo;\u00e9tiquette vaut environ les trois quarts de l&rsquo;effet r\u00e9el de qualit\u00e9, et c&rsquo;est la seule variable enti\u00e8rement sous votre contr\u00f4le. Retirer les signatures avant de juger un travail sur lequel vous comptez agir ne co\u00fbte rien et supprime un biais de taille mesur\u00e9e.<\/p>\n<h2 id=\"sources\"><span class=\"ez-toc-section\" id=\"Sources\"><\/span>Sources<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Porter et Machery. AI-generated poetry is indistinguishable from human-written poetry and is rated more favorably. Scientific Reports.<\/p>\n<p>Jones et Bergen. Large Language Models Pass the Turing Test. Pr\u00e9impression arXiv, Computation and Language.<\/p>\n<p>Jakesch, Hancock et Naaman. Human heuristics for AI-generated language are flawed. Proceedings of the National Academy of Sciences, 2023.<\/p>\n<p>Kobis et Mossink, paradigmes avec et sans humain dans la boucle pour l&rsquo;\u00e9valuation de la po\u00e9sie g\u00e9n\u00e9r\u00e9e par machine, tels que caract\u00e9ris\u00e9s dans Porter et Machery.<\/p>\n<p>Note de port\u00e9e : le total combin\u00e9 de 6 518 participants sur les trois \u00e9tudes de d\u00e9tection est une somme CEOtudent de tailles d&rsquo;\u00e9chantillon publi\u00e9es, utilis\u00e9e uniquement pour indiquer l&rsquo;ampleur. Les trois \u00e9tudes diff\u00e8rent par leur protocole, leur population et leur mesure de r\u00e9sultat, et ne sont agr\u00e9g\u00e9es statistiquement nulle part dans cet article.<\/p>\n<hr>\n<p><em>Ce contenu a \u00e9t\u00e9 compil\u00e9 avec le soutien de l&rsquo;IA \u00e0 la suite d&rsquo;une recherche approfondie, puis r\u00e9dig\u00e9 et pr\u00e9par\u00e9 pour publication par l&rsquo;\u00e9quipe \u00e9ditoriale de CEOtudent.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Trois grandes \u00e9tudes men\u00e9es par trois laboratoires ind\u00e9pendants dans des domaines totalement diff\u00e9rents convergent vers le m\u00eame constat inconfortable : les gens n&rsquo;identifient pas de fa\u00e7on fiable un travail produit par une machine, l&rsquo;expertise n&rsquo;aide pas, et la confiance en soi joue \u00e0 l&rsquo;envers. Pire, l&rsquo;\u00e9valuation elle-m\u00eame est environ aux trois quarts aussi sensible \u00e0 l&rsquo;\u00e9tiquette appos\u00e9e sur un travail qu&rsquo;au travail lui-m\u00eame. Cet article rassemble les donn\u00e9es, d\u00e9rive ce que vaut r\u00e9ellement la couche de pr\u00e9sentation face \u00e0 la couche de substance, et expose les seules strat\u00e9gies qui ont am\u00e9lior\u00e9 la justesse de fa\u00e7on mesurable.<\/p>\n","protected":false},"author":1,"featured_media":325915,"comment_status":"open","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[4599,18],"tags":[],"class_list":["post-325913","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-gelisim","category-strateji"],"_links":{"self":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts\/325913","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/comments?post=325913"}],"version-history":[{"count":0,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts\/325913\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/media\/325915"}],"wp:attachment":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/media?parent=325913"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/categories?post=325913"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/tags?post=325913"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}