\n| HLE<\/td>\n | Choix multiples \/ notation par \u00e9quivalence<\/td>\n | Oui<\/td>\n | Aucun<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n Source : Kalai, Nachum, Vempala et Zhang, \u00ab Why Language Models Hallucinate \u00bb, pr\u00e9publication arXiv 2509.04664v1, septembre 2025, tableau 2. Notre comptage de leurs lignes : 9 sur 10 utilisent une notation binaire ; 9 sur 10 n’accordent aucun cr\u00e9dit \u00e0 l’abstention ; 0 sur 10 accorde le plein cr\u00e9dit \u00e0 une abstention calibr\u00e9e. La grille de WildBench n’offre qu’un cr\u00e9dit partiel, et les auteurs notent que son \u00e9chelle de 1 \u00e0 10 peut encore noter une abstention en dessous d’une r\u00e9ponse assur\u00e9e mais hallucin\u00e9e.<\/em><\/p>\nCette derni\u00e8re ligne contient tout le probl\u00e8me en miniature. M\u00eame le seul r\u00e9f\u00e9rentiel qui n’utilise pas de notation binaire peut encore r\u00e9compenser une fausset\u00e9 assur\u00e9e davantage qu’un honn\u00eate \u00ab je ne sais pas \u00bb.<\/p>\n La solution propos\u00e9e n’est pas un nouveau r\u00e9f\u00e9rentiel d’hallucination. C’est de changer la notation des r\u00e9f\u00e9rentiels qui dominent d\u00e9j\u00e0 les classements, en \u00e9non\u00e7ant un seuil de confiance dans les consignes : ne r\u00e9ponds que si tu es s\u00fbr \u00e0 plus de t, car les erreurs sont p\u00e9nalis\u00e9es de t\/(1-t) points, les bonnes r\u00e9ponses valent 1 point et \u00ab je ne sais pas \u00bb vaut 0.<\/p>\n Une note sur cette formule, pour les lecteurs qui v\u00e9rifient les calculs. La pr\u00e9publication cite comme valeurs naturelles t = 0,5 (p\u00e9nalit\u00e9 1), t = 0,75 (p\u00e9nalit\u00e9 2) et t = 0,9 (p\u00e9nalit\u00e9 9). En appliquant la formule que l’article \u00e9nonce lui-m\u00eame, t\/(1-t), on obtient 1 pour t = 0,5 et 9 pour t = 0,9, les deux concordent, mais 3 pour t = 0,75, et non 2. La parenth\u00e8se de la valeur interm\u00e9diaire contredit la formule qu’elle accompagne. C’est un petit d\u00e9rapage dans une pr\u00e9publication par ailleurs soign\u00e9e et cela ne change rien \u00e0 l’argument. Nous le signalons parce que c’est exactement le type de nombre d\u00e9riv\u00e9 que cet article vous invite \u00e0 recalculer, et la le\u00e7on ne s’arr\u00eate pas aux articles des laboratoires de pointe. L’observation porte sur la version 1 de la pr\u00e9publication arXiv dat\u00e9e du 4 septembre 2025 ; les versions publi\u00e9es ult\u00e9rieurement peuvent diff\u00e9rer.<\/p>\n <\/span>Le taux de bluff : une colonne in\u00e9dite<\/span><\/h2>\nC’est ici que la th\u00e9orie devient mesurable.<\/p>\n OpenAI a publi\u00e9 SimpleQA en novembre 2024, un r\u00e9f\u00e9rentiel de 4 326 questions factuelles courtes \u00e9crites pour \u00eatre difficiles pour GPT-4o, chacune ayant une seule r\u00e9ponse incontestable. Sa notation comporte trois issues plut\u00f4t que deux : correcte, incorrecte et non tent\u00e9e, cette derni\u00e8re couvrant les r\u00e9ponses qui ne donnent pas pleinement la r\u00e9ponse de r\u00e9f\u00e9rence, y compris un franc \u00ab je ne sais pas \u00bb.<\/p>\n Cette troisi\u00e8me cat\u00e9gorie rend le jeu de donn\u00e9es utile ici, car elle s\u00e9pare deux choses que les r\u00e9f\u00e9rentiels binaires confondent : ne pas savoir, et faire semblant de savoir.<\/p>\n Le tableau publi\u00e9 rapporte correcte, non tent\u00e9e et incorrecte pour huit mod\u00e8les. Il ne rapporte pas le ratio qui compte le plus pour un professionnel en activit\u00e9. Si un mod\u00e8le doit vous faire d\u00e9faut, \u00e0 quoi ressemble cet \u00e9chec ? Vous dit-il qu’il ne sait pas, ou vous tend-il quelque chose de faux sans sourciller ?<\/p>\n C’est une simple division : incorrecte divis\u00e9e par la somme d’incorrecte et de non tent\u00e9e. Nous l’avons calcul\u00e9e pour chaque ligne.<\/p>\n \n\n\n| Mod\u00e8le<\/th>\n | Correcte (%)<\/th>\n | Non tent\u00e9e (%)<\/th>\n | Incorrecte (%)<\/th>\n | Taux de bluff (%)<\/th>\n<\/tr>\n<\/thead>\n | \n\n| GPT-4o-mini<\/td>\n | 8,6<\/td>\n | 0,9<\/td>\n | 90,5<\/td>\n | 99,0<\/td>\n<\/tr>\n | \n| GPT-4o<\/td>\n | 38,2<\/td>\n | 1,0<\/td>\n | 60,8<\/td>\n | 98,4<\/td>\n<\/tr>\n | \n| OpenAI o1-preview<\/td>\n | 42,7<\/td>\n | 9,2<\/td>\n | 48,1<\/td>\n | 83,9<\/td>\n<\/tr>\n | \n| OpenAI o1-mini<\/td>\n | 8,1<\/td>\n | 28,5<\/td>\n | 63,4<\/td>\n | 69,0<\/td>\n<\/tr>\n | \n| Claude-3.5-sonnet (2024-06-20)<\/td>\n | 28,9<\/td>\n | 35,0<\/td>\n | 36,1<\/td>\n | 50,8<\/td>\n<\/tr>\n | \n| Claude-3-opus (2024-02-29)<\/td>\n | 23,5<\/td>\n | 39,6<\/td>\n | 36,9<\/td>\n | 48,2<\/td>\n<\/tr>\n | \n| Claude-3-haiku (2024-03-07)<\/td>\n | 5,1<\/td>\n | 75,3<\/td>\n | 19,6<\/td>\n | 20,7<\/td>\n<\/tr>\n | \n| Claude-3-sonnet (2024-02-29)<\/td>\n | 5,7<\/td>\n | 75,0<\/td>\n | 19,3<\/td>\n | 20,5<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n Cadre \u00e9ditorial CEOtudent. Les colonnes correcte, non tent\u00e9e et incorrecte sont reprises verbatim d’OpenAI, \u00ab Measuring short-form factuality in large language models \u00bb, pr\u00e9publication arXiv 2411.04368, tableau 3. Le taux de bluff est notre calcul : incorrecte \/ (incorrecte + non tent\u00e9e), soit la part des r\u00e9ponses non correctes dans lesquelles le mod\u00e8le a affirm\u00e9 une r\u00e9ponse fausse plut\u00f4t que de s’abstenir. Chaque ligne du tableau source totalise 100,0, ce que nous avons v\u00e9rifi\u00e9. Les mod\u00e8les et les dates correspondent \u00e0 l’\u00e9valuation de fin 2024 et les syst\u00e8mes actuels diff\u00e8rent ; la colonne est incluse pour montrer l’amplitude des comportements d’abstention, non pour classer des fournisseurs aujourd’hui.<\/em><\/p>\nDeux lectures, et la seconde est la plus importante.<\/p>\n La lecture \u00e9vidente est l’amplitude. GPT-4o-mini, quand il ne sait pas, vous r\u00e9pond quand m\u00eame 99 fois sur 100. Claude-3-sonnet, dans la m\u00eame situation, d\u00e9cline quatre fois sur cinq. C’est un \u00e9cart de 4,8 fois dans la mani\u00e8re dont l’\u00e9chec se pr\u00e9sente.<\/p>\n La lecture qui compte davantage : le taux de bluff est largement d\u00e9coupl\u00e9 de l’exactitude. GPT-4o-mini a r\u00e9pondu correctement \u00e0 8,6% des questions. Claude-3-haiku \u00e0 5,1%. Un \u00e9cart de 3,5 points de pourcentage en comp\u00e9tence, et un \u00e9cart de 78 points dans leur comportement lorsqu’ils sont d\u00e9pass\u00e9s. Ces deux mod\u00e8les savent presque aussi peu. L’un le dit, l’autre non.<\/p>\n C’est pr\u00e9cis\u00e9ment ce que pr\u00e9dit l’article sur l’hallucination. Le comportement d’abstention n’est pas un sous-produit de la capacit\u00e9. C’est une disposition distincte et apprise, fix\u00e9e par ce que le processus d’entra\u00eenement et d’\u00e9valuation a r\u00e9compens\u00e9. Et puisque neuf r\u00e9f\u00e9rentiels de premier plan sur dix ne paient rien pour l’abstention, le gradient d’incitation pointe dans une seule direction.<\/p>\n La cons\u00e9quence pratique : vous ne pouvez pas d\u00e9duire la fiabilit\u00e9 des scores de r\u00e9f\u00e9rentiels. Le mod\u00e8le en t\u00eate d’un classement peut \u00eatre celui qui a le plus de chances de vous tendre une r\u00e9f\u00e9rence fabriqu\u00e9e, car la position au classement et la propension au bluff sont produites par la m\u00eame pression.<\/p>\n <\/span>Le second r\u00e9gime : ce qui se passe quand vous fournissez les faits<\/span><\/h2>\nTout ce qui pr\u00e9c\u00e8de concerne le rappel \u00e0 livre ferm\u00e9, o\u00f9 le mod\u00e8le r\u00e9pond \u00e0 partir de ses seuls param\u00e8tres. La plupart du travail professionnel n’est pas ainsi. Vous collez un document, joignez un rapport, pointez vers une base de code. Cela r\u00e8gle-t-il le probl\u00e8me ?<\/p>\n Vectara tient un classement public des hallucinations \u00e0 l’aide de son Hallucination Evaluation Model. La t\u00e2che est d\u00e9lib\u00e9r\u00e9ment \u00e9troite : chaque mod\u00e8le re\u00e7oit un document et doit le r\u00e9sumer en n’utilisant que les faits qui y figurent, puis le r\u00e9sum\u00e9 est v\u00e9rifi\u00e9 pour rep\u00e9rer les affirmations que la source ne soutient pas. Le jeu de donn\u00e9es contient plus de 7 700 articles couvrant actualit\u00e9, technologie, science, m\u00e9decine, droit, sport, \u00e9conomie et \u00e9ducation, de 50 \u00e0 24 000 mots, il est tenu priv\u00e9 pour \u00e9viter le surapprentissage, et les mod\u00e8les sont appel\u00e9s \u00e0 temp\u00e9rature 0. La version ci-dessous a \u00e9t\u00e9 mise \u00e0 jour le 11 mai 2026 et couvre 106 mod\u00e8les.<\/p>\n Sur l’ensemble du classement, les taux d’hallucination sur source fournie vont de 1,8% pour le meilleur \u00e0 24,2% pour le pire.<\/p>\n Comparez cela aux chiffres \u00e0 livre ferm\u00e9 plus haut, o\u00f9 GPT-4o a r\u00e9pondu incorrectement \u00e0 60,8% des questions SimpleQA. Ce sont des t\u00e2ches, des mod\u00e8les et des dates diff\u00e9rents : ce n’est donc pas une comparaison de mod\u00e8les \u00e0 p\u00e9rim\u00e8tre \u00e9gal et il ne faut pas la lire ainsi. C’est une comparaison de deux r\u00e9gimes, et l’\u00e9cart entre eux est d’environ un ordre de grandeur. Mettre le fait dans la fen\u00eatre de contexte est la plus grande intervention \u00e0 votre disposition, et elle est disponible sur chaque t\u00e2che, gratuitement, d\u00e8s maintenant.<\/p>\n Mais elle ne ram\u00e8ne pas le taux \u00e0 z\u00e9ro, et la forme de l’erreur r\u00e9siduelle est l\u00e0 o\u00f9 cela devient int\u00e9ressant.<\/p>\n | |