{"id":325164,"date":"2026-08-17T04:52:18","date_gmt":"2026-08-17T01:52:18","guid":{"rendered":"https:\/\/ceotudent.com\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026"},"modified":"2026-08-17T04:52:18","modified_gmt":"2026-08-17T01:52:18","slug":"navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026","status":"publish","type":"post","link":"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026","title":{"rendered":"Navigateurs agentiques et IA pilotant l&rsquo;ordinateur : ce qui fonctionne vraiment pour le travail de bureau en 2026"},"content":{"rendered":"<p><strong>En bref :<\/strong> Les agents pilotant l&rsquo;ordinateur, ces syst\u00e8mes qui voient votre \u00e9cran et manipulent souris et clavier, ont r\u00e9alis\u00e9 un v\u00e9ritable saut de capacit\u00e9, et les d\u00e9monstrations ne sont pas truqu\u00e9es. Mais les donn\u00e9es publi\u00e9es tracent une ligne nette que les d\u00e9monstrations ne tracent pas. Sur OSWorld, le r\u00e9f\u00e9rentiel acad\u00e9mique compos\u00e9 de 369 t\u00e2ches courtes sur un vrai bureau, les agents sont pass\u00e9s de 12,24 pour cent de r\u00e9ussite au lancement en 2024 \u00e0 des scores sup\u00e9rieurs au seuil humain de 72,36 pour cent. Sur OSWorld 2.0, publi\u00e9 en juin 2026 avec 108 flux de longue haleine qui demandent \u00e0 un humain une m\u00e9diane de 1,6 heure, le meilleur agent de pointe en termine 20,6 pour cent. Le m\u00eame syst\u00e8me obtient 83,5 pour cent sur le r\u00e9f\u00e9rentiel court et 20,6 pour cent sur le long. Cet \u00e9cart est le chiffre le plus important du domaine, et il vous dit exactement o\u00f9 la d\u00e9l\u00e9gation fonctionne et o\u00f9 elle d\u00e9truit de la valeur. Ce guide fournit le tableau v\u00e9rifi\u00e9 des r\u00e9sultats, une analyse d\u00e9riv\u00e9e du co\u00fbt par t\u00e2che r\u00e9ellement achev\u00e9e, la taxonomie publi\u00e9e des six modes d&rsquo;\u00e9chec, et un cadre de d\u00e9l\u00e9gation \u00e0 trois paliers qui associe chaque type de travail \u00e0 la supervision qu&rsquo;il exige r\u00e9ellement. Un dirigeant ach\u00e8te de la fiabilit\u00e9, pas des d\u00e9monstrations ; un \u00e9tudiant refait la v\u00e9rification quand le mod\u00e8le suivant arrive.<\/p>\n<p>Quelque chose a r\u00e9ellement chang\u00e9 ces deux derni\u00e8res ann\u00e9es. Un syst\u00e8me d&rsquo;IA peut d\u00e9sormais regarder votre \u00e9cran, trouver le bouton, cliquer, saisir dans le champ, passer d&rsquo;une application \u00e0 l&rsquo;autre et poursuivre. Non pas via une int\u00e9gration sur mesure construite par votre service informatique, mais exactement comme vous le faites, en regardant et en agissant. C&rsquo;est la capacit\u00e9 que l&rsquo;on imagine depuis le premier agent conversationnel, car c&rsquo;est celle qui touche enfin \u00e0 la forme r\u00e9elle du travail de bureau, lequel n&rsquo;est pas une conversation mais une longue s\u00e9rie de petites manipulations r\u00e9parties sur une demi-douzaine d&rsquo;applications qui ne se parlent jamais correctement.<\/p>\n<p>Les vid\u00e9os de d\u00e9monstration sont convaincantes et, ce qui compte, elles ne sont pas truqu\u00e9es. Le probl\u00e8me est qu&rsquo;une d\u00e9monstration est un \u00e9chantillon de taille un tir\u00e9 d&rsquo;une distribution que personne ne vous montre. La question utile n&rsquo;est pas de savoir si un agent peut r\u00e9server un vol ou rapprocher un tableur, car la r\u00e9ponse est oui, parfois. La question utile est : \u00e0 quelle fr\u00e9quence, sur quel type de t\u00e2che, et que se passe-t-il le reste du temps. Cette question a maintenant de vraies r\u00e9ponses, publi\u00e9es dans des travaux de r\u00e9f\u00e9rencement \u00e9valu\u00e9s par les pairs ou en pr\u00e9publication, et ces r\u00e9ponses sont bien plus exploitables que l&rsquo;enthousiasme comme que le rejet.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_84 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Table of Contents<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Le-referentiel-qui-a-defini-le-domaine-et-celui-qui-la-redefini\" >Le r\u00e9f\u00e9rentiel qui a d\u00e9fini le domaine, et celui qui l&rsquo;a red\u00e9fini<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Bien-lire-le-tableau-des-resultats\" >Bien lire le tableau des r\u00e9sultats<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Ce-que-coute-reellement-le-manque-de-fiabilite\" >Ce que co\u00fbte r\u00e9ellement le manque de fiabilit\u00e9<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Pourquoi-les-taches-longues-echouent-la-taxonomie-publiee\" >Pourquoi les t\u00e2ches longues \u00e9chouent : la taxonomie publi\u00e9e<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Le-cadre-des-paliers-de-delegation\" >Le cadre des paliers de d\u00e9l\u00e9gation<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#La-regle-dirreversibilite\" >La r\u00e8gle d&rsquo;irr\u00e9versibilit\u00e9<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Comment-evaluer-vous-meme-le-prochain-modele\" >Comment \u00e9valuer vous-m\u00eame le prochain mod\u00e8le<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Le-dirigeant-et-letudiant\" >Le dirigeant et l&rsquo;\u00e9tudiant<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Questions-frequentes\" >Questions fr\u00e9quentes<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/ceotudent.com\/fr\/navigateurs-agentiques-ia-pilotant-ordinateur-taches-bureau-2026\/#Sources\" >Sources<\/a><\/li><\/ul><\/nav><\/div>\n<h2 id=\"le-rfrentiel-qui-a-dfini-le-domaine-et-celui-qui-la-redfini\"><span class=\"ez-toc-section\" id=\"Le-referentiel-qui-a-defini-le-domaine-et-celui-qui-la-redefini\"><\/span>Le r\u00e9f\u00e9rentiel qui a d\u00e9fini le domaine, et celui qui l&rsquo;a red\u00e9fini<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>OSWorld, pr\u00e9sent\u00e9 \u00e0 NeurIPS 2024, fut la premi\u00e8re tentative s\u00e9rieuse de mesurer cela correctement. Il place un agent dans un vrai syst\u00e8me d&rsquo;exploitation avec de vraies applications et lui confie 369 t\u00e2ches issues d&rsquo;un usage r\u00e9el de l&rsquo;ordinateur : gestion de fichiers, navigation web, \u00e9dition de documents et flux traversant plusieurs applications. Chaque t\u00e2che dispose d&rsquo;une v\u00e9rification script\u00e9e fond\u00e9e sur l&rsquo;ex\u00e9cution : la r\u00e9ussite signifie donc que le fichier s&rsquo;est r\u00e9ellement retrouv\u00e9 dans le bon \u00e9tat, non qu&rsquo;un mod\u00e8le \u00e9valuateur a appr\u00e9ci\u00e9 la transcription.<\/p>\n<p>Deux chiffres de ce travail initial ancrent encore tout. Les humains accomplissent 72,36 pour cent des t\u00e2ches, ce qui m\u00e9rite qu&rsquo;on s&rsquo;y arr\u00eate, car cela signifie qu&rsquo;il ne s&rsquo;agit pas de courses triviales, m\u00eame pour une personne. Et le meilleur mod\u00e8le au lancement, en avril 2024, en accomplissait 12,24 pour cent. Les auteurs attribuaient l&rsquo;\u00e9cart principalement \u00e0 l&rsquo;ancrage sur l&rsquo;interface, c&rsquo;est-\u00e0-dire savoir o\u00f9 se trouve r\u00e9ellement l&rsquo;\u00e9l\u00e9ment \u00e0 l&rsquo;\u00e9cran, et \u00e0 la connaissance op\u00e9ratoire, c&rsquo;est-\u00e0-dire conna\u00eetre la mani\u00e8re conventionnelle dont une application attend d&rsquo;\u00eatre pilot\u00e9e.<\/p>\n<p>Cet \u00e9cart s&rsquo;est combl\u00e9 vite. En deux ans environ, les scores rapport\u00e9s sur OSWorld ont d\u00e9pass\u00e9 le seuil humain, et \u00e0 la mi-2026 les principaux syst\u00e8mes annoncent des chiffres dans les quatre-vingts. Lu isol\u00e9ment, c&rsquo;est un r\u00e9cit de probl\u00e8me r\u00e9solu et livr\u00e9, et une large part des commentaires de 2026 l&rsquo;a lu exactement ainsi.<\/p>\n<p>Puis, en juin 2026, la m\u00eame \u00e9quipe de recherche a publi\u00e9 OSWorld 2.0, et le tableau a chang\u00e9. Le nouveau r\u00e9f\u00e9rentiel contient 108 flux, chacun \u00e9tant un travail r\u00e9aliste de bout en bout plut\u00f4t qu&rsquo;une course isol\u00e9e. La contrainte de conception est la partie int\u00e9ressante : chaque t\u00e2che demande \u00e0 un utilisateur une m\u00e9diane d&rsquo;environ 1,6 heure. L\u00e0 o\u00f9 une t\u00e2che du r\u00e9f\u00e9rentiel initial exigeait de l&rsquo;agent une trentaine d&rsquo;appels d&rsquo;outils, celles du nouveau en r\u00e9clament en moyenne 318,4 pour un mod\u00e8le de pointe fonctionnant \u00e0 effort de raisonnement maximal. Ce n&rsquo;est pas une version plus difficile du m\u00eame test. C&rsquo;est un autre r\u00e9gime, bien plus proche de ce \u00e0 quoi ressemble un vrai poste.<\/p>\n<p>Sur ce r\u00e9f\u00e9rentiel, avec un budget de 500 \u00e9tapes, le meilleur agent de pointe ach\u00e8ve 20,6 pour cent des t\u00e2ches.<\/p>\n<h2 id=\"bien-lire-le-tableau-des-rsultats\"><span class=\"ez-toc-section\" id=\"Bien-lire-le-tableau-des-resultats\"><\/span>Bien lire le tableau des r\u00e9sultats<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le tableau suivant pr\u00e9sente les r\u00e9sultats publi\u00e9s d&rsquo;OSWorld 2.0 avec un budget de 500 \u00e9tapes et un effort de raisonnement maximal, tels que document\u00e9s par les auteurs du r\u00e9f\u00e9rentiel. L&rsquo;ach\u00e8vement binaire signifie que le flux entier s&rsquo;est termin\u00e9 correctement. Le score partiel cr\u00e9dite les progr\u00e8s accomplis en chemin. Le co\u00fbt correspond \u00e0 la d\u00e9pense approximative rapport\u00e9e par tentative.<\/p>\n<table>\n<thead>\n<tr>\n<th>Syst\u00e8me (tel que rapport\u00e9)<\/th>\n<th>Ach\u00e8vement binaire<\/th>\n<th>Score partiel<\/th>\n<th>Co\u00fbt approximatif par tentative<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Claude Opus 4.8 (par lots)<\/td>\n<td>20,6 %<\/td>\n<td>54,8 %<\/td>\n<td>72,4 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Opus 4.8 (individuel)<\/td>\n<td>18,5 %<\/td>\n<td>49,3 %<\/td>\n<td>76,1 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Opus 4.7 (par lots)<\/td>\n<td>18,2 %<\/td>\n<td>48,9 %<\/td>\n<td>33,6 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Opus 4.7 (individuel)<\/td>\n<td>13,9 %<\/td>\n<td>49,1 %<\/td>\n<td>35,8 $<\/td>\n<\/tr>\n<tr>\n<td>GPT-5.5 (par lots)<\/td>\n<td>13,0 %<\/td>\n<td>49,5 %<\/td>\n<td>25,5 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Sonnet 4.6<\/td>\n<td>8,3 %<\/td>\n<td>41,5 %<\/td>\n<td>22,3 $<\/td>\n<\/tr>\n<tr>\n<td>MiniMax M3<\/td>\n<td>4,6 %<\/td>\n<td>22,3 %<\/td>\n<td>2,4 $<\/td>\n<\/tr>\n<tr>\n<td>Kimi 2.6<\/td>\n<td>4,6 %<\/td>\n<td>22,1 %<\/td>\n<td>6,6 $<\/td>\n<\/tr>\n<tr>\n<td>Qwen 3.7-Plus<\/td>\n<td>2,8 %<\/td>\n<td>21,5 %<\/td>\n<td>3,8 $<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Deux caract\u00e9ristiques de ce tableau comptent davantage que le classement.<\/p>\n<p>La premi\u00e8re est la distance entre la colonne binaire et la colonne partielle. Le syst\u00e8me de t\u00eate ach\u00e8ve compl\u00e8tement une t\u00e2che sur cinq, mais obtient 54,8 pour cent de progression partielle. Les agents n&rsquo;\u00e9chouent pas sur la ligne de d\u00e9part. Ils avancent consid\u00e9rablement dans les flux longs, puis ne parviennent pas \u00e0 conclure. Pour un responsable qui d\u00e9cide quoi d\u00e9l\u00e9guer, c&rsquo;est toute l&rsquo;histoire : sur une t\u00e2che longue, la production d&rsquo;un agent pilotant l&rsquo;ordinateur est g\u00e9n\u00e9ralement un travail \u00e0 moiti\u00e9 fait, non un refus. Un travail \u00e0 moiti\u00e9 fait qui a l&rsquo;air termin\u00e9 est le type de production le plus co\u00fbteux qui soit, car quelqu&rsquo;un doit l&rsquo;auditer avant de pouvoir s&rsquo;y fier, et auditer un flux que l&rsquo;on n&rsquo;a pas ex\u00e9cut\u00e9 soi-m\u00eame est souvent plus lent que de l&rsquo;ex\u00e9cuter.<\/p>\n<p>La seconde est la falaise de r\u00e9f\u00e9rentiel. Les auteurs notent que la m\u00eame configuration de Claude Opus 4.8 qui n&rsquo;atteint que 20,6 pour cent d&rsquo;ach\u00e8vement binaire sur le r\u00e9f\u00e9rentiel long obtient 83,5 pour cent sur l&rsquo;OSWorld initial. Un syst\u00e8me, un instant donn\u00e9, deux chiffres dans un rapport de quatre. Toute affirmation sur la fiabilit\u00e9 des agents qui ne pr\u00e9cise pas la longueur des t\u00e2ches est presque d\u00e9pourvue de sens.<\/p>\n<h2 id=\"ce-que-coute-rellement-le-manque-de-fiabilit\"><span class=\"ez-toc-section\" id=\"Ce-que-coute-reellement-le-manque-de-fiabilite\"><\/span>Ce que co\u00fbte r\u00e9ellement le manque de fiabilit\u00e9<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Le tableau publi\u00e9 donne le co\u00fbt par tentative, mais ce n&rsquo;est pas le chiffre qui int\u00e9resse une entreprise. Ce que vous voulez conna\u00eetre, c&rsquo;est le co\u00fbt par t\u00e2che achev\u00e9e, c&rsquo;est-\u00e0-dire la d\u00e9pense divis\u00e9e par la probabilit\u00e9 que la tentative aboutisse r\u00e9ellement. Le tableau suivant, un cadre \u00e9ditorial CEOtudent appliqu\u00e9 aux chiffres publi\u00e9s ci-dessus, en fait la d\u00e9duction.<\/p>\n<table>\n<thead>\n<tr>\n<th>Syst\u00e8me (tel que rapport\u00e9)<\/th>\n<th>Ach\u00e8vement binaire<\/th>\n<th>Co\u00fbt par tentative<\/th>\n<th>Co\u00fbt d\u00e9duit par t\u00e2che achev\u00e9e<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>MiniMax M3<\/td>\n<td>4,6 %<\/td>\n<td>2,4 $<\/td>\n<td>~52 $<\/td>\n<\/tr>\n<tr>\n<td>Qwen 3.7-Plus<\/td>\n<td>2,8 %<\/td>\n<td>3,8 $<\/td>\n<td>~136 $<\/td>\n<\/tr>\n<tr>\n<td>Kimi 2.6<\/td>\n<td>4,6 %<\/td>\n<td>6,6 $<\/td>\n<td>~143 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Opus 4.7 (par lots)<\/td>\n<td>18,2 %<\/td>\n<td>33,6 $<\/td>\n<td>~185 $<\/td>\n<\/tr>\n<tr>\n<td>GPT-5.5 (par lots)<\/td>\n<td>13,0 %<\/td>\n<td>25,5 $<\/td>\n<td>~196 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Opus 4.7 (individuel)<\/td>\n<td>13,9 %<\/td>\n<td>35,8 $<\/td>\n<td>~258 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Sonnet 4.6<\/td>\n<td>8,3 %<\/td>\n<td>22,3 $<\/td>\n<td>~269 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Opus 4.8 (par lots)<\/td>\n<td>20,6 %<\/td>\n<td>72,4 $<\/td>\n<td>~352 $<\/td>\n<\/tr>\n<tr>\n<td>Claude Opus 4.8 (individuel)<\/td>\n<td>18,5 %<\/td>\n<td>76,1 $<\/td>\n<td>~411 $<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Lisez ceci comme une illustration de ce que co\u00fbte le manque de fiabilit\u00e9, non comme un devis. Le calcul suppose que les tentatives sont ind\u00e9pendantes et qu&rsquo;une tentative rat\u00e9e ne vaut rien, et ni l&rsquo;un ni l&rsquo;autre n&rsquo;est strictement vrai : une ex\u00e9cution rat\u00e9e laisse souvent un travail partiel utilisable, et une t\u00e2che que l&rsquo;agent rate une fois, il la ratera souvent de nouveau pour la m\u00eame raison structurelle plut\u00f4t que de r\u00e9ussir au tirage suivant. Consid\u00e9rez ces chiffres comme une borne sup\u00e9rieure du co\u00fbt na\u00eff d&rsquo;une reprise en force brute.<\/p>\n<p>M\u00eame comme borne sup\u00e9rieure, la forme est instructive. Le syst\u00e8me le moins cher par t\u00e2che achev\u00e9e est aussi celui qui n&rsquo;ach\u00e8ve presque rien : un faible co\u00fbt par r\u00e9ussite n&rsquo;est donc pas un signal d&rsquo;achat quand le taux de base est de 4,6 pour cent ; il vous faudrait attendre vingt et une tentatives. Et le syst\u00e8me le plus performant est de loin le plus cher par r\u00e9ussite, car vous payez le tarif de pointe sur chaque tentative rat\u00e9e aussi.<\/p>\n<p>Placez maintenant un humain \u00e0 c\u00f4t\u00e9. Le r\u00e9f\u00e9rentiel nous apprend que ces flux demandent \u00e0 une personne une m\u00e9diane de 1,6 heure. Avec un co\u00fbt complet de travailleur du savoir situ\u00e9 entre 30 et 80 dollars de l&rsquo;heure, fourchette qui varie \u00e9norm\u00e9ment selon le poste et le march\u00e9 et que nous donnons \u00e0 titre purement indicatif, l&rsquo;humain fait le travail pour environ 48 \u00e0 128 dollars, avec un taux d&rsquo;ach\u00e8vement proche de la certitude et le discernement n\u00e9cessaire pour signaler que la t\u00e2che elle-m\u00eame \u00e9tait mal sp\u00e9cifi\u00e9e. Le calcul brut d&rsquo;une tentative de l&rsquo;agent est comp\u00e9titif face \u00e0 cela. Son co\u00fbt par flux long r\u00e9ellement achev\u00e9 ne l&rsquo;est pas encore.<\/p>\n<p>Ce n&rsquo;est pas un argument contre la technologie. C&rsquo;est un argument sur les t\u00e2ches vers lesquelles la diriger, ce qui est une conclusion diff\u00e9rente et bien plus utile.<\/p>\n<h2 id=\"pourquoi-les-taches-longues-chouent-la-taxonomie-publie\"><span class=\"ez-toc-section\" id=\"Pourquoi-les-taches-longues-echouent-la-taxonomie-publiee\"><\/span>Pourquoi les t\u00e2ches longues \u00e9chouent : la taxonomie publi\u00e9e<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les auteurs d&rsquo;OSWorld 2.0 ont accompli le travail r\u00e9ellement pr\u00e9cieux consistant \u00e0 cat\u00e9goriser la mani\u00e8re dont les agents \u00e9chouent plut\u00f4t qu&rsquo;\u00e0 seulement compter qu&rsquo;ils \u00e9chouent. Six sch\u00e9mas reviennent :<\/p>\n<p><strong>Suivi de l&rsquo;information.<\/strong> Les agents manquent des informations pr\u00e9sentes dans la consigne, visibles dans l&rsquo;environnement ou fournies par le canal utilisateur.<\/p>\n<p><strong>Sensibilit\u00e9 au temps.<\/strong> Sur les \u00e9tapes sensibles au temps, les longs intervalles entre l&rsquo;observation et l&rsquo;action font que celle-ci s&rsquo;applique \u00e0 un \u00e9tat d&rsquo;interface d\u00e9j\u00e0 modifi\u00e9.<\/p>\n<p><strong>Artefacts m\u00e9tier.<\/strong> Les agents peinent \u00e0 interpr\u00e9ter et \u00e0 produire correctement les formats de fichiers et conventions propres \u00e0 un domaine.<\/p>\n<p><strong>Lacunes de v\u00e9rification.<\/strong> Les agents omettent fr\u00e9quemment de contr\u00f4ler des propri\u00e9t\u00e9s critiques avant de soumettre et, fait frappant, ne corrigent pas des erreurs qu&rsquo;ils avaient d\u00e9j\u00e0 remarqu\u00e9es.<\/p>\n<p><strong>D\u00e9rive d&rsquo;\u00e9tat.<\/strong> L&rsquo;information recueillie t\u00f4t est oubli\u00e9e quand l&rsquo;\u00e9tat de la t\u00e2che n&rsquo;existe que dans un contexte de raisonnement compress\u00e9 plut\u00f4t que dans l&rsquo;environnement.<\/p>\n<p><strong>\u00c9tat cach\u00e9.<\/strong> Tous les syst\u00e8mes test\u00e9s obtiennent leurs plus faibles scores l\u00e0 o\u00f9 la r\u00e9ussite exige d&rsquo;inf\u00e9rer ce qui n&rsquo;a jamais \u00e9t\u00e9 \u00e9nonc\u00e9 : exigences implicites, suivi simultan\u00e9 de plusieurs \u00e9l\u00e9ments, r\u00e9solution de consignes contradictoires et adaptation \u00e0 des environnements qui changent sous eux.<\/p>\n<p>Sous ces six sch\u00e9mas se trouve un constat qui m\u00e9rite d&rsquo;\u00eatre le titre. Les auteurs rapportent que chaque mod\u00e8le ne consacre presque rien de son budget \u00e0 d\u00e9tecter et corriger ses propres erreurs, la r\u00e9cup\u00e9ration et la r\u00e9paration repr\u00e9sentant ensemble moins de 7 pour cent de l&rsquo;effort sur l&rsquo;ensemble des syst\u00e8mes.<\/p>\n<p>Voil\u00e0 le m\u00e9canisme. Ces syst\u00e8mes ne sont pas faibles pour faire des choses. Ils sont faibles pour remarquer que ce qu&rsquo;ils viennent de faire \u00e9tait faux. Un humain comp\u00e9tent r\u00e9alisant un flux de 1,6 heure consacre une part appr\u00e9ciable de ce temps \u00e0 contr\u00f4ler son propre travail et rev\u00e9rifie par r\u00e9flexe apr\u00e8s toute surprise. Un agent qui consacre moins de 7 pour cent de son budget \u00e0 l&rsquo;autocorrection portera une petite erreur initiale jusqu&rsquo;au bout et vous remettra un r\u00e9sultat achev\u00e9 avec assurance et faux. C&rsquo;est pr\u00e9cis\u00e9ment le profil d&rsquo;\u00e9chec que d\u00e9crit <a href=\"https:\/\/ceotudent.com\/en\/the-delegation-ceiling-why-professionals-fail-to-scale-ai-agents\">le plafond de d\u00e9l\u00e9gation<\/a> : la contrainte n&rsquo;est pas la capacit\u00e9, c&rsquo;est la charge de v\u00e9rification que cette capacit\u00e9 vous renvoie.<\/p>\n<h2 id=\"le-cadre-des-paliers-de-dlgation\"><span class=\"ez-toc-section\" id=\"Le-cadre-des-paliers-de-delegation\"><\/span>Le cadre des paliers de d\u00e9l\u00e9gation<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>En rassemblant les \u00e9l\u00e9ments, une r\u00e8gle pratique \u00e9merge. La fiabilit\u00e9 est fonction de la longueur de la t\u00e2che, du nombre d&rsquo;applications et du fait que le r\u00e9sultat soit v\u00e9rifiable en moins de temps qu&rsquo;il n&rsquo;en a fallu pour le produire. Le cadre \u00e0 trois paliers ci-dessous, un cadre \u00e9ditorial CEOtudent construit sur les sch\u00e9mas d&rsquo;\u00e9chec pr\u00e9c\u00e9dents, associe le travail de bureau \u00e0 la supervision qu&rsquo;il exige r\u00e9ellement.<\/p>\n<table>\n<thead>\n<tr>\n<th>Palier<\/th>\n<th>Profil de t\u00e2che<\/th>\n<th>Base factuelle<\/th>\n<th>Mode d&rsquo;ex\u00e9cution<\/th>\n<th>Position r\u00e9aliste en 2026<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td><strong>Palier 1 : d\u00e9l\u00e9guer<\/strong><\/td>\n<td>Court, une seule application, un \u00e9tat final clair, r\u00e9sultat v\u00e9rifiable d&rsquo;un coup d&rsquo;oeil (renommer et classer un lot, extraire des champs d&rsquo;un formulaire, remettre en forme un document, tirer un rapport d\u00e9fini)<\/td>\n<td>La performance sur t\u00e2ches courtes d\u00e9passe d\u00e9sormais le seuil humain de 72,36 %<\/td>\n<td>Lancer et v\u00e9rifier par sondage. \u00c9chantillonner le r\u00e9sultat plut\u00f4t qu&rsquo;auditer chaque \u00e9l\u00e9ment<\/td>\n<td>Gains de temps r\u00e9els disponibles d\u00e8s aujourd&rsquo;hui<\/td>\n<\/tr>\n<tr>\n<td><strong>Palier 2 : superviser<\/strong><\/td>\n<td>Plusieurs \u00e9tapes, deux ou trois applications, 15 \u00e0 45 minutes de travail humain, r\u00e9versible en cas d&rsquo;erreur (synth\u00e8se concurrentielle \u00e0 partir de sources nomm\u00e9es, pr\u00e9sentation r\u00e9currente, rapprochement de deux listes)<\/td>\n<td>Des scores partiels proches de 50 % signifient une progression substantielle, un faible ach\u00e8vement binaire signifie une mauvaise conclusion<\/td>\n<td>L&rsquo;agent produit le brouillon, vous v\u00e9rifiez \u00e0 des points de contr\u00f4le nomm\u00e9s. Ne jamais accepter l&rsquo;\u00e9tat final sans le lire<\/td>\n<td>Le point d&rsquo;\u00e9quilibre r\u00e9aliste ; vous achetez un premier jet, pas un r\u00e9sultat<\/td>\n<\/tr>\n<tr>\n<td><strong>Palier 3 : ne pas d\u00e9l\u00e9guer encore<\/strong><\/td>\n<td>Longue haleine, quatre applications ou plus, plus d&rsquo;une heure, ou toute action irr\u00e9versible (envoyer, payer, publier, supprimer, soumettre)<\/td>\n<td>20,6 % d&rsquo;ach\u00e8vement binaire sur des flux de 1,6 heure ; moins de 7 % du budget consacr\u00e9 \u00e0 l&rsquo;autocorrection<\/td>\n<td>D\u00e9composer en unit\u00e9s de paliers 1 et 2 avec des points de contr\u00f4le humains, ou faire soi-m\u00eame<\/td>\n<td>L&rsquo;ex\u00e9cution sans supervision n&rsquo;est pas \u00e9tay\u00e9e par les donn\u00e9es<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Le mouvement de d\u00e9composition du palier 3 est celui qui paie. Un flux qui \u00e9choue en tant qu&rsquo;instruction unique de 318 appels r\u00e9ussit souvent en cinq segments supervis\u00e9s, parce que vous ins\u00e9rez la v\u00e9rification que l&rsquo;agent n&rsquo;effectue pas pour lui-m\u00eame. Vous contournez moins une limite que vous ne fournissez le composant manquant.<\/p>\n<h2 id=\"la-rgle-dirrversibilit\"><span class=\"ez-toc-section\" id=\"La-regle-dirreversibilite\"><\/span>La r\u00e8gle d&rsquo;irr\u00e9versibilit\u00e9<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Une ligne traverse les trois paliers et m\u00e9rite d&rsquo;\u00eatre \u00e9nonc\u00e9e \u00e0 part, car c&rsquo;est la r\u00e8gle qui \u00e9vite le type co\u00fbteux d&rsquo;erreur.<\/p>\n<p>N&rsquo;accordez jamais d&rsquo;autorit\u00e9 sans supervision sur une action qui ne peut \u00eatre annul\u00e9e. Envoyer un courriel, soumettre un formulaire, effectuer un paiement, publier une publication, supprimer un enregistrement, accepter des conditions. Les donn\u00e9es de r\u00e9f\u00e9rencement fournissent une justification remarquablement nette : un syst\u00e8me qui consacre moins de 7 pour cent de son effort \u00e0 l&rsquo;autocorrection et obtient 20,6 pour cent sur les flux longs arrivera, dans la plupart des tentatives, \u00e0 l&rsquo;\u00e9tape irr\u00e9versible dans un \u00e9tat qu&rsquo;il n&rsquo;a pas v\u00e9rifi\u00e9. Le mode d&rsquo;\u00e9chec n&rsquo;est pas qu&rsquo;il refuse. C&rsquo;est qu&rsquo;il poursuit avec assurance.<\/p>\n<p>L&rsquo;asym\u00e9trie des co\u00fbts ach\u00e8ve l&rsquo;argument. Une erreur r\u00e9versible vous co\u00fbte le temps de la refaire. Une erreur irr\u00e9versible co\u00fbte ce qu&rsquo;elle co\u00fbte, et vous l&rsquo;apprenez apr\u00e8s coup. Exiger une confirmation humaine exactement aux \u00e9tapes irr\u00e9versibles prend quelques secondes et supprime toute la queue de distribution. C&rsquo;est de la gestion des risques op\u00e9rationnels ordinaire, et elle s&rsquo;applique ici sans changement.<\/p>\n<h2 id=\"comment-valuer-vous-mme-le-prochain-modle\"><span class=\"ez-toc-section\" id=\"Comment-evaluer-vous-meme-le-prochain-modele\"><\/span>Comment \u00e9valuer vous-m\u00eame le prochain mod\u00e8le<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Les chiffres pr\u00e9cis de cet article vieilliront, et ce n&rsquo;est pas grave, car la m\u00e9thode, elle, ne vieillira pas. Quand le prochain agent sortira avec un score impressionnant, quatre questions s\u00e9parent une vraie affirmation de capacit\u00e9 d&rsquo;une d\u00e9monstration.<\/p>\n<p><strong>Quel r\u00e9f\u00e9rentiel, et quelle longueur de t\u00e2ches ?<\/strong> Un score sur des t\u00e2ches courtes en application unique ne dit rien du travail multi-applications d&rsquo;une heure. Demandez explicitement le chiffre sur flux longs. L&rsquo;\u00e9cart d&rsquo;un facteur quatre entre les deux g\u00e9n\u00e9rations d&rsquo;OSWorld en est la raison.<\/p>\n<p><strong>Ach\u00e8vement binaire ou cr\u00e9dit partiel ?<\/strong> Des scores partiels proches de 50 pour cent aux c\u00f4t\u00e9s de scores binaires proches de 20 pour cent d\u00e9crivent un syst\u00e8me qui parcourt presque tout le chemin sans conclure. Ce sont des produits diff\u00e9rents. Exigez le chiffre binaire.<\/p>\n<p><strong>Quel budget d&rsquo;\u00e9tapes et de co\u00fbt ?<\/strong> Des r\u00e9sultats obtenus \u00e0 500 \u00e9tapes et effort de raisonnement maximal ne correspondent pas \u00e0 la configuration que vous obtenez par d\u00e9faut, et le co\u00fbt par tentative \u00e0 ce r\u00e9glage peut \u00eatre substantiel.<\/p>\n<p><strong>Quel est le taux d&rsquo;autocorrection ?<\/strong> C&rsquo;est l&rsquo;indicateur avanc\u00e9. Quand l&rsquo;effort publi\u00e9 de r\u00e9cup\u00e9ration et de r\u00e9paration d\u00e9passera nettement la fourchette actuelle inf\u00e9rieure \u00e0 7 pour cent, le tableau de la fiabilit\u00e9 changera sensiblement et le palier 3 commencera \u00e0 s&rsquo;ouvrir. D&rsquo;ici l\u00e0, consid\u00e9rez l&rsquo;ex\u00e9cution autonome de longue haleine comme non \u00e9tay\u00e9e, quel que soit le score affich\u00e9.<\/p>\n<p>C&rsquo;est la m\u00eame discipline d&rsquo;\u00e9valuation que pour <a href=\"https:\/\/ceotudent.com\/en\/which-ai-model-for-which-task-routing-guide-2026\">le choix d&rsquo;un mod\u00e8le selon la t\u00e2che<\/a> : lisez le r\u00e9f\u00e9rentiel qui correspond \u00e0 votre travail r\u00e9el, pas celui qui flatte le lancement.<\/p>\n<h2 id=\"le-dirigeant-et-ltudiant\"><span class=\"ez-toc-section\" id=\"Le-dirigeant-et-letudiant\"><\/span>Le dirigeant et l&rsquo;\u00e9tudiant<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Un dirigeant n&rsquo;ach\u00e8te pas une capacit\u00e9 parce qu&rsquo;une d\u00e9monstration \u00e9tait impressionnante. Il demande ce qu&rsquo;elle livre de fa\u00e7on fiable, \u00e0 quel co\u00fbt, avec quel mode d&rsquo;\u00e9chec, et ce que cet \u00e9chec co\u00fbte quand il survient. Selon ce crit\u00e8re, les agents pilotant l&rsquo;ordinateur sont en 2026 un achat \u00e9vident pour les t\u00e2ches courtes et d\u00e9limit\u00e9es, un achat solide pour la r\u00e9daction supervis\u00e9e de flux moyens, et une abstention claire pour l&rsquo;ex\u00e9cution autonome de longue haleine. Ce n&rsquo;est pas une \u00e9chappatoire. Ce sont trois d\u00e9cisions distinctes, et les donn\u00e9es \u00e9tayent chacune s\u00e9par\u00e9ment.<\/p>\n<p>La part de l&rsquo;\u00e9tudiant emp\u00eache cela de se figer. Ce domaine est pass\u00e9 de 12,24 pour cent \u00e0 plus que le seuil humain sur les t\u00e2ches courtes en environ deux ans. Le chiffre sur les flux longs bougera aussi. Celui qui a enterr\u00e9 les agents en 2024 apr\u00e8s une mauvaise d\u00e9monstration a tort aujourd&rsquo;hui, et celui qui d\u00e9clarerait aujourd&rsquo;hui la d\u00e9l\u00e9gation longue r\u00e9solue aura tort dans l&rsquo;autre sens. Ce qui survit aux deux erreurs, c&rsquo;est l&rsquo;habitude de revenir au r\u00e9f\u00e9rentiel, de poser les quatre questions ci-dessus et de ne faire monter une t\u00e2che d&rsquo;un palier que lorsque les donn\u00e9es l&rsquo;autorisent.<\/p>\n<p>\u00c9tablissez d\u00e8s maintenant la carte des paliers pour votre propre travail. La plupart des gens d\u00e9couvrent qu&rsquo;ils ont plus de t\u00e2ches de palier 1 qu&rsquo;ils ne le pensaient, et c&rsquo;est l\u00e0 que se trouve le rendement imm\u00e9diat, et que certains de leurs flux de palier 3 se d\u00e9composent proprement en segments supervis\u00e9s. Voil\u00e0 toute l&rsquo;opportunit\u00e9 de 2026 : non pas le bureau autonome, mais un bureau consid\u00e9rablement plus rapide, conduit par quelqu&rsquo;un qui sait exactement o\u00f9 regarder.<\/p>\n<h2 id=\"questions-frquentes\"><span class=\"ez-toc-section\" id=\"Questions-frequentes\"><\/span>Questions fr\u00e9quentes<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Les navigateurs agentiques diff\u00e8rent-ils des agents pilotant l&rsquo;ordinateur ?<\/strong><br \/>\nUn navigateur agentique op\u00e8re \u00e0 l&rsquo;int\u00e9rieur du navigateur : son monde se compose de pages web, d&rsquo;onglets et de formulaires. Un agent pilotant l&rsquo;ordinateur conduit tout le bureau, y compris les applications locales et le syst\u00e8me de fichiers. Les agents limit\u00e9s au navigateur sont g\u00e9n\u00e9ralement plus fiables dans leur domaine plus \u00e9troit, l&rsquo;environnement \u00e9tant plus uniforme, mais la plupart des vrais flux de bureau franchissent la fronti\u00e8re entre navigateur et bureau, et c&rsquo;est pr\u00e9cis\u00e9ment l\u00e0 qu&rsquo;apparaissent les modes d&rsquo;\u00e9chec multi-applications.<\/p>\n<p><strong>Si les agents d\u00e9passent le seuil humain sur OSWorld, pourquoi ne pas tout d\u00e9l\u00e9guer ?<\/strong><br \/>\nParce que ce seuil concerne des t\u00e2ches courtes, le plus souvent dans une seule application. Les 72,36 pour cent humains comme les scores d&rsquo;agents sup\u00e9rieurs proviennent du r\u00e9f\u00e9rentiel de 369 t\u00e2ches. Sur le r\u00e9f\u00e9rentiel de longue haleine, o\u00f9 les t\u00e2ches demandent \u00e0 un humain une m\u00e9diane de 1,6 heure, le meilleur agent en ach\u00e8ve 20,6 pour cent. La variable qui d\u00e9cide de la d\u00e9l\u00e9gation est la longueur de la t\u00e2che, non le score affich\u00e9.<\/p>\n<p><strong>L&rsquo;ach\u00e8vement partiel est-il utile ou sans valeur ?<\/strong><br \/>\nCela d\u00e9pend enti\u00e8rement de votre intention de v\u00e9rifier le travail. Si vous attendiez un r\u00e9sultat fini, l&rsquo;ach\u00e8vement partiel est pire que sans valeur, car il para\u00eet fini et vous transf\u00e8re discr\u00e8tement une t\u00e2che d&rsquo;audit. Si vous demandiez un premier jet et comptiez le relire, un score partiel proche de 50 pour cent repr\u00e9sente une valeur r\u00e9elle. C&rsquo;est pourquoi le palier 2 existe comme cat\u00e9gorie distincte.<\/p>\n<p><strong>Quel est le meilleur indicateur d&rsquo;une fiabilit\u00e9 en progr\u00e8s ?<\/strong><br \/>\nLa part de l&rsquo;effort qu&rsquo;un syst\u00e8me consacre \u00e0 d\u00e9tecter et corriger ses propres erreurs. Les chiffres publi\u00e9s situent actuellement r\u00e9cup\u00e9ration et r\u00e9paration sous 7 pour cent pour tous les syst\u00e8mes test\u00e9s. Comme la plupart des \u00e9checs sur flux longs remontent \u00e0 des erreurs initiales non corrig\u00e9es, la hausse de ce chiffre sera le signal que l&rsquo;ex\u00e9cution autonome devient viable.<\/p>\n<p><strong>Les petites \u00e9quipes doivent-elles attendre la maturit\u00e9 de la technologie ?<\/strong><br \/>\nNon. La d\u00e9l\u00e9gation de palier 1 fonctionne d\u00e8s maintenant et c&rsquo;est l\u00e0 que se situe le rendement imm\u00e9diat. Ce que les petites \u00e9quipes ne doivent pas faire, c&rsquo;est b\u00e2tir un processus qui d\u00e9pend d&rsquo;une ex\u00e9cution autonome de longue haleine, car les donn\u00e9es actuelles ne l&rsquo;\u00e9tayent pas, et un processus reposant sur une capacit\u00e9 qui n&rsquo;existe pas encore \u00e9choue silencieusement et co\u00fbteusement.<\/p>\n<h2 id=\"sources\"><span class=\"ez-toc-section\" id=\"Sources\"><\/span>Sources<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li>Xie et autres, OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments, NeurIPS 2024, section Jeux de donn\u00e9es et R\u00e9f\u00e9rentiels (arXiv:2404.07972)<\/li>\n<li>Yuan et autres, OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks, juin 2026 (arXiv:2606.29537)<\/li>\n<li>XLANG Lab, Universit\u00e9 de Hong Kong, documentation du r\u00e9f\u00e9rentiel OSWorld et m\u00e9thodologie des r\u00e9sultats v\u00e9rifi\u00e9s<\/li>\n<li>OCDE, Intelligence artificielle et avenir du travail, analyse des politiques sur l&rsquo;automatisation au niveau des t\u00e2ches et la compl\u00e9mentarit\u00e9<\/li>\n<li>Stanford Institute for Human-Centered Artificial Intelligence, AI Index Report, chapitres sur la performance technique et la saturation des r\u00e9f\u00e9rentiels<\/li>\n<\/ul>\n<hr>\n<p><em>Ce contenu a \u00e9t\u00e9 compil\u00e9 avec le soutien de l&rsquo;IA \u00e0 la suite d&rsquo;une recherche approfondie, puis r\u00e9dig\u00e9 et pr\u00e9par\u00e9 pour publication par l&rsquo;\u00e9quipe \u00e9ditoriale de CEOtudent.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Les agents capables de piloter un ordinateur savent d\u00e9sormais conduire un vrai bureau, et le marketing laisse entendre que vos t\u00e2ches administratives sont r\u00e9gl\u00e9es. Les r\u00e9f\u00e9rentiels publi\u00e9s disent quelque chose de plus pr\u00e9cis et de bien plus utile. Sur les t\u00e2ches courtes, dans une seule application, les meilleurs syst\u00e8mes ont d\u00e9pass\u00e9 le seuil humain ; sur les flux longs et multi-applications qui composent un vrai poste de bureau, le meilleur agent de pointe en termine 20,6 pour cent. Ce guide lit correctement les donn\u00e9es d&rsquo;OSWorld et d&rsquo;OSWorld 2.0, d\u00e9duit ce que l&rsquo;absence de fiabilit\u00e9 co\u00fbte r\u00e9ellement par t\u00e2che achev\u00e9e, et transforme la taxonomie des \u00e9checs publi\u00e9e en un syst\u00e8me de paliers de d\u00e9l\u00e9gation applicable d\u00e8s cette semaine. D\u00e9cidez comme un dirigeant qui ach\u00e8te de la fiabilit\u00e9 et non des d\u00e9monstrations, et restez un \u00e9tudiant qui relit le r\u00e9f\u00e9rentiel \u00e0 chaque nouveau mod\u00e8le.<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[5,18],"tags":[],"class_list":["post-325164","post","type-post","status-publish","format-standard","hentry","category-is","category-strateji"],"_links":{"self":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts\/325164","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/comments?post=325164"}],"version-history":[{"count":0,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/posts\/325164\/revisions"}],"wp:attachment":[{"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/media?parent=325164"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/categories?post=325164"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ceotudent.com\/fr\/wp-json\/wp\/v2\/tags?post=325164"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}