En bref. La fenêtre de contexte est la partie d’un modèle d’IA qui contient ce que vous lui fournissez dans une seule requête, et en 2026 elle est immense. Anthropic, OpenAI et Google proposent tous des modèles phares dotés d’environ un million de tokens de contexte, ce qui, selon le taux de conversion de Google lui-même (100 tokens correspondent à environ 60-80 mots anglais), représente à peu près 600 000 à 800 000 mots. La tentation est de tout coller et de laisser le modèle faire le tri. La recherche indique que c’est une erreur. Dans le benchmark RULER, 17 modèles annonçaient tous 32K tokens ou plus, mais seule la moitié maintenait des performances satisfaisantes à 32K (Hsieh et collaborateurs, 2024). Dans NoLiMa, un test qui supprime les correspondances littérales de mots-clés, 11 modèles sur 13 sont tombés sous la moitié de leur score en contexte court à 32K, et GPT-4o est passé de 99,3 à 69,7 % (Modarressi et collaborateurs, 2025). La documentation d’Anthropic qualifie désormais la fenêtre de contexte de « mémoire de travail » du modèle et avertit que la précision et le rappel se dégradent à mesure que le nombre de tokens augmente. Les humains subissent la même contrainte à plus petite échelle : la mémoire de travail retient environ quatre blocs d’information nouvelle (Cowan, 2001), et la théorie de la charge cognitive montre depuis 1988 que la manière de présenter l’information compte autant que sa quantité (Sweller, van Merrienboer et Paas, 2019). Le réflexe du CEO consiste à traiter le contexte comme un budget avec un coût par token. Le réflexe de l’étudiant consiste à écrire des prompts que vous pourriez vérifier vous-même, avec la méthode Load-Fit Prompt présentée ci-dessous.
Cet article fait partie de la série Prompt and Context Craft. Si vous n’avez pas encore rédigé une description permanente de votre métier pour vos outils d’IA, commencez par le fichier de contexte et la configuration des instructions personnalisées, des projets et de la mémoire. Ce texte porte sur la requête unique : ce qu’il faut y mettre, dans quel ordre et en quelle quantité.
Qu’est-ce qu’une fenêtre de contexte, en termes simples ?
Une fenêtre de contexte est la quantité maximale de texte, mesurée en tokens, qu’un modèle peut lire et écrire dans une seule requête. Tout y est décompté : vos instructions, les documents que vous collez, la conversation jusque-là et la réponse du modèle. Les tokens ne sont pas des mots. La documentation de Google donne la conversion dont la plupart des gens ont besoin : pour les modèles Gemini, « un token équivaut à environ 4 caractères » et « 100 tokens correspondent à environ 60-80 mots anglais ». Les tokenizers des autres fournisseurs diffèrent légèrement ; considérez donc toute conversion comme une estimation.
La documentation d’Anthropic décrit la fenêtre en termes humains. Elle indique que la fenêtre de contexte « représente une “mémoire de travail” pour le modèle », que « davantage de contexte n’est pas automatiquement mieux » et que « à mesure que le nombre de tokens augmente, la précision et le rappel se dégradent, un phénomène appelé context rot ». Il s’agit d’un cadrage de fournisseur, pas d’une expérience, mais c’est le bon point de départ : la fenêtre de contexte n’est pas un disque dur. Elle ressemble davantage à un bureau, et un bureau encombré ralentit tout le monde.
Quelle est la taille des fenêtres de contexte en 2026 ?
Le tableau ci-dessous recense les limites documentées des modèles phares actuels, relevées sur les pages de chaque fournisseur le 7 octobre 2026. Ces chiffres changent souvent ; consultez la page du fournisseur avant de vous y fier.
| Fournisseur | Modèle | Fenêtre de contexte | Sortie max. par requête | Source |
|---|---|---|---|---|
| Anthropic | Claude Fable 5.1, Opus 5.5, Sonnet 5.5 | 1M tokens | 128K tokens | Vue d’ensemble des modèles Anthropic |
| Anthropic | Claude Haiku 4.5 | 200K tokens | 64K tokens | Vue d’ensemble des modèles Anthropic |
| OpenAI | GPT-6 Astra, GPT-6.1 Sol, GPT-6 Luna | 1,05M tokens | 128K tokens | Page des modèles OpenAI |
| Gemini 3.1 Pro Preview | 1 048 576 tokens | 65 536 tokens | Page du modèle dans l’API Gemini | |
| Gemini 3.8 Flash | 1 048 576 tokens | 65 536 tokens | Page du modèle dans l’API Gemini |
Google donne un ordre de grandeur : en pratique, selon l’entreprise, un million de tokens correspondrait à « 50 000 lignes de code », « 8 romans anglais de longueur moyenne » ou « les transcriptions de plus de 200 épisodes de podcast de longueur moyenne ». En appliquant le ratio de Google lui-même, une fenêtre de 1 048 576 tokens correspond à environ 629 000 à 839 000 mots anglais (calcul CEOtudent : 1 048 576 tokens x 0,60 à 0,80 mot par token).
Le chiffre affiché répond à une seule question : combien pouvez-vous envoyer ? Il ne répond pas à celle qui compte pour votre travail : quelle part le modèle exploitera-t-il réellement bien ?
Une fenêtre plus grande signifie-t-elle que le modèle l’utilise entièrement ?
Non, et c’est le constat le plus constant de la recherche sur les contextes longs.
La position compte. Dans « Lost in the Middle », Liu et collaborateurs (2024) ont constaté que « les performances sont maximales lorsque l’information pertinente se trouve tout au début (biais de primauté) ou à la fin du contexte d’entrée (biais de récence), et qu’elles se dégradent nettement lorsque les modèles doivent accéder à une information située au milieu et l’utiliser ». Dans leur test de questions-réponses multi-documents, les performances de GPT-3.5-Turbo pouvaient « chuter de plus de 20 % », et dans le pire des cas elles étaient inférieures à ses performances sans aucun document (56,1 %). Il s’agissait de modèles de 2023 : les ordres de grandeur ne se transposent donc pas directement aux modèles de 2026. La forme du problème, un milieu fragile, n’a pourtant cessé de réapparaître.
La longueur annoncée n’est pas la longueur effective. RULER (Hsieh et collaborateurs, 2024) a testé 17 modèles à contexte long sur 13 épreuves. Presque tous obtenaient un score quasi parfait au test simple de « l’aiguille dans une botte de foin », mais « seule la moitié d’entre eux parvient à maintenir des performances satisfaisantes à une longueur de 32K ». NoLiMa (Modarressi et collaborateurs, 2025) a durci le test en supprimant le recouvrement littéral de mots entre la question et la réponse, ce qui se rapproche du fonctionnement des vraies questions. Sur 13 modèles annonçant au moins 128K tokens, « 11 modèles tombent sous 50 % de leurs solides scores de référence en contexte court » à 32K.
Le contexte non pertinent coûte en précision, même quand la réponse est présente. Le rapport « Context Rot » de Chroma (2025), un rapport industriel publié par une entreprise de bases de données de recherche et non évalué par les pairs, a évalué 18 modèles. Dans une expérience, il a comparé des prompts ciblés d’environ 300 tokens avec la version complète de 113k tokens de la même consigne conversationnelle, qui contenait du matériel non pertinent, et a observé « une dégradation constante des performances avec l’entrée complète ».
Les fournisseurs disent la même chose dans leurs propres guides. Le guide GPT-4.1 d’OpenAI fait état de très bonnes performances au test de l’aiguille dans une botte de foin jusqu’à 1M tokens, mais ajoute que « les performances en contexte long peuvent se dégrader lorsqu’il faut retrouver davantage d’éléments, ou mener un raisonnement complexe qui exige de connaître l’état de l’ensemble du contexte ». La documentation de Google sur le contexte long note qu’avec plusieurs « aiguilles », le modèle « n’atteint pas la même précision ».
Contexte annoncé ou contexte effectif : ce qu’ont trouvé les benchmarks
Les deux benchmarks définissent différemment la « longueur effective ». RULER retient la plus grande longueur à laquelle un modèle dépasse encore un seuil fixe (85,6 %, le score de Llama2-7B à 4K). NoLiMa retient la plus grande longueur à laquelle un modèle conserve au moins 85 % de son propre score en contexte court. La colonne du ratio est un calcul CEOtudent (effectif divisé par annoncé, en prenant K pour 1 000).
| Modèle (année du benchmark) | Contexte annoncé | Contexte effectif | Part effective de l’annoncé | Benchmark |
|---|---|---|---|---|
| GPT-4 (2024) | 128K | 64K | 50 % | RULER |
| GPT-4o (2025) | 128K | 8K | 6,3 % | NoLiMa |
| Claude 3.5 Sonnet (2025) | 200K | 4K | 2 % | NoLiMa |
| Gemini 1.5 Pro (2025) | 2M | 2K | 0,1 % | NoLiMa |
Synthèse originale du cadre éditorial CEOtudent à partir du tableau 3 de RULER et du tableau de résultats de NoLiMa. Il s’agit de modèles plus anciens, testés sur des épreuves de recherche volontairement difficiles ; les modèles actuels font probablement mieux, et aucun benchmark indépendant des modèles de 2026 ci-dessus n’était disponible au moment de la rédaction. Ce qui compte, c’est l’écart, pas le chiffre exact.
La leçon pour un travailleur du savoir est simple : la fenêtre de contexte est un plafond, pas une garantie. Si votre réponse dépend d’un élément enfoui à la page 140 d’un document collé, le modèle peut le manquer, et vous risquez de ne pas vous en apercevoir.
Que dit la science cognitive de la mémoire de travail humaine ?
Le versant humain du problème est plus ancien et mieux étudié.
L’empan est réduit. L’article de George Miller de 1956 observait que « cet empan compte environ sept éléments », mais soulignait aussi que l’empan se mesure en blocs, pas en bits bruts : « nous pouvons augmenter le nombre de bits d’information qu’il contient simplement en construisant des blocs de plus en plus grands ». La revue de Nelson Cowan de 2001 soutenait que le sept de Miller relevait « davantage d’une estimation approximative et d’un procédé rhétorique que d’une véritable limite de capacité », et proposait « une limite de capacité centrale unique, d’environ quatre blocs en moyenne ».
La charge se présente sous trois formes. La théorie de la charge cognitive, née des travaux de John Sweller sur la résolution de problèmes en 1988, distingue trois sources de charge. La revue de 2019 de Sweller, van Merrienboer et Paas les résume :
– La charge intrinsèque est la complexité réelle du travail demandé. Elle « ne peut être modifiée qu’en changeant ce qui doit être appris ou en changeant l’expertise de l’apprenant ».
– La charge extrinsèque est le coût d’une mauvaise présentation. Elle « n’est pas déterminée par la complexité intrinsèque de l’information, mais par la manière dont l’information est présentée et par ce que l’on demande à l’apprenant de faire ».
– La charge essentielle (germane) était à l’origine définie comme la charge « nécessaire pour apprendre ». La revue de 2019 la redéfinit comme la mémoire de travail consacrée au travail intrinsèque plutôt que comme une charge distincte.
Le familier coûte peu. La même revue note que la mémoire de travail « était limitée en capacité et en durée face à une information nouvelle, mais que ces limites disparaissaient de fait lorsque la mémoire de travail traitait une information transférée depuis la mémoire à long terme ». Les experts peuvent traiter des contenus longs et denses dans leur domaine, car ils les lisent comme quelques grands blocs.
L’information fragmentée et redondante pénalise. Chandler et Sweller (1991) ont constaté, au fil de six expériences, que « l’information à sources séparées peut générer une forte charge cognitive, car le matériel doit être intégré mentalement avant que l’apprentissage puisse commencer », et qu’un « matériel explicatif apparemment utile mais non essentiel » pouvait avoir des « effets délétères » même une fois intégré.
Ce qui aide les novices peut nuire aux experts. Kalyuga et collaborateurs (2003) ont nommé l’effet de renversement de l’expertise : des techniques « très efficaces auprès d’apprenants inexpérimentés peuvent perdre leur efficacité, voire avoir des conséquences négatives, lorsqu’elles sont utilisées auprès d’apprenants plus expérimentés ».
Où le modèle et l’humain se rejoignent-ils ?
Les deux littératures se sont construites séparément, mais elles décrivent le même problème de conception : un lecteur à l’attention limitée, beaucoup de texte disponible et un travail qui dépend de la capacité à trouver et combiner les bons passages. L’équipe d’ingénierie d’Anthropic a explicité la comparaison en septembre 2025 : « Comme les humains, dont la capacité de mémoire de travail est limitée, les LLM disposent d’un “budget d’attention” », et « chaque nouveau token introduit entame ce budget dans une certaine mesure ». Les auteurs du benchmark IFScale emploient le même vocabulaire lorsqu’ils décrivent des modèles qui « commencent à peiner sous la charge cognitive » à mesure que le nombre d’instructions augmente. Ce sont des analogies, pas la preuve que modèles et cerveaux fonctionnent de la même façon. Elles sont utiles parce que les conseils de conception des deux camps convergent.
| Problème de conception | Données sur l’humain | Données sur le modèle | Ce que cela implique pour votre prompt |
|---|---|---|---|
| Trop d’éléments à la fois | Environ quatre blocs d’information nouvelle (Cowan, 2001) | La moitié des 17 modèles se dégradent dès 32K (RULER) | Envoyez le plus petit ensemble de matériel qui répond à la question |
| Effets de position | Non couverts par les sources examinées ici | Meilleurs au début ou à la fin, milieu fragile (Liu et collaborateurs, 2024) | Placez le matériel en premier et la question en dernier, ou répétez les instructions clés |
| Matériel non pertinent | Une explication non essentielle peut nuire (Chandler et Sweller, 1991) | L’entrée complète de 113k tokens fait moins bien qu’une version ciblée de 300 tokens (Chroma, 2025) | Supprimez ce que vous sauteriez vous-même |
| Instructions contradictoires | Les sources séparées doivent être intégrées avant de commencer le travail | GPT-5 « dépense des tokens de raisonnement à chercher un moyen de concilier les contradictions » (OpenAI) | Résolvez les contradictions avant l’envoi |
| Trop de règles | Limites de la mémoire de travail face à des règles nouvelles | Le meilleur de 20 modèles atteint 68 % de précision à 500 instructions (IFScale) | Gardez peu de règles permanentes, et précises |
| Expertise | Le familier coûte peu (Sweller et collaborateurs, 2019) | Anthropic : « les balises XML aident Claude à analyser sans ambiguïté des prompts complexes » | Structurez les entrées pour qu’elles se lisent comme quelques grands blocs |
Tableau comparatif : cadre éditorial CEOtudent, construit à partir des sources citées dans chaque cellule.
Le Load-Fit Prompt : une méthode en cinq étapes
La méthode ci-dessous relève du cadre éditorial CEOtudent. Ce n’est pas un protocole testé ; elle traduit les données ci-dessus en étapes applicables à tout prompt sérieux. Son principe : un prompt doit tenir dans deux mémoires de travail à la fois, celle du modèle, pour qu’il exploite bien le contexte, et la vôtre, pour que vous puissiez vérifier la réponse.
Étape 1. Nommez la charge intrinsèque en une phrase. Écrivez ce qu’est réellement le travail demandé avant d’ajouter quoi que ce soit. « Déterminer si la clause 7 de ce contrat entre en conflit avec notre politique de données » est une consigne. « Regarde ce contrat » n’en est pas une. Si vous ne parvenez pas à écrire cette phrase, le problème ne vient pas du modèle.
Étape 2. Réduisez la charge extrinsèque. Passez en revue chaque document et chaque instruction que vous vous apprêtiez à coller, et demandez-vous : en aurais-je besoin pour faire ce travail moi-même ? Supprimez le reste. Les ingénieurs d’Anthropic décrivent l’objectif comme « le plus petit ensemble possible de tokens à fort signal qui maximise la probabilité d’obtenir le résultat souhaité ». Concrètement, cela signifie des extraits plutôt que des fichiers entiers, une seule version d’un document plutôt que trois brouillons, et aucun contexte que vous sauteriez si un collègue vous le remettait.
Étape 3. Découpez ce qui reste en blocs. Étiquetez chaque bloc de matériel avec un court intitulé ou une balise pour qu’il se lise comme un seul bloc, à la manière dont un expert lit un contenu familier. Limitez les règles permanentes à une liste courte. L’heuristique des quatre blocs, pas plus d’environ quatre demandes distinctes par requête, est une règle empirique éditoriale tirée de l’estimation de Cowan pour les humains ; ce n’est pas une limite mesurée des modèles.
Étape 4. Jouez sur la position. Pour les entrées longues, Anthropic recommande de placer « vos longs documents et entrées vers le haut du prompt, au-dessus de votre question », et indique que « les questions placées à la fin peuvent améliorer la qualité des réponses jusqu’à 30 % lors des tests ». Google donne le même conseil. Le guide GPT-4.1 d’OpenAI a constaté que placer les instructions « à la fois au début et à la fin du contexte fourni » donnait les meilleurs résultats. Un choix par défaut sûr qui satisfait les trois : une consigne d’une ligne en haut, le matériel au milieu, et la question complète avec le format de sortie à la fin.
Étape 5. Rendez la réponse vérifiable. Demandez au modèle de citer les passages sur lesquels il s’appuie avant de répondre. Anthropic suggère précisément cela pour les longs documents : « demandez à Claude de citer d’abord les parties pertinentes des documents ». Les citations transforment un long contexte en un contexte court pour vous, le relecteur, et révèlent quand le modèle est allé puiser dans le milieu fragile pour en revenir avec la mauvaise information.
La carte de charge du prompt
| Type de charge | Dans un prompt, cela ressemble à | Signe qu’elle est trop élevée | Correctif |
|---|---|---|---|
| Intrinsèque | La difficulté réelle du travail demandé | Vous ne parvenez pas à formuler la consigne en une phrase | Découpez le travail en prompts successifs |
| Extrinsèque | Fichiers collés, anciens brouillons, règles contradictoires, long historique de conversation | La réponse cite la mauvaise section ou ignore un fait clé | Réduisez à des extraits ; ouvrez une nouvelle conversation avec un résumé |
| Essentielle (réorientée) | Étiquettes, exemples, format de sortie explicite | Vous passez plus de temps à interpréter la réponse qu’à la lire | Ajoutez de la structure : intitulés, modèle, un exemple résolu |
Cadre éditorial CEOtudent, adapté des trois catégories de charge de Sweller, van Merrienboer et Paas (2019).
Pourquoi est-ce important pour votre propre réflexion ?
Chaque prompt contient une seconde mémoire de travail : la vôtre. Les longs prompts et les longues réponses déplacent l’effort de la réflexion vers la relecture, et les données suggèrent que les gens ne suivent pas toujours.
- Dans une enquête auprès de 319 travailleurs du savoir ayant partagé 936 exemples, Lee et collaborateurs (CHI 2025) ont constaté qu’« une confiance plus élevée dans l’IA générative est associée à moins d’esprit critique, tandis qu’une confiance en soi plus élevée est associée à davantage d’esprit critique ». La nature de l’esprit critique s’est déplacée « vers la vérification de l’information, l’intégration des réponses et la supervision du travail ». Ces données sont autodéclarées et corrélationnelles.
- Gerlich (2025) a interrogé par questionnaire et entretien 666 participants et a rapporté « une corrélation négative significative entre l’usage fréquent d’outils d’IA et les capacités d’esprit critique, médiée par un déchargement cognitif accru ». Là encore, il s’agit de corrélations.
- Dans une prépublication du MIT Media Lab qui n’a pas encore été évaluée par les pairs, Kosmyna et collaborateurs (2025) ont suivi 54 participants rédigeant des essais. Lors de la première séance, 83,3 % du groupe assisté par l’IA (15 sur 18) n’ont pas pu citer correctement leur propre essai, contre 11,1 % (2 sur 18) dans chacun des deux autres groupes. L’échantillon est réduit et le cadre étroit.
- Dans une expérience de terrain préenregistrée menée auprès de 758 travailleurs du savoir, Dell’Acqua et collaborateurs (Organization Science, 2026) ont constaté que, sur 18 missions situées dans le champ des capacités de l’IA, les utilisateurs de l’IA ont accompli 12,2 % de missions en plus, 25,1 % plus vite, avec une qualité nettement supérieure. Sur une mission située hors de ce champ, ils avaient « 19 % de probabilité en moins de produire des solutions correctes ». Savoir de quel côté de la frontière se situe une mission reste un travail humain.
Risko et Gilbert (2016) définissent le déchargement cognitif comme le recours à « une action physique pour modifier les exigences de traitement de l’information d’un travail afin de réduire la demande cognitive ». Le déchargement n’est pas le problème ; c’est ainsi que les humains ont toujours étendu leur esprit. Le problème, c’est de décharger la vérification. Un prompt que vous ne pouvez pas relire en quelques minutes est un prompt que vous approuverez sans le relire. Pour approfondir ce compromis, consultez si l’IA vous rend moins bon en réflexion et le budget de charge cognitive.
Quand faut-il malgré tout utiliser le contexte long ?
L’objectif n’est pas d’écrire des prompts courts pour le principe. Le contexte long est le bon outil lorsque :
– Le travail consiste à chercher dans un vaste ensemble que vous ne pouvez pas filtrer en amont, comme retrouver chaque mention d’un fournisseur dans une année de comptes rendus de réunion. Attendez-vous à des oublis et demandez des citations.
– La cohérence de l’ensemble du document est l’enjeu, comme vérifier les contradictions d’une proposition de 60 pages. Découpez-la en sections et demandez au modèle de résumer chacune avant de les comparer.
– Vous mettez en place un espace de travail réutilisable, comme un projet doté de documents de référence permanents. Ici, la structure du matériel compte plus que sa taille : un fichier de contexte propre et étiqueté vaut mieux qu’un dossier d’exports bruts. Le choix du bon modèle pour ce travail est traité dans quel modèle d’IA pour quel usage, et la réutilisation de vos meilleurs prompts dans les bibliothèques de prompts pour professionnels.
C’est le mauvais outil lorsque la vraie raison pour laquelle vous collez tout est que vous n’avez pas encore décidé quelle est la question.
Une vérification Load-Fit en 10 minutes
Appliquez-la avant tout prompt dont la relecture vous prendra plus de cinq minutes :
- Puis-je formuler la consigne en une phrase ?
- Ai-je retiré chaque document dont je n’aurais pas besoin moi-même ?
- N’y a-t-il qu’une seule version de chaque document ?
- Ai-je résolu les instructions contradictoires ?
- Y a-t-il quatre demandes distinctes ou moins ?
- Chaque bloc de matériel est-il étiqueté ?
- Le matériel est-il en haut et la question à la fin ?
- Ai-je précisé le format de sortie ?
- Ai-je demandé des citations ou des références aux passages sources ?
- Pourrais-je vérifier la réponse dans le temps dont je dispose ?
Liste de contrôle : cadre éditorial CEOtudent.
Questions fréquentes
Une fenêtre de contexte de 1M tokens est-elle donc inutile ?
Non. Elle supprime une limite stricte, ce qui est précieux pour la recherche et pour les espaces de travail réutilisables. Les benchmarks montrent que la qualité d’utilisation décroît bien avant la limite : il vaut donc mieux considérer la fenêtre comme une marge que comme un objectif.
Ces résultats de benchmarks s’appliquent-ils aux modèles les plus récents ?
Pas directement. RULER et NoLiMa ont testé des modèles de 2024 et du début de 2025, et les modèles plus récents feront probablement mieux. Les guides des fournisseurs pour les modèles actuels recommandent toujours un contexte ciblé et un placement soigné, et aucun benchmark indépendant des modèles de 2026 cités plus haut n’était disponible au moment de la rédaction de cet article.
Les instructions doivent-elles aller en haut ou en bas ?
Les fournisseurs divergent légèrement. Anthropic et Google recommandent le matériel long en premier et la question en dernier. Le guide GPT-4.1 d’OpenAI a constaté que les instructions placées à la fois au début et à la fin donnaient les meilleurs résultats, et qu’au-dessus du contexte valait mieux qu’en dessous si vous ne les placez qu’une fois. Une courte ligne de consigne en haut et la question complète à la fin couvrent les deux cas.
« Sept plus ou moins deux » reste-t-il la règle pour la mémoire de travail ?
Miller lui-même présentait sept comme une approximation, mesurée en blocs. La revue de Cowan de 2001 situe la limite à environ quatre blocs d’information nouvelle. Le chiffre exact importe moins que le principe : des blocs moins nombreux, plus grands et bien étiquetés.
Cela signifie-t-il que l’IA fait moins réfléchir les gens ?
Les données sont contrastées et surtout corrélationnelles. La lecture la plus prudente est que la confiance dans l’outil tend à réduire l’effort que les gens consacrent à le vérifier. Concevoir des prompts dont vous pouvez vérifier les réponses permet de maintenir cet effort.
Sources
- Anthropic. Models overview; Context windows; Prompting best practices (long context prompting). Claude Platform Docs. Consulté le 7 octobre 2026.
- Anthropic Applied AI team. Effective context engineering for AI agents. Anthropic Engineering, 29 septembre 2025.
- OpenAI. Models. Documentation de l’API OpenAI. Consulté le 7 octobre 2026.
- OpenAI. GPT-4.1 Prompting Guide; GPT-5 prompting guide. OpenAI Cookbook, 2025.
- Google. Pages des modèles Gemini 3.1 Pro Preview et Gemini 3.8 Flash ; Long context ; Understand and count tokens. Documentation de l’API Gemini. Consulté le 7 octobre 2026.
- Liu NF, Lin K, Hewitt J, Paranjape A, Bevilacqua M, Petroni F, Liang P. Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics. 2024;12:157-173.
- Hsieh CP, Sun S, Kriman S, Acharya S, Rekesh D, Jia F, Zhang Y, Ginsburg B. RULER: What’s the Real Context Size of Your Long-Context Language Models? COLM 2024.
- Modarressi A, Deilamsalehy H, Dernoncourt F, Bui T, Rossi R, Yoon S, Schuetze H. NoLiMa: Long-Context Evaluation Beyond Literal Matching. ICML 2025.
- Hong K, Troynikov A, Huber J. Context Rot: How Increasing Input Tokens Impacts LLM Performance. Chroma Technical Report, 14 juillet 2025. Rapport industriel, non évalué par les pairs.
- Jaroslawicz D, Whiting B, Shah P, Maamari K. How Many Instructions Can LLMs Follow at Once? arXiv 2507.11538, 2025. Prépublication.
- Miller GA. The magical number seven, plus or minus two: Some limits on our capacity for processing information. Psychological Review. 1956;63(2):81-97.
- Cowan N. The magical number 4 in short-term memory: A reconsideration of mental storage capacity. Behavioral and Brain Sciences. 2001;24(1):87-114. Résumé.
- Sweller J. Cognitive load during problem solving: Effects on learning. Cognitive Science. 1988;12(2):257-285. Résumé.
- Sweller J, van Merrienboer JJG, Paas F. Cognitive Architecture and Instructional Design: 20 Years Later. Educational Psychology Review. 2019;31:261-292.
- Chandler P, Sweller J. Cognitive Load Theory and the Format of Instruction. Cognition and Instruction. 1991;8(4):293-332. Résumé.
- Kalyuga S, Ayres P, Chandler P, Sweller J. The Expertise Reversal Effect. Educational Psychologist. 2003;38(1):23-31. Résumé.
- Risko EF, Gilbert SJ. Cognitive Offloading. Trends in Cognitive Sciences. 2016;20(9):676-688. Résumé.
- Lee HP, Sarkar A, Tankelevitch L, Drosos I, Rintel S, Banks R, Wilson N. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI 2025.
- Gerlich M. AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking. Societies. 2025;15(1):6. Résumé.
- Kosmyna N, Hauptmann E, Yuan YT, Situ J, Liao XH, Beresnitzky AV, Braunstein I, Maes P. Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task. MIT Media Lab, arXiv 2506.08872, 2025. Prépublication, non évaluée par les pairs.
- Dell’Acqua F, McFowland E III, Mollick E, Lifshitz-Assaf H, et collaborateurs. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science. 2026;37(2). Résumé.
Le tableau contexte annoncé ou effectif, le tableau comparatif humain-modèle, la méthode Load-Fit Prompt, la carte de charge du prompt et la vérification en 10 minutes sont des analyses CEOtudent fondées sur les sources ci-dessus. Tous les autres chiffres sont rapportés tels qu’ils figurent dans ces sources ; les sources consultées uniquement sous forme de résumé sont signalées. Deux chiffres largement repris n’ont pas été utilisés, faute d’avoir pu être retrouvés dans les textes publiés : un résultat de « qualité supérieure de 40 % » attribué à l’étude sur la frontière technologique irrégulière, et une règle de « trois quarts de mot par token » attribuée à OpenAI.
Ce contenu a été compilé avec le soutien de l’IA à la suite d’une recherche approfondie, puis rédigé et préparé pour publication par l’équipe éditoriale de CEOtudent.
This post is also available in:










