L’essentiel. Les réponses sont devenues presque gratuites. En juillet 2025, ChatGPT comptait à lui seul plus de 700 millions d’utilisateurs hebdomadaires envoyant plus de 2,5 milliards de messages par jour, et la part de ces messages qui étaient des questions (« Asking ») est passée d’une répartition à parts égales avec les demandes d’exécution en juillet 2024 à 51,6 pour cent fin juin 2025. Les utilisateurs notent aussi plus favorablement les réponses aux questions que les résultats des demandes d’exécution. Dans le même temps, les données d’Anthropic montrent l’habitude inverse en progression : les conversations dans lesquelles l’utilisateur confie un travail entier presque sans aller-retour sont passées de 27 pour cent à 39 pour cent en huit mois. Le facteur différenciant n’est donc plus de savoir qui peut obtenir une réponse, mais qui sait poser la question qui mérite une réponse. La recherche sur le questionnement, des salles de classe des années 1990 aux jeux de laboratoire de 2018 et à une enquête de 2025 auprès de 319 travailleurs du savoir, converge vers trois constats. Les gens reconnaissent une bonne question bien mieux qu’ils n’en formulent une. Poser plus de questions n’est pas la même chose que poser de meilleures questions. Et l’ambiguïté est la règle, pas l’exception. Une analyse CEOtudent de neuf études primaires en tire un cadre de qualité des questions à six dimensions, noté de 0 à 12, avec un exemple commenté. Il s’agit d’un cadre éditorial, pas d’un instrument validé, et nous indiquons où ses preuves sont minces.
Cet article est le complément de notre dossier sur l’économie du jugement. Ce dossier soutenait que le jugement devient la compétence rare. Le présent article s’intéresse au premier acte du jugement : décider quoi demander. Le réflexe CEO consiste à traiter vos questions comme les intrants à plus fort levier que vous contrôlez. Le réflexe étudiant consiste à pratiquer délibérément la formulation de questions, parce que les preuves montrent qu’elle ne s’améliore pas toute seule.
Pourquoi la qualité des questions est-elle soudain le goulot d’étranglement ?
Deux jeux de données publiés en septembre 2025 décrivent la manière dont les gens parlent réellement aux systèmes d’IA et, lus ensemble, ils expliquent le basculement.
Le premier est un document de travail d’économistes d’OpenAI et de David Deming, de Harvard, publié par le National Bureau of Economic Research. Il a classé un échantillon d’environ 1,1 million de conversations ChatGPT, de mai 2024 à juin 2025, selon trois intentions. « Asking » (demander) désigne la recherche d’information ou de clarification pour éclairer une décision. « Doing » (faire) désigne la production d’un résultat ou l’exécution d’un travail. « Expressing » (exprimer) désigne le partage d’opinions ou de sentiments. Sur l’ensemble de la période, 49 pour cent des messages relevaient d’Asking, 40 pour cent de Doing et 11 pour cent d’Expressing. En juillet 2024, Asking et Doing étaient à égalité ; fin juin 2025, la répartition était de 51,6 pour cent pour Asking, 34,6 pour cent pour Doing et 13,8 pour cent pour Expressing. Les auteurs rapportent aussi que les messages Asking sont « systématiquement évalués comme étant de meilleure qualité », tant par un classifieur de satisfaction que par les retours directs des utilisateurs. L’usage lié au travail, lui, est passé de 47 pour cent des messages en juin 2024 à 27 pour cent en juin 2025, non parce que l’usage professionnel a reculé, mais parce que tout le reste a progressé plus vite.
Le second est l’Anthropic Economic Index. Son premier rapport, couvrant la fin 2024 et le début 2025, relevait que 57 pour cent des conversations sur Claude.ai présentaient des schémas d’augmentation (apprendre, itérer, valider) et 43 pour cent des schémas d’automatisation. Dans le rapport de septembre 2025, les conversations « directives », dans lesquelles l’utilisateur donne une consigne complète et prend le résultat avec un minimum d’aller-retour, avaient bondi de 27 pour cent à 39 pour cent, et automatisation et augmentation étaient presque à égalité sur Claude.ai (49 pour cent d’automatisation selon le classifieur actuel). Le rapport note que cette hausse « s’est faite principalement au détriment de l’itération et des interactions d’apprentissage ».
Rapprochez les deux. Une part croissante de ce que les gens envoient à l’IA est une question, et les questions obtiennent les meilleures réponses. Mais une proportion grandissante d’utilisateurs demandent une fois, prennent le résultat et s’en vont. La deuxième question, celle qui teste ou affine la première réponse, est exactement ce qui disparaît. C’est un problème de qualité des questions, et il précède l’IA de plusieurs décennies.
Qu’a réellement mesuré la recherche sur les questions ?
La plupart des conseils pour « poser de meilleures questions » relèvent du folklore. Les études ci-dessous ont mesuré quelque chose de précis. Tous les chiffres sont tirés des textes primaires ; aucun ne provient d’un résumé de seconde main.
| Étude (source primaire) | Cadre et échantillon | Ce qui a été mesuré | Constat vérifié |
|---|---|---|---|
| Graesser et Person, 1994, American Educational Research Journal | Synthèse de la littérature sur la classe, plus 27 étudiants en tutorat universitaire et un échantillon de collégiens (7th grade) en algèbre | Fréquence et profondeur des questions ; corrélation avec les notes d’examen | Un élève pose seul environ 0,11 question par heure en classe contre 26,5 par heure en tutorat, soit à peu près 241 fois plus. Les enseignants en posent environ 69 par heure, 96 % de toutes les questions de classe, et seulement 4 % des leurs sont de haut niveau. Dans la première moitié du cours, le nombre total de questions était corrélé négativement aux notes d’examen (r = -0,56) ; la proportion de questions de raisonnement profond l’était positivement (0,36, montant à 0,47 plus tard) |
| Rosenshine, Meister et Chapman, 1996, Review of Educational Research | 26 études d’intervention apprenant aux élèves à formuler leurs propres questions | Effet sur les tests de compréhension de lecture | Taille d’effet médiane de 0,36 sur les tests standardisés et de 0,86 sur les tests conçus par les expérimentateurs. Le type d’amorce le plus puissant, les amorces de questions génériques telles que « Comment … influence-t-il … ? », atteignait une médiane de 1,12 sur quatre études |
| Huang, Yeomans, Brooks, Minson et Gino, 2017, Journal of Personality and Social Psychology | 199 dyades de conversation, 368 transcriptions codées, 110 participants à des séances de speed dating et 1 961 observations de rendez-vous | Types de questions et degré de sympathie du partenaire envers celui qui questionne | Les partenaires des grands poseurs de questions rapportaient une sympathie de 5,79 contre 5,31 (d = 0,35). Seules les questions de relance prédisaient la sympathie. En speed dating, un écart de 8 % dans le taux de questions de relance était associé à un second rendez-vous supplémentaire sur une soirée de 20 rencontres |
| Rothe, Lake et Gureckis, 2018, Computational Brain and Behavior | 40 participants formulant des questions libres sur 18 grilles de type bataille navale (605 questions catégorisées) ; 45 et 41 participants évaluant des questions | Gain d’information attendu (EIG) des questions formulées contre des questions évaluées | La fréquence à laquelle une question était formulée n’était corrélée à sa valeur informationnelle qu’à r = 0,16. Lorsque le même type de participants classait des questions écrites par d’autres, leur classement était corrélé à la valeur informationnelle à r = 0,89. Environ 3 % des questions formulées n’apportaient aucune information |
| Ruggeri, Lombrozo, Griffiths et Xu, 2016, Developmental Psychology | 24 enfants de sept ans, 23 enfants de dix ans et 23 adultes dans un jeu hiérarchique de 20 questions | Nombre de questions jusqu’à la solution ; niveau de la première question ; questions posées alors que la réponse était déjà déterminée | La stratégie optimale demande 2,85 questions. Les adultes en ont eu besoin de 3,36, les enfants de dix ans de 4,38, ceux de sept ans de 4,92. Sur trois manches, les adultes ont ouvert au niveau le plus informatif 1,87 fois contre 0,41 pour les enfants de sept ans. Pourtant, 52 % des adultes ont posé au moins une question qui ne pouvait plus changer la réponse |
| Min, Michael, Hajishirzi et Zettlemoyer, 2020, EMNLP (AmbigQA) | 14 042 questions réelles issues du benchmark en domaine ouvert Natural Questions, tirées de recherches Google | Part des questions ayant plus d’une interprétation valide | « Plus de la moitié » des questions des jeux de développement et de test étaient ambiguës (47 % dans le jeu d’entraînement), la dépendance temporelle et les références à des entités figurant parmi les principales sources |
| Lee, Sarkar, Tankelevitch, Drosos, Rintel, Banks et Wilson, 2025, CHI (Microsoft Research) | 319 travailleurs du savoir, 936 exemples de première main d’usage de l’IA générative au travail | Pensée critique auto-déclarée et ce qui la prédit | La pensée critique était rapportée dans 59,29 % des exemples. La confiance dans l’IA était associée négativement à la pensée critique (bêta = -0,69) ; la confiance dans ses propres capacités (0,26) et dans sa capacité à évaluer la production de l’IA (0,31) y étaient associées positivement. L’effort s’est déplacé « de la collecte d’information vers la vérification de l’information » |
Trois réserves accompagnent ce tableau. Les chiffres de classe sont des estimations des années 1990 agrégées par Graesser et Person à partir d’études antérieures. Les jeux de laboratoire mesurent les questions par rapport à un optimum défini mathématiquement, ce que les décisions réelles ont rarement. Et l’enquête de Microsoft repose sur l’auto-déclaration et, comme l’indiquent les auteurs, « n’établit pas de causalité ». Nous utilisons ces études pour la forme du problème, pas pour des prévisions précises sur votre prochain prompt.
Quel schéma les études ont-elles en commun ?
Lues côte à côte, les sept études décrivent les quatre mêmes défaillances, et chacune a sa jumelle à l’ère de l’IA.
1. L’écart de génération. Rothe et ses collègues ont constaté que les gens sont médiocres pour produire la meilleure question (r = 0,16 entre fréquence et valeur) et bons pour la reconnaître (r = 0,89). C’est le constat le plus important pour quiconque travaille avec l’IA. Il signifie que le goulot d’étranglement n’est pas le goût mais la production. Vous saurez reconnaître une grande question quand vous la verrez ; vous en écrirez rarement une sans y être poussé. La revue de Rosenshine montre le remède : les élèves explicitement entraînés à formuler leurs propres questions ont nettement progressé aux tests de compréhension conçus autour du matériel étudié (taille d’effet médiane de 0,86, soit le 81e centile), et les amorces de questions génériques étaient le type d’amorce le plus puissant (médiane de 1,12 sur quatre études). La formulation de questions est une compétence qui s’entraîne, et elle s’entraîne avec des échafaudages, pas avec des exhortations.
2. La quantité n’est pas la qualité. Dans les données de Graesser et Person, les étudiants qui posaient plus de questions en début de cours obtenaient de moins bonnes notes aux examens, tandis que ceux dont les questions étaient plus souvent du type « pourquoi, comment, et si » obtenaient de meilleures notes. Les adultes de Ruggeri, pourtant bien plus efficaces que les enfants, posaient encore des questions redondantes dans plus de la moitié des cas. Une fenêtre de discussion sans coût par message rend cette défaillance bon marché et invisible : vous pouvez poser vingt questions superficielles et vous sentir productif.
3. L’ambiguïté est la règle. AmbigQA a montré que plus de la moitié des questions de recherche ordinaires ont plus d’une réponse légitime selon le moment, l’entité ou le périmètre. Un expert humain répond à une question ambiguë en en posant une en retour. Un modèle de langage répond généralement à la lecture statistiquement la plus probable sans vous dire qu’il a choisi. Ce choix silencieux est l’un des mécanismes derrière le biais de première conclusion que nous avons décrit plus tôt : la première réponse paraît complète parce que l’ambiguïté de la question a été résolue pour vous, invisiblement.
4. C’est dans la relance que se trouve la valeur. L’équipe de Huang a constaté que seules les questions de relance, et non le total des questions, prédisaient si un partenaire de conversation vous appréciait, et l’effet se prolongeait jusque dans les décisions de second rendez-vous. Les données d’Anthropic montrent que le comportement de relance (itération, apprentissage) est précisément ce qui a reculé à mesure que l’usage directif progressait. L’enquête de Lee ajoute le mécanisme : quand les gens font davantage confiance à l’IA, ils pensent moins de manière critique, et la pensée critique qui subsiste s’est déplacée vers la vérification. Une question de relance est la vérification sous sa forme la moins coûteuse.
Le cadre de qualité des questions
Le tableau ci-dessous est un cadre éditorial CEOtudent. C’est notre synthèse des études ci-dessus, pas un instrument validé par rapport à des résultats. Chacune des six dimensions est notée 0, 1 ou 2. Une question obtient un score de 0 à 12.
| Dimension | À quoi ressemble un 0 | À quoi ressemble un 2 | Ancrage dans la recherche |
|---|---|---|---|
| Lien avec la décision | Aucune décision ne dépend de la réponse ; curiosité ou remplissage | Vous pouvez nommer la décision que la réponse va changer et le seuil qui la ferait basculer | Définition NBER d’« Asking » comme éclairant une décision ; questions de déficit de connaissance de Graesser |
| Désambiguïsation | Ouverte à plusieurs lectures du moment, de l’entité, du périmètre ou du public | Période, entité, périmètre et public sont fixés dans la question elle-même | AmbigQA (plus de la moitié des questions réelles sont ambiguës) |
| Pouvoir de partition | Teste une hypothèse à la fois (« Est-ce X ? ») | Coupe l’espace des possibilités à peu près en deux au niveau le plus général utile | Questions superordonnées d’abord chez Ruggeri ; gain d’information attendu chez Rothe |
| Type de profondeur | Oui/non, qui, quoi, combien | Pourquoi, comment, et si, pourquoi pas : demande un mécanisme, une cause ou une conséquence | Catégories de raisonnement profond de Graesser, corrélées à la réussite |
| Forme de la réponse | Vous accepteriez n’importe quelle réponse fluide | Vous avez écrit à quoi ressemblerait une mauvaise réponse et quelle preuve trancherait | Lee et al. : l’effort se déplace vers la vérification ; amorces génériques de Rosenshine |
| Plan de relance | La première réponse clôt la session | Vous connaissez déjà la deuxième question pour chaque réponse probable | Huang et al. (la relance prédit la sympathie et les résultats) ; itération en recul chez Anthropic |
Tranches de score (éditoriales) : de 0 à 4, c’est une requête de recherche, acceptable pour des faits que vous vérifierez ailleurs. De 5 à 8, c’est une question de travail, suffisante pour des brouillons et de l’exploration. De 9 à 12, c’est une question de niveau décisionnel, la seule que vous devriez confier à un système d’IA ou à un collègue expérimenté quand un vrai choix en dépend.
Un exemple commenté
Prenez une question de carrière courante : « Devrais-je apprendre Python ? »
- Lien avec la décision : 0. Aucune décision ni aucun seuil n’est énoncé.
- Désambiguïsation : 0. Pour quel poste, pour quand, à la place de quoi ?
- Pouvoir de partition : 0. Elle teste une option contre rien.
- Type de profondeur : 0. Elle appelle un oui ou un non.
- Forme de la réponse : 0. N’importe quelle réponse assurée serait acceptée.
- Plan de relance : 0. « Oui » met fin à la conversation.
Score : 0 sur 12. Toute réponse n’est que du bruit, et la plupart des outils d’IA fourniront un oui assuré et générique.
Maintenant le même besoin, reformulé : « Je suis analyste marketing avec deux ans d’expérience et je décide dans les 30 prochains jours si je consacre mes 60 heures de formation de ce trimestre à Python pour l’analyse de données ou au SQL avancé. Laquelle des deux compétences apparaît le plus souvent comme requise dans les offres d’analyste d’entreprises de ma taille, et laquelle produit plus vite un résultat exploitable pour le reporting hebdomadaire ? Si la réponse est Python, quel est le plus petit projet qui le prouverait en quatre semaines ? Si c’est SQL, à quoi renoncerais-je ? »
- Lien avec la décision : 2. Une décision datée avec un budget.
- Désambiguïsation : 2. Poste, expérience, horizon, alternatives.
- Pouvoir de partition : 2. Deux options réelles, comparées sur deux critères nommés.
- Type de profondeur : 1. Elle demande « laquelle » et « quoi », le mécanisme étant sous-entendu plutôt qu’exigé.
- Forme de la réponse : 1. Les critères sont nommés, mais aucun seuil (« requise dans au moins X des offres ») n’est fixé.
- Plan de relance : 2. Les deux branches ont déjà leur question suivante.
Score : 10 sur 12. Remarquez que rien dans la seconde version n’est astucieux. C’est la première version plus l’échafaudage que, selon la recherche, les gens n’ajoutent pas d’eux-mêmes.
Comment le pratiquer en tant qu’étudiant ?
La revue de Rosenshine est claire : la formulation de questions progresse avec des échafaudages explicites, et les amorces génériques ont donné les meilleurs résultats. Gardez une courte liste et utilisez-la avant d’ouvrir le moindre outil d’IA :
- Comment … influence-t-il … ?
- Quelles sont les forces et les faiblesses de … ?
- Comment … s’articule-t-il avec ce que nous savons déjà ?
- Quel est un nouvel exemple de … ?
- Quelles conclusions pouvez-vous tirer sur … ?
- Pourquoi est-il important que … ?
Un exercice pratique : pendant une semaine, écrivez votre question dans un fichier texte brut avant de la taper dans une fenêtre de discussion, notez-la sur les six dimensions, et n’envoyez rien en dessous de 5. Exigez ensuite une question de relance par session, choisie dans votre plan plutôt qu’improvisée en réaction à la réponse. La méthode du prompt socratique est une manière structurée de mener cette relance, et le journal de décision est l’endroit où vivent dans la durée les colonnes Lien avec la décision et Forme de la réponse.
Comment le piloter en tant que CEO de vous-même ?
Traitez les questions comme un budget, pas comme un réflexe. Trois règles découlent des preuves.
Questionnez avant de déléguer. Notre article sur les décisions à confier à l’IA fixait des frontières par type de décision. Le cadre ajoute une porte : un travail qui ne peut pas être formulé comme une question à 9 ou plus n’est pas prêt à être délégué, ni à un agent IA ni à une personne, parce que vous n’avez pas encore dit ce qu’est une bonne réponse.
Calibrez la confiance par la relance, pas par la première réponse. L’enquête de Lee a montré que la confiance dans l’IA était le prédicteur négatif le plus fort de la pensée critique. Le contrepoids le moins coûteux est une deuxième question planifiée. Le calibrage de la confiance traite du moment où faire confiance ; le plan de relance est la manière dont vous gagnez cette confiance au cas par cas.
Auditez votre mélange de questions chaque mois. Les corrélations de Graesser avec la réussite portaient sur la proportion de questions profondes, pas sur leur nombre. Une fois par mois, sortez dix de vos propres prompts et classez-les en superficiels (qui, quoi, oui/non) ou profonds (pourquoi, comment, et si). Si la part des questions profondes est inférieure à un tiers, vos outils vont bien et ce sont vos questions le problème. L’audit des hypothèses est une source toute prête de questions profondes sur votre propre domaine, et l’écart de discernement explique pourquoi les questions superficielles produisent un résultat impossible à distinguer d’une pensée.
Ce que ce cadre ne peut pas vous dire
- Il n’est pas validé. Aucune étude n’a testé si noter les questions sur ces six dimensions améliore les décisions. Les dimensions sont ancrées dans la recherche ; la notation est éditoriale.
- Les données d’usage sont propres à chaque plateforme et reposent sur des classifieurs. Les chiffres du NBER décrivent les offres grand public de ChatGPT et excluent les utilisateurs ayant refusé le partage de données ; les chiffres d’Anthropic décrivent le trafic de Claude.ai et de l’API classé par les propres modèles d’Anthropic. Ni l’un ni l’autre n’est un recensement de l’usage de l’IA.
- Les études de laboratoire définissent « bon » comme un gain d’information par rapport à un espace de réponses connu. La plupart des questions stratégiques n’ont pas un tel espace, raison pour laquelle les dimensions Lien avec la décision et Forme de la réponse pèsent davantage en pratique qu’en laboratoire.
- Les taux de classe datent de plusieurs décennies et sont agrégés à partir de plusieurs études ; traitez l’écart de 241 fois comme un ordre de grandeur, pas comme un chiffre précis.
- Lee et ses collègues ont mesuré une pensée critique auto-déclarée et indiquent clairement que leur analyse n’établit pas de causalité.
Questions fréquentes
Est-ce la même chose que l’ingénierie de prompts ?
Non. L’ingénierie de prompts consiste à formater des instructions pour qu’un modèle exécute bien un travail ; nos articles sur la pile de compétences IA et l’ingénierie de contexte couvrent ce sujet. Ce cadre porte sur la question de savoir si ce que vous demandez mérite d’être demandé, ce qui compte tout autant quand la personne en face de vous est humaine.
Si les gens reconnaissent si bien les bonnes questions, pourquoi ne pas simplement demander à l’IA d’améliorer ma question ?
C’est un usage raisonnable de l’écart de génération, et nous le recommandons comme étape. Mais le constat de Rothe était que les gens classent bien les questions quand les alternatives leur sont fournies. Il vous reste à évaluer la réécriture de l’IA, ce qui signifie que vous avez de toute façon besoin des six dimensions en tête.
Poser plus de questions de relance me ralentit-il ?
Dans les données de Huang, le speed date moyen contenait déjà 4,51 questions de relance en quatre minutes, le coût est donc faible. Le temps économisé en n’agissant pas sur une question mal lue est le chiffre le plus élevé, même si aucune étude que nous ayons trouvée ne l’a mesuré directement pour l’usage de l’IA.
Quel est le changement unique à plus forte valeur ?
Écrivez la relance avant de voir la première réponse. Cela force les colonnes Lien avec la décision et Forme de la réponse, et c’est le comportement dont les données d’usage de 2025 montrent qu’il recule le plus vite.
Puis-je utiliser le cadre pour des réunions, pas seulement pour l’IA ?
Oui. Les chiffres de classe de Graesser et Person (des enseignants posant 96 pour cent des questions, dont seulement 4 pour cent de haut niveau) décrivent la plupart des points d’avancement. Les six mêmes colonnes s’appliquent à la question que vous apportez à votre manager ou à votre équipe.
Sources
- Chatterji, Cunningham, Deming, Hitzig, Ong, Shan et Wadman, « How People Use ChatGPT », National Bureau of Economic Research Working Paper 34255, septembre 2025.
- Anthropic Economic Index, « Uneven geographic and enterprise AI adoption », rapport de septembre 2025, et Handa, Tamkin et al., « Which Economic Tasks are Performed with AI? Evidence from Millions of Claude Conversations », mars 2025 (arXiv 2503.04761).
- Graesser et Person, « Question Asking During Tutoring », American Educational Research Journal, 31(1), 1994, pages 104 à 137.
- Rosenshine, Meister et Chapman, « Teaching Students to Generate Questions: A Review of the Intervention Studies », Review of Educational Research, 66(2), 1996, pages 181 à 221.
- Huang, Yeomans, Brooks, Minson et Gino, « It Doesn’t Hurt to Ask: Question-Asking Increases Liking », Journal of Personality and Social Psychology, 113(3), 2017, pages 430 à 452.
- Rothe, Lake et Gureckis, « Do People Ask Good Questions? », Computational Brain and Behavior, 1, 2018, pages 69 à 89.
- Ruggeri, Lombrozo, Griffiths et Xu, « Sources of Developmental Change in the Efficiency of Information Search », Developmental Psychology, 52(12), 2016, pages 2159 à 2173.
- Min, Michael, Hajishirzi et Zettlemoyer, « AmbigQA: Answering Ambiguous Open-domain Questions », Proceedings of EMNLP 2020.
- Lee, Sarkar, Tankelevitch, Drosos, Rintel, Banks et Wilson, « The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers », Proceedings of CHI 2025, Microsoft Research.
Ce contenu a été compilé avec le soutien de l’IA à la suite d’une recherche approfondie, puis rédigé et préparé pour publication par l’équipe éditoriale de CEOtudent.
This post is also available in:











