GelişimStrateji
0

Bessere Fragen schlagen bessere Antworten: Ein Framework für Fragequalität im KI-Zeitalter

A professional pausing in thought at a sunlit table with an open notebook, the moment before asking a better question

Kurzfassung. Antworten sind nahezu kostenlos geworden. Bis Juli 2025 hatte allein ChatGPT mehr als 700 Millionen wöchentliche Nutzer, die täglich über 2,5 Milliarden Nachrichten schickten, und der Anteil dieser Nachrichten, die Fragen waren (“Asking”), stieg von einem Gleichstand mit Aufgabenanfragen im Juli 2024 auf 51,6 Prozent Ende Juni 2025. Nutzer bewerten die Antworten auf Fragen zudem höher als die Ergebnisse von Aufgaben. Zugleich zeigen die Daten von Anthropic, dass die gegenteilige Gewohnheit wächst: Gespräche, in denen Nutzer eine komplette Aufgabe fast ohne Hin und Her abgeben, stiegen innerhalb von acht Monaten von 27 Prozent auf 39 Prozent. Das Unterscheidungsmerkmal ist also nicht mehr, wer eine Antwort bekommt, sondern wer die Frage stellen kann, die eine Antwort wert ist. Die Forschung zum Fragenstellen, von Klassenzimmern der 1990er über Laborspiele von 2018 bis zu einer Befragung von 319 Wissensarbeitern aus dem Jahr 2025, läuft auf drei Befunde hinaus. Menschen erkennen eine gute Frage viel besser, als sie eine formulieren. Mehr Fragen zu stellen ist nicht dasselbe wie bessere Fragen zu stellen. Und Mehrdeutigkeit ist der Normalfall, nicht die Ausnahme. Eine CEOtudent-Analyse von neun Primärstudien macht daraus ein sechsdimensionales Framework für Fragequalität mit einer Skala von 0 bis 12 und einem durchgerechneten Beispiel. Es handelt sich um ein redaktionelles Framework, nicht um ein validiertes Instrument, und wir sagen, wo seine Evidenz dünn ist.

Dieser Beitrag ist das Gegenstück zu unserem Hub über die Urteilsökonomie. Dort haben wir argumentiert, dass Urteilsvermögen zur knappen Fähigkeit wird. Hier geht es um den ersten Akt des Urteilens: zu entscheiden, was man fragt. Der CEO-Ansatz: Ihre Fragen als die Eingaben mit dem größten Hebel behandeln, die Sie selbst kontrollieren. Der Studenten-Ansatz: das Formulieren von Fragen bewusst üben, denn die Evidenz zeigt, dass es sich nicht von allein verbessert.

Warum ist Fragequalität plötzlich der Engpass?

Zwei im September 2025 veröffentlichte Datensätze beschreiben, wie Menschen tatsächlich mit KI-Systemen sprechen, und zusammen gelesen erklären sie die Verschiebung.

Der erste ist ein Working Paper von OpenAI-Ökonomen und David Deming von der Harvard University, veröffentlicht über das National Bureau of Economic Research. Es ordnete eine Stichprobe von rund 1,1 Millionen ChatGPT-Gesprächen von Mai 2024 bis Juni 2025 drei Absichten zu. “Asking” (Fragen) bedeutet, Informationen oder Klärung zu suchen, um eine Entscheidung zu untermauern. “Doing” (Erledigen) bedeutet, ein Ergebnis zu produzieren oder eine Aufgabe auszuführen. “Expressing” (Ausdrücken) bedeutet, Ansichten oder Gefühle zu teilen. Über den gesamten Zeitraum waren 49 Prozent der Nachrichten Asking, 40 Prozent Doing und 11 Prozent Expressing. Im Juli 2024 hielten sich Asking und Doing die Waage; Ende Juni 2025 lag die Verteilung bei 51,6 Prozent Asking, 34,6 Prozent Doing und 13,8 Prozent Expressing. Die Autoren berichten außerdem, dass Asking-Nachrichten sowohl von einem Zufriedenheitsklassifikator als auch im direkten Nutzerfeedback “durchgängig als qualitativ höherwertig bewertet” werden. Die arbeitsbezogene Nutzung sank derweil von 47 Prozent der Nachrichten im Juni 2024 auf 27 Prozent im Juni 2025, nicht weil die Nutzung bei der Arbeit schrumpfte, sondern weil alles andere schneller wuchs.

Der zweite ist der Anthropic Economic Index. Sein erster Bericht, der Ende 2024 und Anfang 2025 abdeckt, fand in 57 Prozent der Claude.ai-Gespräche Augmentierungsmuster (Lernen, Iterieren, Validieren) und in 43 Prozent Automatisierungsmuster. Im Bericht vom September 2025 waren “direktive” Gespräche, in denen Nutzer eine vollständige Aufgabe übergeben und das Ergebnis mit minimalem Hin und Her entgegennehmen, von 27 Prozent auf 39 Prozent gesprungen, und Automatisierung und Augmentierung lagen auf Claude.ai nahezu gleichauf (49 Prozent Automatisierung nach dem aktuellen Klassifikator). Der Bericht merkt an, dieser Anstieg sei “vor allem auf Kosten von Aufgaben-Iteration und Lerninteraktionen” gegangen.

Nimmt man beides zusammen: Mehr von dem, was Menschen an KI schicken, ist eine Frage, und Fragen bekommen die besseren Antworten. Aber ein wachsender Anteil der Nutzer fragt einmal, nimmt das Ergebnis und geht. Die zweite Frage, die die erste Antwort prüft oder verfeinert, ist genau das, was verschwindet. Das ist ein Problem der Fragequalität, und es ist Jahrzehnte älter als KI.

Was hat die Forschung über Fragen tatsächlich gemessen?

Die meisten Ratschläge zum “besseren Fragen” sind Folklore. Die folgenden Studien haben etwas Konkretes gemessen. Alle Zahlen stammen aus den Primärtexten; keine aus einer Sekundärzusammenfassung.

Studie (Primärquelle) Setting und Stichprobe Was gemessen wurde Verifizierter Befund
Graesser und Person, 1994, American Educational Research Journal Synthese der Klassenzimmerliteratur plus 27 College-Studierende im Tutoring und eine Algebra-Stichprobe aus der 7. Klasse Häufigkeit und Tiefe von Fragen; Korrelation mit Prüfungsergebnissen Ein einzelner Schüler stellt im Unterricht etwa 0,11 Fragen pro Stunde gegenüber 26,5 pro Stunde im Tutoring, rund 241-mal mehr. Lehrkräfte stellen etwa 69 pro Stunde, 96 % aller Fragen im Unterricht, und nur 4 % davon sind auf hohem Niveau. In der ersten Kurshälfte korrelierte die Gesamtzahl der Fragen negativ mit den Prüfungsergebnissen (r = -0,56); der Anteil tiefer Begründungsfragen korrelierte positiv (0,36, später auf 0,47 steigend)
Rosenshine, Meister und Chapman, 1996, Review of Educational Research 26 Interventionsstudien, in denen Schüler lernten, eigene Fragen zu formulieren Effekt auf Leseverständnistests Mediane Effektstärke 0,36 bei standardisierten Tests und 0,86 bei von den Forschern entwickelten Tests. Der stärkste Prompttyp, generische Fragestämme wie “Wie wirkt sich … auf … aus?”, erreichte über vier Studien einen Median von 1,12
Huang, Yeomans, Brooks, Minson und Gino, 2017, Journal of Personality and Social Psychology 199 Gesprächsdyaden, 368 kodierte Transkripte, 110 Speed-Dating-Teilnehmer und 1.961 Date-Beobachtungen Fragetypen und wie sehr das Gegenüber den Fragenden mochte Gesprächspartner von Vielfragern gaben eine Sympathie von 5,79 gegenüber 5,31 an (d = 0,35). Nur Nachfragen sagten Sympathie vorher. Beim Speed-Dating ging ein Unterschied von 8 % in der Nachfragerate mit einem zusätzlichen zweiten Date über einen Abend mit 20 Dates einher
Rothe, Lake und Gureckis, 2018, Computational Brain and Behavior 40 Teilnehmer, die auf 18 Spielfeldern im Stil von Schiffe versenken freie Fragen formulierten (605 kategorisierte Fragen); 45 und 41 Teilnehmer, die Fragen bewerteten Erwarteter Informationsgewinn (EIG) formulierter gegenüber bewerteten Fragen Wie oft eine Frage formuliert wurde, korrelierte mit ihrem Informationswert nur mit r = 0,16. Wenn dieselbe Art von Teilnehmern von anderen geschriebene Fragen in eine Rangfolge brachte, korrelierten ihre Rangfolgen mit dem Informationswert mit r = 0,89. Etwa 3 % der formulierten Fragen trugen keinerlei Information
Ruggeri, Lombrozo, Griffiths und Xu, 2016, Developmental Psychology 24 Siebenjährige, 23 Zehnjährige und 23 Erwachsene in einem hierarchischen 20-Fragen-Spiel Zahl der Fragen bis zur Lösung; Ebene der ersten Frage; Fragen, die gestellt wurden, nachdem die Antwort bereits feststand Die optimale Strategie braucht 2,85 Fragen. Erwachsene brauchten 3,36, Zehnjährige 4,38, Siebenjährige 4,92. Von drei Runden eröffneten Erwachsene 1,87-mal auf der informativsten Ebene gegenüber 0,41 bei Siebenjährigen. Dennoch stellten 52 % der Erwachsenen mindestens eine Frage, die die Antwort nicht mehr ändern konnte
Min, Michael, Hajishirzi und Zettlemoyer, 2020, EMNLP (AmbigQA) 14.042 echte Fragen aus dem Open-Domain-Benchmark Natural Questions, gewonnen aus Google-Suchen Anteil der Fragen mit mehr als einer gültigen Lesart “Über die Hälfte” der Entwicklungs- und Testfragen war mehrdeutig (47 % im Trainingssplit), mit Zeitabhängigkeit und Entitätsbezügen als Hauptquellen
Lee, Sarkar, Tankelevitch, Drosos, Rintel, Banks und Wilson, 2025, CHI (Microsoft Research) 319 Wissensarbeiter, 936 selbst erlebte Beispiele für den Einsatz generativer KI bei der Arbeit Selbstberichtetes kritisches Denken und was es vorhersagt Kritisches Denken wurde in 59,29 % der Beispiele berichtet. Vertrauen in die KI war negativ mit kritischem Denken assoziiert (Beta = -0,69); Vertrauen in die eigenen Fähigkeiten (0,26) und in die eigene Fähigkeit, KI-Ausgaben zu bewerten (0,31), waren positiv assoziiert. Der Aufwand verlagerte sich “von der Informationsbeschaffung zur Informationsprüfung”

Unter der Tabelle liegen drei Vorbehalte. Die Klassenzimmerzahlen sind Schätzungen aus den 1990ern, die Graesser und Person aus früheren Studien aggregiert haben. Die Laborspiele messen Fragen an einem mathematisch definierten Optimum, das echte Entscheidungen selten haben. Und die Microsoft-Befragung beruht auf Selbstauskunft und “belegt keine Kausalität”, wie die Autoren selbst festhalten. Wir nutzen diese Studien für die Gestalt des Problems, nicht für präzise Prognosen über Ihren nächsten Prompt.

Welches Muster teilen die Studien?

Nebeneinander gelesen beschreiben die sieben Studien dieselben vier Fehler, und jeder Fehler hat einen Zwilling im KI-Zeitalter.

1. Die Formulierungslücke. Rothe und Kollegen fanden, dass Menschen schlecht darin sind, die beste Frage zu produzieren (r = 0,16 zwischen Häufigkeit und Wert), und gut darin, sie zu erkennen (r = 0,89). Das ist der wichtigste einzelne Befund für alle, die mit KI arbeiten. Er bedeutet, dass der Engpass nicht der Geschmack ist, sondern die Produktion. Sie werden eine großartige Frage erkennen, wenn Sie sie sehen; Sie werden selten von sich aus eine schreiben. Rosenshines Übersichtsarbeit zeigt die Lösung: Schüler, denen explizit beigebracht wurde, eigene Fragen zu formulieren, verbesserten sich deutlich bei Verständnistests, die auf den Stoff zugeschnitten waren (mediane Effektstärke 0,86, das 81. Perzentil), und generische Fragestämme waren der stärkste Prompttyp (Median 1,12 über vier Studien). Fragen zu formulieren ist eine trainierbare Fähigkeit, und sie wird mit Gerüsten trainiert, nicht mit Ermahnungen.

2. Quantität ist nicht Qualität. In den Daten von Graesser und Person schnitten Studierende, die früh im Kurs mehr Fragen stellten, in den Prüfungen schlechter ab, während Studierende, deren Fragen häufiger “warum, wie, was wäre wenn” lauteten, besser abschnitten. Ruggeris Erwachsene, die weit effizienter waren als die Kinder, stellten in mehr als der Hälfte der Fälle trotzdem überflüssige Fragen. Ein Chatfenster ohne Kosten pro Nachricht macht diesen Fehler billig und unsichtbar: Sie können zwanzig oberflächliche Fragen stellen und sich produktiv fühlen.

3. Mehrdeutigkeit ist der Normalfall. AmbigQA fand, dass über die Hälfte gewöhnlicher Suchfragen je nach Zeit, Entität oder Umfang mehr als eine legitime Antwort hat. Ein menschlicher Experte beantwortet eine mehrdeutige Frage, indem er eine Gegenfrage stellt. Ein Sprachmodell beantwortet in der Regel die statistisch wahrscheinlichste Lesart, ohne Ihnen zu sagen, dass es gewählt hat. Diese stille Wahl ist einer der Mechanismen hinter der Erstschluss-Verzerrung, die wir früher beschrieben haben: Die erste Antwort fühlt sich vollständig an, weil die Mehrdeutigkeit der Frage für Sie aufgelöst wurde, unsichtbar.

4. Der Wert steckt in der Nachfrage. Huangs Team fand, dass nur Nachfragen, nicht die Gesamtzahl der Fragen, vorhersagten, ob ein Gesprächspartner Sie mochte, und der Effekt reichte bis in die Entscheidungen über ein zweites Date. Die Daten von Anthropic zeigen, dass Nachfrageverhalten (Aufgaben-Iteration, Lernen) genau das ist, was schrumpfte, als die direktive Nutzung wuchs. Lees Befragung liefert den Mechanismus: Wenn Menschen der KI mehr vertrauen, denken sie weniger kritisch, und das kritische Denken, das bleibt, ist zur Prüfung übergegangen. Eine Nachfrage ist Prüfung in ihrer billigsten Form.

Das Framework für Fragequalität

Die folgende Tabelle ist ein redaktionelles Framework von CEOtudent. Sie ist unsere Synthese der obigen Studien, kein Instrument, das an Ergebnissen validiert wurde. Jede der sechs Dimensionen wird mit 0, 1 oder 2 bewertet. Eine Frage erreicht 0 bis 12 Punkte.

Dimension So sieht eine 0 aus So sieht eine 2 aus Forschungsanker
Entscheidungsbezug Keine Entscheidung hängt von der Antwort ab; Neugier oder Füllmaterial Sie können die Entscheidung benennen, die die Antwort verändern wird, und die Schwelle, die sie kippen würde NBER-Definition von “Asking” als Entscheidungsgrundlage; Graessers Fragen aus Wissensdefizit
Eindeutigkeit Offen für mehrere Lesarten von Zeit, Entität, Umfang oder Zielgruppe Zeitrahmen, Entität, Umfang und Zielgruppe sind in der Frage selbst festgelegt AmbigQA (über die Hälfte echter Fragen mehrdeutig)
Trennschärfe Prüft eine Vermutung nach der anderen (“Ist es X?”) Teilt den Raum der Möglichkeiten auf der allgemeinsten nützlichen Ebene ungefähr in zwei Hälften Ruggeris übergeordnete Fragen zuerst; Rothes erwarteter Informationsgewinn
Fragetiefe Ja/Nein, wer, was, wie viele Warum, wie, was wäre wenn, warum nicht: fragt nach Mechanismus, Ursache oder Folge Graessers Kategorien tiefer Begründungsfragen, die mit Leistung korrelierten
Antwortform Sie würden jede flüssige Antwort akzeptieren Sie haben aufgeschrieben, wie eine falsche Antwort aussähe und welche Belege die Sache entscheiden würden Lee et al.: Aufwand verlagert sich zur Prüfung; Rosenshines generische Fragestämme
Nachfrageplan Die erste Antwort beendet die Sitzung Sie kennen für jede wahrscheinliche Antwort bereits die zweite Frage Huang et al. (Nachfragen sagen Sympathie und Ergebnisse vorher); Anthropics rückläufige Iteration

Punktebereiche (redaktionell): 0 bis 4 ist eine Suchanfrage, gut genug für Fakten, die Sie anderswo prüfen. 5 bis 8 ist eine Arbeitsfrage, ausreichend für Entwürfe und Erkundung. 9 bis 12 ist eine entscheidungsreife Frage, die einzige Art, die Sie einem KI-System oder einem erfahrenen Kollegen übergeben sollten, wenn eine echte Wahl davon abhängt.

Ein durchgerechnetes Beispiel

Nehmen Sie eine verbreitete Karrierefrage: “Soll ich Python lernen?”

  • Entscheidungsbezug: 0. Weder Entscheidung noch Schwelle werden genannt.
  • Eindeutigkeit: 0. Für welche Rolle, bis wann, statt was?
  • Trennschärfe: 0. Sie prüft eine Option gegen nichts.
  • Fragetiefe: 0. Sie lädt zu einem Ja oder Nein ein.
  • Antwortform: 0. Jede selbstbewusste Antwort würde akzeptiert.
  • Nachfrageplan: 0. “Ja” beendet das Gespräch.

Punktzahl: 0 von 12. Jede Antwort darauf ist Rauschen, und die meisten KI-Tools liefern ein selbstbewusstes, generisches Ja.

Nun dasselbe Bedürfnis, neu formuliert: “Ich bin Marketing-Analyst mit zwei Jahren Erfahrung und entscheide in den nächsten 30 Tagen, ob ich meine 60 Weiterbildungsstunden in diesem Quartal in Python für Datenanalyse oder in fortgeschrittenes SQL investiere. Welche der beiden Fähigkeiten taucht häufiger als Anforderung in Analysten-Stellenanzeigen bei Unternehmen meiner Größe auf, und welche liefert schneller brauchbare Ergebnisse für das wöchentliche Reporting? Falls die Antwort Python lautet, was ist das kleinste Projekt, das es in vier Wochen beweisen würde? Falls SQL, worauf würde ich verzichten?”

  • Entscheidungsbezug: 2. Eine terminierte Entscheidung mit Budget.
  • Eindeutigkeit: 2. Rolle, Erfahrung, Zeithorizont, Alternativen.
  • Trennschärfe: 2. Zwei offene Optionen, verglichen anhand zweier benannter Kriterien.
  • Fragetiefe: 1. Sie fragt “welche” und “was”, der Mechanismus ist impliziert, nicht eingefordert.
  • Antwortform: 1. Kriterien sind benannt, aber keine Schwelle (“in mindestens X der Anzeigen gefordert”) ist gesetzt.
  • Nachfrageplan: 2. Beide Zweige haben bereits ihre nächste Frage.

Punktzahl: 10 von 12. Beachten Sie, dass an der zweiten Version nichts clever ist. Sie ist die erste Version plus das Gerüst, das Menschen laut Forschung nicht von sich aus hinzufügen.

Wie üben Sie das als Student?

Rosenshines Übersichtsarbeit ist eindeutig: Das Formulieren von Fragen verbessert sich mit expliziten Gerüsten, und generische Fragestämme funktionierten am besten. Halten Sie eine kurze Liste bereit und nutzen Sie sie, bevor Sie ein KI-Tool öffnen:

  • Wie wirkt sich … auf … aus?
  • Was sind die Stärken und Schwächen von …?
  • Wie passt … zu dem, was wir bereits wissen?
  • Was ist ein neues Beispiel für …?
  • Welche Schlüsse können Sie über … ziehen?
  • Warum ist es wichtig, dass …?

Eine praktische Übung: Schreiben Sie eine Woche lang Ihre Frage in eine einfache Textdatei, bevor Sie sie in ein Chatfenster tippen, bewerten Sie sie auf den sechs Dimensionen und schicken Sie nichts unter 5 ab. Verlangen Sie dann von sich eine Nachfrage pro Sitzung, gewählt aus Ihrem Plan statt in Reaktion auf die Antwort erfunden. Die sokratische Prompting-Methode ist ein strukturierter Weg, diese Nachfrage zu führen, und das Entscheidungsjournal ist der Ort, an dem die Spalten Entscheidungsbezug und Antwortform über die Zeit leben.

Wie führen Sie das als CEO Ihrer selbst?

Behandeln Sie Fragen als Budget, nicht als Reflex. Drei Regeln folgen aus der Evidenz.

Fragen, bevor Sie delegieren. Unser Beitrag darüber, welche Entscheidungen Sie der KI überlassen sollten, setzte Grenzen nach Entscheidungstyp. Das Framework fügt eine Schleuse hinzu: Eine Aufgabe, die sich nicht als Frage mit 9 oder mehr Punkten formulieren lässt, ist nicht reif zum Delegieren, weder an einen KI-Agenten noch an eine Person, weil Sie noch nicht gesagt haben, was eine gute Antwort ist.

Kalibrieren Sie Vertrauen über die Nachfrage, nicht über die erste Antwort. Lees Befragung fand, dass Vertrauen in die KI der stärkste negative Prädiktor für kritisches Denken war. Das billigste Gegengewicht ist eine geplante zweite Frage. Vertrauenskalibrierung behandelt, wann Sie vertrauen sollten; der Nachfrageplan ist der Weg, wie Sie sich dieses Vertrauen Fall für Fall verdienen.

Prüfen Sie Ihren Fragenmix monatlich. Graessers Leistungskorrelationen folgten dem Anteil tiefer Fragen, nicht ihrer Zahl. Ziehen Sie einmal im Monat zehn Ihrer eigenen Prompts und ordnen Sie sie als oberflächlich (wer, was, Ja/Nein) oder tief (warum, wie, was wäre wenn) ein. Liegt der Anteil tiefer Fragen unter einem Drittel, ist Ihr Werkzeug in Ordnung und Ihre Fragen sind das Problem. Das Annahmen-Audit ist eine fertige Quelle tiefer Fragen über Ihr eigenes Feld, und die Unterscheidungslücke erklärt, warum oberflächliche Fragen Ergebnisse produzieren, die Sie nicht von Denken unterscheiden können.

Was dieses Framework Ihnen nicht sagen kann

  • Es ist nicht validiert. Keine Studie hat geprüft, ob das Bewerten von Fragen auf diesen sechs Dimensionen Entscheidungen verbessert. Die Dimensionen sind in der Forschung verankert; die Bewertung ist redaktionell.
  • Die Nutzungsdaten sind plattformspezifisch und klassifikatorbasiert. Die NBER-Zahlen beschreiben ChatGPT-Verbrauchertarife und schließen Nutzer aus, die der Datenweitergabe widersprochen haben; die Anthropic-Zahlen beschreiben Claude.ai- und API-Verkehr, klassifiziert durch Anthropics eigene Modelle. Keine von beiden ist eine Vollerhebung der KI-Nutzung.
  • Die Laborstudien definieren “gut” als Informationsgewinn gegenüber einem bekannten Antwortraum. Die meisten strategischen Fragen haben keinen solchen Raum, weshalb die Dimensionen Entscheidungsbezug und Antwortform in der Praxis mehr Gewicht tragen als im Labor.
  • Die Klassenzimmerraten sind Jahrzehnte alt und aus mehreren Studien aggregiert; behandeln Sie den 241-fachen Unterschied als Größenordnung, nicht als präzise Zahl.
  • Lee und Kollegen haben selbstberichtetes kritisches Denken gemessen und sagen klar, dass ihre Analyse keine Kausalität belegt.

Häufig gestellte Fragen

Ist das dasselbe wie Prompt Engineering?
Nein. Beim Prompt Engineering geht es darum, Anweisungen so zu formatieren, dass ein Modell eine Aufgabe gut erledigt; unsere Beiträge zum KI-Kompetenz-Stack und zum Context Engineering behandeln das. In diesem Framework geht es darum, ob das, was Sie fragen, überhaupt fragenswert ist, und das zählt genauso, wenn die Person auf der anderen Seite des Tisches ein Mensch ist.

Wenn Menschen gute Fragen so gut erkennen, warum nicht einfach die KI bitten, meine Frage zu verbessern?
Das ist eine vernünftige Nutzung der Formulierungslücke, und wir empfehlen sie als Zwischenschritt. Aber Rothes Befund war, dass Menschen Fragen gut in eine Rangfolge bringen, wenn die Alternativen vorgegeben sind. Sie müssen die Umformulierung der KI immer noch bewerten, und dafür brauchen Sie die sechs Dimensionen ohnehin im Kopf.

Bremsen mich mehr Nachfragen aus?
In Huangs Daten enthielt das durchschnittliche Speed-Date bereits 4,51 Nachfragen in vier Minuten, die Kosten sind also gering. Die Zeit, die Sie sparen, weil Sie nicht auf eine missverstandene Frage hin handeln, ist die größere Zahl, auch wenn keine von uns gefundene Studie sie für die KI-Nutzung direkt gemessen hat.

Was ist die eine Änderung mit dem höchsten Wert?
Schreiben Sie die Nachfrage, bevor Sie die erste Antwort sehen. Das erzwingt die Spalten Entscheidungsbezug und Antwortform, und es ist das Verhalten, das laut den Nutzungsdaten von 2025 am schnellsten zurückgeht.

Kann ich das Framework auch für Meetings nutzen, nicht nur für KI?
Ja. Die Klassenzimmerzahlen von Graesser und Person (Lehrkräfte stellen 96 Prozent der Fragen, nur 4 Prozent davon auf hohem Niveau) beschreiben die meisten Statusmeetings. Dieselben sechs Spalten gelten für die Frage, die Sie Ihrer Führungskraft oder Ihrem Team mitbringen.

Quellen

  • Chatterji, Cunningham, Deming, Hitzig, Ong, Shan und Wadman, “How People Use ChatGPT”, National Bureau of Economic Research Working Paper 34255, September 2025.
  • Anthropic Economic Index, “Uneven geographic and enterprise AI adoption”, Bericht vom September 2025, und Handa, Tamkin et al., “Which Economic Tasks are Performed with AI? Evidence from Millions of Claude Conversations”, März 2025 (arXiv 2503.04761).
  • Graesser und Person, “Question Asking During Tutoring”, American Educational Research Journal, 31(1), 1994, S. 104 bis 137.
  • Rosenshine, Meister und Chapman, “Teaching Students to Generate Questions: A Review of the Intervention Studies”, Review of Educational Research, 66(2), 1996, S. 181 bis 221.
  • Huang, Yeomans, Brooks, Minson und Gino, “It Doesn’t Hurt to Ask: Question-Asking Increases Liking”, Journal of Personality and Social Psychology, 113(3), 2017, S. 430 bis 452.
  • Rothe, Lake und Gureckis, “Do People Ask Good Questions?”, Computational Brain and Behavior, 1, 2018, S. 69 bis 89.
  • Ruggeri, Lombrozo, Griffiths und Xu, “Sources of Developmental Change in the Efficiency of Information Search”, Developmental Psychology, 52(12), 2016, S. 2159 bis 2173.
  • Min, Michael, Hajishirzi und Zettlemoyer, “AmbigQA: Answering Ambiguous Open-domain Questions”, Proceedings of EMNLP 2020.
  • Lee, Sarkar, Tankelevitch, Drosos, Rintel, Banks und Wilson, “The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers”, Proceedings of CHI 2025, Microsoft Research.

Dieser Inhalt wurde nach eingehender Recherche mit Unterstützung von KI zusammengestellt und vom CEOtudent-Redaktionsteam geschrieben und für die Veröffentlichung aufbereitet.

This post is also available in: Türkçe English Français Español

Benzer içerikler