TL;DR. KI-Fehler kommen in der realen Arbeit häufig genug vor, um ein stetiger Nachschub an Übungsmaterial zu sein, und die meisten Menschen werfen dieses Material weg. In einem randomisierten Feldexperiment mit fast tausend Mathematikschülerinnen und -schülern einer weiterführenden Schule (Bastani und Kollegen, PNAS, 2025) steigerte eine schlichte GPT-4-Oberfläche die Übungsergebnisse um 48 Prozent, doch diese Lernenden schnitten um 17 Prozent schlechter ab als die Kontrollgruppe, sobald das Tool entfernt wurde. Dasselbe Tool gab nur in 51 Prozent der Fälle eine richtige Antwort. Eine Evaluation von Stanford und Yale ergab, dass führende juristische Recherchetools in 17 bis 33 Prozent der Fälle halluzinieren. Auf der Lernseite fand eine Metaanalyse von 24 Studien zum Fehlermanagement-Training einen positiven mittleren Effekt von d = 0,44, der beim Transfer auf strukturell neue Aufgaben auf d = 0,80 steigt. Der CEO-Zug: Führen Sie ein KI-Fehlerprotokoll und eine schriftliche Prüfrichtlinie, damit Fehler zu einem gesteuerten Risiko werden statt zu einer Überraschung. Der Studenten-Zug: Behandeln Sie jeden entdeckten Fehler als Übungseinheit, klassifizieren Sie ihn, arbeiten Sie ihn ohne das Tool neu durch und werten Sie das Protokoll jede Woche aus.
Dieser Beitrag gehört zum Cluster Bewertung. Beginnen Sie mit dem Hub, die Bewertungskompetenz: KI-Ausgaben beurteilen, für die Gesamtmethode. Zur Mechanik hinter den Fehlern siehe warum KI halluziniert und wie Sie Modellfehler früh erkennen. Zur Frage, wie viel Prüfung eine Aufgabe verdient, siehe Vertrauenskalibrierung: wann Sie KI-Empfehlungen vertrauen können.
Warum einen KI-Fehler als Trainingsdaten behandeln statt als Ärgernis?
Die übliche Reaktion auf einen Modellfehler lautet: korrigieren und weitermachen. Das erledigt die Ausgabe und verschenkt die Lektion. Zwei Forschungsstränge legen eine bessere Nutzung nahe.
Der erste ist die Psychologie des Lernens aus Fehlern. Janet Metcalfes Übersichtsarbeit im Annual Review of Psychology (2017) fasst die Laborbefunde in einem Satz zusammen: “Fehlerbehaftetes Lernen, auf das korrigierendes Feedback folgt, ist dem Lernen förderlich.” Sie fügt eine Bedingung hinzu, die für alle wichtig ist, die mit KI arbeiten: “Korrigierendes Feedback, einschließlich einer Analyse der Überlegungen, die zu dem Fehler geführt haben, ist entscheidend.” Eine falsche Zahl zu korrigieren genügt nicht. Der Gewinn entsteht, wenn man herausarbeitet, warum sie falsch war.
Der zweite sind die Belege dafür, was geschieht, wenn Menschen KI ohne diese Analyse nutzen. Die Autoren des PNAS-Feldexperiments benennen das Risiko deutlich. Weil generative KI fehlbar ist, “müssen Nutzer ihre Ausgaben wachsam prüfen und vorhandene Probleme beheben; wenn sie die zugrunde liegenden Fähigkeiten nicht erlernen, fehlt ihnen möglicherweise die dafür erforderliche Expertise.” Die Fähigkeit zu prüfen hängt von der Fähigkeit ab, es selbst zu tun. Wenn die KI-Nutzung die zweite aushöhlt, geht die erste mit verloren.
Jede falsche Antwort eines Modells ist entweder eine kleine Steuer, die gezahlt und vergessen wird, oder eine Aufgabe mit angehängtem Feedback. Das ist die CEO- und Studenten-Perspektive, angewandt auf ein und denselben Gegenstand. Ein Vorstandsvorsitzender behandelt einen Mangel nicht als Pech; der Mangel wird protokolliert, klassifiziert und auf einen Prozess zurückgeführt. Ein guter Student behandelt eine falsche Antwort nicht als Peinlichkeit; die falsche Antwort ist der aufschlussreichste Punkt auf der Seite. Das unten beschriebene KI-Fehlerprotokoll ist beides zugleich.
Wie oft liegt KI tatsächlich falsch?
Die ehrliche Antwort lautet: Es gibt keine einheitliche Quote. Veröffentlichte Fehlerquoten unterscheiden sich je nach Aufgabe um mehr als eine Größenordnung. Die folgenden Zahlen entsprechen den Angaben in ihren Quellen.
| Aufgabe und getestetes System | Veröffentlichte Zahl | Quelle |
|---|---|---|
| Zusammenfassung eines vorgelegten Nachrichtendokuments, beste Modelle der HHEM-Rangliste | Niedrigste Halluzinationsrate 1,3 % (zwei Modelle gleichauf), danach 1,4 % und 1,5 % | Stanford HAI, AI Index Report 2025 |
| Kurze Faktenfragen (SimpleQA, über 4.000 Fragen) | Das beste Modell beantwortete 42,7 % der Fragen erfolgreich | Stanford HAI, AI Index Report 2025 |
| Mathematik-Übungsaufgaben der weiterführenden Schule, GPT-4 hinter einer schlichten Chat-Oberfläche | Richtige Antwort in 51 % der Fälle; logische Fehler 42 %; Rechenfehler 8 % | Bastani et al., PNAS, 2025 |
| Juristische Recherchefragen, kommerzielle Tools mit Retrieval (202 Anfragen) | Halluzination in 17 % bis 33 % der Fälle | Magesh et al., Preprint 2024 |
| Direkte, überprüfbare Fragen zu Fällen der US-Bundesgerichte, Allzweckmodelle | Halluzination in 58 % (ChatGPT 4) bis 88 % (Llama 2) der Fälle | Dahl et al., 2024 |
Quellen: Stanford Institute for Human-Centered AI, AI Index Report 2025, Kapitel 3; Bastani et al., PNAS 122, 2025; Magesh et al., arXiv-Preprint 2405.20362, 2024; Dahl et al., arXiv 2401.01301, erscheint im Journal of Legal Analysis. Alle Zahlen beschreiben die konkret getesteten Modelle und Zeitpunkte und sind keine aktuellen Quoten für irgendein Produkt.
Aus der Tabelle folgen drei Punkte.
Erstens hängt die Quote weit stärker von der Aufgabe ab als von der Marke. Das Experiment der Harvard Business School und der Boston Consulting Group gab dieser Ungleichmäßigkeit einen Namen. Sein Abstract beschreibt eine “gezackte technologische Grenze”, an der KI-Unterstützung “die Leistung bei manchen Aufgaben verbessert, bei anderen aber verschlechtert, sogar innerhalb desselben Wissens-Workflows und bei scheinbar ähnlichem Schwierigkeitsgrad.”
Zweitens verringern spezialisierte Tools Fehler, ohne sie zu beseitigen. Die juristische Studie testete Produkte, deren Anbieter ein Ende der Halluzinationen beworben hatten. Die Autoren berichten, dass Lexis+ AI 65 Prozent der Anfragen korrekt beantwortete, dass Westlaws AI-Assisted Research in 42 Prozent der Fälle korrekt war und dass “mehr als 1 von 6” Anfragen Lexis+ AI und Ask Practical Law AI dazu brachten, mit irreführenden oder falschen Informationen zu antworten. Ihre Definition ist für jedes Fehlerprotokoll nützlich: Eine Antwort gilt als halluziniert, “wenn sie entweder inkorrekt oder falsch belegt ist”.
Drittens sind die Modelle schlechte Richter ihrer eigenen Fehler. Dahl und Kollegen kommen zu dem Schluss, dass die Modelle “Mühe haben, ihre eigenen Halluzinationen vorherzusagen, und falsche juristische Annahmen der Nutzer oft unkritisch übernehmen.” Ein selbstsicherer Ton ist kein Beleg.
Was passiert, wenn Menschen nicht aus KI-Fehlern lernen?
Das PNAS-Experiment liefert den klarsten Beleg, weil es sowohl die Leistung mit Unterstützung als auch die anschließende Leistung ohne Unterstützung gemessen hat. Die Studie lief an einer weiterführenden Schule in der Türkei im Herbsthalbjahr des Schuljahres 2023-2024, über vier 90-minütige Sitzungen und etwa fünfzig Klassen. Die Lernenden übten mit einem von zwei GPT-4-Tools oder nur mit Lehrbüchern und schrieben danach eine Prüfung ohne Unterlagen.
| Messgröße | Kontrolle (nur Lehrbücher) | GPT Base (schlichte Chat-Oberfläche) | GPT Tutor (von Lehrkräften entworfene Prompts) |
|---|---|---|---|
| Übungsergebnis mit Unterstützung, Veränderung gegenüber der Kontrolle (von 1) | Mittelwert 0,28 | +0,137 | +0,361 |
| Übungsverbesserung wie angegeben | – | 48 % | 127 % |
| Prüfung ohne Unterstützung, Veränderung gegenüber der Kontrolle (von 1) | – | -0,054 | -0,004 |
| Prüfungseffekt wie angegeben | – | 17 % Rückgang | Statistisch nicht von der Kontrolle zu unterscheiden |
Quelle: Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R, PNAS 122, e2422633122, 2025.
Zwei Details machen daraus mehr als eine Warnung über Schulkinder. Die Autoren prüften das schlichte Tool, indem sie ihm jede der 57 Übungsaufgaben zehnmal stellten. Es “gibt im Durchschnitt nur in 51 % der Fälle eine richtige Antwort”, mit logischen Fehlern in 42 Prozent und Rechenfehlern in 8 Prozent der Fälle. Die Lernenden übten mit einem Tutor, der etwa in der Hälfte der Fälle falsch lag, und die Prüfung ohne Unterstützung zeigt, dass sie diese Fehler nicht in Lernen verwandelt haben.
Sie haben es auch nicht bemerkt. Die Lernenden im GPT-Base-Arm “nahmen nicht wahr, dass sie schlechter abschnitten oder weniger lernten.” Das Gefühl des Fortschritts und die Tatsache des Fortschritts fielen auseinander.
Das Beratungsexperiment zeigt dasselbe Muster in der professionellen Arbeit. Unter 758 Wissensarbeitern erledigten diejenigen, die GPT-4 bei 18 Aufgaben innerhalb der Grenze nutzten, 12,2 Prozent mehr Aufgaben und schlossen sie 25,1 Prozent schneller ab. Bei einer Aufgabe, die bewusst außerhalb der Grenze gewählt wurde, war es bei ihnen “um 19 % weniger wahrscheinlich, dass sie korrekte Lösungen lieferten, verglichen mit jenen ohne KI.” Das Tool kündigte nicht an, auf welcher Seite der Grenze eine Aufgabe lag. Nur wer prüfte, konnte es wissen.
Ältere Forschung zu Entscheidungsunterstützungssystemen erklärt den Mechanismus. Eine systematische Übersichtsarbeit zum Automation Bias im Journal of the American Medical Informatics Association sichtete 13.821 Arbeiten und schloss 74 ein. In ihrer gepoolten Analyse von vier Studien lag das Risikoverhältnis bei 1,26 (95-%-KI 1,11 bis 1,44): War der Rat des Systems falsch, so “erhöhte er das Risiko einer falschen Entscheidung um 26 %.” Die Übersichtsarbeit beschreibt zwei Arten menschlicher Fehler: Commission, das Befolgen eines falschen Rats, und Omission, das Unterlassen einer Handlung, weil das System nicht dazu aufgefordert hat. Beide gehören in ein Fehlerprotokoll, denn beide sind Ihre Fehler, nicht die des Modells.
Was sagt die Lernforschung über Fehler, die korrigiert werden?
Wenn unkorrigierte Fehler schaden, weist die Forschung zu korrigierten Fehlern in die andere Richtung. Die Zahlen entsprechen den Angaben der jeweiligen Quelle.
| Befund | Evidenzbasis | Effektstärke wie angegeben |
|---|---|---|
| Fehlermanagement-Training, insgesamt (Keith und Frese, 2008) | 24 Studien, N = 2.183 | Cohens d = 0,44 |
| Dasselbe, Transfer nach dem Training | Moderatoranalyse | d = 0,56 |
| Dasselbe, strukturell andersartige Aufgaben (adaptiver Transfer) | Moderatoranalyse | d = 0,80 |
| Problemlösen vor der Instruktion (Sinha und Kapur, 2021) | 53 Studien, 166 Vergleiche | Hedges g 0,36, 95-%-KI 0,20 bis 0,51 |
| Dasselbe, hohe Treue zu den Prinzipien des produktiven Scheiterns | Teilmenge | Hedges g zwischen 0,37 und 0,58 |
Quellen: Keith N, Frese M, Journal of Applied Psychology 93(1), 2008; Sinha T, Kapur M, Review of Educational Research 91(5), 2021. Beide nur auf Abstract-Ebene gelesen.
Vier Befunde lassen sich direkt in die Praxis mit KI übertragen.
Fehler helfen am meisten bei neuen Problemen. Keith und Frese fanden den größten Effekt beim adaptiven Transfer, 0,80 gegenüber 0,44 insgesamt, etwa das 1,8-Fache des Durchschnitts. Fehlerbasiertes Training ist “besser geeignet als fehlervermeidende Trainingsmethoden, um den Transfer auf neuartige Aufgaben zu fördern.” Neuartige Aufgaben sind das, woraus ein Job im KI-Zeitalter zunehmend besteht.
Es zuerst selbst zu versuchen zählt, selbst wenn der Versuch scheitert. Kornell, Hays und Bjork führten sechs Experimente durch, in denen die Teilnehmenden Antworten erraten mussten, die sie nicht kennen konnten, bevor sie diese sahen. Ihr Fazit: “Erfolglose Abrufversuche verbesserten das Lernen bei beiden Arten von Material.” Für die KI-Nutzung folgt daraus eine Reihenfolgeregel. Bilden Sie Ihre eigene Antwort, Schätzung oder Gliederung, bevor Sie die des Modells lesen.
Fehler mit hoher Gewissheit sind am besten korrigierbar. Butterfield und Metcalfe erwarteten, dass Fehler mit hoher Gewissheit am schwersten zu beheben wären. Sie fanden das Gegenteil: “Fehler mit hoher Gewissheit wurden in einem anschließenden Wiederholungstest am ehesten korrigiert.” Deshalb hält das Protokoll unten Ihre Gewissheit vor der Prüfung fest. Die Einträge, bei denen Sie sicher waren und falsch lagen, sind die wertvollsten.
Feedback muss die Begründung enthalten. Metcalfes oben zitierte Bedingung schließt die bequeme Version eines Fehlerprotokolls aus. Eine Liste falscher Ausgaben lehrt wenig. Eine Liste falscher Ausgaben mit der Ursache und der Prüfung, die den Fehler aufgedeckt hätte, ist ein Lehrplan.
Ein Vorbehalt: Sinha und Kapur berichten, dass beim “Erlernen domänenübergreifender Fähigkeiten” die Effektstärken für die Instruktion zuerst sprachen. Das Prüfen von KI-Ausgaben ist zum Teil eine allgemeine Fähigkeit, lernen Sie die Prüfungen also auch ausdrücklich. Die Taxonomie unten ist diese Instruktion.
Welche menschliche Fähigkeit trainiert welcher KI-Fehlertyp?
CEOtudent-Redaktionsrahmen: die KI-Fehlertaxonomie. Die ersten sechs Zeilen sind Fehler auf der Modellseite; die letzten beiden sind Fehler auf der menschlichen Seite, entnommen der Literatur zum Automation Bias. Die Zuordnung zu Fähigkeiten ist ein redaktionelles Urteil, kein Messergebnis.
| Code | Fehlertyp | Wie er aussieht | Menschliche Fähigkeit, die er trainiert | Die Übungseinheit |
|---|---|---|---|---|
| F | Erfundene Quelle oder Tatsache | Ein Beleg, ein Fall, ein Zitat oder eine Statistik, die nicht existiert | Quellenprüfung | Das Original öffnen und die genaue Zeile finden, bevor Sie sie verwenden |
| M | Falsch belegte Behauptung | Eine echte Quelle, zitiert für etwas, das sie nicht sagt | Genaues Lesen | Die Behauptung Wort für Wort mit der zitierten Passage vergleichen |
| L | Logischer Fehler | Plausible Schritte, die nicht folgen, oder die falsche Methode | Schlussfolgern und Problemstrukturierung | Die ersten zwei Schritte ohne Hilfe wiederholen, dann finden, wo sich die Wege trennen |
| A | Rechen- oder Einheitenfehler | Richtige Methode, falsche Zahl | Schätzen | Eine Größenordnungsschätzung aufschreiben, bevor Sie die Antwort lesen |
| P | Übernommene falsche Prämisse | Das Modell baut auf einer falschen Annahme im Prompt auf | Fragestellung | Dieselbe Frage mit neutral formulierter Prämisse stellen |
| S | Themenabweichung oder unvollständige Antwort | Beantwortet eine benachbarte Frage oder lässt einen geforderten Teil aus | Briefing-Schreiben | Das Briefing mit einer Definition of Done neu schreiben und erneut ausführen |
| C | Commission (Mensch) | Sie haben eine falsche Ausgabe ungeprüft übernommen | Prüfdisziplin | Die ausgelassene Prüfung benennen und in die Richtlinie aufnehmen |
| O | Omission (Mensch) | Sie haben etwas übersehen, weil das Modell es nicht angesprochen hat | Eigenständiges Absuchen | Vor dem Prompten auflisten, was eine gute Antwort enthalten muss |
Die Codes folgen Unterscheidungen aus den Quellen: inkorrekte gegenüber falsch belegten Antworten in der juristischen Studie, logische gegenüber Rechenfehlern im PNAS-Audit (42 gegenüber 8 Prozent), übernommene falsche Prämissen bei Dahl und Kollegen sowie Commission gegenüber Omission in der Übersichtsarbeit zum Automation Bias.
Ein Muster in den Codes ist eine Diagnose. Viele S-Einträge bedeuten, dass die Briefings schwach sind. Viele C-Einträge bedeuten, dass die Prüfrichtlinie nicht befolgt wird. Viele F- und M-Einträge in einem Fachgebiet bedeuten, dass das Tool bei dieser Aufgabe jenseits seiner Grenze liegt. Zur Briefing-Seite dieser Schleife siehe das KI-Management-Playbook.
Was sollte ein KI-Fehlerprotokoll enthalten?
CEOtudent-Redaktionsrahmen: die Vorlage für das KI-Fehlerprotokoll. Eine Zeile pro entdecktem Fehler. Eine Tabellenkalkulation oder eine Notizdatei genügt.
| Spalte | Was einzutragen ist | Warum sie da ist |
|---|---|---|
| Datum und Aufgabe | Was erstellt wurde und für wen | Zeigt, welche Workflows Fehler erzeugen |
| Tragweite | Niedrig, mittel oder hoch | Verknüpft den Eintrag mit der Prüfrichtlinie |
| Tool und Modus | Modell, mit oder ohne Suche oder Dokumente | Fehlerquoten unterscheiden sich je nach Aufgabe und Setup |
| Der Fehler, wörtlich | Der genaue falsche Satz oder die falsche Zahl | Verhindert vage Erinnerung |
| Code | F, M, L, A, P, S, C oder O | Macht die wöchentliche Zählung möglich |
| Wie er entdeckt wurde | Welche Prüfung, oder wer ihn nachgelagert gefunden hat | Zeigt, welche Prüfungen ihre Zeit wert sind |
| Gewissheit vor der Prüfung | 0 bis 100, dass die Ausgabe richtig war | Macht Treffer mit hoher Gewissheit sichtbar, die am besten korrigierbare Art |
| Ursache auf der menschlichen Seite | Schwaches Briefing, fehlender Kontext, ausgelassene Prüfung, unvertrautes Fachgebiet | Verlagert die Lektion vom Modell zum Nutzer |
| Richtige Antwort und Quelle | Die Korrektur, mit dem Ort, an dem sie verifiziert wurde | Das korrigierende Feedback selbst |
| Regeländerung | Die Zeile, die der Prüfrichtlinie hinzugefügt wurde, oder “keine” | Macht aus dem Fehler eine Prozessänderung |
| Datum des Wiederholungstests | Wann dieser Punkt ohne Hilfe neu durchzuarbeiten ist | Plant die Übungseinheit ein |
Zwei Spalten leisten den Großteil der Arbeit. Einträge, die nachgelagert von einer Kollegin, einem Kunden oder einem Prüfer entdeckt wurden, sind Durchrutscher; ihr Anteil an allen Einträgen zeigt, ob das Prüfen funktioniert. Die Gewissheitsspalte schützt vor der Wahrnehmungslücke aus der PNAS-Studie: Eine Zahl, die vor der Prüfung aufgeschrieben wurde, lässt sich nachträglich nicht korrigieren.
Für dasselbe Vorher-nachher-Format, angewandt auf Entscheidungen, siehe die Vorlage und das Protokoll für das Entscheidungsjournal.
Wie viel Übungsmaterial gibt es?
CEOtudent-Analyse der oben veröffentlichten Quoten. Die Tabelle rechnet jede angegebene Quote in das um, worauf eine Person stößt, die jede Ausgabe prüft. Sie nimmt an, dass jede Ausgabe eine unabhängige Ziehung mit der angegebenen Quote ist, was eine Vereinfachung darstellt: Echte Fehler häufen sich nach Aufgabentyp.
| Kontext und angegebene Quote | Erwartete Fehler pro 20 Ausgaben | Wahrscheinlichkeit von mindestens einem Fehler in 10 Ausgaben | Im Durchschnitt ein Fehler alle | Fehler in 50 Wochen bei 20 geprüften Ausgaben pro Woche |
|---|---|---|---|---|
| Dokumentzusammenfassungen, beste Modelle, 1,3 % | 0,3 | 12,3 % | 76,9 Ausgaben | 13 |
| Juristische Recherchetools, unteres Ende, 17 % | 3,4 | 84,5 % | 5,9 Ausgaben | 170 |
| Juristische Recherchetools, oberes Ende, 33 % | 6,6 | 98,2 % | 3,0 Ausgaben | 330 |
| Mathematikantworten von schlichtem GPT-4, 49 % (100 minus 51) | 9,8 | 99,9 % | 2,0 Ausgaben | 490 |
| Allgemeiner Chatbot bei Fragen zur Rechtsprechung, unteres Ende, 58 % | 11,6 | über 99,9 % | 1,7 Ausgaben | 580 |
Quelle: CEOtudent-Berechnungen (calc.py) aus den im AI Index Report 2025, bei Magesh et al. 2024, Bastani et al. 2025 und Dahl et al. 2024 angegebenen Quoten. Zur Veranschaulichung, keine Prognose für irgendein aktuelles Tool.
Bei einer Quote von 17 Prozent hat jemand, der zehn Ausgaben ungeprüft übernimmt, eine Wahrscheinlichkeit von 84,5 Prozent, dass mindestens eine falsch ist. Dieselbe Quote ergibt mit Prüfung etwa 170 durchgearbeitete Beispiele mit Feedback in einem Jahr. Das untere Ende des allgemeinen Chatbots liegt beim 3,4-Fachen der spezialisierten Tools, die Toolwahl verändert also die Last, ohne sie zu beseitigen.
Bei 1,3 Prozent tritt etwa einmal in 77 Ausgaben ein Fehler auf, die Bedingung, unter der die Aufmerksamkeit abschweift. Aufgaben mit niedriger Quote brauchen eine feste Stichprobenregel in der Richtlinie, nicht Wachsamkeit.
Wie führen Sie die Wochenauswertung durch?
CEOtudent-Redaktionsprotokoll: 20 Minuten, einmal pro Woche. Über 50 Wochen sind das etwa 16,7 Stunden.
- Zählen und klassifizieren (5 Minuten). Zählen Sie die Einträge der Woche nach Code aus. Notieren Sie die Durchrutscher, also die Einträge, die jemand anderes entdeckt hat.
- Einen Fehler ohne Hilfe neu durcharbeiten (5 Minuten). Nehmen Sie den Eintrag mit der höchsten Gewissheit vor der Prüfung. Erarbeiten Sie ohne das Tool die richtige Antwort oder die richtige Methode. Das ist der Abrufversuch; er wirkt auch, wenn er scheitert, sofern die richtige Antwort anschließend durchgesehen wird.
- Die Ursache zurückverfolgen (5 Minuten). Schreiben Sie für die zwei häufigsten Codes einen Satz zur Ursache auf der menschlichen Seite. Nutzen Sie Metcalfes Bedingung als Test: Die Notiz muss die Überlegung beschreiben, die zu dem Versäumnis geführt hat, nicht nur das Versäumnis.
- Eine Regel ändern (3 Minuten). Ergänzen, verschärfen oder streichen Sie eine Zeile der Prüfrichtlinie. Eine Änderung pro Woche genügt; mehr wird nicht befolgt.
- Den Wiederholungstest einplanen (2 Minuten). Legen Sie ein Datum fest, an dem Sie den Punkt dieser Woche erneut durcharbeiten, und arbeiten Sie den Punkt durch, der aus einer früheren Woche fällig geworden ist.
Prüfen Sie einmal im Monat, ob der Anteil der Durchrutscher sinkt und ob sich die Mischung der Codes von C und S wegbewegt.
Wie sieht die CEO-Seite aus: die Prüfrichtlinie?
Ein Protokoll ohne Richtlinie ist ein Tagebuch. Die Richtlinie ist ein kurzes schriftliches Dokument, das festlegt, wie viel Prüfung jede Klasse von Arbeit erhält, bevor sie Ihre Hände verlässt. Die Forschung zum Automation Bias spricht dafür, sie aufzuschreiben. Die JAMIA-Übersichtsarbeit führt “Schulung und die Betonung der Verantwortlichkeit der Nutzer” unter den abmildernden Faktoren auf und berichtet von einer Studie, in der Menschen, die sich selbst als rechenschaftspflichtig wahrnahmen, weniger Automation-Bias-Fehler machten. Parasuraman und Manzey sind weniger optimistisch und kommen zu dem Schluss, dass Automation Bias “nicht durch Schulung oder Anweisungen verhindert werden kann.” Die beiden Übersichtsarbeiten sind sich im praktischen Punkt einig: Gute Absichten sind keine Kontrolle. Ein benannter Verantwortlicher und ein festes Verfahren sind es.
CEOtudent-Redaktionsrahmen: eine dreistufige Prüfrichtlinie.
| Stufe | Typische Arbeit | Mindestprüfung |
|---|---|---|
| 1. Geringe Tragweite, umkehrbar | Entwürfe, Brainstorming, interne Notizen | Einmal lesen; stichprobenartig eine Tatsache pro Dokument prüfen |
| 2. Mittlere Tragweite | Texte für Kunden, Analysen, die eine Entscheidung stützen, Code, der ausgeführt wird | Jede Zahl, jeden Namen, jedes Datum und jeden Beleg an einer Quelle verifizieren; Berechnungen unabhängig wiederholen |
| 3. Hohe Tragweite oder außerhalb Ihrer Expertise | Juristische, medizinische, finanzielle oder sicherheitsrelevante Inhalte; alles, was unterschrieben oder veröffentlicht wird | Prüfungen der Stufe 2 plus Durchsicht durch eine qualifizierte Person; keine Quelle, keine Behauptung |
Zwei Regeln halten die Richtlinie ehrlich. Jeder Durchrutscher verschiebt diesen Aufgabentyp um eine Stufe nach oben, bis ein Monat ohne einen weiteren vergeht. Und jede Regel benennt ihre Prüfung, nicht eine Absicht (“die zitierte Seite öffnen”, nicht “vorsichtig sein”).
Die Umfrage von Lee und Kollegen bei Microsoft Research und Carnegie Mellon zeigt, warum die Richtlinie nicht auf Gefühl beruhen kann. Unter 319 Wissensarbeitern, die 936 Beispiele für den Einsatz generativer KI bei der Arbeit teilten, “geht höheres Vertrauen in GenAI mit weniger kritischem Denken einher, während höheres Selbstvertrauen mit mehr kritischem Denken einhergeht.” Vertrauen in das Tool senkte das Prüfen genau dort, wo das Prüfen die einzige Absicherung war. Die Lücke zwischen Vertrauen in das Tool und Selbstvertrauen ist das Thema von die Unterscheidungslücke.
Lernen Sie aus KI-Fehlern? Eine Scorecard mit 8 Fragen
CEOtudent-Redaktions-Scorecard. Bewerten Sie jede Frage mit 0 (nein), 1 (manchmal) oder 2 (durchgängig). Maximum 16.
- Bilden Sie Ihre eigene Schätzung, Gliederung oder Antwort, bevor Sie die des Modells lesen?
- Halten Sie entdeckte Fehler irgendwo fest, mit dem genauen falschen Text?
- Klassifizieren Sie jeden Fehler nach Typ?
- Schreiben Sie Ihre Gewissheit auf, bevor Sie prüfen?
- Notieren Sie die Ursache auf der menschlichen Seite, nicht nur den Fehler des Modells?
- Arbeiten Sie jede Woche mindestens einen Fehler ohne Hilfe neu durch?
- Haben Sie eine schriftliche Prüfrichtlinie mit Stufen nach Tragweite?
- Erfassen Sie Fehler, die jemand anderes nach Ihnen entdeckt hat?
| Punktzahl | Lesart | Nächster Schritt |
|---|---|---|
| 0-6 | Fehler werden korrigiert und vergessen | Beginnen Sie das Protokoll mit fünf Spalten: Aufgabe, Fehler, Code, Ursache, Korrektur |
| 7-11 | Fehler werden erfasst, aber noch nicht umgewandelt | Ergänzen Sie die Gewissheitsspalte und die wöchentliche Neubearbeitung ohne Hilfe |
| 12-16 | Fehler sind ein funktionierender Lehrplan | Verfolgen Sie den monatlichen Anteil der Durchrutscher und streichen Sie Regeln, die nie greifen |
Was das nicht bedeutet
KI-Fehler sind nicht gut, und mehr Fehler sind nicht besser. Die Lernforschung handelt von korrigierten Fehlern in Situationen mit geringer Tragweite. Metcalfes Übersichtsarbeit empfiehlt, Fehler zuzulassen, “solange sie in Lernsituationen mit geringer Tragweite auftreten”, nicht in Arbeit, die einen Kunden oder ein Gericht erreicht.
Die Verbindung von KI-Fehlern zu menschlicher Kompetenz ist ein Rückschluss. Die hier zitierten Lernstudien untersuchen die eigenen Fehler von Menschen, überwiegend in Klassenzimmern, Laboren und Schulungen. Keine für diesen Artikel geöffnete Studie hat getestet, ob das Protokollieren der Fehler eines Modells das Urteilsvermögen des Nutzers verbessert. Der Rahmen wendet etablierte Prinzipien auf eine neue Situation an; er ist kein gemessener Effekt.
Die Fehlerquoten sind Momentaufnahmen. Sie beschreiben konkrete Modelle, die 2023 und 2024 getestet wurden. Die Autoren der juristischen Studie weisen darauf hin, dass ihre Schätzung “nicht als unverzerrte Schätzung” der Populationsrate von Halluzinationen bei juristischen KI-Anfragen gedacht ist. Aktuelle Tools können bei jeder beliebigen Aufgabe besser oder schlechter abschneiden.
Die Tabelle zum Übungsmaterial ist Arithmetik, keine Vorhersage. Sie nimmt unabhängige Fehler mit konstanter Quote an und dass jeder Fehler entdeckt wird.
Häufig gestellte Fragen
Wie viele Fehler braucht es, bevor ein Protokoll nützlich ist?
Eine Handvoll. Das Wochenprotokoll funktioniert mit einem Eintrag, weil Schritt 2 nur einen Punkt zum Neudurcharbeiten braucht. Muster in den Codes brauchen meist Einträge aus einigen Wochen.
Sollten Fehler protokolliert werden, wenn die Tragweite trivial war?
Ja, kurz. Fehler mit geringer Tragweite sind das sicherste Übungsmaterial, und sie legen dieselben Schwächen in Briefings und Prüfungen offen, die Fehler mit hoher Tragweite verursachen.
Lohnt es sich, Fehler zu protokollieren, an denen der Nutzer schuld war?
Das sind die nützlichsten Einträge. Die Codes C und O existieren, weil die Literatur zum Automation Bias das Befolgen falscher Ratschläge und das Übersehen nicht angesprochener Probleme als menschliche Fehler behandelt.
Macht ein besseres Modell das Protokoll überflüssig?
Nein. Niedrigere Fehlerquoten machen jeden Fehler seltener und damit leichter zu übersehen. Das Protokoll wandelt sich dann von einer Übungsquelle zu einem Stichprobennachweis, der zeigt, dass die Prüfungen weiterhin durchgeführt werden.
Was ist der schnellste erste Schritt?
Schreiben Sie vor der nächsten KI-Antwort zu etwas, das zählt, eine einzeilige Schätzung dessen auf, wie die Antwort lauten sollte. Vergleichen Sie dann. Diese eine Gewohnheit wendet den Abrufbefund an und macht den ersten Protokolleintrag leicht zu schreiben.
Quellen
- Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R. Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences 122, e2422633122, 2025. Eine Korrektur von 2025 betrifft nur die Affiliation eines Autors.
- Magesh V, Surani F, Dahl M, Suzgun M, Manning CD, Ho DE. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. arXiv-Preprint 2405.20362, 2024.
- Dahl M, Magesh V, Suzgun M, Ho DE. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. arXiv 2401.01301, 2024, erscheint im Journal of Legal Analysis.
- Maslej N, et al. The AI Index 2025 Annual Report. AI Index Steering Committee, Institute for Human-Centered AI, Stanford University, April 2025. Kapitel 3, Responsible AI.
- Dell’Acqua F, McFowland E, Mollick E, Lifshitz-Assaf H, Kellogg KC, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science 37(2): 403-423, 2026. Nur Abstract.
- Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association 19(1): 121-127, 2012.
- Parasuraman R, Manzey DH. Complacency and Bias in Human Use of Automation: An Attentional Integration. Human Factors 52(3): 381-410, 2010. Nur Abstract.
- Lee HP, Sarkar A, Tankelevitch L, et al. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI Conference on Human Factors in Computing Systems, 2025.
- Metcalfe J. Learning from Errors. Annual Review of Psychology 68: 465-489, 2017. Nur Abstract.
- Keith N, Frese M. Effectiveness of Error Management Training: A Meta-Analysis. Journal of Applied Psychology 93(1): 59-69, 2008. Nur Abstract.
- Sinha T, Kapur M. When Problem Solving Followed by Instruction Works: Evidence for Productive Failure. Review of Educational Research 91(5): 761-798, 2021. Nur Abstract.
- Kornell N, Hays MJ, Bjork RA. Unsuccessful Retrieval Attempts Enhance Subsequent Learning. Journal of Experimental Psychology: Learning, Memory, and Cognition 35(4): 989-998, 2009.
- Butterfield B, Metcalfe J. Errors Committed With High Confidence Are Hypercorrected. Journal of Experimental Psychology: Learning, Memory, and Cognition 27(6): 1491-1494, 2001. Nur Abstract.
Datentabellen geben die Zahlen so wieder, wie sie in ihren Quellen stehen. Die Fehlertaxonomie, die Vorlage für das Fehlerprotokoll, die Tabelle zum Übungsmaterial, das Protokoll der Wochenauswertung, die Prüfrichtlinie und die Scorecard sind CEOtudent-Analysen oder Redaktionsrahmen; die Vielfachen 1,8 und 3,4 sind CEOtudent-Berechnungen. Nicht verwendet: die Working-Paper-Fassung des Beratungsexperiments, die nicht geöffnet werden konnte; die nur als Diagramm vorliegenden Werte der juristischen Studie für GPT-4; die bias-adjustierte Schätzung von 0,87 bei Sinha und Kapur; sowie verbreitete Behauptungen, Chatbots lägen zu einem festen Anteil falsch, die keine hier geöffnete Quelle stützt.
Dieser Inhalt wurde nach eingehender Recherche mit Unterstützung von KI zusammengestellt und vom CEOtudent-Redaktionsteam geschrieben und für die Veröffentlichung aufbereitet.
This post is also available in:








