{"id":326437,"date":"2026-10-10T12:37:30","date_gmt":"2026-10-10T09:37:30","guid":{"rendered":"https:\/\/ceotudent.com\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn"},"modified":"2026-10-10T12:37:30","modified_gmt":"2026-10-10T09:37:30","slug":"aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn","status":"publish","type":"post","link":"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn","title":{"rendered":"Aus KI-Fehlern lernen: So werden Modellfehler zu Ihrem eigenen Kompetenzgewinn"},"content":{"rendered":"<p><strong>TL;DR.<\/strong> KI-Fehler kommen in der realen Arbeit h\u00e4ufig genug vor, um ein stetiger Nachschub an \u00dcbungsmaterial zu sein, und die meisten Menschen werfen dieses Material weg. In einem randomisierten Feldexperiment mit fast tausend Mathematiksch\u00fclerinnen und -sch\u00fclern einer weiterf\u00fchrenden Schule (Bastani und Kollegen, PNAS, 2025) steigerte eine schlichte GPT-4-Oberfl\u00e4che die \u00dcbungsergebnisse um 48 Prozent, doch diese Lernenden schnitten um 17 Prozent schlechter ab als die Kontrollgruppe, sobald das Tool entfernt wurde. Dasselbe Tool gab nur in 51 Prozent der F\u00e4lle eine richtige Antwort. Eine Evaluation von Stanford und Yale ergab, dass f\u00fchrende juristische Recherchetools in 17 bis 33 Prozent der F\u00e4lle halluzinieren. Auf der Lernseite fand eine Metaanalyse von 24 Studien zum Fehlermanagement-Training einen positiven mittleren Effekt von d = 0,44, der beim Transfer auf strukturell neue Aufgaben auf d = 0,80 steigt. Der CEO-Zug: F\u00fchren Sie ein KI-Fehlerprotokoll und eine schriftliche Pr\u00fcfrichtlinie, damit Fehler zu einem gesteuerten Risiko werden statt zu einer \u00dcberraschung. Der Studenten-Zug: Behandeln Sie jeden entdeckten Fehler als \u00dcbungseinheit, klassifizieren Sie ihn, arbeiten Sie ihn ohne das Tool neu durch und werten Sie das Protokoll jede Woche aus.<\/p>\n<p>Dieser Beitrag geh\u00f6rt zum Cluster Bewertung. Beginnen Sie mit dem Hub, <a href=\"\/de\/die-bewertungskompetenz-ki-ausgaben-beurteilen\">die Bewertungskompetenz: KI-Ausgaben beurteilen<\/a>, f\u00fcr die Gesamtmethode. Zur Mechanik hinter den Fehlern siehe <a href=\"\/de\/warum-ki-halluziniert-mechanik-der-modellfehler-frueh-erkennen\">warum KI halluziniert und wie Sie Modellfehler fr\u00fch erkennen<\/a>. Zur Frage, wie viel Pr\u00fcfung eine Aufgabe verdient, siehe <a href=\"\/de\/vertrauenskalibrierung-wann-ki-empfehlungen-vertrauen\">Vertrauenskalibrierung: wann Sie KI-Empfehlungen vertrauen k\u00f6nnen<\/a>.<\/p>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_84 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Table of Contents<\/p>\n<span class=\"ez-toc-title-toggle\"><a href=\"#\" class=\"ez-toc-pull-right ez-toc-btn ez-toc-btn-xs ez-toc-btn-default ez-toc-toggle\" aria-label=\"Toggle Table of Content\"><span class=\"ez-toc-js-icon-con\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/span><\/a><\/span><\/div>\n<nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Warum-einen-KI-Fehler-als-Trainingsdaten-behandeln-statt-als-Aergernis\" >Warum einen KI-Fehler als Trainingsdaten behandeln statt als \u00c4rgernis?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Wie-oft-liegt-KI-tatsaechlich-falsch\" >Wie oft liegt KI tats\u00e4chlich falsch?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Was-passiert-wenn-Menschen-nicht-aus-KI-Fehlern-lernen\" >Was passiert, wenn Menschen nicht aus KI-Fehlern lernen?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Was-sagt-die-Lernforschung-ueber-Fehler-die-korrigiert-werden\" >Was sagt die Lernforschung \u00fcber Fehler, die korrigiert werden?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Welche-menschliche-Faehigkeit-trainiert-welcher-KI-Fehlertyp\" >Welche menschliche F\u00e4higkeit trainiert welcher KI-Fehlertyp?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Was-sollte-ein-KI-Fehlerprotokoll-enthalten\" >Was sollte ein KI-Fehlerprotokoll enthalten?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Wie-viel-Uebungsmaterial-gibt-es\" >Wie viel \u00dcbungsmaterial gibt es?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Wie-fuehren-Sie-die-Wochenauswertung-durch\" >Wie f\u00fchren Sie die Wochenauswertung durch?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Wie-sieht-die-CEO-Seite-aus-die-Pruefrichtlinie\" >Wie sieht die CEO-Seite aus: die Pr\u00fcfrichtlinie?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Lernen-Sie-aus-KI-Fehlern-Eine-Scorecard-mit-8-Fragen\" >Lernen Sie aus KI-Fehlern? Eine Scorecard mit 8 Fragen<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Was-das-nicht-bedeutet\" >Was das nicht bedeutet<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-12\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Haeufig-gestellte-Fragen\" >H\u00e4ufig gestellte Fragen<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-13\" href=\"https:\/\/ceotudent.com\/de\/aus-ki-fehlern-lernen-so-werden-modellfehler-zum-eigenen-kompetenzgewinn\/#Quellen\" >Quellen<\/a><\/li><\/ul><\/nav><\/div>\n<h2 id=\"warum-einen-ki-fehler-als-trainingsdaten-behandeln-statt-als-rgernis\"><span class=\"ez-toc-section\" id=\"Warum-einen-KI-Fehler-als-Trainingsdaten-behandeln-statt-als-Aergernis\"><\/span>Warum einen KI-Fehler als Trainingsdaten behandeln statt als \u00c4rgernis?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die \u00fcbliche Reaktion auf einen Modellfehler lautet: korrigieren und weitermachen. Das erledigt die Ausgabe und verschenkt die Lektion. Zwei Forschungsstr\u00e4nge legen eine bessere Nutzung nahe.<\/p>\n<p>Der erste ist die Psychologie des Lernens aus Fehlern. Janet Metcalfes \u00dcbersichtsarbeit im Annual Review of Psychology (2017) fasst die Laborbefunde in einem Satz zusammen: &ldquo;Fehlerbehaftetes Lernen, auf das korrigierendes Feedback folgt, ist dem Lernen f\u00f6rderlich.&rdquo; Sie f\u00fcgt eine Bedingung hinzu, die f\u00fcr alle wichtig ist, die mit KI arbeiten: &ldquo;Korrigierendes Feedback, einschlie\u00dflich einer Analyse der \u00dcberlegungen, die zu dem Fehler gef\u00fchrt haben, ist entscheidend.&rdquo; Eine falsche Zahl zu korrigieren gen\u00fcgt nicht. Der Gewinn entsteht, wenn man herausarbeitet, warum sie falsch war.<\/p>\n<p>Der zweite sind die Belege daf\u00fcr, was geschieht, wenn Menschen KI ohne diese Analyse nutzen. Die Autoren des PNAS-Feldexperiments benennen das Risiko deutlich. Weil generative KI fehlbar ist, &ldquo;m\u00fcssen Nutzer ihre Ausgaben wachsam pr\u00fcfen und vorhandene Probleme beheben; wenn sie die zugrunde liegenden F\u00e4higkeiten nicht erlernen, fehlt ihnen m\u00f6glicherweise die daf\u00fcr erforderliche Expertise.&rdquo; Die F\u00e4higkeit zu pr\u00fcfen h\u00e4ngt von der F\u00e4higkeit ab, es selbst zu tun. Wenn die KI-Nutzung die zweite aush\u00f6hlt, geht die erste mit verloren.<\/p>\n<p>Jede falsche Antwort eines Modells ist entweder eine kleine Steuer, die gezahlt und vergessen wird, oder eine Aufgabe mit angeh\u00e4ngtem Feedback. Das ist die CEO- und Studenten-Perspektive, angewandt auf ein und denselben Gegenstand. Ein Vorstandsvorsitzender behandelt einen Mangel nicht als Pech; der Mangel wird protokolliert, klassifiziert und auf einen Prozess zur\u00fcckgef\u00fchrt. Ein guter Student behandelt eine falsche Antwort nicht als Peinlichkeit; die falsche Antwort ist der aufschlussreichste Punkt auf der Seite. Das unten beschriebene KI-Fehlerprotokoll ist beides zugleich.<\/p>\n<h2 id=\"wie-oft-liegt-ki-tatschlich-falsch\"><span class=\"ez-toc-section\" id=\"Wie-oft-liegt-KI-tatsaechlich-falsch\"><\/span>Wie oft liegt KI tats\u00e4chlich falsch?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Die ehrliche Antwort lautet: Es gibt keine einheitliche Quote. Ver\u00f6ffentlichte Fehlerquoten unterscheiden sich je nach Aufgabe um mehr als eine Gr\u00f6\u00dfenordnung. Die folgenden Zahlen entsprechen den Angaben in ihren Quellen.<\/p>\n<table>\n<thead>\n<tr>\n<th>Aufgabe und getestetes System<\/th>\n<th>Ver\u00f6ffentlichte Zahl<\/th>\n<th>Quelle<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Zusammenfassung eines vorgelegten Nachrichtendokuments, beste Modelle der HHEM-Rangliste<\/td>\n<td>Niedrigste Halluzinationsrate 1,3 % (zwei Modelle gleichauf), danach 1,4 % und 1,5 %<\/td>\n<td>Stanford HAI, AI Index Report 2025<\/td>\n<\/tr>\n<tr>\n<td>Kurze Faktenfragen (SimpleQA, \u00fcber 4.000 Fragen)<\/td>\n<td>Das beste Modell beantwortete 42,7 % der Fragen erfolgreich<\/td>\n<td>Stanford HAI, AI Index Report 2025<\/td>\n<\/tr>\n<tr>\n<td>Mathematik-\u00dcbungsaufgaben der weiterf\u00fchrenden Schule, GPT-4 hinter einer schlichten Chat-Oberfl\u00e4che<\/td>\n<td>Richtige Antwort in 51 % der F\u00e4lle; logische Fehler 42 %; Rechenfehler 8 %<\/td>\n<td>Bastani et al., PNAS, 2025<\/td>\n<\/tr>\n<tr>\n<td>Juristische Recherchefragen, kommerzielle Tools mit Retrieval (202 Anfragen)<\/td>\n<td>Halluzination in 17 % bis 33 % der F\u00e4lle<\/td>\n<td>Magesh et al., Preprint 2024<\/td>\n<\/tr>\n<tr>\n<td>Direkte, \u00fcberpr\u00fcfbare Fragen zu F\u00e4llen der US-Bundesgerichte, Allzweckmodelle<\/td>\n<td>Halluzination in 58 % (ChatGPT 4) bis 88 % (Llama 2) der F\u00e4lle<\/td>\n<td>Dahl et al., 2024<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Quellen: Stanford Institute for Human-Centered AI, AI Index Report 2025, Kapitel 3; Bastani et al., PNAS 122, 2025; Magesh et al., arXiv-Preprint 2405.20362, 2024; Dahl et al., arXiv 2401.01301, erscheint im Journal of Legal Analysis. Alle Zahlen beschreiben die konkret getesteten Modelle und Zeitpunkte und sind keine aktuellen Quoten f\u00fcr irgendein Produkt.<\/em><\/p>\n<p>Aus der Tabelle folgen drei Punkte.<\/p>\n<p>Erstens h\u00e4ngt die Quote weit st\u00e4rker von der Aufgabe ab als von der Marke. Das Experiment der Harvard Business School und der Boston Consulting Group gab dieser Ungleichm\u00e4\u00dfigkeit einen Namen. Sein Abstract beschreibt eine &ldquo;gezackte technologische Grenze&rdquo;, an der KI-Unterst\u00fctzung &ldquo;die Leistung bei manchen Aufgaben verbessert, bei anderen aber verschlechtert, sogar innerhalb desselben Wissens-Workflows und bei scheinbar \u00e4hnlichem Schwierigkeitsgrad.&rdquo;<\/p>\n<p>Zweitens verringern spezialisierte Tools Fehler, ohne sie zu beseitigen. Die juristische Studie testete Produkte, deren Anbieter ein Ende der Halluzinationen beworben hatten. Die Autoren berichten, dass Lexis+ AI 65 Prozent der Anfragen korrekt beantwortete, dass Westlaws AI-Assisted Research in 42 Prozent der F\u00e4lle korrekt war und dass &ldquo;mehr als 1 von 6&rdquo; Anfragen Lexis+ AI und Ask Practical Law AI dazu brachten, mit irref\u00fchrenden oder falschen Informationen zu antworten. Ihre Definition ist f\u00fcr jedes Fehlerprotokoll n\u00fctzlich: Eine Antwort gilt als halluziniert, &ldquo;wenn sie entweder inkorrekt oder falsch belegt ist&rdquo;.<\/p>\n<p>Drittens sind die Modelle schlechte Richter ihrer eigenen Fehler. Dahl und Kollegen kommen zu dem Schluss, dass die Modelle &ldquo;M\u00fche haben, ihre eigenen Halluzinationen vorherzusagen, und falsche juristische Annahmen der Nutzer oft unkritisch \u00fcbernehmen.&rdquo; Ein selbstsicherer Ton ist kein Beleg.<\/p>\n<h2 id=\"was-passiert-wenn-menschen-nicht-aus-ki-fehlern-lernen\"><span class=\"ez-toc-section\" id=\"Was-passiert-wenn-Menschen-nicht-aus-KI-Fehlern-lernen\"><\/span>Was passiert, wenn Menschen nicht aus KI-Fehlern lernen?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Das PNAS-Experiment liefert den klarsten Beleg, weil es sowohl die Leistung mit Unterst\u00fctzung als auch die anschlie\u00dfende Leistung ohne Unterst\u00fctzung gemessen hat. Die Studie lief an einer weiterf\u00fchrenden Schule in der T\u00fcrkei im Herbsthalbjahr des Schuljahres 2023-2024, \u00fcber vier 90-min\u00fctige Sitzungen und etwa f\u00fcnfzig Klassen. Die Lernenden \u00fcbten mit einem von zwei GPT-4-Tools oder nur mit Lehrb\u00fcchern und schrieben danach eine Pr\u00fcfung ohne Unterlagen.<\/p>\n<table>\n<thead>\n<tr>\n<th>Messgr\u00f6\u00dfe<\/th>\n<th>Kontrolle (nur Lehrb\u00fccher)<\/th>\n<th>GPT Base (schlichte Chat-Oberfl\u00e4che)<\/th>\n<th>GPT Tutor (von Lehrkr\u00e4ften entworfene Prompts)<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>\u00dcbungsergebnis mit Unterst\u00fctzung, Ver\u00e4nderung gegen\u00fcber der Kontrolle (von 1)<\/td>\n<td>Mittelwert 0,28<\/td>\n<td>+0,137<\/td>\n<td>+0,361<\/td>\n<\/tr>\n<tr>\n<td>\u00dcbungsverbesserung wie angegeben<\/td>\n<td>&#8211;<\/td>\n<td>48 %<\/td>\n<td>127 %<\/td>\n<\/tr>\n<tr>\n<td>Pr\u00fcfung ohne Unterst\u00fctzung, Ver\u00e4nderung gegen\u00fcber der Kontrolle (von 1)<\/td>\n<td>&#8211;<\/td>\n<td>-0,054<\/td>\n<td>-0,004<\/td>\n<\/tr>\n<tr>\n<td>Pr\u00fcfungseffekt wie angegeben<\/td>\n<td>&#8211;<\/td>\n<td>17 % R\u00fcckgang<\/td>\n<td>Statistisch nicht von der Kontrolle zu unterscheiden<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Quelle: Bastani H, Bastani O, Sungu A, Ge H, Kabakc\u0131 \u00d6, Mariman R, PNAS 122, e2422633122, 2025.<\/em><\/p>\n<p>Zwei Details machen daraus mehr als eine Warnung \u00fcber Schulkinder. Die Autoren pr\u00fcften das schlichte Tool, indem sie ihm jede der 57 \u00dcbungsaufgaben zehnmal stellten. Es &ldquo;gibt im Durchschnitt nur in 51 % der F\u00e4lle eine richtige Antwort&rdquo;, mit logischen Fehlern in 42 Prozent und Rechenfehlern in 8 Prozent der F\u00e4lle. Die Lernenden \u00fcbten mit einem Tutor, der etwa in der H\u00e4lfte der F\u00e4lle falsch lag, und die Pr\u00fcfung ohne Unterst\u00fctzung zeigt, dass sie diese Fehler nicht in Lernen verwandelt haben.<\/p>\n<p>Sie haben es auch nicht bemerkt. Die Lernenden im GPT-Base-Arm &ldquo;nahmen nicht wahr, dass sie schlechter abschnitten oder weniger lernten.&rdquo; Das Gef\u00fchl des Fortschritts und die Tatsache des Fortschritts fielen auseinander.<\/p>\n<p>Das Beratungsexperiment zeigt dasselbe Muster in der professionellen Arbeit. Unter 758 Wissensarbeitern erledigten diejenigen, die GPT-4 bei 18 Aufgaben innerhalb der Grenze nutzten, 12,2 Prozent mehr Aufgaben und schlossen sie 25,1 Prozent schneller ab. Bei einer Aufgabe, die bewusst au\u00dferhalb der Grenze gew\u00e4hlt wurde, war es bei ihnen &ldquo;um 19 % weniger wahrscheinlich, dass sie korrekte L\u00f6sungen lieferten, verglichen mit jenen ohne KI.&rdquo; Das Tool k\u00fcndigte nicht an, auf welcher Seite der Grenze eine Aufgabe lag. Nur wer pr\u00fcfte, konnte es wissen.<\/p>\n<p>\u00c4ltere Forschung zu Entscheidungsunterst\u00fctzungssystemen erkl\u00e4rt den Mechanismus. Eine systematische \u00dcbersichtsarbeit zum Automation Bias im Journal of the American Medical Informatics Association sichtete 13.821 Arbeiten und schloss 74 ein. In ihrer gepoolten Analyse von vier Studien lag das Risikoverh\u00e4ltnis bei 1,26 (95-%-KI 1,11 bis 1,44): War der Rat des Systems falsch, so &ldquo;erh\u00f6hte er das Risiko einer falschen Entscheidung um 26 %.&rdquo; Die \u00dcbersichtsarbeit beschreibt zwei Arten menschlicher Fehler: Commission, das Befolgen eines falschen Rats, und Omission, das Unterlassen einer Handlung, weil das System nicht dazu aufgefordert hat. Beide geh\u00f6ren in ein Fehlerprotokoll, denn beide sind Ihre Fehler, nicht die des Modells.<\/p>\n<h2 id=\"was-sagt-die-lernforschung-uber-fehler-die-korrigiert-werden\"><span class=\"ez-toc-section\" id=\"Was-sagt-die-Lernforschung-ueber-Fehler-die-korrigiert-werden\"><\/span>Was sagt die Lernforschung \u00fcber Fehler, die korrigiert werden?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Wenn unkorrigierte Fehler schaden, weist die Forschung zu korrigierten Fehlern in die andere Richtung. Die Zahlen entsprechen den Angaben der jeweiligen Quelle.<\/p>\n<table>\n<thead>\n<tr>\n<th>Befund<\/th>\n<th>Evidenzbasis<\/th>\n<th>Effektst\u00e4rke wie angegeben<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Fehlermanagement-Training, insgesamt (Keith und Frese, 2008)<\/td>\n<td>24 Studien, N = 2.183<\/td>\n<td>Cohens d = 0,44<\/td>\n<\/tr>\n<tr>\n<td>Dasselbe, Transfer nach dem Training<\/td>\n<td>Moderatoranalyse<\/td>\n<td>d = 0,56<\/td>\n<\/tr>\n<tr>\n<td>Dasselbe, strukturell andersartige Aufgaben (adaptiver Transfer)<\/td>\n<td>Moderatoranalyse<\/td>\n<td>d = 0,80<\/td>\n<\/tr>\n<tr>\n<td>Probleml\u00f6sen vor der Instruktion (Sinha und Kapur, 2021)<\/td>\n<td>53 Studien, 166 Vergleiche<\/td>\n<td>Hedges g 0,36, 95-%-KI 0,20 bis 0,51<\/td>\n<\/tr>\n<tr>\n<td>Dasselbe, hohe Treue zu den Prinzipien des produktiven Scheiterns<\/td>\n<td>Teilmenge<\/td>\n<td>Hedges g zwischen 0,37 und 0,58<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Quellen: Keith N, Frese M, Journal of Applied Psychology 93(1), 2008; Sinha T, Kapur M, Review of Educational Research 91(5), 2021. Beide nur auf Abstract-Ebene gelesen.<\/em><\/p>\n<p>Vier Befunde lassen sich direkt in die Praxis mit KI \u00fcbertragen.<\/p>\n<p><strong>Fehler helfen am meisten bei neuen Problemen.<\/strong> Keith und Frese fanden den gr\u00f6\u00dften Effekt beim adaptiven Transfer, 0,80 gegen\u00fcber 0,44 insgesamt, etwa das 1,8-Fache des Durchschnitts. Fehlerbasiertes Training ist &ldquo;besser geeignet als fehlervermeidende Trainingsmethoden, um den Transfer auf neuartige Aufgaben zu f\u00f6rdern.&rdquo; Neuartige Aufgaben sind das, woraus ein Job im KI-Zeitalter zunehmend besteht.<\/p>\n<p><strong>Es zuerst selbst zu versuchen z\u00e4hlt, selbst wenn der Versuch scheitert.<\/strong> Kornell, Hays und Bjork f\u00fchrten sechs Experimente durch, in denen die Teilnehmenden Antworten erraten mussten, die sie nicht kennen konnten, bevor sie diese sahen. Ihr Fazit: &ldquo;Erfolglose Abrufversuche verbesserten das Lernen bei beiden Arten von Material.&rdquo; F\u00fcr die KI-Nutzung folgt daraus eine Reihenfolgeregel. Bilden Sie Ihre eigene Antwort, Sch\u00e4tzung oder Gliederung, bevor Sie die des Modells lesen.<\/p>\n<p><strong>Fehler mit hoher Gewissheit sind am besten korrigierbar.<\/strong> Butterfield und Metcalfe erwarteten, dass Fehler mit hoher Gewissheit am schwersten zu beheben w\u00e4ren. Sie fanden das Gegenteil: &ldquo;Fehler mit hoher Gewissheit wurden in einem anschlie\u00dfenden Wiederholungstest am ehesten korrigiert.&rdquo; Deshalb h\u00e4lt das Protokoll unten Ihre Gewissheit vor der Pr\u00fcfung fest. Die Eintr\u00e4ge, bei denen Sie sicher waren und falsch lagen, sind die wertvollsten.<\/p>\n<p><strong>Feedback muss die Begr\u00fcndung enthalten.<\/strong> Metcalfes oben zitierte Bedingung schlie\u00dft die bequeme Version eines Fehlerprotokolls aus. Eine Liste falscher Ausgaben lehrt wenig. Eine Liste falscher Ausgaben mit der Ursache und der Pr\u00fcfung, die den Fehler aufgedeckt h\u00e4tte, ist ein Lehrplan.<\/p>\n<p>Ein Vorbehalt: Sinha und Kapur berichten, dass beim &ldquo;Erlernen dom\u00e4nen\u00fcbergreifender F\u00e4higkeiten&rdquo; die Effektst\u00e4rken f\u00fcr die Instruktion zuerst sprachen. Das Pr\u00fcfen von KI-Ausgaben ist zum Teil eine allgemeine F\u00e4higkeit, lernen Sie die Pr\u00fcfungen also auch ausdr\u00fccklich. Die Taxonomie unten ist diese Instruktion.<\/p>\n<h2 id=\"welche-menschliche-fhigkeit-trainiert-welcher-ki-fehlertyp\"><span class=\"ez-toc-section\" id=\"Welche-menschliche-Faehigkeit-trainiert-welcher-KI-Fehlertyp\"><\/span>Welche menschliche F\u00e4higkeit trainiert welcher KI-Fehlertyp?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>CEOtudent-Redaktionsrahmen: die KI-Fehlertaxonomie.<\/strong> Die ersten sechs Zeilen sind Fehler auf der Modellseite; die letzten beiden sind Fehler auf der menschlichen Seite, entnommen der Literatur zum Automation Bias. Die Zuordnung zu F\u00e4higkeiten ist ein redaktionelles Urteil, kein Messergebnis.<\/p>\n<table>\n<thead>\n<tr>\n<th>Code<\/th>\n<th>Fehlertyp<\/th>\n<th>Wie er aussieht<\/th>\n<th>Menschliche F\u00e4higkeit, die er trainiert<\/th>\n<th>Die \u00dcbungseinheit<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>F<\/td>\n<td>Erfundene Quelle oder Tatsache<\/td>\n<td>Ein Beleg, ein Fall, ein Zitat oder eine Statistik, die nicht existiert<\/td>\n<td>Quellenpr\u00fcfung<\/td>\n<td>Das Original \u00f6ffnen und die genaue Zeile finden, bevor Sie sie verwenden<\/td>\n<\/tr>\n<tr>\n<td>M<\/td>\n<td>Falsch belegte Behauptung<\/td>\n<td>Eine echte Quelle, zitiert f\u00fcr etwas, das sie nicht sagt<\/td>\n<td>Genaues Lesen<\/td>\n<td>Die Behauptung Wort f\u00fcr Wort mit der zitierten Passage vergleichen<\/td>\n<\/tr>\n<tr>\n<td>L<\/td>\n<td>Logischer Fehler<\/td>\n<td>Plausible Schritte, die nicht folgen, oder die falsche Methode<\/td>\n<td>Schlussfolgern und Problemstrukturierung<\/td>\n<td>Die ersten zwei Schritte ohne Hilfe wiederholen, dann finden, wo sich die Wege trennen<\/td>\n<\/tr>\n<tr>\n<td>A<\/td>\n<td>Rechen- oder Einheitenfehler<\/td>\n<td>Richtige Methode, falsche Zahl<\/td>\n<td>Sch\u00e4tzen<\/td>\n<td>Eine Gr\u00f6\u00dfenordnungssch\u00e4tzung aufschreiben, bevor Sie die Antwort lesen<\/td>\n<\/tr>\n<tr>\n<td>P<\/td>\n<td>\u00dcbernommene falsche Pr\u00e4misse<\/td>\n<td>Das Modell baut auf einer falschen Annahme im Prompt auf<\/td>\n<td>Fragestellung<\/td>\n<td>Dieselbe Frage mit neutral formulierter Pr\u00e4misse stellen<\/td>\n<\/tr>\n<tr>\n<td>S<\/td>\n<td>Themenabweichung oder unvollst\u00e4ndige Antwort<\/td>\n<td>Beantwortet eine benachbarte Frage oder l\u00e4sst einen geforderten Teil aus<\/td>\n<td>Briefing-Schreiben<\/td>\n<td>Das Briefing mit einer Definition of Done neu schreiben und erneut ausf\u00fchren<\/td>\n<\/tr>\n<tr>\n<td>C<\/td>\n<td>Commission (Mensch)<\/td>\n<td>Sie haben eine falsche Ausgabe ungepr\u00fcft \u00fcbernommen<\/td>\n<td>Pr\u00fcfdisziplin<\/td>\n<td>Die ausgelassene Pr\u00fcfung benennen und in die Richtlinie aufnehmen<\/td>\n<\/tr>\n<tr>\n<td>O<\/td>\n<td>Omission (Mensch)<\/td>\n<td>Sie haben etwas \u00fcbersehen, weil das Modell es nicht angesprochen hat<\/td>\n<td>Eigenst\u00e4ndiges Absuchen<\/td>\n<td>Vor dem Prompten auflisten, was eine gute Antwort enthalten muss<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Die Codes folgen Unterscheidungen aus den Quellen: inkorrekte gegen\u00fcber falsch belegten Antworten in der juristischen Studie, logische gegen\u00fcber Rechenfehlern im PNAS-Audit (42 gegen\u00fcber 8 Prozent), \u00fcbernommene falsche Pr\u00e4missen bei Dahl und Kollegen sowie Commission gegen\u00fcber Omission in der \u00dcbersichtsarbeit zum Automation Bias.<\/p>\n<p>Ein Muster in den Codes ist eine Diagnose. Viele S-Eintr\u00e4ge bedeuten, dass die Briefings schwach sind. Viele C-Eintr\u00e4ge bedeuten, dass die Pr\u00fcfrichtlinie nicht befolgt wird. Viele F- und M-Eintr\u00e4ge in einem Fachgebiet bedeuten, dass das Tool bei dieser Aufgabe jenseits seiner Grenze liegt. Zur Briefing-Seite dieser Schleife siehe <a href=\"\/de\/ki-management-playbook-anleiten-bewerten-verbessern\">das KI-Management-Playbook<\/a>.<\/p>\n<h2 id=\"was-sollte-ein-ki-fehlerprotokoll-enthalten\"><span class=\"ez-toc-section\" id=\"Was-sollte-ein-KI-Fehlerprotokoll-enthalten\"><\/span>Was sollte ein KI-Fehlerprotokoll enthalten?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>CEOtudent-Redaktionsrahmen: die Vorlage f\u00fcr das KI-Fehlerprotokoll.<\/strong> Eine Zeile pro entdecktem Fehler. Eine Tabellenkalkulation oder eine Notizdatei gen\u00fcgt.<\/p>\n<table>\n<thead>\n<tr>\n<th>Spalte<\/th>\n<th>Was einzutragen ist<\/th>\n<th>Warum sie da ist<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Datum und Aufgabe<\/td>\n<td>Was erstellt wurde und f\u00fcr wen<\/td>\n<td>Zeigt, welche Workflows Fehler erzeugen<\/td>\n<\/tr>\n<tr>\n<td>Tragweite<\/td>\n<td>Niedrig, mittel oder hoch<\/td>\n<td>Verkn\u00fcpft den Eintrag mit der Pr\u00fcfrichtlinie<\/td>\n<\/tr>\n<tr>\n<td>Tool und Modus<\/td>\n<td>Modell, mit oder ohne Suche oder Dokumente<\/td>\n<td>Fehlerquoten unterscheiden sich je nach Aufgabe und Setup<\/td>\n<\/tr>\n<tr>\n<td>Der Fehler, w\u00f6rtlich<\/td>\n<td>Der genaue falsche Satz oder die falsche Zahl<\/td>\n<td>Verhindert vage Erinnerung<\/td>\n<\/tr>\n<tr>\n<td>Code<\/td>\n<td>F, M, L, A, P, S, C oder O<\/td>\n<td>Macht die w\u00f6chentliche Z\u00e4hlung m\u00f6glich<\/td>\n<\/tr>\n<tr>\n<td>Wie er entdeckt wurde<\/td>\n<td>Welche Pr\u00fcfung, oder wer ihn nachgelagert gefunden hat<\/td>\n<td>Zeigt, welche Pr\u00fcfungen ihre Zeit wert sind<\/td>\n<\/tr>\n<tr>\n<td>Gewissheit vor der Pr\u00fcfung<\/td>\n<td>0 bis 100, dass die Ausgabe richtig war<\/td>\n<td>Macht Treffer mit hoher Gewissheit sichtbar, die am besten korrigierbare Art<\/td>\n<\/tr>\n<tr>\n<td>Ursache auf der menschlichen Seite<\/td>\n<td>Schwaches Briefing, fehlender Kontext, ausgelassene Pr\u00fcfung, unvertrautes Fachgebiet<\/td>\n<td>Verlagert die Lektion vom Modell zum Nutzer<\/td>\n<\/tr>\n<tr>\n<td>Richtige Antwort und Quelle<\/td>\n<td>Die Korrektur, mit dem Ort, an dem sie verifiziert wurde<\/td>\n<td>Das korrigierende Feedback selbst<\/td>\n<\/tr>\n<tr>\n<td>Regel\u00e4nderung<\/td>\n<td>Die Zeile, die der Pr\u00fcfrichtlinie hinzugef\u00fcgt wurde, oder &ldquo;keine&rdquo;<\/td>\n<td>Macht aus dem Fehler eine Prozess\u00e4nderung<\/td>\n<\/tr>\n<tr>\n<td>Datum des Wiederholungstests<\/td>\n<td>Wann dieser Punkt ohne Hilfe neu durchzuarbeiten ist<\/td>\n<td>Plant die \u00dcbungseinheit ein<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Zwei Spalten leisten den Gro\u00dfteil der Arbeit. Eintr\u00e4ge, die nachgelagert von einer Kollegin, einem Kunden oder einem Pr\u00fcfer entdeckt wurden, sind Durchrutscher; ihr Anteil an allen Eintr\u00e4gen zeigt, ob das Pr\u00fcfen funktioniert. Die Gewissheitsspalte sch\u00fctzt vor der Wahrnehmungsl\u00fccke aus der PNAS-Studie: Eine Zahl, die vor der Pr\u00fcfung aufgeschrieben wurde, l\u00e4sst sich nachtr\u00e4glich nicht korrigieren.<\/p>\n<p>F\u00fcr dasselbe Vorher-nachher-Format, angewandt auf Entscheidungen, siehe <a href=\"\/de\/entscheidungsjournal-vorlage-und-protokoll-fuer-besseres-urteilsvermoegen\">die Vorlage und das Protokoll f\u00fcr das Entscheidungsjournal<\/a>.<\/p>\n<h2 id=\"wie-viel-ubungsmaterial-gibt-es\"><span class=\"ez-toc-section\" id=\"Wie-viel-Uebungsmaterial-gibt-es\"><\/span>Wie viel \u00dcbungsmaterial gibt es?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>CEOtudent-Analyse der oben ver\u00f6ffentlichten Quoten.<\/strong> Die Tabelle rechnet jede angegebene Quote in das um, worauf eine Person st\u00f6\u00dft, die jede Ausgabe pr\u00fcft. Sie nimmt an, dass jede Ausgabe eine unabh\u00e4ngige Ziehung mit der angegebenen Quote ist, was eine Vereinfachung darstellt: Echte Fehler h\u00e4ufen sich nach Aufgabentyp.<\/p>\n<table>\n<thead>\n<tr>\n<th>Kontext und angegebene Quote<\/th>\n<th>Erwartete Fehler pro 20 Ausgaben<\/th>\n<th>Wahrscheinlichkeit von mindestens einem Fehler in 10 Ausgaben<\/th>\n<th>Im Durchschnitt ein Fehler alle<\/th>\n<th>Fehler in 50 Wochen bei 20 gepr\u00fcften Ausgaben pro Woche<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Dokumentzusammenfassungen, beste Modelle, 1,3 %<\/td>\n<td>0,3<\/td>\n<td>12,3 %<\/td>\n<td>76,9 Ausgaben<\/td>\n<td>13<\/td>\n<\/tr>\n<tr>\n<td>Juristische Recherchetools, unteres Ende, 17 %<\/td>\n<td>3,4<\/td>\n<td>84,5 %<\/td>\n<td>5,9 Ausgaben<\/td>\n<td>170<\/td>\n<\/tr>\n<tr>\n<td>Juristische Recherchetools, oberes Ende, 33 %<\/td>\n<td>6,6<\/td>\n<td>98,2 %<\/td>\n<td>3,0 Ausgaben<\/td>\n<td>330<\/td>\n<\/tr>\n<tr>\n<td>Mathematikantworten von schlichtem GPT-4, 49 % (100 minus 51)<\/td>\n<td>9,8<\/td>\n<td>99,9 %<\/td>\n<td>2,0 Ausgaben<\/td>\n<td>490<\/td>\n<\/tr>\n<tr>\n<td>Allgemeiner Chatbot bei Fragen zur Rechtsprechung, unteres Ende, 58 %<\/td>\n<td>11,6<\/td>\n<td>\u00fcber 99,9 %<\/td>\n<td>1,7 Ausgaben<\/td>\n<td>580<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><em>Quelle: CEOtudent-Berechnungen (calc.py) aus den im AI Index Report 2025, bei Magesh et al. 2024, Bastani et al. 2025 und Dahl et al. 2024 angegebenen Quoten. Zur Veranschaulichung, keine Prognose f\u00fcr irgendein aktuelles Tool.<\/em><\/p>\n<p>Bei einer Quote von 17 Prozent hat jemand, der zehn Ausgaben ungepr\u00fcft \u00fcbernimmt, eine Wahrscheinlichkeit von 84,5 Prozent, dass mindestens eine falsch ist. Dieselbe Quote ergibt mit Pr\u00fcfung etwa 170 durchgearbeitete Beispiele mit Feedback in einem Jahr. Das untere Ende des allgemeinen Chatbots liegt beim 3,4-Fachen der spezialisierten Tools, die Toolwahl ver\u00e4ndert also die Last, ohne sie zu beseitigen.<\/p>\n<p>Bei 1,3 Prozent tritt etwa einmal in 77 Ausgaben ein Fehler auf, die Bedingung, unter der die Aufmerksamkeit abschweift. Aufgaben mit niedriger Quote brauchen eine feste Stichprobenregel in der Richtlinie, nicht Wachsamkeit.<\/p>\n<h2 id=\"wie-fuhren-sie-die-wochenauswertung-durch\"><span class=\"ez-toc-section\" id=\"Wie-fuehren-Sie-die-Wochenauswertung-durch\"><\/span>Wie f\u00fchren Sie die Wochenauswertung durch?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>CEOtudent-Redaktionsprotokoll: 20 Minuten, einmal pro Woche.<\/strong> \u00dcber 50 Wochen sind das etwa 16,7 Stunden.<\/p>\n<ol>\n<li><strong>Z\u00e4hlen und klassifizieren (5 Minuten).<\/strong> Z\u00e4hlen Sie die Eintr\u00e4ge der Woche nach Code aus. Notieren Sie die Durchrutscher, also die Eintr\u00e4ge, die jemand anderes entdeckt hat.<\/li>\n<li><strong>Einen Fehler ohne Hilfe neu durcharbeiten (5 Minuten).<\/strong> Nehmen Sie den Eintrag mit der h\u00f6chsten Gewissheit vor der Pr\u00fcfung. Erarbeiten Sie ohne das Tool die richtige Antwort oder die richtige Methode. Das ist der Abrufversuch; er wirkt auch, wenn er scheitert, sofern die richtige Antwort anschlie\u00dfend durchgesehen wird.<\/li>\n<li><strong>Die Ursache zur\u00fcckverfolgen (5 Minuten).<\/strong> Schreiben Sie f\u00fcr die zwei h\u00e4ufigsten Codes einen Satz zur Ursache auf der menschlichen Seite. Nutzen Sie Metcalfes Bedingung als Test: Die Notiz muss die \u00dcberlegung beschreiben, die zu dem Vers\u00e4umnis gef\u00fchrt hat, nicht nur das Vers\u00e4umnis.<\/li>\n<li><strong>Eine Regel \u00e4ndern (3 Minuten).<\/strong> Erg\u00e4nzen, versch\u00e4rfen oder streichen Sie eine Zeile der Pr\u00fcfrichtlinie. Eine \u00c4nderung pro Woche gen\u00fcgt; mehr wird nicht befolgt.<\/li>\n<li><strong>Den Wiederholungstest einplanen (2 Minuten).<\/strong> Legen Sie ein Datum fest, an dem Sie den Punkt dieser Woche erneut durcharbeiten, und arbeiten Sie den Punkt durch, der aus einer fr\u00fcheren Woche f\u00e4llig geworden ist.<\/li>\n<\/ol>\n<p>Pr\u00fcfen Sie einmal im Monat, ob der Anteil der Durchrutscher sinkt und ob sich die Mischung der Codes von C und S wegbewegt.<\/p>\n<h2 id=\"wie-sieht-die-ceo-seite-aus-die-prufrichtlinie\"><span class=\"ez-toc-section\" id=\"Wie-sieht-die-CEO-Seite-aus-die-Pruefrichtlinie\"><\/span>Wie sieht die CEO-Seite aus: die Pr\u00fcfrichtlinie?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Ein Protokoll ohne Richtlinie ist ein Tagebuch. Die Richtlinie ist ein kurzes schriftliches Dokument, das festlegt, wie viel Pr\u00fcfung jede Klasse von Arbeit erh\u00e4lt, bevor sie Ihre H\u00e4nde verl\u00e4sst. Die Forschung zum Automation Bias spricht daf\u00fcr, sie aufzuschreiben. Die JAMIA-\u00dcbersichtsarbeit f\u00fchrt &ldquo;Schulung und die Betonung der Verantwortlichkeit der Nutzer&rdquo; unter den abmildernden Faktoren auf und berichtet von einer Studie, in der Menschen, die sich selbst als rechenschaftspflichtig wahrnahmen, weniger Automation-Bias-Fehler machten. Parasuraman und Manzey sind weniger optimistisch und kommen zu dem Schluss, dass Automation Bias &ldquo;nicht durch Schulung oder Anweisungen verhindert werden kann.&rdquo; Die beiden \u00dcbersichtsarbeiten sind sich im praktischen Punkt einig: Gute Absichten sind keine Kontrolle. Ein benannter Verantwortlicher und ein festes Verfahren sind es.<\/p>\n<p><strong>CEOtudent-Redaktionsrahmen: eine dreistufige Pr\u00fcfrichtlinie.<\/strong><\/p>\n<table>\n<thead>\n<tr>\n<th>Stufe<\/th>\n<th>Typische Arbeit<\/th>\n<th>Mindestpr\u00fcfung<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>1. Geringe Tragweite, umkehrbar<\/td>\n<td>Entw\u00fcrfe, Brainstorming, interne Notizen<\/td>\n<td>Einmal lesen; stichprobenartig eine Tatsache pro Dokument pr\u00fcfen<\/td>\n<\/tr>\n<tr>\n<td>2. Mittlere Tragweite<\/td>\n<td>Texte f\u00fcr Kunden, Analysen, die eine Entscheidung st\u00fctzen, Code, der ausgef\u00fchrt wird<\/td>\n<td>Jede Zahl, jeden Namen, jedes Datum und jeden Beleg an einer Quelle verifizieren; Berechnungen unabh\u00e4ngig wiederholen<\/td>\n<\/tr>\n<tr>\n<td>3. Hohe Tragweite oder au\u00dferhalb Ihrer Expertise<\/td>\n<td>Juristische, medizinische, finanzielle oder sicherheitsrelevante Inhalte; alles, was unterschrieben oder ver\u00f6ffentlicht wird<\/td>\n<td>Pr\u00fcfungen der Stufe 2 plus Durchsicht durch eine qualifizierte Person; keine Quelle, keine Behauptung<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Zwei Regeln halten die Richtlinie ehrlich. Jeder Durchrutscher verschiebt diesen Aufgabentyp um eine Stufe nach oben, bis ein Monat ohne einen weiteren vergeht. Und jede Regel benennt ihre Pr\u00fcfung, nicht eine Absicht (&ldquo;die zitierte Seite \u00f6ffnen&rdquo;, nicht &ldquo;vorsichtig sein&rdquo;).<\/p>\n<p>Die Umfrage von Lee und Kollegen bei Microsoft Research und Carnegie Mellon zeigt, warum die Richtlinie nicht auf Gef\u00fchl beruhen kann. Unter 319 Wissensarbeitern, die 936 Beispiele f\u00fcr den Einsatz generativer KI bei der Arbeit teilten, &ldquo;geht h\u00f6heres Vertrauen in GenAI mit weniger kritischem Denken einher, w\u00e4hrend h\u00f6heres Selbstvertrauen mit mehr kritischem Denken einhergeht.&rdquo; Vertrauen in das Tool senkte das Pr\u00fcfen genau dort, wo das Pr\u00fcfen die einzige Absicherung war. Die L\u00fccke zwischen Vertrauen in das Tool und Selbstvertrauen ist das Thema von <a href=\"\/de\/unterscheidungsluecke-ki-ausgabe-menschliches-denken\">die Unterscheidungsl\u00fccke<\/a>.<\/p>\n<h2 id=\"lernen-sie-aus-ki-fehlern-eine-scorecard-mit-8-fragen\"><span class=\"ez-toc-section\" id=\"Lernen-Sie-aus-KI-Fehlern-Eine-Scorecard-mit-8-Fragen\"><\/span>Lernen Sie aus KI-Fehlern? Eine Scorecard mit 8 Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>CEOtudent-Redaktions-Scorecard.<\/strong> Bewerten Sie jede Frage mit 0 (nein), 1 (manchmal) oder 2 (durchg\u00e4ngig). Maximum 16.<\/p>\n<ol>\n<li>Bilden Sie Ihre eigene Sch\u00e4tzung, Gliederung oder Antwort, bevor Sie die des Modells lesen?<\/li>\n<li>Halten Sie entdeckte Fehler irgendwo fest, mit dem genauen falschen Text?<\/li>\n<li>Klassifizieren Sie jeden Fehler nach Typ?<\/li>\n<li>Schreiben Sie Ihre Gewissheit auf, bevor Sie pr\u00fcfen?<\/li>\n<li>Notieren Sie die Ursache auf der menschlichen Seite, nicht nur den Fehler des Modells?<\/li>\n<li>Arbeiten Sie jede Woche mindestens einen Fehler ohne Hilfe neu durch?<\/li>\n<li>Haben Sie eine schriftliche Pr\u00fcfrichtlinie mit Stufen nach Tragweite?<\/li>\n<li>Erfassen Sie Fehler, die jemand anderes nach Ihnen entdeckt hat?<\/li>\n<\/ol>\n<table>\n<thead>\n<tr>\n<th>Punktzahl<\/th>\n<th>Lesart<\/th>\n<th>N\u00e4chster Schritt<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>0-6<\/td>\n<td>Fehler werden korrigiert und vergessen<\/td>\n<td>Beginnen Sie das Protokoll mit f\u00fcnf Spalten: Aufgabe, Fehler, Code, Ursache, Korrektur<\/td>\n<\/tr>\n<tr>\n<td>7-11<\/td>\n<td>Fehler werden erfasst, aber noch nicht umgewandelt<\/td>\n<td>Erg\u00e4nzen Sie die Gewissheitsspalte und die w\u00f6chentliche Neubearbeitung ohne Hilfe<\/td>\n<\/tr>\n<tr>\n<td>12-16<\/td>\n<td>Fehler sind ein funktionierender Lehrplan<\/td>\n<td>Verfolgen Sie den monatlichen Anteil der Durchrutscher und streichen Sie Regeln, die nie greifen<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2 id=\"was-das-nicht-bedeutet\"><span class=\"ez-toc-section\" id=\"Was-das-nicht-bedeutet\"><\/span>Was das nicht bedeutet<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>KI-Fehler sind nicht gut, und mehr Fehler sind nicht besser.<\/strong> Die Lernforschung handelt von korrigierten Fehlern in Situationen mit geringer Tragweite. Metcalfes \u00dcbersichtsarbeit empfiehlt, Fehler zuzulassen, &ldquo;solange sie in Lernsituationen mit geringer Tragweite auftreten&rdquo;, nicht in Arbeit, die einen Kunden oder ein Gericht erreicht.<\/p>\n<p><strong>Die Verbindung von KI-Fehlern zu menschlicher Kompetenz ist ein R\u00fcckschluss.<\/strong> Die hier zitierten Lernstudien untersuchen die eigenen Fehler von Menschen, \u00fcberwiegend in Klassenzimmern, Laboren und Schulungen. Keine f\u00fcr diesen Artikel ge\u00f6ffnete Studie hat getestet, ob das Protokollieren der Fehler eines Modells das Urteilsverm\u00f6gen des Nutzers verbessert. Der Rahmen wendet etablierte Prinzipien auf eine neue Situation an; er ist kein gemessener Effekt.<\/p>\n<p><strong>Die Fehlerquoten sind Momentaufnahmen.<\/strong> Sie beschreiben konkrete Modelle, die 2023 und 2024 getestet wurden. Die Autoren der juristischen Studie weisen darauf hin, dass ihre Sch\u00e4tzung &ldquo;nicht als unverzerrte Sch\u00e4tzung&rdquo; der Populationsrate von Halluzinationen bei juristischen KI-Anfragen gedacht ist. Aktuelle Tools k\u00f6nnen bei jeder beliebigen Aufgabe besser oder schlechter abschneiden.<\/p>\n<p><strong>Die Tabelle zum \u00dcbungsmaterial ist Arithmetik, keine Vorhersage.<\/strong> Sie nimmt unabh\u00e4ngige Fehler mit konstanter Quote an und dass jeder Fehler entdeckt wird.<\/p>\n<h2 id=\"hufig-gestellte-fragen\"><span class=\"ez-toc-section\" id=\"Haeufig-gestellte-Fragen\"><\/span>H\u00e4ufig gestellte Fragen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p><strong>Wie viele Fehler braucht es, bevor ein Protokoll n\u00fctzlich ist?<\/strong><br \/>\nEine Handvoll. Das Wochenprotokoll funktioniert mit einem Eintrag, weil Schritt 2 nur einen Punkt zum Neudurcharbeiten braucht. Muster in den Codes brauchen meist Eintr\u00e4ge aus einigen Wochen.<\/p>\n<p><strong>Sollten Fehler protokolliert werden, wenn die Tragweite trivial war?<\/strong><br \/>\nJa, kurz. Fehler mit geringer Tragweite sind das sicherste \u00dcbungsmaterial, und sie legen dieselben Schw\u00e4chen in Briefings und Pr\u00fcfungen offen, die Fehler mit hoher Tragweite verursachen.<\/p>\n<p><strong>Lohnt es sich, Fehler zu protokollieren, an denen der Nutzer schuld war?<\/strong><br \/>\nDas sind die n\u00fctzlichsten Eintr\u00e4ge. Die Codes C und O existieren, weil die Literatur zum Automation Bias das Befolgen falscher Ratschl\u00e4ge und das \u00dcbersehen nicht angesprochener Probleme als menschliche Fehler behandelt.<\/p>\n<p><strong>Macht ein besseres Modell das Protokoll \u00fcberfl\u00fcssig?<\/strong><br \/>\nNein. Niedrigere Fehlerquoten machen jeden Fehler seltener und damit leichter zu \u00fcbersehen. Das Protokoll wandelt sich dann von einer \u00dcbungsquelle zu einem Stichprobennachweis, der zeigt, dass die Pr\u00fcfungen weiterhin durchgef\u00fchrt werden.<\/p>\n<p><strong>Was ist der schnellste erste Schritt?<\/strong><br \/>\nSchreiben Sie vor der n\u00e4chsten KI-Antwort zu etwas, das z\u00e4hlt, eine einzeilige Sch\u00e4tzung dessen auf, wie die Antwort lauten sollte. Vergleichen Sie dann. Diese eine Gewohnheit wendet den Abrufbefund an und macht den ersten Protokolleintrag leicht zu schreiben.<\/p>\n<h2 id=\"quellen\"><span class=\"ez-toc-section\" id=\"Quellen\"><\/span>Quellen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ol>\n<li>Bastani H, Bastani O, Sungu A, Ge H, Kabakc\u0131 \u00d6, Mariman R. Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences 122, e2422633122, 2025. Eine Korrektur von 2025 betrifft nur die Affiliation eines Autors.<\/li>\n<li>Magesh V, Surani F, Dahl M, Suzgun M, Manning CD, Ho DE. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. arXiv-Preprint 2405.20362, 2024.<\/li>\n<li>Dahl M, Magesh V, Suzgun M, Ho DE. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. arXiv 2401.01301, 2024, erscheint im Journal of Legal Analysis.<\/li>\n<li>Maslej N, et al. The AI Index 2025 Annual Report. AI Index Steering Committee, Institute for Human-Centered AI, Stanford University, April 2025. Kapitel 3, Responsible AI.<\/li>\n<li>Dell&rsquo;Acqua F, McFowland E, Mollick E, Lifshitz-Assaf H, Kellogg KC, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science 37(2): 403-423, 2026. Nur Abstract.<\/li>\n<li>Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association 19(1): 121-127, 2012.<\/li>\n<li>Parasuraman R, Manzey DH. Complacency and Bias in Human Use of Automation: An Attentional Integration. Human Factors 52(3): 381-410, 2010. Nur Abstract.<\/li>\n<li>Lee HP, Sarkar A, Tankelevitch L, et al. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI Conference on Human Factors in Computing Systems, 2025.<\/li>\n<li>Metcalfe J. Learning from Errors. Annual Review of Psychology 68: 465-489, 2017. Nur Abstract.<\/li>\n<li>Keith N, Frese M. Effectiveness of Error Management Training: A Meta-Analysis. Journal of Applied Psychology 93(1): 59-69, 2008. Nur Abstract.<\/li>\n<li>Sinha T, Kapur M. When Problem Solving Followed by Instruction Works: Evidence for Productive Failure. Review of Educational Research 91(5): 761-798, 2021. Nur Abstract.<\/li>\n<li>Kornell N, Hays MJ, Bjork RA. Unsuccessful Retrieval Attempts Enhance Subsequent Learning. Journal of Experimental Psychology: Learning, Memory, and Cognition 35(4): 989-998, 2009.<\/li>\n<li>Butterfield B, Metcalfe J. Errors Committed With High Confidence Are Hypercorrected. Journal of Experimental Psychology: Learning, Memory, and Cognition 27(6): 1491-1494, 2001. Nur Abstract.<\/li>\n<\/ol>\n<p><em>Datentabellen geben die Zahlen so wieder, wie sie in ihren Quellen stehen. Die Fehlertaxonomie, die Vorlage f\u00fcr das Fehlerprotokoll, die Tabelle zum \u00dcbungsmaterial, das Protokoll der Wochenauswertung, die Pr\u00fcfrichtlinie und die Scorecard sind CEOtudent-Analysen oder Redaktionsrahmen; die Vielfachen 1,8 und 3,4 sind CEOtudent-Berechnungen. Nicht verwendet: die Working-Paper-Fassung des Beratungsexperiments, die nicht ge\u00f6ffnet werden konnte; die nur als Diagramm vorliegenden Werte der juristischen Studie f\u00fcr GPT-4; die bias-adjustierte Sch\u00e4tzung von 0,87 bei Sinha und Kapur; sowie verbreitete Behauptungen, Chatbots l\u00e4gen zu einem festen Anteil falsch, die keine hier ge\u00f6ffnete Quelle st\u00fctzt.<\/em><\/p>\n<hr>\n<p><em>Dieser Inhalt wurde nach eingehender Recherche mit Unterst\u00fctzung von KI zusammengestellt und vom CEOtudent-Redaktionsteam geschrieben und f\u00fcr die Ver\u00f6ffentlichung aufbereitet.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>In einem Feldexperiment mit fast tausend Sch\u00fclerinnen und Sch\u00fclern einer weiterf\u00fchrenden Schule steigerte eine schlichte GPT-4-Oberfl\u00e4che die \u00dcbungsergebnisse um 48 Prozent und lie\u00df die Lernenden in der Pr\u00fcfung ohne Hilfsmittel anschlie\u00dfend um 17 Prozent schlechter abschneiden, w\u00e4hrend das Tool selbst nur in 51 Prozent der F\u00e4lle richtig antwortete. Ver\u00f6ffentlichte Fehlerquoten reichen von 1,3 Prozent bei Dokumentzusammenfassungen bis zu 17 bis 33 Prozent bei juristischen Recherchetools. Dieser Leitfaden macht aus diesen Fehlern \u00dcbungsmaterial: eine Fehlertaxonomie, die jedem Typ die menschliche F\u00e4higkeit zuordnet, die er trainiert, eine Vorlage f\u00fcr ein KI-Fehlerprotokoll, eine 20-min\u00fctige Wochenauswertung und eine Scorecard mit 8 Fragen.<\/p>\n","protected":false},"author":1,"featured_media":326440,"comment_status":"open","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[4599,18],"tags":[],"class_list":["post-326437","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-gelisim","category-strateji"],"_links":{"self":[{"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/posts\/326437","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/comments?post=326437"}],"version-history":[{"count":0,"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/posts\/326437\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/media\/326440"}],"wp:attachment":[{"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/media?parent=326437"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/categories?post=326437"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/ceotudent.com\/de\/wp-json\/wp\/v2\/tags?post=326437"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}