Kurzfassung. Die meisten Fachkräfte nutzen inzwischen KI bei der Arbeit, und fast niemand bewahrt auf, was funktioniert. Gallups Umfrage vom Mai 2026 ergab, dass 52 Prozent der US-Beschäftigten KI in ihrer Rolle mindestens ein paar Mal im Jahr nutzen, 30 Prozent ein paar Mal pro Woche oder öfter und 15 Prozent täglich, gegenüber 40, 19 und 8 Prozent ein Jahr zuvor. Nur 25 Prozent sagen, ihre Organisation habe einen klaren Plan für die Integration kommuniziert. Die Umfragereihe der Federal Reserve Bank of St. Louis beziffert die Zeitersparnis von Beschäftigten, die generative KI nutzen, auf 5,4 Prozent ihrer Arbeitsstunden, etwa 2,2 Stunden in einer 40-Stunden-Woche, und der Anteil aller eingesparten Arbeitsstunden stieg zwischen Ende 2024 und Mitte 2026 von 1,6 Prozent auf 2,2 Prozent. Drei Forschungsstränge zeigen, warum eine persönliche Prompt-Bibliothek der günstigste Weg ist, diese Zeit kumulieren zu lassen. Prompts sind fragil: Allein die Änderung von Trennzeichen, Abständen oder Groß- und Kleinschreibung verschob die Genauigkeit in einer Benchmark-Studie um bis zu 76 Punkte, und eine einzelne Prompt-Vorlage liefert bei vielen Aufgaben unzuverlässige Modell-Rankings. Menschen entwerfen Prompts standardmäßig schlecht: In einer Berkeley-Studie iterierten Laien opportunistisch und erklärten nach einem einzigen guten Output den Erfolg. Und Prompt-Qualität zählt: In einer kontrollierten Studierendenstichprobe erklärte sie 53 bis 78 Prozent der Varianz der Output-Qualität. Eine CEOtudent-Analyse verbindet die Adoptionsumfragen mit acht Feldexperimenten zu einem Vorlagen-Prioritätsindex, der Ihnen sagt, welche Aufgabenfamilien zuerst eine Vorlage verdienen, und liefert dann die Prompt-Karte, die Ordnerstruktur und die Wartungsregeln. Der CEO in Ihnen behandelt Prompts als versionierte Assets. Der Student in Ihnen behandelt jeden einzelnen als Hypothese mit Testfällen.
Dies ist der System-Begleittext zu unserem Hub zum KI-Kompetenz-Stack. Jener Beitrag argumentierte, dass Prompting eine Schicht unter mehreren ist. Dieser hier handelt von der Schicht, die die meisten Fachkräfte überspringen: die Prompts, die für sie bereits funktionieren, zu speichern, zu testen und wiederzuverwenden.
Warum zählt eine Bibliothek mehr als ein besserer Prompt?
Vier Befunde, jeder aus einer anderen Art von Studie, weisen auf dieselbe Schlussfolgerung.
Prompts sind fragil, verwenden Sie also exakt den wieder, der funktioniert hat. In einem ICLR-Paper von 2024 änderten Sclar, Choi, Tsvetkov und Suhr in Few-Shot-Prompts nichts als die Formatierung (Trennzeichen, Abstände, die Groß- und Kleinschreibung von Feldnamen) und fanden “Leistungsunterschiede von bis zu 76 Genauigkeitspunkten” für LLaMA-2-13B, mit im Schnitt etwa 10 Punkten Streuung über mehr als 50 Aufgaben und mehrere Modelle. Bei größeren und instruktionsgetunten Modellen schrumpfte die Empfindlichkeit, verschwand aber nicht; GPT-3.5 zeigte über 53 Aufgaben eine mediane Spannweite von 0,064 bei einem Maximum von 0,562. Mizrahi und Kollegen, die 20 Modelle auf 39 Aufgaben mit mehr als 5.000 Instruktionsparaphrasen evaluierten, stellten fest, dass eine einzelne Vorlage “bei vielen Aufgaben zu unzuverlässigen Rankings führt”, wobei die meisten Übereinstimmungswerte unter 0,85 lagen. Die praktische Lesart ist nicht, dass Sie den perfekten Prompt konstruieren müssen. Sie lautet: Sobald ein Format für Ihre Aufgabe funktioniert, wirft jedes erneute Eintippen aus dem Gedächtnis das Ergebnis weg.
Menschen iterieren standardmäßig schlecht. Zamfirescu-Pereira, Wong, Hartmann und Yang beobachteten für die CHI 2023, wie 10 Laien Chatbot-Prompts entwarfen. Die Teilnehmenden “erkundeten Prompt-Designs opportunistisch, nicht systematisch”, verallgemeinerten “aus einzelnen Beobachtungen von Erfolg und Misserfolg” zu stark, und “die meisten Teilnehmenden erklären nach nur einer einzigen Instanz den Erfolg und gehen weiter”. Mehrere bestanden darauf, jede Anweisung mit “bitte” zu beginnen. Eine Bibliothek mit Testfällen ist die direkte Gegenmaßnahme: Ein Prompt wird erst befördert, wenn er auf mehr als einer Eingabe funktioniert hat.
Prompt-Qualität sagt Output-Qualität voraus. In einer Studie von 2024 mit 45 Universitätsstudierenden von Knoth, Tolzin, Janson und Leimeister erklärte die Qualität des Prompts (bewertet anhand von sechs Komponenten) 53 Prozent der Varianz der Output-Qualität bei einer Reiseplanungsaufgabe und 78 Prozent bei einer Projektplanungsaufgabe. Die Stichprobe ist klein und die Aufgaben sind akademisch, aber die Richtung deckt sich mit jedem Feldexperiment weiter unten.
Die Gewinne sind real, aber ungleich verteilt, also brauchen Sie eine Landkarte, die zeigt, wo sie liegen. Die im nächsten Abschnitt zusammengefassten Feldexperimente berichten große Produktivitätseffekte bei bestimmten Aufgabenfamilien und einen messbaren Malus, wenn KI außerhalb ihrer Kompetenz eingesetzt wird. Eine Bibliothek ist der Ort, an dem Sie beide Seiten festhalten: wofür ein Prompt zu verwenden ist und wofür nicht.
Was haben die Feldexperimente tatsächlich gemessen?
| Studie (Primärquelle) | Setting und Stichprobe | Aufgabenfamilie | Verifizierter Effekt | Im Paper festgehaltener Vorbehalt |
|---|---|---|---|---|
| Noy und Zhang, 2023, Science | 453 Fachkräfte mit Hochschulabschluss, incentivierte Schreibaufgaben, die Hälfte mit ChatGPT | Professionelles Schreiben | Durchschnittliche Zeit um 40 % gesunken, Qualität um 18 % gestiegen; exponierte Beschäftigte nutzten es zwei Wochen später 2-mal so häufig im Job | Kurze, von Gutachtern bewertete Aufgaben; ein Werkzeug und eine Modellgeneration |
| Dell’Acqua und Kollegen, 2023, Harvard Business School Working Paper | 758 Beraterinnen und Berater einer Firma, 18 realistische Aufgaben innerhalb der KI-Grenze, eine Aufgabe außerhalb | Analyse, Schreiben, Strategiememos | Innerhalb der Grenze: 12,2 % mehr Aufgaben, 25,1 % schneller, mehr als 40 % höhere Qualität; unterdurchschnittliche Performer gewannen 43 %, überdurchschnittliche 17 %. Der Arm mit einem Prompt-Engineering-Überblick steigerte die Qualitätswerte um 25,1 % gegenüber 17,9 % für KI allein | Außerhalb der Grenze lagen KI-Nutzer mit 19 Prozentpunkten geringerer Wahrscheinlichkeit richtig (Kontrolle etwa 84,5 %, KI-Arme 60 und 70 %) |
| Brynjolfsson, Li und Raymond, 2025, Quarterly Journal of Economics (arXiv-Version) | 5.172 Kundensupport-Agenten, gestaffelte Einführung eines KI-Assistenten | Chatbasierter Kundensupport | Gelöste Anliegen pro Stunde im Schnitt um 15 % gestiegen; etwa 30 % bei weniger erfahrenen Agenten, 36 % im untersten Kompetenzquintil; Agenten folgten den Empfehlungen in 35 % der Fälle | Minimale Gewinne und leichte Qualitätsrückgänge bei den erfahrensten Agenten |
| Peng, Kalliamvakou, Cihon und Demirer, 2023, arXiv | 95 professionelle Programmierer, eine HTTP-Server-Aufgabe | Programmieren | Behandelte Gruppe 55,8 % schneller (71,17 gegenüber 160,89 Minuten), Konfidenzintervall 21 bis 89 % | Einzelne Aufgabe und kleine Stichprobe, daher ein breites Konfidenzintervall |
| Cui, Demirer, Jaffe, Musolff, Peng und Salz, 2025 (Microsoft, Accenture und ein Fortune-100-Unternehmen) | 4.867 Entwickler in drei randomisierten Rollouts | Programmieren | 26,08 % mehr abgeschlossene Aufgaben (Standardfehler 10,3); Junior-Entwickler gewannen 21 bis 40 %, Seniors 7 bis 16 % | Jedes Experiment für sich verrauscht; die Adoption unter behandelten Entwicklern lag zu verschiedenen Zeitpunkten zwischen 42,5 und 75,6 %, die Effekte gelten also pro Nutzer |
| Chatterji und Kollegen, 2025, NBER (ChatGPT-Nutzung) | Etwa 1,1 Millionen gesampelte Konversationen, Mai 2024 bis Juni 2025 | Gesamte berufliche Nutzung | Schreiben macht 40 % der beruflichen Nachrichten aus; etwa zwei Drittel der Schreibnachrichten bitten das Modell, vom Nutzer gelieferten Text zu überarbeiten statt neu zu entwerfen; etwa 81 % der beruflichen Nachrichten fallen unter zwei breite Tätigkeiten, Informationen verarbeiten und Entscheidungen treffen oder Probleme lösen | Nur Consumer-Tarife; klassifikatorbasiert |
Das Muster in der Tabelle ist das Fundament des Index weiter unten. Die Gewinne sind am größten, wo die Aufgabe häufig und klar spezifiziert ist und innerhalb der Kompetenz des Modells liegt, und sie sind am größten für Menschen mit weniger Erfahrung in der Aufgabe. Die eine Studie, die Prompt-Anleitung direkt testete (der Überblicks-Arm bei Dell’Acqua), fand, dass sie die Qualität weiter verbesserte. Die eine Studie, die eine Aufgabe außerhalb der Grenze testete, fand einen Malus, der groß genug war, den Nutzen auszulöschen.
Wie verbreitet ist KI-Nutzung, und wie viel Zeit spart sie?
Zwei unabhängige Umfrageprogramme verfolgen dieselbe Frage mit unterschiedlichen Definitionen, deshalb halten wir sie in getrennten Zeilen und verschneiden sie nicht.
| Quelle | Messgröße | Neueste verifizierte Werte | Trend |
|---|---|---|---|
| Gallup-Quartalspanel der Erwerbsbevölkerung (US-Beschäftigte, 19.043 bis 23.717 Befragte pro Welle) | Nutzen KI in ihrer Rolle ein paar Mal im Jahr oder öfter / ein paar Mal pro Woche oder öfter / täglich | 52 / 30 / 15 % (Mai 2026) | 40 / 19 / 8 % im Mai 2025; tägliche Nutzung 4 % im Mai 2024 |
| Gallup, dasselbe Panel | Organisation hat einen klaren KI-Plan kommuniziert | 25 % (Mai 2026) | 22 % im Mai 2025; 47 % sagen, ihre Organisation habe KI-Werkzeuge integriert |
| Gallup, dasselbe Panel | Häufigste Nutzungen unter KI-Nutzern | Schreiben und Redigieren 51 %, Suche oder Recherche 49 %, allgemeine Unterstützung oder Problemlösung 39 % | Welle vom Mai 2026 |
| Bick, Blandin und Deming, Real-Time Population Survey, NBER Working Paper 32966 | Anteil der US-Beschäftigten, die generative KI bei der Arbeit nutzen; eingesparte Zeit | 26,5 % irgendeine Nutzung, 9,0 % an jedem Arbeitstag, 22,9 % wöchentlich (August und November 2024); Nutzer sparen 5,4 % der Arbeitsstunden, 1,4 % über alle Beschäftigten | Top-zwei-Aufgaben: Schreiben 39,5 %, Administratives 25,6 %, Interpretieren oder Zusammenfassen 22,7 %, Faktensuche 18,0 %, Ideenfindung 13,2 %, Programmieren 12,9 %, Dokumentation 12,7 % |
| St. Louis Fed Generative AI Adoption Tracker (dieselbe Umfrage, revidierte Definitionen) | Wöchentliche berufliche Nutzung; unterstützte Stunden; eingesparte Stunden | 39,2 % wöchentliche Nutzung (Q2 2026); 6,3 % der Stunden unterstützt; 2,2 % der Stunden eingespart | Ausgangswerte 28,2 %, 4,1 % und 1,6 % im Q3 2024 |
Zwei Zahlen aus diesen Tabellen setzen den Einsatz fest. Wer generative KI nutzt, spart nach eigener Schätzung etwa 2,2 Stunden pro Woche, und drei von vier Beschäftigten haben keinen organisatorischen Plan, der ihnen hilft. Welches System auch immer existiert, es wird ein persönliches sein.
Der Vorlagen-Prioritätsindex
Die folgende Tabelle ist ein redaktionelles Framework von CEOtudent. Sie verbindet drei verifizierte Quellen, die bisher nicht kombiniert wurden: Gallups Anteile der Anwendungsfälle unter KI-Nutzern, die am höchsten gereihten Arbeitsaufgaben der Fed-Umfrage und die Feldexperiment-Evidenz je Aufgabenfamilie. Die Priorität wird nach einer ausgewiesenen Regel vergeben, nicht allein nach Urteil: Priorität 1 bedeutet, dass die Aufgabenfamilie sowohl häufig ist (Top drei in einer der beiden Umfragen) als auch durch mindestens eine randomisierte oder quasi-randomisierte Feldstudie gestützt wird; Priorität 2 bedeutet eines von beiden; Priorität 3 bedeutet keines von beiden, oder die Evidenz trägt eine Verifizierungswarnung.
| Aufgabenfamilie | Anteil der KI-Nutzer (Gallup, Mai 2026) | Anteil mit Rang unter den Top zwei (Fed-Umfrage, 2024) | Stärkste Feldevidenz | Wiederholbarkeit (redaktionell) | Priorität |
|---|---|---|---|---|---|
| Redigieren und Umschreiben von Text, den Sie liefern | 51 % (Schreiben und Redigieren) | 39,5 % (Schreiben) | Noy und Zhang: 40 % schneller, 18 % höhere Qualität; zwei Drittel der ChatGPT-Schreibnachrichten sind Überarbeitungen | Hoch: gleiche Eingaben, gleiches Publikum, wöchentlich | 1 |
| Entwerfen von Routinedokumenten und administrativem Text | Innerhalb der 51 % | 25,6 % (Administratives), 12,7 % (Dokumentation) | Brynjolfsson, Li und Raymond: 15 % mehr gelöste Anliegen in skriptgestützter Supportarbeit | Hoch | 1 |
| Zusammenfassen, Interpretieren und Übersetzen | Nicht separat ausgewiesen | 22,7 % | Dell’Acqua: Aufgaben innerhalb der Grenze umfassten Analyse und Synthese, 12,2 % mehr Aufgaben, mehr als 40 % Qualität | Mittel: Eingaben variieren | 2 |
| Strukturierte Analyse und Problemlösung | 39 % (allgemeine Unterstützung oder Problemlösung) | Nicht separat ausgewiesen | Dell’Acqua: starke Gewinne innerhalb der Grenze, 19 Prozentpunkte schlechter außerhalb | Mittel, mit Grenzhinweis auf jeder Karte | 2 |
| Recherche und Faktensuche | 49 % | 18,0 % | Keine randomisierte Feldstudie hat die Genauigkeit von KI-Suche bei der Arbeit gemessen | Niedrig: jeder Output braucht Verifizierung | 3 |
| Programmieren | Nicht separat ausgewiesen | 12,9 % | Peng: 55,8 % schneller; Cui: 26,08 % mehr Aufgaben | Hoch für Entwickler | 1 für Entwickler, sonst nicht anwendbar |
| Ideenfindung | Nicht separat ausgewiesen | 13,2 % | Keine Feldstudie hat sie isoliert; Noy und Zhang beschreiben eine Verschiebung der Aufgaben hin zu Ideenfindung und Redigieren | Niedrig: Outputs sind nicht vergleichbar | 3 |
Lesen Sie den Index als Reihenfolge für den Aufbau. Ihre ersten drei Karten sollten das Redigieren von Text, den Sie selbst geschrieben haben, die Routinedokumente, die Sie jede Woche produzieren, und (falls Sie programmieren) Ihre häufigste Programmieraufgabe abdecken. Recherche-Prompts kommen zuletzt und tragen von vornherein einen Verifizierungsschritt.
Die Prompt-Karte: eine Vorlage, neun Felder
Eine Bibliothek ist nur so gut wie ihre Speichereinheit. Wir empfehlen eine Karte mit neun Feldern, in Klartext gehalten, damit sie jeden Werkzeugwechsel übersteht. Die Felder bilden die Forschung ab: Das eingefrorene Format antwortet auf Sclar und Mizrahi, die Testfälle antworten auf die Berkeley-Studie, die Grenzlinie antwortet auf Dell’Acqua.
| Feld | Was hineingehört | Warum es existiert |
|---|---|---|
| Name und Version | Familie-Verb-Objekt plus Versionsnummer, zum Beispiel “edit-exec-summary-v3” | Innerhalb eines Monats haben Sie fünf Varianten; Namen stoppen die Drift |
| Auslöser | Die konkrete Situation, die nach dieser Karte verlangt, zum Beispiel “jeder Entwurf über 300 Wörter, der an eine Entscheiderin oder einen Entscheider geht” | Karten werden nach Situation abgerufen, nicht nach Cleverness |
| Erforderliche Eingaben | Genau das, was Sie einfügen oder anhängen müssen: Entwurf, Publikum, gewünschte Entscheidung, Längenlimit | Fehlende Eingaben sind die häufigste Ursache schwacher Outputs |
| Prompt-Text (eingefroren) | Der vollständige Text einschließlich Trennzeichen und Groß- und Kleinschreibung, nie aus dem Gedächtnis neu getippt | Formatierungsänderungen allein verschieben Ergebnisse |
| Modell und Einstellungen | Mit welchem Modell und Modus Sie getestet haben, mit Verweis auf Ihre Routing-Regel | Ergebnisse übertragen sich nicht unverändert zwischen Modellen |
| Testfälle | Drei Eingaben mit dem Output, den Sie akzeptiert haben, daneben gespeichert | Eine Karte wird erst nach drei Durchläufen befördert, nicht nach einem |
| Bekannte Fehlermodi | Was dieser Prompt falsch macht, wenn er scheitert, zum Beispiel “fügt Fakten hinzu, die der Entwurf nicht enthielt” | Macht aus einer bösen Überraschung eine dauerhafte Leitplanke |
| Grenzlinie | Der explizite Satz “nicht verwenden für”, zum Beispiel “nicht für juristische oder finanzielle Formulierungen” | Der Malus außerhalb der Grenze ist das größte dokumentierte Einzelrisiko |
| Zuletzt verifiziert und Verantwortliche | Datum, an dem Sie die Testfälle zuletzt ausgeführt haben; wer die Karte im Team pflegt | Modelle ändern sich; eine Karte ohne Datum ist ein Gerücht |
Eine ausgefüllte Karte
Name und Version: edit-exec-summary-v3 (Executive Summary redigieren, dritte Version).
Auslöser: Jeder Entwurf von mehr als 300 Wörtern, der von jemandem gelesen wird, der etwas entscheidet.
Erforderliche Eingaben: Der Entwurf; die Rolle der Leserin oder des Lesers; die eine Entscheidung, die die Leserin oder der Leser treffen muss; das Längenlimit in Wörtern.
Prompt-Text (eingefroren): “Du redigierst, du schreibst nicht neu. Behalte jede Tatsachenbehauptung exakt wie vorgegeben bei und füge keinen Fakt, keine Zahl und kein Beispiel hinzu, die nicht im Entwurf stehen. Leser: [Rolle]. Entscheidung, die der Leser nach der Lektüre treffen muss: [Entscheidung]. Schreibe den Entwurf so um, dass der erste Absatz die Empfehlung und die eine Zahl nennt, die sie stützt, der zweite Absatz die zwei stärksten Gründe liefert und der letzte Absatz das Risiko benennt und das, was die Empfehlung ändern würde. Maximal [N] Wörter. Wo dem Entwurf ein Fakt fehlt, den der Leser brauchen wird, füge die Markierung [LÜCKE: was fehlt] ein, statt sie zu füllen. Gib nur den umgeschriebenen Text zurück.”
Modell und Einstellungen: Das Allzweckmodell aus unserer Routing-Regel für das Schreiben; kein Browsing.
Testfälle: Ein Budgetmemo, eine Projektstatus-E-Mail, ein Satz Foliennotizen, jeweils mit gespeichertem akzeptiertem Output.
Bekannte Fehlermodi: Lässt beim Verdichten Einschränkungen wie “vorläufig” fallen; verschmilzt gelegentlich zwei Gründe zu einem.
Grenzlinie: Nicht für Vertragssprache, regulatorische Einreichungen oder irgendetwas mit Rechtswirkung; nicht für Entwürfe ohne Zahlen (dafür die Entwurfskarte verwenden).
Zuletzt verifiziert und Verantwortliche: 2026-10, Sie.
Beachten Sie, dass die Karte den Befund aus den ChatGPT-Nutzungsdaten kodiert: Zwei Drittel der professionellen Schreibanfragen sind Überarbeitungen von Text, den der Nutzer bereits hat. Die wertvollste Karte in den meisten Bibliotheken ist eine Redigierkarte, keine Entwurfskarte.
Wie organisieren Sie die Bibliothek?
Ordner nach Aufgabenfamilie, nicht nach Werkzeug. Werkzeuge ändern sich; die Aufgabenfamilien im Index oben sind seit 2024 in jeder Umfrage stabil geblieben. Verwenden Sie die sieben Familien als oberste Ordnerebene und lassen Sie Programmieren leer, wenn Sie nicht programmieren.
Drei Stufen innerhalb jeder Familie. Kernkarten sind die, die Sie wöchentlich ausführen; sie haben drei Testfälle und ein Datum. Situative Karten laufen monatlich oder seltener; sie haben einen Testfall. Experimentelle Karten sind alles, was Sie einmal ausprobiert haben; sie liegen im Ordner, tragen aber bis zur Beförderung keine Versionsnummer. Der Berkeley-Befund ist der Grund für das Stufensystem: Das menschliche Standardverhalten ist, nach einem Erfolg zu befördern.
Eine Indexdatei. Eine einzelne Seite, die jede Kernkarte mit ihrem Auslöser auflistet. Abgerufen wird nach Auslöser (“Entwurf geht an eine Entscheiderin oder einen Entscheider”), denn so werden Sie sich unter Zeitdruck tatsächlich erinnern.
Eingaben separat speichern. Ihr stehender Kontext (Rolle, Publikum, Hausstil, Einschränkungen) gehört in ein Kontextdokument, nicht in jede Karte. Unsere Beiträge zur Kontextdatei und zur Konfiguration von Custom Instructions, Projekten und Memory decken diese Schicht ab; die Karten bleiben dann kurz und portabel. Auf welchem Modell eine Karte getestet wird, folgt Ihrer Routing-Regel.
Sechs Betriebsregeln aus der Evidenz
- Das Format einfrieren. Kopieren Sie den Prompt-Text wortwörtlich. “Räumen” Sie Trennzeichen, Großschreibung oder Abstände zwischen den Durchläufen nicht “auf”. Sclar und Kollegen merken an, dass es für Leute, die Systeme auf einem Modell aufbauen, eine gültige Methode ist, ein funktionierendes Format zu wählen und beizubehalten.
- Drei Fälle vor der Beförderung. Ein Prompt wandert erst von Experimentell nach Kern, wenn drei verschiedene Eingaben akzeptierten Output produziert haben. Mizrahis Multi-Prompt-Evaluation ist die Forschungsversion derselben Regel.
- Die Grenzlinie zuerst schreiben. Bevor Sie eine Karte speichern, schreiben Sie den Satz, der sagt, wofür sie nicht verwendet werden darf. Dell’Acquas Berater verloren bei der einen Aufgabe, die das Werkzeug nicht konnte, 19 Prozentpunkte Genauigkeit, und sie bemerkten es nicht.
- Fehler als Felder festhalten, nicht als Erinnerungen. Jedes Mal, wenn eine Karte scheitert, wandert der Fehler noch am selben Tag in das Feld für bekannte Fehler. Die Berkeley-Teilnehmenden verallgemeinerten aus einzelnen Misserfolgen so bereitwillig wie aus einzelnen Erfolgen; eine schriftliche Aufzeichnung verhindert beides.
- Datieren und vierteljährlich erneut testen. Führen Sie die drei Testfälle jedes Quartal auf dem aktuellen Modell erneut aus. Ändert sich der Output wesentlich, erhöhen Sie die Version.
- Die Kernstufe teilen. Gallup stellt fest, dass drei von vier Beschäftigten keinen organisatorischen KI-Plan haben, und in Microsofts Umfrage von 2024 unter 31.000 Wissensarbeitern brachten 78 Prozent der Nutzer ihre eigenen KI-Werkzeuge mit zur Arbeit. Ein im Team geteilter Kernordner ist die kleinste Einheit eines KI-Plans, die tatsächlich existiert. Er schließt auch die Erfahrungslücke, die die Feldexperimente immer wieder finden: Neulinge gewannen in den Support- und Beratungsstudien 30 bis 43 Prozent, und eine geteilte Karte ist der Weg, auf dem ein Neuling sich den Prompt eines Experten leiht.
Die CEO-Sicht und die Student-Sicht
Führen Sie die Bibliothek wie ein Anlagenregister. Jede Karte hat eine verantwortliche Person, eine Version, ein Datum der letzten Verifizierung und eine Ausmusterungsregel (sechs Monate keine Nutzung heißt archivieren). Messen Sie sie einmal im Quartal mit dem Maßstab der Fed-Umfrage selbst: Wie viele Stunden haben Ihnen die Kernkarten diese Woche nach ehrlicher Schätzung gespart? Liegt die Antwort unter den 2,2 Stunden pro Woche, die der durchschnittliche Nutzer angibt, deckt die Bibliothek Ihre häufigen Aufgaben nicht ab, und der Index oben sagt Ihnen, welche Familie fehlt.
Lernen Sie aus ihr wie aus einem Laborbuch. Jede Karte ist eine Hypothese darüber, was funktioniert; die Testfälle sind das Experiment; das Feld für bekannte Fehler ist das Ergebnis, das Sie nicht wollten. Der Student in Ihnen bekommt von der Forschung eine beruhigende Tatsache mit: Die Menschen, die in jedem Feldexperiment am meisten von KI-Unterstützung profitierten, waren die weniger erfahrenen, und der Mechanismus war der Zugang zu kodifizierter guter Praxis. Eine Bibliothek ist kodifizierte gute Praxis, die Sie für sich selbst geschrieben haben. Sie passt natürlich zum Framework für Fragequalität: Die Karte hält das Format, das Framework prüft, ob die Frage darin es wert ist, gestellt zu werden.
Was diese Evidenz Ihnen nicht sagen kann
- Keine randomisierte Studie hat “das Führen einer Prompt-Bibliothek” als Intervention getestet. Die Argumentation hier ist aus Studien zu Prompt-Fragilität, Laienverhalten, Prompt-Qualität und Produktivität auf Aufgabenebene zusammengesetzt. Behandeln Sie sie als gut gestützte Schlussfolgerung, nicht als gemessenen Effekt.
- Die Feldexperimente nutzten Modelle von 2023 bis 2025 für bestimmte Aufgaben in bestimmten Firmen. Die Effektgrößen werden für Ihre Aufgaben und für aktuelle Modelle anders ausfallen; genau deshalb trägt die Karte ein Datum und Testfälle.
- Die Fragilitätsergebnisse wurden überwiegend an Open-Weight-Modellen in Few-Shot-Settings gemessen. Neuere Modelle mögen weniger empfindlich sein, aber das Sclar-Paper fand, dass die Empfindlichkeit nach Skalierung und Instruktionstuning bestehen blieb, und die Kosten des Einfrierens eines Formats liegen nahe null.
- Umfragezahlen sind selbstberichtet, und die beiden Umfrageprogramme definieren Nutzung unterschiedlich. Wir kombinieren nie eine Gallup-Zahl mit einer Fed-Zahl in einem Satz.
- Die Knoth-Studie hat 45 Studierende und akademische Aufgaben; die Berkeley-Studie hat 10 Teilnehmende. Beide werden hier für den Mechanismus herangezogen, nicht für die Größenordnung.
Häufig gestellte Fragen
Ist eine Prompt-Bibliothek dasselbe wie ein Prompt-Engineering-Leitfaden?
Nein. Ein Leitfaden nennt Ihnen Prinzipien; eine Bibliothek enthält die konkreten Prompts, die Ihre Testfälle bei Ihren Aufgaben bestanden haben. Das Dell’Acqua-Experiment legt nahe, dass ein kurzer Prompt-Engineering-Überblick die Ergebnisse verbessert, und die Bibliothek ist der Ort, an dem dieser Überblick zu wiederverwendbarer Praxis wird.
Wie viele Karten brauche ich?
Weniger, als Sie denken. Beginnen Sie mit drei Kernkarten aus den Familien mit Priorität 1. Die wöchentliche KI-Nutzung der meisten Fachkräfte konzentriert sich auf Redigieren, Routinedokumente und Suche, weshalb der Index sie an den Anfang stellt.
Soll ich die Karten in der werkzeugeigenen Funktion für gespeicherte Prompts ablegen?
Speichern Sie die Masterkopie als Klartext, den Sie kontrollieren, und spiegeln Sie sie der Bequemlichkeit halber in Werkzeugfunktionen. Werkzeugfunktionen ändern sich, und die Testfälle und Fehlerfelder der Karte haben dort meist keinen Platz.
Was ist mit Prompts für KI-Agenten statt für Chat?
Dieselbe Karte funktioniert, wobei die Grenzlinie mehr Arbeit übernimmt. Unsere Beiträge zum Delegieren an einen KI-Agenten und zum Context Engineering behandeln die zusätzlichen Felder, die ein Agenten-Briefing braucht.
Woher weiß ich, dass eine Karte nach einem Modell-Update noch gut ist?
Führen Sie die drei Testfälle erneut aus. Ändern sich zwei von drei Outputs auf eine Weise, die Sie nicht akzeptiert hätten, geht die Karte zurück nach Experimentell, bis sie wieder besteht.
Quellen
- Gallup, “AI Use at Work Has Nearly Doubled in Two Years” (Juni 2025), “Organizational AI Adoption Jumps Six Points” (Juli 2026) und der Gallup Indicator on Artificial Intelligence (Datenstand Mai 2026).
- Bick, Blandin und Deming, “The Rapid Adoption of Generative AI”, National Bureau of Economic Research Working Paper 32966 (revidiert Februar 2025); Federal Reserve Bank of St. Louis, “The Impact of Generative AI on Work Productivity” (Februar 2025) und FRED Blog, “Does generative AI save time at work?” (August 2026).
- Chatterji, Cunningham, Deming, Hitzig, Ong, Shan und Wadman, “How People Use ChatGPT”, National Bureau of Economic Research Working Paper 34255, September 2025.
- Sclar, Choi, Tsvetkov und Suhr, “Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design”, International Conference on Learning Representations 2024.
- Mizrahi, Kaplan, Malkin, Dror, Shahaf und Stanovsky, “State of What Art? A Call for Multi-Prompt LLM Evaluation”, Transactions of the Association for Computational Linguistics, Band 12, 2024.
- Zamfirescu-Pereira, Wong, Hartmann und Yang, “Why Johnny Can’t Prompt: How Non-AI Experts Try (and Fail) to Design LLM Prompts”, Proceedings of CHI 2023.
- Knoth, Tolzin, Janson und Leimeister, “AI literacy and its implications for prompt engineering strategies”, Computers and Education: Artificial Intelligence, Band 6, 2024.
- Noy und Zhang, “Experimental evidence on the productivity effects of generative artificial intelligence”, Science, 381(6654), 2023, Seiten 187 bis 192.
- Dell’Acqua, McFowland, Mollick, Lifshitz-Assaf, Kellogg, Rajendran, Krayer, Candelon und Lakhani, “Navigating the Jagged Technological Frontier”, Harvard Business School Working Paper 24-013, 2023.
- Brynjolfsson, Li und Raymond, “Generative AI at Work”, Quarterly Journal of Economics, 140(2), 2025 (Zahlen aus der arXiv-Version vom November 2024).
- Peng, Kalliamvakou, Cihon und Demirer, “The Impact of AI on Developer Productivity: Evidence from GitHub Copilot”, arXiv 2302.06590, 2023.
- Cui, Demirer, Jaffe, Musolff, Peng und Salz, “The Effects of Generative AI on High-Skilled Work: Evidence from Three Field Experiments with Software Developers”, 2025 (Autorenversion, Juni 2025); Microsoft und LinkedIn, 2024 Work Trend Index Annual Report (für die Zahl zu selbst mitgebrachten KI-Werkzeugen).
Dieser Inhalt wurde nach eingehender Recherche mit Unterstützung von KI zusammengestellt und vom CEOtudent-Redaktionsteam geschrieben und für die Veröffentlichung aufbereitet.
This post is also available in:




