GelişimStrateji
0

Intellektuelle Ehrlichkeit als Wettbewerbsvorteil: Öfter recht haben, indem man sich schneller irrt

Professional smiling while revising a note in a paper notebook at a sunlit desk

Kurzfassung. Intellektuelle Ehrlichkeit klingt nach einer Charaktereigenschaft. In der Prognoseforschung verhält sie sich wie eine Fähigkeit, die sich messen lässt. Im Good Judgment Project, einem Forschungsteam, das an einem von US-Nachrichtendiensten finanzierten Prognoseturnier teilnahm, nahmen die treffsichersten Prognostiker „häufige, kleine Anpassungen“ vor, während Prognostiker mit geringer Treffsicherheit „dazu neigten, ihr Ausgangsurteil zu bestätigen oder selten und stark zu korrigieren“ (Atanasov und Kollegen, 2020, auf Basis von mehr als 400.000 Vorhersagen zu fast 500 Fragen). Die Elitegruppe, die Superforecaster, gab im Schnitt 7,8 Prognosen pro Frage ab, reguläre Teams 1,6 und Einzelprognostiker 1,4. Wir haben die veröffentlichte Genauigkeitstabelle nachgerechnet: In der letzten Woche vor Schließung der Fragen lag der Brier-Score der Superforecaster mit 0,07 um 56 % unter dem trainierter Teams (0,16) und um 73 % unter dem untrainierter Einzelpersonen (0,26). Dazu gehören zwei ehrliche Einschränkungen. Anpassen zahlt sich nur aus, wenn die Evidenz aussagekräftig ist: In einer Studie schnitten die aufgeschlossensten Menschen bei Überraschungsergebnissen schlechter ab. Und eine Neuanalyse von 2024 argumentiert, dass die gefeierten Trainings- und Teameffekte schrumpfen oder verschwinden, sobald man den Zeitpunkt der Antworten und die Auswahl der Fragen kontrolliert. Die praktische Regel übersteht beide Einschränkungen: Legen Sie sich auf eine Zahl fest, benennen Sie vorab, was sie ändern würde, und bewegen Sie sie in kleinen Schritten, sobald Evidenz eintrifft.

Warum intellektuelle Ehrlichkeit eine Leistungsvariable ist und keine Tugend

Intellektuelle Ehrlichkeit wird meist als Frage der Ethik dargestellt: Man gesteht Fehler ein, weil es richtig ist. Diese Sichtweise macht sie optional, und viel beschäftigte, ehrgeizige Menschen neigen dazu, das Eingestehen eines Irrtums als Kosten für ihre Glaubwürdigkeit zu betrachten.

Die Prognoseliteratur stellt die Frage anders. Wer seine Überzeugungen als Wahrscheinlichkeiten formuliert und sie mit dem tatsächlichen Ausgang abgleicht, stellt fest: Die Gewohnheiten, die wir intellektuelle Ehrlichkeit nennen (widersprechende Evidenz wahrnehmen, öffentlich korrigieren, nicht an einer ersten Antwort festhalten), hinterlassen eine messbare Spur in der Treffsicherheit. Sie sind dann keine Tugend mehr, die man zur Schau stellt, sondern eine Größe, die man verfolgen kann.

Drei Forschungsstränge untermauern das, jeder mit einer Grenze, die man kennen sollte:

  • Anpassung von Überzeugungen bei realen Prognosen (Mellers und Kollegen, 2014 und 2015; Atanasov und Kollegen, 2020): wie oft und wie stark die besten Prognostiker korrigieren.
  • Aktiv aufgeschlossenes Denken (Haran, Ritov und Mellers, 2013): die Neigung, Informationen zu suchen, auch solche, die einen widerlegen könnten, und was das für die Treffsicherheit bedeutet.
  • Intellektuelle Demut (Leary und Kollegen, 2017): das Ausmaß, in dem Menschen anerkennen, dass ihre Überzeugungen falsch sein könnten, und wie das ihre Bewertung von Argumenten und anderen Menschen prägt.

Das ist die CEOtudent-Perspektive in einem Satz. Der CEO verantwortet eine Entscheidung und legt sich auf eine Position fest. Der Student behandelt diese Position als Entwurf und überarbeitet sie laufend. Treffsicherheit entsteht, wenn man beides zugleich tut.

Wie Treffsicherheit gemessen wird: der Brier-Score verständlich erklärt

Die Prognoseforschung braucht eine Bewertungsregel, die Ehrlichkeit belohnt, und der Standard ist der Brier-Score, den Brier 1950 in der Zeitschrift Monthly Weather Review vorschlug und der im gesamten Good Judgment Project verwendet wurde. In der Variante des Projekts wird eine Prognose zu einer Ja-Nein-Frage als Summe der quadrierten Abstände zwischen den angegebenen Wahrscheinlichkeiten und dem tatsächlichen Ausgang bewertet. Ein perfekter Wert ist 0, der schlechtestmögliche 2.

Mellers und Kollegen liefern das Rechenbeispiel. Angenommen, Sie sagen 90 %, dass ein Ereignis eintritt. Tritt es ein, beträgt Ihr Score (0,9 – 1)² + (0,1 – 0)² = 0,02. Tritt es nicht ein, beträgt er (0,9 – 0)² + (0,1 – 1)² = 1,62. Selbstsicher danebenzuliegen kostet 81-mal so viel, wie selbstsicher richtigzuliegen einbringt. Die Scores werden über jeden Tag gemittelt, an dem eine Frage offen ist, sodass eine wochenlang nicht aktualisierte Prognose den Fehler immer weiter erhöht.

Für intellektuelle Ehrlichkeit zählen zwei Eigenschaften. Erstens ist die Regel „proper“ (strikt korrekt): Die beste langfristige Strategie besteht darin, anzugeben, was man tatsächlich glaubt, statt die eigene Zuversicht zu übertreiben. Zweitens macht die Mittelung über die Tage das Anpassen sichtbar. Wer am Ende richtigliegt, sich aber während des größten Teils der Laufzeit nicht bewegt hat, zahlt trotzdem für jeden veralteten Tag.

Was die besten Prognostiker tatsächlich anders machen

Das Good Judgment Project führte innerhalb des Turniers randomisierte Experimente durch. Im zweiten Jahr wurden die besten 2 % des ersten Jahres in Eliteteams aus Superforecastern zusammengefasst. Die veröffentlichte Tabelle der Treffsicherheit nach Zeitabschnitten ist der nützlichste Ausgangspunkt, weil sie die Genauigkeit zu Beginn, in der Mitte und am Ende jeder Frage zeigt.

Tabelle 1. Durchschnittliche Brier-Scores nach Zeitabschnitt, Jahr 2 (verifizierte Daten aus Mellers und Kollegen, 2014, Tabelle 1; niedriger ist besser; Fragen mindestens einen Monat offen)

Bedingung Erste Woche Mittlere 2 Wochen Letzte Woche
Einzelprognostiker, ohne Training 0,46 0,39 0,26
Einzelprognostiker, Wahrscheinlichkeitstraining 0,42 0,36 0,24
Teamprognostiker, ohne Training 0,38 0,32 0,16
Teamprognostiker, Wahrscheinlichkeitstraining 0,40 0,28 0,16
Superforecaster 0,25 0,19 0,07

Dieselbe Studie berichtet, wie stark sich jede Gruppe engagierte. Über das zweite Jahr hinweg gaben die Teilnehmenden im Schnitt 1,8 Vorhersagen pro Frage ab. Unabhängige Prognostiker kamen auf 1,4, reguläre Teams auf 1,6 und Superforecaster auf 7,8. Die Autoren bezeichnen das Engagement der Superforecaster als „außergewöhnlich“. Superforecaster beantworteten zudem mehr Fragen: im Schnitt 95, gegenüber 61 bei regulären Teams.

Die Studie liefert auch ein konkretes Beispiel dafür, was unterlassenes Anpassen kostet. Die Kalibrierung war bei Prognosen von 100 % am schlechtesten, und die Autoren benennen die Ursache klar: „Das Problem war mangelndes Anpassen.“ Prognosen von 100 %, die in den ersten 20 % der Laufzeit einer Frage abgegeben wurden, trafen nur in etwa 70 % der Fälle zu. Dieselben Prognosen, abgegeben in den letzten 20 % der Tage, lagen in etwa 90 % der Fälle richtig. Früh geäußerte Gewissheit verhielt sich wie eine zu lange festgehaltene Vermutung.

Die Folgestudie zu Superforecastern (Mellers und Kollegen, 2015) ergab, dass sie ihre hohe Treffsicherheit zwei Jahre in Folge hielten und damit „den Erwartungen einer Regression zur Mitte trotzten“. Die Autoren stützen vier sich gegenseitig verstärkende Erklärungen: kognitive Fähigkeiten und Denkstile, aufgabenspezifische Fertigkeiten, Motivation und Engagement sowie förderliche Umgebungen. Ihr Fazit lautet, Superforecaster würden „teils entdeckt und teils geschaffen“. Die zweite Hälfte dieses Satzes ist der Grund, warum das für alle relevant ist, die noch keine Superforecaster sind.

Kleine Schritte schlagen große Sprünge: die Evidenz zum Anpassen

Die direkteste Evidenz zum Anpassen stammt von Atanasov, Witkowski, Ungar, Mellers und Tetlock (2020). Sie nutzten vier Jahre Turnierdaten und unterschieden drei Aspekte des Anpassens: Häufigkeit (wie oft ein Prognostiker korrigiert), Ausmaß (die durchschnittliche Größe jeder Korrektur) und Bestätigungsneigung (die Tendenz, dieselbe Prognose erneut abzugeben).

Ihre Ergebnisse, in der Zusammenfassung der Autoren:

  • Die treffsichersten Prognostiker nahmen häufige, kleine Anpassungen vor.
  • Prognostiker mit geringer Treffsicherheit neigten dazu, ihr Ausgangsurteil zu bestätigen oder selten und stark zu korrigieren.
  • Häufig Anpassende erzielten höhere Werte bei kristalliner Intelligenz und Aufgeschlossenheit, griffen auf mehr Informationen zu und verbesserten sich mit der Zeit.
  • Wer in kleinen Schritten anpasste, hatte höhere Werte bei fluider Intelligenz und bezog seinen Vorteil aus den ersten Prognosen.
  • Das Ausmaß der Anpassungen vermittelte den kausalen Effekt des Trainings auf die Treffsicherheit.
  • Häufige, kleine Korrekturen lieferten „zuverlässige und valide Signale für Können“.

Zwei Punkte verdienen Betonung. Erstens sind Häufigkeit und Ausmaß unterschiedliche Gewohnheiten mit unterschiedlichen Ursachen. Häufiges Anpassen spiegelt Engagement und Informationssuche wider. Anpassen in kleinen Schritten spiegelt wider, dass man von einer vernünftigen Schätzung ausgeht, sodass keine große Korrektur nötig wird. Zweitens beschreiben die Autoren beides als Signale, mit denen Organisationen Menschen erkennen können, die gut mit Unsicherheit umgehen. Anders gesagt: Die Art, wie jemand seine Meinung ändert, ist selbst ein Beleg für sein Urteilsvermögen.

Eine Rechnung: was Verankerung, Selbstüberschätzung und schrittweises Anpassen kosten

Um den Mechanismus greifbar zu machen, haben wir eine transparente Veranschaulichung erstellt. Sie verwendet denselben Brier-Score mit zwei Ausgängen wie das Good Judgment Project, gemittelt über die Tage, an denen eine Frage offen ist. Die Frage läuft 10 Tage. Die in dieser Zeit eintreffende Evidenz deutet zunehmend auf „Ja“. Vier Prognostiker reagieren unterschiedlich. Alle Zahlen in Tabelle 2 sind illustrativ: Sie zeigen, wie die Bewertungsregel jedes Verhalten behandelt, nicht, wie ein realer Prognostiker abgeschnitten hat.

Tabelle 2. Vier Anpassungsstile bei einer illustrativen 10-Tage-Frage (CEOtudent-Berechnung; illustrative Zahlen; Brier-Score mit zwei Ausgängen, über die Tage gemittelt, 0 am besten, 2 am schlechtesten)

Stil Prognoseverlauf Anpassungen Mittlere Anpassungsgröße Score, wenn „Ja“ eintritt Score bei Überraschung („Nein“) Erwarteter Score*
Verankert 30 % an allen 10 Tagen 0 0 Punkte 0,980 0,180 0,820
Selbstüberschätzt 95 % ab Tag 1, nie korrigiert 0 0 Punkte 0,005 1,805 0,545
Später großer Sprung 30 % für 7 Tage, dann 90 % 1 60 Punkte 0,692 0,612 0,676
Schrittweise 30, 35, 42, 50, 57, 63, 70, 78, 85, 90 % 9 6,7 Punkte 0,398 0,798 0,478

*Der erwartete Score unterstellt, dass sich der Evidenztrend in 80 % der Fälle als richtig erweist. Für den selbstüberschätzten Prognostiker, dessen Sicht feststeht, bevor die Evidenz eintrifft, nehmen wir an, dass der erste Eindruck in 70 % der Fälle stimmt, was an den Befund von Mellers und Kollegen anknüpft, wonach frühe 100-%-Prognosen in etwa 70 % der Fälle zutrafen. Beide Prozentsätze sind illustrative Annahmen.

Was die Rechnung zeigt:

  1. Verankerung ist die teuerste Gewohnheit, wenn sich etwas verändert. Der verankerte Prognostiker wird an jedem Tag bestraft, an dem sich die Welt von seiner Ausgangssicht entfernt.
  2. Selbstüberschätzung gewinnt groß oder verliert katastrophal. Ein Score von 0,005, wenn man richtigliegt, 1,805, wenn man falschliegt. Das ist die Asymmetrie des Brier-Scores in Aktion.
  3. Ein später großer Sprung ist besser als gar keiner, bezahlt aber für jeden veralteten Tag davor. Das ist das Muster „seltener, großer Korrekturen“, das Atanasov und Kollegen mit geringerem Können verbinden.
  4. Schrittweises Anpassen hat den besten erwarteten Score, ist aber nicht umsonst. Führt die Evidenz in die Irre, schneidet der schrittweise Anpassende schlechter ab als der verankerte (0,798 gegenüber 0,180). Anpassen ist eine Wette darauf, dass die Evidenz aussagekräftig ist.

Dieser vierte Punkt ist keine Eigenheit unseres Beispiels. Er deckt sich mit der sorgfältigsten Studie zu Aufgeschlossenheit und Treffsicherheit, die wir als Nächstes betrachten.

Die ehrlichen Grenzen: wenn Aufgeschlossenheit nach hinten losgeht, und die Neuanalyse

Haran, Ritov und Mellers (2013) prüften in drei Studien vier Denkstile als Prädiktoren für Treffsicherheit: aktiv aufgeschlossenes Denken, Kognitionsbedürfnis, Beharrlichkeit (Grit) und die Neigung zum Maximieren. Nur aktiv aufgeschlossenes Denken sagte die Leistung vorher. Der Mechanismus waren Informationen: Aufgeschlossenere Menschen sammelten vor ihrer Schätzung mehr Informationen, und diese zusätzlichen Informationen erzeugten den Genauigkeitsgewinn. Wurde die Menge der verfügbaren Informationen konstant gehalten (Studie 2), hatte Aufgeschlossenheit keinen Einfluss auf die Leistung.

Die dritte Studie, in der Teilnehmende Ergebnisse im American Football vorhersagen sollten, liefert die Einschränkung. Wenn die Ergebnisse zu den Informationen vor dem Spiel passten, waren aufgeschlossene Denker treffsicherer. Bei Überraschungsergebnissen ging höhere Aufgeschlossenheit mit schlechterer Leistung einher, weil diese Prognostiker den Informationen enger gefolgt waren. Wie die Autoren schreiben, waren sehr aufgeschlossene Menschen bei irreführenden Informationen „anfälliger für ungültige Informationen“. Ihr Fazit ist bedingt: Solange Informationen zumindest einigermaßen prädiktiv sind, sollte aufgeschlossenes Denken helfen.

Die Studie des Good Judgment Project hat ein eigenes Beispiel. Bei einer Frage zu einer tödlichen Konfrontation im Süd- oder Ostchinesischen Meer starteten die besten Prognostiker nahe 20 %, der Basisrate, und senkten ihre Schätzungen mit der Zeit. Dann wurde ein südkoreanischer Küstenwachbeamter von einem chinesischen Fischer getötet. Trainierte Teams erzielten bei dieser Frage einen Score von 1,44, schlechter als untrainierte unabhängige Prognostiker mit 1,31.

Die größere Einschränkung ist methodischer Natur. In einer in Psychological Science veröffentlichten Neuanalyse modellierten Hauenstein, Thomas, Illingworth und Dougherty (2024) dieselben Turnierdaten mit der Item-Response-Theorie und kontrollierten die Schwierigkeit der Fragen, den Zeitpunkt der Prognosen und die Auswahl der Fragen, die die Prognostiker beantworteten. In ihren Worten haben die am besten passenden Modelle die Effekte der Team- und Trainingsmanipulationen auf die latente Prognosefähigkeit „erheblich beseitigt, verringert und in einigen Fällen sogar umgekehrt“. Sie berichten außerdem, dass diese Störvariablen Superforecaster von anderen unterscheiden können, was es schwerer macht zu sagen, worauf die Leistung der Superforecaster beruht.

Was das für unsere Argumentation bedeutet: Die Neuanalyse stellt infrage, ob ein 45-minütiges Trainingsmodul oder die Mitgliedschaft in einem Team bessere Prognosen verursacht. Sie widerlegt nicht den deskriptiven Befund, dass die treffsichersten Prognostiker häufig und in kleinen Schritten anpassen. Der Antwortzeitpunkt, eine der Variablen, die die Neuanalyse kontrolliert, ist selbst zum Teil ein Anpassungsverhalten. Mellers und Kollegen hatten 2014 berichtet, dass Training und Teamarbeit auch nach Kontrolle von Zeitpunkt und Anzahl der Prognosen signifikant blieben. Die beiden Teams sind sich methodisch uneinig, und wer sorgfältig liest, sollte die kausalen Aussagen über Training mit Vorsicht behandeln.

Intellektuelle Demut und wie Sie Menschen beurteilen, die ihre Meinung ändern

Intellektuelle Ehrlichkeit hat auch eine soziale Seite. Leary und Kollegen (2017) entwickelten eine Skala für intellektuelle Demut und definierten das Merkmal als das Ausmaß, in dem Menschen anerkennen, dass ihre Überzeugungen falsch sein könnten. In der ersten von vier Studien hing intellektuelle Demut mit Offenheit, Neugier, Ambiguitätstoleranz und geringem Dogmatismus zusammen. Menschen mit hoher intellektueller Demut neigten weniger dazu, Politiker, die ihre Haltung änderten, als „Wendehälse“ zu sehen, und sie achteten stärker auf die Überzeugungskraft von Argumenten als Menschen mit geringer Ausprägung dieses Merkmals.

Für Führungskräfte ist das relevant. Wenn die Kultur, die Sie prägen, jede Korrektur als Wankelmut behandelt, erziehen Sie Ihr Team zu den Stilen „verankert“ und „später großer Sprung“ aus Tabelle 2. Wenn Korrekturen als Reaktion auf Evidenz als normal gelten, machen Sie kleine, häufige Anpassungen sozial erschwinglich. Die Prognoseevidenz sagt, dass genau dort die Treffsicherheit liegt. Wie Sie erkennen, ob Ihre eigene erste Antwort aus den falschen Gründen hängen bleibt, lesen Sie in unserem Beitrag über die Erstschluss-Verzerrung und warum Menschen die erste Antwort einer KI akzeptieren.

Das Arbeitsprotokoll für intellektuelle Ehrlichkeit

Evidenz und Framework müssen getrennt bleiben. Die obigen Befunde sind Evidenz. Das folgende Protokoll ist unsere redaktionelle Synthese: ein Weg, diese Befunde in wöchentliche Gewohnheiten zu übersetzen. Jeder Schritt ist dem Befund zugeordnet, der ihn begründet, und der Grenze dieses Befunds.

Tabelle 3. Das Arbeitsprotokoll für intellektuelle Ehrlichkeit (redaktionelles CEOtudent-Framework, verifizierten Befunden zugeordnet)

Schritt Was Sie tun Befund, der ihn begründet Zu beachtende Grenze
1. Auf eine Zahl festlegen Wichtige Überzeugungen als Wahrscheinlichkeiten formulieren („65 %, dass dieser Launch das Ziel erreicht“), nicht als Adjektive Der Brier-Score belohnt ehrliche Wahrscheinlichkeiten und macht Treffsicherheit nachverfolgbar (Mellers und Kollegen, 2014) Eine Zahl ohne spätere Überprüfung ist Theater; Schritt 5 ist Pflicht
2. Vorab festlegen, was Ihre Meinung ändern würde Vor der Entscheidung die zwei oder drei Beobachtungen notieren, die Ihre Zahl um 10 Punkte oder mehr verschieben würden Frühe Gewissheit traf nur in etwa 70 % der Fälle zu; „das Problem war mangelndes Anpassen“ (Mellers und Kollegen, 2014) Wählen Sie Signale, die wirklich prädiktiv sind, nicht nur sichtbar
3. Von einer Basisrate ausgehen Die erste Schätzung daran verankern, wie oft Ähnliches eintritt, und dann anpassen Wer in kleinen Schritten anpasste, bezog seinen Vorteil aus besseren ersten Prognosen (Atanasov und Kollegen, 2020) Basisraten können irreführen, wenn Ihr Fall ungewöhnlich ist
4. Oft und in kleinen Schritten anpassen Aktuelle Überzeugungen planmäßig überprüfen; in Schritten bewegen, die der Evidenz entsprechen, typischerweise um wenige Punkte Die treffsichersten Prognostiker passten häufig und in kleinen Schritten an; schwächere bestätigten oder sprangen (Atanasov und Kollegen, 2020) Anpassen ist eine Wette darauf, dass Evidenz aussagekräftig ist (Haran und Kollegen, 2013)
5. Ein Fehlerprotokoll führen und bewerten Prognosen und Ausgänge festhalten; jedes Quartal einen einfachen Brier-Score berechnen Häufige, kleine Korrekturen waren „zuverlässige und valide Signale für Können“ (Atanasov und Kollegen, 2020) Wenige Entscheidungen pro Jahr bedeuten verrauschte Scores; beurteilen Sie Trends, nicht Einzelergebnisse
6. Informationen suchen, die Sie widerlegen könnten Vor einer großen Entscheidung bewusst Zeit in die stärkste Gegenevidenz investieren Aufgeschlossene Denker sammelten mehr Informationen, was ihre Treffsicherheit erklärte (Haran und Kollegen, 2013) Zusätzliche Informationen helfen nur, wenn sie valide sind
7. Korrekturen sozial sicher machen Evidenzbasierte Meinungsänderungen im Team loben; sie nie als Wankelmut bestrafen Hohe intellektuelle Demut geht mit weniger „Wendehals“-Urteilen und mehr Aufmerksamkeit für Argumentstärke einher (Leary und Kollegen, 2017) Korrelative Evidenz; Kultureffekte sind unsere Schlussfolgerung

Mehrere Werkzeuge auf CEOtudent unterstützen einzelne Schritte. Für Schritt 1 lesen Sie, wie man in Wetten denkt. Für Schritt 2 zeigt der Leitfaden zu Abbruchkriterien, wie man Bedingungen im Voraus festlegt. Für Schritt 5 liefert das Protokoll für das Entscheidungsjournal eine Vorlage, um Prognosen festzuhalten und zu überprüfen. Für Schritt 6 macht ein Pre-Mortem die Gegenevidenz zu einem festen Bestandteil der Planung.

Der CEO und der Student

Das Karriereargument für intellektuelle Ehrlichkeit ist einfach, sobald Treffsicherheit messbar ist. Menschen, die gut mit Unsicherheit umgehen, sind wertvoll, und Atanasov und Kollegen legen nahe, dass das Muster der Anpassungen einer Person ein verlässliches Signal für diese Fähigkeit ist. Eine Organisation, die Prognosen verfolgt, sieht, wer in kleinen, rechtzeitigen Schritten korrigiert und wer eine erste Antwort verteidigt, bis die Realität einen Sprung erzwingt.

Die CEO-Seite der Perspektive ist Verantwortung. Sie legen sich auf eine Zahl fest, setzen Ihren Namen darunter und entscheiden. Intellektuelle Ehrlichkeit heißt nicht, Festlegungen zu vermeiden. Der verankerte Prognostiker in Tabelle 2 hat sich festgelegt, der selbstüberschätzte ebenso. Der Unterschied liegt darin, was nach der Festlegung geschieht.

Die Studenten-Seite ist Überarbeitung. Sie behandeln jede Position als aktuellen Entwurf, wissen vorab, was sie ändern würde, und ändern sie im richtigen Maß, wenn diese Evidenz eintrifft. Die Daten deuten darauf hin, dass dies kein Zielkonflikt zwischen Zuversicht und Demut ist. Die treffsichersten Prognostiker im Good Judgment Project taten beides: Sie legten sich auf Zahlen fest und bewegten sie weiter.

Sich schneller zu irren heißt nicht, sich öfter zu irren. Es heißt, es früher zu merken, solange die Korrektur klein und günstig ist.

FAQ

Was bedeutet intellektuelle Ehrlichkeit bei Entscheidungen?
Praktisch gesehen ist es die Gewohnheit, Überzeugungen so präzise zu formulieren, dass sie widerlegt werden können, nach Evidenz zu suchen, die sie widerlegen könnte, und sie im Verhältnis zu dieser Evidenz zu korrigieren. Die Prognoseforschung macht das messbar, indem sie Wahrscheinlichkeitsurteile mit tatsächlichen Ausgängen abgleicht.

Treffen Menschen, die oft ihre Meinung ändern, bessere Vorhersagen?
In den Daten des Good Judgment Project ja, wenn die Änderungen häufig und klein sind. Atanasov und Kollegen (2020) stellten fest, dass die treffsichersten Prognostiker häufige, kleine Anpassungen vornahmen, während Prognostiker mit geringer Treffsicherheit ihr erstes Urteil bestätigten oder selten und stark korrigierten. Superforecaster gaben im Schnitt 7,8 Prognosen pro Frage ab, reguläre Teams 1,6.

Ist Aufgeschlossenheit immer besser?
Nein. Haran, Ritov und Mellers (2013) stellten fest, dass aktiv aufgeschlossene Denker treffsicherer waren, weil sie mehr Informationen sammelten, bei Überraschungsergebnissen aber, bei denen die Informationen in die falsche Richtung wiesen, ging höhere Aufgeschlossenheit mit schlechterer Leistung einher. Anpassen hilft, wenn die Evidenz zumindest einigermaßen prädiktiv ist.

Lässt sich Prognosefähigkeit trainieren?
Die ursprünglichen Ergebnisse des Good Judgment Project besagten, dass ein etwa 45-minütiges Modul zum Wahrscheinlichkeitstraining die Treffsicherheit verbesserte, mit Effekten über Prognosesaisons von jeweils etwa 8 bis 10 Monaten hinweg. Eine Neuanalyse von Hauenstein und Kollegen aus dem Jahr 2024 argumentiert, dass diese Trainings- und Teameffekte schrumpfen, verschwinden oder sich umkehren, sobald Zeitpunkt, Fragenauswahl und Schwierigkeit der Fragen kontrolliert werden. Die kausale Frage ist umstritten. Der Zusammenhang zwischen Anpassungsstil und Treffsicherheit ist besser belegt.

Wie kann ich meine eigene Treffsicherheit messen?
Notieren Sie Prognosen als Wahrscheinlichkeiten mit Datum und Auflösungsregel und bewerten Sie sie anschließend. Für eine Ja-Nein-Frage in der hier verwendeten Variante mit zwei Ausgängen ist der Score der quadrierte Abstand bei „Ja“ plus der quadrierte Abstand bei „Nein“. Wer 90 % für etwas angibt, das eintritt, erzielt 0,02, und wer 90 % für etwas angibt, das nicht eintritt, erzielt 1,62. Mitteln Sie die Scores über ein Quartal und verfolgen Sie den Trend.

Quellen

  • Mellers, B., Ungar, L., Baron, J., Ramos, J., Gurcay, B., Fincher, K., Scott, S. E., Moore, D., Atanasov, P., Swift, S. A., Murray, T., Stone, E. und Tetlock, P. E. (2014). Psychological Strategies for Winning a Geopolitical Forecasting Tournament. Psychological Science, 25(5). Tabelle 1 (Brier-Scores nach Zeitabschnitt), Engagement-Kennzahlen (Vorhersagen pro Frage), Diskussion der Kalibrierung, Rechenbeispiel zum Brier-Score, Beispiel zum Süd- und Ostchinesischen Meer.
  • Mellers, B., Stone, E., Murray, T., Minster, A., Rohrbaugh, N., Bishop, M., Chen, E., Baker, J., Hou, Y., Horowitz, M., Ungar, L. und Tetlock, P. (2015). Identifying and Cultivating Superforecasters as a Method of Improving Probabilistic Predictions. Perspectives on Psychological Science, 10(3), 267-281. Abstract: Beständigkeit der Treffsicherheit von Superforecastern und vier Erklärungen.
  • Atanasov, P., Witkowski, J., Ungar, L., Mellers, B. und Tetlock, P. (2020). Small steps to accuracy: Incremental belief updaters are better forecasters. Organizational Behavior and Human Decision Processes, 160, 19-35. Befunde aus dem Abstract zu Häufigkeit, Ausmaß und Bestätigung von Anpassungen; Konferenzfassung auf der 21st ACM Conference on Economics and Computation (EC‘20) für die Beschreibung des Datensatzes und der Anpassungsmaße.
  • Haran, U., Ritov, I. und Mellers, B. A. (2013). The role of actively open-minded thinking in information acquisition, accuracy, and calibration. Judgment and Decision Making, 8(3), 188-201. Studien 1 bis 3, Mediation durch Informationsbeschaffung, Überraschungsergebnisse, allgemeine Diskussion.
  • Hauenstein, C., Thomas, R., Illingworth, D. und Dougherty, M. (2024 online veröffentlicht; Printausgabe 2025). Rethinking the Role of Teams and Training in Geopolitical Forecasting: The Effect of Uncontrolled Method Variance on Statistical Conclusions. Psychological Science, 36(1), 3-18. Akzeptiertes Autorenmanuskript: Abstract und Diskussion.
  • Leary, M. R., Diebels, K. J., Davisson, E. K., Jongman-Sereno, K. P., Isherwood, J. C., Raimi, K. T., Deffler, S. A. und Hoyle, R. H. (2017). Cognitive and Interpersonal Features of Intellectual Humility. Personality and Social Psychology Bulletin, 43(6), 793-813. Abstract: vier Studien mit der Intellectual Humility Scale.

Tabelle 1 gibt veröffentlichte Daten von Mellers und Kollegen (2014) wieder. Die prozentualen Vergleiche im Text (zum Beispiel „56 % niedriger“) sind CEOtudent-Berechnungen auf Basis dieser Tabelle. Tabelle 2 ist eine CEOtudent-Berechnung mit illustrativen Zahlen. Tabelle 3 ist ein redaktionelles CEOtudent-Framework.


Dieser Inhalt wurde nach eingehender Recherche mit Unterstützung von KI zusammengestellt und vom CEOtudent-Redaktionsteam geschrieben und für die Veröffentlichung aufbereitet.

This post is also available in: Türkçe English Français Español

Benzer içerikler