Özet. Entelektüel dürüstlük kulağa bir karakter özelliği gibi geliyor. Tahmin araştırmalarında ise puanı olan bir beceri gibi davranıyor. ABD istihbaratının finanse ettiği bir tahmin turnuvasında yarışan araştırma ekibi Good Judgment Project’te en isabetli tahminciler “sık ve küçük güncellemeler yaptı”; düşük beceriye sahip tahminciler ise “ilk yargılarını teyit etmeye ya da seyrek ve büyük revizyonlar yapmaya yatkındı” (Atanasov ve arkadaşları, 2020; yaklaşık 500 soru üzerinde 400.000’den fazla tahmine dayanarak). Elit grup, yani süper tahminciler, soru başına ortalama 7,8 tahmin gönderdi; bu sayı sıradan takımlarda 1,6, tek başına tahmin yapanlarda 1,4’tü. Yayımlanmış isabet tablosunu yeniden hesapladık: sorular kapanmadan önceki son haftada süper tahmincilerin 0,07’lik Brier skoru, eğitimli takımlarınkinden (0,16) %56, eğitimsiz bireylerinkinden (0,26) %73 daha düşüktü. Bununla birlikte iki dürüst uyarı gelir. Güncelleme yalnızca kanıt bilgilendirici olduğunda kazandırır: bir çalışmada en açık fikirli kişiler sürpriz sonuçlarda daha kötü performans gösterdi. Ve 2024 tarihli bir yeniden analiz, çok konuşulan eğitim ve takım etkilerinin yanıt zamanlaması ile soru seçimi kontrol edildiğinde küçüldüğünü ya da kaybolduğunu savunuyor. Pratik kural her iki uyarıdan da sağ çıkıyor: bir sayıya bağlan, onu neyin değiştireceğini önceden söyle ve kanıt geldikçe küçük adımlarla hareket ettir.
Entelektüel dürüstlük neden bir erdem değil, performans değişkenidir
Entelektüel dürüstlük genellikle bir etik meselesi olarak çerçevelenir: hatalarını kabul et, çünkü doğrusu budur. Bu çerçeve onu isteğe bağlı kılar; yoğun ve hırslı insanlar da hatayı kabul etmeyi çoğu zaman güvenilirliklerine bir maliyet olarak görür.
Tahmin literatürü soruyu yeniden çerçeveliyor. İnançlarınızı olasılık olarak ifade eder ve bunları gerçekte olanlarla puanlarsanız, entelektüel dürüstlük dediğimiz alışkanlıklar (çürütücü kanıtı fark etmek, açıkça revize etmek, ilk cevaba yapışıp kalmamak) isabette ölçülebilir bir iz bırakır. Sergilediğiniz bir erdem olmaktan çıkar, takip edebileceğiniz bir girdiye dönüşür.
Bu argümanı üç kanıt kümesi destekliyor; her birinin bilinmeye değer bir sınırı var:
- Gerçek dünyada tahminde inanç güncelleme (Mellers ve arkadaşları, 2014 ve 2015; Atanasov ve arkadaşları, 2020): en iyi tahmincilerin ne sıklıkla ve ne kadar revize ettiği.
- Aktif açık fikirli düşünme (Haran, Ritov ve Mellers, 2013): sizi yanıltabileceğini gösterebilecek bilgi de dahil olmak üzere bilgi arama eğilimi ve bunun isabete etkisi.
- Entelektüel alçakgönüllülük (Leary ve arkadaşları, 2017): insanların inançlarının yanlış olabileceğini ne ölçüde kabul ettiği ve bunun argümanları ve diğer insanları değerlendirme biçimini nasıl şekillendirdiği.
CEOtudent lensi tek cümlede şudur: CEO bir kararın sahibidir ve bir pozisyona bağlanır. Öğrenci ise bu pozisyonu bir taslak olarak görür ve revize etmeye devam eder. İsabet, ikisini aynı anda yapmaktan gelir.
İsabet nasıl ölçülür: sade haliyle Brier skoru
Tahmin araştırmaları dürüstlüğü ödüllendiren bir puanlama kuralına ihtiyaç duyar; standart kural da Brier’in 1950’de Monthly Weather Review dergisinde önerdiği ve Good Judgment Project boyunca kullanılan Brier skorudur. Projenin kullandığı versiyonda evet-hayır sorusundaki bir tahmin, verdiğiniz olasılıklar ile gerçekleşen sonuç arasındaki farkların karelerinin toplamı olarak puanlanır. Mükemmel skor 0, mümkün olan en kötü skor 2’dir.
Mellers ve arkadaşları bir örnek hesap veriyor. Bir olayın gerçekleşmesine %90 dediğinizi varsayın. Olay gerçekleşirse skorunuz (0,9 – 1)² + (0,1 – 0)² = 0,02 olur. Gerçekleşmezse skorunuz (0,9 – 0)² + (0,1 – 1)² = 1,62 olur. Emin bir şekilde yanılmak, emin bir şekilde haklı çıkmanın kazandırdığının 81 katına mal olur. Skorlar sorunun açık kaldığı her gün için ortalaması alınarak hesaplanır; dolayısıyla haftalarca bayat bırakılan bir tahmin hatanıza eklenmeye devam eder.
Entelektüel dürüstlük açısından iki özellik önemli. Birincisi, kural “uygun” (proper) bir kuraldır: uzun vadede en iyi strateji, güveninizi abartmak değil gerçekten ne düşündüğünüzü bildirmektir. İkincisi, skor günlere göre ortalandığı için güncelleme görünür hale gelir. Sonunda haklı çıkan ama sorunun ömrünün büyük kısmında kıpırdamayı reddeden bir tahminci, her bayat gün için yine bedel öder.
En iyi tahminciler gerçekte neyi farklı yapıyor
Good Judgment Project, turnuva içinde randomize deneyler yürüttü. 2. yılda, 1. yılın en iyi %2’lik dilimindeki katılımcılar süper tahmincilerden oluşan elit takımlara yerleştirildi. Zaman dilimine göre isabet tablosu en kullanışlı başlangıç noktasıdır, çünkü her sorunun başında, ortasında ve sonunda isabeti gösterir.
Tablo 1. Zaman dilimine göre ortalama Brier skorları, 2. yıl (Mellers ve arkadaşları, 2014, Tablo 1’den doğrulanmış veri; düşük olan daha iyi; en az bir ay açık kalan sorular)
| Koşul | İlk hafta | Ortadaki 2 hafta | Son hafta |
|---|---|---|---|
| Bireysel tahminciler, eğitimsiz | 0,46 | 0,39 | 0,26 |
| Bireysel tahminciler, olasılık eğitimi almış | 0,42 | 0,36 | 0,24 |
| Takım tahmincileri, eğitimsiz | 0,38 | 0,32 | 0,16 |
| Takım tahmincileri, olasılık eğitimi almış | 0,40 | 0,28 | 0,16 |
| Süper tahminciler | 0,25 | 0,19 | 0,07 |
Aynı makale her grubun ne kadar katılım gösterdiğini de raporluyor. 2. yıl boyunca katılımcılar soru başına ortalama 1,8 tahmin yaptı. Bağımsız tahminciler 1,4, sıradan takımlar 1,6, süper tahminciler ise 7,8 tahmin yaptı. Yazarlar süper tahmincilerin katılımını “olağanüstü” diye niteliyor. Süper tahminciler ayrıca daha fazla soru yanıtladı: sıradan takımlardaki 61’e karşı ortalama 95.
Makale, güncellememenin bedeline dair somut bir örnek de sunuyor. Kalibrasyon en kötü %100’lük tahminlerde çıktı ve yazarlar nedeni açıkça koyuyor: “Sorun güncelleme eksikliğiydi.” Bir sorunun ömrünün ilk %20’sinde yapılan %100’lük tahminler yalnızca yaklaşık %70 oranında gerçekleşti. Son %20’lik günlerde yapılan aynı tahminler ise yaklaşık %90 oranında doğru çıktı. Erken beyan edilen kesinlik, fazla uzun süre elde tutulan bir tahmin gibi davrandı.
Süper tahmincilere dair takip makalesi (Mellers ve arkadaşları, 2015), bu kişilerin yüksek isabetlerini iki yıl üst üste koruduğunu ve “ortalamaya dönüş beklentilerine meydan okuduğunu” buldu. Yazarlar birbirini güçlendiren dört açıklamayı destekliyor: bilişsel yetenekler ve üsluplar, göreve özgü beceriler, motivasyon ve bağlılık, zenginleştirilmiş ortamlar. Vardıkları sonuç, süper tahmincilerin “kısmen keşfedildiği, kısmen yaratıldığı” yönünde. Bu ikinci yarı, zaten süper tahminci olmayan herkes için konunun neden önemli olduğunu açıklıyor.
Küçük adımlar büyük sıçramaları yener: güncelleme kanıtı
Güncellemeye dair en doğrudan kanıt Atanasov, Witkowski, Ungar, Mellers ve Tetlock’tan (2020) geliyor. Dört yıllık turnuva verisini kullanarak güncellemenin üç boyutunu ayırdılar: sıklık (tahmincinin ne sıklıkla revize ettiği), büyüklük (her revizyonun ortalama boyutu) ve teyit eğilimi (aynı tahmini yeniden gönderme eğilimi).
Bulguları, yazarların kendi özetiyle:
- En isabetli tahminciler sık ve küçük güncellemeler yaptı.
- Düşük beceriye sahip tahminciler ilk yargılarını teyit etmeye ya da seyrek ve büyük revizyonlar yapmaya yatkındı.
- Sık güncelleyenler kristalize zekâ ve açık fikirlilikte daha yüksek puan aldı, daha fazla bilgiye erişti ve zamanla gelişti.
- Küçük adımlarla güncelleyenlerin akışkan zekâ puanları daha yüksekti ve avantajlarını ilk tahminlerinden elde ettiler.
- Güncelleme büyüklüğü, eğitimin isabet üzerindeki nedensel etkisine aracılık etti.
- Sık ve küçük revizyonlar “becerinin güvenilir ve geçerli sinyalleri” oldu.
İki nokta vurguyu hak ediyor. Birincisi, sıklık ve büyüklük farklı kaynaklardan beslenen farklı alışkanlıklardır. Sık güncelleme, katılımı ve bilgi toplamayı yansıtır. Küçük adımlarla güncelleme ise büyük bir düzeltmeye gerek kalmayacak makul bir tahminle başlamayı yansıtır. İkincisi, yazarlar her ikisini de kurumların belirsizliği iyi yöneten kişileri belirlemek için kullanabileceği sinyaller olarak çerçeveliyor. Başka bir deyişle, birinin fikrini değiştirme biçimi, muhakemesinin kendisine dair bir kanıttır.
Bir hesap: çapalanma, aşırı güven ve adım adım güncellemenin bedeli
Mekanizmayı somutlaştırmak için şeffaf bir örnek kurguladık. Good Judgment Project ile aynı iki sonuçlu Brier skorunu, sorunun açık kaldığı günler üzerinden ortalayarak kullanıyor. Soru 10 gün açık kalıyor. Bu günler boyunca gelen kanıt giderek “evet”i işaret ediyor. Dört tahminci farklı tepki veriyor. Tablo 2’deki tüm sayılar örnek amaçlıdır: gerçek bir tahmincinin nasıl performans gösterdiğini değil, puanlama kuralının her davranışa nasıl muamele ettiğini gösterir.
Tablo 2. Örnek bir 10 günlük soruda dört güncelleme üslubu (CEOtudent hesabı; örnek sayılar; iki sonuçlu Brier skoru, günlere göre ortalanmış, 0 en iyi, 2 en kötü)
| Üslup | Tahmin yolu | Güncelleme | Ortalama güncelleme boyutu | “Evet” gerçekleşirse skor | Sürpriz (“hayır”) olursa skor | Beklenen skor* |
|---|---|---|---|---|---|---|
| Çapalanmış | 10 gün boyunca %30 | 0 | 0 puan | 0,980 | 0,180 | 0,820 |
| Aşırı özgüvenli | 1. günden itibaren %95, hiç revize edilmemiş | 0 | 0 puan | 0,005 | 1,805 | 0,545 |
| Geç büyük sıçrama | 7 gün %30, sonra %90 | 1 | 60 puan | 0,692 | 0,612 | 0,676 |
| Adım adım | %30, 35, 42, 50, 57, 63, 70, 78, 85, 90 | 9 | 6,7 puan | 0,398 | 0,798 | 0,478 |
*Beklenen skor, kanıt eğiliminin zamanın %80’inde doğru çıktığını varsayar. Görüşü kanıt gelmeden önce belirlenen aşırı özgüvenli tahminci için ilk izlenimin zamanın %70’inde doğru çıktığını varsayıyoruz; bu, Mellers ve arkadaşlarının erken %100’lük tahminlerin yaklaşık %70 oranında gerçekleştiği bulgusunu yansıtır. Her iki yüzde de örnek amaçlı varsayımlardır.
Hesabın gösterdikleri:
- İşler değiştiğinde en pahalı alışkanlık çapalanmadır. Çapalanmış tahminci, dünya başlangıç görüşünden uzaklaştığı her gün cezalandırılır.
- Aşırı güven ya büyük kazanır ya da felaketle kaybeder. Haklıyken 0,005, yanılırken 1,805. Brier skorunun asimetrisi iş başında.
- Geç büyük bir sıçrama hiç sıçramamaktan iyidir, ama öncesindeki her bayat günün bedelini öder. Bu, Atanasov ve arkadaşlarının düşük beceriyle ilişkilendirdiği “seyrek ve büyük revizyonlar” örüntüsüdür.
- Adım adım güncelleme en iyi beklenen skora sahiptir, ama bedava değildir. Kanıt yanıltırsa adım adım güncelleyen, çapalanmış olandan daha kötü sonuç alır (0,180’e karşı 0,798). Güncelleme, kanıtın bilgilendirici olduğuna dair bir bahistir.
Bu dördüncü nokta örneğimizin bir tuhaflığı değil. Açık fikirlilik ile isabet üzerine yapılmış, sıradaki bölümde ele aldığımız en titiz çalışmayla örtüşüyor.
Dürüst sınırlar: açık fikirlilik ne zaman ters teper ve yeniden analiz
Haran, Ritov ve Mellers (2013) üç çalışma boyunca dört düşünme üslubunu isabetin yordayıcısı olarak test etti: aktif açık fikirli düşünme, biliş ihtiyacı, azim ve en iyiyi arama eğilimi. Performansı yalnızca aktif açık fikirli düşünme yordadı. Mekanizma bilgiydi: daha açık fikirli insanlar tahmin yapmadan önce daha fazla bilgi topladı ve isabet kazancını bu ek bilgi üretti. Erişilebilir bilgi miktarı sabit tutulduğunda (2. Çalışma) açık fikirliliğin performansa etkisi olmadı.
İnsanlardan Amerikan futbolu sonuçlarını tahmin etmelerinin istendiği üçüncü çalışma uyarıyı ekliyor. Sonuçlar maç öncesi bilgiyle örtüştüğünde açık fikirli düşünenler daha isabetliydi. Sonuç sürpriz olduğunda ise daha yüksek açık fikirlilik daha kötü performansla birlikte görüldü, çünkü bu tahminciler bilgiyi daha yakından takip etmişti. Yazarların ifadesiyle, bilgi yanıltıcı olduğunda yüksek açık fikirli insanlar “geçersiz bilgiye karşı daha savunmasızdı”. Vardıkları sonuç koşullu: bilgi en azından bir ölçüde yordayıcı olduğu sürece açık fikirli düşünme işe yaramalıdır.
Good Judgment Project makalesinin de kendi örneği var. Güney veya Doğu Çin Denizi’nde ölümcül bir çatışmaya dair bir soruda en iyi tahminciler taban oranı olan %20 civarından başladı ve tahminlerini zamanla düşürdü. Sonra bir Güney Koreli sahil güvenlik görevlisi Çinli bir balıkçı tarafından öldürüldü. Eğitimli takımlar bu soruda 1,44 skor aldı; bu, eğitimsiz bağımsız tahmincilerin 1,31’inden daha kötüydü.
Daha büyük uyarı metodolojik. Psychological Science’da yayımlanan bir yeniden analizde Hauenstein, Thomas, Illingworth ve Dougherty (2024), aynı turnuva verisini madde tepki kuramıyla modelledi; madde zorluğunu, tahminlerin zamanlamasını ve tahmincilerin hangi soruları yanıtlamayı seçtiğini kontrol etti. Kendi ifadeleriyle, en iyi uyum gösteren modeller takım ve eğitim manipülasyonlarının örtük tahmin yeteneği üzerindeki etkilerini “önemli ölçüde ortadan kaldırdı, azalttı ve bazı durumlarda tersine bile çevirdi”. Ayrıca bu dışsal değişkenlerin süper tahmincileri diğerlerinden ayırt edebildiğini raporluyorlar; bu da süper tahmincilerin performansının altında neyin yattığını söylemeyi zorlaştırıyor.
Bunun buradaki argümana etkisi şu: yeniden analiz, 45 dakikalık bir eğitim modülünün ya da takım üyeliğinin daha iyi tahmine neden olup olmadığını sorguluyor. En isabetli tahmincilerin sık ve küçük adımlarla güncellediği yönündeki betimleyici bulguyu ise çürütmüyor. Yeniden analizin kontrol ettiği değişkenlerden biri olan yanıt zamanlaması, kısmen bir güncelleme davranışının kendisidir. Mellers ve arkadaşları 2014’te eğitim ve takımın, tahminlerin zamanlaması ve sayısı kontrol edildikten sonra da anlamlı kaldığını raporlamıştı. İki ekip yöntem konusunda ayrışıyor; dikkatli bir okur, eğitime dair nedensel iddialara temkinli yaklaşmalı.
Entelektüel alçakgönüllülük ve fikrini değiştirenleri nasıl yargıladığınız
Entelektüel dürüstlüğün toplumsal bir yanı da var. Leary ve arkadaşları (2017), bu özelliği insanların inançlarının yanlış olabileceğini ne ölçüde kabul ettiği olarak tanımlayan bir Entelektüel Alçakgönüllülük Ölçeği geliştirdi. Dört çalışmanın ilkinde entelektüel alçakgönüllülük; açıklık, merak, belirsizliğe tolerans ve düşük dogmatizmle ilişkiliydi. Entelektüel alçakgönüllülüğü yüksek olanlar, tutumlarını değiştiren politikacıları “döneklik” yapıyor diye görmeye daha az eğilimliydi ve ikna edici argümanların gücüne, bu özelliği düşük olanlardan daha duyarlıydı.
Bu, liderler için önemli. Kurduğunuz kültür her revizyonu döneklik olarak görürse, ekibinizi Tablo 2’deki çapalanmış ve geç büyük sıçrama üsluplarına doğru eğitmiş olursunuz. Kanıta yanıt olarak yapılan revizyonlar normal karşılanırsa, küçük ve sık güncellemeleri toplumsal olarak karşılanabilir kılarsınız. Tahmin kanıtı, isabetin tam da orada yaşadığını söylüyor. Kendi ilk cevabınızın yanlış nedenlerle tutunup tutunmadığını anlamanın bir yolu için ilk sonuç önyargısı ve insanların yapay zekânın ilk cevabını neden kabul ettiği üzerine yazımıza bakabilirsiniz.
Entelektüel Dürüstlük İşletim Protokolü
Kanıt ile çerçeve ayrı tutulmalı. Yukarıdaki bulgular kanıttır. Aşağıdaki protokol ise editöryel sentezimizdir: bu bulguları haftalık alışkanlıklara dönüştürmenin bir yolu. Her adım, onu motive eden bulguyla ve o bulgunun sınırıyla eşleştirilmiştir.
Tablo 3. Entelektüel Dürüstlük İşletim Protokolü (CEOtudent editöryel çerçevesi, doğrulanmış bulgularla eşleştirilmiş)
| Adım | Ne yaparsınız | Onu motive eden bulgu | Uyulması gereken sınır |
|---|---|---|---|
| 1. Bir sayıya bağlanın | Önemli inançlarınızı sıfatlarla değil olasılıklarla ifade edin (“Bu lansmanın hedefi tutturma olasılığı %65”) | Brier skoru dürüst olasılıkları ödüllendirir ve isabeti takip edilebilir kılar (Mellers ve arkadaşları, 2014) | Sonradan kontrol edilmeyen bir sayı gösteriden ibarettir; 5. adım zorunludur |
| 2. Fikrinizi neyin değiştireceğini önceden taahhüt edin | Karar vermeden önce sayınızı 10 puan veya daha fazla oynatacak iki ya da üç gözlemi yazın | Erken kesinlik yalnızca yaklaşık %70 oranında doğru çıktı; “sorun güncelleme eksikliğiydi” (Mellers ve arkadaşları, 2014) | Yalnızca görünür olanları değil, gerçekten yordayıcı sinyalleri seçin |
| 3. Bir taban oranından başlayın | İlk tahmini benzer şeylerin ne sıklıkla gerçekleştiğine çapalayın, sonra ayarlayın | Küçük adımlarla güncelleyenler avantajlarını daha iyi ilk tahminlerden elde etti (Atanasov ve arkadaşları, 2020) | Durumunuz olağandışıysa taban oranları yanıltabilir |
| 4. Sık ve küçük adımlarla güncelleyin | Canlı inançlarınızı bir takvime göre yeniden ele alın; kanıtın büyüklüğüne göre, genellikle birkaç puanlık adımlarla hareket edin | En isabetli tahminciler sık ve küçük güncellemeler yaptı; düşük beceriye sahip olanlar teyit etti ya da sıçradı (Atanasov ve arkadaşları, 2020) | Güncelleme, kanıtın bilgilendirici olduğuna dair bir bahistir (Haran ve arkadaşları, 2013) |
| 5. Bir hata günlüğü tutun ve puanlayın | Tahminleri ve sonuçları kaydedin; her çeyrekte basit bir Brier skoru hesaplayın | Sık ve küçük revizyonlar “becerinin güvenilir ve geçerli sinyalleri” oldu (Atanasov ve arkadaşları, 2020) | Yılda az karar, gürültülü skor demektir; tek sonuçları değil eğilimleri değerlendirin |
| 6. Sizi yanıltabileceğini gösterecek bilgiyi arayın | Büyük bir karardan önce en güçlü karşı kanıta bilinçli olarak zaman ayırın | Açık fikirli düşünenler daha fazla bilgi topladı ve isabetlerini bu açıkladı (Haran ve arkadaşları, 2013) | Ek bilgi yalnızca geçerliyse işe yarar |
| 7. Revizyonu toplumsal olarak güvenli kılın | Ekibinizde kanıta dayalı fikir değişikliklerini övün; bunları asla döneklik diye cezalandırmayın | Yüksek entelektüel alçakgönüllülük, daha az “döneklik” yargısı ve argüman gücüne daha fazla dikkatle birlikte görülür (Leary ve arkadaşları, 2017) | Korelasyonel kanıt; kültür etkileri bizim çıkarımımızdır |
CEOtudent’teki birçok araç tek tek adımları destekliyor. 1. adım için bahis gibi düşünmek yazımıza bakın. 2. adım için vazgeçme kriterleri rehberi koşulları önceden nasıl belirleyeceğinizi gösteriyor. 5. adım için karar günlüğü protokolü tahminleri kaydetmek ve gözden geçirmek için bir şablon sunuyor. 6. adım için bir ön otopsi karşı kanıtı planlamanın takvimli bir parçası haline getiriyor.
CEO ve öğrenci
İsabet ölçülebilir olduğunda entelektüel dürüstlüğün kariyer argümanı basittir. Belirsizliği iyi yöneten insanlar değerlidir ve Atanasov ve arkadaşları, birinin güncelleme örüntüsünün bu becerinin güvenilir bir sinyali olduğunu öne sürüyor. Tahminleri takip eden bir kurum, kimin küçük ve zamanında adımlarla revize ettiğini, kimin gerçeklik bir sıçramayı zorlayana kadar ilk cevabını savunduğunu görebilir.
Lensin CEO tarafı sahiplenmedir. Bir sayıya bağlanır, altına adınızı yazar ve karar verirsiniz. Entelektüel dürüstlük taahhütten kaçınmak demek değildir. Tablo 2’deki çapalanmış tahminci de taahhüt etti, aşırı özgüvenli olan da. Fark, taahhütten sonra ne olduğundadır.
Öğrenci tarafı revizyondur. Her pozisyonu güncel taslak olarak görür, onu neyin değiştireceğini önceden bilir ve o kanıt geldiğinde doğru miktarda değiştirirsiniz. Veriler bunun özgüven ile alçakgönüllülük arasında bir ödünleşim olmadığını gösteriyor. Good Judgment Project’in en isabetli tahmincileri ikisini birden yaptı: sayılara bağlandılar ve onları hareket ettirmeye devam ettiler.
Daha hızlı yanılmak, daha sık yanılmak demek değildir. Düzeltme henüz küçük ve ucuzken bunu daha erken fark etmek demektir.
SSS
Karar vermede entelektüel dürüstlük nedir?
Pratik anlamda, inançları yanlışlanabilecek kadar kesin ifade etme, onları yanlışlayabilecek kanıtı arama ve bu kanıtla orantılı olarak revize etme alışkanlığıdır. Tahmin araştırmaları, olasılık yargılarını sonuçlara göre puanlayarak bunu ölçülebilir kılar.
Fikrini sık değiştiren insanlar daha iyi tahmin mi yapar?
Good Judgment Project verisinde, değişiklikler sık ve küçük olduğunda evet. Atanasov ve arkadaşları (2020), en isabetli tahmincilerin sık ve küçük güncellemeler yaptığını, düşük beceriye sahip tahmincilerin ise ilk yargılarını teyit ettiğini ya da seyrek ve büyük revizyonlara gittiğini buldu. Süper tahminciler soru başına ortalama 7,8 tahmin gönderdi; sıradan takımlarda bu sayı 1,6’ydı.
Açık fikirli olmak her zaman daha mı iyidir?
Hayır. Haran, Ritov ve Mellers (2013), aktif açık fikirli düşünenlerin daha fazla bilgi topladıkları için daha isabetli olduğunu buldu; ancak bilginin yanlış yönü gösterdiği sürpriz sonuçlarda daha yüksek açık fikirlilik daha kötü performansla birlikte görüldü. Güncelleme, kanıt en azından bir ölçüde yordayıcı olduğunda işe yarar.
Tahmin becerisi eğitilebilir mi?
Good Judgment Project’in orijinal sonuçları, yaklaşık 45 dakikalık bir olasılık eğitimi modülünün isabeti artırdığını ve faydanın her biri yaklaşık 8 ila 10 ay süren tahmin sezonları boyunca sürdüğünü söylüyordu. Hauenstein ve arkadaşlarının 2024 tarihli yeniden analizi ise bu eğitim ve takım etkilerinin zamanlama, soru seçimi ve soru zorluğu kontrol edildiğinde küçüldüğünü, kaybolduğunu ya da tersine döndüğünü savunuyor. Nedensellik sorusu tartışmalı. Güncelleme üslubu ile isabet arasındaki bağ ise daha iyi destekleniyor.
Kendi isabetimi nasıl ölçebilirim?
Tahminlerinizi bir tarih ve bir sonuçlanma kuralıyla birlikte olasılık olarak yazın, sonra puanlayın. Burada kullanılan iki sonuçlu versiyonda evet-hayır sorusunun skoru, “evet” üzerindeki farkın karesi ile “hayır” üzerindeki farkın karesinin toplamıdır. Gerçekleşen bir şeye %90 demek 0,02, gerçekleşmeyen bir şeye %90 demek 1,62 skor alır. Skorların bir çeyrek boyunca ortalamasını alın ve eğilimi takip edin.
Kaynaklar
- Mellers, B., Ungar, L., Baron, J., Ramos, J., Gurcay, B., Fincher, K., Scott, S. E., Moore, D., Atanasov, P., Swift, S. A., Murray, T., Stone, E. ve Tetlock, P. E. (2014). Psychological Strategies for Winning a Geopolitical Forecasting Tournament. Psychological Science, 25(5). Tablo 1 (zaman dilimine göre Brier skorları), katılım ölçüleri (soru başına tahmin), kalibrasyon tartışması, Brier skoru örnek hesabı, Güney ve Doğu Çin Denizi örneği.
- Mellers, B., Stone, E., Murray, T., Minster, A., Rohrbaugh, N., Bishop, M., Chen, E., Baker, J., Hou, Y., Horowitz, M., Ungar, L. ve Tetlock, P. (2015). Identifying and Cultivating Superforecasters as a Method of Improving Probabilistic Predictions. Perspectives on Psychological Science, 10(3), 267-281. Özet: süper tahminci isabetinin kalıcılığı ve dört açıklama.
- Atanasov, P., Witkowski, J., Ungar, L., Mellers, B. ve Tetlock, P. (2020). Small steps to accuracy: Incremental belief updaters are better forecasters. Organizational Behavior and Human Decision Processes, 160, 19-35. Güncelleme sıklığı, büyüklüğü ve teyidine dair özet bulgular; veri seti tanımı ve güncelleme ölçüleri için 21. ACM Conference on Economics and Computation (EC‘20) konferans versiyonu.
- Haran, U., Ritov, I. ve Mellers, B. A. (2013). The role of actively open-minded thinking in information acquisition, accuracy, and calibration. Judgment and Decision Making, 8(3), 188-201. 1-3. çalışmalar, bilgi edinmenin aracılık etkisi, sürpriz sonuçlar, genel tartışma.
- Hauenstein, C., Thomas, R., Illingworth, D. ve Dougherty, M. (2024, çevrimiçi yayın; 2025 basılı sayı). Rethinking the Role of Teams and Training in Geopolitical Forecasting: The Effect of Uncontrolled Method Variance on Statistical Conclusions. Psychological Science, 36(1), 3-18. Yazarın kabul edilmiş makale versiyonu: özet ve tartışma.
- Leary, M. R., Diebels, K. J., Davisson, E. K., Jongman-Sereno, K. P., Isherwood, J. C., Raimi, K. T., Deffler, S. A. ve Hoyle, R. H. (2017). Cognitive and Interpersonal Features of Intellectual Humility. Personality and Social Psychology Bulletin, 43(6), 793-813. Özet: Entelektüel Alçakgönüllülük Ölçeği’nin kullanıldığı dört çalışma.
Tablo 1, Mellers ve arkadaşlarının (2014) yayımlanmış verisini aktarır. Metindeki yüzde karşılaştırmaları (örneğin “%56 daha düşük”) bu tablodan yapılmış CEOtudent hesaplarıdır. Tablo 2, örnek sayılarla yapılmış bir CEOtudent hesabıdır. Tablo 3, bir CEOtudent editöryel çerçevesidir.
Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.














