Özet. Gelecek düşünme tavsiyelerinin çoğu ölçülmüş isabet üzerinden değil, kulağa yatkınlık üzerinden satılıyor ve bu ikisi pek örtüşmüyor. Yalnızca açıp yeniden hesaplayabildiğimiz yayımlanmış sonuçlarla çalıştığımızda dört bulgu öne çıkıyor. Birincisi, bireysel tahmin isabeti üzerinde ölçülen en büyük etkiye sahip müdahale aslında bir teknik değil: geçmiş performansa göre seçim. Bu, en güçlü yayımlanmış koşulda hatada %73,1’lik bir azalma, ayrı bir 2024 çalışmasında ise %20 ila %23’lük bir azalma değerinde. İkincisi, en iyi teknik zamanlamayla değişiyor: bir tahmin sorusunun ilk haftasında olasılık eğitimi grup tartışmasını geçti; son haftada tartışma 4,5 kat daha güçlü kaldıraçtı. Üçüncüsü, kurumsal öngörü çalışmalarının çoğunun ait olduğu aile olan senaryo eğitimi, bir sorunun orta döneminde bireyler için tam olarak %0,0 iyileşme sağladı ve son haftada takım tahminlerini %9,1 kötüleştirdi. Dördüncüsü ve en rahatsız edici olanı, orijinaliyle aynı dergide yayımlanan 2025 tarihli bir yeniden analiz, kontrol edilmemiş yöntem varyansı modellendiğinde eğitim ve takım etkilerinin önemli ölçüde küçüldüğünü, ortadan kalktığını ya da bir vakada tersine döndüğünü buldu. Geriye kısa bir liste kalıyor ve bu, öngörü sektörünün sattığı liste değil.
Bu soru neden yanıtlanabilir
Gelecek çalışmalarının nadiren itiraf ettiği bir ölçüm sorunu var. Tekniklerin çoğu, katılımcıların atölyeyi değerli bulup bulmadığına göre değerlendiriliyor; ortaya çıkan tahminlerin gerçekleşene yakın olup olmadığına göre değil. Bunlar farklı sorular ve yanıtları zıt olabilir.
Büyük bir istisna var. 2011 ile 2015 arasında Intelligence Advanced Research Projects Activity, Aggregative Contingent Estimation turnuvasını yürüttü. Yarışan araştırma grupları binlerce sıradan gönüllü topladı, onları rastgele koşullara atadı ve her tahmini gerçek jeopolitik sonuçlara karşı uygun bir puanlama kuralıyla değerlendirdi. Sıralamayı mümkün kılan tam da bu tasarım: teknikler memnuniyete göre değil, hataya göre karşılaştırıldı.
Sonuçlar 2014’te Mellers ve meslektaşları tarafından Psychological Science dergisinde yayımlandı ve 2025’te Hauenstein ve meslektaşları tarafından aynı dergide yeniden analiz edildi. Aşağıdaki her şey bu iki makale ile üç ayrı yayımlanmış kanıt gövdesine dayanıyor. Kendi kararlarınızın kaydını tutuyorsanız bu yazı doğrudan karar günlüğü protokolüyle ve bahis gibi düşünmeyle eşleşir.
Ham kanıt
Brier skorları olasılıksal tahminlerin isabetini ölçer. Düşük olan iyidir. %90 deyip haklı çıkan bir tahminci makalede kullanılan ölçekte 0,02 alır; %90 deyip yanılan 1,62 alır.
Doğrulanmış veri. Bir sorunun ömrüne göre koşul bazlı ortalama Brier skoru (Mellers ve diğerleri, Psychological Science, 2014, Tablo 1). Yalnızca en az bir ay açık kalan sorular dâhildir.
| Koşul | İlk hafta | Ortadaki 2 hafta | Son hafta |
|---|---|---|---|
| Yıl 1 | |||
| Birey, eğitimsiz | 0,44 | 0,40 | 0,31 |
| Birey, senaryo eğitimi | 0,41 | 0,40 | 0,29 |
| Birey, olasılık eğitimi | 0,40 | 0,36 | 0,29 |
| Kalabalık görüşü, eğitimsiz | 0,42 | 0,39 | 0,30 |
| Kalabalık görüşü, olasılık eğitimi | 0,36 | 0,34 | 0,23 |
| Takım, eğitimsiz | 0,42 | 0,33 | 0,22 |
| Takım, senaryo eğitimi | 0,36 | 0,33 | 0,24 |
| Takım, olasılık eğitimi | 0,35 | 0,30 | 0,19 |
| Yıl 2 | |||
| Birey, eğitimsiz | 0,46 | 0,39 | 0,26 |
| Birey, olasılık eğitimi | 0,42 | 0,36 | 0,24 |
| Takım, eğitimsiz | 0,38 | 0,32 | 0,16 |
| Takım, olasılık eğitimi | 0,40 | 0,28 | 0,16 |
| Süper tahminciler | 0,25 | 0,19 | 0,07 |
Makale, hem eğitimin hem takım çalışmasının üç dönemin tamamında yararlı olduğunu bildiriyor. Bu doğru ve tablodaki en az ilginç şey. Her hücreyi aynı dönemdeki eğitimsiz bireye göre yüzde iyileşmeye çevirin; makalenin sayısal olarak hiç ifade etmediği bir örüntü ortaya çıkıyor.
Özgün bulgu 1: en iyi kaldıraç zamanlamayla değişiyor
CEOtudent editöryel çerçevesi: zamanlama dönüşü. Yukarıdaki Yıl 1 satırlarından hesaplanmış, aynı dönemdeki eğitimsiz bireye göre Brier skorundaki yüzde azalma.
| Dönem | Tek başına olasılık eğitimi | Tek başına takım tartışması | İkisi birlikte | Tartışma bölü eğitim |
|---|---|---|---|---|
| İlk hafta | %9,1 daha iyi | %4,5 daha iyi | %20,5 daha iyi | 0,50 kat |
| Ortadaki 2 hafta | %10,0 daha iyi | %17,5 daha iyi | %25,0 daha iyi | 1,75 kat |
| Son hafta | %6,5 daha iyi | %29,0 daha iyi | %38,7 daha iyi | 4,50 kat |
Bir sorunun ilk haftasında eğitim, tartışmanın iki katı kaldıraçtı. Son haftaya gelindiğinde ilişki göreli olarak neredeyse dokuz kat tersine dönmüştü: tartışma, eğitimin 4,5 katı değerindeydi.
Sayılar önünüzde olunca mekanizma sezgisel. Erken dönemde kimsede bilgi yoktur, dolayısıyla mevcut tek üstünlük muhakeme disiplinidir: referans sınıfları, temel oranlar, kendi tahminlerinizin ortalaması. Geç dönemde bilgi dünyada mevcuttur ve üstünlük ona erişimdir; bunu da bir grup sağlar. Makale, takımlardaki daha yüksek isabetin bilgi toplayıp paylaşan üyelerden geldiğini ve bir bireyin yazdığı yorum sayısının isabetle Yıl 1’de r = -0,19, Yıl 2’de -0,22 ilişkili olduğunu belirtiyor; burada eksi işareti daha iyi demek.
Dolayısıyla birey için pratik talimat “X tekniğini kullan” değil. Şu: bir soru tazeyken muhakemenize çalışın; olgunlaşırken girdilerinize çalışın. Çoğu insan tam tersini yapıyor, en yoğun beyin fırtınasını başta yapıp teslim tarihi yaklaştıkça susuyor.
Özgün bulgu 2: senaryo eğitimi ölçülen en zayıf kaldıraç
Bu turnuvada senaryo eğitimi tahmincilere yeni gelecekler üretmeyi, daha fazla olasılığı etkin biçimde düşünmeyi, karar ağaçları kullanmayı ve değişimi fazla tahmin etmekten kaçınmayı öğretti. Bu, kurumsal gelecek çalışmalarının çoğunun yaptığı şeyin tanınabilir bir tarifi. Rastgele atandı ve ayrı puanlandı; bu da onu senaryo tabanlı ve olasılık tabanlı öngörü eğitimi arasındaki en temiz yayımlanmış doğrudan karşılaştırma yapıyor.
CEOtudent editöryel çerçevesi: senaryo eğitimine karşı olasılık eğitimi. Aynı tahminci tipinin eğitimsiz koşuluna göre Brier skorundaki yüzde azalma, Yıl 1.
| Dönem | Bireyler: senaryo | Bireyler: olasılık | Takım içinde: senaryo | Takım içinde: olasılık |
|---|---|---|---|---|
| İlk hafta | %6,8 daha iyi | %9,1 daha iyi | %14,3 daha iyi | %16,7 daha iyi |
| Ortadaki 2 hafta | %0,0 (değişim yok) | %10,0 daha iyi | %0,0 (değişim yok) | %9,1 daha iyi |
| Son hafta | %6,5 daha iyi | %6,5 daha iyi | %9,1 daha kötü | %13,6 daha iyi |
Senaryo eğitimi altı karşılaştırmanın beşinde olasılık eğitimine yenildi, altıncısında berabere kaldı. Orta dönemde ne bireyler ne de takımlar için ölçülebilir hiçbir iyileşme üretmedi. Takım içinde son haftada ise takıma hiç eğitim vermemekten aktif olarak daha kötüydü; Brier skorunu 0,22’den 0,24’e taşıdı.
Orijinal makale bireysel karşılaştırmanın arkasındaki anlamlılık testini bildiriyor: olasılık eğitimi senaryo eğitiminden daha etkiliydi, t(1053) = 2,23, p = 0,026; senaryo eğitimi de eğitimsizliği geçti, t(1056) = 3,25, p < 0,001. Yani senaryo eğitimi değersiz değil. Yalnızca ikisinin zayıfı ve üstünlüğü, çoğu profesyonelin onu kullanacağı koşullarda, yani bir grup içinde ve karara yakınken kayboluyor.
Bu argümanın dürüst versiyonunun taşıması gereken bir çekince var: isabet, senaryo planlamasının sunduğunu iddia ettiği tek şey değil. Uygulayıcılar, nokta tahminlerden çok hazırlıklılığı ve kurumsal sohbeti iyileştirdiğini savunuyor. Bu doğru olabilir; ama bu farklı bir iddia ve burada ölçülen o değil. Senaryo çalışmasını benimseyecekseniz, ölçüldüğü şey için benimseyin; ölçüldüğü şey tahmin isabeti değil.
Özgün bulgu 3: seçim her tekniği geçiyor
Yıl 2’nin süper tahminci satırına yeniden bakın: Yıl 1 performansının ilk %2’si, elit takımlara yerleştirilmiş hâlleri. Aynı dönemdeki eğitimsiz bireye göre ilk haftada %45,7, ortada %51,3, son haftada %73,1 daha iyi skor yaptılar. Tablodaki hiçbir eğitim ya da takım koşulu buna yaklaşmıyor.
Bu izole bir sonuç değil. Atanasov ve meslektaşları, International Journal of Forecasting dergisinde yayımlanan çalışmalarında, 136 soru boyunca iki kitle kaynak sisteminde küçük elit kalabalıkları daha büyük elit olmayan kalabalıklarla karşılaştırdı.
Doğrulanmış veri. Kalabalık tipi ve tahmin sistemine göre toplu Brier skorları (Atanasov ve diğerleri, International Journal of Forecasting, 2024).
| Sistem | Elit olmayan kalabalık | Elit kalabalık | Elit üstünlüğü |
|---|---|---|---|
| Tahmin piyasaları | 0,215 | 0,173 | %20 |
| Tahmin anketleri | 0,203 | 0,156 | %23 |
Bu yüzdeleri temeldeki ortalamalardan yeniden hesaplamak %19,5 ve %23,2 veriyor; makalenin yuvarlanmış rakamlarıyla tutarlı. Karma etkiler modelinde yazarlar elit etkisini b = -0,045, yani %21’lik bir isabet iyileşmesi olarak koyuyor; piyasa ile anket arasındaki seçim ise anlamlı değil, b = -0,015, p = 0,13.
Buradan iki sonuç çıkıyor ve ikisi de farklı biçimde can sıkıcı. Bir kurum için en yüksek getirili öngörü yatırımı bir metodoloji satın almak değil; geçmiş performansı olan birkaç kişiyi bulup onlara sormak. Birey içinse o gruba girmenin yavaş olandan başka kısayolu yok: tahmin et, kaydet, puanla, tekrarla ve gerçekten iyi olup olmadığını öğren. Süper tahmincilerin turnuvadaki davranışına da dikkat edin: soru başına ortalama 7,8 tahmin yaptılar; diğer herkes 1,4 ila 1,6. Seçim başka ne yakaladıysa yakalasın, güncelleyen insanları yakaladı.
Rahatsız edici kısım: manşet kanıt tartışmalı
Ocak 2025’te Hauenstein, Thomas, Illingworth ve Dougherty tam olarak bu verinin yeniden analizini Psychological Science’ta yayımladı. Argümanları yöntemsel: tahminciler hangi soruları ne zaman yanıtlayacaklarını kendileri seçti ve bu seçimler rastgele değil. Bir takımdaki kişi, tek başına tahmin yapan birinden farklı soruları, daha geç yanıtlıyor olabilir ve tek başına bu fark, tartışmayla hiçbir ilgisi olmayan görünürde bir isabet üstünlüğü üretebilir.
Gizil tahmin yeteneğini madde tepki kuramıyla modellediler ve bu dışsal değişkenleri dâhil ettiler. Etki büyüklükleri sertçe kaydı.
CEOtudent editöryel çerçevesi: yöntem varyansı kontrol edildiğinde etkilere ne oluyor. Gizil tahmin yeteneği etki büyüklükleri, Cohen’in d’si, Hauenstein ve diğerleri (Psychological Science, 2025, Tablo 4). M2 temel model, M7 tam yöntem varyansı modeli.
| Veri kümesi | Faktör | Temel d (M2) | Yöntem varyansı d (M7) | Değişim |
|---|---|---|---|---|
| Yıl 1 | Eğitim | +0,050 | -0,144 | işaret tersine döndü |
| Yıl 1 | Takım | +0,766 | -0,285 | işaret tersine döndü, 1,051’lik kayma |
| Yıl 2, süper tahminciler hariç | Eğitim | +0,174 | +0,038 | %78,2 küçüldü |
| Yıl 2, süper tahminciler hariç | Takım | +0,256 | +0,065 | %74,6 küçüldü |
| Yıl 2, süper tahminciler dâhil | Eğitim | +0,328 | +0,227 | %30,8 küçüldü |
| Yıl 2, süper tahminciler dâhil | Takım | +0,390 | +0,247 | %36,7 küçüldü |
Üzerinde durulması gereken, Yıl 1 takım etkisi. Temel modelde d = +0,766; büyük bir etki ve gruplar hâlinde tahmin yapmaya dair on yıllık tavsiyenin ampirik omurgası. Tam modelde d = -0,285, yani ters yöne bakıyor; toplam hareket 1,051 standart sapma.
Yazarlar Yıl 2 süper tahminci içermeyen veri için sonuçlarını açıkça yazıyor: takım ve eğitimin tahmin isabetini etkileyip etkilemediği sorulduğunda, modeller madde seçimini ve yanıt zamanlamasını içerdiğinde yanıt “hayır”. Yıl 2 için, en iyi uyum veren modellerin tahmin becerisinin takım ve eğitime göre değişmesine izin veren parametreleri hiç içermediğini bildiriyorlar.
Burada iki şeyi ayrı tutmak gerekiyor, çünkü her iki yönde de aşırı iddiada bulunmak kolay. Tablo 1’deki ham Brier farkları gerçek; eğitimli takım tahmincilerinin daha iyi skor yaptığını kimse tartışmıyor. Tartışmalı olan nedensel atıf: eğitim ve takım çalışması iyileşmeyi üretti mi, yoksa yalnızca ona eşlik mi etti? Dikkat çekici biçimde yeniden analiz süper tahminci farkını ortadan kaldırmadı; yorumunu karmaşıklaştırdı, çünkü stratejik yanıtlamayla ilişkili özelliklerin de süper tahmincileri diğerlerinden ayırt ettiğini gösterdi.
Çabasını nereye harcayacağına karar veren birey için bu, felç olmak için bir neden değil. En çok incelemeden sağ çıkan yöntemlere ağırlık vermek için bir neden; aşağıdaki puan kartının yaptığı da bu.
Turnuva dışından iki yöntem
Yapılandırılmış grup süreci (Delphi). Rowe ve Wright’ın değerlendirme literatürü taraması etkileri havuzlamak yerine çalışmaları sayıyor. Delphi gruplarının aynı bireylerin basit istatistiksel toplulaştırmasını 12 çalışmaya 2 ve 2 beraberlikle, geleneksel yapılandırılmamış grup toplantılarını ise 5’e 1 geçtiğini bildiriyorlar. Bunu aktaranlar için not edilmeye değer küçük bir tutarsızlık: bölümün gövde metni geleneksel grup karşılaştırmalarının “beş çalışmaya bir, iki beraberlikle” gittiğini söylerken, kendi özeti “beşe bir, bir beraberlikle” diyor. Oy sayımı, etki büyüklüğü havuzlamasından zayıf bir kanıt biçimi; dolayısıyla bunu ölçülmüş bir büyüklük değil, yön gösterici destek olarak alın. Desteklediği şey spesifik: yapı, yapılandırılmamış toplantıyı geçiyor ve bağımsız tahminlerin ardından geri bildirim, tek turu geçiyor.
Referans sınıfı tahmini. Flyvbjerg’in altyapı projeleri üzerine çalışması temel problemi alışılmadık ölçüde sert sayılarla belgeliyor: maliyet tahminlerinde ortalama sapma demiryolunda %44,7, köprü ve tünellerde %33,8, karayollarında %20,4; demiryolu yolcu talebi tahminleri ortalama -%51,4 sapıyor ve demiryolu projelerinin %84’ü her iki yönde de %20’den fazla yanılıyor. Çözüm, mevcut projenin içinden değil, tamamlanmış benzer projelerin dağılımından tahmin yapmak. Birleşik Krallık Ulaştırma Bakanlığı uygulaması bu dağılımı gerekli artışlara çevirdi: karayolları için aşımda %50 riski kabul ediyorsanız %15, yalnızca %10 riski kabul ediyorsanız %45; demiryolu için sırasıyla %40 ve %68. Amerikan Planlama Derneği yöntemi 2005’te onayladı.
Bunun bireyler için bir sıralamada yer alma nedeni şu: buradaki tek teknik ki tek bir kişi grupsuz, eğitim programsız ve geçmiş performans kaydı olmadan bir öğleden sonrada uygulayabilir; üstelik tüm literatürdeki en büyük belgelenmiş hataya saldırır.
Puan kartı
CEOtudent editöryel çerçevesi: bireysel kullanım için puanlanmış öngörü yöntemleri. Kanıt gücü ve sağlamlık, bu yazıda alıntılanan yayımlanmış kayda dair değerlendirmelerdir, yeni ölçümler değildir. Tek başına yürütülebilirlik ve maliyet pratik değerlendirmelerdir.
| Yöntem | Ölçülen en iyi etki | Yeniden analizden sağ çıkıyor mu | Tek başına yürütülebilir mi | Maliyet | Hüküm |
|---|---|---|---|---|---|
| Geçmiş performansa göre seçim | %73,1 hata azalması (turnuva); %20 ila %23 (elit kalabalıklar) | Fark ayakta; yorumu tartışmalı | Yalnızca o kaydı oluşturarak | Yüksek, yıllarla ölçülür | Yine de yapın. Yaklaşan başka bir şey yok. |
| Referans sınıfı tahmini | Belgelenmiş %20 ila %51 temel hatalara saldırıyor | İncelenen literatürde meydan okunmamış | Evet, tamamen | Düşük, karar başına bir öğleden sonra | Buradan başlayın. Saat başına en iyi getiri. |
| Olasılık eğitimi | Sorunun erken döneminde %9,1 ila %10,0 | Yöntem varyansı modellendiğinde önemli ölçüde küçülüyor ya da tersine dönüyor | Evet | Düşük, bir modül yaklaşık 45 dakika sürdü | Manşet rakam için değil, alışkanlıklar için değerli. |
| Yapılandırılmış grup süreci | Delphi istatistiksel toplulaştırmayı 12’ye 2, 2 beraberlikle geçti | Yalnızca oy sayımı, havuzlanmış etki büyüklüğü yok | Hayır, üç veya daha fazla kişi gerekir | Orta | İnsanlarınız varsa kullanın. |
| Takım tartışması | Sorunun geç döneminde %29,0 | Neredeyse sıfıra indi, Yıl 1’de işaret tersine döndü | Hayır | Orta | Teknik olarak değil, bilgiye erişim için kullanın. |
| Tahmin piyasaları | Takım anketleriyle istatistiksel olarak berabere | Ayrıca meydan okunmamış | Hayır, kalabalık gerekir | Yüksek | Bireysel gerekçesi yok. |
| Kalabalık görüşüne maruz kalma | Yalnızca başkalarının sayılarını görmekten %2,5 ila %4,5 | Ayrıca modellenmemiş | Evet, kamuya açık bir tahmin varsa | Çok düşük | Bedava, küçük, alın. |
| Senaryo planlaması ve eğitimi | Orta dönemde %0,0; takım içinde %9,1 daha kötü | Öne sürdüğü en güçlü iddia bu değil | Evet | Orta ila yüksek | İsabet için değil. Yalnızca ölçüldüğü şey için benimseyin. |
Aslında ne yapmalı
Bu kanıttan savunulabilir bir kişisel öngörü pratiğinin dört parçası var ve hiçbiri atölye gerektirmiyor.
- Tahmini kurmadan önce referans sınıfını kurun. Ne tahmin ediyorsanız edin, en karşılaştırılabilir on ila otuz tamamlanmış vakayı bulun ve onlara gerçekte ne olduğuna bakın. Bu, literatürdeki en büyük ölçülmüş hataya saldırır ve kimsenin iznini gerektirmez.
- Çabanızı evreye göre bölün. Açık bir sorunun erken döneminde zamanınızı muhakeme disiplinine harcayın: temel oranlar, çoklu bağımsız tahminler, ortalama alma. Geç dönemde bilgi toplamaya ve paylaşmaya harcayın. Bu iki hamle arasındaki ölçülen kaldıraç oranı, sorunun ömrü boyunca 0,50 kattan 4,50 kata çıkıyor.
- Puanı yazılı olarak, sayılarla tutun. Ölçülen en büyük üstünlüğe sahip gruba giden tek yol bu. Kayıtlı bir olasılığı ve bir çözülme tarihi olmayan tahmin puanlanamaz, puanlanmayan tahminci de gelişemez. Sık güncelleyin; süper tahminciler herkesten kabaca beş kat fazla güncelledi.
- Senaryo çalışmalarını iyi ölçüldükleri şeye indirin. Kullanacaksanız, bir olasılığı keskinleştirmek için değil, düşündüğünüz olasılıklar kümesini genişletmek için kullanın. Olasılık keskinleştirmede burada en kötü ölçümü onlar aldı.
Pratiği bir CEO gibi yönetin: ölçülen getirisi en iyi iki yöntemi seçin ve ne kadar moda olursa olsun gerisini reddedin. Bir öğrenci gibi öğrenin: puan kartı en sevdiğiniz tekniğin hiçbir şey yapmadığını söylediğinde bile dürüst tutun; çünkü bu literatürün tüm değeri, kendisi hakkındaki o sonucu yayımlamaya razı olmasından geliyor. Hem de iki kez.
İlk etapta neyi tahmin edeceğinizi fark etme sorusu için zayıf sinyalleri nasıl yakalarsınız yazısına, on yıllık kendinden emin uzman tahminlerinin gerçekte nasıl sonuçlandığı için tahmin karnesine bakın.
Sıkça sorulan sorular
2025 yeniden analizi eğitim ve takımların işe yaramaz olduğu anlamına mı geliyor?
Hayır ve makale bunu iddia etmiyor. İddiası, soru seçimi ve yanıt zamanlaması modellendiğinde orijinal nedensel sonuçların geçerli olmadığı. Eğitimli takım tahmincileri yine de daha iyi ham skorlar kaydetti. Şüpheli olan, eğitimin ve takım çalışmasının bunu üretip üretmediği. Pratikte bu, o belirli çıkarım üzerine kurulmamış yöntemlere ağırlık vermeyi savunur; referans sınıfı tahmininin burada olasılık eğitiminin üstünde yer almasının nedeni de budur.
Senaryo planlaması en kötü ölçüldüyse neden bu kadar popüler?
Çünkü farklı bir sonuç üzerinden değerlendiriliyor. Senaryo çalışması hazırlıklılık, hizalanma ve içerideki sohbetin niteliği için satın alınıyor ve bunları pekâlâ sağlıyor olabilir. Bu yazı yalnızca tahmin isabetini ölçüyor ve o sonuçta test edilen en zayıf kaldıraç oydu.
Süper tahmincilik sadece yetenek mi?
Turnuva kanıtı doğuştan yetenekten çok davranışa işaret ediyor: süper tahminciler soru başına ortalama 7,8 tahmin yaptı, diğer koşullarda bu 1,4 ila 1,6’ydı; ve tanımlamanın kendisi bir test değil, bir geçmiş performans kaydıydı. 2025 yeniden analizi, yanıt stratejisi özelliklerinin de grubu ayırdığını göstererek bunu karmaşıklaştırıyor; dolayısıyla dürüst yanıt şu: puanlama gerçek bir şeyi tanımlıyor ama bileşimi henüz yerine oturmuş değil.
Bir referans sınıfı için kaç karşılaştırılabilir vaka gerekir?
Literatür bir sayı sabitlemiyor ve size vereceğimiz her rakam uydurma olurdu. Birleşik Krallık Ulaştırma Bakanlığı uygulamasının gösterdiği şey gerekliliğin biçimi: nokta değil dağılım görmeye yetecek kadar tamamlanmış, gerçekten karşılaştırılabilir vaka; kullanımdan önce riskçe benzer oldukları istatistiksel olarak saptanmış olarak.
İki meslektaşımla Delphi süreci yürütebilir miyim?
Çekirdek mekanizma, yani kimse kimseyi duymadan önce toplanan bağımsız tahminler, sonra geri bildirim, sonra revizyon, küçük ölçekte çalışır ve neredeyse hiçbir maliyeti yoktur. Kanıt tabanı çiftleri değil panelleri karşılaştırıyor; dolayısıyla üç kişilik bir sürümü ölçülmüş bir şey olarak değil, ilkenin makul bir uygulaması olarak görün.
Kaynakça
- Mellers, Ungar, Baron, Ramos, Gurcay, Fincher, Scott, Moore, Atanasov, Swift, Murray, Stone ve Tetlock, Psychological Strategies for Winning a Geopolitical Forecasting Tournament, Psychological Science, 2014, cilt 25, sayı 5, sayfa 1106-1115. Koşul ve döneme göre Tablo 1 Brier skorları; olasılık ile senaryo eğitimi anlamlılık testleri; yorum sayısı korelasyonları; soru başına tahmin sayıları.
- Hauenstein, Thomas, Illingworth ve Dougherty, Rethinking the Role of Teams and Training in Geopolitical Forecasting: The Effect of Uncontrolled Method Variance on Statistical Conclusions, Psychological Science, 2025, cilt 36, sayı 1, sayfa 3-18. Madde tepki kuramıyla yeniden analiz; temel ve tam yöntem varyansı modelleri için Tablo 4 gizil yetenek etki büyüklükleri; Yıl 2 süper tahminci içermeyen veri için sonuç.
- Atanasov, Witkowski, Mellers ve Tetlock, Crowd Prediction Systems: Markets, Polls, and Elite Forecasters, International Journal of Forecasting, 2024. 136 soru boyunca kalabalık tipi ve sisteme göre toplu Brier skorları; karma etkiler elit katsayısı ve anlamlı çıkmayan piyasa ile anket karşılaştırması.
- Rowe ve Wright, Expert Opinions in Forecasting: The Role of the Delphi Technique, Principles of Forecasting içinde, Kluwer Academic Publishers, 2001. Delphi’nin istatistiksel ve geleneksel gruplara karşı oy sayımları ve Delphi paneli yürütme ilkeleri.
- Flyvbjerg, From Nobel Prize to Project Management: Getting Risks Right, Project Management Journal, 2006. Proje tipine göre ortalama maliyet ve talep tahmini sapması; Birleşik Krallık Ulaştırma Bakanlığı iyimserlik yanlılığı artışları %50 ve %80 düzeylerinde; referans sınıfı tahmininin 2005’te Amerikan Planlama Derneği tarafından onaylanması.
Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.















