Özet. Kaynak uyduran bir dil modeli arızalı değildir. Tam olarak puanlandığı şeyi yapmaktadır. Eylül 2025’te, üçü OpenAI’de biri Georgia Tech’te olmak üzere dört araştırmacı, halüsinasyonun modellerin nasıl notlandırıldığı yüzünden hayatta kaldığını savunan bir çalışma yayımladı: ikili doğru-yanlış ölçeğinde tahmin eden bir model, belirsizliğini kabul eden özdeş bir modeli her zaman yener. On önde gelen değerlendirmeyi taradılar; dokuzunun ikili notlandırma kullandığını ve hiçbirinin kalibre edilmiş bir “bilmiyorum” için tam puan vermediğini buldular. Biz OpenAI’nin kendi SimpleQA sonuçlarını alıp makalelerinin bildirmediği bir sütunu hesapladık: blöf oranı, yani modelin çekimser kalmak yerine yanlış yanıt verdiği başarısızlıkların payı. Oran %20,5 ile %99,0 arasında değişiyor, yani 4,8 katlık bir aralık ve doğrulukla neredeyse bağımsız. Ardından, gerçekler istemin içinde verildiğinde ne olduğunu görmek için Vectara’nın 11 Mayıs 2026’da güncellenen halüsinasyon liderlik tablosuna baktık. Temellendirme çok işe yarıyor, ama beklemediğimiz bir sonuç üretti: aynı model ailesi içindeki dört ayrı karşılaştırmada akıl yürütme çabasını artırmak halüsinasyon oranını yükseltti ve özetler istisnasız her seferinde uzadı. Aşağıda: beş doğrulanmış mekanizma, görevinizin hangi rejimde olduğu ve her biri için bir tespit testi.
Bu yazı, yapay zeka çıktısını değerlendirme ve güven kalibrasyonu üzerine çalışmalarımızın altındaki mekanik katmandır. O yazılar ne zaman güveneceğinizi anlatır. Bu yazı, hataların neden tam da orada olduğunu anlatır.
Tek cümlelik yanıt
Modeller halüsinasyon görür çünkü tahmin etmek çekimser kalmaktan daha iyi puan alır; geri kalan her şey ne zaman olduğuna dair ayrıntıdır.
Bu çerçeve, 4 Eylül 2025’te arXiv’e yüklenen “Why Language Models Hallucinate” çalışmasından geliyor; yazarları OpenAI’den Adam Tauman Kalai ve Ofir Nachum, Georgia Tech’ten Santosh S. Vempala ve OpenAI’den Edwin Zhang. Benzetmeleri sınavdaki bir öğrenci. Yanıtlayamadığınız bir soruda boş bırakmak sıfır alır, tahmin ise sıfır ya da bir alır. Bu kural altında akılcı strateji her zaman tahmin etmek, üstelik spesifik tahmin etmektir; çünkü “30 Eylül” ile “sonbaharda bir zaman” ikisi de yanlışsa aynı puanı alır ama yalnızca birincisi doğru çıkabilir.
Yazarlara göre dil modelleri kalıcı olarak bu sınavın içinde yaşıyor. Standart testleri taklit eden ölçütlere karşı optimize ediliyorlar ve bu yüzden sürekli sınav modundalar.
Makalenin en somut katkısı, ölçütlerin gerçekte ne yaptığına dair bir tarama. Yazarlar yaygın kullanılan on değerlendirmeyi inceleyip her birini, birincil ölçütünün katı doğru-yanlış isabet olup olmadığına ve çekimser kalmanın herhangi bir puan kazanıp kazanamayacağına göre sınıflandırdı.
| Ölçüt | Puanlama yöntemi | İkili notlandırma | “Bilmiyorum” için puan |
|---|---|---|---|
| GPQA | Çoktan seçmeli isabet | Evet | Yok |
| MMLU-Pro | Çoktan seçmeli isabet | Evet | Yok |
| IFEval | Programatik talimat doğrulama | Evet | Yok |
| Omni-MATH | Denklik notlandırma | Evet | Yok |
| WildBench | Dil modeliyle rubrik notlandırma | Hayır | Kısmi |
| BBH | Çoktan seçmeli / tam eşleşme | Evet | Yok |
| MATH (Seviye 5 bölümü) | Denklik notlandırma | Evet | Yok |
| MuSR | Çoktan seçmeli isabet | Evet | Yok |
| SWE-bench | Yamanın birim testlerinden geçmesi | Evet | Yok |
| HLE | Çoktan seçmeli / denklik notlandırma | Evet | Yok |
Kaynak: Kalai, Nachum, Vempala ve Zhang, “Why Language Models Hallucinate,” arXiv ön baskı 2509.04664v1, Eylül 2025, Tablo 2. Satırları üzerinden bizim sayımımız: 10’da 9’u ikili notlandırma kullanıyor; 10’da 9’u çekimser kalmaya puan vermiyor; 10’da 0’ı kalibre edilmiş bir çekimserliğe tam puan veriyor. WildBench’in rubriği yalnızca kısmi puan sunuyor ve yazarlar 1-10 ölçeğinin çekimser bir yanıtı, kendinden emin ama halüsinasyonlu bir yanıtın altında puanlayabileceğini not düşüyor.
Bu son not, sorunun tamamını küçük ölçekte anlatıyor. İkili notlandırma kullanmayan tek ölçüt bile, kendinden emin bir yanlışı dürüst bir “bilmiyorum”un üstüne koyabiliyor.
Yazarların önerdiği çözüm yeni bir halüsinasyon ölçütü değil. Liderlik tablolarına zaten hâkim olan ölçütlerin puanlamasını değiştirmek: talimatlarda bir güven eşiği belirtmek. Yalnızca t’den fazla eminseniz yanıtlayın, çünkü hatalar t/(1-t) puan cezalandırılır, doğru yanıtlar 1 puan kazanır ve “bilmiyorum” 0 puan alır.
Aritmetiği kontrol eden okurlar için bu formüle dair bir not. Ön baskı doğal değerleri t = 0,5 (ceza 1), t = 0,75 (ceza 2) ve t = 0,9 (ceza 9) olarak listeliyor. Makalenin kendi formülü olan t/(1-t) uygulandığında t = 0,5 için 1 ve t = 0,9 için 9 çıkıyor, ikisi de tutuyor; ama t = 0,75 için 3 çıkıyor, 2 değil. Ortadaki değerin parantez içi ifadesi, yanında durduğu formülle tutarsız. Bu, aksi halde titiz olan bir ön baskıdaki küçük bir kayma ve argüman hakkında hiçbir şeyi değiştirmiyor. Bunu belirtiyoruz çünkü tam olarak bu yazının size yeniden hesaplamanızı söylediği türden bir türetilmiş sayı ve ders sınır laboratuvarlarının makalelerinde bitmiyor. Gözlem, arXiv ön baskısının 4 Eylül 2025 tarihli birinci sürümü için geçerlidir; sonradan yayımlanan sürümler farklı olabilir.
Blöf oranı: özgün bir sütun
Teorinin ölçülebilir hale geldiği yer burası.
OpenAI, Kasım 2024’te SimpleQA’yı yayımladı: GPT-4o için zor olacak şekilde yazılmış, her birinin tek ve tartışmasız bir yanıtı bulunan 4.326 kısa olgu sorusundan oluşan bir ölçüt. Notlandırması ikili değil üçlü: doğru, yanlış ve girişilmedi; sonuncusu referans yanıtı tam vermeyen yanıtları, açık “bilmiyorum” dahil, kapsıyor.
Bu üçüncü kategori veri setini burada kullanışlı kılan şey, çünkü ikili ölçütlerin birbirine karıştırdığı iki şeyi ayırıyor: bilmemek ve biliyormuş gibi yapmak.
Yayımlanan tablo sekiz model için doğru, girişilmedi ve yanlış değerlerini bildiriyor. Çalışan bir profesyonel için en önemli oranı bildirmiyor. Bir model sizi yarı yolda bırakacaksa, bu başarısızlık nasıl görünür? Bilmediğini mi söyler, yoksa gözünüzün içine baka baka yanlış bir şey mi verir?
Bu tek bir bölme işlemi: yanlış bölü yanlış ile girişilmedi toplamı. Her satır için hesapladık.
| Model | Doğru (%) | Girişilmedi (%) | Yanlış (%) | Blöf oranı (%) |
|---|---|---|---|---|
| GPT-4o-mini | 8,6 | 0,9 | 90,5 | 99,0 |
| GPT-4o | 38,2 | 1,0 | 60,8 | 98,4 |
| OpenAI o1-preview | 42,7 | 9,2 | 48,1 | 83,9 |
| OpenAI o1-mini | 8,1 | 28,5 | 63,4 | 69,0 |
| Claude-3.5-sonnet (2024-06-20) | 28,9 | 35,0 | 36,1 | 50,8 |
| Claude-3-opus (2024-02-29) | 23,5 | 39,6 | 36,9 | 48,2 |
| Claude-3-haiku (2024-03-07) | 5,1 | 75,3 | 19,6 | 20,7 |
| Claude-3-sonnet (2024-02-29) | 5,7 | 75,0 | 19,3 | 20,5 |
CEOtudent editöryel çerçevesi. Doğru, girişilmedi ve yanlış sütunları OpenAI, “Measuring short-form factuality in large language models,” arXiv ön baskı 2411.04368, Tablo 3’ten birebir aktarılmıştır. Blöf oranı bizim hesabımızdır: yanlış / (yanlış + girişilmedi); yani doğru olmayan yanıtlar içinde modelin çekimser kalmak yerine yanlış bir yanıtı öne sürdüğü pay. Kaynak tablonun her satırının toplamının 100,0 ettiğini doğruladık. Modeller ve tarihler 2024 sonunda değerlendirildiği haliyledir ve bugünkü sistemler farklılık gösterecektir; sütun, satıcı sıralaması yapmak için değil çekimserlik davranışındaki aralığı göstermek için eklenmiştir.
İki okuma var ve önemli olan ikincisi.
Bariz okuma aralık. GPT-4o-mini bilmediğinde 100 vakanın 99’unda yine de size bir şey söylüyor. Claude-3-sonnet aynı durumda beş vakanın dördünde reddediyor. Başarısızlığın kendini sunma biçiminde 4,8 katlık bir fark bu.
Daha önemli olan okuma şu: blöf oranı büyük ölçüde doğruluktan bağımsız. GPT-4o-mini soruların %8,6’sını doğru yanıtladı. Claude-3-haiku %5,1’ini. Yetkinlikte 3,5 puanlık bir fark, ama kendi alanlarının dışına düştüklerinde nasıl davrandıklarında 78 puanlık bir fark. Bu iki model neredeyse eşit derecede az şey biliyor. Biri bunu söylüyor, diğeri söylemiyor.
Halüsinasyon makalesinin öngördüğü tam olarak bu. Çekimserlik davranışı yeteneğin bir yan ürünü değil. Eğitim ve değerlendirme sürecinin neyi ödüllendirdiğine göre belirlenen, ayrı ve eğitilmiş bir eğilim. On önde gelen ölçütün dokuzu çekimserliğe hiçbir şey ödemediği için, teşvik eğimi tek yöne bakıyor.
Pratik sonuç: güvenilirliği ölçüt puanlarından çıkaramazsınız. Bir liderlik tablosunun tepesindeki model, size uydurma bir kaynak verme olasılığı en yüksek model olabilir; çünkü tablo sırası ile blöf yapma eğilimini aynı baskı üretir.
İkinci rejim: gerçekleri siz verdiğinizde ne oluyor
Yukarıdaki her şey, modelin yalnızca parametrelerinden yanıtladığı kapalı kitap hatırlamayla ilgili. Profesyonel işlerin çoğu böyle değil. Bir belge yapıştırırsınız, bir rapor eklersiniz, bir kod tabanını gösterirsiniz. Bu sorunu çözer mi?
Vectara, Halüsinasyon Değerlendirme Modeli’ni kullanan halka açık bir halüsinasyon liderlik tablosu tutuyor. Görev kasıtlı olarak dar: her modele bir belge veriliyor ve yalnızca o belgede bulunan gerçekleri kullanarak özetlemesi isteniyor, ardından özet kaynağın desteklemediği ifadeler açısından kontrol ediliyor. Veri seti haber, teknoloji, bilim, tıp, hukuk, spor, iş ve eğitim alanlarında 7.700’den fazla makale içeriyor, 50 ile 24.000 kelime arasında değişiyor, aşırı uyumu önlemek için gizli tutuluyor ve modeller sıfır sıcaklıkta çağrılıyor. Aşağıdaki sürüm en son 11 Mayıs 2026’da güncellendi ve 106 modeli kapsıyor.
Tablonun tamamında temellendirilmiş halüsinasyon oranları en iyide %1,8’den en kötüde %24,2’ye kadar uzanıyor.
Bunu, GPT-4o’nun SimpleQA sorularının %60,8’ini yanlış yanıtladığı kapalı kitap sayılarıyla karşılaştırın. Bunlar farklı görevler, farklı modeller ve farklı tarihler; dolayısıyla bu birebir bir model karşılaştırması değildir ve öyle okunmamalıdır. Bu, iki rejimin karşılaştırmasıdır ve aralarındaki fark kabaca bir büyüklük mertebesi. Gerçeği bağlam penceresine koymak, elinizdeki tek en büyük müdahaledir ve her görevde, bedelsiz, şu anda kullanılabilir.
Ama oranı sıfıra indirmiyor ve kalan hatanın biçimi işin ilginçleştiği yer.
Beklemediğimiz bulgu: akıl yürütme çabası temellendirilmiş halüsinasyonu kötüleştiriyor
Tabloyu okurken birkaç model ailesinin farklı akıl yürütme ayarlarıyla birden fazla kez yer aldığını fark ettik. Bu doğal kontrollü karşılaştırmalar yaratıyor: aynı aile, aynı ölçüt koşusu, aynı tarih, değişen tek bir değişken.
Bu türden beş çift var. Gösterdikleri şu.
| Aile | Düşük çaba ayarı | Oran | Kelime | Yüksek çaba ayarı | Oran | Kelime | Orandaki değişim | Uzunluktaki değişim |
|---|---|---|---|---|---|---|---|---|
| GPT-5.2 | düşük | %8,4 | 126,5 | yüksek | %10,8 | 186,3 | +2,4 puan | +59,8 kelime |
| GPT-5.1 | düşük | %10,9 | 165,5 | yüksek | %12,1 | 254,4 | +1,2 puan | +88,9 kelime |
| Grok-4.1-fast | akıl yürütmesiz | %17,8 | 87,5 | akıl yürütmeli | %19,2 | 99,5 | +1,4 puan | +12,0 kelime |
| Grok-4-fast | akıl yürütmesiz | %19,7 | 141,9 | akıl yürütmeli | %20,2 | 173,9 | +0,5 puan | +32,0 kelime |
| o4-mini | düşük | %18,6 | 130,9 | yüksek | %18,6 | 127,7 | 0,0 puan | -3,2 kelime |
CEOtudent editöryel çerçevesi. Tüm oranlar ve ortalama özet uzunlukları, 11 Mayıs 2026’da güncellendiği haliyle Vectara halüsinasyon liderlik tablosundan birebir aktarılmıştır; eşleştirme, değişim sütunları ve uzunluk okuması bize aittir. Aile içi beş çiftin dördünde halüsinasyon oranı ve özet uzunluğu akıl yürütme çabasıyla birlikte yükseliyor. Beşincisi olan o4-mini’de ikisinde de anlamlı bir hareket yok; bu, ilişkiye bir istisna değil onunla tutarlı bir durum.
Hareket eden dört çiftin dördü de aynı yönde ve aynı anda iki değişkende birden hareket etti. Beşinci çift hiçbirinde hareket etmedi. Bu veride daha fazla akıl yürütme çabasının daha düşük bir temellendirilmiş halüsinasyon oranı ürettiği tek bir durum yok.
Uzunluk sütunu nedenini akla getiriyor ve mekanizma hiç de gösterişli değil. Daha yüksek akıl yürütme çabası daha uzun çıktı üretiyor. GPT-5.1 yüksek çabada 254 kelime yazıyor, düşük ayarda 166; yani %54 artış. Bir özetteki her ek cümle, kaynak belgenin desteklemediği bir şey öne sürmek için bir fırsat daha. Model kendini yanlışa doğru akıl yürütmüyor; daha fazla yazıyor ve desteklenmeyen iddialar hacimle birlikte birikiyor.
Aynı örüntü, o tek liderlik tablosu koşusunda OpenAI ailesinin tamamında görülüyor: listedeki en küçük model olan gpt-5.4-nano %3,1’de dururken, bir akıl yürütme amiral gemisi olan o3-pro %23,3’te duruyor. Tek bir satıcının ürün yelpazesi içinde, model yeteneğine göre ters yönde işleyen 7,5 katlık bir aralık.
Aşırı yorumdan önce iki uyarı. Ölçüt tek bir dar görevi, verilen bir belgenin sadık özetlenmesini ölçüyor ve bir akıl yürütme modelinin matematik, kod ve çok adımlı analizdeki üstünlükleri burada puanlanan şey değil. Ayrıca bunlar yayımlanmış güven aralıkları olmayan tekil ölçümler; dolayısıyla en küçük iki fark, 0,5 ve 1,2 puan, belirleyici değil yön gösterici sayılmalı. Ağırlığı taşıyan şey bağımsız aileler arasındaki tutarlılık, herhangi bir tek satır değil.
Uygulanabilir hali: işin bir kaynak belgenin içinde kalmak olduğu çıkarım ve özetleme görevlerinde en büyük akıl yürütme modeline uzanmak otomatik olarak güvenli seçim değildir, hatta tersi olabilir. Daha kısa çıktı isteyin. Aynı kolun ta kendisi.
Beş mekanizma ve her birinin görünümü
Halüsinasyon makalesi bu hataların ardındaki istatistiksel etkenleri sıralıyor. İşte her biri, gerçekten yapabileceğiniz şeye eşlenmiş halde. Mekanizmalar makaleye ait; tespit testleri ve maruziyet sütunu bize ait.
| Mekanizma | Nedeni | Görünümü | Tespit testi | En yüksek maruziyetli görevler |
|---|---|---|---|---|
| Keyfi olgular | Olgunun genelleme yapılacak bir örüntüsü yok ve eğitimde ya hiç ya da çok ender geçti. Makale bunu tekil oranıyla formüle ediyor: olguların bir kısmı tam bir kez geçtiyse, temel modellerin en az o oranda halüsinasyon görmesi beklenir | Kendinden emin, spesifik, makul, yanlış. Tarihler, isimler, kaynaklar, rakamlar, sayfa numaraları | Aynı soruyu üç ayrı oturumda sorun. Kararsız yanıtlar tahmin ettiği anlamına gelir. Kararlı yanıtlar doğruluğu kanıtlamaz ama kararsızlık neredeyse hatanın kanıtıdır | Kaynak gösterimi, biyografik ayrıntı, istatistikler, bilinmeyen varlıklar |
| Zayıf model uyumu | Mimari, bilgiden bağımsız olarak görevi kötü temsil ediyor. Makalenin örneği harf sayma | Zoru başarırken önemsiz derecede kolay bir şeyde başarısız olur. Karakter sayıları, dize işlemleri, hassas aritmetik | İki saniyede elle doğrulayabileceğiniz bir görev verin. Orada başarısız olursa konuya değil o görev sınıfına güvenmeyin | Sayma, ayrıştırma, tam dize işleri, uzun sayılarla aritmetik |
| Hesaplama zorluğu | Problem çözülemez. Hiçbir sistem, ne kadar yetenekli olursa olsun, karmaşıklık sınırlarından kaçamaz | Verimli çözümü olmayan bir şeye akıcı bir yanıt | Bu ölçekte doğru bir yanıtın hesaplanabilir olup olmadığını sorun. Değilse, akıcı yanıt süstür | Kriptografik sorgular, büyük kombinatoryal eniyileme, kapsamlı arama |
| Dağılım kayması | İstem, eğitimdeki hiçbir şeye benzemiyor. Dağılım dışı girdiler sınıflandırıcıları bozar, modeller de istisna değildir | Tuzak sorularda, alışılmadık ifadelerde ya da gerçekten yeni durumlarda tuhaf başarısızlıklar | Alışılmış biçime çevirip yeniden sorun. Yanıt değişirse sorun özgün ifadeydi | Yeni senaryolar, kasıtlı olarak sıra dışı çerçeveleme, çok yeni olaylar |
| Çöp girer, çöp çıkar | Hata eğitim derlemesinde vardı. Model onu sadakatle yeniden üretir | Yaygın bir yanlış kanıyı, güncelliğini yitirmiş bir rakamı ya da geniş dolaşımdaki bir yanlış alıntıyı kendinden emin biçimde tekrarlar | Arama sonucunu değil birincil kaynağı kontrol edin. Çok tekrarlanan sayılar en yüksek riskli kategoridir; çünkü onları eğitime sokan şey tekrarın kendisidir | Popüler istatistikler, halk bilimi, tartışmalı tarih, yürürlükten kalkmış standartlar |
CEOtudent editöryel çerçevesi. Beş mekanizma ve teknik temelleri Kalai, Nachum, Vempala ve Zhang, arXiv ön baskı 2509.04664v1, bölüm 3.3 ve 3.4’ten alınmıştır. Tespit testleri, maruziyet değerlendirmeleri ve görev eşlemesi bizim sentezimizdir ve o makalenin bulguları değildir.
Beşinci satır vurguyu hak ediyor, çünkü dikkatli insanları yakalayan satır o. Yüz makalede tekrarlanan bir istatistiğin bir model tarafından yeniden üretilme olasılığı, birincil kaynakta bir kez bildirilmiş bir istatistikten yüksektir ve tekrar kanıt değildir. Bununla doğrudan karşılaştık: ikincil kaynaklarda her yerde olan ve altta yatan çalışmada hiç bulunmayan sayılar.
Bundan çıkan kural rahatsız edici ve doğru. Bir sayı önemliyse, birincil belgeyi açın ve sayıyı onun içinde bulun. Belgenin özetini değil. Belgeyi.
Uygulanabilir bir protokol
En az çabayla en çok şeyi yakalayan sırayla beş adım.
Hangi rejimde olduğunuzu belirleyin. Yanıt bağlam penceresinde mi, modelin parametrelerinde mi? Kapalı kitap hatırlama kabaca bir büyüklük mertebesi daha riskli. Kaynağı yapıştırarak kapalı kitap bir soruyu temellendirilmiş bir soruya çevirebiliyorsanız, önce bunu yapın. Elinizdeki en yüksek kaldıraçlı hamle bu.
Açmadığınız hiçbir kaynağı kabul etmeyin. Başlıklar, yazarlar, yıllar, dergi adları ve sayfa numaraları klasik keyfi olgu başarısızlığıdır: genelleme yapılacak örüntü yok, uydurulduğunda makullük yüksek. Açılmamış her kaynağı doğrulanmamış sayın.
Yeni bir oturumda yeniden sorun. Ucuz, hızlı ve mekanizmayı doğrudan kullanır. Tekil bir olguyu tahmin eden bir model farklı tahminler üretir. Halüsinasyon makalesi tam da bununla açılıyor: bir yazarın doğum gününü üç denemede soran araştırmacılara sınır bir model üç farklı yanlış tarih verdi.
Temellendirilmiş görevlerde daha kısa çıktı isteyin. Liderlik tablosu çiftleri uzunluk ile desteklenmeyen iddiaların birlikte yükseldiğini gösteriyor. Uzunluk sizin kontrol ettiğiniz koldur.
Güveni sorun ve çekimser kalma izni verin. “Bilmiyorum”un kabul edilebilir bir yanıt olduğunu açıkça söyleyin. Bu, makalenin önerdiği çözümün kullanıcı tarafındaki hali. Ölçütlerin nasıl puanlandığını değiştiremezsiniz ama kendi isteminizin içindeki puanlama kuralını değiştirebilirsiniz.
Bu ne anlama gelmiyor
Modellerin genel olarak güvenilmez olduğu anlamına gelmiyor. Sadık özetlemede iyi modeller için %2 ila %7 arasındaki temellendirilmiş oranlar, sıfır olmadığını bildiğiniz ve önemli kısımları kontrol ettiğiniz sürece ilk geçiş için çalışılabilir bir hata oranı.
Halüsinasyonun gelecek yıl mühendislikle ortadan kaldırılacağı anlamına gelmiyor. Makalenin argümanı yapısal: baskın değerlendirmeler kalibre edilmiş belirsizliğe hiçbir şey ödemediği sürece, o değerlendirmeler için optimize edilen modeller tahmin etmeyi sürdürecek. Bunu düzeltmek puan tablosunu değiştirmeyi gerektiriyor ki bu, tek bir laboratuvardaki bir modelleme sorunundan çok bütün alanı kapsayan bir eşgüdüm sorunu.
Ve her şeyi doğrulamanız gerektiği anlamına da gelmiyor; o zaten aracı kullanmayı reddetmek olur. Anlamı şu: kendi göreviniz beş mekanizmadan hangisine maruz kalıyor bilin ve orayı kontrol edin. Tekdüze harcanan doğrulama çabası, boşa harcanan doğrulama çabasıdır.
Burada anlatılan yetkinlik şüphecilik değil. Kalibrasyon: hataların nerede yaşadığını bilmek, böylece başka her yere bakmayı bırakabilmek. Bu, yapay zeka okuryazarlığı ile akıcılığı yazısında ele alınan becerinin, yetenek yüzeyine değil hata yüzeyine uygulanmış hali.
Sıkça sorulan sorular
Yeni modeller daha az halüsinasyon görüyor mu?
Güvenilir biçimde değil ve her görevde değil. Mayıs 2026’da güncellenen temellendirilmiş özetleme tablosunda OpenAI’nin listelenen ailesindeki en küçük model %3,1, aynı ailedeki bir akıl yürütme amiral gemisi %23,3 aldı. Yetenek ve sadakat farklı eksenler ve bu görevde ters yönlere işaret edebiliyorlar.
Erişimle desteklenmiş üretim bunu çözer mi?
Sizi daha iyi rejime taşır ki bu büyük bir kazanç, ama bu yazıdaki temellendirilmiş oranlar kaynak belge zaten verilmişken ölçülmüştür. O sayıların her biri, temellendirmenin gideremediği artık bir hatadır. Erişim ayrıca kendi başarısızlık biçimini de ekler: yanlış belgeyi getirmek, yanlış kaynağa sadakatle temellendirilmiş kendinden emin bir yanıt üretir.
Model yanlışken neden bu kadar emin konuşuyor?
Çünkü spesifiklik ödüllendirildi, çekince ödüllendirilmedi. İkili notlandırmada belirsiz bir yanıt ile yanlış bir yanıt aynı sıfırı alır, oysa spesifik bir tahminin bir alma şansı vardır. Akıcı kendinden eminlik bu teşvikin eğitilmiş çıktısıdır, yanıt hakkında bir sinyal değil.
Modele emin olup olmadığını sormanın faydası var mı?
Zayıf. Beyan edilen güven sistematik olarak abartılıyor. SimpleQA yazarları bunu doğrudan ölçtü: modellerden yüzde olarak güven belirtmelerini isteyip gerçek doğrulukla karşılaştırdılar ve modellerin tutarlı biçimde abarttığını buldular. Yeni oturumlar arasında tekrarlı örnekleme, öz beyandan daha iyi bir sinyaldir; çünkü davranış hakkında bir iddiayı değil davranışın kendisini ölçer.
En çok hatayı yakalayan tek alışkanlık nedir?
Bir kararı etkileyecek her sayı ya da kaynak için birincil kaynağı açmak. Sonuç doğuran mesleki hataların çoğundan sorumlu iki mekanizmayı, keyfi olguları ve çöp girer çöp çıkarı hedefler ve kalem başına yaklaşık bir dakika sürer.
Kaynakça
- Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala ve Edwin Zhang, “Why Language Models Hallucinate,” arXiv ön baskı 2509.04664 sürüm 1, Eylül 2025. Ölçüt puanlaması üzerine Tablo 2; hata mekanizmaları üzerine bölüm 3.3 ve 3.4; açık güven hedefleri üzerine bölüm 4.2.
- OpenAI, “Measuring short-form factuality in large language models,” arXiv ön baskı 2411.04368, Kasım 2024, SimpleQA ölçütünü tanıtan çalışma. Model performansı üzerine Tablo 3; kalibrasyon üzerine bölüm 4.
- Vectara, Halüsinasyon Liderlik Tablosu, 7.700’den fazla belgeden oluşan gizli bir derlem üzerinde Halüsinasyon Değerlendirme Modeli ile hesaplanmıştır, 11 Mayıs 2026’da güncellenen sürüm.
- Vapnik ve Chervonenkis, fonksiyon ailelerinin boyutu üzerine temel çalışma; Kalai ve meslektaşları tarafından keyfi olgular analizinin dayanağı olarak gösterilmektedir.
- I. J. Good, görülmemiş türlerin popülasyon sıklıklarının tahmini üzerine; tekil oran argümanının altındaki eksik kütle tahmin edicisi.
- Stanford İnsan Odaklı Yapay Zeka Enstitüsü, Yapay Zeka Endeksi Raporu, model değerlendirme pratiği ve ölçüt doygunluğu üzerine.
Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.














