GelişimStrateji
0

Yapay Zeka Hatalarından Nasıl Öğrenilir: Model Hatalarını Kendi Beceri Kazanımına Dönüştürmek

TL;DR. Yapay zeka hataları gerçek işlerde, düzenli bir alıştırma malzemesi kaynağı olacak kadar sık görülür ve çoğu insan bu malzemeyi çöpe atar. Yaklaşık bin lise matematik öğrencisiyle yapılan rastgele kontrollü bir saha deneyinde (Bastani ve arkadaşları, PNAS, 2025), sade bir GPT-4 arayüzü alıştırma puanlarını yüzde 48 artırdı; ancak araç ortadan kaldırıldığında bu öğrenciler kontrol grubundan yüzde 17 daha düşük puan aldı. Aynı araç yalnızca yüzde 51 oranında doğru yanıt verdi. Stanford ve Yale’in bir değerlendirmesi, önde gelen hukuk araştırma araçlarının yüzde 17 ile 33 arasında bir oranda halüsinasyon ürettiğini buldu. Öğrenme tarafında, hata yönetimi eğitimi üzerine 24 çalışmayı kapsayan bir meta-analiz d = 0,44’lük pozitif bir ortalama etki buldu; bu etki yapısal olarak yeni görevlere transferde d = 0,80’e çıkıyor. CEO hamlesi: bir Yapay Zeka Hata Günlüğünü ve yazılı bir doğrulama politikasını sahiplenin ki hatalar sürpriz olmaktan çıkıp yönetilen bir riske dönüşsün. Öğrenci hamlesi: yakalanan her hatayı bir alıştırma tekrarı sayın, sınıflandırın, araç olmadan yeniden çözün ve günlüğü her hafta gözden geçirin.

Bu yazı değerlendirme kümesinin bir parçasıdır. Genel yöntem için merkez yazıyla başlayın: değerlendirme becerisi: yapay zeka çıktısını yargılamak. Hataların ardındaki mekanik için yapay zeka neden halüsinasyon görür ve model hataları nasıl erken yakalanır yazısına bakın. Bir görevin ne kadar kontrolü hak ettiğine karar vermek için güven kalibrasyonu: yapay zeka önerilerine ne zaman güvenmeli yazısına bakın.

Bir yapay zeka hatasını neden baş belası değil, eğitim verisi saymalı?

Bir model hatasına verilen olağan tepki, onu düzeltip yola devam etmektir. Bu, çıktıyı halleder ve dersi boşa harcar. İki araştırma alanı daha iyi bir kullanım öneriyor.

Birincisi, hatalardan öğrenmenin psikolojisidir. Janet Metcalfe’nin Annual Review of Psychology’deki derlemesi (2017) laboratuvar kanıtlarını tek cümlede özetler: “düzeltici geri bildirimin izlediği hatalı öğrenme, öğrenmeye yarar sağlar.” Yapay zekayla çalışan herkes için önem taşıyan bir koşul da ekler: “Hataya götüren akıl yürütmenin analizini de içeren düzeltici geri bildirim kritik önemdedir.” Yanlış bir sayıyı düzeltmek yetmez. Kazanım, onun neden yanlış olduğunu çözmekten gelir.

İkincisi, insanlar yapay zekayı bu analiz olmadan kullandığında ne olduğuna dair kanıtlardır. PNAS saha deneyinin yazarları riski açıkça dile getirir. Üretken yapay zeka yanılabilir olduğu için, “kullanıcılar çıktılarını dikkatle kontrol etmeli ve mevcut sorunları gidermelidir; altta yatan becerileri öğrenemezlerse, bunu yapmak için gereken uzmanlıktan yoksun kalabilirler.” Kontrol etme becerisi, yapma becerisine bağlıdır. Yapay zeka kullanımı ikincisini aşındırırsa, birincisi de onunla birlikte gider.

Bir modelden gelen her yanlış yanıt ya ödenip unutulan küçük bir vergidir ya da geri bildirimi üzerine iliştirilmiş bir problemdir. Bu, CEO ve öğrenci merceğinin tek bir nesneye uygulanmasıdır. Bir üst yönetici bir kusuru şanssızlık saymaz; kusur kaydedilir, sınıflandırılır ve bir sürece kadar izlenir. İyi bir öğrenci yanlış bir yanıtı utanılacak bir şey saymaz; yanlış yanıt sayfadaki en bilgilendirici maddedir. Aşağıda anlatılan Yapay Zeka Hata Günlüğü ikisini birden yapar.

Yapay zeka gerçekte ne sıklıkla yanılıyor?

Dürüst yanıt şu: tek bir oran yok. Yayımlanmış hata oranları, göreve bağlı olarak bir büyüklük mertebesinden fazla farklılaşıyor. Aşağıdaki rakamlar kaynaklarında basıldığı gibidir.

Test edilen görev ve sistem Yayımlanmış rakam Kaynak
Verilen bir haber belgesini özetleme, HHEM sıralamasındaki en iyi modeller En düşük halüsinasyon oranı %1,3 (iki model berabere), ardından %1,4 ve %1,5 Stanford HAI, AI Index Report 2025
Kısa, olgu arayan sorular (SimpleQA, 4.000’den fazla soru) En iyi performans gösteren model soruların %42,7’sini başarıyla yanıtladı Stanford HAI, AI Index Report 2025
Lise matematik alıştırma problemleri, sade bir sohbet arayüzünün ardındaki GPT-4 %51 oranında doğru yanıt; %42 mantık hatası; %8 aritmetik hatası Bastani ve ark., PNAS, 2025
Hukuk araştırma soruları, erişim (retrieval) destekli ticari araçlar (202 sorgu) %17 ile %33 arasında bir oranda halüsinasyon Magesh ve ark., 2024 ön baskı
Federal mahkeme davaları hakkında doğrudan, doğrulanabilir sorular, genel amaçlı modeller %58 (ChatGPT 4) ile %88 (Llama 2) arasında bir oranda halüsinasyon Dahl ve ark., 2024

Kaynaklar: Stanford Institute for Human-Centered AI, AI Index Report 2025, Bölüm 3; Bastani ve ark., PNAS 122, 2025; Magesh ve ark., arXiv ön baskı 2405.20362, 2024; Dahl ve ark., arXiv 2401.01301, Journal of Legal Analysis’te yayımlanacak. Tüm rakamlar test edilen belirli modelleri ve tarihleri tanımlar; herhangi bir ürünün güncel oranı değildir.

Tablodan üç sonuç çıkıyor.

Birincisi, oran markadan çok daha fazla göreve bağlıdır. Harvard Business School ve Boston Consulting Group deneyi bu düzensizliğe bir ad verdi. Çalışmanın özeti, yapay zeka desteğinin “aynı bilgi iş akışı içinde ve görünüşte benzer bir zorluk düzeyinde bile bazı görevlerde performansı iyileştirdiği, bazılarında ise kötüleştirdiği” bir “girintili çıkıntılı teknoloji sınırı”nı tanımlar.

İkincisi, uzmanlaşmış araçlar hataları ortadan kaldırmadan azaltır. Hukuk çalışması, satıcıları halüsinasyonların sona erdiğini duyurmuş ürünleri test etti. Yazarlar, Lexis+ AI’ın sorguların yüzde 65’ini doğru yanıtladığını, Westlaw’ın AI-Assisted Research ürününün yüzde 42 oranında doğru olduğunu ve “6’da 1’den fazla” sorgunun Lexis+ AI ile Ask Practical Law AI’ı yanıltıcı veya yanlış bilgiyle yanıt vermeye götürdüğünü bildiriyor. Tanımları her hata günlüğü için kullanışlıdır: bir yanıt “ya yanlışsa ya da yanlış dayandırılmışsa” halüsinasyon sayılır.

Üçüncüsü, modeller kendi hatalarının kötü yargıçlarıdır. Dahl ve arkadaşları, modellerin “kendi halüsinasyonlarını öngörmekte zorlandığı ve kullanıcıların yanlış hukuki varsayımlarını çoğu zaman eleştirmeden kabul ettiği” sonucuna varıyor. Kendinden emin bir ton kanıt değildir.

İnsanlar yapay zeka hatalarından öğrenmediğinde ne olur?

PNAS deneyi en net kanıttır, çünkü hem destekli performansı hem de sonrasındaki yardımsız performansı ölçtü. Çalışma, Türkiye’deki bir lisede 2023-2024 eğitim öğretim yılının güz döneminde, 90 dakikalık dört oturum ve yaklaşık elli sınıf üzerinden yürütüldü. Öğrenciler iki GPT-4 aracından biriyle ya da yalnızca ders kitaplarıyla alıştırma yaptı, ardından kitap kapalı bir sınava girdi.

Ölçüt Kontrol (yalnızca ders kitapları) GPT Base (sade sohbet arayüzü) GPT Tutor (öğretmen tasarımı istemler)
Destekli alıştırma puanı, kontrole göre değişim (1 üzerinden) Ortalama 0,28 +0,137 +0,361
Basıldığı haliyle alıştırma iyileşmesi – %48 %127
Yardımsız sınav, kontrole göre değişim (1 üzerinden) – -0,054 -0,004
Basıldığı haliyle sınav etkisi – %17 düşüş İstatistiksel olarak kontrolden ayırt edilemez

Kaynak: Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R, PNAS 122, e2422633122, 2025.

İki ayrıntı bunu okul çocuklarına dair bir uyarıdan fazlası yapıyor. Yazarlar sade aracı, 57 alıştırma probleminin her birini ona on kez sorarak denetledi. Araç “ortalamada yalnızca %51 oranında doğru yanıt veriyor”; yüzde 42 oranında mantık hatası, yüzde 8 oranında aritmetik hatası yapıyor. Öğrenciler, zamanın yaklaşık yarısında yanılan bir öğreticiyle alıştırma yapıyordu ve yardımsız sınav, bu hataları öğrenmeye çevirmediklerini gösteriyor.

Üstelik fark etmediler. GPT Base kolundaki öğrenciler “daha kötü performans gösterdiklerini ya da daha az öğrendiklerini algılamadı.” İlerleme hissi ile ilerleme gerçeği birbirinden ayrıldı.

Danışmanlık deneyi aynı örüntüyü profesyonel işte gösteriyor. 758 bilgi çalışanı arasında, sınırın içindeki 18 görevde GPT-4 kullananlar yüzde 12,2 daha fazla görev tamamladı ve bunları yüzde 25,1 daha hızlı bitirdi. Sınırın dışında olacak şekilde seçilmiş bir görevde ise “yapay zekasız çalışanlara kıyasla doğru çözüm üretme olasılıkları %19 daha düşüktü.” Araç, bir görevin sınırın hangi tarafında olduğunu duyurmadı. Bunu yalnızca kontrol edenler bilebilirdi.

Karar destek sistemleri üzerine daha eski araştırmalar mekanizmayı açıklıyor. Journal of the American Medical Informatics Association’da yayımlanan, otomasyon yanlılığı üzerine sistematik bir derleme 13.821 makaleyi taradı ve 74’ünü dahil etti. Dört çalışmanın havuzlanmış analizinde risk oranı 1,26 idi (%95 GA 1,11 ile 1,44 arası): sistemin tavsiyesi yanlış olduğunda bu, “yanlış bir karar verilmesi riskini %26 artırdı.” Derleme iki tür insan hatası tanımlar: yanlış tavsiyeye uymak anlamına gelen icra (commission) ve sistem uyarmadığı için harekete geçmemek anlamına gelen ihmal (omission). İkisi de hata günlüğüne girer, çünkü ikisi de modelin değil, sizindir.

Öğrenme bilimi düzeltilen hatalar hakkında ne söylüyor?

Düzeltilmeyen hatalar zarar veriyorsa, düzeltilen hatalar üzerine araştırmalar tersi yönü gösteriyor. Rakamlar her kaynakta basıldığı gibidir.

Bulgu Kanıt tabanı Basıldığı haliyle etki büyüklüğü
Hata yönetimi eğitimi, genel (Keith ve Frese, 2008) 24 çalışma, N = 2.183 Cohen’s d = 0,44
Aynı çalışma, eğitim sonrası transfer Moderatör analizi d = 0,56
Aynı çalışma, yapısal olarak farklı görevler (uyarlanabilir transfer) Moderatör analizi d = 0,80
Öğretimden önce problem çözme (Sinha ve Kapur, 2021) 53 çalışma, 166 karşılaştırma Hedge’s g 0,36, %95 GA 0,20 ile 0,51 arası
Aynı çalışma, üretken başarısızlık ilkelerine yüksek sadakat Alt küme Hedge’s g 0,37 ile 0,58 arasında

Kaynaklar: Keith N, Frese M, Journal of Applied Psychology 93(1), 2008; Sinha T, Kapur M, Review of Educational Research 91(5), 2021. İkisi de yalnızca özet düzeyinde okundu.

Dört bulgu doğrudan yapay zekayla pratiğe çevrilebiliyor.

Hatalar en çok yeni problemlerde işe yarar. Keith ve Frese en büyük etkiyi uyarlanabilir transferde buldu: genel 0,44’e karşı 0,80, yani ortalamanın yaklaşık 1,8 katı. Hataya dayalı eğitim, “yeni görevlere transferi desteklemek için hatadan kaçınan eğitim yöntemlerinden daha uygundur.” Yapay zeka çağında bir iş, giderek artan ölçüde yeni görevlerden oluşuyor.

Deneme başarısız olsa bile önce denemek önemlidir. Kornell, Hays ve Bjork, katılımcıların bilemeyecekleri yanıtları görmeden önce tahmin etmek zorunda kaldığı altı deney yürüttü. Vardıkları sonuç: “Başarısız geri çağırma girişimleri her iki malzeme türünde de öğrenmeyi artırdı.” Bunun yapay zeka kullanımı açısından anlamı bir sıralama kuralıdır. Modelinkini okumadan önce kendi yanıtınızı, tahmininizi ya da taslağınızı oluşturun.

Kendinden emin yapılan hatalar en düzeltilebilir olanlardır. Butterfield ve Metcalfe, yüksek güvenle yapılan hataların düzeltilmesi en zor hatalar olmasını bekliyordu. Tersini buldular: “yüksek güvenle yapılan hatalar, sonraki bir yeniden testte düzeltilme olasılığı en yüksek olanlardı.” Aşağıdaki günlüğün kontrol öncesi güveninizi kaydetmesinin nedeni budur. Emin olup yanıldığınız kayıtlar en değerli olanlardır.

Geri bildirim akıl yürütmeyi de içermek zorundadır. Metcalfe’nin yukarıda alıntılanan koşulu, hata günlüğünün tembel sürümünü dışarıda bırakır. Yanlış çıktıların bir listesi pek az şey öğretir. Nedeniyle ve onu yakalayacak olan kontrolle birlikte tutulan bir yanlış çıktı listesi ise bir müfredattır.

Bir uyarı: Sinha ve Kapur, “alandan bağımsız genel becerilerin öğrenilmesi” söz konusu olduğunda etki büyüklüklerinin önce öğretimden yana olduğunu bildiriyor. Yapay zeka çıktısını kontrol etmek kısmen genel bir beceridir; dolayısıyla kontrolleri açık biçimde de öğrenin. Aşağıdaki taksonomi o öğretimdir.

Her yapay zeka hatası türü hangi insan becerisini eğitir?

CEOtudent editöryel çerçevesi: yapay zeka hata taksonomisi. İlk altı satır model tarafındaki hatalardır; son ikisi otomasyon yanlılığı literatüründen alınan insan tarafındaki hatalardır. Becerilerle yapılan eşleştirme editöryel bir yargıdır, ölçülmüş bir sonuç değildir.

Kod Hata türü Nasıl görünür Eğittiği insan becerisi Tekrar
F Uydurma kaynak veya olgu Var olmayan bir atıf, dava, alıntı ya da istatistik Kaynak doğrulama Kullanmadan önce orijinali açın ve tam satırı bulun
M Yanlış dayandırılmış iddia Söylemediği bir şey için atıf yapılan gerçek bir kaynak Yakın okuma İddiayı atıf yapılan pasajla kelime kelime karşılaştırın
L Mantık hatası Birbirini izlemeyen makul görünümlü adımlar ya da yanlış yöntem Akıl yürütme ve problem yapılandırma İlk iki adımı yardımsız yeniden yapın, sonra yolların nerede ayrıldığını bulun
A Aritmetik veya birim hatası Doğru yöntem, yanlış sayı Tahmin Yanıtı okumadan önce büyüklük mertebesinde bir tahmin yazın
P Kabul edilen yanlış öncül Model, istemdeki yanlış bir varsayımın üzerine inşa eder Soru çerçeveleme Aynı soruyu, öncülü tarafsız biçimde ifade ederek sorun
S Kapsam kayması veya eksik yanıt Yakın bir soruyu yanıtlar ya da gerekli bir bölümü atlar Brif yazma Brifi bir tamamlanma tanımıyla yeniden yazın ve yeniden çalıştırın
C İcra (insan) Yanlış çıktıyı kontrol etmeden kabul ettiniz Doğrulama disiplini Atlanan kontrolü adlandırın ve politikaya ekleyin
O İhmal (insan) Model gündeme getirmediği için bir şeyi kaçırdınız Bağımsız tarama İstem yazmadan önce iyi bir yanıtın neleri içermesi gerektiğini listeleyin

Kodlar kaynaklarda yapılan ayrımları izler: hukuk çalışmasında yanlış yanıtlara karşı yanlış dayandırılmış yanıtlar, PNAS denetiminde mantık hatalarına karşı aritmetik hataları (yüzde 42’ye karşı 8), Dahl ve arkadaşlarında kabul edilen yanlış öncüller, otomasyon yanlılığı derlemesinde ise icraya karşı ihmal.

Kodlardaki bir örüntü bir teşhistir. Çok sayıda S kaydı briflerin zayıf olduğu anlamına gelir. Çok sayıda C kaydı doğrulama politikasına uyulmadığı anlamına gelir. Tek bir alanda çok sayıda F ve M kaydı, aracın o görev için sınırının ötesinde olduğu anlamına gelir. Bu döngünün brif yazma tarafı için yapay zeka yöneticisinin oyun kitabı yazısına bakın.

Bir Yapay Zeka Hata Günlüğü neleri içermeli?

CEOtudent editöryel çerçevesi: Yapay Zeka Hata Günlüğü şablonu. Yakalanan her hata için bir satır. Bir elektronik tablo ya da bir not dosyası yeterlidir.

Sütun Ne yazılır Neden orada
Tarih ve görev Ne üretiliyordu ve kimin için Hangi iş akışlarının hata ürettiğini gösterir
Risk düzeyi Düşük, orta veya yüksek Kaydı doğrulama politikasına bağlar
Araç ve mod Model; aramalı ya da aramasız, belgeli ya da belgesiz Hata oranları göreve ve kuruluma göre değişir
Hata, alıntılanmış haliyle Tam olarak yanlış olan cümle ya da sayı Bulanık hatırlamayı önler
Kod F, M, L, A, P, S, C veya O Haftalık sayımı mümkün kılar
Nasıl yakalandı Hangi kontrol, ya da sonraki aşamada kim buldu Hangi kontrollerin harcanan zamana değdiğini gösterir
Kontrol öncesi güven Çıktının doğru olduğuna dair 0 ile 100 arası bir değer En düzeltilebilir tür olan kendinden emin ıskaları görünür kılar
İnsan tarafındaki neden Zayıf brif, eksik bağlam, atlanan kontrol, yabancı alan Dersi modelden kullanıcıya taşır
Doğru yanıt ve kaynak Düzeltme ve nerede doğrulandığı Düzeltici geri bildirimin kendisi
Kural değişikliği Doğrulama politikasına eklenen satır ya da “yok” Hatayı bir süreç değişikliğine çevirir
Yeniden test tarihi Bu maddenin ne zaman yardımsız yeniden çözüleceği Alıştırma tekrarını takvime bağlar

İşin çoğunu iki sütun görür. Sonraki aşamada bir meslektaş, müşteri ya da gözden geçiren kişi tarafından yakalanan kayıtlar kaçaklardır; bunların tüm kayıtlar içindeki payı kontrolün işe yarayıp yaramadığını gösterir. Güven sütunu ise PNAS çalışmasındaki algı açığına karşı korur: kontrolden önce yazılan bir sayı sonradan düzeltilemez.

Aynı önce ve sonra biçiminin seçimlere uygulanmış hali için karar günlüğü şablonu ve protokolü yazısına bakın.

Ne kadar alıştırma malzemesi var?

Yukarıdaki yayımlanmış oranlara ilişkin CEOtudent analizi. Tablo, basılmış her oranı, her çıktıyı kontrol eden bir kişinin karşılaşacağı şeye çevirir. Her çıktının basılan oranda bağımsız bir çekiliş olduğunu varsayar; bu bir basitleştirmedir: gerçek hatalar görev türüne göre kümelenir.

Bağlam ve basılan oran 20 çıktı başına beklenen hata 10 çıktıda en az bir hata olasılığı Ortalama olarak her kaç çıktıda bir hata Haftada 20 kontrol edilmiş çıktıyla 50 haftada karşılaşılan hata
Belge özetleri, en iyi modeller, %1,3 0,3 %12,3 76,9 çıktı 13
Hukuk araştırma araçları, alt uç, %17 3,4 %84,5 5,9 çıktı 170
Hukuk araştırma araçları, üst uç, %33 6,6 %98,2 3,0 çıktı 330
Sade GPT-4 matematik yanıtları, %49 (100 eksi 51) 9,8 %99,9 2,0 çıktı 490
İçtihat sorularında genel sohbet robotu, alt uç, %58 11,6 %99,9’un üzerinde 1,7 çıktı 580

Kaynak: AI Index Report 2025, Magesh ve ark. 2024, Bastani ve ark. 2025 ve Dahl ve ark. 2024’te basılan oranlardan CEOtudent hesaplamaları (calc.py). Örnekleyicidir, güncel herhangi bir araç için tahmin değildir.

Yüzde 17’lik bir oranda, on çıktıyı kontrol etmeden kabul eden biri, en az birinin yanlış olması yönünde yüzde 84,5’lik bir olasılıkla karşı karşıyadır. Aynı oran, kontrolle birlikte, bir yılda geri bildirimli yaklaşık 170 çözümlü örnek üretir. Genel sohbet robotunun alt ucu uzmanlaşmış araçlarınkinin 3,4 katıdır; yani araç seçimi yükü ortadan kaldırmadan değiştirir.

Yüzde 1,3’te bir hata yaklaşık 77 çıktıda bir gelir; bu, dikkatin dağıldığı koşuldur. Düşük oranlı görevler uyanıklığa değil, politikada sabit bir örnekleme kuralına ihtiyaç duyar.

Haftalık gözden geçirme nasıl yürütülür?

CEOtudent editöryel protokolü: haftada bir kez, 20 dakika. 50 haftada bu yaklaşık 16,7 saat eder.

  1. Sayın ve sınıflandırın (5 dakika). Haftanın kayıtlarını koda göre sayın. Kaçakları, yani başkasının yakaladığı kayıtları not edin.
  2. Bir hatayı yardımsız yeniden çözün (5 dakika). Kontrol öncesi güveni en yüksek olan kaydı alın. Araç olmadan doğru yanıtı ya da doğru yöntemi üretin. Bu, geri çağırma girişimidir; doğru yanıt sonradan gözden geçirildiği sürece başarısız olduğunda bile işe yarar.
  3. Nedenin izini sürün (5 dakika). En sık görülen iki kod için, insan tarafındaki nedene dair birer cümle yazın. Test olarak Metcalfe’nin koşulunu kullanın: not yalnızca ıskayı değil, ıskaya götüren akıl yürütmeyi anlatmalıdır.
  4. Bir kuralı değiştirin (3 dakika). Doğrulama politikasına bir satır ekleyin, bir satırı sıkılaştırın ya da silin. Haftada bir değişiklik yeterlidir; daha fazlasına uyulmaz.
  5. Yeniden testi takvime bağlayın (2 dakika). Bu haftanın maddesini yeniden çözmek için bir tarih belirleyin ve daha önceki bir haftadan vadesi gelen maddeyi yeniden çözün.

Ayda bir kez, kaçakların payının düştüğünü ve kod dağılımının C ile S’den uzaklaştığını kontrol edin.

CEO tarafı nasıl görünür: doğrulama politikası?

Politikası olmayan bir günlük, bir hatıra defteridir. Politika, her iş sınıfının elinizden çıkmadan önce ne kadar kontrol göreceğini söyleyen kısa bir yazılı belgedir. Otomasyon yanlılığı araştırmaları bunun yazıya dökülmesini destekliyor. JAMIA derlemesi hafifletici etkenler arasında “eğitimi ve kullanıcı hesap verebilirliğinin vurgulanmasını” sayar ve kendini hesap verebilir olarak algılayan kişilerin daha az otomasyon yanlılığı hatası yaptığı bir çalışmayı aktarır. Parasuraman ve Manzey daha az iyimserdir; otomasyon yanlılığının “eğitimle ya da talimatlarla önlenemeyeceği” sonucuna varırlar. İki derleme pratik noktada birleşir: iyi niyet bir kontrol mekanizması değildir. Adı konmuş bir sahip ve sabit bir prosedür ise öyledir.

CEOtudent editöryel çerçevesi: üç kademeli bir doğrulama politikası.

Kademe Tipik iş Asgari kontrol
1. Düşük riskli, geri alınabilir Taslaklar, beyin fırtınası, iç notlar Bir kez okuyun; belge başına bir olguyu örnekleyerek kontrol edin
2. Orta riskli Müşteriye giden metin, bir kararı besleyen analiz, çalıştırılacak kod Her sayıyı, adı, tarihi ve atfı bir kaynakla doğrulayın; hesaplamaları bağımsız olarak yeniden yapın
3. Yüksek riskli ya da uzmanlığınızın dışında Hukuki, tıbbi, finansal ya da güvenlikle ilgili içerik; imzalanan ya da yayımlanan her şey Kademe 2 kontrolleri artı yetkin bir kişinin incelemesi; kaynak yoksa iddia da yok

İki kural politikayı dürüst tutar. Her kaçak, o görev türünü, bir yenisi olmadan bir ay geçene kadar bir kademe yukarı taşır. Ve her kural bir niyeti değil, kontrolünü adlandırır (“atıf yapılan sayfayı aç”; “dikkatli ol” değil).

Microsoft Research ve Carnegie Mellon’dan Lee ve arkadaşlarının anketi, politikanın neden hisse dayanamayacağını gösteriyor. İşte üretken yapay zeka kullanımına dair 936 örnek paylaşan 319 bilgi çalışanı arasında, “üretken yapay zekaya duyulan daha yüksek güven daha az eleştirel düşünmeyle, daha yüksek özgüven ise daha fazla eleştirel düşünmeyle ilişkilidir.” Araca duyulan güven, kontrolü tam da kontrolün tek güvence olduğu yerde düşürdü. Araca güven ile özgüven arasındaki açıklık, ayırt etme açığı yazısının konusudur.

Yapay zeka hatalarından öğreniyor musunuz? 8 soruluk bir puan kartı

CEOtudent editöryel puan kartı. Her soruya 0 (hayır), 1 (bazen) ya da 2 (tutarlı biçimde) puan verin. En yüksek puan 16.

  1. Modelinkini okumadan önce kendi tahmininizi, taslağınızı ya da yanıtınızı oluşturuyor musunuz?
  2. Yakalanan hataları, tam olarak yanlış olan metinle birlikte bir yere kaydediyor musunuz?
  3. Her hatayı türüne göre sınıflandırıyor musunuz?
  4. Kontrol etmeden önce güveninizi yazıyor musunuz?
  5. Yalnızca modelin kusurunu değil, insan tarafındaki nedeni de not ediyor musunuz?
  6. Her hafta en az bir hatayı yardımsız yeniden çözüyor musunuz?
  7. Risk düzeyine göre kademeleri olan yazılı bir doğrulama politikanız var mı?
  8. Sizden sonra başkasının yakaladığı hataları takip ediyor musunuz?
Puan Yorum Sonraki adım
0-6 Hatalar düzeltilip unutuluyor Günlüğe beş sütunla başlayın: görev, hata, kod, neden, düzeltme
7-11 Hatalar yakalanıyor, henüz dönüştürülmüyor Güven sütununu ve haftalık yardımsız yeniden çözümü ekleyin
12-16 Hatalar işleyen bir müfredat Aylık kaçak payını izleyin ve hiç tetiklenmeyen kuralları budayın

Bu ne anlama gelmiyor

Yapay zeka hataları iyi değildir ve daha fazla hata daha iyi değildir. Öğrenme araştırmaları, düşük riskli ortamlardaki düzeltilmiş hatalarla ilgilidir. Metcalfe’nin derlemesi hatalara “düşük riskli öğrenme durumlarındayken” izin verilmesini önerir; bir müşteriye ya da mahkemeye ulaşan işte değil.

Yapay zeka hatalarından insan becerisine uzanan bağ bir çıkarımdır. Burada atıf yapılan öğrenme çalışmaları, çoğunlukla sınıflarda, laboratuvarlarda ve eğitim kurslarında insanların kendi hatalarını inceler. Bu yazı için açılan hiçbir çalışma, bir modelin hatalarını kaydetmenin kullanıcının muhakemesini geliştirip geliştirmediğini test etmedi. Çerçeve, yerleşik ilkeleri yeni bir ortama uygular; ölçülmüş bir etki değildir.

Hata oranları anlık görüntülerdir. 2023 ve 2024’te test edilen belirli modelleri tanımlarlar. Hukuk çalışmasının yazarları, tahminlerinin hukuki yapay zeka sorgularındaki halüsinasyonların popülasyon oranına ilişkin “yansız bir tahmin olması amaçlanmadığı” konusunda uyarır. Güncel araçlar herhangi bir görevde daha iyi ya da daha kötü olabilir.

Alıştırma malzemesi tablosu aritmetiktir, öngörü değil. Sabit bir oranda bağımsız hatalar olduğunu ve her hatanın yakalandığını varsayar.

Sıkça sorulan sorular

Bir günlüğün işe yaraması için kaç hata gerekir?
Bir avuç. Haftalık protokol tek kayıtla çalışır, çünkü 2. adım yeniden çözülecek yalnızca bir maddeye ihtiyaç duyar. Kodlardaki örüntüler için genellikle birkaç haftalık kayıt gerekir.

Risk önemsizken de hatalar kaydedilmeli mi?
Evet, kısaca. Düşük riskli hatalar en güvenli alıştırma malzemesidir ve yüksek riskli hatalara yol açan brif ve kontrol zayıflıklarının aynısını ortaya çıkarır.

Kullanıcının kusuru olan hataları kaydetmeye değer mi?
En yararlı kayıtlar onlardır. C ve O kodları, otomasyon yanlılığı literatürü yanlış tavsiyeye uymayı ve sistemin gündeme getirmediği sorunları kaçırmayı insan hatası saydığı için vardır.

Daha iyi bir model günlüğü gereksiz kılar mı?
Hayır. Daha düşük hata oranları her hatayı daha seyrek, dolayısıyla gözden kaçması daha kolay hale getirir. O zaman günlük, bir alıştırma kaynağı olmaktan çıkıp kontrollerin hala yapıldığını gösteren bir örnekleme kaydına dönüşür.

En hızlı ilk adım nedir?
Önem taşıyan bir konuda bir sonraki yapay zeka yanıtından önce, yanıtın ne olması gerektiğine dair tek satırlık bir tahmin yazın. Sonra karşılaştırın. Bu tek alışkanlık geri çağırma bulgusunu uygular ve ilk günlük kaydını yazmayı kolaylaştırır.

Kaynaklar

  1. Bastani H, Bastani O, Sungu A, Ge H, Kabakcı Ö, Mariman R. Generative AI without guardrails can harm learning: Evidence from high school mathematics. Proceedings of the National Academy of Sciences 122, e2422633122, 2025. 2025 tarihli bir düzeltme yalnızca bir yazarın kurum bilgisiyle ilgilidir.
  2. Magesh V, Surani F, Dahl M, Suzgun M, Manning CD, Ho DE. Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools. arXiv ön baskı 2405.20362, 2024.
  3. Dahl M, Magesh V, Suzgun M, Ho DE. Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. arXiv 2401.01301, 2024, Journal of Legal Analysis’te yayımlanacak.
  4. Maslej N, et al. The AI Index 2025 Annual Report. AI Index Steering Committee, Institute for Human-Centered AI, Stanford University, Nisan 2025. Bölüm 3, Responsible AI.
  5. Dell’Acqua F, McFowland E, Mollick E, Lifshitz-Assaf H, Kellogg KC, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science 37(2): 403-423, 2026. Yalnızca özet.
  6. Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association 19(1): 121-127, 2012.
  7. Parasuraman R, Manzey DH. Complacency and Bias in Human Use of Automation: An Attentional Integration. Human Factors 52(3): 381-410, 2010. Yalnızca özet.
  8. Lee HP, Sarkar A, Tankelevitch L, et al. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI Conference on Human Factors in Computing Systems, 2025.
  9. Metcalfe J. Learning from Errors. Annual Review of Psychology 68: 465-489, 2017. Yalnızca özet.
  10. Keith N, Frese M. Effectiveness of Error Management Training: A Meta-Analysis. Journal of Applied Psychology 93(1): 59-69, 2008. Yalnızca özet.
  11. Sinha T, Kapur M. When Problem Solving Followed by Instruction Works: Evidence for Productive Failure. Review of Educational Research 91(5): 761-798, 2021. Yalnızca özet.
  12. Kornell N, Hays MJ, Bjork RA. Unsuccessful Retrieval Attempts Enhance Subsequent Learning. Journal of Experimental Psychology: Learning, Memory, and Cognition 35(4): 989-998, 2009.
  13. Butterfield B, Metcalfe J. Errors Committed With High Confidence Are Hypercorrected. Journal of Experimental Psychology: Learning, Memory, and Cognition 27(6): 1491-1494, 2001. Yalnızca özet.

Veri tabloları rakamları kaynaklarında basıldığı gibi aktarır. Hata taksonomisi, Hata Günlüğü şablonu, alıştırma malzemesi tablosu, haftalık gözden geçirme protokolü, doğrulama politikası ve puan kartı CEOtudent analizleri ya da editöryel çerçeveleridir; 1,8 ve 3,4 katları CEOtudent hesaplamalarıdır. Kullanılmayanlar: danışmanlık deneyinin açılamayan çalışma metni sürümü; hukuk çalışmasının GPT-4 için yalnızca grafikte yer alan değerleri; Sinha ve Kapur’daki 0,87’lik yanlılığa göre düzeltilmiş tahmin; ve sohbet robotlarının zamanın sabit bir payında yanıldığına dair, burada açılan hiçbir kaynağın desteklemediği popüler iddialar.


Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.

Benzer içerikler