TL;DR: Çoğu insan yapay zeka ajanlarına sohbet robotu alışkanlıklarıyla gelir ve sonuçların daha iyi değil daha kötü olmasına şaşırır. Nedeni yapısaldır: bir sohbet robotu inceleyebileceğiniz tek bir yanıt üretir, bir ajan ise erken yapılan tek bir hatanın sonraki her şeye sessizce yayıldığı bir eylem zinciri üretir. Ajan okuryazarlığı, işi devretmeden önce o zincirin nerede kopacağını öngörmenizi sağlayan küçük kavram kümesidir. Kanıtlar aynı anda hem iyimserliği hem temkinliliği destekler. Stanford HAI’nin 2026 AI Index raporu, işletim sistemleri genelinde gerçek bilgisayar görevlerini test eden OSWorld’de ajan doğruluğunun yaklaşık yüzde 12’den yüzde 66,3’e çıktığını, yani insan performansının altı puan yakınına geldiğini bildiriyor; aynı rapor ajanların yapılandırılmış kıyaslamalarda hâlâ yaklaşık üç denemeden birinde başarısız olduğunu da not ediyor. METR’in ölçümleri daha da keskindir: ajanlar bir uzman insanın dört dakikadan kısa sürede bitireceği görevlerin neredeyse tamamında başarılı olurken, yaklaşık dört saatten uzun süren görevlerin yüzde 10’undan azında başarılı oluyor ve bu zaman ufku kabaca her yedi ayda bir ikiye katlanıyor. Birlikte okunduğunda bu sayılar şunu söyler: yetenek gerçektir, güvenilirlik koşulludur. Aşağıdaki yedi kavram, o koşulun içinde nasıl çalışacağınızdır ve bu yazıdaki özgün güvenilirlik aritmetiği, belirli bir başarı oranında kaç adımı güvenle zincirleyebileceğinizi tam olarak gösterir. Kontrol noktasını tasarlayan bir CEO gibi devredin ve başarısızlığı okuyan bir öğrenci olarak kalın.
Sohbet robotu becerisi neden aktarılmaz
Bir sohbet robotuna komut verdiğinizde son adım sizsinizdir. Model bir şey üretir, siz bakarsınız, kabul veya reddedersiniz. Hatalar görünürdür; çünkü çıktı, teslim edilecek şeyin kendisidir.
Bir ajan bunu tersine çevirir. Planlar, araçları çağırır, sonuçları okur, bir sonraki adıma karar verir ve size herhangi bir şey göstermeden önce çoğu zaman onlarca adım boyunca bunu tekrarlar. Muhakemeniz artık her kavşakta uygulanmaz. Tüm inşasını izlemediğiniz bir sonuca, en sonda, bir kez uygulanır. Komut vermede mükemmel olan insanların devretmede zayıf kalabilmesinin nedeni budur: test edilen beceri ifade biçimi değil, kapsam belirleme ve denetim tasarımıdır.
Bu, pratikte okuryazarlığı akıcılıktan ayıran ayrımdır; daha önce yapay zeka okuryazarlığı ile akıcılığı karşılaştırdığımız yazıda ve komut mühendisliğinin ötesine geçen daha geniş yapay zeka okuryazarlığı katmanında ele almıştık. Ajan okuryazarlığı, özellikle izlemediğiniz işe dair olan katmandır.
Kavram 1: Gerçek yetenek ölçüsü görev ufkudur
Faydalı soru, ajanın ne kadar akıllı olduğu değildir. İpin ucunu kaçırmadan ne kadar uzun bir görevi taşıyabildiğidir.
METR bunu doğrudan, zaman ufku dediği şeyle ölçer: bir uzman insanın ne kadar süreceğiyle ölçülen ve modelin yaklaşık yarı yarıya başarılı olduğu görev uzunluğu. Bulguları alandaki en pratik sayıdır. Mevcut modeller, bir insanın dört dakikadan kısa sürede tamamlayacağı görevlerin neredeyse yüzde 100’ünde başarılı olurken, bir insanın yaklaşık dört saatten uzun sürdüreceği görevlerin yüzde 10’undan azında başarılı olur. Bu iki uç arasında başarı, süreyle birlikte istikrarlı biçimde düşer.
Eğilim de düzey kadar önemlidir. METR, bu yüzde 50 zaman ufkunun kabaca altı yıl boyunca yaklaşık her yedi ayda bir ikiye katlandığını buldu. Yani sınır hızla hareket eder; bu da ajanların neyi kaldırabileceğine dair oluşturduğunuz kişisel kuralın raf ömrünün kısa olduğu ve varsayılmak yerine birkaç ayda bir yeniden test edilmesi gerektiği anlamına gelir.
Pratik çevirisi: devretmeden önce, görevin yetkin bir insanın ne kadar süreceğini tahmin edin. Modelin zekâsına dair izleniminiz değil, o tahmin, devrin tutup tutmayacağının elimizdeki en iyi göstergesidir.
Kavram 2: Güvenilirlik adımlar boyunca aşağı doğru bileşiklenir
Davranışı en çok değiştiren kavram budur ve saf aritmetiktir.
Çok adımlı bir görevi tamamlayan bir ajanın her adımda başarılı olması gerekir. Tek bir adım başarısız olursa zincir başarısız olur. Dolayısıyla genel başarı, kabaca adım başına başarı oranının adım sayısı kuvvetine yükseltilmiş hâlidir. Toby Ord’un “Yapay zeka ajanlarının başarı oranları için bir yarı ömür var mı?” başlıklı makalesi bunu kesinleştirir; ajanların uzun görevlerdeki performansının çarpıcı ölçüde basit bir modelle iyi açıklandığını gösterir: her zaman biriminde sabit bir başarısız olma oranı, ki bu da süre büyüdükçe başarıda üstel bir azalma üretir.
Aşağıdaki tablo bu mantığı doğrudan uygular. Bir CEOtudent editöryel hesaplamasıdır; bir çalışmada ölçülmüş değil, bileşiklenme kuralından aritmetik olarak türetilmiştir ve adımların bağımsız ve eşit zorlukta olduğunu varsayar. Gerçek zincirler değişkenlik gösterir ama şekil korunur.
Zincirlenen adımlar başarıyı nasıl aşındırır (CEOtudent editöryel hesaplaması)
| Adım başına başarı oranı | 1 adım | 3 adım | 5 adım | 10 adım | 20 adım |
|---|---|---|---|---|---|
| %95 | %95,0 | %85,7 | %77,4 | %59,9 | %35,8 |
| %90 | %90,0 | %72,9 | %59,0 | %34,9 | %12,2 |
| %80 | %80,0 | %51,2 | %32,8 | %10,7 | %1,2 |
| %67 (yaklaşık yapılandırılmış kıyaslama oranı) | %67,0 | %30,1 | %13,5 | %1,8 | %0,03 |
Üzerinde durulması gereken satır en alttakidir. 2026 AI Index’in, ajanların yapılandırılmış kıyaslamalarda kabaca üç denemeden birinde başarısız olduğu gözlemi, adım başına yüzde 67’ye yakın bir oran anlamına gelir. Bu oranda beş adımlık bir zincir, yaklaşık yüzde 13 oranında doğru tamamlanır. Ajan tek tek adımlarda kötü olduğu için değil, üst üste doğru yapılması gereken beş adımın çok fazla olması nedeniyle.
Bunu bir kurala çevirin. Tüm zincirin doğru olma olasılığının en az yüzde 80 olmasını istiyorsanız, denetlenmemiş azami adım sayısı adım başına yüzde 95 güvenilirlikte kabaca dört, yüzde 90’da iki ve yüzde 80’de birdir. Bunun altında denetimsiz zincirleme devretme değil, kumardır. Bu, delegasyon tavanı olarak tarif ettiğimiz şeyin altındaki aritmetiktir: insanlar duvara ajanlar gelişmeyi bıraktığı için toslamaz; kontrol noktası eklemeden adım eklemeye devam ettikleri için toslar.
Kavram 3: Bir ajan ancak araçları ve izinleri kadar yeteneklidir
Bir ajanın muhakemesi, gerçekten erişebildiği şeyle sınırlıdır. Dosyaya erişemiyor, veritabanını sorgulayamıyor ya da isteği gönderemiyorsa, hiçbir yetenek düzeyi bunu telafi etmez. Tersine, iyi seçilmiş araçlara sahip mütevazı bir model, körlemesine çalışan daha güçlü bir modeli sıklıkla geride bırakır.
OSWorld sonuçları bunu gösterir. O kıyaslama tam olarak zordur; çünkü yazılım hakkında soru yanıtlamayı değil, gerçek arayüzler üzerinden gerçek yazılımı kullanmayı gerektirir ve yaklaşık yüzde 12’den yüzde 66,3’e sıçrama, ajanların yalnızca muhakemede değil araç kullanımında iyileşmesini yansıtır.
Devretmeden önce, görevin ajanın neye dokunmasını gerektirdiğini listeleyin. Eksik araç erişimi, kendinden emin biçimde yanlış sonuçların en yaygın nedenidir; çünkü erişimi reddedilen bir ajan çoğu zaman boşluğu bildirmek yerine çıkarım yapar.
Kavram 4: Bağlam bir hafıza değil, bir çalışma bütçesidir
İnsanlar ajanın tüm görevi hatırladığını varsayar. Ajan, her kararın verildiği andaki bağlamında ne varsa onunla çalışır ve uzun ajan koşuları daha önceki materyali dışarı iter veya gömer.
Sonuç çok belirgindir: başta bir kez söylenen kısıtlar, on beşinci adımda unutulması en muhtemel şeydir. Bir kural önemliyse, yalnızca talimat noktasında değil, karar noktasında da mevcut olmalıdır. İyi ajan brifinglerinin kısıtları geçerli oldukları adımların içinde yeniden ifade etmesinin ve iyi yapılandırılmış bir brifingin uzun olandan daha iyi performans göstermesinin nedeni budur. Eksiksiz yapay zeka ajanı brifing çerçevemizdeki yapı tam olarak bu kısıt etrafında kurulmuştur.
Kavram 5: Özerklik bir kadrandır ve ayarını siz seçersiniz
Özerklik ikili değildir. Pratikte seviyeler vardır ve her biri insan muhakemesini farklı bir noktaya yerleştirir:
- Öner. Ajan önerir, siz uygularsınız. En yavaş, en güvenli.
- Onayla ve uygula. Ajan yalnızca siz her önemli adımı onayladıktan sonra harekete geçer.
- Kontrol noktalarıyla uygula. Ajan, gözden geçirdiğiniz tanımlı duraklar arasında serbestçe çalışır.
- Denetimli tam özerklik. Ajan görevi tamamlar, siz kaydı sonradan incelersiniz.
Doğru seviye Kavram 2’den çıkar. Zincir uzunsa ve adım başına güvenilirlik belirsizse, kontrol noktaları bürokrasi değil, bileşiklenmeyi sıfırlayan mekanizmadır. Adım başına yüzde 95 güvenilirlikte, her dört adımda bir kontrol noktası, gözden geçirilen her bölümü yüzde 80 güvenin üzerinde tutar; kontrol noktasında bulunan hatalar orada gerçekten düzeltildiği sürece bu, genel görev ne kadar uzun sürerse sürsün geçerlidir. Kontrol noktası olmadan aynı görev sıfıra doğru çürür.
Kontrol noktalarını eşit aralıklarla değil, hataların geri alınmasının pahalı hâle geldiği yerlere koyun. Geri döndürülemez olan her şey, sisteminizden çıkan her şey ve başka birinin dayanacağı her şey doğal duraklardır.
Kavram 6: Devretmenin değip değmeyeceğine doğrulama maliyeti karar verir
Ajan işinde, yetenekle hiç ilgisi olmayan bir tuzak vardır. Bazı görevler yapması hızlı, kontrol etmesi yavaştır. Bunları devretmek, ajan iyi performans gösterse bile zaman kaybettirir; çünkü her koşuda tam doğrulama maliyetini ödersiniz.
Test bir orandır. Çıktıyı doğrulama süresini, işi kendiniz yapma süresiyle karşılaştırın. Doğrulama, yapmanın yaklaşık yarısından fazlasına mal oluyorsa, görev bir test, bir kural ya da örneklem temelli inceleme gibi ucuz bir kontrol kurabileceğiniz kadar sık tekrarlanmadıkça devretme genellikle kazandırmaz.
Ajanların doğrulaması ucuz görevlerde, yani doğruluğun bakışta belli olduğu ya da bir testin teyit edebildiği işlerde güçlü; doğru olduğunu bilmenin tek yolunun muhakemeyi yeniden yapmak olduğu işlerde zayıf olmasının nedeni budur. Muhakeme yoğun sentez klasik pahalı-doğrulama vakasıdır ve bu yüzden sizde kalır.
Kavram 7: Hesap verebilirlik devredilmez
İşi devredebilirsiniz. Sonucun sorumluluğunu devredemezsiniz ve mevcut hiçbir yönetişim çerçevesi buna izin vermez.
NIST Yapay Zeka Risk Yönetimi Çerçevesi bunu dört işlev etrafında düzenler: YÖNET, HARİTALA, ÖLÇ ve İDARE ET; merkezî varsayımı, bir yapay zeka sisteminin yaptıklarından bir insanın ya da bir kurumun sorumlu kalmaya devam ettiğidir. İş devreden bir birey için pratik sonuçları küçük ama pazarlıksızdır: ajanın ne yaptığını bilin, onu yeniden kurgulayabilir olun ve nasıl üretildiği sorulduğunda savunamayacağınız hiçbir şeyi kendi adınızla dışarı göndermeyin.
Diğer altı kavramı dürüst tutan kavram budur. Kapsam belirlemede, kontrol noktalarında ya da doğrulamada atılan her kestirme, eninde sonunda çıktının üzerinde adı yazan kişiye iner.
Ajan Devri Hazırlık Kontrolü
Bir görevi devretmeden önce yedi kavramı soru olarak çalıştırın. Aşağıdaki kontrol bir CEOtudent editöryel çerçevesidir: yapılandırılmış bir muhakeme aracıdır, doğrulanmış bir ölçek değildir.
Ajan Devri Hazırlık Kontrolü (CEOtudent editöryel çerçevesi)
| # | Kavram | Önce yanıtlanacak soru | Kırmızı bayrak | Çözüm |
|---|---|---|---|---|
| 1 | Görev ufku | Yetkin bir insan ne kadar sürede yapardı? | Birkaç saatten fazla insan işi | Ufkun altındaki alt görevlere bölün |
| 2 | Bileşiklenen güvenilirlik | Üst üste kaç adımın başarılı olması gerekiyor? | Dörtten fazla denetlenmemiş adım | Her üç ila dört adımda bir kontrol noktası koyun |
| 3 | Araç erişimi | Ajanın başarması için neye erişmesi gerekiyor? | Gerekli kaynaklardan biri ona kapalı | Erişim verin ya da veriyi brifinge koyun |
| 4 | Bağlam bütçesi | Kısıtlar kararların verildiği yerde mevcut mu? | Kurallar yalnızca başta bir kez söylenmiş | Kısıtları ilgili adımların içinde yineleyin |
| 5 | Özerklik seviyesi | Hangi eylemler geri döndürülemez? | Özerk koşu içinde geri döndürülemez eylemler | O noktalarda onay şartı koyun |
| 6 | Doğrulama maliyeti | Kontrol, yapmaya kıyasla ne kadar sürüyor? | Kontrol, yapmanın yarısından fazlası | Devretmeyin ya da önce ucuz bir test kurun |
| 7 | Hesap verebilirlik | Bunun nasıl üretildiğini açıklayabilir miyim? | Ajanın ne yaptığına dair kayıt yok | Çıktıyla birlikte kayıt veya yöntem beyanı isteyin |
1, 2 ve 6 numaralı sorular hep birlikte rahatsız ediciyse, bu bir devretme sorunu değildir. Bir kapsam sorunudur ve bu çeyrekte daha iyi bir model bunu çözmez.
Bunun öğrenme biçiminiz açısından anlamı
Bunun bir CEO yarısı bir de öğrenci yarısı vardır ve ikisi de gereklidir.
CEO yarısı tasarımdır. Bir ajandan güvenilir olmasını istemiyorsunuz. Güvenilmez adımların yine de güvenilir bir sonuç ürettiği bir süreç kuruyorsunuz ki her operasyon lideri insan ekiplerle tam olarak bunu yapar. Kontrol noktaları, tanımlı kapsam, net geri dönülemezlik sınırları ve açık doğrulama, yapay zeka araçları değil yönetim araçlarıdır.
Öğrenci yarısı ise alışıldıktan daha hızlıdır; çünkü zemin hareket ediyor. Kabaca her yedi ayda bir ikiye katlanan bir zaman ufku, altı ay sonra güvenle devredilebilir olanın sınırının bugünkünden anlamlı biçimde farklı olacağı anlamına gelir. Doğru duruş, ajanların neyi yapamayacağını ezberlemek değildir. Periyodik olarak yeniden test ettiğiniz küçük bir görev kümesi tutmaktır; böylece sınırla ilgili çalışan modeliniz hatırlanmış değil güncel olur.
2026’da ajanlardan en çok verim alanlar en iyi komutlara sahip olanlar değildir. Zincirlerinin nerede koptuğunu bilen ve oraya bakanlardır.
Sık sorulan sorular
Yapay zeka ajanı, fazladan adımları olan bir sohbet robotu mudur?
İşlevsel fark, ajanın eylemleri sırayla gerçekleştirmesi, araçları kullanması ve sonra sonuçlara göre bir sonraki adıma karar vermesidir. Bu, başarısızlık biçimini tamamen değiştirir: sohbet robotu size yargılayacağınız tek bir çıktı verir, ajan ise üçüncü adımda yanılıp sonraki on iki adımı o hatanın üzerine kendinden emin biçimde inşa edebilir.
Bir ajanı denetimsiz olarak kaç adım çalıştırabilirim?
Adım başına güvenilirliğe bağlıdır ve aritmetik affetmez. Zincirin bütününde yüzde 80 veya üzeri güven için adım başına yüzde 95 güvenilirlikte kabaca dört adım, yüzde 90’da iki ve yüzde 80’de bir adım. Tereddüt ettiğinizde, gerekli hissettirenden daha erken bir kontrol noktası koyun.
Ajanlar gerçek işe emanet edilecek kadar iyi mi?
Kısa insan zaman ufku içinde kalan ve doğrulaması ucuz görevler için sıklıkla evet; OSWorld sonuçlarının doğruluğu insan performansının altı puan yakınında göstermesi bunu destekler. Uzun, çok adımlı ve doğrulaması zor işler için kontrol noktası olmadan hayır. Yetenek gerçektir; güvenilirlik, görevi nasıl yapılandırdığınıza bağlıdır.
İnsanların ajanlarla yaptığı en yaygın hata nedir?
Fazla uzun bir görev kapsamı belirleyip sonuna kadar hiç kontrol etmemek. En çok zarar veren iki başarısızlık biçimini birleştirir: zaman ufkunu aşmak ve adım başına hataların gözlenmeden bileşiklenmesine izin vermek.
Daha iyi bir model kontrol noktası ihtiyacını ortadan kaldırır mı?
Eşiği kaydırır, ortadan kaldırmaz. Adım başına yüzde 95 güvenilirlikte bile yirmi zincirlenmiş adım yalnızca yaklaşık yüzde 36 oranında başarılı olur. Bileşiklenme aritmetiktir; iyileşme kaç adıma paranızın yeteceğini değiştirir, etkinin var olup olmadığını asla.
Ajan okuryazarı olmak için teknik beceri gerekir mi?
Hayır. Yedi kavramın altısı teknik değil, kapsam ve denetim muhakemesidir. Tek teknik parça, ajanın hangi araçlara ve erişime sahip olduğunu anlamaktır ve bu bir mühendislik değil, bir sorma meselesidir.
Ajanların neyi kaldırabildiğini ne sıklıkla yeniden test etmeliyim?
Ölçülen zaman ufkunun kabaca her yedi ayda bir ikiye katlandığı düşünülürse, birkaç tanıdık görevin üç ayda bir yeniden test edilmesi makul bir ritimdir. Ajan sınırlarına dair inançlar şu anda neredeyse her mesleki bilgiden daha hızlı bayatlıyor.
Kaynakça
- Stanford Institute for Human-Centered Artificial Intelligence, 2026 AI Index Raporu, teknik performans bölümü
- Model Evaluation and Threat Research, Measuring AI Ability to Complete Long Tasks, 2025
- Toby Ord, Is there a half-life for the success rates of AI agents?, 2025
- National Institute of Standards and Technology, AI Risk Management Framework, AI 100-1
- Ekonomik İşbirliği ve Kalkınma Örgütü, yapay zeka yetenek ölçümü ve işgücü etkisi üzerine çalışmalar
- Peter Drucker, The Effective Executive, Harper and Row
- Dünya Ekonomik Forumu, görev düzeyinde otomasyon ve insan gözetimi üzerine Future of Jobs araştırması
Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.














