Kısaca: Yapay zeka ve bilgi işi üzerine kontrollü kanıtlar, sıralanana kadar çelişkili görünüyor. Science dergisinde yayımlanan, 453 profesyonelle yapılan bir deney ortalama görev süresinin yüzde 40 düştüğünü buldu. Quarterly Journal of Economics’te yayımlanan, 5.172 müşteri destek temsilcisiyle yapılan bir çalışma saatte çözülen sorun sayısında yüzde 15 artış buldu; en deneyimli temsilciler hızda neredeyse hiçbir kazanç elde etmedi ve kalitede biraz kaybetti. Organization Science’ta yayımlanan, Boston Consulting Group’tan 758 danışmanla yapılan saha deneyi, sınır içindeki 18 görevde yüzde 12,2 daha fazla görev tamamlandığını ve yüzde 25,1 daha hızlı çalışıldığını, ancak bilinçli olarak sınırın dışına yerleştirilen tek bir görevde doğru cevap verme olasılığının yüzde 19 düştüğünü buldu. Yaklaşık beş yıldır bildikleri kod depolarında çalışan 16 deneyimli açık kaynak geliştiricisiyle 2025’te yapılan rastgele kontrollü bir deney, yapay zekanın onları yüzde 19 yavaşlattığını gösterdi; oysa kendileri yüzde 24 hızlanacaklarını öngörmüştü. Kullanıcının göreve özgü uzmanlığına göre sıralandığında bu beş sonuç temiz bir eğim oluşturuyor: tam o işteki mevcut ustalığınız ne kadar derinse, ölçülen etki o kadar küçük ve sonunda o kadar olumsuz. Dolayısıyla ölçeklenen bir gün, katmanlı bir gündür: yapay zeka uzmanlığın sığ olduğu katmanlarda yoğunlaşır, derin olduğu katmanlarda bilinçli olarak dizginlenir.
Yapay zekayla çalışmaya dair tavsiyelerin çoğu, aracın tek bir etki büyüklüğü varmış gibi yazılıyor. Benimse, hızlan. Kontrollü kanıtlar bunu desteklemiyor ve çalışmalar arasındaki uyuşmazlık gürültü değil. Bulgunun kendisi.
Dört araştırma grubu, farklı popülasyonlar, farklı görevler ve farklı tasarımlar kullanarak üretken yapay zeka ve profesyonel iş üzerine güvenilir deneyler yürüttü. Manşet rakamları yaklaşık altmış puanlık bir aralığa yayılıyor: harcanan sürede yüzde 40’lık bir azalmadan yüzde 19’luk bir artışa. Bu yayılımı açıklayamayan hiçbir çerçeve çerçeve değildir. Tercihtir.
Beş kontrollü sonuç aslında neyi ölçtü?
Aşağıdaki her rakam, adı geçen çalışmanın yayımlanmış özetinden alınmıştır. Buradaki hiçbir şey ikincil haberlerden çıkarılmış ya da yuvarlanmış değildir.
| Çalışma | Popülasyon ve tasarım | Ölçülen etki |
|---|---|---|
| Noy ve Zhang, Science, 2023 | Üniversite mezunu 453 profesyonel; ön kayıtlı çevrimiçi deney; mesleğe özgü, teşvikli orta düzey yazma görevleri; yarısı rastgele ChatGPT’ye maruz bırakıldı | Harcanan ortalama süre yüzde 40 azaldı; çıktı kalitesi yüzde 18 arttı; çalışanlar arasındaki eşitsizlik azaldı |
| Brynjolfsson, Li ve Raymond, Quarterly Journal of Economics, 2025 | 5.172 müşteri destek temsilcisi; üretken yapay zeka tabanlı bir konuşma asistanının kademeli devreye alınması | Saatte çözülen sorun sayısı ortalama yüzde 15 arttı; daha az deneyimli ve daha düşük becerili çalışanlar hem hızı hem kaliteyi iyileştirdi; en deneyimli ve en yüksek becerili çalışanlar hızda küçük kazançlar, kalitede küçük düşüşler yaşadı |
| Dell’Acqua ve arkadaşları, Organization Science | Boston Consulting Group’ta 758 bilgi çalışanı; ön kayıtlı; üç kol; yapay zeka yetenek sınırının içindeki 18 gerçekçi danışmanlık görevi | Yapay zeka kullananlar ortalama yüzde 12,2 daha fazla görev tamamladı ve bunları yüzde 25,1 daha hızlı bitirdi, kalite de anlamlı biçimde arttı |
| Dell’Acqua ve arkadaşları, aynı deney, sınır dışı görev | Yapay zeka yeteneğinin sınırının dışında kalacak şekilde seçilmiş tek bir karmaşık yönetsel görev | Yapay zeka kullananların doğru çözüm üretme olasılığı, kullanmayanlara göre yüzde 19 daha düşüktü |
| METR rastgele kontrollü deneyi, 2025 | Orta düzey yapay zeka deneyimine sahip 16 deneyimli açık kaynak geliştiricisi; ortalama beş yıllık geçmişe sahip oldukları olgun projelerde 246 görev | Yapay zekaya izin verilmesi tamamlanma süresini yüzde 19 artırdı; aynı geliştiriciler öncesinde yüzde 24’lük bir azalma öngörmüş, sonrasında yüzde 20’lik bir azalma tahmin etmişlerdi |
Bu tablodaki iki ayrıntı iki kez okunmayı hak ediyor.
Birincisi son satırdaki tahmin hatası. Geliştiriciler acemi değildi. Araçları kullanmışlardı, yakından bildikleri kodda çalışıyorlardı ve etkiyi hem öncesinde tahmin etmeleri hem sonrasında değerlendirmeleri istendi. Her iki seferde de aynı yönde, ölçülen sonuca göre yaklaşık kırk puan yanıldılar. Aynı deneyi tahmin etmesi istenen iktisatçılar yüzde 39’luk, makine öğrenmesi araştırmacıları yüzde 38’lik bir azalma bekliyordu. Yapay zekanın yardım ettiği sezgisi, ettiğine dair güvenilir bir kanıt değil ve tam olarak insanların en emin hissettiği yerde en az güvenilir.
İkincisi Brynjolfsson satırındaki iç ayrışma. Aynı araç, aynı işte, aynı firmada, en az deneyimli temsilcilere hem hızda hem kalitede yardım ederken en deneyimlilere küçük hız kazancı ve küçük kalite kaybı üretti. Yüzde 15’lik ortalama gerçek bir sayı ama neredeyse hiç kimseyi tarif etmiyor.
Kimsenin adını koymadığı eğim
Beş sonucu tek bir sıraya koyun: kullanıcının ölçülen tam işte hâlihazırda sahip olduğu göreve özgü uzmanlık. Genel kıdem değil, meslekteki yıl sayısı değil, o belirli görevdeki derinlik.
Tablo: Kullanıcının göreve özgü uzmanlığına göre sıralanmış ölçülen yapay zeka etkisi (CEOtudent editöryel çerçevesi, yukarıda anılan beş çalışmadan türetilmiştir)
| Sıra | İşi kim yapıyordu | Tam o işteki derinlik | Ölçülen yön |
|---|---|---|---|
| 1 | Ana zanaatları olmayan, ara sıra ürettikleri orta düzey belgeleri yazan profesyoneller | Sığ | Süre yüzde 40 düştü, kalite yüzde 18 arttı |
| 2 | En az deneyimli ve en düşük temel beceriye sahip destek temsilcileri | Sığ | Hız ve kalite birlikte iyileşti |
| 3 | 18 standart analitik ve yaratıcı görevdeki danışmanlar | Orta | Süre yüzde 25,1 düştü, iş hacmi yüzde 12,2 arttı |
| 4 | En deneyimli ve en yüksek temel beceriye sahip destek temsilcileri | Derin | Küçük hız kazancı, küçük kalite kaybı |
| 5 | Modelin yetkinliği dışındaki bir yönetsel görevdeki danışmanlar | Derin ve görev sınır dışı | Doğru olma olasılığı yüzde 19 daha düşük |
| 6 | Yaklaşık beş yıldır çalıştıkları kod depolarındaki geliştiriciler | Çok derin | Süre yüzde 19 arttı |
Yön tek yönlü. Göreve özgü derinlik arttıkça ölçülen etki düşüyor, dördüncü sıra civarında kabaca sıfırdan geçiyor ve negatife dönüyor. Bu sıralama CEOtudent’a ait; altındaki sonuçlar araştırmacılara.
Bunun neyi kanıtlayıp neyi kanıtlamadığı konusunda kesin olmak gerekir. Bunlar farklı popülasyonlara, görevlere ve sonuç ölçütlerine sahip beş ayrı deney; dolayısıyla sıralama, tek bir tahmin edilmiş eğri değil yorumlayıcı bir sentez. Henüz hiçbir çalışma, diğer her şeyi sabit tutarak göreve özgü uzmanlığı deneysel olarak değiştirmedi. Söylenebilecek olan şu: sıralama beşinde de tutarlı, hiçbir sonuç onu ihlal etmiyor ve her araştırma ekibi kendi verisinin içinde aynı yönde işleyen bir beceri ya da uzmanlık ayrışması bildirdi.
Mekanizma gizemli değil. Yapay zeka desteği, aksi halde sıfırdan kurmanız gereken kısmın yerine geçiyor. Bir görev için elinizde az yapı varken bu ikame muazzam. Zaten derin bir yapınız varsa modelin çıktısı, okumanız, değerlendirmeniz, bildiklerinizle karşılaştırmanız ve genellikle onarmanız gereken bir şey olarak geliyor. Değerlendirme bedava değil. Belli bir uzmanlık derinliğinden sonra kontrol etmenin maliyeti, yapmanın maliyetini aşıyor. Yapay zeka çıktısını değerlendirmenin başlı başına bir beceri olmasının nedeni de bu; araçları kullanmanın yan ürünü değil.
Beş katman
Kazanç derinliğe göre değişiyorsa, tasarımın birimi araç da gün de değildir. Katmandır. Bir bilgi çalışanının günü, uzmanlık profilleri yapısal olarak farklı beş tür işe ayrılır ve her biri farklı bir daimî politika hak eder.
Tablo: 5 Katmanlı Yapay Zeka İş Akışı (CEOtudent editöryel çerçevesi)
| Katman | Burada ne olur | Daimî yapay zeka politikası | Kanıt açısından neden |
|---|---|---|---|
| 1. Alım | Okuma, arama, toplantılar, gelen mesajlar, ham malzeme toplama | Azami devretme. Özetle, getir, kümele, ayıkla | Derinlik tanımı gereği sığ; henüz bir görüş oluşturmadınız. Burası 1. ve 2. sıra bölgesi |
| 2. Taslak | İlk versiyonları üretmek: belgeler, planlar, kod iskeletleri, yanıtlar, ana hatlar | Yüksek devretme, her zaman ilk taslak olarak, asla nihai olarak değil | Noy ve Zhang ile sınır içi danışmanlık sonuçları burada yaşıyor. Büyük, güvenilir, iyi tekrarlanmış kazançlar |
| 3. Muhakeme | Seçenekler arasında seçim, yön belirleme, ödünleşimleri kabul etme, neyi yapmayacağına karar verme | Kararın sahibi insandır. Yapay zekayı karşıt olarak kullanın: seçiminizin aleyhine savunma yapmasını isteyin | Sınır dışı sonuç, analiz görevi gibi görünen bir muhakeme başarısızlığıydı. Model, çizgiyi geçtiğine dair hiçbir sinyal vermedi |
| 4. Zanaat | Gerçekten uzman olduğunuz, itibarınızın fiilen yaşadığı dar iş | Dizginli. Yalnızca mekanik alt adımları devredin; asıl işi varsayılan olarak elle yapın | METR sonucu. Ölçülen etkinin negatif olduğu tek katman bu ve kullanıcılar bunu hissedemedi |
| 5. Doğrulama | Kontrol etmek, karşılaştırmak, önceki katmanların yanlış yaptığını yakalamak | Çıktıyı üreten sisteme devredilemez. Buna gerçek zaman ayırın | 1. ve 2. katmandaki her kazanç, 5. katmana akan hacmi artırır. Atlamak, sınırın sizi yemesinin yoludur |
Katmanlar bir program değil. Bir politika kümesi. Herhangi bir saat birkaçını birden içerebilir; asıl mesele, ekranınızdaki araç değişmese bile doğru yapay zeka duruşunun katmanlar arasında değişmesidir.
Yeniden dağıtım kuralı
Benimsemenin çoğu burada yanlış gidiyor ve bu bir disiplin hatasından çok yapısal bir hata.
- ve 2. katmanlar yapay zeka altında çarpıcı biçimde sıkışır. Vaadin tamamı bu ve kanıtlar bunu destekliyor. Ama 5. katman sıkışmaz. Genişler; çünkü artık kontrol edilecek daha fazla çıktı vardır, daha hızlı üretilmiştir ve üreten sistemin hata biçimleri başarılarından görsel olarak ayırt edilemez. Organization Science bulgusu tam olarak budur: sınırın dışında kalan görev, içerideki on sekiz görevden daha zor görünmüyordu ve model karşıya geçtiğine dair hiçbir işaret vermedi.
Kural basit ve neredeyse kimse uygulamıyor. Alım ve taslakta kazanılan süre bedava değildir. Bunun belirli bir payı kalıcı olarak doğrulamaya aittir.
Pratik bir başlangıç bölüşümü: yeni bir yapay zeka destekli iş akışının ilk çeyreğinde, ölçülen zaman tasarrufunun kabaca üçte birini 5. katmana geri verin, sonra doğrulamanın fiilen kaç hata yakaladığına göre ayarlayın. Doğrulama haftalarca hiçbir şey yakalamıyorsa bütçe fazladır ve iş muhtemelen yapay zekanın zaten güvenli olduğu katmanlara kaymıştır. Doğrulama yayımlayacağınız şeyleri yakalıyorsa bütçe azdır. Bu dağıtım, ölçülmüş bir en iyi değil çalışan bir kuraldır ve kendi hata kaydınıza göre ayarlanacak bir başlangıç hipotezi olarak ele alınmalıdır.
Kuralın ikinci yarısı 4. katmanla ilgili. Zanaat katmanınızı gelişigüzel yapay zeka kullanımından korumak nostalji değil, verimlilik tercihi de değil. Bir ölçüm sorunu. METR geliştiricileri yavaşlatılırken hızlandıklarını deneyimlediler ve iş bittikten sonra bile tahminleri yanlıştı. Kendi uzman işinizde etkiyi algılayamıyorsanız onu hisle yönetemezsiniz ve ölçene kadar tek doğru varsayılan dizginlemedir. Zamanın nereye gittiğine dair sezginize güvenmek yerine yapılandırılmış bir iş akışı denetimi yürütmenin dürüst gerekçesi de budur.
Bir hafta boyunca uygulamak
Çerçeve ancak bir takvimi değiştirirse işe yarar. Asgari bir uygulama bir hafta sürer ve görüş değil kanıt üretir.
Birinci ve ikinci gün: etiketleyin, değiştirmeyin. Mevcut gününüzü gözden geçirin ve her bloğu beş katmandan biriyle işaretleyin. Çoğu kişi iki şey keşfeder. 3. katmanın neredeyse hiç ayrılmış zamanı yoktur ve diğer işlerin aralarında olup biter. 5. katmanın hiç zamanı yoktur; çünkü doğrulama şu anda planlanmaz, varsayılır.
Üçüncü gün: daimî politikaları belirleyin. Her katman için yapay zekanın orada ne yapmasına izin verildiğini söyleyen tek satır yazın. Değer yazmakta; çünkü yazılmamış bir politika, aracın en kolay kıldığı şeye dönüşür ve aracın en kolay kıldığı şey onu her yerde kullanmaktır.
Dördüncü ve beşinci gün: politikaları uygulayın ve her düzeltmeyi kaydedin. Doğrulama bir şey yakaladığında hangi katmanın ürettiğini not edin. Bu kayıt sahip olduğunuz tek güvenilir ölçüm aracıdır ve bilinçli devretme sınırları sezgi üzerine değil bunun üzerine kurulmalıdır.
Hafta sonu: yeniden dağıtın. Zamanın nerede kazanıldığını hataların nerede bulunduğuyla karşılaştırın. Takvim zamanını buna göre kaydırın. Sonra aylık olarak tekrarlayın; çünkü sınır hareket eder ve politikalarınızın tarihi olmalıdır.
Bu, önce hangi görevlerin otomatikleştirileceğini denetlemekle aynı temel yöntemdir ve ajanlara devretmek için yapılandırılmış bir brifing çerçevesinin yanına doğal olarak oturur. Katman modelinin eklediği fark, tüm gününüzü tek bir devretme kararı gibi ele almayı bırakmasıdır.
Bu neden aynı anda hem bir CEO hem bir öğrenci sorunu?
İşin CEO yarısı tahsistir. Farklı ölçülen getirileri olan beş katman verildiğinde yönetsel soru kapasitenin nereye gideceğidir ve cevap “aracın işe yaradığı her yere” değildir. Cevap şudur: derinliğin sığ olduğu yerde azami devretme, derin olduğu yerde dizginleme ve otomatikleştirdiğiniz her şeyle birlikte büyüyen kontrol işlevi için kalıcı bir daimî bütçe.
Öğrenci yarısı daha zordur; çünkü en iyi bildiğiniz alanda kendi performansınıza dair algınızın sahip olduğunuz en güvenilmez araç olduğunu kabul etmeyi gerektirir. METR deneyindeki geliştiriciler uzmandı, ölçülüyorlardı ve yine de yüzde 19’luk bir yavaşlamayı hissedemediler. Buna karşı tek savunma inanmaya devam etmek değil ölçmeye devam etmektir.
Ölçeklenen bir gün, içinde daha fazla yapay zeka olan bir gün değildir. Yapay zekanın katmana göre yerleştirildiği, tasarrufların bilinçli olarak yeniden dağıtıldığı ve uzman işin heves değil kanıt aksini söyleyene kadar savunulduğu bir gündür.
Sık sorulan sorular
Bu, uzmanların yapay zekayı hiç kullanmaması gerektiği anlamına mı geliyor?
Hayır. Dar ustalık alanlarında varsayılan olarak kullanmamaları, diğer dört katmanda ise yoğun kullanmaya devam etmeleri gerektiği anlamına geliyor. Bir uzmanın alım ve taslak katmanları uzmanlık katmanı değildir. Bir şartnameyi özetleyen kıdemli bir geliştirici, eğimde altıncı sırada değil birinci sıradadır.
İşimin hangi kısmının 4. katman olduğunu nasıl bilirim?
Pratik test: İnsanların özellikle size geldiği iş ve ince bir hatanın alanı bilen birine görüneceği iş. Yanlış bir cevabı yetkin herhangi bir okur yakalayacaksa muhtemelen 2. katmandır. Yalnızca bir meslektaş yakalayacaksa 4. katmandır.
Yüzde 19’luk yavaşlama sonucu genellenebilir mi?
16 geliştirici ve 246 görevle yapılmış tek bir deney; dolayısıyla yerleşmiş bir parametre değil güçlü bir sinyal olarak okunmalı. Yazarlar, yavaşlamaya önsel olarak katkıda bulunabilecek 20 farklı özelliğe dair kanıt topladı ve etkinin analizleri boyunca sağlam kaldığını, ancak deneysel yapıntıların tamamen dışlanamayacağını bildirdi. Asıl değeri, tablodaki tek girdi olması: dikkatli ölçümün, katılımcıların kendi tahminleri dahil bütün öngörüleri yalanladığı tek satır.
Doğrulama neden taslağın parçası değil de ayrı bir katman?
Çünkü farklı bir sahibi ve farklı bir başarısızlık biçimi var. Taslak görünür biçimde, hiçbir şey üretmeyerek başarısız olur. Doğrulama görünmez biçimde, güven üreterek başarısız olur. Görünmez başarısızlık biçimi olan katmanların kendi takvim zamanı olmalıdır; yoksa daha gürültülü olan ne varsa onun içinde erirler.
Kurumum yalnızca çıktı hacmini ölçüyorsa?
O zaman eğim, ilk iki çeyrekte ödüllendirileceğinizi ve üçüncüde açığa çıkacağınızı öngörür; çünkü 1. ve 2. katmanlar hacmi hemen artırırken 5. katman başarısızlıkları sonradan yüzeye çıkar. Savunulabilir tutum kendi hata kaydınızı tutmaktır; böylece kalite soruları geldiğinde çaba tartışması yerine hataların nereden kaynaklandığına dair kanıtınız olur.
Kaynakça
Noy, S. ve Zhang, W. Experimental evidence on the productivity effects of generative artificial intelligence. Science, 2023.
Brynjolfsson, E., Li, D. ve Raymond, L. Generative AI at Work. The Quarterly Journal of Economics, 2025.
Dell’Acqua, F. ve arkadaşları. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science.
METR. Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. Rastgele kontrollü deney raporu, 2025.
Harvard Business School Digital Data Design Institute ve Division of Research and Faculty Development, Boston Consulting Group saha deneyinin bildirilen destekçileri.
Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.















