Gelişimİş
0

Bağlam Pencereleri ve Bilişsel Yük: Gerçekten Nasıl Düşündüğünüze Uyan Promptlar Nasıl Tasarlanır?

Özet. Bağlam penceresi, bir yapay zeka modelinin tek bir istekte ona verdiğiniz her şeyi tuttuğu alandır ve 2026’da devasa boyutlara ulaştı. Anthropic, OpenAI ve Google’ın amiral gemisi modellerinin hepsi yaklaşık bir milyon tokenlik bağlam sunuyor; Google’ın kendi dönüşüm oranıyla (100 token yaklaşık 60-80 İngilizce kelime) bu kabaca 600.000 ila 800.000 kelime eder. Her şeyi yapıştırıp ayıklamayı modele bırakmak cazip gelir. Araştırmalar bunun bir hata olduğunu söylüyor. RULER kıyaslamasında 17 modelin tamamı 32K veya daha fazla token iddia ediyordu, ancak yalnızca yarısı 32K’da tatmin edici performansı koruyabildi (Hsieh ve arkadaşları, 2024). Birebir anahtar kelime eşleşmelerini ortadan kaldıran NoLiMa testinde 13 modelden 11’i 32K’da kısa bağlam puanlarının yarısının altına düştü; GPT-4o yüzde 99,3’ten yüzde 69,7’ye geriledi (Modarressi ve arkadaşları, 2025). Anthropic’in kendi dokümantasyonu artık bağlam penceresini modelin “çalışma belleği” olarak tanımlıyor ve token sayısı arttıkça doğruluk ile hatırlamanın bozulduğu konusunda uyarıyor. İnsanlar da daha küçük ölçekte aynı kısıtla yaşar: çalışma belleği yaklaşık dört yığın yeni bilgi tutar (Cowan, 2001) ve bilişsel yük kuramı 1988’den beri bilginin nasıl sunulduğunun ne kadar olduğu kadar önemli olduğunu gösteriyor (Sweller, van Merrienboer ve Paas, 2019). CEO hamlesi, bağlamı token başına maliyeti olan bir bütçe gibi yönetmektir. Öğrenci hamlesi ise aşağıdaki Yüke Uygun Prompt yöntemiyle kendi kendinize kontrol edebileceğiniz promptlar yazmaktır.

Bu yazı Prompt ve Bağlam Ustalığı serisinin bir parçası. Yapay zeka araçları için işinizi anlatan kalıcı bir tanım henüz yazmadıysanız, bağlam dosyası ve özel talimatları, projeleri ve belleği yapılandırma yazılarıyla başlayın. Bu yazı ise tek bir isteği konu alıyor: içine ne konacağı, hangi sırayla ve ne kadar.

Bağlam penceresi, en sade haliyle nedir?

Bağlam penceresi, bir modelin tek bir istekte okuyup yazabileceği, token cinsinden ölçülen azami metin miktarıdır. Her şey bu sınırdan düşer: talimatlarınız, yapıştırdığınız belgeler, o ana kadarki konuşma ve modelin yanıtı. Tokenler kelime değildir. Google’ın dokümantasyonu çoğu kişinin ihtiyaç duyduğu dönüşümü veriyor: Gemini modellerinde “bir token yaklaşık 4 karaktere eşittir” ve “100 token yaklaşık 60-80 İngilizce kelimeye eşittir”. Diğer sağlayıcıların tokenizer’ları biraz farklıdır, bu yüzden her dönüşümü bir tahmin olarak ele alın.

Anthropic’in dokümantasyonu pencereyi insani terimlerle anlatıyor. Bağlam penceresinin “model için bir ‘çalışma belleğini’ temsil ettiğini”, “daha fazla bağlamın otomatik olarak daha iyi olmadığını” ve “token sayısı arttıkça doğruluk ve hatırlamanın bozulduğunu, bunun bağlam çürümesi olarak bilinen bir olgu olduğunu” söylüyor. Bu bir deney değil, sağlayıcının kendi çerçevesi; ama doğru başlangıç noktası: bağlam penceresi bir sabit disk değildir. Daha çok bir çalışma masasına benzer ve dağınık bir masa herkesi yavaşlatır.

2026’da bağlam pencereleri ne kadar büyük?

Aşağıdaki tablo, güncel amiral gemisi modellerin belgelenmiş sınırlarını, her sağlayıcının model sayfalarından 7 Ekim 2026’da okunduğu haliyle listeliyor. Bu rakamlar sık değişir; bunlara dayanmadan önce sağlayıcı sayfasını kontrol edin.

Sağlayıcı Model Bağlam penceresi İstek başına azami çıktı Kaynak
Anthropic Claude Fable 5.1, Opus 5.5, Sonnet 5.5 1M token 128K token Anthropic model genel bakışı
Anthropic Claude Haiku 4.5 200K token 64K token Anthropic model genel bakışı
OpenAI GPT-6 Astra, GPT-6.1 Sol, GPT-6 Luna 1,05M token 128K token OpenAI modeller sayfası
Google Gemini 3.1 Pro Preview 1.048.576 token 65.536 token Gemini API model sayfası
Google Gemini 3.8 Flash 1.048.576 token 65.536 token Gemini API model sayfası

Google ölçek hakkında bir fikir veriyor: pratikte bir milyon tokenin “50.000 satır kod”, “ortalama uzunlukta 8 İngilizce roman” ya da “ortalama uzunlukta 200’den fazla podcast bölümünün transkripti” gibi görüneceğini söylüyor. Google’ın kendi oranı uygulandığında 1.048.576 tokenlik bir pencere kabaca 629.000 ila 839.000 İngilizce kelimeye karşılık gelir (CEOtudent hesaplaması: 1.048.576 token x token başına 0,60 ila 0,80 kelime).

Manşetteki rakam tek bir soruyu yanıtlar: ne kadar gönderebilirsiniz? İşiniz için asıl önemli olan soruyu yanıtlamaz: model bunun ne kadarını gerçekten iyi kullanacak?

Daha büyük pencere, modelin hepsini kullandığı anlamına mı gelir?

Hayır; uzun bağlam araştırmalarındaki en tutarlı bulgu da budur.

Konum önemlidir. “Lost in the Middle” çalışmasında Liu ve arkadaşları (2024), “ilgili bilgi girdi bağlamının en başında (öncelik yanlılığı) veya sonunda (sonralık yanlılığı) yer aldığında performansın en yüksek olduğunu, modeller ortadaki bilgiye erişip onu kullanmak zorunda kaldığında ise performansın belirgin biçimde düştüğünü” buldu. Çok belgeli soru yanıtlama testlerinde GPT-3.5-Turbo’nun performansı “yüzde 20’den fazla düşebiliyordu” ve en kötü durumda hiç belge verilmediğindeki performansının (yüzde 56,1) bile altına iniyordu. Bunlar 2023 dönemi modellerdi, dolayısıyla büyüklükler 2026 modellerine doğrudan aktarılamaz. Ancak sorunun biçimi, yani zayıf orta bölüm, ortaya çıkmaya devam etti.

İddia edilen uzunluk, etkin uzunluk değildir. RULER (Hsieh ve arkadaşları, 2024) 17 uzun bağlam modelini 13 görevde test etti. Neredeyse hepsi basit “samanlıkta iğne” testinde neredeyse kusursuz puan aldı, ama “yalnızca yarısı 32K uzunlukta tatmin edici performansı koruyabildi”. NoLiMa (Modarressi ve arkadaşları, 2025) soru ile yanıt arasındaki birebir kelime örtüşmesini kaldırarak testi zorlaştırdı; bu, gerçek soruların işleyişine daha yakın. En az 128K token iddia eden 13 modelden “11’i, kısa uzunluktaki güçlü taban puanlarının yüzde 50’sinin altına düştü” ve bu 32K’da gerçekleşti.

İlgisiz bağlam, yanıt orada olsa bile doğruluğa mal olur. Bir geri getirme veritabanı şirketinin hakem değerlendirmesinden geçmemiş sektör raporu olan Chroma’nın “Context Rot” raporu (2025), 18 modeli değerlendirdi. Bir deneyde yaklaşık 300 tokenlik odaklı promptları, aynı sohbet görevinin ilgisiz materyal de içeren 113k tokenlik tam versiyonuyla karşılaştırdı ve “tam girdide tutarlı bir performans düşüşü” gözlemledi.

Sağlayıcılar kendi rehberlerinde aynı şeyi söylüyor. OpenAI’ın GPT-4.1 rehberi 1M tokene kadar çok iyi samanlıkta iğne performansı bildiriyor, ancak “geri getirilmesi gereken öğe sayısı arttıkça ya da bağlamın tamamının durumuna dair bilgi gerektiren karmaşık akıl yürütmeler yapıldıkça uzun bağlam performansının düşebileceğini” ekliyor. Google’ın uzun bağlam dokümantasyonu da birden fazla “iğne” olduğunda modelin “aynı doğrulukla performans göstermediğini” belirtiyor.

İddia edilen ve etkin bağlam: kıyaslamalar ne buldu?

İki kıyaslama “etkin uzunluğu” farklı tanımlıyor. RULER, bir modelin sabit bir eşiği (yüzde 85,6; Llama2-7B’nin 4K’daki puanı) hala geçtiği en uzun uzunluğu esas alıyor. NoLiMa ise bir modelin kendi kısa bağlam puanının en az yüzde 85’ini koruduğu en uzun uzunluğu kullanıyor. Oran sütunu bir CEOtudent hesaplamasıdır (etkin bölü iddia edilen; K = 1.000 kabul edilerek).

Model (kıyaslama yılı) İddia edilen bağlam Etkin bağlam Etkinin iddia edilene oranı Kıyaslama
GPT-4 (2024) 128K 64K %50 RULER
GPT-4o (2025) 128K 8K %6,3 NoLiMa
Claude 3.5 Sonnet (2025) 200K 4K %2 NoLiMa
Gemini 1.5 Pro (2025) 2M 2K %0,1 NoLiMa

CEOtudent editöryel çerçevesinin RULER Tablo 3 ve NoLiMa sonuç tablosundan yaptığı özgün sentez. Bunlar kasıtlı olarak zorlaştırılmış geri getirme görevlerinde test edilmiş eski modellerdir; güncel modeller muhtemelen daha iyidir ve bu yazı hazırlanırken yukarıdaki 2026 modellerine ait bağımsız bir kıyaslama mevcut değildi. Önemli olan tam rakam değil, aradaki farktır.

Bilgi çalışanı için ders basit: bağlam penceresi bir tavandır, garanti değil. Yanıtınız yapıştırılmış bir belgenin 140. sayfasına gömülü bir bilgiye bağlıysa, model onu kaçırabilir ve siz de bunu fark etmeyebilirsiniz.

Bilişsel bilim insan çalışma belleği hakkında ne söylüyor?

Sorunun insan tarafı daha eski ve daha iyi incelenmiş.

Kapasite küçüktür. George Miller 1956 tarihli makalesinde “bu kapasitenin yaklaşık yedi öğe uzunluğunda olduğunu” gözlemledi, ama kapasitenin ham bitlerle değil yığınlarla ölçüldüğünü de vurguladı: “içerdiği bilgi bitlerinin sayısını, yalnızca giderek daha büyük yığınlar oluşturarak artırabiliriz”. Nelson Cowan 2001 tarihli derlemesinde Miller’ın yedisinin “gerçek bir kapasite sınırından çok kaba bir tahmin ve retorik bir araç” olduğunu savundu ve “ortalama yaklaşık dört yığın olan tek, merkezi bir kapasite sınırı” önerdi.

Yük üç türlüdür. John Sweller’ın 1988’de problem çözme üzerine yaptığı çalışmayla başlayan bilişsel yük kuramı, üç yük kaynağını birbirinden ayırır. Sweller, van Merrienboer ve Paas’ın 2019 tarihli derlemesi bunları şöyle özetliyor:
– İçsel yük, görevin gerçek karmaşıklığıdır. “Yalnızca öğrenilmesi gerekenin ya da öğrenenin uzmanlığının değiştirilmesiyle değiştirilebilir.”
– Dışsal yük, kötü sunumun maliyetidir. “Bilginin içsel karmaşıklığıyla değil, bilginin nasıl sunulduğu ve öğrenenden ne yapmasının istendiğiyle belirlenir.”
– Etkili yük başlangıçta “öğrenmek için gereken” yük olarak tanımlanmıştı. 2019 derlemesi onu ayrı bir yük yerine içsel göreve ayrılan çalışma belleği olarak yeniden çerçeveliyor.

Tanıdık materyal ucuzdur. Aynı derleme, çalışma belleğinin “yeni bilgiyle uğraşırken kapasite ve süre açısından sınırlı olduğunu, ancak uzun süreli bellekten aktarılan bilgiyle uğraşırken bu sınırlamaların fiilen ortadan kalktığını” belirtiyor. Uzmanlar kendi alanlarındaki uzun ve yoğun girdileri kaldırabilir, çünkü onları birkaç büyük yığın olarak okurlar.

Bölünmüş ve gereksiz bilgi zarar verir. Chandler ve Sweller (1991) altı deneyde “bölünmüş kaynaklı bilginin ağır bir bilişsel yük yaratabileceğini, çünkü öğrenme başlamadan önce materyalin zihinsel olarak birleştirilmesi gerektiğini” ve “faydalı görünen ama temel olmayan açıklayıcı materyalin” birleştirilmiş olsa bile “zararlı etkileri” olabileceğini buldu.

Acemiye yardım eden, uzmana zarar verebilir. Kalyuga ve arkadaşları (2003) uzmanlığın tersine çevirme etkisini adlandırdı: “deneyimsiz öğrenenlerde son derece etkili olan” tekniklerin “daha deneyimli öğrenenlerde kullanıldığında etkinliğini yitirebileceğini, hatta olumsuz sonuçlar doğurabileceğini” gösterdi.

Model ile insan nerede buluşuyor?

İki literatür birbirinden ayrı gelişti, ama aynı tasarım sorununu tarif ediyorlar: sınırlı dikkati olan bir okur, erişilebilir bol metin ve doğru parçaları bulup birleştirmeye bağlı bir görev. Anthropic’in mühendislik ekibi bu karşılaştırmayı Eylül 2025’te açıkça yaptı: “Sınırlı çalışma belleği kapasitesine sahip insanlar gibi, LLM’lerin de bir ‘dikkat bütçesi’ vardır” ve “eklenen her yeni token bu bütçeyi bir miktar tüketir”. IFScale kıyaslamasının yazarları da talimat sayısı arttıkça “bilişsel yük altında zorlanmaya başlayan” modelleri anlatırken aynı dili kullanıyor. Bunlar benzetmedir; modellerin ve beyinlerin aynı şekilde çalıştığının kanıtı değildir. Yararlı olmalarının nedeni, iki taraftan gelen tasarım tavsiyelerinin aynı noktada buluşmasıdır.

Tasarım sorunu İnsan kanıtı Model kanıtı Promptunuz için anlamı
Aynı anda çok fazla şey Yaklaşık dört yığın yeni bilgi (Cowan, 2001) 17 modelin yarısı 32K’da geriliyor (RULER) Soruyu yanıtlayan en küçük materyal setini gönderin
Konum etkileri Burada incelenen kaynaklarda ele alınmıyor En iyi başta veya sonda, ortası zayıf (Liu ve arkadaşları, 2024) Materyali başa, soruyu sona koyun ya da kilit talimatları tekrarlayın
İlgisiz materyal Temel olmayan açıklama zarar verebilir (Chandler ve Sweller, 1991) 113k tokenlik tam girdi, 300 tokenlik odaklı versiyonun gerisinde kalıyor (Chroma, 2025) Kendinizin atlayacağı şeyleri çıkarın
Çelişen talimatlar Bölünmüş kaynaklar iş başlamadan önce birleştirilmeli GPT-5 “çelişkileri uzlaştırmanın bir yolunu aramak için akıl yürütme tokenleri harcıyor” (OpenAI) Göndermeden önce çelişkileri giderin
Çok fazla kural Yeni kurallarda çalışma belleği sınırları 20 modelin en iyileri 500 talimatta %68 doğruluğa ulaşıyor (IFScale) Kalıcı kuralları az ve net tutun
Uzmanlık Tanıdık materyalin maliyeti düşük (Sweller ve arkadaşları, 2019) Anthropic: “XML etiketleri Claude’un karmaşık promptları belirsizlik olmadan ayrıştırmasına yardımcı olur” Girdileri birkaç büyük yığın olarak okunacak şekilde yapılandırın

Karşılaştırma tablosu: CEOtudent editöryel çerçevesi; her hücrede atıf yapılan kaynaklardan derlenmiştir.

Yüke Uygun Prompt: beş adımlı bir yöntem

Aşağıdaki yöntem bir CEOtudent editöryel çerçevesidir. Test edilmiş bir protokol değildir; yukarıdaki kanıtları ciddi her prompta uygulanabilecek adımlara dönüştürür. Temel varsayımı, bir promptun aynı anda iki çalışma belleğine uyması gerektiğidir: bağlamı iyi kullanması için modelinkine ve yanıtı kontrol edebilmeniz için sizinkine.

Adım 1. İçsel yükü tek cümleyle adlandırın. Herhangi bir şey eklemeden önce görevin gerçekte ne olduğunu yazın. “Bu sözleşmenin 7. maddesinin veri politikamızla çelişip çelişmediğine karar ver” bir görevdir. “Şu sözleşmeye bir bak” değildir. Bu cümleyi yazamıyorsanız sorun modelde değildir.

Adım 2. Dışsal yükü kesin. Yapıştırmak üzere olduğunuz her belgeyi ve talimatı gözden geçirip şunu sorun: bu görevi kendim yapsaydım buna ihtiyacım olur muydu? Gerisini çıkarın. Anthropic’in mühendisleri hedefi “istenen sonucun olasılığını en üst düzeye çıkaran, olabilecek en küçük yüksek sinyalli token seti” olarak tanımlıyor. Pratikte bu, dosyaların tamamı yerine alıntılar, üç taslak yerine bir belgenin tek versiyonu ve bir meslektaşınız size verseydi atlayacağınız hiçbir arka plan bilgisinin olmaması demektir.

Adım 3. Kalanları yığınlara ayırın. Her materyal bloğunu kısa bir başlık ya da etiketle işaretleyin; böylece bir uzmanın tanıdık materyali okuduğu gibi tek bir yığın olarak okunsun. Kalıcı kuralları kısa bir listede tutun. Dört yığın sezgisi, yani istek başına en fazla yaklaşık dört ayrı talep, Cowan’ın insanlar için yaptığı tahminden türetilmiş editöryel bir pratik kuraldır; ölçülmüş bir model sınırı değildir.

Adım 4. Konuma göre yerleştirin. Uzun girdiler için Anthropic “uzun belgelerinizi ve girdilerinizi promptunuzun en üstüne, sorgunuzun üzerine” koymanızı öneriyor ve “sona konan sorguların testlerde yanıt kalitesini yüzde 30’a kadar artırabildiğini” söylüyor. Google da aynı tavsiyeyi veriyor. OpenAI’ın GPT-4.1 rehberi, talimatları “verilen bağlamın hem başına hem sonuna” koymanın en iyi sonucu verdiğini buldu. Üçünü birden karşılayan güvenli bir varsayılan: en üstte tek satırlık bir görev ifadesi, ortada materyal, sonda ise sorunun tamamı ve çıktı formatı.

Adım 5. Yanıtı kontrol edilebilir kılın. Modelden, yanıt vermeden önce dayandığı pasajları alıntılamasını isteyin. Anthropic uzun belgeler için tam olarak bunu öneriyor: “Claude’dan önce belgelerin ilgili bölümlerini alıntılamasını isteyin”. Alıntılar, gözden geçiren kişi olarak sizin için uzun bir bağlamı kısa bir bağlama dönüştürür ve modelin zayıf orta bölüme uzanıp yanlış bir şeyle döndüğü anları açığa çıkarır.

Prompt Yük Haritası

Yük türü Bir promptta şöyle görünür Fazla yüksek olduğunun işareti Çözüm
İçsel Görevin gerçek zorluğu Görevi tek cümleyle ifade edemiyorsunuz Görevi ardışık promptlara bölün
Dışsal Yapıştırılmış dosyalar, eski taslaklar, çelişen kurallar, uzun sohbet geçmişi Yanıt yanlış bölüme atıf yapıyor ya da kilit bir bilgiyi görmezden geliyor Alıntılara indirin; bir özetle yeni bir sohbet başlatın
Etkili (yeniden yönlendirilmiş) Etiketler, örnekler, belirtilmiş bir çıktı formatı Yanıtı yorumlamaya, okumaktan daha fazla zaman harcıyorsunuz Yapı ekleyin: başlıklar, bir şablon, bir çözümlü örnek

CEOtudent editöryel çerçevesi; Sweller, van Merrienboer ve Paas’ın (2019) üç yük kategorisinden uyarlanmıştır.

Bu, kendi düşünmeniz için neden önemli?

Her promptta ikinci bir çalışma belleği daha vardır: sizinki. Uzun promptlar ve uzun yanıtlar çabayı düşünmekten gözden geçirmeye kaydırır ve kanıtlar insanların buna her zaman ayak uyduramadığını gösteriyor.

  • Lee ve arkadaşları (CHI 2025), 936 örnek paylaşan 319 bilgi çalışanıyla yaptıkları ankette “üretken yapay zekaya duyulan güvenin yüksek olmasının daha az eleştirel düşünmeyle, kişinin kendine güveninin yüksek olmasının ise daha fazla eleştirel düşünmeyle ilişkili olduğunu” buldu. Eleştirel düşünmenin niteliği “bilgi doğrulama, yanıt entegrasyonu ve görev yönetimine doğru” kaydı. Bu bulgu öz bildirime dayalı ve korelasyoneldir.
  • Gerlich (2025) 666 katılımcıyla anket ve görüşmeler yaptı ve “sık yapay zeka aracı kullanımı ile eleştirel düşünme becerileri arasında, artan bilişsel yük boşaltmanın aracılık ettiği anlamlı bir negatif korelasyon” bildirdi. Bu da korelasyoneldir.
  • Henüz hakem değerlendirmesinden geçmemiş bir MIT Media Lab ön baskısında Kosmyna ve arkadaşları (2025), deneme yazan 54 katılımcıyı izledi. İlk oturumda yapay zeka destekli gruptakilerin yüzde 83,3’ü (18 kişiden 15’i) kendi denemesinden doğru alıntı yapamadı; diğer iki grubun her birinde bu oran yüzde 11,1’di (18 kişiden 2’si). Örneklem küçük, ortam dar.
  • Dell’Acqua ve arkadaşları (Organization Science, 2026), 758 bilgi çalışanıyla yapılan önceden kaydedilmiş bir saha deneyinde, yapay zekanın yetenekleri dahilindeki 18 görevde yapay zeka kullanıcılarının yüzde 12,2 daha fazla görev tamamladığını, yüzde 25,1 daha hızlı çalıştığını ve anlamlı ölçüde daha yüksek kalite elde ettiğini buldu. Bu yeteneklerin dışında kalan bir görevde ise “doğru çözüm üretme olasılıkları yüzde 19 daha düşüktü”. Bir görevin bu çizginin hangi tarafında olduğunu bilmek insanın işidir.

Risko ve Gilbert (2016) bilişsel yük boşaltmayı “bilişsel talebi azaltmak amacıyla bir görevin bilgi işleme gereksinimlerini değiştirmek için fiziksel eylem kullanmak” olarak tanımlıyor. Yük boşaltmanın kendisi sorun değildir; insanlar zihinlerini her zaman böyle genişletmiştir. Sorun, kontrolün de boşaltılmasıdır. Birkaç dakikada gözden geçiremeyeceğiniz bir prompt, gözden geçirmeden onaylayacağınız bir prompttur. Bu ödünleşim hakkında daha fazlası için yapay zekanın sizi daha kötü düşünür hale getirip getirmediği ve bilişsel yük bütçesi yazılarına göz atın.

Uzun bağlamı yine de ne zaman kullanmalısınız?

Amaç, kendi başına kısa promptlar değil. Uzun bağlam şu durumlarda doğru araçtır:
– Görev, önceden filtreleyemeyeceğiniz büyük bir metin bütününde arama yapmaksa; örneğin bir yıllık toplantı notlarında bir tedarikçinin geçtiği her yeri bulmak gibi. Kaçırılan noktalar olacağını bekleyin ve alıntı isteyin.
– Asıl mesele belgenin bütünündeki tutarlılıksa; örneğin 60 sayfalık bir teklifi çelişkiler açısından kontrol etmek gibi. Belgeyi bölümlere ayırın ve modelden karşılaştırmadan önce her birini özetlemesini isteyin.
– Yeniden kullanılabilir bir çalışma alanı kuruyorsanız; örneğin kalıcı referans belgeleri olan bir proje gibi. Burada materyalin yapısı boyutundan daha önemlidir: temiz, etiketli bir bağlam dosyası, ham dışa aktarımlarla dolu bir klasörden iyidir. Bu iş için doğru modeli seçmek hangi yapay zeka modeli hangi görev için yazısında, en iyi promptlarınızı yeniden kullanılabilir tutmak ise profesyoneller için prompt kütüphaneleri yazısında ele alınıyor.

Her şeyi yapıştırmanızın dürüst nedeni sorunun ne olduğuna henüz karar vermemiş olmanızsa, yanlış araçtır.

10 dakikalık Yüke Uygunluk kontrolü

Gözden geçirmesi beş dakikadan uzun sürecek her prompttan önce şunu uygulayın:

  1. Görevi tek cümleyle ifade edebiliyor muyum?
  2. Kendi başıma ihtiyaç duymayacağım her belgeyi çıkardım mı?
  3. Her belgenin yalnızca bir versiyonu mu var?
  4. Çelişen talimatları giderdim mi?
  5. Dört veya daha az ayrı talep mi var?
  6. Her materyal bloğu etiketli mi?
  7. Materyal en üstte, soru en sonda mı?
  8. Çıktı formatını belirttim mi?
  9. Kaynak pasajlara alıntı ya da referans istedim mi?
  10. Yanıtı elimdeki sürede kontrol edebilir miyim?

Kontrol listesi: CEOtudent editöryel çerçevesi.

Sık sorulan sorular

O halde 1M tokenlik bağlam penceresi işe yaramaz mı?
Hayır. Kesin bir sınırı ortadan kaldırıyor; bu da arama ve yeniden kullanılabilir çalışma alanları için değerli. Kıyaslamalar kullanım kalitesinin sınıra varmadan çok önce düştüğünü gösteriyor; bu yüzden pencereyi hedef olarak değil, pay olarak görmek en doğrusu.

Bu kıyaslama sonuçları en yeni modeller için de geçerli mi?
Doğrudan değil. RULER ve NoLiMa 2024 ve 2025 başı modellerini test etti; yeni modellerin daha iyi sonuç vermesi muhtemel. Güncel modellerin sağlayıcı rehberleri yine de odaklı bağlam ve özenli yerleştirme öneriyor ve bu yazı hazırlanırken yukarıda listelenen 2026 modellerine ait bağımsız bir kıyaslama mevcut değildi.

Talimatlar en üste mi, en alta mı konmalı?
Sağlayıcılar biraz farklı düşünüyor. Anthropic ve Google uzun materyalin önce, sorunun sonra gelmesini öneriyor. OpenAI’ın GPT-4.1 rehberi talimatların hem başta hem sonda yer almasının en iyi sonucu verdiğini, yalnızca bir kez kullanılacaksa bağlamın üstünde olmasının altında olmasından daha iyi olduğunu buldu. En üstte kısa bir görev satırı ve sonda sorunun tamamı, her ikisini de karşılar.

“Yedi artı eksi iki” hala çalışma belleğinin kuralı mı?
Miller’ın kendisi yediyi yaklaşık bir değer olarak ve yığınlarla ölçülen bir büyüklük olarak tanımladı. Cowan’ın 2001 derlemesi sınırı yaklaşık dört yığın yeni bilgiye yerleştiriyor. Tam rakam, ilkeden daha az önemli: daha az, daha büyük ve iyi etiketlenmiş yığınlar.

Bu, yapay zekanın insanları daha az düşündürdüğü anlamına mı geliyor?
Kanıtlar karışık ve büyük ölçüde korelasyonel. En güvenli yorum şu: araca duyulan güven, insanların onu kontrol etmeye harcadığı çabayı azaltma eğiliminde. Yanıtlarını doğrulayabileceğiniz promptlar tasarlamak bu çabayı yerinde tutar.

Kaynakça

  1. Anthropic. Models overview; Context windows; Prompting best practices (long context prompting). Claude Platform Docs. Erişim: 7 Ekim 2026.
  2. Anthropic Applied AI ekibi. Effective context engineering for AI agents. Anthropic Engineering, 29 Eylül 2025.
  3. OpenAI. Models. OpenAI API dokümantasyonu. Erişim: 7 Ekim 2026.
  4. OpenAI. GPT-4.1 Prompting Guide; GPT-5 prompting guide. OpenAI Cookbook, 2025.
  5. Google. Gemini 3.1 Pro Preview ve Gemini 3.8 Flash model sayfaları; Long context; Understand and count tokens. Gemini API dokümantasyonu. Erişim: 7 Ekim 2026.
  6. Liu NF, Lin K, Hewitt J, Paranjape A, Bevilacqua M, Petroni F, Liang P. Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics. 2024;12:157-173.
  7. Hsieh CP, Sun S, Kriman S, Acharya S, Rekesh D, Jia F, Zhang Y, Ginsburg B. RULER: What’s the Real Context Size of Your Long-Context Language Models? COLM 2024.
  8. Modarressi A, Deilamsalehy H, Dernoncourt F, Bui T, Rossi R, Yoon S, Schuetze H. NoLiMa: Long-Context Evaluation Beyond Literal Matching. ICML 2025.
  9. Hong K, Troynikov A, Huber J. Context Rot: How Increasing Input Tokens Impacts LLM Performance. Chroma Technical Report, 14 Temmuz 2025. Sektör raporu, hakem değerlendirmesinden geçmemiş.
  10. Jaroslawicz D, Whiting B, Shah P, Maamari K. How Many Instructions Can LLMs Follow at Once? arXiv 2507.11538, 2025. Ön baskı.
  11. Miller GA. The magical number seven, plus or minus two: Some limits on our capacity for processing information. Psychological Review. 1956;63(2):81-97.
  12. Cowan N. The magical number 4 in short-term memory: A reconsideration of mental storage capacity. Behavioral and Brain Sciences. 2001;24(1):87-114. Özet.
  13. Sweller J. Cognitive load during problem solving: Effects on learning. Cognitive Science. 1988;12(2):257-285. Özet.
  14. Sweller J, van Merrienboer JJG, Paas F. Cognitive Architecture and Instructional Design: 20 Years Later. Educational Psychology Review. 2019;31:261-292.
  15. Chandler P, Sweller J. Cognitive Load Theory and the Format of Instruction. Cognition and Instruction. 1991;8(4):293-332. Özet.
  16. Kalyuga S, Ayres P, Chandler P, Sweller J. The Expertise Reversal Effect. Educational Psychologist. 2003;38(1):23-31. Özet.
  17. Risko EF, Gilbert SJ. Cognitive Offloading. Trends in Cognitive Sciences. 2016;20(9):676-688. Özet.
  18. Lee HP, Sarkar A, Tankelevitch L, Drosos I, Rintel S, Banks R, Wilson N. The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI 2025.
  19. Gerlich M. AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking. Societies. 2025;15(1):6. Özet.
  20. Kosmyna N, Hauptmann E, Yuan YT, Situ J, Liao XH, Beresnitzky AV, Braunstein I, Maes P. Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task. MIT Media Lab, arXiv 2506.08872, 2025. Ön baskı, hakem değerlendirmesinden geçmemiş.
  21. Dell’Acqua F, McFowland E III, Mollick E, Lifshitz-Assaf H ve arkadaşları. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science. 2026;37(2). Özet.

İddia edilen ve etkin bağlam tablosu, insan-model karşılaştırma tablosu, Yüke Uygun Prompt yöntemi, Prompt Yük Haritası ve 10 dakikalık kontrol, yukarıdaki kaynaklara dayanan CEOtudent analizleridir. Diğer tüm rakamlar bu kaynaklarda yayımlandığı haliyle aktarılmıştır; yalnızca özet halinde okunan kaynaklar işaretlenmiştir. Yaygın biçimde tekrarlanan iki rakam, yayımlanmış metinlerde bulunamadığı için kullanılmadı: pürüzlü sınır çalışmasına atfedilen “yüzde 40 daha yüksek kalite” sonucu ve OpenAI’a atfedilen “token başına dörtte üç kelime” kuralı.


Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.

Benzer içerikler