Özet. Bugün her büyük asistan üç yapılandırma katmanı sunuyor: bir kez yazdığınız kalıcı bir brifing, bağlamı tek bir iş gövdesine daraltan bir proje veya çalışma alanı ve aracın kendi doldurduğu bir bellek. Çoğu profesyonel bu üçünden yalnızca birini, genellikle de kötü kullanıyor ve ardından aracın işini anlamadığı sonucuna varıyor. Sağlayıcıların kendisi bu katmanların nasıl doldurulacağı konusunda anlaşamıyor: Google’ın resmî Gem rehberi mümkün olduğunca çok arka plan vermeyi söylerken, Anthropic’in resmî belgeleri muadil dosyayı yaklaşık 200 satırla sınırlıyor ve uzun dosyaların talimata uyumu düşürdüğünü açıkça yazıyor. Hakemli kanıt kesin biçimde ikinci pozisyonu destekliyor. Lost in the Middle çalışmasında modele tek doğru belgeyi vermek doğruluğu 27,8 ila 50,4 yüzde puanı artırdı; buna karşılık bağlam penceresini dörde ya da 12,5 kata katlamak doğruluğu 0,3 puan değiştirdi. Bu, daha fazlasını saklamak yerine iyi seçmenin 93 ila 107 kat üstünlüğü demek. Pratik sonuç “daha çok bağlam yaz” değil; “her bilgiyi hâlâ okunacağı katmana ata.”
Bu, hangi başarısızlığı çözüyor
Şikâyet tanıdık. Konuşmanın başında rolünüzü, müşterilerinizi, kısıtlarınızı ve kurum içi üslubunuzu anlatıyorsunuz. Çıktı düzeliyor. Ertesi gün yeni bir konuşma açıyor ve hepsini baştan anlatıyorsunuz. Dördüncü tekrardan sonra aracın gerçek iş için tasarlanmadığına karar veriyorsunuz.
Oysa tasarlanmış. Siz bağlamı, unutmak üzere kurgulanmış tek yere veriyorsunuz: konuşmanın kendisine. Üç yapılandırma katmanı tam da yeniden yazılmaması gerekeni tutmak için var. Neredeyse kimsenin yapmadığı şey ise hangi bilginin hangi katmana ait olduğuna bilinçli olarak karar vermek. Bu atama problemi disiplinin tamamıdır ve iyi bir istem yazmaktan ayrı bir iştir. İşiniz hakkında henüz tek bir kaynak belge oluşturmadıysanız bağlam dosyasıyla başlayın; bu yazı, o belgenin içeriğinin gerçekte nerede yaşaması gerektiğine dair.
Üç katman nedir
Terminoloji sağlayıcıdan sağlayıcıya değişiyor, ama mimari birleşti.
Katman 1, kalıcı brifing. Araçla yaptığınız her işe uygulanan talimatlar. ChatGPT buna özel talimatlar diyor. Anthropic’in geliştirici araçları ~/.claude/CLAUDE.md konumunda kullanıcı kapsamlı bir talimat dosyası kullanıyor. Google’ın muadili, küresel değil asistan başına uygulanan Gem talimat bloğu. Bu katman her oturuma yükleniyor.
Katman 2, proje veya çalışma alanı. Tek bir iş gövdesine daraltılmış bağlam: bir müşteri, bir ürün, bir araştırma hattı. O sınırın içinde geçerli olan, dışında geçerli olmayan dosyalar, referans belgeler ve talimatlar. Anthropic bunu, işin yanında saklanan proje kapsamlı bir talimat dosyası ve yalnızca eşleşen materyal devredeyken yüklenen yol kapsamlı kurallar olarak belgeliyor.
Katman 3, bellek. Asistanın istenmeden sizin hakkınızda yazdığı notlar. Anthropic’in belgeleri buradaki iş bölümünde alışılmadık ölçüde açık: talimat dosyalarını siz yazarsınız ve “talimatlar ve kurallar” içerirler; otomatik bellek ise model tarafından yazılır ve “öğrenilenler ve örüntüler” içerir, özellikle tercihleriniz, verdiğiniz düzeltmeler ve modelin kendi başına çıkaramayacağı proje bağlamı. Belgeler ayrıca bellek dizininin her oturuma yalnızca ilk 200 satırını veya 25KB’ını, hangisi önce gelirse onu yüklediğini, geri kalanının oturum başlangıcında yüklenmediğini belirtiyor.
Bu son ayrıntı göründüğünden önemli. Katman 3’ün sessizce uygulanan katı bir bütçesi var. Bütçeyi aşan her şey basitçe orada değildir.
Kanıt: seçicilik, kapasiteyi iki büyüklük mertebesi geride bırakıyor
Bu katmanların hepsinde ayartı aynıdır: doldurmak. Bağlam pencereleri yüz binlerce token olarak duyuruluyor, dolayısıyla her şeyi saklamak bedava gibi görünüyor. Kontrollü kanıt bunun tersini söylüyor.
Liu ve meslektaşları, Transactions of the Association for Computational Linguistics dergisinde yayımladıkları çalışmada çok belgeli soru yanıtlama görevini iki referans koşulunda çalıştırdı. Bağlamsız koşulda model hiç belge almadı ve yalnızca hâlihazırda bildiğine dayanmak zorunda kaldı. Kâhin koşulunda ise tam olarak tek bir belge aldı: yanıtı içeren belge. Çalışmanın geri kalanı, yanıtın dikkat dağıtıcılar arasında nerede durduğunu değiştiriyordu.
Doğrulanmış veri. Çok belgeli soru yanıtlamada bağlamsız ve kâhin doğruluk oranları (Liu ve diğerleri, TACL 2024).
| Model | Bağlamsız | Kâhin |
|---|---|---|
| LongChat-13B (16K) | %35,0 | %83,4 |
| MPT-30B-Instruct | %31,5 | %81,9 |
| GPT-3.5-Turbo | %56,1 | %88,3 |
| GPT-3.5-Turbo (16K) | %56,0 | %88,6 |
| Claude-1.3 | %48,3 | %76,1 |
| Claude-1.3 (100K) | %48,2 | %76,4 |
Tabloyu aşağı doğru okuyun; satırlardan ikisi bilerek neredeyse ikiz. GPT-3.5-Turbo hem 4K hem 16K pencereyle yer alıyor. Claude-1.3 hem 8K hem 100K ile. Aynı model ailesi, aynı görev, farklı kapasite. Bu eşleştirme, tek başına kapasitenin ne satın aldığını ayrıştırmamızı sağlıyor; makale bunu tablolaştırmıyor.
CEOtudent editöryel çerçevesi: seçicilik primi. Yukarıdaki tablodan türetildi; doğru belge kazancı ile büyük pencere kazancının karşılaştırması.
| Karşılaştırma | Değişen | Doğruluk değişimi | Oran |
|---|---|---|---|
| GPT-3.5-Turbo, bağlamsızdan kâhine | Tek doğru belge verildi | +32,2 puan (+%57,4) | referans |
| GPT-3.5-Turbo, 4K’dan 16K pencereye | Bağlam kapasitesi 4 katına çıktı | +0,3 puan (+%0,34) | seçicilik 107 kat değerli |
| Claude-1.3, bağlamsızdan kâhine | Tek doğru belge verildi | +27,8 puan (+%57,6) | referans |
| Claude-1.3, 8K’dan 100K pencereye | Bağlam kapasitesi 12,5 katına çıktı | +0,3 puan (+%0,39) | seçicilik 93 kat değerli |
| LongChat-13B, bağlamsızdan kâhine | Tek doğru belge verildi | +48,4 puan (+%138,3) | gözlenen en büyük tekil kazanç |
| MPT-30B-Instruct, bağlamsızdan kâhine | Tek doğru belge verildi | +50,4 puan (+%160,0) | gözlenen en büyük tekil kazanç |
Claude-1.3’ün bağlam penceresini 12,5 katına çıkarmak kâhin doğruluğunu %76,1’den %76,4’e taşıdı. Aynı modele doğru belgeyi vermek ise %48,3’ten %76,1’e taşıdı. İkinci müdahale birincisinin 93 katıydı. GPT-3.5-Turbo için kat sayısı 107. Pencere büyüdüğünde her iki bağlamsız skor da 0,1 puanla yanlış yöne kıpırdadı; bu gürültüdür, ama iyileşme kesinlikle değildir.
Müşteri klasörünüzün tamamını bir projeye yapıştırıp yapıştırmayacağınıza karar verirken akılda tutulacak sayı budur. Kısıt kapasite değil. Seçim.
Fazla bağlamın hiç bağlamdan kötü olduğu an
Daha güçlü bulgu, rahatsız edici olan. Liu ve meslektaşları, ilgili bilgi girdinin ortasında durduğunda GPT-3.5-Turbo’nun performansının %20’den fazla düşebildiğini ve en kötü durumda 20 ve 30 belgeli koşullardaki performansın modelin kendi bağlamsız skoru olan %56,1’in altına indiğini bildiriyor.
Bunu çalışma diline çevirin. Modele yanıt verildi. Hiçbir şey verilmediği duruma göre daha kötü performans gösterdi. Doğru bir belgeyi çevreleyen on dokuz ya da yirmi dokuz alakasız belge, doğru belgenin yaptığı iyilikten fazla zarar verdi.
Yazarların tarif ettiği mekanizma U biçimli bir eğri: bağlamın en başındaki ve en sonundaki materyalin güçlü kullanımı, aradaki her şeyin bozulmuş kullanımı. Uzun bir kalıcı brifingin ortasına gömdüğünüz şey, işlevsel olarak en riskli materyaldir.
Bu yüzden “her şeyi ekle, belki işe yarar” tarafsız bir strateji değil. Ölçülebilir bir bedeli var ve bu bedel, eklediğiniz makul görünümlü ama alakasız materyalle birlikte büyüyor. Çıktının kendinden emin biçimde yanlış olduğu durumlar için yapay zekanın neden halüsinasyon gördüğüne bakın.
Sağlayıcılar birbirleriyle anlaşmıyor
İşte bildiğimiz kadarıyla kimsenin yan yana koymadığı bir karşılaştırma: iki büyük sağlayıcının, kalıcı brifing katmanının nasıl doldurulacağına dair kendi resmî yazılı rehberleri.
Doğrulanmış veri. Kalıcı brifing katmanının yazımına dair resmî sağlayıcı rehberleri, her sağlayıcının kendi belgelerinden.
| Sağlayıcı rehberi | Uzunluk hakkında | Özgüllük hakkında | Aslında ne olduğu |
|---|---|---|---|
| Anthropic, bellek belgeleri | “CLAUDE.md dosyası başına 200 satırın altını hedefleyin. Daha uzun dosyalar daha çok bağlam tüketir ve talimata uyumu düşürür.” Kısa dosyaların daha iyi uyum ürettiği belirtiliyor. | Somut ve denetlenebilir talimatları tercih ediyor: “Kodu düzgün biçimlendir” yerine “2 boşluklu girinti kullan”; “Değişikliklerini test et” yerine “Commit öncesi npm test çalıştır”. |
Açıkça dayatılan yapılandırma değil. Sistem isteminden sonra bir kullanıcı mesajı olarak iletilen bağlam olarak belgeleniyor; katı uyum garantisi yok. |
| Google, Gemini Gems destek belgeleri | Dört bileşen öneriyor: persona, görev, bağlam ve biçim. Bağlam başlığı altındaki tavsiye: “Mümkün olduğunca çok arka plan sağlayın.” | Biçim bileşeni için “İstenen yapıyı belirtirken spesifik olun”; persona rolü ve yanıt üslubunu tanımlıyor. | Küresel bir varsayılan yerine, belirli bir amaç için kurulmuş asistana iliştirilen talimat bloğu. |
İkisi de resmî. Ve yeni bir kullanıcının en çok yanıt beklediği tek soruda zıt yönleri gösteriyorlar: ne kadar yazmalıyım?
Lost in the Middle sonuçları hükmü veriyor. Kaldıraç hacim değil; yerleşim ve ilgililik. Google’ın tavsiyesi bir Gem’in kurulduğu dar durum için savunulabilir: orada arka plan gerçekten görevin kendisidir ve asistan tek bir iş yapar. Ne yaparsanız yapın her oturuma yüklenen genel bir kalıcı brifinge uygulandığında ise “mümkün olduğunca çok arka plan”, bağlamsız skorun altında kalan deney koşuluna yakındır.
Anthropic’in kendi belgelerinin içinde de fark edilmeye değer ikinci bir çelişki var; özensizlikten çok öğretici olduğu için. Belgeler büyük talimat dosyalarının düzen için içe aktarmalara bölünmesini öneriyor, ardından içe aktarılan dosyaların yine de başlangıçta bağlam penceresine yüklendiğini, dolayısıyla bölmenin “bağlamı azaltmadığını” belirtiyor. Düzen ile maliyet farklı problemlerdir ve belgeler birincinin ikincisini çözüyormuş gibi yapmasına izin vermiyor. Yapay zeka yapılandırması hakkındaki üretkenlik tavsiyelerinin çoğu tam da bu çizgiyi bulanıklaştırır.
İş Bağlamı Şartnamesi
Atama problemi tercih değil kural ister. Bizimki, her bilgiye sırayla uygulanan üç sınamayla başlıyor.
CEOtudent editöryel çerçevesi: İş Bağlamı Şartnamesi. İşinize dair bilgiler için katman atama kuralı.
| Sınama | Soru | Evetse |
|---|---|---|
| Kapsam | Bu, araçla yaptığım her iş için doğru mu? | Katman 1, kalıcı brifing |
| Sınır | Bu yalnızca tek bir müşteri, ürün veya hat içinde mi doğru? | Katman 2, proje |
| Köken | Bunu yalnızca araç yanlış yaptığı ve düzelttiğim için mi öğrendim? | Katman 3, bellek |
| Türetilebilirlik | Araç bunu zaten gördüğü materyalden çıkarabilir mi? | Hiçbir katman. Sil. |
| Oynaklık | Bu bir çeyrek içinde yanlış hâle gelecek mi? | Hiçbir katman. Konuşmada söyle. |
İşin çoğunu dördüncü ve beşinci sınamalar yapıyor, çünkü katmanları 200 satır probleminden sağ çıkacak kadar küçük tutan bunlar.
Türetilebilirlik, insanların atladığı sınama. Projeniz zaten üslup kılavuzunu içeriyorsa, kalıcı brifingde üslup kılavuzunu tekrar etmek hiçbir şey kazandırmaz, yerleşim maliyeti çıkarır. Anthropic’in belgeleri tam bu kuralı kendi otomatik belleğine uyguluyor: kod tabanından türetilebilecek her şeyi ve talimat dosyalarının zaten söylediği her şeyi atladığını yazıyor.
Oynaklık, insanların ters anladığı sınama. Bu çeyreğin öncelikleri, bu hafta kapanacak anlaşma, on bir gün sonraki teslim tarihi: hepsi önemli bağlam gibi hissettiriyor ve hepsi bir çeyrek içinde yanlış hâle geliyor. O noktada tarafsız bir kalabalık değil, gelecekteki her oturumun en yüksek öncelikli konumunda duran aktif yanlış bilgi olurlar.
Kariyerinin ortasındaki bir profesyonel için işlenmiş atama örneği:
- “Düzenlemeye tabi ilaç pazarlamasında çalışıyorum; her iddianın kaynağı olmalı.” Kapsam sınamasını geçer. Katman 1.
- “Müşteriye giden notlarda madde işareti kullanma.” Kapsam sınamasını geçer ve denetlenebilecek kadar somuttur. Katman 1.
- “Bu müşterinin marka sesi abartılı sıfatlardan kaçınır, ekteki kılavuza bakın.” Sınır sınaması. Katman 2, kılavuz talimatlara alıntılanmak yerine projeye konur.
- “Sürekli daha kısa giriş istiyorum, sürekli üç cümlelik önsöz alıyorum.” Köken sınaması. Araç kendi yazıyorsa Katman 3; yazmıyorsa düzeltilmiş kuralı tek satır hâlinde Katman 1’e yükseltin.
- Onay akışı belgesi zaten projedeyken “Onay akışımız dört aşamalı.” Türetilebilirlik sınamasında kalır. Silin.
- “Üçüncü çeyrek hedefi %14 büyüme.” Oynaklık sınamasında kalır. Geçerli olduğu konuşmada söyleyin.
Bu şekilde kurulan bir kalıcı brifing genellikle 15 ila 40 satır arasında oturur. Bu, zarafet için uydurduğumuz bir hedef değil; çoğu tek rollü profesyonel için beş sınamadan sağ çıkan miktar bu ve herhangi bir sağlayıcının yazılı olarak taahhüt ettiği tek satır bütçesinin rahatça içinde kalıyor.
Adı konması gereken üç yapılandırma hatası
Şartname yerine persona yazmak. “Sen dünya çapında bir strateji danışmanısın” bir kostümdür, bilgi değil. Denetlenemez, çıktıyı kısıtlamaz ve bağlamdaki en değerli konumu işgal eder. Onun yerine aracın varsayılanlarından gerçekten farklı olan kısıtları yazın.
Belleği dosya dolabı sanmak. Bellek, modelin sizin düzeltmelerinizden doldurduğu yerdir. Öğrenilenleri tutmak için tasarlanmıştır ve belirtilmiş bir yükleme bütçesi vardır. Referans materyali oraya itmek, onu yararlı kılan düzeltmelerle rekabet eder ve bütçeyi aşan her şey oturum başlangıcında sessizce düşer.
Hiç denetlememek. Anthropic’in belgeleri, iki kural birbiriyle çelişirse modelin “keyfî olarak birini seçebileceği” uyarısını yapıyor ve güncelliğini yitirmiş ya da çelişen talimatların kaldırılması için düzenli gözden geçirme öneriyor. Yapılandırma çürür. Sekiz ay önce, farklı bir rolde ve farklı müşterilerle yazılmış bir kalıcı brifing, bugün çıktıyı artık yapmadığınız işe doğru aktif olarak yönlendiren bir talimatlar kümesidir. Her çeyrek takvime 20 dakikalık bir gözden geçirme koyun ve eklemek yerine silin.
Bunun pratikte görünümü
Kurulum bir kez, yaklaşık bir saat sürer.
- Son bir ayda bir konuşmaya ikiden fazla kez yazdığınız her bilgiyi listeleyin. Bu sizin aday listeniz ve neyin önemli olduğuna dair fikrinizden değil, gerçek davranışınızdan gelmeli.
- Her adayı yukarıdaki beş sınamadan geçirin. Türetilebilirlik ve oynaklık sınamalarında üçte bir ile yarısı arasında bir kısmı silmeyi bekleyin.
- Kalanları atandıkları katmana koyun. Tarif değil, somut talimat olarak yazın.
- Kalıcı brifingi, ihlal edilmesini en çok istemeyeceğiniz iki üç kısıt en üstte ve en altta olacak, ortada olmayacak şekilde sıralayın. Bu hiçbir şeye mal olmaz ve U biçimli eğriyi doğrudan hedefler.
- Varsayılan eylemi silmek olan çeyreklik bir gözden geçirmeyi ajandaya yazın.
Bunu yapmanın nedeni derli topluluk değil. İşinizi tanıyan bir asistanla tanımayan bir asistan arasındaki fark 27,8 ila 50,4 doğruluk puanı olarak ölçüldü ve bu fark depolamadan değil, seçimden geldi. Bunun içinde yer aldığı daha geniş beceri için bağlam mühendisliğinin ne olduğuna, bağlam yerine tüm görevleri devretmek için yapay zeka ajanlarına brifing çerçevesine bakın.
Yapılandırmayı bir CEO’nun görev tanımı yazması gibi yönetin: az sayıda kısıt, hepsi bağlayıcı, programa bağlı gözden geçirme. Bir öğrenci gibi öğrenin: hangi düzeltmeyi tekrar tekrar yaptığınızı fark edin ve o tekrarı, brifingde bir satırın eksik olduğunun işareti sayın.
Sıkça sorulan sorular
Tüm özgeçmişimi kalıcı brifinge koymalı mıyım?
Neredeyse kesinlikle hayır. Satır satır kapsam sınamasından geçirin. Mevcut rolünüz ve getirdiği kısıtlar geçer. On yıl önceki iş geçmişiniz hiçbir çıktıyı etkilemez ve bağlayıcı kısıtların durması gereken konumları tüketir.
Daha büyük bir bağlam penceresi bunları gevşetmek için gerekçe mi?
Bu yazıdaki kanıt tam olarak o sorunun doğrudan sınamasıdır. Pencereyi 12,5 katına çıkarmak kâhin doğruluğunu 0,3 puan değiştirdi. Doğru belge etkisi bunun 93 katıydı. Bu kanıta göre kapasite büyümesi seçimi daha önemsiz hâle getirmedi.
Sağlayıcılar sınırları sürekli değiştiriyor. Bu çerçeveyi bozar mı?
Karakter ve satır sınırları sık değişiyor; çerçeve tam da bu yüzden sayıların değil sınamaların üzerine kuruldu. Kapsam, sınır, köken, türetilebilirlik ve oynaklık hiçbir sağlayıcının güncel sınırına bağlı değil. Güncel sınırı üçüncü taraf bir özetten değil, aracınızın kendi belgelerinden kontrol edin; bu rakamlar yayımlanmış rehberlerin çoğundan hızlı hareket ediyor.
Araç düpedüz olguları yanlış veriyorsa bunların faydası olur mu?
Kısmen. Doğru bağlam bir hata sınıfını, modelin hiç doldurmak zorunda kalmaması gereken bir boşluğu doldurmasından kaynaklanan hataları azaltır. Modelin kendi üretim sürecinden gelen kendinden emin hataları ortadan kaldırmaz; o ayrı bir problemdir.
İşverenim bu ayarları merkezî olarak yönetiyorsa?
O zaman Katman 1 kısmen sizin elinizde olmayabilir. Anthropic, bireysel ayarların dışarıda bırakamayacağı kuruluş çapında yönetilen bir talimat dosyasını belgeliyor. Kaldıracınız, proje kapsamının genellikle hâlâ sizin tasarımınıza açık olduğu Katman 2’ye kayar.
Kaynakça
- Liu, Lin, Hewitt, Paranjape, Bevilacqua, Petroni ve Liang, Lost in the Middle: How Language Models Use Long Contexts, Transactions of the Association for Computational Linguistics, 2024. Altı model için bağlamsız ve kâhin doğruluk oranları; U biçimli konum eğrisi; 20 ve 30 belgeli koşulların bağlamsız performansın altına düşebildiği bulgusu.
- Anthropic, resmî Claude Code belgeleri, bellek referans sayfası. Talimat dosyaları ile otomatik bellek ayrımı; dört kapsam düzeyi; 200 satırın altı rehberi ve uzun dosyaların uyumu düşürdüğü ifadesi; 200 satır veya 25KB bellek dizini yükleme sınırı; talimat dosyalarının dayatılan yapılandırma değil bağlam olduğu notu; özgüllük, çelişen kurallar ve içe aktarmalar hakkındaki rehber.
- Google, etkili Gem talimatları yazımına dair resmî Gemini Apps destek belgeleri. Persona, görev, bağlam ve biçimden oluşan dört bileşenli yapı ve mümkün olduğunca çok arka plan sağlama tavsiyesi.
Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.















