Gelişimİş
0

Büyük Dil Modelleri Nasıl Çalışır: Yapay Zekayı Her Gün Kullananlar İçin Sade Bir Anlatım

TL;DR

Bir büyük dil modeli tam olarak tek bir şey yapar: kendisine verilen metni alır ve tekrar tekrar metnin bir sonraki parçasını tahmin eder. Akıcı yanıtlar, kod, ürkütücü derecede iyi tavsiyeler ve kendinden emin saçmalıklar dahil diğer her şey, muazzam ölçekte çalışan bu tek mekanizmadan doğar. Bu anlatım zihinsel modeli matematiksiz kurar: bir token nedir, eğitim aslında neyi değiştirir, modelin neden bir şeyleri arayacak bir veritabanı yoktur ve “onu uydurdu” neden bir hata değil, yanıtlayamadığı bir soruya yöneltilmiş, en iyi işini üreten aynı sürecin ta kendisidir. Mekanizmayı anlayın, modele şaşırmayı bırakır ve onu yönlendirmeye başlarsınız. Motorun nasıl çalıştığını bilmek isteyen bir öğrenci gibi öğrenin, aracın neye güvenilip neye güvenilemeyeceğini bilen bir CEO gibi kullanın.

Yüz milyonlarca insan artık her gün bir yapay zeka modeline yazı yazıyor ama enter’a bastıktan sonra ne olduğunu kabaca bile anlatamaz. Bu bir zeka eksikliği değil. Kimse açıklamadı. Sonuç, bir sonraki kelime tahmincisini bir arama motoru, bir kâhin ya da bir insan gibi ele alan ve sonra o hiçbiri gibi davranmadığında ihanete uğramış hisseden bir iş gücü.

Mekanizmayı anlamak hızla bir uzmanlık becerisi değil temel bir okuryazarlık haline geliyor. Bu araçlardan giderek daha fazla iş geçtikçe, onlardan en çok faydayı sağlayanlar en zekice komutları bilenler değil. Kaputun altında ne olduğuna dair doğru bir zihinsel modeli olanlar; çünkü o model onlara neye güveneceklerini, neyi kontrol edeceklerini ve nasıl soracaklarını söyler. Geniş gerekçeyi Komut Mühendisliği Yeterli Değil yazısında ortaya koyduk. Bu yazı, onun altındaki temeli kuruyor.

Bir dil modelinin yaptığı tek şey

İşte tüm motor tek bir cümlede: bir büyük dil modeli size verdiğiniz metni alır ve tekrar tekrar en olası bir sonraki metin parçasını tahmin eder.

Bu, yaptığı şeyin bir sadeleştirmesi değil. Yaptığı şeyin kendisi. Bir soru yazarsınız; model onu okur ve bir yanıtın olası ilk kelimesini tahmin eder. Sonra sorunuzu artı o ilk kelimeyi okur ve ikincisini tahmin eder. Sonra üçüncüsünü. Başkasının cümlesini tamamlayabileceğiniz gibi yazar, ancak bir farkla ki tamamlamayı hiç bırakmaz, her seferinde küçük bir adımla, yanıt tamamlanana kadar.

Tahmin ettiği birim tam olarak bir kelime değildir. Bir tokentır; çoğu zaman bütün bir kelime olan ama bir kelimenin parçası, bir noktalama işareti ya da yaygın bir kelime parçası da olabilen bir metin parçası. “Understanding” tek bir token olabilir ya da “Understand” ve “ing” olarak bölünebilir. Modeller bu yüzden bazen bir kelimedeki harfleri yanlış sayar ya da kelime oyunlarında takılır: harfleri sizin gördüğünüz gibi görmezler. Token görürler.

Bu sistemlerdeki etkileyici her şey, hayal etmesi zor bir ölçekte çalışan bu tek döngüdür. Ve onlardaki sinir bozucu her şey, güvenilir biçimde bildiği şeyin sınırının ötesinde çalışan aynı döngüdür.

“Eğitim” aslında neyi değiştirdi

Model sadece bir sonraki token’ı tahmin ediyorsa, görünen bilgisi nereden geliyor? Eğitimden ve bu, doğru anlamaya değer kısım.

Bir model mekanik olarak parametre denen, çoğu zaman milyarlarca sayıdan oluşan devasa bir kümedir. Eğitimden önce o sayılar özünde rastgeledir ve modelin tahminleri anlamsızdır. Eğitim, modele muazzam miktarda metin gösterme ve her bir sonraki token’ı tahmin ettiğinde o milyarlarca sayıyı biraz kaydırma sürecidir, öyle ki bir sonraki sefer tahmini gerçek metinde gerçekten sonra gelene biraz daha yakın olsun.

Bunu yazılı internetin, kitapların ve kodun geniş bir diliminde trilyonlarca kez yapın ve dikkat çekici bir şey olur. Herhangi bir metinde bir sonraki token’ı iyi tahmin etmek için model örüntüleri kodlamak zorunda kalır: dil bilgisi, olgular, üsluplar, akıl yürütme adımları, bir hukuk maddesinin yapısı, bir şiirin ritmi. Bunları kimse programlamaz. Bunlar ölçekte yapılan tahminin istatistiksel tortusudur. Bunu pratik kılan mimariye transformatör denir; 2017 tarihli “Attention Is All You Need” (Dikkat Yeterlidir) araştırma makalesinde tanıtıldı ve temel fikri olan dikkat, modelin bir sonrakini tahmin etmek için hangi önceki kelimelerin en çok önemli olduğunu tartmasını sağlar.

Kritik olarak, eğitim bittiğinde sayılar donar. Model konuşmalarınızdan öğrenmeye devam etmez ve etrafındaki sistem bunu geri beslemedikçe dünün belleği yoktur. Bildiği şey o donmuş parametrelere işlenmiştir; bu yüzden her modelin bir bilgi kesim tarihi vardır ve bu sabah ne olduğunu size söyleyemez.

Bu sürecin ölçeği, hepsini bir arada görmeye değer bir hızla tırmanıyor.

Tablo 1. Teknolojinin gidişatı (doğrulanmış veri)

Ölçüt Bulgu Kaynak
Eğitim işlem gücü Kabaca her 5 ayda bir ikiye katlanıyor Stanford HAI AI Index 2025
Eğitim veri kümesi boyutu Kabaca her 8 ayda bir ikiye katlanıyor Stanford HAI AI Index 2025
GPT-3.5 düzeyinde bir modeli sorgulama maliyeti Milyon token başına $20’dan $0,07’ye düştü (Kasım 2022’den Ekim 2024’e) Stanford HAI AI Index 2025
2024’te dikkate değer modellerin endüstriden gelen payı ~%90 (2023’teki ~%60’tan) Stanford HAI AI Index 2025

Ortadaki satır, dünyayı sessizce değiştiren satırdır: iki yıldan kısa sürede yetkin bir modelin çıktısının maliyetinde 280 kattan fazla düşüş, teknolojinin bir demodan bir kamu hizmetine geçmesinin nedenidir.

Neden bir şey “aramaz”

Şimdi anlaşılacak en yararlı tek şey, çünkü herkesi yanıltan davranışı açıklar.

Bir dil modelinin içinde veritabanı yoktur. Olgusal bir soru sorduğunuzda kayıtları arayıp bir eşleşme döndürmüyor. Yaptığı tek şeyi yapıyor: parametrelerine işlenmiş örüntülere dayanarak sorunuzun en olası devamını tahmin ediyor. Yanıt eğitim metninde yaygınsa tahmin ile gerçek güzelce örtüşür ve olguyu “biliyormuş” gibi görünür. Yanıt nadir, belirsiz ya da yoksa model durup “sonuç yok” demez. Diyemez. Yine de kulağa makul gelen bir devam tahmin eder, çünkü tüm işi budur.

Bir halüsinasyon işte budur. Modelin arızalanması değil. Modelin tam tasarlandığı gibi çalışması, akıcı, kendinden emin metin üretmesi, kendinden emin metnin tesadüfen yanlış olduğu bir boşluğa yöneltilmesidir. İçerik ister gerçek ister uydurma olsun akıcılık aynıdır; tam da bu yüzden tondan anlayamazsınız. Yararlı bir zihinsel model: dil modeli bir kitabı getiren bir kütüphaneci değildir. Size her zaman pürüzsüz bir yanıt verecek, olağanüstü çok okumuş bir doğaçlamacıdır ve hatırlamak ile uydurmak arasındaki farka dair yerleşik bir sinyali yoktur.

Bu, her gün karşılaşılan iki davranışı daha açıklar. Örnekleme, aynı komuta iki kez farklı yanıt almanızın nedenidir: model her zaman tek en olası bir sonraki token’ı seçmez; olası olanlar arasından örnekler, bu da onu robotik yerine yaratıcı hissettiren şeydir. Ve bağlam penceresi, modelin bir seferde dikkate alabileceği metin miktarıdır, komutunuz artı o ana kadarki konuşma. Bunu aşarsanız en eski kısımlar görüş alanından çıkar; çok uzun sohbetlerin başta söylediklerinizi “unutmuş” gibi görünmesinin nedeni budur.

Çalışan zihinsel model

Parçaları bir araya getirin, taşıması kolay ve aracı kullanma biçiminizi değiştiren bir model elde edersiniz.

Tablo 2. Bir dil modelinin çalışan zihinsel modeli (CEOtudent editöryel çerçeve)

Onu şöyle düşünürseniz… Şunu beklersiniz… Ve yanılırsınız, çünkü…
Bir arama motoru Getirilmiş, kaynaklı olgular Kayıt getirmez, makul metin üretir
Sizi anlayan bir insan Bellek, niyet, sorumluluk Oturumlar arası belleği ve bir doğruluk modeli yoktur
Kelimeler için bir hesap makinesi Belirlenimci, tekrarlanabilir çıktı Örnekler, dolayısıyla aynı komut farklı yanıt verebilir
Çok okumuş bir doğaçlamacı Kontrol gerektiren akıcı yardım Bu, kabaca doğru olanı

Doğaçlamacı modeli üç pratik hamlede karşılığını verir. Birincisi, malzemeyi ona verin. Önündekinden tahmin ettiği için, ilgili belgeyi, veriyi ya da bağlamı komuta yapıştırmak donmuş belleğine güvenmeyi yener; bu yüzden bir yapay zekayı iyi bilgilendirmek başlı başına bir beceridir ve onu Bir Yapay Zeka Ajanına Nasıl Görev Devredilir yazısında parçaladık. İkincisi, önemli olan her şeyi doğrulayın. Akıcılık kanıt değildir. Üzerine hareket edeceğiniz her olgusal iddia, isim, sayı ya da atıf için model, güvenilecek bir kaynak değil, kontrol edilecek bir ilk taslaktır. Üçüncüsü, makul olmanın yeterli olduğu yerde kullanın. Taslak hazırlama, beyin fırtınası, yeniden yapılandırma, açıklama ve çeviri, güçlü bir makul yanıtın gerçekten değerli olduğu görevlerdir; yüksek riskli olgular ve geri döndürülemez kararlar değildir.

Bunların hiçbiri matematiği bilmeyi gerektirmez. Mekanizmayı bilmeyi gerektirir: eğitim zamanında donmuş örüntülerden, aramasız ve yerleşik bir doğruluk duygusu olmadan, bir sonraki token’ı tahmin eden tek bir döngü. Bunu tutun, model büyü ya da tehdit olmaktan çıkar ve olduğu şey olur: sınırları güçleri kadar bilinebilir güçlü bir araç. O bilme başlı başına kalıcı beceridir, çünkü araçlar değişmeye devam edecek ve mekanizma değişmeyecek; bunu Yapay Zeka Yöneticisi Kılavuzu yazısında geliştiriyoruz.

SSS

Model gerçekten düşünüyor ya da akıl yürütüyor mu?
Çoğu zaman akıl yürütmeye benzeyen metin üretir ve “akıl yürüten” modeller, zor problemlerde yanıtlarını gerçekten iyileştiren ara adımlar üretir. Ama mekanik olarak hâlâ token tahmin ediyor; akıl yürütme biçimli çıktı, aynı sürecin çok gelişmiş bir versiyonudur, ayrı bir yeti değil. Görünen akıl yürütmeyi yararlı ve yine de kontrol edilebilir olarak görün, kanıt olarak değil.

Konuşmalarımdan öğreniyor mu?
Parametreleri eğitimden sonra donan çekirdek model, hayır. Bazı ürünler belleği taklit etmek için son mesajlarınızı ya da kayıtlı tercihlerinizi komuta geri besler, ama bu, kendini güncelleyen model değil çevredeki sistemdir. Sohbetiniz onu yeniden eğitmez.

Yanlışken neden bu kadar kendinden emin?
Çünkü çıktısında kendinden eminlik ile doğruluk birbiriyle ilgisizdir. Model, altındaki içerik doğru olsun olmasın en akıcı devamı üretir ve akıcı metin kendinden emin metin olarak okunur. Halüsinasyonlu bir olguya iliştirilmiş yerleşik bir “emin değilim” sinyali yoktur; harici doğrulamanın size düşmesinin nedeni tam da budur.

Sadece metin tahmin ediyorsa neden bu kadar iyi?
Çünkü bir sonraki token’ı iyi tahmin etmek, esasen tüm yazılı insan bilgisi boyunca, dil, olgular ve akıl yürütme hakkında şaşırtıcı miktarda yapıyı kodlamayı gerektirir. Görevin basitliği ile sonucun zenginliği, alanın tüm sürprizidir. Gerisini ölçek yaptı, Tablo 1’in gösterdiği gibi.

Yapay zekayı iyi kullanmak için bunu anlamam gerekir mi?
Mühendisliğe ihtiyacınız yok. Zihinsel modele ihtiyacınız var, çünkü çıktıya ne zaman güveneceğinizi ve ne zaman kontrol edeceğinizi söyleyen o. Mekanizmaya dair doğru bir modeli olan insanlar, aracı bir zihin ya da arama motoru gibi ele alanlara göre tutarlı biçimde daha fazla değer elde eder ve daha az pahalı hata yapar.


Kaynaklar: Vaswani ve diğerleri, “Attention Is All You Need,” 2017; Stanford İnsan Merkezli Yapay Zeka Enstitüsü, AI Index Raporu 2025; transformatör dil modelleri ve sinir ağı eğitimi üzerine temel makine öğrenmesi literatürü.


Bu içerik, derinlemesine bir araştırmanın ardından yapay zeka desteğiyle derlenmiş ve CEOtudent editör ekibi tarafından yazılıp yayına hazırlanmıştır.

Benzer içerikler