Belirli bir promptun iyi çalışırken birdenbire çalışmamaya başladığı oldu mu?
Sonuçları iyileştirmeye çalışırken sistem promptunu sürekli yamadığınız, ancak hiçbir şeyin işe yaramadığı bir döngüye hiç girdiniz mi?
Sistem promptu öğrenimi tam da ihtiyacınız olan şey olabilir.
Sistem promptu öğrenimi (SPL), yapay zekâ topluluğunda ilgi görmeye başlayan bir alandır ve mayıs ayında Andrej Karpathy tarafından X'te geniş kitlelere tanıtılmıştır.
Sistem promptu öğrenimi; statik sistem promptlarına veya yönetilmesi güç ince ayar düzeneklerine dayanan, esnek olmayan ve kırılgan yapay zekâ sistemlerinin sınırlamalarını ele alır. Yapay zekâ sistemlerinde sürekli öğrenmeyi desteklemenin başka bir yolunu sunar.
Ayrıntılara geçmeden önce prompt oluşturmanın temellerini kısaca gözden geçirelim.
Bir ajan veya özel model geliştirirken öncelikle iki temel bileşen tasarlamamız gerekir:
Bir sistem promptu
Bir kullanıcı promptu
Sistem promptları, bir modelin nasıl davranması gerektiğine ilişkin temel kuralları belirler. Özel yapay zekâ çözümleri için yazıldıklarında genellikle şöyle başlarlar:
“You are an intelligent assistant. Your role is to perform <insert task here>.
You must not do (A), (B), or (C).”
Buna karşılık kullanıcı promptları genellikle kullanıcının sorgusunu ve saat dilimi ile tercihleri gibi diğer ilgili bilgileri içerir. Bir kullanıcı promptu şöyle olabilir:


I’m in the capital city of Portugal. Can you suggest some things I can do tonight?
Büyük yapay zekâ laboratuvarlarının yeni model sürümlerinden sonra sistem promptu sızıntıları yaygınlaştı; kullanıcılar, temel talimatlarını açığa çıkarmak için sohbet botlarına jailbreak uyguluyor. Popüler bir GitHub deposu artık bu sistem promptlarının birçoğunu tek yerde topluyor. Bunlar, yapay zekâ laboratuvarlarının uygun model davranışını teşvik etmek için zaman içinde geliştirdiği “gizli formülü” ortaya koyuyor. Örneğin yakın zamanda sızdırılan GPT-5 sistem promptu (ChatGPT içinde açığa çıktı) yaklaşık 6.000 kelime içeriyor. Bu da sistem davranışını şekillendirmek için ne kadar çok bilgi ve yönlendirmenin kodlanması gerektiğini gösteriyor.
Bu kapsamlı sistem promptları genellikle şu temel alanları ele alır:
Arama talimatları
Araç tanımları
Kullanıcı tercihleri
Kaynak gösterme talimatları
Bilinen sorunlara yönelik hızlı yamalar
Uygulamada özel yapay zekâ sistemlerinin geliştiricileri, uygulamalarını test edip iyileştirirken sistem promptlarını yinelemeli olarak elle yamalar ve bu iyileştirme sürecine yön vermek için çoğunlukla değerlendirmelerden yararlanır.
Bir modelin davranışını yönlendirmenin diğer yolları şunlardır:
Modele sunulan içeriği denetleyen, erişim destekli üretimi (RAG) de kapsayan prompt mühendisliği
İnce ayar (modelin temel ağırlıklarını doğrudan değiştirme)
Model davranışını etkilemenin başka bir yolu olsaydı? Daha önce üretilmiş düşünce, plan ve stratejilerden yararlanarak kendi sistem promptunu dinamik biçimde öğrenip iyileştiren bir sistem hayal edin. Çıktılarını değerlendirmek için hem kullanıcı geri bildiriminden hem de hakem olarak LLM değerlendirmelerinden yararlanabilir.
Ajan tabanlı bir sistem kullanarak otomatikleştirmek istediğiniz, süregelen bir iş sorununu düşünün. Etkili çözümler, basit iş akışı otomasyonunun ötesinde akıl yürütme becerileri gerektirir. Bu tür durumlarda yapay zekâ sisteminize plan üretme bileşeni eklemek zorunlu hâle gelir. Bu, sistemin göreve bağlı olarak birden çok ajanla farklı şekillerde çalışmasını sağlar. Adımlar, alt görevleri tamamlamak üzere diğer ajanlara erişme veya araçları kullanma talimatlarını içerebilir.


Not: Bir ajan aracı, yapay zekâ ajanının metnin ötesine geçip gerçek eylemler gerçekleştirmek için çağırabileceği herhangi bir harici işlev, API veya kaynaktır.
Modelin sistem promptuna, bir insanın izleyeceği mantıksal adımlardan oluşan bir planı “başlangıç tohumu” olarak ekleyebilirsiniz. Ancak LLM'ler genellikle araç kullanımı, çıktı biçimlendirme ve ilgili gereklilikler hakkında daha özel yönlendirmelere ihtiyaç duyar. Bazen en iyi strateji belirsiz olabilir veya daha önce çözüldüğü düşünüldüğü için yeniden değerlendirilmemiş bir problemle uğraşıyor olabilirsiniz. Sistem promptu öğrenimi (SPL) tam bu noktada devreye girer.
SPL, daha önce üretilen stratejileri dâhil ederek bir sistem promptunu yinelemeli biçimde iyileştirir. Yeni problemler ortaya çıktıkça sistem zamanla bilgi biriktirir ve daha sağlam hâle gelir. Bunu, alanınızdaki problemleri çözmek için bir el kitabı oluşturmak gibi düşünün.
SPL, kullanıcı geri bildirimlerinden elde edilen içgörüleri kademeli olarak sistem promptuna dâhil eder. Sisteminiz olgunlaştıkça daha genel ve üst düzey ilkelere dönüştürülebilecek yinelenen sorunlar keşfedebilirsiniz.
Sürecin nasıl işlediğine adım adım daha yakından bakalım:
Sistemden belirli bir görevi yerine getirmesini isteyen kullanıcı sorgusuyla başlayın.
Sisteminiz yalnızca tek bir problemi ele alıyorsa önceki çalışmalardan en yüksek puanlı stratejileri seçen “açgözlü” bir yaklaşım benimseyebilirsiniz. Alternatif olarak, yüksek puanlı stratejileri tercih ederken ara sıra düşük puanlıları da içeren bir dağılımdan örnekleme yaparak keşfi teşvik edebilirsiniz. Bu, özellikle strateji toplamaya yeni başladığınızda yararlıdır.
Farklı problem kümelerini ele almak üzere tasarlanmış sistemlerde ilgili yaklaşımları belirlemek için bir sınıflandırma katmanı eklemeyi veya gömmelerden ve kosinüs benzerliğinden (genellikle RAG'de kullanılan tekniklerle aynıdır) yararlanmayı düşünün. Bu, belirli probleme uygun stratejileri seçmenize yardımcı olur; örneğin kodlama görevlerine uyarlanmış stratejiler.
Not: Gömmeler, kosinüs benzerliğiyle birlikte kullanıldığında iki bilgi parçasının ne kadar yakından ilişkili olduğunu ölçmemizi sağlar. Böylece birebir ifadeleri farklı olsa bile belgeleri, sorguları veya fikirleri eşleştirmek kolaylaşır.
Kodlama problemlerini çözmeye yönelik basitleştirilmiş bir strateji deposu için örnek başlangıç noktası.
Not: Burada gösterilen “başlangıç stratejileri” yalnızca örnek amaçlıdır. Gerçek kodlama senaryolarında bunları daha da iyileştirirdik. Niş iş problemleri, zaman içinde ek içgörüler toplamayı gerektirir.
Üretim_kimliği (ters sıra) | Konu | Puan | Strateji_metni | Açıklama |
|---|---|---|---|---|
4 | kodlama | 1 | Problemi, kısıtlamaları ve uç durumları anlayın. Doğru veri yapılarını kullanan bir algoritma tasarlayın. Planı örnekler ve değişmezler üzerinde doğrulayın. Temiz ve okunabilir kod yazın. Yeniden düzenleme, optimizasyon ve son biçimlendirmeyle iyileştirin. Araç kullanımı: Bir araç kullanırken neden gerekli olduğunu kısaca açıklayın. | Aşağıdaki üç stratejinin en güçlü unsurlarını birleştirip harmanlar. |
3 | kodlama | 1 | Problemi, kısıtlamaları ve uç durumları anlayın. Doğru veri yapılarını kullanan bir algoritma tasarlayın. Planı örnekler ve değişmezler üzerinde doğrulayın. Temiz ve okunabilir kod yazın. Yeniden düzenleme, optimizasyon ve son biçimlendirmeyle iyileştirin. | Daha kapsamlı bir stratejidir ancak araç kullanımına ilişkin yönlendirme içermez. |
2 | kodlama | -1 | Problemi, kısıtlamaları ve uç durumları anlayın. Doğru verileri kullanan bir algoritma tasarlayın. Temiz ve okunabilir kod yazın. Araç kullanımı: Araçlara erişirken o aracı neden kullandığınızı kısaca özetleyin. | Araç kullanımından söz eden daha iyi bir stratejidir ancak hâlâ geliştirilebilir. |
1 | kodlama | -1 | Probleme göz atın. Problemi çözün. Asgari testler oluşturun. Çalışan ne varsa gönderin. | Testlerden söz etse de genel olarak zayıf bir stratejidir. |
3. N örnek seçtikten sonra bunları sistem promptuna dâhil edin. Bu, modelin çok az yönlendirmeyle plan oluşturmasını önleyerek plan üretimini önceki uzman geri bildirimlerine dayandırır. Modeli, örnek stratejileri kelimesi kelimesine kopyalamak yerine “kalıpların dışında düşünmeye” ve gerektiğinde adımlar eklemeye teşvik edin.


4. Dinamik olarak oluşturduğunuz sistem promptuyla kullanıcının isteğini ele alacak yeni bir strateji üretin. Bu süreç, nihai çıktıyı iyileştiren ek görevler üretmelidir. Amaç yaratıcılıktır: Önceki stratejilerin en güçlü unsurlarını harmanlayın, örtüşen adımları birleştirin ve gerektiğinde yararlı yeni adımlar ekleyin.
Not: Sıcaklık, daha çeşitli ve daha az belirlenimci çıktılar üretmek için ayarlanabilen bir parametredir; bu da yaratıcılık istendiğinde yararlıdır. Sıcaklık sıfırdan farklı olduğunda üretilen her plan farklı olabilir.
5. Modelin çıktısını aldıktan sonra, probleminiz için iyi bir çözümü tanımlayan belirli ölçütlere göre bir insan değerlendirici veya LLM hakemi kullanarak değerlendirin. Daha önce söz edilen Portekiz'deki etkinlikler örneği için değerlendirme ölçütleri şunları içerebilir:
Kısalık (yanıtın tek cümleyle sınırlı olması)
Önerilen etkinliğin uygunluğu
Konum doğruluğu
6. Bu değerlendirmeye dayanarak stratejiyi başka bir modelle iyileştirin. İsteğe bağlı bir geri bildirim döngüsü, insan katkısını sürece dâhil ederek iş birliğine dayalı iyileştirmeleri destekleyebilir. Sürümleri ve değişiklikleri izlemek için iyileştirilmiş stratejiyi uygun meta verilerle veri tabanınızda saklayın.


Peki neden tüm bunlarla uğraşalım? Çıktıları elle inceleyip sistem promptunu buna göre ayarlayabilirsiniz. Ancak güçlü akıl yürütme modelleri, hem çıktı bağlamından hem de insan geri bildiriminden yararlanarak stratejileri iyileştirebilir. İnsanlar basit yaklaşımlardaki kusurları kolayca fark edebilse de daha geniş problem kümelerini ele alan karmaşık sistemlerde bunları belirlemek zor ve zahmetli hâle gelir.
LLM'ler, insanların bir probleme doğal olarak kattığı bağlamsal bilgiyi toplamak için çoğu zaman ayrıntılı talimatlara ve ek adımlara ihtiyaç duyar. Bir sistem daha geniş problem kümelerini ele alacak şekilde büyüdükçe gerekli görevlerin sayısı hızla artabilir. Örneğin kodlama problemleriyle uğraşan insanlar çevredeki kod tabanını sezgisel olarak anlayabilirken bir LLM'nin önce birden çok dosyayı “okuması” gerekebilir.
Yararlı olduğu durum: Bir müşteri destek ekibi yönettiğinizi ve destek taleplerini bir yapay zekâ ajanının önceliklendirdiğini düşünün. SPL zaman içinde ekibinizin düşünmediği bir sınıflandırma yöntemi keşfederek üst kademeye aktarma oranlarını azaltabilir.
Yararlı olmadığı durum: Finansal raporlama gibi iş akışlarınız uyumluluk gereklilikleri veya düzenlemelerle zaten tanımlanmışsa yaratıcılık bir avantaj değil yük olacağından SPL çok az değer sunabilir.
Yararlı olduğu durum: Yoğun araştırma gerektiren rollerde (pazar istihbaratı veya ürün stratejisi gibi) planlarını iyileştirerek, çıktısını zenginleştirerek ve bu geliştirmeleri gelecekte kullanmak üzere sisteme dâhil ederek yapay zekâyla iş birliği yapabilirsiniz. Her etkileşim sistemin etkinliğini artırır.
Yararlı olmadığı durum: Ekibiniz yapay zekâyı çoğunlukla insan katkısının sınırlı olduğu basit iş akışlarında (ör. fatura işleme) kullanıyorsa iş birliğinin getirdiği ek yük, faydasını aşabilir.
Yararlı olduğu durum: Yeni bir bölgeye açıldığınızı ve yapay zekânın birdenbire yerel vergi sorularını yanıtlaması gerektiğini varsayın. SPL, yeni kuralları ve sezgisel yöntemleri ortaya çıktıkça hızla kodlamanızı sağlayarak hataların tekrarlanmasını önler.
Yararlı olmadığı durum: Toplantı dökümlerini standart özetlere dönüştürmek gibi ortamınızın değişmediği durumlarda sürekli uyum çok az fayda sağlar.
Teoride tüm bunlar umut verici görünse de SPL'yi uygulamak gerçek zorluklar barındırır. Başlıca zorluklardan bazılarını aşağıda ele alıyoruz:
Strateji üretiminin ilk aşamalarında ilerleme sık sık durur: Yeni çıktılar öncekileri geliştiremez ve ivme azalır. Buna genellikle iki temel sorun yol açar:
Çözüm: Sistemin yararlanabileceği derinliğe sahip olması için mevcut tüm iş bilgisini baştan kodlayın.
Çözüm: Yanıtın doğruluk, açıklık ve uygunluk gibi farklı yönlerini puanlayan ayrıntılı bir değerlendirme anahtarı tasarlayın ve örneklemenizi bu sinyalleri yansıtacak şekilde ayarlayın.
Sisteminiz yüzlerce strateji üretir ancak iyiyi kötüden ayıracak çok az geri bildirim alırsa örnekleme hızla yönetilemez hâle gelir. Çözüm budamadır.
Strateji deponuzu iyileştirirken şunları göz önünde bulundurun:
Ömür: Tanımlanan süreyi veya üretim sayısını aşan stratejileri kullanımdan kaldırın.
Puan: Sürekli düşük performans gösteren stratejileri elemek için değerlendirme anahtarınızı kullanın. Bunu ömür ölçütüyle birleştirmek, yalnızca zaman içinde değerini kanıtlayan yaklaşımları korumanızı sağlar.
LLM değerlendirmesi: Yararlı unsurları muhtemelen daha yeni sürümlere dâhil edilmiş olduğundan, artık benzersiz içgörüler sunmayan stratejileri belirlemek için düzenli değerlendirmeler yapın.
Çözüm: Strateji veri tabanınızı yaşayan bir sistem olarak ele alın; yalnızca ilgili ve yüksek değerli bilgilerin kalması için düzenli olarak budayın.
Sistem promptu öğrenimi henüz emekleme aşamasında olsa da potansiyeli çok büyük. Yalnızca statik promptlara veya bitmek bilmeyen ince ayarlara güvenen işletmeler; kırılgan sistemler, artan maliyetler ve boşa harcanan emek gibi bilindik sınırlamalarla karşılaşacaktır. SPL, zamanla gelişen ve tekil yamalar yerine üst düzey ilkeleri kodlayan sistemler oluşturarak bu döngüden çıkış yolu sunar.
SPL hâlâ gelişmekte olsa da gidişat nettir: Kendi kendine öğrenebilen sistemler, öğrenemeyenleri geride bırakacaktır. Deney yapmanın, küçük adımlarla başlamanın, çıkarılan dersleri kaydetmenin ve her etkileşimle gelişen yapay zekâ sistemlerinin temelini atmanın tam zamanı.