Meta-Harness: Güvenli, kendini geliştiren kurumsal AI iş akışları

Disiplinli bir meta-düzenek, kurumsal ekiplerin uzun soluklu kodlama görevlerindeki ajan iş akışlarını güvenle geliştirmesine yardımcı olur.

Yönetici özeti

  • Mevcut otonom iyileştirme sistemleri kodlama görevlerinde güçlü sonuçlar gösterdi. Ancak gerçek kurumsal uygulamalara benzeyen, karmaşık ve uzun soluklu yapay zekâ iş akışlarını geliştirip geliştiremeyecekleri hâlâ belirsiz.

  • Meta-Harness araştırmamız; otonom öz iyileştirmeyi ajan tabanlı erişim, derin araştırma ve sinyal istihbaratı iş akışlarına uygularken ayrılmış değerlendirme, denetlenebilirlik, bütçe kontrolleri ve insan onayı gibi kurumsal gereksinimleri de ekliyor.

  • Meta-Harness, üç temsili iş yükünde performansı önemli ölçüde artırdı. Signal Engine'in ayrılmış test performansında %84 iyileşme, Ajan Tabanlı Çok Modlu Erişim'de ise daha yüksek doğrulukla 16 kat daha hızlı yürütme sağladı.

  • Meta-Harness, önceki yaklaşımların çoğundan farklı olarak iyileştirmelerin optimizasyonda kullanılan verilerin ötesine genellenip genellenmediğini ölçmek için mümkün olan her durumda başarıyı ayrılmış veri kümelerinde değerlendirir.

  • Bu sonuçlar, otonom iş akışı iyileştirmenin kodlama kıyaslamalarının ötesine geçerek gerçek kurumsal yapay zekâ sistemlerine uzanabileceğini ve sürekli gelişen yapay zekâ uygulamaları için uygulanabilir bir yol sunduğunu gösteriyor.

Meta-Harness makalesi, CORAL çerçevesi ve karpathy/autoresearch dâhil otonom yapay zekâ araştırmalarındaki son çalışmalar, bir değerlendirme ölçütü verildiğinde kodlama ajanlarının çözümü yinelemeli olarak geliştirebildiğini gösterdi. Yanıt bekleyen soru, bu yöntemlerin uzun soluklu yapay zekâ iş akışlarında işe yarayıp yaramadığıdır. Bunlar arasında bir ajanın soruyu yanıtlamak için çok modlu alan derlemlerinde yinelemeli arama yaptığı ajan tabanlı çok modlu erişim ile birbirine bağlı çok sayıda adım, araç çağrısı ve istisna işleme kararı gerektiren karmaşık veri işleme işlem hatları yer alır. Daha temel soru ise kazanımların, optimize edicinin hiç görmediği verilerde de korunup korunmadığıdır.

Meta-Harness Ar-Ge çalışmamız bu soruya verdiğimiz yanıttır. Yakın tarihli araştırmalardaki fikirleri kurumsal ihtiyaçlara göre yeniden şekillendirir: ayrılmış değerlendirme, denetim izleri, maliyet üst sınırları ve herhangi bir şey kullanıma sunulmadan önce insan inceleyiciye açık bir devir noktası.

Sistemi, gerçek müşteri çalışmalarından modellenen üç uzun soluklu görevde test ettik. Signal Engine, yapay zekâ pazarıyla ilgili canlı X gönderisi akışını izler ve kaynakları sağlam, yapılandırılmış eğilim raporları üretir. Ajan Tabanlı Çok Modlu Erişim, en ilgili belge sayfalarını döndürmek için metin ve görsel içeren karma sorgular üzerinde akıl yürütür. Derin Araştırma, web'de arama yapmak, kaynakları çapraz kontrol etmek ve uzun araştırma raporları yazmak üzere birden çok ajanı koordine eder.

Bir bakışta sonuçlar

  • Signal Engine: ayrılmış test bileşik puanı 0,456 → 0,841; göreli artış %84. CORAL ve karpathy/autoresearch aynı bütçeyle 0,50'nin altında kaldı.

  • Ajan Tabanlı Çok Modlu Erişim: ayrılmış NDCG@10 puanı 0,705 → 0,744; değerlendirme başına geçen süre ise 869 saniyeden 54 saniyeye düştü. Bu, daha yüksek doğrulukla 16 kat hızlanma demektir.

  • Derin Araştırma: 10 referans soruda rapor kalitesi bileşik puanı 0,449 → 0,802; temel yöntemlerin puanı ise yaklaşık 0,52. Bu görevde ayrılmış veri bölümü bulunmadığından sonucu yalnızca örneklem içi kabul ediyoruz.

  • Arama verimliliği: Öngörülü Hipotez Yeniden Sıralaması sayesinde Signal Engine, aynı değerlendirme bütçesiyle referans çalışmanın en iyi puanının %91'ine 20 yerine 3 yinelemede ulaştı.

Çoğu otonom araştırma sistemi aynı veri kümesinde hem optimizasyon hem değerlendirme yapar; bu da sonucun genellenip genellenmediğini belirlemeyi imkânsız kılar. Signal Engine ve Ajan Tabanlı Çok Modlu Erişim için katı bir ayrım uyguluyoruz: adayların puan alabildiği eğitim kümesi, doğrulama kontrolleri için geliştirme kümesi ve optimize edicinin hiç görmediği ayrılmış test kümesi. Bildirilen her sonuç, tüm veri bölümlerinde puanlanan belirli tek bir kod sürümünden gelir. Böylece bir adayın en iyi eğitim puanıyla başka bir adayın en iyi test puanını asla birleştirmeyiz.

Nasıl çalışır?

Düzenek, her turda kodda yapılacak değişikliklere yönelik bir grup yapılandırılmış hipotez üretir. Her hipotez, değiştirmek istediği mekanizmayı, temel aldığı önceki sürümü ve hedeflediği hata biçimini belirtir. Bir sıralama adımı, maliyetli değerlendirmelere geçilmeden önce grubu filtreler. Kalan hipotezler, ortak bir bilgi tabanını paylaşan ancak kodu tamamen yalıtılmış çalışma alanlarında düzenleyen paralel çalışan ajanlara gönderilir; böylece her aday adil ve bağımsız biçimde puanlanır. Turun sonunda yürütücü tek bir kazananı seçer: görünür veri bölümlerindeki tüm kontrolleri geçen en yüksek puanlı aday. Bu kazanan, sonraki turun temel alacağı en üst seviye aday olur. Her deneme; kod yamasını, veri bölümü bazındaki puanları, olay günlüğünü ve iz, hatalar, maliyet ile değerlendirme üzerine LLM tarafından yazılmış dört kısa analizi değiştirilemez bir kanıt deposuna kaydeder. Sonraki turun önericisi bu geçmişi yeniden okur; böylece düzenek aynı çıkmazları tekrar denemek yerine öğrendiklerini birikimli olarak kullanır.

Girdileri, başlangıç değerlendirmesini, hipotez aramasını, paralel ajan ekiplerini, değerlendirme çalışma alanını, inceleme çıktılarını, kanıt deposunu ve güvenlik ile maliyet kontrollerini gösteren Meta-Harness iş akışı şeması.

Üç koruyucu önlem, döngünün güvenle çalışmasını sağlar. Kapsam politikası, adayın değiştirebileceği dosyaları sınırlar ve kapsam dışındaki tüm değişiklikleri geri alır. Token ve çalışma süresi bütçeleri, harcama üst sınırı aşılınca çalışmayı durdurur; eş zamanlılık sınırları da düzeneğin model ve GPU hız sınırları içinde kalmasını sağlar. Ayrıca düzenek hiçbir şeyi kendisi kullanıma sunmaz. Sıralanmış ve eksiksiz belgelenmiş bir aday üretir; bir mühendis de değişiklikleri inceleyerek üretime alınıp alınmayacağına karar verir.

Altyapı

Yerel teknoloji yığınında, yukarıdaki döngünün her turunu beş mühendislik bileşeni destekler.

  • Çalışma Alanı Yalıtımı. Her aday için bir git çalışma ağacı. Ayrı kopyalar aynı nesne veri tabanını paylaşır ancak birbirlerinin dosyalarına erişmez. Böylece adaylar disk maliyeti neredeyse değişmeden paralel çalışabilir ve mevcut en üst seviye adayla farkları kolayca karşılaştırılabilir.

  • Yürütme Korumalı Alanı. Yapılandırmaya göre iki mod sunar: hızlı yineleme için yerel alt süreç veya tamamen yalıtılmış çalışma ortamı. Derlemler salt okunur olarak bağlanır ve denemeye özel geçici dizin, puanlamadan sonra silinir. Böylece bir deneme veri kümesini değiştiremez veya sonraki denemeye durum bilgisi sızdıramaz.

  • Kapsam Politikası. Deney yapılandırmasında tanımlanan izinli yol listesi. Kapsam dışında değiştirilen her şey deneme puanlanmadan önce geri alınır ve deneme işaretlenir. Dolayısıyla inceleyicinin gördüğü değişikliklerin belirtilen kapsam içinde kalması garanti edilir.

  • Bütçe Denetimi. Üç katman vardır: deneme başına token ve çalışma süresi sınırları, çalışma başına toplam üst sınır ve eş zamanlılık sınırı. Bunlar birlikte harcamayı öngörülebilir kılar ve düzeneğin model ile altyapı hız sınırları içinde kalmasını sağlar.

  • Kanıt Deposu. Kod yamasını, veri bölümü bazındaki puanları, olay günlüğünü ve LLM tarafından yazılmış dört analizi içeren, yalnızca kayıt eklenebilen bir JSONL dosyası. Somutlaştırılmış görünümler (liderlik tablosu, en üst seviye aday ve hata dizini) her denemeden sonra yeniden oluşturulur. Böylece sonraki turlar geçmişten yararlanırken her çalışma bayt düzeyinde yeniden üretilebilir kalır.

Bu bileşenlerin hiçbiri isteğe bağlı değildir. Düzeneğin amacı, çalışma sonunda inceleyiciye gerçekten onaylayabileceği bir sonuç sunmaktır: kazanan aday, sınırları belirli değişiklikler, denenen her şeyin eksiksiz kaydı ve bilinen bir maliyet. Bu beş bileşenden herhangi biri kaldırılırsa söz konusu garantilerden biri ortadan kalkar.

Öngörülü hipotez yeniden sıralaması

Üç deney de aynı hipotez stratejisini kullanır. Önerici, her yinelemede bütçenin çalıştırmaya yetmeyeceği kadar çok hipotez üretir: K = 4 dağıtım bütçesi için M = 8 aday. Ardından ayrı bir LLM sıralayıcı, tüm resmi önünde görerek 8 adayı otuz saniyelik tek bir çağrıda sıralar: mevcut en iyi puan ve zayıf boyutları, son denemelerin hata analizleri ve yan yana sunulan 8 önerinin tümü. İlk 4 aday, her biri 15 ila 30 dakika süren yürütme için çalıştırıcıya gönderilir. Diğer 4 aday, herhangi bir harcama yapmadan elenir.

Değerlendirmeler

Temel modeller süreç boyunca sabit tutuldu; düzenek yalnızca çevrelerindeki kodu düzenledi. Signal Engine ve Derin Araştırma, gpt-5.5 üzerinde çalıştırıldı. Ajan Tabanlı Çok Modlu Erişim, vLLM üzerinden yerel olarak sunulan açık ağırlıklı Qwen3.6-35B-A3B ile çalıştırıldı ve ColQwen3-4B görsel erişim modeliyle eşleştirildi. Bu kombinasyon, öngörülebilir şirket içi maliyet için seçildi.

Aşağıdaki grafik, üç ana görevimizin puanlarının nasıl değiştiğini gösteriyor. "Seed", bir mühendisin yazdığı başlangıç kodunu; "Meta-Harness" ise Meta-Harness'ın bulduğu en iyi versiyonu ifade ediyor. Üç görevin tümünde ayrılmış test kümesinde performans artışı görüyoruz.

Signal Engine, Ajan Tabanlı Çok Modlu Erişim ve Derin Araştırma performansında başlangıç sürümü ile Meta-Harness'ı karşılaştıran çubuk grafik; Meta-Harness tüm ayrılmış testlerde daha yüksek sonuç veriyor.

Signal Engine, 150 eğitim tweet'i ve 150 ayrılmış test tweet'i kullanılarak güncellik, olgusal doğruluk, ayrıntı düzeyi ve üslup açısından bir LLM hakemi tarafından değerlendirildi. Çalışma boyunca en iyi sürüm, eğitim bileşik puanını 0,431'den 0,756'ya, ayrılmış test puanını ise 0,456'dan 0,841'e yükseltti. Kazanımlar yalnızca prompt ayarlarından değil, düzeneğin kendisindeki değişikliklerden kaynaklandı: kazanan yinelemeler sosyal medya gürültüsünü filtrelemeyi öğrendi, olguları çapraz kontrol eden adımlar ekledi ve her çıktının açık kanıtlara dayanmasını zorunlu kıldı. Aşağıdaki şema, yineleme sürecini gösteriyor.

Signal Engine eğitim denemelerini gösteren çizgi grafik; o ana kadarki en iyi puanlar ile ayrılmış test puanları, yinelemeli keşif ve iyileştirme denemeleri boyunca başlangıç düzeyinden hedefe doğru yükseliyor.

Deneme geçmişi, bu kazanımların nasıl biriktiğini gösteriyor. İlk yapısal değişiklik, o ana kadarki en iyi puanı 0,625'e yükseltti; daha ayrıntılı kanıt işleme bu puanı 0,679'a çıkardı; iyileştirilmiş değerlendirme ve ölçüt döngüsü ise 0,819'a taşıdı. Tüm aday çalışmalarının yaklaşık yarısı düşük performans gösterdi veya tamamen başarısız oldu; ancak liderlik tablosunu bozmadılar. Her ayrı kopya yalıtılmış biçimde çalıştı, kaybeden değişiklikler silindi ve hatalar değerlendirme deposuna yazılarak sonraki önericinin aynı çıkmazı tekrarlaması önlendi.

En önemlisi, ayrılmış veri eğrisi çalışma boyunca eğitim eğrisiyle birlikte yükseldi. Bu durum, düzeneğin eğitim derlemini ezberlemek yerine iş akışını geliştirdiğini gösteriyor. Ayrılmış veri puanları eğitim puanlarından biraz yüksekti; bunu küçük ve birbiriyle kesişmeyen iki veri bölümü arasındaki olağan örnekleme gürültüsü olarak yorumluyoruz.

Ajan Tabanlı Çok Modlu Erişim, herkese açık ViDoRe V3 Bilgisayar Bilimi bölümünde NDCG@10 ile ölçülür. Bu bölüm 20 eğitim, 10 geliştirme ve 20 ayrılmış test sorgusu içerecek şekilde düzenlenmiştir. Düzenek, ayrılmış NDCG@10 puanını 0,705'ten 0,744'e yükseltirken toplam değerlendirme süresini 869 saniyeden 54 saniyeye indirdi.

Derin Araştırma, DeepResearch-Eval izlenerek 10 referans soruda içerik kalitesi ile referans kalitesini birleştiren ve LLM tarafından değerlendirilen bir bileşik puanla ölçülür. Geliştirilen kod, ortalamayı 0,449'dan 0,802'ye yükseltti. Kazandıran değişiklikler fark görünümünde kolayca görülüyordu: araştırma ajanları görevlendirilmeden önce yaklaşımları karşılaştıran bir ön planlama adımı ve raporların geçmişte düşük puan aldığı boyutlara odaklanan bir son inceleme adımı. Bu küme küçük ve değerlendirmesi pahalı olduğundan veri bölümlerine ayırmadık; sonucu örneklem içi kabul ediyoruz.

CORAL ve karpathy/autoresearch ile karşılaştırma

Signal Engine, Ajan Tabanlı Çok Modlu Erişim ve Derin Araştırma puanları ile değerlendirme gecikmesi açısından Meta-Harness, CORAL ve karpathy/autoresearch'ü karşılaştıran çubuk grafikler.

Üç yöntemi de aynı bütçeyle kıyasladık: aynı veri kümeleri, aynı temel modeller, aynı yineleme sınırı ve aynı toplam aday değerlendirmesi. Signal Engine'de Meta-Harness, ayrılmış testte 0,841 puana ulaşırken iki temel yöntem de 0,50'nin altında kaldı. Ajan Tabanlı Çok Modlu Erişim'de ekibimiz en yüksek ayrılmış NDCG@10 puanına sahip (0,744; CORAL 0,700 ve karpathy 0,738) ve resmî değerlendirmeyi 12 ila 14 kat daha hızlı çalıştırıyor: 786 ve 650 saniyeye karşı 54 saniye. Derin Araştırma'da ekibimiz 0,802 puana ulaşırken iki temel yöntem de 0,52 civarında kaldı. Tüm sonuçlar için bir noktayı göz önünde bulundurmak gerekir: CORAL ve karpathy/autoresearch'ü yayımlanan açıklamalarına göre yeniden uyguladık. Bu nedenle farkın bir kısmı yalnızca yöntemlerden değil, uygulama farklılıklarından kaynaklanabilir.

Farkı dört tasarım tercihi açıklıyor. İlk olarak ekibimiz, herhangi bir kod düzenlenmeden önce yapılandırılmış bir tasarım tanımı oluşturuyor. Bu da sistemi prompt ayarları yerine yeni işlem hattı aşamaları gibi yapısal değişikliklere yöneltiyor. İkinci olarak sistem, paylaşılan bir en üst seviye adayı temel alan eş zamanlı ayrı kopyalar çalıştırıyor. Böylece iyileştirmeler, CORAL'ın bağımsız ajanlarına veya karpathy'nin tamamen sıralı döngüsüne göre daha hızlı birikiyor. Üçüncü olarak her deneme, sonraki önericinin yeniden okuduğu yapılandırılmış çıktılar (puanlar, olay günlükleri ve LLM tarafından yazılmış dört analiz) bırakırken temel yöntemler yalnızca düz deneme günlüklerini saklıyor. Dördüncü olarak uyarlanabilir bir denetleyici, ilerleme durduğunda önericiyi keşfe, başarıdan sonra ise iyileştirmeye yöneltiyor. Bunun üzerindeki Öngörülü Hipotez Yeniden Sıralaması da zayıf fikirleri bütçe harcamadan önce eliyor.

Henüz göstermediklerimiz

Ayrılmış veri eğrileri, alanlar arası aktarımı değil alan içi genellemeyi gösteriyor. Yapay zekâ pazarı sinyallerini çıkarmak için ayarlanmış bir iş akışının, düzenek yeniden çalıştırılmadan hukuk veya biyotıp metinlerinde de başarılı olması beklenmemelidir. Düzenek yalnızca puanlayıcının tanımladığı hedefe doğru ilerler. Bu nedenle gürültülü bir eğitim kümesine veya hatalı kalibre edilmiş bir hakeme sadakatle aşırı uyum sağlar. Ciddi bir çalışma öncesinde özenle seçilmiş en az 20 eğitim öğesi ve ayrı bir geliştirme bölümü öneriyoruz. En büyük pratik kısıt maliyettir. Her değerlendirme, işlem hattının tamamını tüm veri bölümlerinde yeniden çalıştırır. Yalnızca seçilen erişim adayı yaklaşık 2,2 milyon girdi tokeni tüketmiştir ve gpt-5.5 sınıfı bir modelde ciddi bir optimizasyonun görev başına maliyeti yüzlerce dolardan birkaç bin dolara kadar çıkabilir. Son olarak bu rakamlar tekrarlanan denemelerden değil, tekil çalışmalardan geliyor. Bu yüzden sonuçları resmî bir araştırma yerine mühendislik blog yazısı olarak paylaşıyoruz.

Sonuç

Meta-Harness, otonom kod iyileştirmenin kurumsal kullanıma uygun disiplinle uygulanabileceğini gösteriyor. Bunun temel unsurları yapısal hipotezler, öngörülü ön filtreleme, yalıtılmış değerlendirme, verilerin elverdiği her durumda ayrılmış testler ve kullanıma alınan her değişikliğin ardında eksiksiz bir denetim izidir. Bunlar birlikte mühendislik ekibine çalışan bir başlangıç işlem hattından ölçülebilir biçimde daha iyi bir sürüme giden öngörülebilir bir yol sunar. Operasyon sorumlusuna da basit bir model sağlar: otonom keşfin getirisi, hiçbir şey kullanıma sunulmadan önce insan denetimi içeren, katı ve bütçe odaklı bir çerçeve içinde tutulur.

Yazarlar

David Huang, Bjorn Jee