Güvenilir yapay zekâ kararları için LLM'leri biçimsel çözücülerle birleştirme

Hibrit mimari, güvenilir ve doğrulanabilir kurumsal kararlar üretmek için LLM esnekliğini deterministik çözücülerle birleştirir.

Büyük dil modelleri (LLM'ler), doğal dili anlama, akıcı yanıtlar üretme ve tamamen yeni müşteri ve çalışan deneyimlerine güç verme konusunda olağanüstü ilerleme kaydetti. Ancak LLM'ler doğası gereği stokastik olduğundan, karmaşık sayısal veya mantıksal akıl yürütmede kullanıldıklarında çıktılarının kurallara uygun ya da optimum olacağına dair yalnızca sınırlı güvence sunar. Örneğin:

  • Bir yönetici, yapay zekâ destekli planlama asistanına “Ship as much as possible next week while keeping costs low,” der. Sistem verimli görünen agresif bir plan sunar ancak depo kapasitesini fark ettirmeden aşar ve teslimat taahhütlerini ihlal eder.

  • Bir koordinatör, yapay zekâ asistanına “Reassign crews to reduce overnight stays and minimize disruption,” der. Model optimum görünen, daha düşük maliyetli bir program üretir ancak zorunlu görev süresi veya dinlenme kısıtlarını ihlal eder.

  • Finansal operasyonlara yönelik bir yapay zekâ asistanının, katı bölgesel kısıtlar ve risk kısıtları altında işlemleri onaylaması gerekir. Ancak asistan, iç politikayı ihlal ettiği hâlde kurallara uygun gibi görünen bir gerekçe uydurarak şüpheli bir işleme izin verir.

Katı operasyonel gereksinimlerin bulunduğu ortamlarda LLM'leri biçimsel çözücülerle birleştirmek, doğal dille yönlendirilen kararların tanımlanmış sınırlar içinde kalmasına ve uygulanamaz, optimum olmayan ya da kurallara aykırı sonuçlardan kaçınılmasına yardımcı olur.

Ar-Ge ekibimiz, LLM'lerin yaratıcılığını ve esnekliğini Z3, Pyomo ve OR-Tools gibi biçimsel matematiksel çözücülerin titizliği, güvenceleri ve şeffaflığıyla birleştiren hibrit bir yaklaşımı araştırıyor. Ayrıca bu özelliği kurumsal teknoloji yığınının standart bir parçası hâline getirmek için yeniden kullanılabilir bir biçimsel yapay zekâ motoru geliştiriyoruz. Platform, kuruluşların iş kurallarını mevcut sistemlerinden doğrudan almasını, kararları bu kurallara göre sürekli doğrulamasını ve yapay zekâ ajanlarını açıkça tanımlanmış sınırlar içinde güvenle kullanıma sunmasını sağlayacak.

Vizyonumuz, büyük ölçekte karar alma süreçlerini hızlandırırken operasyonel riski azaltmak. Liderler doğal dil girdilerinden daha hızlı ve politikalara uygun kararlar elde ederken kuruluşlar; planlama, tedarik zinciri kaynak tahsisi, finansal operasyonlar, politika doğrulama ve hatta video ya da 3D tasarımdaki anlık değişiklikleri otomatikleştirebilir. Yerleşik güvenlik önlemleri, uygulanamaz, kurallara aykırı veya güvensiz sonuçların üretime ulaşmasını engeller.

Lojistik tarzı optimizasyon problemleri ve halka açık üç kıyaslama üzerinde yürüttüğümüz kontrollü deneylerde hibrit yaklaşımımız sürekli olarak şunları gösterdi:

  • Daha yüksek doğruluk

  • Daha yüksek yorumlanabilirlik ve denetlenebilirlik

Hibrit mimari

Yaklaşımımız, alışılmış “LLM her şeyi yapar” paradigmasını tersine çevirerek şu tasarımı izliyor:

Büyük dil modelleri ile deterministik çözücülerin doğal dil anlayışını doğrulanabilir optimizasyonla nasıl birleştirdiğini karşılaştıran diyagram.

Bu yaklaşım sorumlulukları net biçimde ayırır: LLM'ler doğal dilden kuralları ve kısıtları çıkarırken OR-Tools, Z3 ve Pyomo gibi deterministik çözücüler optimizasyonu ve doğrulamayı gerçekleştirir. Sonuç, her iki yaklaşımın güçlü yanlarını birleştirir:

LLM'ler

Çözücüler

Hibrit (LLM + Çözücü)

Farklı alanlardaki insan niyetini anlama

✅ Mükemmel

❌ Yok

✅ Mükemmel

Deterministik davranış

❌ Hayır

✅ Garantili

✅ Evet

Birden çok kısıt altında matematiksel akıl yürütme ve optimizasyonda kanıtlanabilir doğruluk

⚠️ Kırılgan

✅ Garantili

✅ Evet

Denetlenebilirlik ve yorumlanabilirlik

⚠️ Kırılgan

✅ Net

✅ Net

Prompt gürültüsüne ve enjeksiyona direnç

❌ Savunmasız

✅ Bağışık

✅ Güçlü

Deneysel çalışma 1: Lojistik ve iş gücü atamaları

Problem alanı

Bazı müşterilerimizin karşılaştığı bir zorlukla başladık:

Operasyon, politika ve maliyet kısıtlarını sıkı biçimde uygularken doğal dildeki istekleri optimum ve gerçek zamanlı kaynak kararlarına dönüştürmek.

Bu zorluk; iş gücü planlama, varlık tahsisi, yönlendirme, sipariş karşılama planlaması ve kapasite yönetimi dâhil modern lojistik ve tedarik zincirlerinin merkezinde yer alır. Aynı zamanda güvenilir sistemler üretmek için LLM'ler ile biçimsel çözücülerin birlikte çalışması gereken alandır. Değerlendirmemiz için kontrollü test senaryoları, veri kaynakları ve kısıtların yanı sıra 240 sentetik sorgu oluşturduk. Örnekler:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Sorgular, sistemin katı ve esnek kısıtları doğrudan doğal dildeki isteklerden güvenilir biçimde çıkarıp uygulaması gerektiğini gösteriyor:

  • Katı kısıtlar müzakereye açık değildir (ör. en erken başlangıç tarihleri, sözleşme koşulları ve kapasite üst sınırları). Bunlardan herhangi birinin ihlal edilmesi çözümü geçersiz kılar.

  • Esnek kısıtlar, gecikmeleri en aza indirme, maliyetleri azaltma ve değişiklikleri sınırlama gibi tercihleri ifade eder. Amaç, katı sınırları aşmadan optimizasyon yapmaktır.

Bu optimizasyon problemlerinin bazı yönleri önceden tamamen tanımlanamaz. Bunların yalnızca yapılandırılmış iş mantığı, iç belgeler ve operasyonel verilerde önceden tanımlanmış kısıtlar ile hedeflerden değil, kullanıcı isteğinden de yararlanılarak dinamik biçimde oluşturulması gerekir.

Değerlendirdiğimiz yaklaşımlar

Farklı tekniklerin bu ortamda nasıl performans gösterdiğini anlamak için üç yaklaşımı uygulayıp karşılaştırdık.

  1. Saf LLM: En basit yaklaşımda ilgili tüm veriler ve kullanıcının doğal dildeki isteği tek bir LLM promptuna aktarılır; LLM'den optimum bir plan veya tahsis üretmesi istenir. Bu yaklaşım küçük veya gevşek kısıtlı problemlerde işe yarayabilse de karmaşıklık arttıkça yetersiz kalır. Model kısıtları göz ardı edebilir, yanlış hedefe öncelik verebilir veya makul görünen ancak uygulanamaz planlar üretebilir. Üstelik hataları güvenilir biçimde tespit etmenin ya da önlemenin bir yolu yoktur.

  2. LLM + Kod Çalıştırma Aracı: Bu yaklaşımda LLM isteği yorumlar; veri kaynaklarına erişmek ve çalıştırılabilir optimizasyon kodu üretmek için araçları kullanır. Bu, esnekliği ve gözlemlenebilirliği artırsa da güvenilirlik sorun olmaya devam eder. LLM'nin kısıtları yine doğru koda çevirmesi gerekir. Özellikle kısıtların sayısı arttıkça küçük akıl yürütme veya kodlama hataları geçersiz ya da optimum olmayan sonuçlara yol açabilir.

  3. Hibrit: LLM → yapılandırılmış kısıtlar → deterministik çözücü: Üçüncü yaklaşım sorumlulukları birbirinden ayırır. LLM sonucu hiçbir zaman “kararlaştırmaz”; değişkenlerin, kısıtların ve hedeflerin biçimsel olarak tanımlanmasına yardımcı olur. Kendini kanıtlamış bir optimizasyon çözücüsü kısıtları uygular, uygulanabilirliği garanti eder ve doğrulanıp denetlenebilen sonuçlar üretir. LLM'nin rolü, doğal dildeki istekleri önceden tanımlanmış şemalar kullanarak açık ve yapılandırılmış kısıtlara dönüştürmekle sınırlıdır. Bu kısıtlar otomatik olarak OR-Tools gibi çözücülerin koduna derlenir; çözücü de uygulanabilir ve optimum çözümü deterministik biçimde hesaplar.

Sonuçlar

Yöntemleri GPT-5, GPT-5.1 ve GPT-5.2 dâhil çeşitli LLM'lerle test ettik. Beklendiği gibi hibrit yaklaşım alternatiflerden daha iyi performans gösterdi:

Yöntem

Atama doğruluğu

Ortalama gecikme

Sorgu başına kullanılan token

Saf LLM

%70–78

62–190 sn.

~175.000

LLM + Kod Çalıştırma Aracı

%82–84

62–140 sn.

~9.000

LLM → Çözücü (Hibrit)

%95–97

6–25 sn.

~2.000

Hibrit yöntemimiz doğrulukta önemli bir artış, 4 kattan fazla token verimliliği ve gecikmede yaklaşık on kat azalma sağlıyor.

Deneysel çalışma 2: Doğal dilden genel amaçlı optimizasyon

Bir sonraki adımımız, doğal dili yapılandırılmış anlamsal gösterimlere dönüştüren, genellenebilir ve yeniden kullanılabilir bir arayüz geliştirmek. Arka uç sistemimiz bu gösterimleri çözücüye hazır koda çevirebilir. Bu deneyde doğrusal optimizasyon problemlerine odaklandık ve yaklaşımı halka açık üç veri kümesiyle karşılaştırarak değerlendirdik: NLP4LP, NL4OPT ve IndustryOR.

Değerlendirdiğimiz yaklaşımlar

  1. Bağımsız LLM

  2. Hibrit yöntem (LLM → yapılandırılmış kurallar → çözücü → doğrulanmış çıktı)

Doğal dildeki isteklerden yapılandırılmış kısıtlara, deterministik çözüme ve doğrulanmış çıktıya uzanan hibrit iş akışını gösteren diyagram.

  • Girdiden değişkenleri, kısıtları ve hedefleri çıkarmak ve yapılandırılmış bir optimizasyon problemi oluşturmak için LLM kullanın.

  • Öz doğrulama için yapılandırılmış problemi ve özgün isteği bir LLM'ye aktarın.

  • Optimum atamayı hesaplamak için yapılandırılmış problemi OR-Tools koduna dönüştürün.

Sonuçlar

Bu yaklaşımı GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max ve GPT-5.2 dâhil tescilli en üst seviye modellerin yanı sıra Kimi K2, GPT-OSS modelleri ve MiniMax M2 gibi açık kaynaklı modellerle değerlendirdik. Kutu grafikleri her yöntemin sonuçlarını özetliyor.

Optimizasyon kıyaslamalarında bağımsız büyük dil modelleriyle çözücü tabanlı hibrit yaklaşımları karşılaştıran grafik.

Hibrit yaklaşım, değerlendirilen temel dil modellerinin neredeyse tamamında bağımsız LLM referansına kıyasla sürekli olarak daha doğru, istikrarlı ve doğrulanabilir sonuçlar üretiyor. Mutlak performans modeller arasında değişse de hibrit yaklaşımın sağladığı göreli kazanımlar tutarlı kalıyor. Bu durum, iyileştirmelerin tek bir modelin akıl yürütme yeteneğine dayanmak yerine doğal dil anlayışıyla biçimsel optimizasyonun birbirinden ayrılmasından kaynaklandığını gösteriyor.

Doğruluk

Ağırlıklı olarak doğrusal programlama problemlerinden oluşan NLP4LP ve NL4OPT'de hibrit yöntem, üst sınıra yakın doğruluğa ulaşıyor ve bağımsız LLM promptlarından daha iyi performans gösteriyor. Hibrit sistem, “yaklaşık olarak doğru” akıl yürütme üretmek yerine geçerli ve düzgün oluşturulmuş matematiksel formülasyonları daha tutarlı biçimde üretiyor. Daha zorlu IndustryOR veri kümesinde her iki yöntemin doğruluğu da azalıyor, ancak bunun nedenleri farklı. Birçok IndustryOR problemi; araç yönlendirme, görev sıralama ve iş gücü ataması gibi, çözücü arka ucumuzun şu anda desteklediği doğrusal optimizasyon yeteneklerini aşan kombinatoryal yapılar içeriyor.

Hata biçimlerinin analizi, aşağıda gösterildiği gibi bağımsız LLM'lerin gerekli kısıtları sık sık ihlal ettiğini ortaya koyuyor:

Örnek 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Bağımsız LLM, toplam yağ miktarı daha düşük bir çözüm üretiyor ancak hindili öğünlerin tüm öğünlerin en fazla %40'ını oluşturması şartını ihlal ediyor. Hibrit yaklaşım bu katı kısıtı doğru biçimde uyguluyor ve geçerli bir yanıt döndürüyor.

Örnek 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Bağımsız LLM yine daha düşük deşarjlı bir çözüm üretiyor ancak izin verilen azami ağrı kesici sınırını aşıyor. Hibrit yaklaşım bu katı kısıtı doğru biçimde uyguluyor ve geçerli bir yanıt döndürüyor.

Gecikme ve token kullanımı

Gecikme ve token kullanım verileri önemli bir ayrımı ortaya koyuyor. Hibrit yaklaşımın ortalama gecikmesi ve token kullanımı, tek seferlik bir LLM promptuna göre daha yüksektir; ancak bu durum verimsizlikten değil, mimari tercihlerden kaynaklanır.

Hibrit işlem hattı şunları içerir:

  1. Yapılandırılmış değişkenleri, kısıtları ve hedefleri çıkarmak için bir veya daha fazla LLM çağrısı.

  2. İç tutarsızlıkları yakalamaya yönelik bir öz doğrulama adımı.

Bu adımlar tek bir prompta kıyasla ek yük getirse de gecikme sınırlı ve öngörülebilir kalır; problem doğru biçimde oluşturulduğunda çözücü genellikle hızlı çalışır. Bu ek çalışma; açık, yeniden kullanılabilir ve denetlenebilir ara gösterimler oluşturur. Buna karşılık bağımsız LLM yaklaşımları, akıl yürütmeyi tek ve şeffaf olmayan bir üretim sürecine sıkıştırarak maliyetleri yeniden denemelere, manuel kontrollere ve sonraki aşamalardaki hatalara kaydırır. Gelecekteki sürümlerde bu ek yük şu yöntemlerle azaltılabilir:

  • Çıkarılan şemaları önbelleğe alma.

  • Kısıtları artımlı olarak güncelleme.

  • Prompt ve çağrı orkestrasyonunu iyileştirme.

Şeffaflık ve denetlenebilirlik

Son olarak, her iki yöntemin de başarısız olduğu durumlarda bile hata biçimleri temelden farklıdır.

  • Bağımsız bir LLM'de hatalar çoğu zaman sessizdir: Model, belli belirsiz yanlış bir sonuç döndürebilir.

  • Hibrit yaklaşımda problemin açıkça formüle edilmesi, hataları görünür kılar ve ekiplerin formülasyonun hangi bölümünün hataya yol açtığını belirlemesine yardımcı olur.

Gelecekteki sürümler, bu formülasyonları bir arayüzde göstererek kullanıcıların çözücü çalışmadan önce bunları denetlemesine veya doğrulamasına olanak tanıyabilir. Bu şeffaflık, ölçülen doğruluğu artırır ve sistemin hata ayıklama ile iyileştirme süreçlerini kolaylaştırır. Bu da gerçek dünyada kullanıma sunulması için kritik önemdedir.

Temel çıkarım

Tüm kıyaslamalarda ve test edilen temel modellerin çoğunda sonuçlar, çalışmamızın ana çıkarımını destekliyor:

LLM'ler niyeti anlama ve dönüştürme konusunda güçlüdür; ancak doğruluğu güvence altına almak için deterministik çözücüler vazgeçilmezdir.

Hibrit yaklaşım, doğal dili bir belirsizlik kaynağı olmaktan çıkarıp matematiksel açıdan sağlam karar alma süreçleri için güvenilir bir arayüze dönüştürür. Böylece kurumsal yapay zekâyı yalnızca akıllı değil, aynı zamanda güvenilir sistemlere bir adım daha yaklaştırır.

Sırada ne var: Kurumlar için yeniden kullanılabilir biçimsel yapay zekâ motoru

Kurumsal kısıtlar nadiren düzenli şemalarda veya kusursuz biçimde ifade edilmiş promptlarda bulunur. Veritabanlarına, elektronik tablolara, iç politikalara ve sözleşmelere dağılmış durumdadırlar. Kullanıcı istekleri eksik, belirsiz veya iş kurallarıyla tutarsız olabilir. Bu yaklaşımın büyük ölçekte çalışmasını sağlamak için söz konusu karmaşıklığı güvenilir bir kurumsal yeteneğe dönüştüren, yeniden kullanılabilir bir arka uç motoru geliştiriyoruz.

İş kuralları, çözücüye çeviri ve denetlenebilir karar alma dâhil olmak üzere kurumsal biçimsel yapay zekâ motorunu gösteren diyagram.

Platform

Bu motor özünde yapay zekâ destekli karar sistemleri için biçimsel bir omurga görevi görür ve şunları sağlar:

  • İş kurallarını, kısıtları, değişkenleri ve hedefleri alan bağdaştırıcılara sahip sembolik bir bilgi tabanı.

  • Şemaları çözücü koduna derleyen bir çeviri katmanı.

  • Ekiplerin kısıtları incelemesine, denetlemesine ve değiştirmesine olanak tanıyan arayüzler.

Değer yarattığı alanlar

Bu deneyler şu anda optimizasyona odaklansa da aynı yöntem mantıksal doğrulamaya da genişletilebilir. Olası iş uygulamaları şunlardır:

  • Tüm operasyonel kısıtları uygularken anlık ve dinamik planlama, yönlendirme ve kaynak tahsisi gerçekleştirme.

  • İş kurallarına sürekli uyan yanıtlar ve öneriler üretme.

  • Karmaşık 3D nesneleri, videoları ve mimarileri tasarlayıp doğrularken uygulanamaz tasarımları üretimden önce tespit etme.

Son düşünceler

Günümüzde yapay zekâ güçlüdür; ancak kurumların güçten fazlasına, yani doğruluğa, tutarlılığa ve kontrole ihtiyacı vardır. Hibrit LLM ve çözücü sistemimiz, şu özelliklere sahip bir dünyaya doğru atılmış bir adımdır:

  • Ajanlar kural veya kısıt uydurmaz.

  • Mantıksal çıkarım ve optimizasyon matematiksel açıdan sağlamdır.

  • Doğal dil, deterministik sistemler için evrensel bir arayüz görevi görür.

Yazar

Peng Seng Ang