Büyük dil modelleri (LLM'ler), doğal dili anlama, akıcı yanıtlar üretme ve tamamen yeni müşteri ve çalışan deneyimlerine güç verme konusunda olağanüstü ilerleme kaydetti. Ancak LLM'ler doğası gereği stokastik olduğundan, karmaşık sayısal veya mantıksal akıl yürütmede kullanıldıklarında çıktılarının kurallara uygun ya da optimum olacağına dair yalnızca sınırlı güvence sunar. Örneğin:
Bir yönetici, yapay zekâ destekli planlama asistanına “Ship as much as possible next week while keeping costs low,” der. Sistem verimli görünen agresif bir plan sunar ancak depo kapasitesini fark ettirmeden aşar ve teslimat taahhütlerini ihlal eder.
Bir koordinatör, yapay zekâ asistanına “Reassign crews to reduce overnight stays and minimize disruption,” der. Model optimum görünen, daha düşük maliyetli bir program üretir ancak zorunlu görev süresi veya dinlenme kısıtlarını ihlal eder.
Finansal operasyonlara yönelik bir yapay zekâ asistanının, katı bölgesel kısıtlar ve risk kısıtları altında işlemleri onaylaması gerekir. Ancak asistan, iç politikayı ihlal ettiği hâlde kurallara uygun gibi görünen bir gerekçe uydurarak şüpheli bir işleme izin verir.
Katı operasyonel gereksinimlerin bulunduğu ortamlarda LLM'leri biçimsel çözücülerle birleştirmek, doğal dille yönlendirilen kararların tanımlanmış sınırlar içinde kalmasına ve uygulanamaz, optimum olmayan ya da kurallara aykırı sonuçlardan kaçınılmasına yardımcı olur.
Ar-Ge ekibimiz, LLM'lerin yaratıcılığını ve esnekliğini Z3, Pyomo ve OR-Tools gibi biçimsel matematiksel çözücülerin titizliği, güvenceleri ve şeffaflığıyla birleştiren hibrit bir yaklaşımı araştırıyor. Ayrıca bu özelliği kurumsal teknoloji yığınının standart bir parçası hâline getirmek için yeniden kullanılabilir bir biçimsel yapay zekâ motoru geliştiriyoruz. Platform, kuruluşların iş kurallarını mevcut sistemlerinden doğrudan almasını, kararları bu kurallara göre sürekli doğrulamasını ve yapay zekâ ajanlarını açıkça tanımlanmış sınırlar içinde güvenle kullanıma sunmasını sağlayacak.
Vizyonumuz, büyük ölçekte karar alma süreçlerini hızlandırırken operasyonel riski azaltmak. Liderler doğal dil girdilerinden daha hızlı ve politikalara uygun kararlar elde ederken kuruluşlar; planlama, tedarik zinciri kaynak tahsisi, finansal operasyonlar, politika doğrulama ve hatta video ya da 3D tasarımdaki anlık değişiklikleri otomatikleştirebilir. Yerleşik güvenlik önlemleri, uygulanamaz, kurallara aykırı veya güvensiz sonuçların üretime ulaşmasını engeller.
Lojistik tarzı optimizasyon problemleri ve halka açık üç kıyaslama üzerinde yürüttüğümüz kontrollü deneylerde hibrit yaklaşımımız sürekli olarak şunları gösterdi:
Daha yüksek doğruluk
Daha yüksek yorumlanabilirlik ve denetlenebilirlik
Yaklaşımımız, alışılmış “LLM her şeyi yapar” paradigmasını tersine çevirerek şu tasarımı izliyor:


Bu yaklaşım sorumlulukları net biçimde ayırır: LLM'ler doğal dilden kuralları ve kısıtları çıkarırken OR-Tools, Z3 ve Pyomo gibi deterministik çözücüler optimizasyonu ve doğrulamayı gerçekleştirir. Sonuç, her iki yaklaşımın güçlü yanlarını birleştirir:
LLM'ler | Çözücüler | Hibrit (LLM + Çözücü) | |
|---|---|---|---|
Farklı alanlardaki insan niyetini anlama | ✅ Mükemmel | ❌ Yok | ✅ Mükemmel |
Deterministik davranış | ❌ Hayır | ✅ Garantili | ✅ Evet |
Birden çok kısıt altında matematiksel akıl yürütme ve optimizasyonda kanıtlanabilir doğruluk | ⚠️ Kırılgan | ✅ Garantili | ✅ Evet |
Denetlenebilirlik ve yorumlanabilirlik | ⚠️ Kırılgan | ✅ Net | ✅ Net |
Prompt gürültüsüne ve enjeksiyona direnç | ❌ Savunmasız | ✅ Bağışık | ✅ Güçlü |
Bazı müşterilerimizin karşılaştığı bir zorlukla başladık:
Operasyon, politika ve maliyet kısıtlarını sıkı biçimde uygularken doğal dildeki istekleri optimum ve gerçek zamanlı kaynak kararlarına dönüştürmek.
Bu zorluk; iş gücü planlama, varlık tahsisi, yönlendirme, sipariş karşılama planlaması ve kapasite yönetimi dâhil modern lojistik ve tedarik zincirlerinin merkezinde yer alır. Aynı zamanda güvenilir sistemler üretmek için LLM'ler ile biçimsel çözücülerin birlikte çalışması gereken alandır. Değerlendirmemiz için kontrollü test senaryoları, veri kaynakları ve kısıtların yanı sıra 240 sentetik sorgu oluşturduk. Örnekler:
Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.
Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.
Sorgular, sistemin katı ve esnek kısıtları doğrudan doğal dildeki isteklerden güvenilir biçimde çıkarıp uygulaması gerektiğini gösteriyor:
Katı kısıtlar müzakereye açık değildir (ör. en erken başlangıç tarihleri, sözleşme koşulları ve kapasite üst sınırları). Bunlardan herhangi birinin ihlal edilmesi çözümü geçersiz kılar.
Esnek kısıtlar, gecikmeleri en aza indirme, maliyetleri azaltma ve değişiklikleri sınırlama gibi tercihleri ifade eder. Amaç, katı sınırları aşmadan optimizasyon yapmaktır.
Bu optimizasyon problemlerinin bazı yönleri önceden tamamen tanımlanamaz. Bunların yalnızca yapılandırılmış iş mantığı, iç belgeler ve operasyonel verilerde önceden tanımlanmış kısıtlar ile hedeflerden değil, kullanıcı isteğinden de yararlanılarak dinamik biçimde oluşturulması gerekir.
Farklı tekniklerin bu ortamda nasıl performans gösterdiğini anlamak için üç yaklaşımı uygulayıp karşılaştırdık.
Saf LLM: En basit yaklaşımda ilgili tüm veriler ve kullanıcının doğal dildeki isteği tek bir LLM promptuna aktarılır; LLM'den optimum bir plan veya tahsis üretmesi istenir. Bu yaklaşım küçük veya gevşek kısıtlı problemlerde işe yarayabilse de karmaşıklık arttıkça yetersiz kalır. Model kısıtları göz ardı edebilir, yanlış hedefe öncelik verebilir veya makul görünen ancak uygulanamaz planlar üretebilir. Üstelik hataları güvenilir biçimde tespit etmenin ya da önlemenin bir yolu yoktur.
LLM + Kod Çalıştırma Aracı: Bu yaklaşımda LLM isteği yorumlar; veri kaynaklarına erişmek ve çalıştırılabilir optimizasyon kodu üretmek için araçları kullanır. Bu, esnekliği ve gözlemlenebilirliği artırsa da güvenilirlik sorun olmaya devam eder. LLM'nin kısıtları yine doğru koda çevirmesi gerekir. Özellikle kısıtların sayısı arttıkça küçük akıl yürütme veya kodlama hataları geçersiz ya da optimum olmayan sonuçlara yol açabilir.
Hibrit: LLM → yapılandırılmış kısıtlar → deterministik çözücü: Üçüncü yaklaşım sorumlulukları birbirinden ayırır. LLM sonucu hiçbir zaman “kararlaştırmaz”; değişkenlerin, kısıtların ve hedeflerin biçimsel olarak tanımlanmasına yardımcı olur. Kendini kanıtlamış bir optimizasyon çözücüsü kısıtları uygular, uygulanabilirliği garanti eder ve doğrulanıp denetlenebilen sonuçlar üretir. LLM'nin rolü, doğal dildeki istekleri önceden tanımlanmış şemalar kullanarak açık ve yapılandırılmış kısıtlara dönüştürmekle sınırlıdır. Bu kısıtlar otomatik olarak OR-Tools gibi çözücülerin koduna derlenir; çözücü de uygulanabilir ve optimum çözümü deterministik biçimde hesaplar.
Yöntemleri GPT-5, GPT-5.1 ve GPT-5.2 dâhil çeşitli LLM'lerle test ettik. Beklendiği gibi hibrit yaklaşım alternatiflerden daha iyi performans gösterdi:
Yöntem | Atama doğruluğu | Ortalama gecikme | Sorgu başına kullanılan token |
|---|---|---|---|
Saf LLM | %70–78 | 62–190 sn. | ~175.000 |
LLM + Kod Çalıştırma Aracı | %82–84 | 62–140 sn. | ~9.000 |
LLM → Çözücü (Hibrit) | %95–97 | 6–25 sn. | ~2.000 |
Hibrit yöntemimiz doğrulukta önemli bir artış, 4 kattan fazla token verimliliği ve gecikmede yaklaşık on kat azalma sağlıyor.
Bir sonraki adımımız, doğal dili yapılandırılmış anlamsal gösterimlere dönüştüren, genellenebilir ve yeniden kullanılabilir bir arayüz geliştirmek. Arka uç sistemimiz bu gösterimleri çözücüye hazır koda çevirebilir. Bu deneyde doğrusal optimizasyon problemlerine odaklandık ve yaklaşımı halka açık üç veri kümesiyle karşılaştırarak değerlendirdik: NLP4LP, NL4OPT ve IndustryOR.
Bağımsız LLM
Hibrit yöntem (LLM → yapılandırılmış kurallar → çözücü → doğrulanmış çıktı)


Girdiden değişkenleri, kısıtları ve hedefleri çıkarmak ve yapılandırılmış bir optimizasyon problemi oluşturmak için LLM kullanın.
Öz doğrulama için yapılandırılmış problemi ve özgün isteği bir LLM'ye aktarın.
Optimum atamayı hesaplamak için yapılandırılmış problemi OR-Tools koduna dönüştürün.
Bu yaklaşımı GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max ve GPT-5.2 dâhil tescilli en üst seviye modellerin yanı sıra Kimi K2, GPT-OSS modelleri ve MiniMax M2 gibi açık kaynaklı modellerle değerlendirdik. Kutu grafikleri her yöntemin sonuçlarını özetliyor.


Hibrit yaklaşım, değerlendirilen temel dil modellerinin neredeyse tamamında bağımsız LLM referansına kıyasla sürekli olarak daha doğru, istikrarlı ve doğrulanabilir sonuçlar üretiyor. Mutlak performans modeller arasında değişse de hibrit yaklaşımın sağladığı göreli kazanımlar tutarlı kalıyor. Bu durum, iyileştirmelerin tek bir modelin akıl yürütme yeteneğine dayanmak yerine doğal dil anlayışıyla biçimsel optimizasyonun birbirinden ayrılmasından kaynaklandığını gösteriyor.
Doğruluk
Ağırlıklı olarak doğrusal programlama problemlerinden oluşan NLP4LP ve NL4OPT'de hibrit yöntem, üst sınıra yakın doğruluğa ulaşıyor ve bağımsız LLM promptlarından daha iyi performans gösteriyor. Hibrit sistem, “yaklaşık olarak doğru” akıl yürütme üretmek yerine geçerli ve düzgün oluşturulmuş matematiksel formülasyonları daha tutarlı biçimde üretiyor. Daha zorlu IndustryOR veri kümesinde her iki yöntemin doğruluğu da azalıyor, ancak bunun nedenleri farklı. Birçok IndustryOR problemi; araç yönlendirme, görev sıralama ve iş gücü ataması gibi, çözücü arka ucumuzun şu anda desteklediği doğrusal optimizasyon yeteneklerini aşan kombinatoryal yapılar içeriyor.
Hata biçimlerinin analizi, aşağıda gösterildiği gibi bağımsız LLM'lerin gerekli kısıtları sık sık ihlal ettiğini ortaya koyuyor:
Örnek 1:
Plain Text
Bağımsız LLM, toplam yağ miktarı daha düşük bir çözüm üretiyor ancak hindili öğünlerin tüm öğünlerin en fazla %40'ını oluşturması şartını ihlal ediyor. Hibrit yaklaşım bu katı kısıtı doğru biçimde uyguluyor ve geçerli bir yanıt döndürüyor.
Örnek 2:
Plain Text
Bağımsız LLM yine daha düşük deşarjlı bir çözüm üretiyor ancak izin verilen azami ağrı kesici sınırını aşıyor. Hibrit yaklaşım bu katı kısıtı doğru biçimde uyguluyor ve geçerli bir yanıt döndürüyor.
Gecikme ve token kullanımı
Gecikme ve token kullanım verileri önemli bir ayrımı ortaya koyuyor. Hibrit yaklaşımın ortalama gecikmesi ve token kullanımı, tek seferlik bir LLM promptuna göre daha yüksektir; ancak bu durum verimsizlikten değil, mimari tercihlerden kaynaklanır.
Hibrit işlem hattı şunları içerir:
Yapılandırılmış değişkenleri, kısıtları ve hedefleri çıkarmak için bir veya daha fazla LLM çağrısı.
İç tutarsızlıkları yakalamaya yönelik bir öz doğrulama adımı.
Bu adımlar tek bir prompta kıyasla ek yük getirse de gecikme sınırlı ve öngörülebilir kalır; problem doğru biçimde oluşturulduğunda çözücü genellikle hızlı çalışır. Bu ek çalışma; açık, yeniden kullanılabilir ve denetlenebilir ara gösterimler oluşturur. Buna karşılık bağımsız LLM yaklaşımları, akıl yürütmeyi tek ve şeffaf olmayan bir üretim sürecine sıkıştırarak maliyetleri yeniden denemelere, manuel kontrollere ve sonraki aşamalardaki hatalara kaydırır. Gelecekteki sürümlerde bu ek yük şu yöntemlerle azaltılabilir:
Çıkarılan şemaları önbelleğe alma.
Kısıtları artımlı olarak güncelleme.
Prompt ve çağrı orkestrasyonunu iyileştirme.
Şeffaflık ve denetlenebilirlik
Son olarak, her iki yöntemin de başarısız olduğu durumlarda bile hata biçimleri temelden farklıdır.
Bağımsız bir LLM'de hatalar çoğu zaman sessizdir: Model, belli belirsiz yanlış bir sonuç döndürebilir.
Hibrit yaklaşımda problemin açıkça formüle edilmesi, hataları görünür kılar ve ekiplerin formülasyonun hangi bölümünün hataya yol açtığını belirlemesine yardımcı olur.
Gelecekteki sürümler, bu formülasyonları bir arayüzde göstererek kullanıcıların çözücü çalışmadan önce bunları denetlemesine veya doğrulamasına olanak tanıyabilir. Bu şeffaflık, ölçülen doğruluğu artırır ve sistemin hata ayıklama ile iyileştirme süreçlerini kolaylaştırır. Bu da gerçek dünyada kullanıma sunulması için kritik önemdedir.
Temel çıkarım
Tüm kıyaslamalarda ve test edilen temel modellerin çoğunda sonuçlar, çalışmamızın ana çıkarımını destekliyor:
LLM'ler niyeti anlama ve dönüştürme konusunda güçlüdür; ancak doğruluğu güvence altına almak için deterministik çözücüler vazgeçilmezdir.
Hibrit yaklaşım, doğal dili bir belirsizlik kaynağı olmaktan çıkarıp matematiksel açıdan sağlam karar alma süreçleri için güvenilir bir arayüze dönüştürür. Böylece kurumsal yapay zekâyı yalnızca akıllı değil, aynı zamanda güvenilir sistemlere bir adım daha yaklaştırır.
Kurumsal kısıtlar nadiren düzenli şemalarda veya kusursuz biçimde ifade edilmiş promptlarda bulunur. Veritabanlarına, elektronik tablolara, iç politikalara ve sözleşmelere dağılmış durumdadırlar. Kullanıcı istekleri eksik, belirsiz veya iş kurallarıyla tutarsız olabilir. Bu yaklaşımın büyük ölçekte çalışmasını sağlamak için söz konusu karmaşıklığı güvenilir bir kurumsal yeteneğe dönüştüren, yeniden kullanılabilir bir arka uç motoru geliştiriyoruz.


Bu motor özünde yapay zekâ destekli karar sistemleri için biçimsel bir omurga görevi görür ve şunları sağlar:
İş kurallarını, kısıtları, değişkenleri ve hedefleri alan bağdaştırıcılara sahip sembolik bir bilgi tabanı.
Şemaları çözücü koduna derleyen bir çeviri katmanı.
Ekiplerin kısıtları incelemesine, denetlemesine ve değiştirmesine olanak tanıyan arayüzler.
Bu deneyler şu anda optimizasyona odaklansa da aynı yöntem mantıksal doğrulamaya da genişletilebilir. Olası iş uygulamaları şunlardır:
Tüm operasyonel kısıtları uygularken anlık ve dinamik planlama, yönlendirme ve kaynak tahsisi gerçekleştirme.
İş kurallarına sürekli uyan yanıtlar ve öneriler üretme.
Karmaşık 3D nesneleri, videoları ve mimarileri tasarlayıp doğrularken uygulanamaz tasarımları üretimden önce tespit etme.
Günümüzde yapay zekâ güçlüdür; ancak kurumların güçten fazlasına, yani doğruluğa, tutarlılığa ve kontrole ihtiyacı vardır. Hibrit LLM ve çözücü sistemimiz, şu özelliklere sahip bir dünyaya doğru atılmış bir adımdır:
Ajanlar kural veya kısıt uydurmaz.
Mantıksal çıkarım ve optimizasyon matematiksel açıdan sağlamdır.
Doğal dil, deterministik sistemler için evrensel bir arayüz görevi görür.