Fő navigáció

LLM-ek és formális megoldók a megbízható MI-döntésekért

A hibrid architektúra az LLM-ek rugalmasságát determinisztikus megoldókkal ötvözi, így megbízható, ellenőrizhető vállalati döntéseket eredményez.

A nagy nyelvi modellek (LLM-ek) rendkívüli fejlődést értek el a természetes nyelv megértésében és a gördülékeny válaszok létrehozásában, valamint teljesen új ügyfél- és munkavállalói élményeket tesznek lehetővé. Mivel azonban az LLM-ek eredendően sztochasztikusak, összetett numerikus vagy logikai érvelésre használva csak korlátozottan garantálható, hogy eredményük megfelel az előírásoknak vagy optimális lesz. Például:

  • Egy vezető ezt mondja egy MI-alapú tervezési asszisztensnek: „Ship as much as possible next week while keeping costs low,” a rendszer pedig agresszív tervet készít, amely hatékonynak tűnik, de észrevétlenül túllépi a raktári kapacitást, és veszélyezteti a garantált szállításokat.

  • Egy koordinátor ezt mondja egy MI-asszisztensnek: „Reassign crews to reduce overnight stays and minimize disruption,” a modell pedig olcsóbb, látszólag optimális beosztást készít, amely megsérti a kötelező szolgálati időre vagy pihenőidőre vonatkozó korlátokat.

  • Egy pénzügyi műveleteket támogató MI-asszisztensnek szigorú regionális és kockázati korlátok alapján kell jóváhagynia a tranzakciókat, mégis engedélyez egy gyanús ügyletet egy olyan, az előírásoknak megfelelőnek hangzó indoklással, amely valójában sérti a belső szabályzatot.

Szigorú működési követelmények mellett az LLM-ek és a formális megoldók kombinációja segít biztosítani, hogy a természetes nyelven vezérelt döntések a meghatározott határokon belül maradjanak, elkerülve a megvalósíthatatlan, szuboptimális vagy szabálytalan eredményeket.

K+F csapatunk olyan hibrid megközelítést vizsgál, amely az LLM-ek kreativitását és rugalmasságát a formális matematikai megoldók – például a Z3, a Pyomo és az OR-Tools – szigorúságával, garanciáival és átláthatóságával ötvözi. Emellett egy újrahasznosítható formális MI-motort is fejlesztünk, hogy ez a képesség a vállalati technológiai környezet alapvető részévé váljon. A platform lehetővé teszi a szervezetek számára, hogy közvetlenül meglévő rendszereikből töltsék be üzleti szabályaikat, folyamatosan ellenőrizzék a döntéseket e szabályok alapján, és biztonságosan telepítsenek MI-ügynököket egyértelműen meghatározott keretek között.

Célunk a működési kockázat csökkentése, miközben nagy léptékben gyorsítjuk a döntéshozatalt. A vezetők természetes nyelvű bemenetek alapján gyorsabban hozhatnak szabályzatoknak megfelelő döntéseket, a szervezetek pedig automatizálhatják az ütemezés, az ellátásilánc-erőforrások elosztása, a pénzügyi műveletek, a szabályzat-ellenőrzés, sőt a videó- és 3D-tervezés eseti módosításait is. A beépített védelmi mechanizmusok megakadályozzák, hogy megvalósíthatatlan, szabálytalan vagy nem biztonságos eredmények kerüljenek éles környezetbe.

A logisztikai jellegű optimalizálási problémákon és három nyilvános benchmarkon végzett kontrollált kísérletekben hibrid megközelítésünk következetesen a következőket mutatta:

  • Nagyobb pontosság

  • Jobb értelmezhetőség és auditálhatóság

A hibrid architektúra

Megközelítésünk szakít a megszokott, „az LLM mindent elvégez” paradigmával, és ehelyett a következő felépítést követi:

Diagram arról, hogyan ötvözik a nagy nyelvi modellek és a determinisztikus megoldók a természetes nyelv megértését az ellenőrizhető optimalizálással.

Ez a megközelítés egyértelműen elválasztja a feladatköröket: az LLM-ek természetes nyelvből nyerik ki a szabályokat és korlátokat, míg a determinisztikus megoldók – például az OR-Tools, a Z3 és a Pyomo – végzik az optimalizálást és az ellenőrzést. Az eredmény mindkét megközelítés erősségeit egyesíti:

LLM-ek

Megoldók

Hibrid (LLM + megoldó)

Az emberi szándék megértése különböző területeken

✅ Kiváló

❌ Nincs

✅ Kiváló

Determinisztikus működés

❌ Nem

✅ Garantált

✅ Igen

Bizonyíthatóan helyes matematikai érvelés és optimalizálás több korlát mellett

⚠️ Megbízhatatlan

✅ Garantált

✅ Igen

Auditálhatóság és értelmezhetőség

⚠️ Megbízhatatlan

✅ Egyértelmű

✅ Egyértelmű

Ellenállás az utasítászajjal és az utasításinjektálással szemben

❌ Sebezhető

✅ Immunis

✅ Erős

1. kísérleti terület: logisztikai és munkaerő-hozzárendelések

A problématerület

Egy olyan kihívással kezdtünk, amellyel néhány ügyfelünk is szembesül:

A természetes nyelvű kérések optimális, valós idejű erőforrás-döntésekké alakítása a működési, szabályozási és költségkorlátok szigorú érvényesítése mellett.

Ez a kihívás a modern logisztika és ellátási láncok középpontjában áll, beleértve a munkaerő ütemezését, az eszközök elosztását, az útvonaltervezést, a teljesítéstervezést és a kapacitáskezelést. Ezen a területen kell az LLM-eknek és a formális megoldóknak együttműködniük ahhoz, hogy megbízható rendszerek szülessenek. Az értékeléshez kontrollált tesztforgatókönyveket, adatforrásokat és korlátokat, valamint 240 szintetikus lekérdezést készítettünk. Példák:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

A lekérdezésekből látható, hogy a rendszernek megbízhatóan kell kinyernie és érvényesítenie a természetes nyelvű kérésekben szereplő szigorú és rugalmas korlátokat:

  • A szigorú korlátok nem képezhetik alku tárgyát (például a legkorábbi kezdési dátumok, a szerződéses feltételek és a kapacitáskorlátok). Bármelyik megsértése érvénytelenné teszi a megoldást.

  • A rugalmas korlátok preferenciákat írnak le, például a késések, a költségek és a változtatások minimalizálását. A cél az optimalizálás a szigorú korlátok átlépése nélkül.

Ezeknek az optimalizálási problémáknak bizonyos elemei nem határozhatók meg teljesen előre. Ezeket dinamikusan kell összeállítani, nemcsak a strukturált üzleti logikából, belső dokumentumokból és működési adatokból származó, előre meghatározott korlátok és célok, hanem a felhasználói kérés alapján is.

Az értékelt megközelítések

Három megközelítést valósítottunk meg és hasonlítottunk össze, hogy megértsük, miként teljesítenek a különböző technikák ebben a környezetben.

  1. Tisztán LLM-alapú: A legegyszerűbb megközelítés az összes releváns adatot és a felhasználó természetes nyelvű kérését egyetlen LLM-utasításnak adja át, amelynek optimális tervet vagy elosztást kell készítenie. Ez kis méretű vagy kevés korláttal rendelkező problémáknál működhet, de a komplexitás növekedésével megbízhatatlanná válik. A modell figyelmen kívül hagyhat korlátokat, rossz célt helyezhet előtérbe, vagy észszerűnek hangzó, de megvalósíthatatlan terveket készíthet, miközben nincs megbízható módszer a hibák észlelésére vagy megelőzésére.

  2. LLM + kódértelmező: Ebben a megközelítésben az LLM értelmezi a kérést, és eszközökkel fér hozzá az adatforrásokhoz, illetve futtatható optimalizálási kódot hoz létre. Ez növeli a rugalmasságot és a megfigyelhetőséget, de a megbízhatóság továbbra is problémát jelent. Az LLM-nek továbbra is helyes kódra kell fordítania a korlátokat, az érvelési vagy kódolási hibák pedig érvénytelen vagy szuboptimális eredményeket okozhatnak, különösen a korlátok számának növekedésével.

  3. Hibrid: LLM → strukturált korlátok → determinisztikus megoldó: A harmadik megközelítés szétválasztja a feladatköröket. Az LLM soha nem „dönt” az eredményről; a változók, korlátok és célfüggvények formalizálásában segít. Egy bevált optimalizálási megoldó érvényesíti a korlátokat, garantálja a megvalósíthatóságot, és ellenőrizhető, auditálható eredményeket készít. Az LLM szerepe arra korlátozódik, hogy a természetes nyelvű kéréseket előre meghatározott sémák segítségével explicit, strukturált korlátokká alakítsa. Ezeket a korlátokat a rendszer automatikusan megoldókódra – például OR-Tools-kódra – fordítja, amely determinisztikusan kiszámítja a megvalósítható, optimális megoldást.

Eredmények

A módszereket több LLM-mel, köztük a GPT-5, GPT-5.1 és GPT-5.2 modellel teszteltük. A várakozásoknak megfelelően a hibrid megközelítés felülmúlta az alternatívákat:

Módszer

Hozzárendelési pontosság

Átlagos késleltetés

Lekérdezésenként felhasznált tokenek

Tisztán LLM-alapú

70–78%

62–190 mp

~175 000

LLM + kódértelmező

82–84%

62–140 mp

~9000

LLM → megoldó (hibrid)

95–97%

6–25 mp

~2000

Hibrid módszerünk jelentősen növeli a pontosságot, több mint négyszeres tokenhatékonyságot ér el, és nagyságrenddel csökkenti a késleltetést.

2. kísérleti terület: általános célú optimalizálás természetes nyelvből

Következő lépésként olyan általánosítható, újrahasznosítható felületet hozunk létre, amely a természetes nyelvet strukturált szemantikai reprezentációkká alakítja, háttérrendszerünk pedig ezeket megoldásra kész kóddá fordíthatja. Ebben a kísérletben lineáris optimalizálási problémákra összpontosítottunk, és három nyilvános adatkészleten (NLP4LP, NL4OPT és IndustryOR) értékeltük a megközelítést.

Az értékelt megközelítések

  1. Önálló LLM

  2. Hibrid módszer (LLM → strukturált szabályok → megoldó → ellenőrzött eredmény)

A természetes nyelvű kérésektől a strukturált korlátokon és determinisztikus megoldáson át az ellenőrzött eredményig vezető hibrid munkafolyamat diagramja.

  • LLM használata a változók, korlátok és célfüggvények kinyerésére a bemenetből, majd egy strukturált optimalizálási probléma megfogalmazása.

  • A strukturált probléma és az eredeti kérés átadása egy LLM-nek önellenőrzés céljából.

  • A strukturált probléma OR-Tools-kódra fordítása az optimális hozzárendelés kiszámításához.

Eredmények

A megközelítést saját fejlesztésű élvonalbeli modellekkel – köztük a GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max és GPT-5.2 modellel –, valamint nyílt forráskódú modellekkel, például a Kimi K2, a GPT-OSS modellek és a MiniMax M2 használatával értékeltük. A dobozdiagramok módszerenként összegzik az eredményeket.

Önálló nagy nyelvi modelleket és hibrid, megoldóalapú megközelítéseket összehasonlító diagram optimalizálási benchmarkokon.

A hibrid megközelítés szinte az összes vizsgált alapul szolgáló nyelvi modell esetében következetesen pontosabb, stabilabb és ellenőrizhetőbb eredményeket ad, mint az önálló LLM-re épülő viszonyítási alap. Bár az abszolút teljesítmény modellenként változik, a hibrid megközelítés relatív előnyei következetesek maradnak. Ez arra utal, hogy a javulás a természetes nyelv megértésének és a formális optimalizálásnak a szétválasztásából ered, nem pedig egyetlen modell érvelési képességéből.

Pontosság

Az elsősorban lineáris programozási problémákból álló NLP4LP és NL4OPT adatkészleten a hibrid módszer közel maximális pontosságot ér el, és felülmúlja az önálló LLM-utasításokat. A „nagyjából helyes” érvelés helyett a hibrid rendszer következetesebben hoz létre érvényes, megfelelően felépített matematikai megfogalmazásokat. A nehezebb IndustryOR adatkészleten mindkét módszer pontossága csökken, de eltérő okokból. Számos IndustryOR-probléma olyan kombinatorikus struktúrákat – például járművek útvonaltervezését, feladatok sorrendbe állítását és munkaerő-hozzárendelést – tartalmaz, amelyek meghaladják a megoldó-háttérrendszerünk által jelenleg támogatott lineáris optimalizálási képességeket.

A hibamódok elemzése szerint az önálló LLM-ek gyakran megsértik az előírt korlátokat, amint az alább látható:

1. példa:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Az önálló LLM alacsonyabb teljes zsírtartalmú megoldást készít, de megsérti azt a követelményt, hogy a pulykás vacsorák legfeljebb az étkezések 40%-át tehetik ki. A hibrid megközelítés helyesen érvényesíti ezt a szigorú korlátot, és érvényes választ ad.

2. példa:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Az önálló LLM ismét alacsonyabb kibocsátású megoldást készít, de túllépi a fájdalomcsillapítók megengedett felső határát. A hibrid megközelítés helyesen érvényesíti ezt a szigorú korlátot, és érvényes választ ad.

Késleltetés és tokenhasználat

A késleltetési és tokenhasználati adatok fontos különbségre világítanak rá. A hibrid megközelítés átlagos késleltetése és tokenhasználata nagyobb, mint egyetlen LLM-utasításé, de ez nem hatékonysági problémát, hanem architekturális döntéseket tükröz.

A hibrid folyamat részei:

  1. Egy vagy több LLM-hívás a strukturált változók, korlátok és célfüggvények kinyeréséhez.

  2. Önellenőrzési lépés a belső ellentmondások észlelésére.

Bár ezek a lépések egyetlen utasításhoz képest többletterhelést jelentenek, a késleltetés korlátozott és kiszámítható marad, a jól megfogalmazott problémát pedig a megoldó jellemzően gyorsan feldolgozza. A többletmunka explicit, újrahasznosítható és auditálható köztes reprezentációkat hoz létre. Ezzel szemben az önálló LLM-megközelítések az érvelést egyetlen átláthatatlan generálási folyamatba sűrítik, így a költségek az ismételt próbálkozásokban, a kézi ellenőrzésekben és a későbbi hibákban jelentkeznek. A későbbi változatok a következőkkel csökkenthetik ezt a többletterhelést:

  • A kinyert sémák gyorsítótárazása.

  • A korlátok inkrementális frissítése.

  • Az utasítások és hívások összehangolásának javítása.

Átláthatóság és auditálhatóság

Végül még akkor is alapvetően eltér a hibamód, ha mindkét módszer kudarcot vall.

  • Önálló LLM használatakor a hibák gyakran rejtve maradnak: a modell olyan eredményt adhat, amely csak alig észrevehetően helytelen.

  • A hibrid megközelítésben a probléma explicit megfogalmazása láthatóvá teszi a hibákat, és segít a csapatoknak azonosítani, hogy a megfogalmazás mely része okozta őket.

A későbbi verziók egy felületen is megjeleníthetik ezeket a megfogalmazásokat, így a felhasználók még a megoldó futtatása előtt auditálhatják vagy ellenőrizhetik őket. Ez az átláthatóság javítja a mért pontosságot, valamint megkönnyíti a rendszer hibakeresését és továbbfejlesztését, ami elengedhetetlen a valós környezetben történő bevezetéshez.

Legfontosabb tanulság

Az összes benchmark és a tesztelt alapmodellek többségének eredményei megerősítik munkánk egyik központi következtetését:

Az LLM-ek kiválóan értelmezik és fordítják le a szándékot, de a helyesség érvényesítéséhez nélkülözhetetlenek a determinisztikus megoldók.

A hibrid megközelítés a természetes nyelvet a bizonytalanság forrásából a matematikailag megalapozott döntéshozatal megbízható felületévé alakítja, így a vállalati MI közelebb kerül az egyszerre intelligens és megbízható rendszerekhez.

Következő lépés: újrahasznosítható formális MI-motor vállalatoknak

A vállalati korlátok ritkán találhatók rendezett sémákban vagy tökéletesen megfogalmazott utasításokban. Adatbázisokban, táblázatokban, belső szabályzatokban és szerződésekben szétszórva jelennek meg. A felhasználói kérések hiányosak, kétértelműek vagy az üzleti szabályokkal ellentétesek lehetnek. A megközelítés nagy léptékű alkalmazásához olyan újrahasznosítható háttérmotort fejlesztünk, amely ezt az összetettséget megbízható vállalati képességgé alakítja.

A vállalati formális MI-motort bemutató diagram, üzleti szabályokkal, megoldókhoz végzett fordítással és auditálható döntéshozatallal.

A platform

Ez a motor alapvetően az MI-vezérelt döntési rendszerek formális gerinceként működik, és a következőket biztosítja:

  • Szimbolikus tudásbázis adapterekkel, amelyek betöltik az üzleti szabályokat, korlátokat, változókat és célfüggvényeket.

  • Fordítási réteg, amely a sémákat megoldókódra fordítja.

  • Felületek, amelyeken a csapatok megvizsgálhatják, auditálhatják és módosíthatják a korlátokat.

Hol teremt ez értéket?

Bár ezek a kísérletek jelenleg az optimalizálásra összpontosítanak, ugyanez a módszer logikai ellenőrzésre is kiterjeszthető. Lehetséges üzleti alkalmazások:

  • Eseti, dinamikus ütemezés, útvonaltervezés és erőforrás-elosztás minden működési korlát betartásával.

  • Az üzleti szabályokat következetesen betartó válaszok és ajánlások létrehozása.

  • Összetett 3D objektumok, videók és architektúrák tervezése és ellenőrzése, a megvalósíthatatlan tervek gyártás előtti kiszűrésével.

Záró gondolatok

A mai MI nagy teljesítményű, de a vállalatoknak ennél többre van szükségük: helyességre, következetességre és ellenőrizhetőségre. Hibrid LLM- és megoldórendszerünk egy lépés egy olyan világ felé, ahol:

  • Az ügynökök nem hallucinálnak szabályokat vagy korlátokat.

  • A logikai következtetés és az optimalizálás matematikailag megalapozott.

  • A természetes nyelv a determinisztikus rendszerek univerzális felületeként szolgál.

Szerző

Peng Seng Ang