LLM-ide ja formaalsete lahendajate ühendamine usaldusväärseteks tehisaruotsusteks

Hübriidarhitektuur ühendab LLM-ide paindlikkuse deterministlike lahendajatega, et teha usaldusväärseid ja kontrollitavaid äriotsuseid.

Suured keelemudelid (LLM-id) on teinud erakordseid edusamme loomuliku keele mõistmisel, ladusate vastuste koostamisel ning täiesti uute kliendi- ja töötajakogemuste loomisel. Kuna LLM-id on olemuselt stohhastilised, ei anna nende kasutamine keerukaks arvuliseks või loogiliseks arutluseks kuigi kindlat garantiid, et väljund on nõuetele vastav või optimaalne. Näiteks:

  • Juht ütleb tehisarul põhinevale planeerimisabilisele: “Ship as much as possible next week while keeping costs low,” ning süsteem koostab jõulise ja pealtnäha tõhusa plaani, mis ületab varjatult lao läbilaskevõime ja rikub tarnegarantiisid.

  • Koordinaator ütleb tehisaruabilisele: “Reassign crews to reduce overnight stays and minimize disruption,” ning mudel koostab odavama ja pealtnäha optimaalse graafiku, mis rikub kohustuslikke töö- või puhkeaja piiranguid.

  • Finantstoimingute tehisaruabiline peab tehinguid heaks kiitma rangete piirkondlike ja riskipiirangute alusel, kuid laseb kahtlase tehingu läbi, mõeldes välja põhjenduse, mis näib nõuetele vastavat, kuid rikub sise-eeskirju.

Rangete tegevusnõuetega keskkondades aitab LLM-ide ühendamine formaalsete lahendajatega tagada, et loomulikul keelel põhinevad otsused jääksid määratud piiridesse ega annaks teostamatuid, alaoptimaalseid või nõuetele mittevastavaid tulemusi.

Meie teadus- ja arendusmeeskond uurib hübriidlahendust, mis ühendab LLM-ide loovuse ja paindlikkuse selliste formaalsete matemaatiliste lahendajate nagu Z3, Pyomo ja OR-Tools ranguse, garantiide ning läbipaistvusega. Samuti loome korduskasutatavat formaalset tehisarumootorit, et muuta see võimekus ettevõtte tehnoloogiapinu standardosaks. Platvorm võimaldab organisatsioonidel importida ärireegleid otse olemasolevatest süsteemidest, kontrollida otsuseid pidevalt nende reeglite alusel ning võtta tehisaruagendid turvaliselt kasutusele selgelt määratletud piirides.

Meie visioon on vähendada tegevusriski ja kiirendada samal ajal ulatuslikku otsustamist. Juhid saavad loomulikus keeles sisendi põhjal kiiremini eeskirjadele vastavaid otsuseid ning organisatsioonid saavad automatiseerida vajaduspõhiseid muudatusi graafikutes, tarneahela ressursside jaotuses, finantstoimingutes, eeskirjade kontrollis ning isegi video- või 3D-disainis. Sisseehitatud kaitsemeetmed takistavad teostamatute, nõuetele mittevastavate või ohtlike tulemuste jõudmist tootmiskeskkonda.

Logistika optimeerimisülesandeid ja kolme avalikku võrdlustesti hõlmanud kontrollitud katsetes näitas meie hübriidlahendus järjepidevalt järgmist:

  • Suurem täpsus

  • Parem tõlgendatavus ja auditeeritavus

Hübriidarhitektuur

Meie lähenemine pöörab tavapärase „LLM teeb kõike“ paradigma ümber ja järgib selle asemel järgmist ülesehitust:

Diagramm, mis võrdleb, kuidas suured keelemudelid ja deterministlikud lahendajad ühendavad loomuliku keele mõistmise kontrollitava optimeerimisega.

See lähenemine eraldab vastutuse selgelt: LLM-id eraldavad loomulikust keelest reeglid ja piirangud, deterministlikud lahendajad nagu OR-Tools, Z3 ja Pyomo aga tegelevad optimeerimise ning kontrollimisega. Tulemus ühendab mõlema lähenemise tugevused:

LLM-id

Lahendajad

Hübriid (LLM + lahendaja)

Inimese kavatsuse mõistmine eri valdkondades

✅ Suurepärane

❌ Puudub

✅ Suurepärane

Deterministlik käitumine

❌ Ei

✅ Garanteeritud

✅ Jah

Tõendatavalt korrektne matemaatiline arutlus ja optimeerimine mitme piirangu korral

⚠️ Ebakindel

✅ Garanteeritud

✅ Jah

Auditeeritavus ja tõlgendatavus

⚠️ Ebakindel

✅ Selge

✅ Selge

Vastupidavus viibamürale ja viibasüstidele

❌ Haavatav

✅ Immuunne

✅ Tugev

Katsevaldkond 1: logistika ja tööjõu jaotamine

Probleemivaldkond

Alustasime probleemist, millega puutuvad kokku mõned meie kliendid:

Loomulikus keeles taotluste teisendamine optimaalseteks reaalaja ressursiotsusteks, jõustades rangelt tegevus-, eeskirja- ja kulupiiranguid.

See probleem on tänapäeva logistika ja tarneahelate keskmes ning hõlmab tööjõu graafikuid, varade jaotamist, marsruutimist, täitmise planeerimist ja läbilaskevõime haldamist. Just siin peavad LLM-id ja formaalsed lahendajad usaldusväärsete süsteemide loomiseks koostööd tegema. Hindamiseks koostasime kontrollitud katsestsenaariumid, andmeallikad ja piirangud ning 240 sünteetilist päringut. Näited:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Päringutest näeme, et süsteem peab eraldama ranged ja paindlikud piirangud usaldusväärselt otse loomulikus keeles taotlustest ning neid jõustama:

  • Ranged piirangud ei ole läbiräägitavad (nt varaseimad alguskuupäevad, lepingutingimused ja läbilaskevõime ülempiirid). Neist kasvõi ühe rikkumine muudab lahenduse kehtetuks.

  • Paindlikud piirangud väljendavad eelistusi, näiteks viivituste ja kulude vähendamist ning muudatuste piiramist. Eesmärk on optimeerida rangeid piire ületamata.

Nende optimeerimisülesannete mõnda aspekti ei saa täielikult ette määrata. Need tuleb dünaamiliselt kokku panna, tuginedes nii struktureeritud äriloogikast, sisedokumentidest ja tegevusandmetest pärinevatele eelmääratud piirangutele ning eesmärkidele kui ka kasutaja taotlusele.

Hinnatud lähenemised

Et mõista eri tehnikate toimivust selles olukorras, rakendasime ja võrdlesime kolme lähenemist.

  1. Puhas LLM: lihtsaima lähenemise korral edastatakse kõik asjakohased andmed ja kasutaja loomulikus keeles taotlus ühe LLM-i viibaga, paludes koostada optimaalse plaani või jaotuse. See võib toimida väikeste või väheste piirangutega ülesannete puhul, kuid keerukuse kasvades lakkab toimimast. Mudel võib piiranguid eirata, seada esikohale vale eesmärgi või koostada plaane, mis tunduvad mõistlikud, kuid pole teostatavad, ilma et tõrkeid saaks usaldusväärselt tuvastada või vältida.

  2. LLM + Koodi tõlgendaja: selle lähenemise puhul tõlgendab LLM taotlust ning kasutab tööriistu andmeallikatele juurdepääsuks ja käivitatava optimeerimiskoodi genereerimiseks. See lisab paindlikkust ja jälgitavust, kuid töökindlus jääb probleemiks. LLM peab endiselt piirangud korrektseks koodiks tõlkima ning väikesed arutlus- või programmeerimisvead võivad anda kehtetuid või alaoptimaalseid tulemusi, eriti piirangute arvu kasvades.

  3. Hübriid: LLM → struktureeritud piirangud → deterministlik lahendaja: kolmas lähenemine eraldab vastutuse. LLM ei „otsusta“ kunagi tulemust, vaid aitab muutujad, piirangud ja eesmärgid formaliseerida. End tõestanud optimeerimislahendaja jõustab piirangud, tagab teostatavuse ning annab kontrollitavad ja auditeeritavad tulemused. LLM-i roll piirdub loomulikus keeles taotluste teisendamisega selgesõnalisteks struktureeritud piiranguteks, kasutades eelmääratud skeeme. Need piirangud kompileeritakse automaatselt lahendaja, näiteks OR-Toolsi koodiks, mis arvutab deterministlikult teostatava optimaalse lahenduse.

Tulemused

Katsetasime meetodeid mitme LLM-iga, sealhulgas GPT-5, GPT-5.1 ja GPT-5.2-ga. Ootuspäraselt ületas hübriidlahendus alternatiive:

Meetod

Jaotuse täpsus

Keskmine latentsus

Tokeneid päringu kohta

Puhas LLM

70–78%

62–190 s

~175 000

LLM + Koodi tõlgendaja

82–84%

62–140 s

~9000

LLM → lahendaja (hübriid)

95–97%

6–25 s

~2000

Meie hübriidmeetod annab oluliselt suurema täpsuse, üle nelja korra parema tokenitõhususe ja suurusjärgu võrra väiksema latentsuse.

Katsevaldkond 2: üldotstarbeline optimeerimine loomuliku keele põhjal

Järgmise sammuna loome üldistatava korduskasutatava liidese, mis teisendab loomuliku keele struktureeritud semantilisteks esitusteks, mille meie taustsüsteem saab tõlkida lahendajale sobivaks koodiks. Selles katses keskendusime lineaarse optimeerimise ülesannetele ja hindasime lähenemist kolme avaliku andmestiku põhjal (NLP4LP, NL4OPT ja IndustryOR).

Hinnatud lähenemised

  1. Eraldiseisev LLM

  2. Hübriidmeetod (LLM → struktureeritud reeglid → lahendaja → kontrollitud väljund)

Diagramm, mis kujutab hübriidtöövoogu loomulikus keeles taotlustest struktureeritud piirangute, deterministliku lahendamise ja kontrollitud väljundini.

  • Kasutada LLM-i sisendist muutujate, piirangute ja eesmärkide eraldamiseks ning struktureeritud optimeerimisülesande formuleerimiseks.

  • Edastada struktureeritud ülesanne ja algne taotlus enesekontrolliks LLM-ile.

  • Tõlkida struktureeritud ülesanne OR-Toolsi koodiks, et arvutada optimaalne jaotus.

Tulemused

Hindasime seda lähenemist tipptasemel omanduslike mudelitega, sealhulgas GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max ja GPT-5.2, ning avatud lähtekoodiga mudelitega, nagu Kimi K2, GPT-OSS-i mudelid ja MiniMax M2. Karpdiagrammid võtavad kokku iga meetodi tulemused.

Diagramm, mis võrdleb eraldiseisvaid suuri keelemudeleid ja lahendajapõhiseid hübriidlahendusi optimeerimise võrdlustestides.

Peaaegu kõigi hinnatud aluseks olevate keelemudelite puhul annab hübriidlahendus järjepidevalt täpsemaid, stabiilsemaid ja paremini kontrollitavaid tulemusi kui eraldiseisev LLM-i võrdlusalus. Kuigi absoluutne tulemuslikkus on mudeliti erinev, püsib hübriidlahenduse suhteline eelis järjepidev. See viitab, et paranemine tuleneb loomuliku keele mõistmise eraldamisest formaalsest optimeerimisest, mitte ühegi mudeli arutlusvõimele tuginemisest.

Täpsus

Peamiselt lineaarse programmeerimise ülesannetest koosnevates NLP4LP-s ja NL4OPT-s saavutab hübriidmeetod peaaegu maksimaalse täpsuse ning edestab eraldiseisva LLM-i viipasid. „Ligikaudu õige“ arutluse asemel genereerib hübriidsüsteem järjepidevamalt kehtivaid ja korrektselt formuleeritud matemaatilisi esitusi. Keerukamas IndustryOR-i andmestikus väheneb mõlema meetodi täpsus, kuid eri põhjustel. Paljud IndustryOR-i ülesanded hõlmavad kombinatoorseid struktuure, nagu sõidukite marsruutimine, ülesannete järjestamine ja tööjõu jaotamine, mis ületavad praegu meie lahendaja taustsüsteemi toetatud lineaarse optimeerimise võimalusi.

Tõrkerežiimide analüüs näitab, et eraldiseisvad LLM-id rikuvad sageli nõutavaid piiranguid, nagu allpool näha:

Näide 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Eraldiseisev LLM annab väiksema rasva kogusisaldusega lahenduse, kuid rikub nõuet, et kalkuniõhtusöögid ei tohi moodustada toidukordadest üle 40%. Hübriidlahendus jõustab selle range piirangu õigesti ja tagastab kehtiva vastuse.

Näide 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Eraldiseisev LLM annab taas väiksema heitkogusega lahenduse, kuid ületab valuvaigistite suurima lubatud piirmäära. Hübriidlahendus jõustab selle range piirangu õigesti ja tagastab kehtiva vastuse.

Latentsus ja tokenikasutus

Latentsus- ja tokenikasutuse andmed toovad esile olulise erinevuse. Hübriidlahenduse keskmine latentsus ja tokenikasutus on suuremad kui ühekordsel LLM-viibal, kuid see tuleneb arhitektuurivalikutest, mitte ebatõhususest.

Hübriidkonveier hõlmab järgmist:

  1. Üks või mitu LLM-i kutset struktureeritud muutujate, piirangute ja eesmärkide eraldamiseks.

  2. Enesekontrolli etapp sisemiste vastuolude tuvastamiseks.

Kuigi need etapid lisavad ühe viibaga võrreldes üldkulu, püsib latentsus piiratud ja prognoositav ning hästi formuleeritud ülesande korral töötab lahendaja tavaliselt kiiresti. Lisatöö loob selgesõnalised, korduskasutatavad ja auditeeritavad vahe-esitused. Eraldiseisvad LLM-lahendused suruvad aga arutluse ühte läbipaistmatusse genereerimisetappi, kandes kulud üle korduskatsetele, käsitsi kontrollimisele ja hilisematele tõrgetele. Edasised versioonid võivad seda üldkulu vähendada järgmiselt:

  • Eraldatud skeemide vahemällu salvestamine.

  • Piirangute järkjärguline uuendamine.

  • Viipade ja kutsete orkestreerimise täiustamine.

Läbipaistvus ja auditeeritavus

Isegi siis, kui mõlemad meetodid ebaõnnestuvad, on tõrke olemus põhimõtteliselt erinev.

  • Eraldiseisva LLM-i tõrked jäävad sageli märkamatuks: mudel võib tagastada tulemuse, milles peitub raskesti märgatav viga.

  • Hübriidlahenduse selgesõnaline ülesandepüstitus muudab tõrked nähtavaks ja aitab meeskondadel tuvastada, milline formuleeringu osa vea põhjustas.

Tulevased versioonid võiksid neid formuleeringuid liideses kuvada, et kasutajad saaksid neid enne lahendaja käivitamist auditeerida või kontrollida. See läbipaistvus parandab mõõdetavat täpsust ning lihtsustab süsteemi silumist ja täiustamist, mis on päriselus kasutuselevõtuks hädavajalik.

Peamine järeldus

Kõigi võrdlustestide ja enamiku katsetatud alusmudelite tulemused kinnitavad meie töö keskset järeldust:

LLM-id mõistavad ja tõlgivad kavatsusi väga hästi, kuid korrektsuse tagamiseks on deterministlikud lahendajad hädavajalikud.

Hübriidlahendus muudab loomuliku keele ebamäärasuse allikast matemaatiliselt põhjendatud otsustamise usaldusväärseks liideseks, viies ettevõtete tehisaru sammu lähemale süsteemidele, mis pole mitte ainult intelligentsed, vaid ka usaldusväärsed.

Järgmine samm: korduskasutatav formaalne tehisarumootor ettevõtetele

Ettevõtte piirangud esinevad harva korrastatud skeemide või täiuslikult sõnastatud viipadena. Need on hajutatud andmebaasidesse, arvutustabelitesse, sise-eeskirjadesse ja lepingutesse. Kasutajate taotlused võivad olla puudulikud, mitmeti mõistetavad või ärireeglitega vastuolus. Et lahendus toimiks suures mahus, loome korduskasutatavat taustamootorit, mis muudab selle keerukuse ettevõtte usaldusväärseks võimekuseks.

Ettevõtte formaalset tehisarumootorit kujutav diagramm, mis hõlmab ärireegleid, lahendaja jaoks tõlkimist ja auditeeritavat otsustamist.

Platvorm

See mootor toimib tehisarupõhiste otsustussüsteemide formaalse selgroona ja pakub järgmist:

  • Sümboolne teadmusbaas adapteritega, mis impordivad ärireegleid, piiranguid, muutujaid ja eesmärke.

  • Tõlkekiht, mis kompileerib skeemid lahendaja koodiks.

  • Liidesed, mille kaudu saavad meeskonnad piiranguid uurida, auditeerida ja muuta.

Kus see väärtust loob

Kuigi praegused katsed keskenduvad optimeerimisele, saab sama meetodit laiendada loogilisele kontrollimisele. Võimalikud ärirakendused on muu hulgas järgmised:

  • Teha vajaduspõhist dünaamilist graafikute koostamist, marsruutimist ja ressursside jaotamist, jõustades kõik tegevuspiirangud.

  • Koostada vastuseid ja soovitusi, mis järgivad järjepidevalt ärireegleid.

  • Kavandada ja valideerida keerukaid 3D-objekte, videoid ning arhitektuure, tuvastades teostamatud lahendused enne tootmist.

Lõppmõtted

Tänapäeva tehisaru on võimas, kuid ettevõtted vajavad enamat kui võimsust: nad vajavad korrektsust, järjepidevust ja kontrolli. Meie LLM-i ja lahendajat ühendav hübriidsüsteem on samm maailma poole, kus:

  • Agendid ei hallutsineeri reegleid ega piiranguid.

  • Loogiline järeldamine ja optimeerimine on matemaatiliselt põhjendatud.

  • Loomulik keel toimib deterministlike süsteemide universaalse liidesena.

Autor

Peng Seng Ang