Pagrindinė navigacija

LLM ir formalių sprendimo įrankių derinimas patikimiems DI sprendimams

Hibridinėje architektūroje LLM lankstumas derinamas su deterministiniais sprendimo įrankiais, kad įmonių sprendimai būtų patikimi ir patikrinami.

Didieji kalbos modeliai (LLM) padarė nepaprastą pažangą suprasdami natūralią kalbą, kurdami sklandžius atsakymus ir suteikdami galimybę kurti visiškai naujas klientų bei darbuotojų patirtis. Tačiau LLM iš prigimties yra stochastiniai, todėl juos naudojant sudėtingam skaitiniam ar loginiam protavimui sunku užtikrinti, kad jų rezultatai atitiks reikalavimus ar bus optimalūs. Pavyzdžiui:

  • Vadovas DI planavimo asistentui nurodo: “Ship as much as possible next week while keeping costs low,” o sistema pateikia ambicingą ir iš pažiūros efektyvų planą, kuris nepastebimai viršija sandėlio pajėgumus ir pažeidžia pristatymo garantijas.

  • Koordinatorius DI asistentui nurodo: “Reassign crews to reduce overnight stays and minimize disruption,” o modelis sudaro pigesnį ir iš pažiūros optimalų tvarkaraštį, kuris pažeidžia privalomus darbo laiko ar poilsio apribojimus.

  • Finansinių operacijų DI asistentas turi tvirtinti operacijas laikydamasis griežtų regioninių ir rizikos apribojimų, tačiau patvirtina įtartiną operaciją išgalvojęs pagrindimą, kuris skamba taip, tarsi atitiktų reikalavimus, nors pažeidžia vidaus politiką.

Aplinkose, kurioms taikomi griežti veiklos reikalavimai, LLM derinimas su formaliais sprendimo įrankiais padeda užtikrinti, kad natūralia kalba grindžiami sprendimai neperžengtų nustatytų ribų ir nebūtų neįgyvendinami, neoptimalūs ar neatitinkantys reikalavimų.

Mūsų M&T komanda tiria hibridinį metodą, kuriame LLM kūrybiškumas ir lankstumas derinami su formalių matematinių sprendimo įrankių, tokių kaip Z3, Pyomo ir OR-Tools, tikslumu, garantijomis bei skaidrumu. Taip pat kuriame daugkartinio naudojimo formalųjį DI modulį, kad ši galimybė taptų standartine įmonių technologijų infrastruktūros dalimi. Platforma leis organizacijoms tiesiogiai perimti verslo taisykles iš esamų sistemų, nuolat tikrinti, ar sprendimai jas atitinka, ir saugiai diegti DI agentus aiškiai apibrėžtose ribose.

Mūsų vizija – mažinti veiklos riziką ir kartu spartinti didelio masto sprendimų priėmimą. Vadovai gali greičiau priimti politiką atitinkančius sprendimus pagal natūralia kalba pateiktą informaciją, o organizacijos – automatizuoti neplanuotus tvarkaraščių, tiekimo grandinės išteklių paskirstymo, finansinių operacijų, politikos tikrinimo ir net vaizdo įrašų ar 3D dizaino pakeitimus. Integruotos apsaugos priemonės neleidžia neįgyvendinamų, reikalavimų neatitinkančių ar nesaugių rezultatų perkelti į gamybinę aplinką.

Per kontroliuojamus eksperimentus su logistikos optimizavimo uždaviniais ir trimis viešaisiais etaloniniais testais mūsų hibridinis metodas nuosekliai pasižymėjo:

  • Didesniu tikslumu

  • Geresniu paaiškinamumu ir audituojamumu

Hibridinė architektūra

Mūsų metodas apverčia įprastą paradigmą „LLM atlieka viską“ ir remiasi tokia struktūra:

Schema, kurioje lyginama, kaip didieji kalbos modeliai ir deterministiniai sprendimo įrankiai sujungia natūralios kalbos supratimą su patikrinamu optimizavimu.

Taikant šį metodą atsakomybės aiškiai atskiriamos: LLM iš natūralios kalbos išskiria taisykles ir apribojimus, o deterministiniai sprendimo įrankiai, tokie kaip OR-Tools, Z3 ir Pyomo, atlieka optimizavimą bei tikrinimą. Taip sujungiamos abiejų metodų stiprybės:

LLM

Sprendimo įrankiai

Hibridinis metodas (LLM + sprendimo įrankis)

Žmogaus ketinimų supratimas įvairiose srityse

✅ Puikus

❌ Nėra

✅ Puikus

Deterministinė elgsena

❌ Ne

✅ Garantuojama

✅ Taip

Įrodomai teisingas matematinis protavimas ir optimizavimas taikant daugybę apribojimų

⚠️ Nepatikimas

✅ Garantuojama

✅ Taip

Audituojamumas ir paaiškinamumas

⚠️ Nepatikimas

✅ Aiškus

✅ Aiškus

Atsparumas užklausų triukšmui ir manipuliacinėms injekcijoms

❌ Pažeidžiamas

✅ Atsparus

✅ Stiprus

1 eksperimentų kryptis: logistikos ir darbuotojų paskyrimai

Uždavinių sritis

Pradėjome nuo iššūkio, su kuriuo susiduria dalis mūsų klientų:

Natūralia kalba pateiktus prašymus realiuoju laiku paversti optimaliais išteklių sprendimais, griežtai laikantis veiklos, politikos ir sąnaudų apribojimų.

Šis iššūkis yra šiuolaikinės logistikos ir tiekimo grandinių pagrindas – jis apima darbuotojų grafikų sudarymą, turto paskirstymą, maršrutų parinkimą, užsakymų vykdymo planavimą ir pajėgumų valdymą. Būtent šioje srityje LLM ir formalūs sprendimo įrankiai turi veikti kartu, kad sistemos būtų patikimos. Vertinimui sukūrėme kontroliuojamus bandymų scenarijus, duomenų šaltinius bei apribojimus ir parengėme 240 sintetinių užklausų. Pavyzdžiai:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Iš užklausų matyti, kad sistema turi patikimai išskirti ir taikyti griežtuosius ir lanksčiuosius apribojimus tiesiogiai iš natūralia kalba pateiktų prašymų:

  • Griežtieji apribojimai yra privalomi (pvz., anksčiausios pradžios datos, sutartinės sąlygos ir pajėgumų ribos). Pažeidus bent vieną iš jų, sprendinys tampa netinkamas.

  • Lankstieji apribojimai apibrėžia pageidavimus, pavyzdžiui, kuo labiau sumažinti vėlavimą, sąnaudas ir pakeitimų skaičių. Tikslas – optimizuoti neperžengiant griežtųjų ribų.

Kai kurių šių optimizavimo uždavinių aspektų neįmanoma iš anksto visiškai apibrėžti. Juos reikia dinamiškai suformuoti remiantis ne tik iš anksto apibrėžtais struktūrizuotos verslo logikos, vidaus dokumentų bei veiklos duomenų apribojimais ir tikslais, bet ir naudotojo prašymu.

Mūsų vertinti metodai

Siekdami suprasti skirtingų metodų veiksmingumą šiomis sąlygomis, įdiegėme ir palyginome tris metodus.

  1. Grynas LLM: taikant paprasčiausią metodą, visi svarbūs duomenys ir natūralia kalba pateiktas naudotojo prašymas perduodami vienoje LLM užklausoje, prašant parengti optimalų planą ar paskirstymą. Šis metodas gali tikti mažiems ar nedaug apribojimų turintiems uždaviniams, tačiau didėjant sudėtingumui nustoja veikti. Modelis gali nepaisyti apribojimų, teikti pirmenybę netinkamam tikslui arba parengti pagrįstai skambančius, bet neįgyvendinamus planus, o patikimo būdo aptikti ar išvengti tokių nesėkmių nėra.

  2. LLM + Kodo interpretatorius: taikant šį metodą, LLM interpretuoja prašymą ir įrankiais pasiekia duomenų šaltinius bei generuoja vykdomąjį optimizavimo kodą. Tai suteikia daugiau lankstumo ir stebimumo, tačiau patikimumas tebėra problema. LLM vis tiek turi teisingai perkelti apribojimus į kodą, o nedidelės protavimo ar programavimo klaidos gali lemti netinkamus ar neoptimalius rezultatus, ypač didėjant apribojimų skaičiui.

  3. Hibridinis metodas: LLM → struktūrizuoti apribojimai → deterministinis sprendimo įrankis: trečiasis metodas atskiria atsakomybes. LLM niekada „nenusprendžia“ rezultato – jis padeda formaliai apibrėžti kintamuosius, apribojimus ir tikslus. Patikrintas optimizavimo sprendimo įrankis taiko apribojimus, užtikrina įgyvendinamumą ir pateikia rezultatus, kuriuos galima patikrinti bei audituoti. LLM vaidmuo apsiriboja natūralia kalba pateiktų prašymų vertimu į aiškius, struktūrizuotus apribojimus pagal iš anksto apibrėžtas schemas. Šie apribojimai automatiškai kompiliuojami į sprendimo įrankio, pavyzdžiui, OR-Tools, kodą, kuris deterministiškai apskaičiuoja įgyvendinamą optimalų sprendinį.

Rezultatai

Metodus išbandėme naudodami kelis LLM, įskaitant GPT-5, GPT-5.1 ir GPT-5.2. Kaip ir tikėtasi, hibridinis metodas pranoko alternatyvas:

Metodas

Paskyrimo tikslumas

Vidutinė delsa

Vienai užklausai naudojami žetonai

Grynas LLM

70–78 %

62–190 sek.

~175 000

LLM + Kodo interpretatorius

82–84 %

62–140 sek.

~9 000

LLM → sprendimo įrankis (hibridinis)

95–97 %

6–25 sek.

~2 000

Mūsų hibridinis metodas užtikrina gerokai didesnį tikslumą, daugiau kaip 4 kartus efektyvesnį žetonų naudojimą ir dešimteriopai mažesnę delsą.

2 eksperimentų kryptis: bendrosios paskirties optimizavimas pagal natūralią kalbą

Kitas mūsų žingsnis – sukurti apibendrinamą daugkartinio naudojimo sąsają, kuri natūralią kalbą paverstų struktūrizuotomis semantinėmis reprezentacijomis, o mūsų vidinė sistema galėtų jas išversti į sprendimo įrankiui paruoštą kodą. Šiame eksperimente daugiausia dėmesio skyrėme tiesinio optimizavimo uždaviniams ir vertinome metodą pagal tris viešuosius duomenų rinkinius (NLP4LP, NL4OPT ir IndustryOR).

Mūsų vertinti metodai

  1. Atskiras LLM

  2. Hibridinis metodas (LLM → struktūrizuotos taisyklės → sprendimo įrankis → patikrintas rezultatas)

Hibridinio proceso schema: nuo natūralia kalba pateiktų prašymų iki struktūrizuotų apribojimų, deterministinio sprendimo ir patikrinto rezultato.

  • Naudojant LLM iš įvesties išskirti kintamuosius, apribojimus bei tikslus ir suformuluoti struktūrizuotą optimizavimo uždavinį.

  • Perduoti struktūrizuotą uždavinį ir pradinį prašymą LLM, kad jis atliktų savikontrolę.

  • Išversti struktūrizuotą uždavinį į OR-Tools kodą optimaliam paskirstymui apskaičiuoti.

Rezultatai

Šį metodą vertinome naudodami nuosavybinius priešakinius modelius, įskaitant GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max ir GPT-5.2, taip pat atvirojo kodo modelius, tokius kaip Kimi K2, GPT-OSS modeliai ir MiniMax M2. Stačiakampės diagramos apibendrina kiekvieno metodo rezultatus.

Diagrama, kurioje pagal optimizavimo etaloninius testus lyginami atskiri didieji kalbos modeliai ir hibridiniai sprendimo įrankiais grindžiami metodai.

Beveik visuose vertintuose baziniuose kalbos modeliuose hibridinis metodas nuosekliai pateikia tikslesnius, stabilesnius ir lengviau patikrinamus rezultatus nei atskiras LLM, naudojamas kaip atskaitos taškas. Nors absoliutus modelių našumas skiriasi, santykinė hibridinio metodo nauda išlieka pastovi. Tai rodo, kad pagerėjimą lemia natūralios kalbos supratimo atskyrimas nuo formaliojo optimizavimo, o ne priklausomybė nuo kurio nors vieno modelio gebėjimo protauti.

Tikslumas

NLP4LP ir NL4OPT rinkiniuose, kuriuos daugiausia sudaro tiesinio programavimo uždaviniai, hibridinis metodas pasiekia beveik maksimalų tikslumą ir pranoksta atskirą LLM su užklausomis. Užuot pateikusi „apytiksliai teisingą“ protavimą, hibridinė sistema nuosekliau generuoja tinkamas ir taisyklingai suformuluotas matematines išraiškas. Sudėtingesniame IndustryOR duomenų rinkinyje abiejų metodų tikslumas sumažėja, tačiau dėl skirtingų priežasčių. Daugelis IndustryOR uždavinių apima kombinatorines struktūras, pavyzdžiui, transporto priemonių maršrutų parinkimą, užduočių sekos sudarymą ir darbuotojų paskyrimą, kurios viršija šiuo metu mūsų vidinės sprendimo sistemos palaikomas tiesinio optimizavimo galimybes.

Nesėkmių analizė rodo, kad atskiri LLM dažnai pažeidžia privalomus apribojimus, kaip parodyta toliau:

1 pavyzdys:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Atskiras LLM pateikia sprendinį, kuriame bendras riebalų kiekis mažesnis, tačiau pažeidžiamas reikalavimas, kad kalakutienos patiekalai sudarytų ne daugiau kaip 40 % visų patiekalų. Hibridinis metodas tinkamai pritaiko šį griežtąjį apribojimą ir pateikia tinkamą atsakymą.

2 pavyzdys:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Atskiras LLM vėl pateikia sprendinį, kuriame išrašomų pacientų skaičius mažesnis, tačiau viršijama didžiausia leistina vaistų nuo skausmo riba. Hibridinis metodas tinkamai pritaiko šį griežtąjį apribojimą ir pateikia tinkamą atsakymą.

Delsa ir žetonų naudojimas

Delsos ir žetonų naudojimo duomenys atskleidžia svarbų skirtumą. Hibridinio metodo vidutinė delsa ir žetonų naudojimas yra didesni nei vienkartinės LLM užklausos, tačiau tai lemia architektūros pasirinkimai, o ne neefektyvumas.

Hibridinį procesą sudaro:

  1. Vienas ar daugiau kreipinių į LLM, skirtų struktūrizuotiems kintamiesiems, apribojimams ir tikslams išskirti.

  2. Savikontrolės etapas vidiniams prieštaravimams aptikti.

Nors, palyginti su viena užklausa, šie etapai reikalauja papildomų išteklių, delsa išlieka ribota ir nuspėjama, o tinkamai suformulavus uždavinį sprendimo įrankis paprastai veikia greitai. Šis papildomas darbas padeda sukurti aiškias, daugkartinio naudojimo ir audituojamas tarpines reprezentacijas. Atskiri LLM metodai visą protavimą sutalpina į vieną neskaidrų generavimo veiksmą, todėl sąnaudos persikelia į pakartotinius bandymus, rankines patikras ir vėlesnius gedimus. Ateityje šias papildomas sąnaudas bus galima sumažinti:

  • Podėlyje kaupiant išskirtas schemas.

  • Laipsniškai atnaujinant apribojimus.

  • Tobulinant užklausų ir kreipinių koordinavimą.

Skaidrumas ir audituojamumas

Galiausiai net ir tais atvejais, kai abu metodai nesuveikia, pats nesėkmės pobūdis iš esmės skiriasi.

  • Naudojant atskirą LLM, klaidos dažnai lieka nepastebėtos: modelis gali pateikti rezultatą su sunkiai pastebima klaida.

  • Taikant hibridinį metodą, aiškus uždavinio formulavimas leidžia pastebėti nesėkmes ir padeda komandoms nustatyti, kuri formuluotės dalis sukėlė klaidą.

Ateities versijose šias formuluotes būtų galima pateikti sąsajoje, kad naudotojai galėtų jas audituoti ar patikrinti prieš paleidžiant sprendimo įrankį. Šis skaidrumas didina išmatuojamą tikslumą ir padeda lengviau derinti bei tobulinti sistemą, o tai būtina diegiant ją realiomis sąlygomis.

Svarbiausia išvada

Visų etaloninių testų ir daugumos išbandytų bazinių modelių rezultatai patvirtina pagrindinę mūsų darbo išvadą:

LLM puikiai supranta ir perteikia ketinimus, tačiau teisingumui užtikrinti būtini deterministiniai sprendimo įrankiai.

Hibridinis metodas natūralią kalbą iš neapibrėžtumo šaltinio paverčia patikima matematiškai pagrįstų sprendimų priėmimo sąsaja ir priartina įmonių DI prie sistemų, kurios būtų ne tik išmanios, bet ir patikimos.

Kas toliau: daugkartinio naudojimo formalusis DI modulis įmonėms

Įmonių apribojimai retai būna pateikti tvarkingose schemose ar tobulai suformuluotose užklausose. Jie išsibarstę duomenų bazėse, skaičiuoklėse, vidaus politikos dokumentuose ir sutartyse. Naudotojų prašymai gali būti neišsamūs, dviprasmiški arba prieštarauti verslo taisyklėms. Kad šį metodą būtų galima taikyti plačiu mastu, kuriame daugkartinio naudojimo vidinės sistemos modulį, kuris šį sudėtingumą paverčia patikima įmonės funkcija.

Įmonėms skirto formaliojo DI modulio schema, apimanti verslo taisykles, jų vertimą sprendimo įrankiui ir audituojamą sprendimų priėmimą.

Platforma

Šis modulis yra formalus DI grindžiamų sprendimų sistemų pagrindas, suteikiantis:

  • Simbolinę žinių bazę su adapteriais, kurie perima verslo taisykles, apribojimus, kintamuosius ir tikslus.

  • Vertimo sluoksnį, kuris kompiliuoja schemas į sprendimo įrankio kodą.

  • Sąsajas, leidžiančias komandoms peržiūrėti, audituoti ir keisti apribojimus.

Kur tai gali sukurti vertę

Nors šiuose eksperimentuose dabar daugiausia dėmesio skiriama optimizavimui, tą patį metodą galima pritaikyti ir loginiam tikrinimui. Galimi verslo pritaikymo būdai:

  • Dinamiškai ir pagal poreikį planuoti tvarkaraščius, maršrutus bei išteklių paskirstymą, kartu užtikrinant visų veiklos apribojimų laikymąsi.

  • Generuoti atsakymus ir rekomendacijas, kurie nuosekliai atitinka verslo taisykles.

  • Projektuoti ir tikrinti sudėtingus 3D objektus, vaizdo įrašus bei architektūras, aptinkant neįgyvendinamus projektus dar prieš gamybą.

Baigiamosios mintys

Šiandien DI yra galingas, tačiau įmonėms reikia daugiau nei galios – joms reikia teisingumo, nuoseklumo ir kontrolės. Mūsų hibridinė LLM ir sprendimo įrankio sistema yra žingsnis link pasaulio, kuriame:

  • Agentai neišgalvoja taisyklių ar apribojimų.

  • Loginės išvados ir optimizavimas yra matematiškai pagrįsti.

  • Natūrali kalba yra universali deterministinių sistemų sąsaja.

Autorius

Peng Seng Ang