LLM og formlegir leysarar fyrir áreiðanlegar ákvarðanir gervigreindar

Blönduð högun sameinar sveigjanleika LLM og ákvarðaða leysara til að skila áreiðanlegum, sannreynanlegum ákvörðunum fyrirtækja.

Stór mállíkön (LLM) hafa tekið ótrúlegum framförum í skilningi á náttúrulegu máli, gerð lipurra svara og þróun nýrrar upplifunar fyrir viðskiptavini og starfsfólk. Þar sem LLM eru í eðli sínu slembin er þó aðeins að takmörkuðu leyti hægt að tryggja að úttak þeirra uppfylli kröfur eða sé ákjósanlegt þegar þau eru notuð við flókin töluleg eða rökleg viðfangsefni. Til dæmis:

  • Stjórnandi segir skipulagsaðstoðarmanni með gervigreind: “Ship as much as possible next week while keeping costs low,” og kerfið skilar metnaðarfullri áætlun sem virðist hagkvæm en fer án viðvörunar yfir afkastagetu vöruhússins og brýtur gegn afhendingarábyrgðum.

  • Samræmingaraðili segir aðstoðarmanni með gervigreind: “Reassign crews to reduce overnight stays and minimize disruption,” og líkanið útbýr ódýrari áætlun sem virðist ákjósanleg en brýtur gegn lögbundnum takmörkunum um vinnutíma eða hvíld.

  • Gervigreindaraðstoðarmaður í fjármálarekstri þarf að samþykkja færslur samkvæmt ströngum svæðisbundnum og áhættutengdum skilyrðum, en hleypir grunsamlegri færslu í gegn með tilbúnum rökstuðningi sem hljómar eins og hann uppfylli kröfur þótt hann brjóti gegn innri reglum.

Þar sem rekstrarkröfur eru strangar stuðlar samvinna LLM og formlegra leysara að því að ákvarðanir byggðar á náttúrulegu máli haldist innan skilgreindra marka og leiði ekki til óframkvæmanlegra, óhagkvæmra eða óheimilla niðurstaðna.

Rannsóknar- og þróunarteymi okkar kannar blandaða nálgun sem sameinar sköpunarkraft og sveigjanleika LLM við nákvæmni, tryggingar og gagnsæi formlegra stærðfræðilegra leysara á borð við Z3, Pyomo og OR-Tools. Við erum einnig að smíða endurnýtanlega formlega gervigreindarvél svo þessi geta verði staðlaður hluti af tæknigrunni fyrirtækja. Vettvangurinn gerir fyrirtækjum kleift að lesa viðskiptareglur beint úr núverandi kerfum, sannreyna ákvarðanir stöðugt gagnvart reglunum og innleiða gervigreindarfulltrúa á öruggan hátt innan skýrt skilgreindra marka.

Framtíðarsýn okkar er að draga úr rekstraráhættu og flýta jafnframt ákvarðanatöku í stórum stíl. Stjórnendur fá hraðari ákvarðanir sem samræmast reglum út frá lýsingum á náttúrulegu máli, en fyrirtæki geta sjálfvirknivætt tilfallandi breytingar á áætlanagerð, úthlutun aðfanga í aðfangakeðjum, fjármálarekstri, sannprófun reglna og jafnvel myndbands- eða þrívíddarhönnun. Innbyggðar varnir koma í veg fyrir að óframkvæmanlegar, óheimilar eða óöruggar niðurstöður fari í framleiðslu.

Í stýrðum tilraunum með bestun í anda flutningastarfsemi og þremur opinberum viðmiðum sýndi blandaða nálgunin okkar stöðugt fram á:

  • Meiri nákvæmni

  • Meiri túlkanleika og rekjanleika

Blandaða högunin

Nálgun okkar snýr hinu hefðbundna viðmiði um að „LLM geri allt“ á haus og fylgir þess í stað þessari hönnun:

Skýringarmynd sem ber saman hvernig stór mállíkön og ákvarðaðir leysarar sameina skilning á náttúrulegu máli og sannreynanlega bestun.

Þessi nálgun aðskilur ábyrgð með skýrum hætti: LLM draga reglur og skorður úr náttúrulegu máli en ákvarðaðir leysarar á borð við OR-Tools, Z3 og Pyomo annast bestun og sannprófun. Niðurstaðan sameinar styrkleika beggja nálgana:

LLM

Leysarar

Blandað (LLM + leysari)

Skilningur á ásetningi fólks á ólíkum sviðum

✅ Framúrskarandi

❌ Enginn

✅ Framúrskarandi

Ákvarðað hegðun

❌ Nei

✅ Tryggt

✅ Já

Sannanlega rétt stærðfræðileg rök og bestun með fjölmörgum skorðum

⚠️ Ótraust

✅ Tryggt

✅ Já

Rekjanleiki og túlkanleiki

⚠️ Ótraust

✅ Skýrt

✅ Skýrt

Viðnám gegn truflunum og innspýtingu í kvaðningum

❌ Berskjaldað

✅ Ónæmt

✅ Sterkt

Tilraunalota 1: flutningar og úthlutun starfsfólks

Viðfangsefnið

Við byrjuðum á áskorun sem sumir viðskiptavina okkar glíma við:

Að umbreyta beiðnum á náttúrulegu máli í ákjósanlegar ákvarðanir um aðföng í rauntíma og framfylgja jafnframt rekstrar-, reglu- og kostnaðarskorðum af festu.

Þessi áskorun er kjarninn í nútíma flutningastarfsemi og aðfangakeðjum, þar á meðal vaktaskipulagi, úthlutun eigna, leiðavali, afhendingaráætlunum og afkastastýringu. Þarna þurfa LLM og formlegir leysarar einnig að vinna saman til að skapa traust kerfi. Við matið útbjuggum við stýrðar prófunaraðstæður, gagnagjafa og skorður ásamt 240 tilbúnum fyrirspurnum. Dæmi:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Af fyrirspurnunum sést að kerfið þarf að draga á áreiðanlegan hátt út og framfylgja hörðum og mjúkum skorðum beint úr beiðnum á náttúrulegu máli:

  • Harðar skorður eru ófrávíkjanlegar (t.d. fyrstu mögulegu upphafsdagsetningar, samningsskilmálar og efri mörk afkastagetu). Brot gegn einni slíkri skorðu ógildir lausnina.

  • Mjúkar skorður lýsa forgangsatriðum, svo sem að lágmarka tafir, draga úr kostnaði og takmarka breytingar. Markmiðið er að besta án þess að fara yfir hörð mörk.

Ekki er hægt að forskilgreina alla þætti þessara bestunarvandamála. Þá þarf að setja saman með kvikum hætti út frá forskilgreindum skorðum og markmiðum í skipulagðri viðskiptarökfræði, innri skjölum og rekstrargögnum, auk beiðni notandans.

Nálganirnar sem við mátum

Til að skilja hvernig ólíkar aðferðir standa sig við þessar aðstæður innleiddum við og bárum saman þrjár nálganir.

  1. Hreint LLM: Einfaldasta nálgunin sendir öll viðeigandi gögn og beiðni notandans á náttúrulegu máli í eina LLM-kvaðningu, sem á að útbúa ákjósanlega áætlun eða úthlutun. Þetta getur virkað fyrir lítil vandamál eða vandamál með fáar skorður en bregst þegar flækjustigið eykst. Líkanið kann að hunsa skorður, setja rangt markmið í forgang eða gera áætlanir sem hljóma skynsamlega en eru óframkvæmanlegar, án áreiðanlegrar leiðar til að greina eða koma í veg fyrir bilanir.

  2. LLM + kóðatúlkur: Í þessari nálgun túlkar LLM beiðnina og notar verkfæri til að nálgast gagnagjafa og mynda keyranlegan bestunarkóða. Þetta eykur sveigjanleika og sýnileika en áreiðanleiki er áfram vandamál. LLM þarf enn að þýða skorðurnar yfir í réttan kóða og litlar villur í rökum eða forritun geta leitt til ógildra eða óhagkvæmra niðurstaðna, einkum þegar skorðum fjölgar.

  3. Blandað: LLM → skipulagðar skorður → ákvarðaður leysari: Þriðja nálgunin aðskilur ábyrgð. LLM „ákveður“ aldrei niðurstöðuna heldur hjálpar til við að setja breytur, skorður og markmið í formlegan búning. Viðurkenndur bestunarleysari framfylgir skorðum, tryggir framkvæmanleika og skilar niðurstöðum sem hægt er að sannreyna og rekja. Hlutverk LLM takmarkast við að þýða beiðnir á náttúrulegu máli yfir í skýrar, skipulagðar skorður með forskilgreindum skemum. Skorðurnar eru sjálfkrafa þýddar yfir í kóða fyrir leysara á borð við OR-Tools, sem reiknar framkvæmanlega, ákjósanlega lausn með ákvörðuðum hætti.

Niðurstöður

Við prófuðum aðferðirnar með nokkrum LLM, þar á meðal GPT-5, GPT-5.1 og GPT-5.2. Eins og búist var við stóð blandaða nálgunin sig betur en hinar:

Aðferð

Nákvæmni úthlutunar

Meðalbiðtími

Tókar notaðir í hverri fyrirspurn

Hreint LLM

70–78%

62–190 sek.

~175.000

LLM + kóðatúlkur

82–84%

62–140 sek.

~9.000

LLM → leysari (blandað)

95–97%

6–25 sek.

~2.000

Blandaða aðferðin okkar sýnir umtalsvert meiri nákvæmni, meira en fjórfalt betri nýtni tóka og tífalt styttri biðtíma.

Tilraunalota 2: almenn bestun út frá náttúrulegu máli

Næsta skref okkar er að smíða almennt, endurnýtanlegt viðmót sem umbreytir náttúrulegu máli í skipulagðar merkingarframsetningar sem bakendinn getur þýtt yfir í kóða fyrir leysara. Í þessari tilraun beindum við sjónum að línulegum bestunarvandamálum og mátum nálgunina með þremur opinberum gagnasöfnum (NLP4LP, NL4OPT og IndustryOR).

Nálganirnar sem við mátum

  1. Sjálfstætt LLM

  2. Blönduð aðferð (LLM → skipulagðar reglur → leysari → sannreynt úttak)

Skýringarmynd af blönduðu vinnuflæði frá beiðnum á náttúrulegu máli yfir í skipulagðar skorður, ákvarðaða úrlausn og sannreynt úttak.

  • Nota LLM til að draga breytur, skorður og markmið úr inntakinu og setja fram skipulagt bestunarvandamál.

  • Senda skipulagða vandamálið og upprunalegu beiðnina til LLM til sjálfssannprófunar.

  • Þýða skipulagða vandamálið yfir í OR-Tools-kóða til að reikna ákjósanlega úthlutun.

Niðurstöður

Við mátum nálgunina með sérþróuðum líkönum sem standa framarlega, þar á meðal GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max og GPT-5.2, ásamt opnum líkönum á borð við Kimi K2, GPT-OSS-líkön og MiniMax M2. Kassarit draga saman niðurstöður hverrar aðferðar.

Línurit sem ber saman sjálfstæð stór mállíkön og blandaðar nálganir með leysurum á viðmiðum fyrir bestun.

Blandaða nálgunin skilar nær alltaf nákvæmari, stöðugri og sannreynanlegri niðurstöðum en viðmið með sjálfstæðu LLM, í nánast öllum undirliggjandi mállíkönum sem voru metin. Þótt heildarárangur sé breytilegur milli líkana er hlutfallslegur ávinningur blönduðu nálgunarinnar stöðugur. Það bendir til þess að umbæturnar stafi af því að skilja að skilning á náttúrulegu máli og formlega bestun, fremur en að treysta á rökgetu eins tiltekins líkans.

Nákvæmni

Á NLP4LP og NL4OPT, sem samanstanda aðallega af línulegum bestunarvandamálum, nær blandaða aðferðin nær fullkominni nákvæmni og stendur sig betur en sjálfstæð LLM-kvaðning. Í stað þess að skila „nokkurn veginn réttum“ rökum myndar blandaða kerfið oftar gildar og vel mótaðar stærðfræðilegar framsetningar. Á erfiðara IndustryOR-gagnasafninu minnkar nákvæmni beggja aðferða, en af ólíkum ástæðum. Mörg IndustryOR-verkefni fela í sér fléttuskipan, svo sem leiðaval ökutækja, röðun verkefna og úthlutun starfsfólks, sem er umfram þá línulegu bestunargetu sem bakendi leysarans styður nú.

Greining á bilunum sýnir að sjálfstæð LLM brjóta oft gegn áskildum skorðum, eins og sýnt er hér að neðan:

Dæmi 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Sjálfstæða LLM-ið finnur lausn með minni heildarfitu en brýtur gegn kröfunni um að kalkúnamáltíðir megi ekki vera meira en 40% máltíðanna. Blandaða nálgunin framfylgir þessari hörðu skorðu rétt og skilar gildu svari.

Dæmi 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Sjálfstæða LLM-ið finnur aftur lausn með minni losun en fer yfir leyfilegt hámark verkjalyfja. Blandaða nálgunin framfylgir þessari hörðu skorðu rétt og skilar gildu svari.

Biðtími og notkun tóka

Gögn um biðtíma og notkun tóka leiða í ljós mikilvægan mun. Blandaða nálgunin hefur lengri meðalbiðtíma og notar fleiri tóka en stök LLM-kvaðning, en það endurspeglar val á högun fremur en óhagkvæmni.

Blandaða vinnslurásin felur í sér:

  1. Eitt eða fleiri köll í LLM til að draga út skipulagðar breytur, skorður og markmið.

  2. Sjálfssannprófun til að greina innra ósamræmi.

Þótt þessi skref auki vinnslukostnað miðað við eina kvaðningu er biðtíminn áfram afmarkaður og fyrirsjáanlegur og keyrsla leysarans er yfirleitt hröð þegar vandamálið hefur verið rétt framsett. Viðbótarvinnan skapar skýrar, endurnýtanlegar og rekjanlegar milliframsetningar. Sjálfstæðar LLM-nálganir þjappa hins vegar rökum saman í eina ógegnsæja myndun og færa kostnaðinn yfir á endurteknar tilraunir, handvirkt eftirlit og bilanir síðar í ferlinu. Í framtíðinni má draga úr þessum viðbótarkostnaði með:

  • Skyndivistun útdreginna skema.

  • Stigvaxandi uppfærslu á skorðum.

  • Betri stýringu kvaðninga og kalla.

Gagnsæi og rekjanleiki

Að lokum er eðli bilunarinnar gerólíkt, jafnvel þegar báðar aðferðirnar bregðast.

  • Þegar sjálfstætt LLM er notað eru bilanir oft hljóðlátar: líkanið kann að skila niðurstöðu sem er röng á lúmskan hátt.

  • Í blönduðu nálguninni gerir skýr framsetning vandamálsins bilanir sýnilegar og hjálpar teymum að greina hvaða hluti framsetningarinnar olli villunni.

Næstu útgáfur gætu birt þessar framsetningar í viðmóti svo notendur geti yfirfarið eða sannreynt þær áður en leysarinn er keyrður. Þetta gagnsæi bætir mælda nákvæmni og auðveldar villuleit og betrumbætur á kerfinu, sem er nauðsynlegt fyrir raunverulega innleiðingu.

Meginniðurstaða

Niðurstöður allra viðmiða og flestra undirliggjandi líkana sem voru prófuð styrkja meginniðurstöðu vinnu okkar:

LLM eru öflug í að skilja og túlka ásetning en ákvarðaðir leysarar eru nauðsynlegir til að tryggja rétta niðurstöðu.

Blandaða nálgunin breytir náttúrulegu máli úr uppsprettu tvíræðni í áreiðanlegt viðmót fyrir stærðfræðilega trausta ákvarðanatöku og færir gervigreind fyrirtækja skrefi nær kerfum sem eru ekki aðeins greind heldur einnig traust.

Næstu skref: endurnýtanleg formleg gervigreindarvél fyrir fyrirtæki

Skorður fyrirtækja eru sjaldnast í snyrtilegum skemum eða fullkomlega orðuðum kvaðningum. Þær eru dreifðar um gagnagrunna, töflureikna, innri reglur og samninga. Beiðnir notenda geta verið ófullkomnar, tvíræðar eða ósamrýmanlegar viðskiptareglum. Til að þessi nálgun virki í stórum stíl erum við að smíða endurnýtanlega bakendavél sem umbreytir þessari flækju í áreiðanlega getu fyrir fyrirtæki.

Skýringarmynd af formlegri gervigreindarvél fyrirtækja, þar á meðal viðskiptareglum, þýðingu fyrir leysara og rekjanlegri ákvarðanatöku.

Vettvangurinn

Kjarni vélarinnar er formlegur burðarás fyrir ákvörðunarkerfi sem byggjast á gervigreind og veitir:

  • Táknrænan þekkingargrunn með tengjum sem lesa inn viðskiptareglur, skorður, breytur og markmið.

  • Þýðingarlag sem þýðir skemu yfir í kóða fyrir leysara.

  • Viðmót þar sem teymi geta skoðað, yfirfarið og breytt skorðum.

Hvar þetta skapar verðmæti

Þótt þessar tilraunir beinist nú að bestun má einnig nota sömu aðferð við röklega sannprófun. Möguleg notkun í rekstri felur í sér:

  • Tilfallandi og kvika áætlanagerð, leiðaval og úthlutun aðfanga þar sem öllum rekstrarskorðum er fylgt.

  • Gerð svara og ráðlegginga sem fylgja viðskiptareglum með samræmdum hætti.

  • Hönnun og sannprófun flókinna þrívíddarhluta, myndbanda og mannvirkja þar sem óframkvæmanleg hönnun greinist fyrir framleiðslu.

Lokaorð

Gervigreind er öflug í dag en fyrirtæki þurfa meira en afl: þau þurfa réttar niðurstöður, samræmi og stjórn. Blandað kerfi okkar með LLM og leysara er skref í átt að heimi þar sem:

  • Fulltrúar búa hvorki til reglur né skorður úr lausu lofti.

  • Rökleg ályktun og bestun eru stærðfræðilega traust.

  • Náttúrulegt mál er altækt viðmót við ákvarðað kerfi.

Höfundur

Peng Seng Ang