Stór mállíkön (LLM) hafa tekið ótrúlegum framförum í skilningi á náttúrulegu máli, gerð lipurra svara og þróun nýrrar upplifunar fyrir viðskiptavini og starfsfólk. Þar sem LLM eru í eðli sínu slembin er þó aðeins að takmörkuðu leyti hægt að tryggja að úttak þeirra uppfylli kröfur eða sé ákjósanlegt þegar þau eru notuð við flókin töluleg eða rökleg viðfangsefni. Til dæmis:
Stjórnandi segir skipulagsaðstoðarmanni með gervigreind: “Ship as much as possible next week while keeping costs low,” og kerfið skilar metnaðarfullri áætlun sem virðist hagkvæm en fer án viðvörunar yfir afkastagetu vöruhússins og brýtur gegn afhendingarábyrgðum.
Samræmingaraðili segir aðstoðarmanni með gervigreind: “Reassign crews to reduce overnight stays and minimize disruption,” og líkanið útbýr ódýrari áætlun sem virðist ákjósanleg en brýtur gegn lögbundnum takmörkunum um vinnutíma eða hvíld.
Gervigreindaraðstoðarmaður í fjármálarekstri þarf að samþykkja færslur samkvæmt ströngum svæðisbundnum og áhættutengdum skilyrðum, en hleypir grunsamlegri færslu í gegn með tilbúnum rökstuðningi sem hljómar eins og hann uppfylli kröfur þótt hann brjóti gegn innri reglum.
Þar sem rekstrarkröfur eru strangar stuðlar samvinna LLM og formlegra leysara að því að ákvarðanir byggðar á náttúrulegu máli haldist innan skilgreindra marka og leiði ekki til óframkvæmanlegra, óhagkvæmra eða óheimilla niðurstaðna.
Rannsóknar- og þróunarteymi okkar kannar blandaða nálgun sem sameinar sköpunarkraft og sveigjanleika LLM við nákvæmni, tryggingar og gagnsæi formlegra stærðfræðilegra leysara á borð við Z3, Pyomo og OR-Tools. Við erum einnig að smíða endurnýtanlega formlega gervigreindarvél svo þessi geta verði staðlaður hluti af tæknigrunni fyrirtækja. Vettvangurinn gerir fyrirtækjum kleift að lesa viðskiptareglur beint úr núverandi kerfum, sannreyna ákvarðanir stöðugt gagnvart reglunum og innleiða gervigreindarfulltrúa á öruggan hátt innan skýrt skilgreindra marka.
Framtíðarsýn okkar er að draga úr rekstraráhættu og flýta jafnframt ákvarðanatöku í stórum stíl. Stjórnendur fá hraðari ákvarðanir sem samræmast reglum út frá lýsingum á náttúrulegu máli, en fyrirtæki geta sjálfvirknivætt tilfallandi breytingar á áætlanagerð, úthlutun aðfanga í aðfangakeðjum, fjármálarekstri, sannprófun reglna og jafnvel myndbands- eða þrívíddarhönnun. Innbyggðar varnir koma í veg fyrir að óframkvæmanlegar, óheimilar eða óöruggar niðurstöður fari í framleiðslu.
Í stýrðum tilraunum með bestun í anda flutningastarfsemi og þremur opinberum viðmiðum sýndi blandaða nálgunin okkar stöðugt fram á:
Meiri nákvæmni
Meiri túlkanleika og rekjanleika
Nálgun okkar snýr hinu hefðbundna viðmiði um að „LLM geri allt“ á haus og fylgir þess í stað þessari hönnun:


Þessi nálgun aðskilur ábyrgð með skýrum hætti: LLM draga reglur og skorður úr náttúrulegu máli en ákvarðaðir leysarar á borð við OR-Tools, Z3 og Pyomo annast bestun og sannprófun. Niðurstaðan sameinar styrkleika beggja nálgana:
LLM | Leysarar | Blandað (LLM + leysari) | |
|---|---|---|---|
Skilningur á ásetningi fólks á ólíkum sviðum | ✅ Framúrskarandi | ❌ Enginn | ✅ Framúrskarandi |
Ákvarðað hegðun | ❌ Nei | ✅ Tryggt | ✅ Já |
Sannanlega rétt stærðfræðileg rök og bestun með fjölmörgum skorðum | ⚠️ Ótraust | ✅ Tryggt | ✅ Já |
Rekjanleiki og túlkanleiki | ⚠️ Ótraust | ✅ Skýrt | ✅ Skýrt |
Viðnám gegn truflunum og innspýtingu í kvaðningum | ❌ Berskjaldað | ✅ Ónæmt | ✅ Sterkt |
Við byrjuðum á áskorun sem sumir viðskiptavina okkar glíma við:
Að umbreyta beiðnum á náttúrulegu máli í ákjósanlegar ákvarðanir um aðföng í rauntíma og framfylgja jafnframt rekstrar-, reglu- og kostnaðarskorðum af festu.
Þessi áskorun er kjarninn í nútíma flutningastarfsemi og aðfangakeðjum, þar á meðal vaktaskipulagi, úthlutun eigna, leiðavali, afhendingaráætlunum og afkastastýringu. Þarna þurfa LLM og formlegir leysarar einnig að vinna saman til að skapa traust kerfi. Við matið útbjuggum við stýrðar prófunaraðstæður, gagnagjafa og skorður ásamt 240 tilbúnum fyrirspurnum. Dæmi:
Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.
Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.
Af fyrirspurnunum sést að kerfið þarf að draga á áreiðanlegan hátt út og framfylgja hörðum og mjúkum skorðum beint úr beiðnum á náttúrulegu máli:
Harðar skorður eru ófrávíkjanlegar (t.d. fyrstu mögulegu upphafsdagsetningar, samningsskilmálar og efri mörk afkastagetu). Brot gegn einni slíkri skorðu ógildir lausnina.
Mjúkar skorður lýsa forgangsatriðum, svo sem að lágmarka tafir, draga úr kostnaði og takmarka breytingar. Markmiðið er að besta án þess að fara yfir hörð mörk.
Ekki er hægt að forskilgreina alla þætti þessara bestunarvandamála. Þá þarf að setja saman með kvikum hætti út frá forskilgreindum skorðum og markmiðum í skipulagðri viðskiptarökfræði, innri skjölum og rekstrargögnum, auk beiðni notandans.
Til að skilja hvernig ólíkar aðferðir standa sig við þessar aðstæður innleiddum við og bárum saman þrjár nálganir.
Hreint LLM: Einfaldasta nálgunin sendir öll viðeigandi gögn og beiðni notandans á náttúrulegu máli í eina LLM-kvaðningu, sem á að útbúa ákjósanlega áætlun eða úthlutun. Þetta getur virkað fyrir lítil vandamál eða vandamál með fáar skorður en bregst þegar flækjustigið eykst. Líkanið kann að hunsa skorður, setja rangt markmið í forgang eða gera áætlanir sem hljóma skynsamlega en eru óframkvæmanlegar, án áreiðanlegrar leiðar til að greina eða koma í veg fyrir bilanir.
LLM + kóðatúlkur: Í þessari nálgun túlkar LLM beiðnina og notar verkfæri til að nálgast gagnagjafa og mynda keyranlegan bestunarkóða. Þetta eykur sveigjanleika og sýnileika en áreiðanleiki er áfram vandamál. LLM þarf enn að þýða skorðurnar yfir í réttan kóða og litlar villur í rökum eða forritun geta leitt til ógildra eða óhagkvæmra niðurstaðna, einkum þegar skorðum fjölgar.
Blandað: LLM → skipulagðar skorður → ákvarðaður leysari: Þriðja nálgunin aðskilur ábyrgð. LLM „ákveður“ aldrei niðurstöðuna heldur hjálpar til við að setja breytur, skorður og markmið í formlegan búning. Viðurkenndur bestunarleysari framfylgir skorðum, tryggir framkvæmanleika og skilar niðurstöðum sem hægt er að sannreyna og rekja. Hlutverk LLM takmarkast við að þýða beiðnir á náttúrulegu máli yfir í skýrar, skipulagðar skorður með forskilgreindum skemum. Skorðurnar eru sjálfkrafa þýddar yfir í kóða fyrir leysara á borð við OR-Tools, sem reiknar framkvæmanlega, ákjósanlega lausn með ákvörðuðum hætti.
Við prófuðum aðferðirnar með nokkrum LLM, þar á meðal GPT-5, GPT-5.1 og GPT-5.2. Eins og búist var við stóð blandaða nálgunin sig betur en hinar:
Aðferð | Nákvæmni úthlutunar | Meðalbiðtími | Tókar notaðir í hverri fyrirspurn |
|---|---|---|---|
Hreint LLM | 70–78% | 62–190 sek. | ~175.000 |
LLM + kóðatúlkur | 82–84% | 62–140 sek. | ~9.000 |
LLM → leysari (blandað) | 95–97% | 6–25 sek. | ~2.000 |
Blandaða aðferðin okkar sýnir umtalsvert meiri nákvæmni, meira en fjórfalt betri nýtni tóka og tífalt styttri biðtíma.
Næsta skref okkar er að smíða almennt, endurnýtanlegt viðmót sem umbreytir náttúrulegu máli í skipulagðar merkingarframsetningar sem bakendinn getur þýtt yfir í kóða fyrir leysara. Í þessari tilraun beindum við sjónum að línulegum bestunarvandamálum og mátum nálgunina með þremur opinberum gagnasöfnum (NLP4LP, NL4OPT og IndustryOR).
Sjálfstætt LLM
Blönduð aðferð (LLM → skipulagðar reglur → leysari → sannreynt úttak)


Nota LLM til að draga breytur, skorður og markmið úr inntakinu og setja fram skipulagt bestunarvandamál.
Senda skipulagða vandamálið og upprunalegu beiðnina til LLM til sjálfssannprófunar.
Þýða skipulagða vandamálið yfir í OR-Tools-kóða til að reikna ákjósanlega úthlutun.
Við mátum nálgunina með sérþróuðum líkönum sem standa framarlega, þar á meðal GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max og GPT-5.2, ásamt opnum líkönum á borð við Kimi K2, GPT-OSS-líkön og MiniMax M2. Kassarit draga saman niðurstöður hverrar aðferðar.


Blandaða nálgunin skilar nær alltaf nákvæmari, stöðugri og sannreynanlegri niðurstöðum en viðmið með sjálfstæðu LLM, í nánast öllum undirliggjandi mállíkönum sem voru metin. Þótt heildarárangur sé breytilegur milli líkana er hlutfallslegur ávinningur blönduðu nálgunarinnar stöðugur. Það bendir til þess að umbæturnar stafi af því að skilja að skilning á náttúrulegu máli og formlega bestun, fremur en að treysta á rökgetu eins tiltekins líkans.
Nákvæmni
Á NLP4LP og NL4OPT, sem samanstanda aðallega af línulegum bestunarvandamálum, nær blandaða aðferðin nær fullkominni nákvæmni og stendur sig betur en sjálfstæð LLM-kvaðning. Í stað þess að skila „nokkurn veginn réttum“ rökum myndar blandaða kerfið oftar gildar og vel mótaðar stærðfræðilegar framsetningar. Á erfiðara IndustryOR-gagnasafninu minnkar nákvæmni beggja aðferða, en af ólíkum ástæðum. Mörg IndustryOR-verkefni fela í sér fléttuskipan, svo sem leiðaval ökutækja, röðun verkefna og úthlutun starfsfólks, sem er umfram þá línulegu bestunargetu sem bakendi leysarans styður nú.
Greining á bilunum sýnir að sjálfstæð LLM brjóta oft gegn áskildum skorðum, eins og sýnt er hér að neðan:
Dæmi 1:
Plain Text
Sjálfstæða LLM-ið finnur lausn með minni heildarfitu en brýtur gegn kröfunni um að kalkúnamáltíðir megi ekki vera meira en 40% máltíðanna. Blandaða nálgunin framfylgir þessari hörðu skorðu rétt og skilar gildu svari.
Dæmi 2:
Plain Text
Sjálfstæða LLM-ið finnur aftur lausn með minni losun en fer yfir leyfilegt hámark verkjalyfja. Blandaða nálgunin framfylgir þessari hörðu skorðu rétt og skilar gildu svari.
Biðtími og notkun tóka
Gögn um biðtíma og notkun tóka leiða í ljós mikilvægan mun. Blandaða nálgunin hefur lengri meðalbiðtíma og notar fleiri tóka en stök LLM-kvaðning, en það endurspeglar val á högun fremur en óhagkvæmni.
Blandaða vinnslurásin felur í sér:
Eitt eða fleiri köll í LLM til að draga út skipulagðar breytur, skorður og markmið.
Sjálfssannprófun til að greina innra ósamræmi.
Þótt þessi skref auki vinnslukostnað miðað við eina kvaðningu er biðtíminn áfram afmarkaður og fyrirsjáanlegur og keyrsla leysarans er yfirleitt hröð þegar vandamálið hefur verið rétt framsett. Viðbótarvinnan skapar skýrar, endurnýtanlegar og rekjanlegar milliframsetningar. Sjálfstæðar LLM-nálganir þjappa hins vegar rökum saman í eina ógegnsæja myndun og færa kostnaðinn yfir á endurteknar tilraunir, handvirkt eftirlit og bilanir síðar í ferlinu. Í framtíðinni má draga úr þessum viðbótarkostnaði með:
Skyndivistun útdreginna skema.
Stigvaxandi uppfærslu á skorðum.
Betri stýringu kvaðninga og kalla.
Gagnsæi og rekjanleiki
Að lokum er eðli bilunarinnar gerólíkt, jafnvel þegar báðar aðferðirnar bregðast.
Þegar sjálfstætt LLM er notað eru bilanir oft hljóðlátar: líkanið kann að skila niðurstöðu sem er röng á lúmskan hátt.
Í blönduðu nálguninni gerir skýr framsetning vandamálsins bilanir sýnilegar og hjálpar teymum að greina hvaða hluti framsetningarinnar olli villunni.
Næstu útgáfur gætu birt þessar framsetningar í viðmóti svo notendur geti yfirfarið eða sannreynt þær áður en leysarinn er keyrður. Þetta gagnsæi bætir mælda nákvæmni og auðveldar villuleit og betrumbætur á kerfinu, sem er nauðsynlegt fyrir raunverulega innleiðingu.
Meginniðurstaða
Niðurstöður allra viðmiða og flestra undirliggjandi líkana sem voru prófuð styrkja meginniðurstöðu vinnu okkar:
LLM eru öflug í að skilja og túlka ásetning en ákvarðaðir leysarar eru nauðsynlegir til að tryggja rétta niðurstöðu.
Blandaða nálgunin breytir náttúrulegu máli úr uppsprettu tvíræðni í áreiðanlegt viðmót fyrir stærðfræðilega trausta ákvarðanatöku og færir gervigreind fyrirtækja skrefi nær kerfum sem eru ekki aðeins greind heldur einnig traust.
Skorður fyrirtækja eru sjaldnast í snyrtilegum skemum eða fullkomlega orðuðum kvaðningum. Þær eru dreifðar um gagnagrunna, töflureikna, innri reglur og samninga. Beiðnir notenda geta verið ófullkomnar, tvíræðar eða ósamrýmanlegar viðskiptareglum. Til að þessi nálgun virki í stórum stíl erum við að smíða endurnýtanlega bakendavél sem umbreytir þessari flækju í áreiðanlega getu fyrir fyrirtæki.


Kjarni vélarinnar er formlegur burðarás fyrir ákvörðunarkerfi sem byggjast á gervigreind og veitir:
Táknrænan þekkingargrunn með tengjum sem lesa inn viðskiptareglur, skorður, breytur og markmið.
Þýðingarlag sem þýðir skemu yfir í kóða fyrir leysara.
Viðmót þar sem teymi geta skoðað, yfirfarið og breytt skorðum.
Þótt þessar tilraunir beinist nú að bestun má einnig nota sömu aðferð við röklega sannprófun. Möguleg notkun í rekstri felur í sér:
Tilfallandi og kvika áætlanagerð, leiðaval og úthlutun aðfanga þar sem öllum rekstrarskorðum er fylgt.
Gerð svara og ráðlegginga sem fylgja viðskiptareglum með samræmdum hætti.
Hönnun og sannprófun flókinna þrívíddarhluta, myndbanda og mannvirkja þar sem óframkvæmanleg hönnun greinist fyrir framleiðslu.
Gervigreind er öflug í dag en fyrirtæki þurfa meira en afl: þau þurfa réttar niðurstöður, samræmi og stjórn. Blandað kerfi okkar með LLM og leysara er skref í átt að heimi þar sem:
Fulltrúar búa hvorki til reglur né skorður úr lausu lofti.
Rökleg ályktun og bestun eru stærðfræðilega traust.
Náttúrulegt mál er altækt viðmót við ákvarðað kerfi.