Stora språkmodeller (LLM:er) har gjort enastående framsteg inom förståelse av naturligt språk, generering av välformulerade svar och helt nya upplevelser för kunder och medarbetare. Eftersom LLM:er i grunden är stokastiska ger användning av dem för komplexa numeriska eller logiska resonemang dock begränsade garantier för att resultaten följer reglerna eller är optimala. Till exempel:
En chef säger till en AI-baserad planeringsassistent: “Ship as much as possible next week while keeping costs low,” och systemet levererar en offensiv plan som verkar effektiv men i det tysta överskrider lagerkapaciteten och bryter leveransgarantierna.
En samordnare säger till en AI-assistent: “Reassign crews to reduce overnight stays and minimize disruption,” och modellen tar fram ett billigare schema som verkar optimalt men bryter mot obligatoriska regler för tjänstgörings- eller vilotid.
En AI-assistent för finansiell verksamhet måste godkänna transaktioner enligt strikta regionala krav och riskkrav, men släpper igenom en misstänkt transaktion genom att hitta på en motivering som låter regelrätt trots att den bryter mot interna policyer.
I miljöer med strikta verksamhetskrav bidrar kombinationen av LLM:er och formella lösare till att säkerställa att beslut som styrs av naturligt språk håller sig inom fastställda gränser och undviker ogenomförbara, suboptimala eller regelstridiga resultat.
Vårt FoU-team undersöker en hybridmetod som kombinerar LLM:ers kreativitet och flexibilitet med stringensen, garantierna och transparensen hos formella matematiska lösare som Z3, Pyomo och OR-Tools. Vi bygger också en återanvändbar formell AI-motor för att göra denna funktion till en standarddel av företagens teknikstack. Plattformen ska göra det möjligt för organisationer att hämta in affärsregler direkt från sina befintliga system, löpande kontrollera beslut mot dessa regler och driftsätta AI-agenter säkert inom tydligt fastställda gränser.
Vår vision är att minska verksamhetsriskerna och samtidigt påskynda beslutsfattandet i stor skala. Ledare får snabbare, policyenliga beslut utifrån indata på naturligt språk, samtidigt som organisationer kan automatisera tillfälliga ändringar i schemaläggning, resursfördelning i leveranskedjan, finansiell verksamhet, policykontroll och till och med video- eller 3D-design. Inbyggda skydd hindrar ogenomförbara, regelstridiga eller osäkra resultat från att nå produktionsmiljön.
I kontrollerade experiment med logistikliknande optimeringsproblem och tre offentliga referenstester uppvisade vår hybridmetod genomgående:
Högre träffsäkerhet
Bättre tolkningsbarhet och granskningsbarhet
Vår metod vänder på det vanliga paradigmet där ”LLM:en gör allt” och följer i stället denna utformning:


Metoden ger en tydlig ansvarsfördelning: LLM:er utvinner regler och begränsningar ur naturligt språk, medan deterministiska lösare som OR-Tools, Z3 och Pyomo hanterar optimering och verifiering. Resultatet förenar styrkorna hos båda metoderna:
LLM:er | Lösare | Hybrid (LLM + lösare) | |
|---|---|---|---|
Förstå mänskliga avsikter inom olika områden | ✅ Utmärkt | ❌ Ingen | ✅ Utmärkt |
Deterministiskt beteende | ❌ Nej | ✅ Garanterat | ✅ Ja |
Bevisbart korrekt matematisk resonemang och optimering med flera begränsningar | ⚠️ Bräckligt | ✅ Garanterat | ✅ Ja |
Granskningsbarhet och tolkningsbarhet | ⚠️ Bräckligt | ✅ Tydligt | ✅ Tydligt |
Motståndskraft mot promptbrus och promptinjektioner | ❌ Sårbar | ✅ Immun | ✅ Stark |
Vi började med en utmaning som några av våra kunder står inför:
Att omvandla förfrågningar på naturligt språk till optimala resursbeslut i realtid, samtidigt som verksamhets-, policy- och kostnadsbegränsningar strikt upprätthålls.
Utmaningen är central inom modern logistik och moderna leveranskedjor, bland annat vid personalplanering, tillgångsfördelning, ruttplanering, leveransplanering och kapacitetshantering. Det är också här LLM:er och formella lösare måste samverka för att skapa tillförlitliga system. För utvärderingen skapade vi kontrollerade testscenarier, datakällor och begränsningar samt 240 syntetiska frågor. Exempel:
Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.
Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.
Av frågorna framgår att systemet på ett tillförlitligt sätt måste utvinna och upprätthålla hårda och mjuka begränsningar direkt ur förfrågningar på naturligt språk:
Hårda begränsningar är inte förhandlingsbara (t.ex. tidigaste startdatum, avtalsvillkor och kapacitetstak). Om någon av dem överträds är lösningen ogiltig.
Mjuka begränsningar uttrycker preferenser, exempelvis att minimera förseningar, sänka kostnader och begränsa ändringar. Målet är att optimera utan att överskrida de hårda gränserna.
Vissa delar av dessa optimeringsproblem kan inte definieras helt i förväg. De måste sättas samman dynamiskt med hjälp av både fördefinierade begränsningar och mål från strukturerad affärslogik, interna dokument och verksamhetsdata samt användarens förfrågan.
För att förstå hur olika tekniker fungerar i den här miljön implementerade och jämförde vi tre metoder.
Ren LLM: Den enklaste metoden skickar alla relevanta data och användarens förfrågan på naturligt språk till en enda LLM-prompt, som ombeds ta fram en optimal plan eller fördelning. Det kan fungera för små problem eller problem med få begränsningar, men metoden brister när komplexiteten ökar. Modellen kan ignorera begränsningar, prioritera fel mål eller skapa planer som låter rimliga men inte går att genomföra, utan något tillförlitligt sätt att upptäcka eller förhindra felen.
LLM + Kodtolkare: I denna metod tolkar LLM:en förfrågan och använder verktyg för att komma åt datakällor och generera körbar optimeringskod. Det ger större flexibilitet och observerbarhet, men tillförlitligheten är fortfarande ett problem. LLM:en måste fortfarande översätta begränsningarna till korrekt kod, och små fel i resonemang eller kod kan ge ogiltiga eller suboptimala resultat, särskilt när antalet begränsningar ökar.
Hybrid: LLM → strukturerade begränsningar → deterministisk lösare: Den tredje metoden delar upp ansvaret. LLM:en ”fattar” aldrig beslut om resultatet, utan hjälper till att formalisera variablerna, begränsningarna och målen. En beprövad optimeringslösare upprätthåller begränsningarna, garanterar genomförbarhet och ger resultat som kan verifieras och granskas. LLM:ens roll begränsas till att översätta förfrågningar på naturligt språk till explicita, strukturerade begränsningar med hjälp av fördefinierade scheman. Begränsningarna kompileras automatiskt till kod för en lösare, exempelvis OR-Tools, som deterministiskt beräknar en genomförbar och optimal lösning.
Vi testade metoderna med flera LLM:er, däribland GPT-5, GPT-5.1 och GPT-5.2. Som väntat överträffade hybridmetoden alternativen:
Metod | Träffsäkerhet i fördelningen | Genomsnittlig latens | Token per fråga |
|---|---|---|---|
Ren LLM | 70–78 % | 62–190 s | ~175 000 |
LLM + Kodtolkare | 82–84 % | 62–140 s | ~9 000 |
LLM → lösare (hybrid) | 95–97 % | 6–25 s | ~2 000 |
Vår hybridmetod ger avsevärt högre träffsäkerhet, mer än fyra gånger högre tokeneffektivitet och en tiodubbling av hastigheten.
Nästa steg är att bygga ett generaliserbart och återanvändbart gränssnitt som omvandlar naturligt språk till strukturerade semantiska representationer, vilka vår backend kan översätta till kod som är klar för lösaren. I experimentet fokuserade vi på linjära optimeringsproblem och utvärderade metoden mot tre offentliga datauppsättningar (NLP4LP, NL4OPT och IndustryOR).
Fristående LLM
Hybridmetod (LLM → strukturerade regler → lösare → verifierat resultat)


Använd en LLM för att utvinna variabler, begränsningar och mål ur indata och formulera ett strukturerat optimeringsproblem.
Skicka det strukturerade problemet och den ursprungliga förfrågan till en LLM för självverifiering.
Översätt det strukturerade problemet till OR-Tools-kod för att beräkna den optimala fördelningen.
Vi utvärderade metoden med proprietära banbrytande modeller, däribland GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max och GPT-5.2, samt modeller med öppen källkod som Kimi K2, GPT-OSS-modeller och MiniMax M2. Lådagrammen sammanfattar resultaten för varje metod.


Hybridmetoden ger genomgående mer träffsäkra, stabila och verifierbara resultat än en fristående LLM-baslinje för nästan alla underliggande språkmodeller som utvärderades. Även om den absoluta prestandan varierar mellan modellerna är de relativa vinsterna med hybridmetoden konsekventa. Det tyder på att förbättringarna kommer av att förståelsen av naturligt språk skiljs från den formella optimeringen, snarare än av att man förlitar sig på en enskild modells resonemangsförmåga.
Träffsäkerhet
På NLP4LP och NL4OPT, som främst består av linjärprogrammeringsproblem, når hybridmetoden en träffsäkerhet nära taket och överträffar promptning av fristående LLM:er. I stället för att ge ”ungefär korrekta” resonemang skapar hybridsystemet mer konsekvent giltiga och välformulerade matematiska formuleringar. På den mer krävande datauppsättningen IndustryOR minskar träffsäkerheten för båda metoderna, men av olika skäl. Många IndustryOR-problem innehåller kombinatoriska strukturer, exempelvis fordonsruttplanering, uppgiftssekvensering och personalfördelning, som överstiger den kapacitet för linjär optimering som vår backendlösare för närvarande stöder.
Analysen av feltyperna visar att fristående LLM:er ofta bryter mot obligatoriska begränsningar, vilket illustreras nedan:
Exempel 1:
Plain Text
Den fristående LLM:en ger en lösning med lägre total fetthalt, men bryter mot kravet att kalkonmiddagar får utgöra högst 40 % av måltiderna. Hybridmetoden upprätthåller den hårda begränsningen korrekt och ger ett giltigt svar.
Exempel 2:
Plain Text
Den fristående LLM:en ger återigen en lösning med lägre utsläpp, men överskrider den högsta tillåtna gränsen för smärtstillande läkemedel. Hybridmetoden upprätthåller den hårda begränsningen korrekt och ger ett giltigt svar.
Latens och tokenanvändning
Uppgifterna om latens och tokenanvändning visar på en viktig skillnad. Hybridmetoden har högre genomsnittlig latens och tokenanvändning än en enstaka LLM-prompt, men det beror på arkitekturval snarare än ineffektivitet.
Hybridflödet omfattar:
Ett eller flera LLM-anrop för att utvinna strukturerade variabler, begränsningar och mål.
Ett steg för självverifiering som upptäcker interna inkonsekvenser.
Även om dessa steg medför extraarbete jämfört med en enstaka prompt förblir latensen begränsad och förutsägbar, och körningen av lösaren är normalt snabb när problemet väl är korrekt formulerat. Det extra arbetet skapar explicita, återanvändbara och granskningsbara mellanrepresentationer. Fristående LLM-metoder komprimerar däremot resonemanget till en enda ogenomskinlig generering och flyttar kostnaderna till nya försök, manuella kontroller och efterföljande fel. Framtida versioner kan minska detta extraarbete genom att:
Cachelagra utvunna scheman.
Uppdatera begränsningar stegvis.
Förbättra orkestreringen av prompter och anrop.
Transparens och granskningsbarhet
Slutligen är själva feltypen fundamentalt annorlunda, även när båda metoderna misslyckas.
Med en fristående LLM sker fel ofta utan att märkas: modellen kan ge ett resultat som är felaktigt på ett svårupptäckt sätt.
Med hybridmetoden gör den explicita problemformuleringen felen synliga och hjälper team att identifiera vilken del av formuleringen som orsakade felet.
Framtida versioner skulle kunna visa formuleringarna i ett gränssnitt så att användarna kan granska eller verifiera dem innan lösaren körs. Denna transparens förbättrar den uppmätta träffsäkerheten och gör systemet enklare att felsöka och förfina, vilket är avgörande för användning i verkliga miljöer.
Viktigaste slutsatsen
Resultaten från alla referenstester och de flesta testade underliggande modellerna stärker en central slutsats i vårt arbete:
LLM:er är kraftfulla när det gäller att förstå och översätta avsikter, men deterministiska lösare är nödvändiga för att säkerställa korrekthet.
Hybridmetoden omvandlar naturligt språk från en källa till tvetydighet till ett tillförlitligt gränssnitt för matematiskt välgrundade beslut. Därmed kommer AI för företag ett steg närmare system som inte bara är intelligenta utan också tillförlitliga.
Företagsbegränsningar finns sällan i prydliga scheman eller perfekt formulerade prompter. De är utspridda i databaser, kalkylblad, interna policyer och avtal. Användarförfrågningar kan vara ofullständiga, tvetydiga eller oförenliga med affärsregler. För att metoden ska fungera i stor skala bygger vi en återanvändbar backendmotor som omvandlar denna komplexitet till en tillförlitlig företagsfunktion.


I grunden fungerar motorn som en formell ryggrad för AI-drivna beslutssystem och tillhandahåller:
En symbolisk kunskapsbas med adaptrar som hämtar in affärsregler, begränsningar, variabler och mål.
Ett översättningslager som kompilerar scheman till kod för lösare.
Gränssnitt där team kan inspektera, granska och ändra begränsningar.
Även om experimenten för närvarande är inriktade på optimering kan samma metod utvidgas till logisk verifiering. Möjliga affärstillämpningar är att:
Utföra dynamisk ad hoc-schemaläggning, ruttplanering och resursfördelning samtidigt som alla verksamhetsbegränsningar upprätthålls.
Generera svar och rekommendationer som konsekvent följer affärsreglerna.
Utforma och validera komplexa 3D-objekt, videor och arkitekturer samt upptäcka ogenomförbara konstruktioner före produktion.
Dagens AI är kraftfull, men företag behöver mer än kraft: de behöver korrekthet, konsekvens och kontroll. Vårt hybridsystem med LLM:er och lösare är ett steg mot en värld där:
Agenter inte hallucinerar regler eller begränsningar.
Logisk slutledning och optimering är matematiskt välgrundade.
Naturligt språk fungerar som ett universellt gränssnitt till deterministiska system.