Modelele lingvistice mari (LLM-urile) au făcut progrese extraordinare în înțelegerea limbajului natural, generarea de răspunsuri fluente și crearea unor experiențe complet noi pentru clienți și angajați. Totuși, deoarece LLM-urile sunt prin natura lor stocastice, utilizarea lor pentru raţionamente numerice sau logice complexe oferă garanții limitate că rezultatele vor fi conforme sau optime. De exemplu:
Un manager îi spune unui asistent AI de planificare: “Ship as much as possible next week while keeping costs low,” iar sistemul furnizează un plan agresiv, aparent eficient, care însă depășește capacitatea depozitului și încalcă garanțiile de livrare fără să semnaleze acest lucru.
Un coordonator îi spune unui asistent AI: “Reassign crews to reduce overnight stays and minimize disruption,” iar modelul creează un program mai ieftin, aparent optim, care însă încalcă limitele obligatorii privind timpul de lucru sau odihna.
Un asistent AI pentru operațiuni financiare trebuie să aprobe tranzacții în limite regionale și de risc stricte, dar autorizează o tranzacție suspectă inventând o justificare care pare conformă, deși încalcă politica internă.
În mediile cu cerințe operaționale stricte, combinarea LLM-urilor cu solver-e formale contribuie la menținerea deciziilor bazate pe limbaj natural în limitele definite și la evitarea rezultatelor irealizabile, suboptime sau neconforme.
Echipa noastră de C&D analizează o abordare hibridă care combină creativitatea și flexibilitatea LLM-urilor cu rigoarea, garanțiile și transparența solver-elor matematice formale precum Z3, Pyomo și OR-Tools. De asemenea, construim un motor AI formal reutilizabil, pentru ca această capacitate să devină o componentă standard a infrastructurii tehnologice pentru companii. Platforma le va permite organizațiilor să preia regulile de afaceri direct din sistemele existente, să verifice continuu deciziile în raport cu acestea și să implementeze în siguranță agenți AI, în limite clar definite.
Viziunea noastră este să reducem riscul operațional, accelerând totodată procesul decizional la scară largă. Liderii obțin mai rapid decizii conforme cu politicile, pornind de la informații în limbaj natural, iar organizațiile pot automatiza modificări ad-hoc în planificare, alocarea resurselor din lanțul de aprovizionare, operațiunile financiare, verificarea politicilor și chiar proiectarea video sau 3D. Mecanismele de protecție integrate împiedică rezultatele irealizabile, neconforme sau nesigure să ajungă în producție.
În experimente controlate cu probleme de optimizare specifice logisticii și trei seturi publice de referință, abordarea noastră hibridă a demonstrat constant:
Acuratețe mai mare
Interpretabilitate și auditabilitate sporite
Abordarea noastră inversează paradigma obișnuită „LLM-ul face totul” și urmează în schimb această structură:


Această abordare separă clar responsabilitățile: LLM-urile extrag reguli și constrângeri din limbajul natural, iar solver-ele deterministe precum OR-Tools, Z3 și Pyomo se ocupă de optimizare și verificare. Rezultatul combină avantajele ambelor abordări:
LLM-uri | Solver-e | Hibrid (LLM + solver) | |
|---|---|---|---|
Înțeleg intenția umană în diferite domenii | ✅ Excelent | ❌ Deloc | ✅ Excelent |
Comportament determinist | ❌ Nu | ✅ Garantat | ✅ Da |
Corectitudine demonstrabilă în raţionamentul matematic și optimizarea cu multiple constrângeri | ⚠️ Fragil | ✅ Garantat | ✅ Da |
Auditabilitate și interpretabilitate | ⚠️ Fragilă | ✅ Clară | ✅ Clară |
Rezistență la zgomotul și injecțiile din solicitări | ❌ Vulnerabil | ✅ Imun | ✅ Ridicată |
Am început cu o provocare întâlnită de unii dintre clienții noștri:
Transformarea cererilor în limbaj natural în decizii optime și în timp real privind resursele, cu respectarea strictă a constrângerilor operaționale, de politică și de cost.
Această provocare este esențială pentru logistica și lanțurile de aprovizionare moderne, incluzând programarea personalului, alocarea activelor, stabilirea rutelor, planificarea îndeplinirii comenzilor și gestionarea capacității. Tot aici LLM-urile și solver-ele formale trebuie să colaboreze pentru a crea sisteme demne de încredere. Pentru evaluare, am creat scenarii de testare controlate, surse de date și constrângeri, împreună cu 240 de interogări sintetice. Printre exemple se numără:
Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.
Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.
Interogările arată că sistemul trebuie să extragă și să aplice în mod fiabil constrângerile stricte și flexibile direct din cererile în limbaj natural:
Constrângerile stricte nu sunt negociabile (de exemplu, primele date de începere permise, clauzele contractuale și limitele de capacitate). Încălcarea oricăreia dintre ele invalidează soluția.
Constrângerile flexibile exprimă preferințe, precum reducerea întârzierilor și a costurilor sau limitarea modificărilor. Obiectivul este optimizarea fără depășirea limitelor stricte.
Unele aspecte ale acestor probleme de optimizare nu pot fi predefinite complet. Ele trebuie asamblate dinamic, folosind atât constrângeri și obiective predefinite din logica structurată a organizației, documente interne și date operaționale, cât și cererea utilizatorului.
Pentru a înțelege performanța diferitelor tehnici în acest context, am implementat și comparat trei abordări.
LLM pur: Cea mai simplă abordare transmite toate datele relevante și cererea utilizatorului în limbaj natural într-o singură solicitare către un LLM, căruia i se cere să producă un plan sau o alocare optimă. Deși această abordare poate funcționa pentru probleme mici sau cu puține constrângeri, ea devine ineficientă pe măsură ce sporește complexitatea. Modelul poate ignora constrângeri, poate prioritiza obiectivul greșit sau poate produce planuri care par rezonabile, dar sunt irealizabile, fără o metodă fiabilă de detectare sau prevenire a erorilor.
LLM + Interpretor de coduri: În această abordare, LLM-ul interpretează cererea și folosește instrumente pentru a accesa surse de date și a genera cod de optimizare executabil. Aceasta oferă mai multă flexibilitate și observabilitate, însă fiabilitatea rămâne problematică. LLM-ul trebuie în continuare să transpună constrângerile în cod corect, iar mici erori de raţionament sau programare pot produce rezultate nevalide ori suboptime, mai ales când numărul constrângerilor crește.
Hibrid: LLM → constrângeri structurate → solver determinist: A treia abordare separă responsabilitățile. LLM-ul nu „decide” niciodată rezultatul, ci ajută la formalizarea variabilelor, a constrângerilor și a obiectivelor. Un solver de optimizare consacrat aplică toate constrângerile, garantează fezabilitatea și produce rezultate care pot fi verificate și auditate. Rolul LLM-ului se limitează la transpunerea cererilor în limbaj natural în constrângeri explicite și structurate, folosind scheme predefinite. Aceste constrângeri sunt compilate automat în cod pentru solver, de exemplu OR-Tools, care calculează determinist o soluție fezabilă și optimă.
Am testat metodele folosind mai multe LLM-uri, inclusiv GPT-5, GPT-5.1 și GPT-5.2. Așa cum ne așteptam, abordarea hibridă a depășit alternativele:
Metodă | Acuratețea alocării | Latență medie | Tokenuri utilizate per interogare |
|---|---|---|---|
LLM pur | 70–78% | 62–190 s | ~175.000 |
LLM + Interpretor de coduri | 82–84% | 62–140 s | ~9.000 |
LLM → solver (hibrid) | 95–97% | 6–25 s | ~2.000 |
Metoda noastră hibridă demonstrează o creștere substanțială a acurateței, o eficiență a tokenurilor de peste 4 ori mai mare și o reducere a latenței cu un ordin de mărime.
Următorul pas este să construim o interfață generalizabilă și reutilizabilă, care transformă limbajul natural în reprezentări semantice structurate, pe care sistemul nostru backend le poate transpune în cod pregătit pentru solver. Pentru acest experiment, ne-am concentrat asupra problemelor de optimizare liniară și am evaluat abordarea folosind trei seturi publice de date (NLP4LP, NL4OPT și IndustryOR).
LLM independent
Metodă hibridă (LLM → reguli structurate → solver → rezultat verificat)


Utilizarea unui LLM pentru a extrage din datele de intrare variabilele, constrângerile și obiectivele și pentru a formula o problemă de optimizare structurată.
Transmiterea problemei structurate și a cererii originale către un LLM pentru autoverificare.
Transpunerea problemei structurate în cod OR-Tools pentru calcularea alocării optime.
Am evaluat această abordare folosind modele proprietare de vârf, inclusiv GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max și GPT-5.2, alături de modele open-source precum Kimi K2, modelele GPT-OSS și MiniMax M2. Diagramele de tip box plot sintetizează rezultatele fiecărei metode.


Abordarea hibridă produce constant rezultate mai exacte, mai stabile și mai ușor de verificat decât varianta de referință bazată pe un LLM independent, pentru aproape toate modelele lingvistice de bază evaluate. Deși performanța absolută variază între modele, avantajele relative ale abordării hibride rămân constante. Aceasta sugerează că îmbunătățirile provin din separarea înțelegerii limbajului natural de optimizarea formală, nu din dependența de capacitatea de raţionament a unui singur model.
Acuratețe
Pe NLP4LP și NL4OPT, care conțin în principal probleme de programare liniară, metoda hibridă atinge o acuratețe aproape maximă și depășește utilizarea solicitărilor cu un LLM independent. În loc să producă un raţionament „aproximativ corect”, sistemul hibrid generează mai consecvent formulări matematice valide și bine definite. Pe setul de date IndustryOR, care este mai dificil, acuratețea scade în cazul ambelor metode, dar din motive diferite. Multe probleme IndustryOR implică structuri combinatorii, precum stabilirea rutelor vehiculelor, ordonarea sarcinilor și repartizarea personalului, care depășesc capacitățile de optimizare liniară acceptate în prezent de sistemul nostru backend pentru solver.
Analiza tipurilor de erori arată că LLM-urile independente încalcă frecvent constrângerile obligatorii, după cum se vede mai jos:
Exemplul 1:
Plain Text
LLM-ul independent produce o soluție cu o cantitate totală mai mică de grăsimi, dar încalcă cerința ca mesele cu curcan să reprezinte cel mult 40% din total. Abordarea hibridă aplică corect această constrângere strictă și returnează un răspuns valid.
Exemplul 2:
Plain Text
LLM-ul independent produce din nou o soluție cu un nivel mai mic al externărilor, dar depășește limita maximă permisă pentru medicația analgezică. Abordarea hibridă aplică corect această constrângere strictă și returnează un răspuns valid.
Latență și utilizarea tokenurilor
Datele privind latența și utilizarea tokenurilor evidențiază o distincție importantă. Abordarea hibridă are o latență medie și un consum de tokenuri mai mari decât o singură solicitare către un LLM, dar acest lucru reflectă alegerile de arhitectură, nu ineficiența.
Fluxul hibrid include:
Unul sau mai multe apeluri către LLM pentru extragerea variabilelor structurate, a constrângerilor și a obiectivelor.
O etapă de autoverificare pentru detectarea inconsecvențelor interne.
Deși aceste etape adaugă un cost suplimentar față de o singură solicitare, latența rămâne limitată și previzibilă, iar solver-ul rulează de obicei rapid după formularea corectă a problemei. Efortul suplimentar creează reprezentări intermediare explicite, reutilizabile și auditabile. În schimb, abordările bazate exclusiv pe LLM comprimă raţionamentul într-o singură generare opacă, transferând costurile către reîncercări, verificări manuale și erori ulterioare. Versiunile viitoare pot reduce acest cost suplimentar prin:
Stocarea în cache a schemelor extrase.
Actualizarea incrementală a constrângerilor.
Îmbunătățirea orchestrării solicitărilor și apelurilor.
Transparență și auditabilitate
În cele din urmă, chiar și atunci când ambele metode eșuează, modul în care se produce eșecul este fundamental diferit.
În cazul unui LLM independent, erorile sunt adesea neobservate: modelul poate returna un rezultat subtil incorect.
În abordarea hibridă, formularea explicită a problemei face erorile transparente și ajută echipele să identifice partea formulării care le-a provocat.
Versiunile viitoare ar putea afișa aceste formulări într-o interfață, permițându-le utilizatorilor să le auditeze sau să le verifice înainte de rularea solver-ului. Această transparență îmbunătățește acuratețea măsurată și facilitează depanarea și perfecționarea sistemului, aspecte esențiale pentru implementarea în lumea reală.
Ideea principală
În toate testele de referință și pentru majoritatea modelelor de bază testate, rezultatele consolidează o concluzie centrală a activității noastre:
LLM-urile sunt performante în înțelegerea și transpunerea intenției, dar solver-ele deterministe sunt esențiale pentru garantarea corectitudinii.
Abordarea hibridă transformă limbajul natural dintr-o sursă de ambiguitate într-o interfață fiabilă pentru decizii corecte din punct de vedere matematic, apropiind AI-ul pentru companii de sisteme care sunt nu doar inteligente, ci și demne de încredere.
Constrângerile organizațiilor sunt rareori cuprinse în scheme ordonate sau în solicitări formulate perfect. Acestea sunt dispersate în baze de date, foi de calcul, politici interne și contracte. Cererile utilizatorilor pot fi incomplete, ambigue sau incompatibile cu regulile de afaceri. Pentru ca această abordare să funcționeze la scară largă, construim un motor backend reutilizabil care transformă această complexitate într-o capacitate fiabilă pentru companii.


În esență, acest motor este infrastructura formală a sistemelor decizionale bazate pe AI și oferă:
O bază simbolică de cunoștințe, cu adaptoare care preiau reguli de afaceri, constrângeri, variabile și obiective.
Un strat de transpunere care compilează schemele în cod pentru solver.
Interfețe care permit echipelor să examineze, să auditeze și să modifice constrângerile.
Deși aceste experimente se concentrează în prezent pe optimizare, aceeași metodă poate fi extinsă la verificarea logică. Printre posibilele aplicații de afaceri se numără:
Planificarea dinamică ad-hoc, stabilirea rutelor și alocarea resurselor, cu respectarea tuturor constrângerilor operaționale.
Generarea de răspunsuri și recomandări care respectă în mod consecvent regulile de afaceri.
Proiectarea și validarea obiectelor 3D, a materialelor video și a arhitecturilor complexe, cu detectarea proiectelor irealizabile înainte de producție.
AI-ul actual este performant, dar companiile au nevoie de mai mult decât performanță: au nevoie de corectitudine, consecvență și control. Sistemul nostru hibrid, bazat pe LLM și solver, reprezintă un pas către o lume în care:
Agenții nu inventează reguli sau constrângeri.
Deducția logică și optimizarea sunt corecte din punct de vedere matematic.
Limbajul natural devine interfața universală pentru sistemele deterministe.