Combinació de LLM i solucionadors formals per prendre decisions d'IA fiables

Una arquitectura híbrida combina la flexibilitat dels LLM amb solucionadors deterministes per prendre decisions empresarials fiables i verificables.

Els grans models de llenguatge (LLM) han avançat extraordinàriament en la comprensió del llenguatge natural, la generació de respostes fluides i la creació d'experiències totalment noves per a clients i empleats. Tanmateix, com que els LLM són inherentment estocàstics, el seu ús per a raonaments numèrics o lògics complexos ofereix poques garanties que els resultats siguin conformes o òptims. Per exemple:

  • Un responsable diu a un assistent de planificació amb IA: "Ship as much as possible next week while keeping costs low," i el sistema presenta un pla agressiu que sembla eficient, però supera la capacitat del magatzem sense avisar i incompleix les garanties de lliurament.

  • Un coordinador diu a un assistent d'IA: "Reassign crews to reduce overnight stays and minimize disruption," i el model genera un calendari de menys cost que sembla òptim, però incompleix les restriccions obligatòries de temps de servei o descans.

  • Un assistent d'IA per a operacions financeres ha d'aprovar transaccions subjectes a restriccions regionals i de risc estrictes, però autoritza una transacció sospitosa inventant una justificació que sembla conforme tot i infringir la política interna.

En entorns amb requisits operatius estrictes, combinar LLM amb solucionadors formals ajuda a garantir que les decisions basades en llenguatge natural es mantinguin dins dels límits definits i evitin resultats inviables, subòptims o no conformes.

El nostre equip d'R+D investiga un enfocament híbrid que combina la creativitat i la flexibilitat dels LLM amb el rigor, les garanties i la transparència de solucionadors matemàtics formals com Z3, Pyomo i OR-Tools. També estem creant un motor d'IA formal reutilitzable perquè aquesta capacitat esdevingui un component habitual de l'arquitectura tecnològica empresarial. La plataforma permetrà a les organitzacions importar regles de negoci directament dels sistemes existents, verificar-hi contínuament les decisions i desplegar agents d'IA de manera segura dins de límits clarament definits.

La nostra visió és reduir el risc operatiu i, alhora, accelerar la presa de decisions a gran escala. Els responsables obtenen decisions més ràpides i conformes a les polítiques a partir d'instruccions en llenguatge natural, mentre que les organitzacions poden automatitzar canvis puntuals en la programació, l'assignació de recursos de la cadena de subministrament, les operacions financeres, la verificació de polítiques i fins i tot el disseny de vídeo o 3D. Les salvaguardes integrades impedeixen que arribin a producció resultats inviables, no conformes o insegurs.

En experiments controlats amb problemes d'optimització logística i tres conjunts de referència públics, el nostre enfocament híbrid va demostrar sistemàticament:

  • Més precisió

  • Més interpretabilitat i auditabilitat

L'arquitectura híbrida

El nostre enfocament capgira el paradigma habitual en què "el LLM ho fa tot" i adopta aquest disseny:

Diagrama que compara com els grans models de llenguatge i els solucionadors deterministes combinen la comprensió del llenguatge natural amb una optimització verificable.

Aquest enfocament separa clarament les responsabilitats: els LLM extreuen regles i restriccions del llenguatge natural, mentre que solucionadors deterministes com OR-Tools, Z3 i Pyomo s'encarreguen de l'optimització i la verificació. El resultat combina els punts forts de tots dos enfocaments:

LLM

Solucionadors

Híbrid (LLM + solucionador)

Comprensió de la intenció humana en diferents àmbits

✅ Excel·lent

❌ Cap

✅ Excel·lent

Comportament determinista

❌ No

✅ Garantit

✅ Sí

Correcció demostrable en raonament matemàtic i optimització amb múltiples restriccions

⚠️ Fràgil

✅ Garantit

✅ Sí

Auditabilitat i interpretabilitat

⚠️ Fràgil

✅ Clara

✅ Clara

Resistència al soroll i a la injecció d'indicacions

❌ Vulnerable

✅ Immune

✅ Alta

Línia experimental 1: logística i assignació de personal

L'àmbit del problema

Vam començar amb un repte al qual s'enfronten alguns clients:

Convertir peticions en llenguatge natural en decisions òptimes sobre recursos en temps real, tot aplicant estrictament les restriccions operatives, de polítiques i de costos.

Aquest repte és al centre de la logística i les cadenes de subministrament modernes, com ara la programació de personal, l'assignació d'actius, les rutes, la planificació del compliment de comandes i la gestió de la capacitat. També és un àmbit en què els LLM i els solucionadors formals han de treballar conjuntament per crear sistemes fiables. Per a l'avaluació, vam crear escenaris de prova, fonts de dades i restriccions controlats, juntament amb 240 consultes sintètiques. Alguns exemples són:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Les consultes mostren que el sistema ha d'extreure i aplicar de manera fiable restriccions dures i flexibles directament de peticions en llenguatge natural:

  • Les restriccions dures no són negociables (p. ex., dates d'inici més primerenques, condicions contractuals i límits de capacitat). Incomplir-ne qualsevol invalida la solució.

  • Les restriccions flexibles codifiquen preferències, com minimitzar els retards, reduir els costos i limitar els canvis. L'objectiu és optimitzar sense traspassar els límits estrictes.

Alguns aspectes d'aquests problemes d'optimització no es poden predefinir completament. S'han de construir dinàmicament a partir de restriccions i objectius predefinits procedents de la lògica de negoci estructurada, els documents interns i les dades operatives, però també de la petició de l'usuari.

Els enfocaments avaluats

Per entendre el rendiment de diferents tècniques en aquest entorn, vam implementar i comparar tres enfocaments.

  1. LLM pur: l'enfocament més senzill envia totes les dades rellevants i la petició de l'usuari en llenguatge natural a una única indicació per a un LLM, al qual es demana que generi un pla o una assignació òptims. Tot i que pot funcionar amb problemes petits o amb poques restriccions, deixa de funcionar a mesura que augmenta la complexitat. El model pot ignorar restriccions, prioritzar un objectiu equivocat o generar plans que semblen raonables però són inviables, sense cap manera fiable de detectar o evitar els errors.

  2. LLM + Intèrpret de codi: en aquest enfocament, el LLM interpreta la petició i utilitza eines per accedir a fonts de dades i generar codi d'optimització executable. Això aporta flexibilitat i observabilitat, però la fiabilitat continua sent un problema. El LLM encara ha de traduir les restriccions a codi correcte, i petits errors de raonament o programació poden generar resultats invàlids o subòptims, sobretot quan augmenta el nombre de restriccions.

  3. Híbrid: LLM → restriccions estructurades → solucionador determinista: el tercer enfocament separa les responsabilitats. El LLM mai no "decideix" el resultat, sinó que ajuda a formalitzar les variables, les restriccions i els objectius. Un solucionador d'optimització provat aplica les restriccions, garanteix la viabilitat i genera resultats que es poden verificar i auditar. La funció del LLM es limita a traduir les peticions en llenguatge natural en restriccions explícites i estructurades mitjançant esquemes predefinits. Aquestes restriccions es compilen automàticament en codi per a solucionadors com OR-Tools, que calcula de manera determinista una solució viable i òptima.

Resultats

Vam provar els mètodes amb diversos LLM, com ara GPT-5, GPT-5.1 i GPT-5.2. Com era d'esperar, l'enfocament híbrid va superar les alternatives:

Mètode

Precisió de l'assignació

Latència mitjana

Segments utilitzats per consulta

LLM pur

70–78%

62–190 s

~175.000

LLM + Intèrpret de codi

82–84%

62–140 s

~9.000

LLM → solucionador (híbrid)

95–97%

6–25 s

~2.000

El nostre mètode híbrid demostra un augment substancial de la precisió, una eficiència en l'ús de segments més de quatre vegades superior i una reducció d'un ordre de magnitud en la latència.

Línia experimental 2: optimització general a partir del llenguatge natural

El pas següent és crear una interfície generalitzable i reutilitzable que converteixi el llenguatge natural en representacions semàntiques estructurades que el nostre backend pugui traduir en codi preparat per al solucionador. En aquest experiment, ens vam centrar en problemes d'optimització lineal i vam avaluar l'enfocament amb tres conjunts de dades públics (NLP4LP, NL4OPT i IndustryOR).

Els enfocaments avaluats

  1. LLM independent

  2. Mètode híbrid (LLM → regles estructurades → solucionador → resultat verificat)

Diagrama del flux de treball híbrid, des de les peticions en llenguatge natural fins a les restriccions estructurades, la resolució determinista i el resultat verificat.

  • Utilitzar un LLM per extreure variables, restriccions i objectius de l'entrada i formular un problema d'optimització estructurat.

  • Enviar el problema estructurat i la petició original a un LLM perquè faci una autoverificació.

  • Traduir el problema estructurat a codi d'OR-Tools per calcular l'assignació òptima.

Resultats

Vam avaluar aquest enfocament amb models d'avantguarda propietaris, com GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max i GPT-5.2, i amb models de codi obert com Kimi K2, els models GPT-OSS i MiniMax M2. Els diagrames de caixa resumeixen els resultats de cada mètode.

Gràfic que compara grans models de llenguatge independents amb enfocaments híbrids basats en solucionadors en diversos conjunts de referència d'optimització.

En gairebé tots els models de llenguatge subjacents avaluats, l'enfocament híbrid genera sistemàticament resultats més precisos, estables i verificables que un LLM independent de referència. Tot i que el rendiment absolut varia entre models, els guanys relatius de l'enfocament híbrid es mantenen constants. Això indica que les millores provenen de separar la comprensió del llenguatge natural de l'optimització formal, en lloc de dependre de la capacitat de raonament d'un únic model.

Precisió

A NLP4LP i NL4OPT, formats principalment per problemes de programació lineal, el mètode híbrid assoleix una precisió gairebé màxima i supera l'ús d'indicacions amb LLM independents. En lloc de produir un raonament "aproximadament correcte", el sistema híbrid genera amb més constància formulacions matemàtiques vàlides i ben construïdes. En el conjunt de dades IndustryOR, més exigent, la precisió disminueix amb tots dos mètodes, però per motius diferents. Molts problemes d'IndustryOR inclouen estructures combinatòries, com les rutes de vehicles, la seqüenciació de tasques i l'assignació de personal, que superen les capacitats d'optimització lineal que admet actualment el nostre backend de solucionadors.

L'anàlisi dels modes d'error mostra que els LLM independents incompleixen sovint les restriccions obligatòries, com s'il·lustra a continuació:

Exemple 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

El LLM independent genera una solució amb menys greix total, però incompleix el requisit que els àpats de gall dindi no representin més del 40% dels àpats. L'enfocament híbrid aplica correctament aquesta restricció dura i retorna una resposta vàlida.

Exemple 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

El LLM independent torna a generar una solució amb una descàrrega inferior, però supera el límit màxim permès de medicació analgèsica. L'enfocament híbrid aplica correctament aquesta restricció dura i retorna una resposta vàlida.

Latència i ús de segments

Les dades de latència i ús de segments revelen una distinció important. L'enfocament híbrid té una latència mitjana i un ús de segments superiors als d'una única indicació per a un LLM, però això reflecteix decisions arquitectòniques, no pas ineficiència.

El procés híbrid inclou:

  1. Una o més crides a un LLM per extreure variables estructurades, restriccions i objectius.

  2. Un pas d'autoverificació per detectar incoherències internes.

Tot i que aquests passos afegeixen sobrecàrrega respecte d'una sola indicació, la latència es manté limitada i previsible, i l'execució del solucionador sol ser ràpida un cop el problema està ben formulat. Aquest treball addicional crea representacions intermèdies explícites, reutilitzables i auditables. En canvi, els enfocaments basats només en LLM comprimeixen el raonament en una única generació opaca i traslladen els costos als reintents, les comprovacions manuals i els errors posteriors. Les iteracions futures poden reduir aquesta sobrecàrrega mitjançant:

  • L'emmagatzematge en memòria cau dels esquemes extrets.

  • L'actualització incremental de les restriccions.

  • La millora de l'orquestració de les indicacions i les crides.

Transparència i auditabilitat

Finalment, fins i tot quan tots dos mètodes fallen, la manera com ho fan és fonamentalment diferent.

  • Amb un LLM independent, els errors sovint passen desapercebuts: el model pot retornar un resultat subtilment incorrecte.

  • Amb l'enfocament híbrid, la formulació explícita del problema fa visibles els errors i ajuda els equips a identificar quina part de la formulació els ha provocat.

Les versions futures podrien mostrar aquestes formulacions en una interfície perquè els usuaris les poguessin auditar o verificar abans d'executar el solucionador. Aquesta transparència millora la precisió mesurada i facilita la depuració i el perfeccionament del sistema, aspectes essencials per desplegar-lo en entorns reals.

Conclusió principal

En tots els conjunts de referència i en la majoria dels models subjacents provats, els resultats reforcen una conclusió central del nostre treball:

Els LLM són potents per comprendre i traduir intencions, però els solucionadors deterministes són essencials per garantir la correcció.

L'enfocament híbrid transforma el llenguatge natural, que deixa de ser una font d'ambigüitat per convertir-se en una interfície fiable per prendre decisions matemàticament sòlides, i acosta la IA empresarial a sistemes que no només són intel·ligents, sinó també dignes de confiança.

El pas següent: un motor d'IA formal reutilitzable per a l'empresa

Les restriccions empresarials rarament es troben en esquemes ordenats o indicacions perfectament formulades. Estan disperses entre bases de dades, fulls de càlcul, polítiques internes i contractes. Les peticions dels usuaris poden ser incompletes, ambigües o incoherents amb les regles de negoci. Per aplicar aquest enfocament a gran escala, estem creant un motor de backend reutilitzable que transforma aquesta complexitat en una capacitat empresarial fiable.

Diagrama del motor d'IA formal empresarial, amb regles de negoci, traducció per al solucionador i presa de decisions auditable.

La plataforma

En essència, aquest motor actua com a eix formal dels sistemes de decisió basats en IA i ofereix:

  • Una base de coneixement simbòlica amb adaptadors que importen regles de negoci, restriccions, variables i objectius.

  • Una capa de traducció que compila esquemes en codi per al solucionador.

  • Interfícies que permeten als equips examinar, auditar i modificar les restriccions.

On genera valor

Tot i que aquests experiments se centren actualment en l'optimització, el mateix mètode es pot estendre a la verificació lògica. Entre les possibles aplicacions empresarials hi ha:

  • Fer programacions, assignacions de rutes i distribucions de recursos dinàmiques i puntuals, tot garantint el compliment de cada restricció operativa.

  • Generar respostes i recomanacions que respectin sistemàticament les regles de negoci.

  • Dissenyar i validar objectes 3D, vídeos i arquitectures complexos, i detectar els dissenys inviables abans de la producció.

Reflexions finals

La IA actual és potent, però les empreses necessiten més que potència: necessiten correcció, coherència i control. El nostre sistema híbrid de LLM i solucionadors és un pas cap a un món on:

  • Els agents no inventen regles ni restriccions.

  • La deducció lògica i l'optimització són matemàticament sòlides.

  • El llenguatge natural serveix d'interfície universal per als sistemes deterministes.

Author

Peng Seng Ang