LLM e risolutori formali per decisioni IA affidabili

Un'architettura ibrida combina la flessibilità degli LLM con risolutori deterministici per produrre decisioni aziendali affidabili e verificabili.

I modelli linguistici di grandi dimensioni (LLM) hanno compiuto progressi straordinari nella comprensione del linguaggio naturale, nella generazione di risposte fluide e nella creazione di esperienze del tutto nuove per clienti e dipendenti. Tuttavia, poiché gli LLM sono intrinsecamente stocastici, il loro impiego per ragionamenti numerici o logici complessi offre garanzie limitate sulla conformità o sull'ottimalità dei risultati. Ad esempio:

  • Un responsabile dice a un assistente di pianificazione basato sull'IA: “Ship as much as possible next week while keeping costs low,” e il sistema propone un piano aggressivo, apparentemente efficiente, che però supera senza segnalarlo la capacità del magazzino e non rispetta le garanzie di consegna.

  • Un coordinatore dice a un assistente basato sull'IA: “Reassign crews to reduce overnight stays and minimize disruption,” e il modello produce un programma meno costoso e apparentemente ottimale, che però viola i vincoli obbligatori sui tempi di servizio o di riposo.

  • Un assistente IA per le operazioni finanziarie deve approvare transazioni nel rispetto di rigorosi vincoli regionali e di rischio, ma autorizza una transazione sospetta inventando una motivazione che sembra conforme pur violando le norme interne.

Negli ambienti con requisiti operativi rigorosi, combinare gli LLM con risolutori formali aiuta a garantire che le decisioni basate sul linguaggio naturale restino entro limiti definiti ed evitino risultati irrealizzabili, subottimali o non conformi.

Il nostro team di R&S sta studiando un approccio ibrido che unisce la creatività e la flessibilità degli LLM al rigore, alle garanzie e alla trasparenza di risolutori matematici formali come Z3, Pyomo e OR-Tools. Stiamo inoltre sviluppando un motore formale di IA riutilizzabile, per rendere questa funzionalità una componente standard dello stack tecnologico aziendale. La piattaforma consentirà alle organizzazioni di importare le regole aziendali direttamente dai sistemi esistenti, verificare continuamente le decisioni rispetto a tali regole e distribuire agenti IA in sicurezza entro limiti chiaramente definiti.

La nostra visione è ridurre il rischio operativo, accelerando al contempo il processo decisionale su larga scala. I dirigenti ottengono più rapidamente decisioni conformi alle norme a partire da input in linguaggio naturale, mentre le organizzazioni possono automatizzare modifiche ad hoc nella pianificazione, nell'allocazione delle risorse della supply chain, nelle operazioni finanziarie, nella verifica delle norme e persino nella progettazione video o 3D. Le misure di sicurezza integrate impediscono che risultati irrealizzabili, non conformi o pericolosi arrivino in produzione.

In esperimenti controllati su problemi di ottimizzazione di tipo logistico e tre benchmark pubblici, il nostro approccio ibrido ha dimostrato costantemente:

  • Maggiore accuratezza

  • Maggiore interpretabilità e verificabilità

L'architettura ibrida

Il nostro approccio ribalta il consueto paradigma «l'LLM fa tutto» e adotta invece questa struttura:

Diagramma che mostra come modelli linguistici di grandi dimensioni e risolutori deterministici combinano la comprensione del linguaggio naturale con un'ottimizzazione verificabile.

Questo approccio separa chiaramente le responsabilità: gli LLM estraggono regole e vincoli dal linguaggio naturale, mentre risolutori deterministici come OR-Tools, Z3 e Pyomo gestiscono l'ottimizzazione e la verifica. Il risultato combina i punti di forza di entrambi gli approcci:

LLM

Risolutori

Ibrido (LLM + risolutore)

Comprensione dell'intento umano in ambiti diversi

✅ Eccellente

❌ Nessuna

✅ Eccellente

Comportamento deterministico

❌ No

✅ Garantito

✅ Sì

Correttezza dimostrabile nel ragionamento matematico e nell'ottimizzazione con più vincoli

⚠️ Fragile

✅ Garantita

✅ Sì

Verificabilità e interpretabilità

⚠️ Fragile

✅ Chiara

✅ Chiara

Resistenza al rumore e alle injection nei prompt

❌ Vulnerabile

✅ Immune

✅ Elevata

Percorso sperimentale 1: logistica e assegnazione del personale

L'ambito del problema

Siamo partiti da una sfida affrontata da alcuni nostri clienti:

Trasformare richieste in linguaggio naturale in decisioni ottimali e in tempo reale sulle risorse, applicando rigorosamente vincoli operativi, normativi e di costo.

Questa sfida è centrale nella logistica e nelle supply chain moderne e comprende la pianificazione del personale, l'allocazione degli asset, l'instradamento, la pianificazione degli approvvigionamenti e la gestione della capacità. È anche l'ambito in cui LLM e risolutori formali devono collaborare per creare sistemi affidabili. Per la valutazione abbiamo creato scenari di test controllati, fonti di dati e vincoli, insieme a 240 query sintetiche. Alcuni esempi:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Dalle query risulta evidente che il sistema deve estrarre e applicare in modo affidabile vincoli rigidi e flessibili direttamente dalle richieste in linguaggio naturale:

  • I vincoli rigidi non sono negoziabili, come le date di inizio più prossime, le condizioni contrattuali e i limiti di capacità. La violazione di uno solo di essi invalida la soluzione.

  • I vincoli flessibili esprimono preferenze, come ridurre al minimo i ritardi, i costi e le modifiche. L'obiettivo è ottimizzare senza superare i limiti rigidi.

Alcuni aspetti di questi problemi di ottimizzazione non possono essere completamente predefiniti. Devono essere costruiti dinamicamente attingendo non solo a vincoli e obiettivi predefiniti provenienti dalla logica aziendale strutturata, dai documenti interni e dai dati operativi, ma anche alla richiesta dell'utente.

Gli approcci valutati

Per capire le prestazioni delle diverse tecniche in questo contesto, abbiamo implementato e confrontato tre approcci.

  1. LLM puro: l'approccio più semplice passa tutti i dati pertinenti e la richiesta dell'utente in linguaggio naturale a un singolo prompt LLM, incaricato di produrre un piano o un'allocazione ottimale. Può funzionare con problemi piccoli o con pochi vincoli, ma perde efficacia all'aumentare della complessità. Il modello può ignorare i vincoli, dare priorità all'obiettivo sbagliato o produrre piani che sembrano ragionevoli ma sono irrealizzabili, senza alcun modo affidabile per rilevare o prevenire gli errori.

  2. LLM + Code Interpreter: in questo approccio, l'LLM interpreta la richiesta e usa strumenti per accedere alle fonti di dati e generare codice di ottimizzazione eseguibile. Ciò aumenta la flessibilità e l'osservabilità, ma l'affidabilità resta problematica. L'LLM deve comunque tradurre i vincoli in codice corretto e piccoli errori di ragionamento o programmazione possono generare risultati non validi o subottimali, soprattutto con l'aumento dei vincoli.

  3. Ibrido: LLM → vincoli strutturati → risolutore deterministico: il terzo approccio separa le responsabilità. L'LLM non «decide» mai il risultato, ma contribuisce a formalizzare variabili, vincoli e obiettivi. Un risolutore di ottimizzazione collaudato applica i vincoli, garantisce la fattibilità e produce risultati verificabili e controllabili. Il ruolo dell'LLM si limita a tradurre le richieste in linguaggio naturale in vincoli espliciti e strutturati tramite schemi predefiniti. Tali vincoli vengono compilati automaticamente in codice per risolutori come OR-Tools, che calcolano in modo deterministico una soluzione fattibile e ottimale.

Risultati

Abbiamo testato i metodi con diversi LLM, tra cui GPT-5, GPT-5.1 e GPT-5.2. Come previsto, l'approccio ibrido ha superato le alternative:

Metodo

Accuratezza dell'assegnazione

Latenza media

Token usati per query

LLM puro

70–78%

62–190 s

~175.000

LLM + Code Interpreter

82–84%

62–140 s

~9.000

LLM → risolutore (ibrido)

95–97%

6–25 s

~2.000

Il nostro metodo ibrido dimostra un notevole aumento dell'accuratezza, un'efficienza nell'uso dei token superiore di oltre 4 volte e una riduzione della latenza di un ordine di grandezza.

Percorso sperimentale 2: ottimizzazione generica dal linguaggio naturale

Il prossimo passo è creare un'interfaccia generalizzabile e riutilizzabile che converta il linguaggio naturale in rappresentazioni semantiche strutturate, traducibili dal backend in codice pronto per il risolutore. Per questo esperimento ci siamo concentrati sui problemi di ottimizzazione lineare e abbiamo valutato l'approccio rispetto a tre set di dati pubblici (NLP4LP, NL4OPT e IndustryOR).

Gli approcci valutati

  1. LLM autonomo

  2. Metodo ibrido (LLM → regole strutturate → risolutore → output verificato)

Diagramma del flusso di lavoro ibrido: dalle richieste in linguaggio naturale ai vincoli strutturati, alla risoluzione deterministica e all'output verificato.

  • Usare un LLM per estrarre dall'input variabili, vincoli e obiettivi e formulare un problema di ottimizzazione strutturato.

  • Passare il problema strutturato e la richiesta originale a un LLM per l'autoverifica.

  • Tradurre il problema strutturato in codice OR-Tools per calcolare l'assegnazione ottimale.

Risultati

Abbiamo valutato questo approccio usando modelli proprietari di frontiera, tra cui GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max e GPT-5.2, insieme a modelli open source come Kimi K2, i modelli GPT-OSS e MiniMax M2. I diagrammi a scatola riassumono i risultati di ciascun metodo.

Grafico che confronta modelli linguistici di grandi dimensioni autonomi e approcci ibridi basati su risolutori in diversi benchmark di ottimizzazione.

Per quasi tutti i modelli linguistici sottostanti valutati, l'approccio ibrido produce sistematicamente risultati più accurati, stabili e verificabili rispetto a un LLM autonomo usato come riferimento. Sebbene le prestazioni assolute varino tra i modelli, i miglioramenti relativi offerti dall'approccio ibrido restano costanti. Ciò suggerisce che i miglioramenti derivino dalla separazione tra comprensione del linguaggio naturale e ottimizzazione formale, anziché dalla capacità di ragionamento di un singolo modello.

Accuratezza

Su NLP4LP e NL4OPT, costituiti principalmente da problemi di programmazione lineare, il metodo ibrido raggiunge un'accuratezza prossima al limite massimo e supera i prompt con LLM autonomi. Invece di produrre un ragionamento «approssimativamente corretto», il sistema ibrido genera con maggiore costanza formulazioni matematiche valide e ben strutturate. Sul set di dati IndustryOR, più impegnativo, l'accuratezza diminuisce con entrambi i metodi, ma per ragioni diverse. Molti problemi di IndustryOR implicano strutture combinatorie, come l'instradamento dei veicoli, il sequenziamento delle attività e l'assegnazione del personale, che superano le capacità di ottimizzazione lineare attualmente supportate dal backend del nostro risolutore.

L'analisi delle modalità di errore mostra che gli LLM autonomi violano spesso i vincoli obbligatori, come illustrato di seguito:

Esempio 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

L'LLM autonomo produce una soluzione con una quantità totale di grassi inferiore, ma viola il requisito secondo cui le cene a base di tacchino non devono superare il 40% dei pasti. L'approccio ibrido applica correttamente questo vincolo rigido e restituisce una risposta valida.

Esempio 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

L'LLM autonomo produce nuovamente una soluzione con meno dimissioni, ma supera il limite massimo consentito per gli antidolorifici. L'approccio ibrido applica correttamente tale vincolo rigido e restituisce una risposta valida.

Latenza e uso dei token

I dati sulla latenza e sull'uso dei token evidenziano una distinzione importante. L'approccio ibrido presenta una latenza media e un uso dei token superiori rispetto a un singolo prompt LLM, ma ciò riflette scelte architetturali, non inefficienze.

La pipeline ibrida include:

  1. Una o più chiamate all'LLM per estrarre variabili, vincoli e obiettivi strutturati.

  2. Una fase di autoverifica per rilevare le incoerenze interne.

Sebbene queste fasi comportino un carico aggiuntivo rispetto a un singolo prompt, la latenza resta limitata e prevedibile e, una volta formulato correttamente il problema, l'esecuzione del risolutore è in genere rapida. Il lavoro aggiuntivo genera rappresentazioni intermedie esplicite, riutilizzabili e verificabili. Al contrario, gli approcci basati su LLM autonomi comprimono il ragionamento in un'unica generazione opaca, trasferendo i costi sui nuovi tentativi, sui controlli manuali e sugli errori a valle. Le iterazioni future potranno ridurre questo carico tramite:

  • Memorizzazione nella cache degli schemi estratti.

  • Aggiornamento incrementale dei vincoli.

  • Miglioramento dell'orchestrazione di prompt e chiamate.

Trasparenza e verificabilità

Infine, anche quando entrambi i metodi falliscono, la modalità di errore è fondamentalmente diversa.

  • Con un LLM autonomo, gli errori sono spesso silenziosi: il modello può restituire un risultato leggermente errato.

  • Con l'approccio ibrido, la formulazione esplicita del problema rende gli errori trasparenti e aiuta i team a individuare quale parte della formulazione li ha causati.

Le versioni future potrebbero mostrare queste formulazioni in un'interfaccia, consentendo agli utenti di esaminarle o verificarle prima dell'esecuzione del risolutore. Questa trasparenza migliora l'accuratezza misurata e facilita il debug e il perfezionamento del sistema, aspetti essenziali per l'impiego nel mondo reale.

Conclusione principale

In tutti i benchmark e nella maggior parte dei modelli sottostanti testati, i risultati confermano una conclusione centrale del nostro lavoro:

Gli LLM sono potenti nel comprendere e tradurre gli intenti, ma i risolutori deterministici sono essenziali per garantire la correttezza.

L'approccio ibrido trasforma il linguaggio naturale da fonte di ambiguità a interfaccia affidabile per decisioni matematicamente solide, avvicinando l'IA aziendale a sistemi non solo intelligenti, ma anche degni di fiducia.

Prossimi passi: un motore formale di IA riutilizzabile per le aziende

I vincoli aziendali raramente esistono sotto forma di schemi ordinati o prompt formulati alla perfezione. Sono distribuiti tra database, fogli di calcolo, norme interne e contratti. Le richieste degli utenti possono essere incomplete, ambigue o incompatibili con le regole aziendali. Per applicare questo approccio su larga scala, stiamo sviluppando un motore di backend riutilizzabile che trasformi tale complessità in una funzionalità aziendale affidabile.

Diagramma del motore formale di IA aziendale, con regole di business, traduzione per il risolutore e processo decisionale verificabile.

La piattaforma

Nella sua essenza, questo motore funge da struttura formale portante per i sistemi decisionali basati sull'IA e offre:

  • Una base di conoscenza simbolica con adattatori che importano regole aziendali, vincoli, variabili e obiettivi.

  • Un livello di traduzione che compila gli schemi in codice per il risolutore.

  • Interfacce che consentono ai team di esaminare, verificare e modificare i vincoli.

Dove genera valore

Sebbene questi esperimenti siano attualmente incentrati sull'ottimizzazione, lo stesso metodo può essere esteso alla verifica logica. Le possibili applicazioni aziendali includono:

  • Eseguire ad hoc pianificazione dinamica, instradamento e allocazione delle risorse, applicando ogni vincolo operativo.

  • Generare risposte e raccomandazioni che rispettino sistematicamente le regole aziendali.

  • Progettare e convalidare oggetti 3D, video e architetture complessi, individuando i progetti irrealizzabili prima della produzione.

Considerazioni finali

L'IA di oggi è potente, ma alle aziende serve più della potenza: servono correttezza, coerenza e controllo. Il nostro sistema ibrido basato su LLM e risolutori è un passo verso un mondo in cui:

  • Gli agenti non inventano regole o vincoli.

  • La deduzione logica e l'ottimizzazione sono matematicamente solide.

  • Il linguaggio naturale funge da interfaccia universale per i sistemi deterministici.

Autore

Peng Seng Ang