Navegación principal

Combinar LLM y solucionadores formales para tomar decisiones de IA fiables

Una arquitectura híbrida combina la flexibilidad de los LLM con solucionadores deterministas para generar decisiones empresariales fiables y verificables.

Los modelos de lenguaje de gran tamaño (LLM) han avanzado extraordinariamente en la comprensión del lenguaje natural, la generación de respuestas fluidas y la creación de experiencias totalmente nuevas para clientes y empleados. Sin embargo, dado que los LLM son inherentemente estocásticos, su uso para razonamientos numéricos o lógicos complejos ofrece pocas garantías de que los resultados sean conformes u óptimos. Por ejemplo:

  • Un responsable indica a un asistente de planificación con IA: «Envía todo lo posible la próxima semana manteniendo los costes bajos». El sistema entrega un plan agresivo que parece eficiente, pero supera discretamente la capacidad del almacén e incumple las garantías de entrega.

  • Un coordinador indica a un asistente de IA: «Reasigna los equipos para reducir las pernoctaciones y minimizar las interrupciones». El modelo genera un calendario de menor coste que parece óptimo, pero incumple las restricciones obligatorias sobre el tiempo de servicio o descanso.

  • Un asistente de IA para operaciones financieras debe aprobar transacciones sujetas a estrictas restricciones regionales y de riesgo, pero autoriza una transacción sospechosa inventando una justificación que parece conforme aunque infringe la política interna.

En entornos con requisitos operativos estrictos, combinar LLM con solucionadores formales ayuda a garantizar que las decisiones basadas en lenguaje natural respeten los límites definidos y eviten resultados inviables, subóptimos o no conformes.

Nuestro equipo de I+D investiga un enfoque híbrido que combina la creatividad y flexibilidad de los LLM con el rigor, las garantías y la transparencia de solucionadores matemáticos formales como Z3, Pyomo y OR-Tools. También estamos creando un motor reutilizable de IA formal para convertir esta capacidad en un componente estándar de la infraestructura tecnológica empresarial. La plataforma permitirá a las organizaciones incorporar reglas de negocio directamente desde sus sistemas actuales, verificar continuamente las decisiones según esas reglas e implantar agentes de IA de forma segura dentro de límites claramente definidos.

Nuestra visión es reducir el riesgo operativo y acelerar la toma de decisiones a gran escala. Los responsables toman decisiones más rápidas y conformes con las políticas a partir de entradas en lenguaje natural, mientras las organizaciones pueden automatizar cambios puntuales en la planificación, la asignación de recursos de la cadena de suministro, las operaciones financieras, la verificación de políticas e incluso el diseño de vídeo o 3D. Las salvaguardas integradas impiden que resultados inviables, no conformes o inseguros lleguen a producción.

En experimentos controlados con problemas de optimización logística y tres conjuntos de referencia públicos, nuestro enfoque híbrido demostró sistemáticamente:

  • Mayor precisión

  • Mayor interpretabilidad y auditabilidad

La arquitectura híbrida

Nuestro enfoque invierte el paradigma habitual de que «el LLM lo hace todo» y adopta este diseño:

Diagrama que compara cómo los modelos de lenguaje de gran tamaño y los solucionadores deterministas combinan la comprensión del lenguaje natural con una optimización verificable.

Este enfoque separa claramente las responsabilidades: los LLM extraen reglas y restricciones del lenguaje natural, mientras que solucionadores deterministas como OR-Tools, Z3 y Pyomo se encargan de la optimización y la verificación. El resultado combina las ventajas de ambos enfoques:

LLM

Solucionadores

Híbrido (LLM + solucionador)

Comprender la intención humana en distintos ámbitos

✅ Excelente

❌ Ninguna

✅ Excelente

Comportamiento determinista

❌ No

✅ Garantizado

✅ Sí

Corrección demostrable en razonamiento matemático y optimización con múltiples restricciones

⚠️ Frágil

✅ Garantizada

✅ Sí

Auditabilidad e interpretabilidad

⚠️ Frágil

✅ Clara

✅ Clara

Resistencia al ruido y a la inyección de prompts

❌ Vulnerable

✅ Inmune

✅ Alta

Línea experimental 1: logística y asignación de personal

El ámbito del problema

Partimos de un reto al que se enfrentan algunos de nuestros clientes:

Convertir solicitudes en lenguaje natural en decisiones óptimas sobre recursos y en tiempo real, aplicando estrictamente las restricciones operativas, normativas y de costes.

Este reto es fundamental para la logística y las cadenas de suministro modernas, incluida la planificación de personal, la asignación de activos, el enrutamiento, la planificación de pedidos y la gestión de la capacidad. También es un ámbito en el que los LLM y los solucionadores formales deben colaborar para crear sistemas fiables. Para la evaluación, creamos escenarios de prueba, fuentes de datos y restricciones controlados, junto con 240 consultas sintéticas. Algunos ejemplos:

  • Revise el calendario actual tras una cancelación. El centro de destino debe estar plenamente abastecido antes del 24 de diciembre de 2025. Cuando sea posible, obtenga las existencias de un almacén cercano y hágalas pasar por un punto de consolidación específico. La fecha de inicio más temprana permitida es el 14 de diciembre de 2025.

  • Solicitud de última hora: una persona VIP llegará a la ubicación A dentro de tres horas. Necesitamos que el personal requerido esté allí en dos horas. Ajuste las asignaciones de personal minimizando los cambios en el calendario actual.

Las consultas muestran que el sistema debe extraer y aplicar de forma fiable restricciones duras y blandas directamente desde solicitudes en lenguaje natural:

  • Las restricciones duras no son negociables (p. ej., fechas de inicio más tempranas, condiciones contractuales y límites de capacidad). Incumplir cualquiera de ellas invalida la solución.

  • Las restricciones blandas representan preferencias, como minimizar los retrasos, reducir los costes y limitar los cambios. El objetivo es optimizar sin traspasar los límites estrictos.

Algunos aspectos de estos problemas de optimización no pueden predefinirse por completo. Deben construirse dinámicamente a partir de las restricciones y los objetivos predefinidos en la lógica de negocio estructurada, los documentos internos y los datos operativos, además de la solicitud del usuario.

Enfoques evaluados

Para comprender el rendimiento de distintas técnicas en este contexto, implementamos y comparamos tres enfoques.

  1. LLM puro: el enfoque más sencillo envía todos los datos pertinentes y la solicitud del usuario en lenguaje natural a un único prompt para un LLM, al que se pide que genere un plan o una asignación óptimos. Aunque puede funcionar con problemas pequeños o con pocas restricciones, deja de hacerlo a medida que aumenta la complejidad. El modelo puede ignorar restricciones, priorizar un objetivo equivocado o generar planes que parecen razonables pero son inviables, sin ninguna forma fiable de detectar o evitar los fallos.

  2. LLM + Intérprete de código: en este enfoque, el LLM interpreta la solicitud y utiliza herramientas para acceder a fuentes de datos y generar código de optimización ejecutable. Esto aporta flexibilidad y observabilidad, pero la fiabilidad sigue siendo un problema. El LLM aún debe traducir las restricciones a código correcto, y pequeños errores de razonamiento o programación pueden generar resultados no válidos o subóptimos, especialmente al aumentar el número de restricciones.

  3. Híbrido: LLM → restricciones estructuradas → solucionador determinista: el tercer enfoque separa las responsabilidades. El LLM nunca «decide» el resultado; ayuda a formalizar las variables, restricciones y objetivos. Un solucionador de optimización probado aplica las restricciones, garantiza la viabilidad y genera resultados que pueden verificarse y auditarse. La función del LLM se limita a traducir las solicitudes en lenguaje natural a restricciones explícitas y estructuradas mediante esquemas predefinidos. Estas restricciones se compilan automáticamente en código para un solucionador, como OR-Tools, que calcula de forma determinista una solución viable y óptima.

Resultados

Probamos los métodos con varios LLM, incluidos GPT-5, GPT-5.1 y GPT-5.2. Como esperábamos, el enfoque híbrido superó a las alternativas:

Método

Precisión de la asignación

Latencia media

Tokens utilizados por consulta

LLM puro

70–78 %

62–190 s

~175 000

LLM + Intérprete de código

82–84 %

62–140 s

~9 000

LLM → solucionador (híbrido)

95–97 %

6–25 s

~2 000

Nuestro método híbrido demuestra un aumento considerable de la precisión, una eficiencia de tokens más de cuatro veces mayor y una reducción de la latencia de un orden de magnitud.

Línea experimental 2: optimización de uso general a partir del lenguaje natural

Nuestro siguiente paso es crear una interfaz generalizable y reutilizable que convierta el lenguaje natural en representaciones semánticas estructuradas, que nuestro backend pueda traducir a código listo para el solucionador. Para este experimento, nos centramos en problemas de optimización lineal y evaluamos el enfoque con tres conjuntos de datos públicos (NLP4LP, NL4OPT e IndustryOR).

Enfoques evaluados

  1. LLM independiente

  2. Método híbrido (LLM → reglas estructuradas → solucionador → resultado verificado)

Diagrama del flujo híbrido, desde las solicitudes en lenguaje natural hasta las restricciones estructuradas, la resolución determinista y el resultado verificado.

  • Utilizar un LLM para extraer variables, restricciones y objetivos de la entrada y formular un problema de optimización estructurado.

  • Enviar el problema estructurado y la solicitud original a un LLM para su autoverificación.

  • Traducir el problema estructurado a código de OR-Tools para calcular la asignación óptima.

Resultados

Evaluamos este enfoque con modelos propios de vanguardia, incluidos GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max y GPT-5.2, además de modelos de código abierto como Kimi K2, los modelos GPT-OSS y MiniMax M2. Los diagramas de caja resumen los resultados de cada método.

Gráfico que compara modelos de lenguaje de gran tamaño independientes y enfoques híbridos basados en solucionadores en distintos conjuntos de referencia de optimización.

El enfoque híbrido genera sistemáticamente resultados más precisos, estables y verificables que un LLM independiente de referencia en casi todos los modelos de lenguaje subyacentes evaluados. Aunque el rendimiento absoluto varía entre modelos, las mejoras relativas del enfoque híbrido se mantienen constantes. Esto indica que las mejoras proceden de separar la comprensión del lenguaje natural de la optimización formal, en lugar de depender de la capacidad de razonamiento de un único modelo.

Precisión

En NLP4LP y NL4OPT, compuestos principalmente por problemas de programación lineal, el método híbrido alcanza una precisión cercana al máximo y supera el uso de prompts con LLM independientes. En lugar de producir razonamientos «aproximadamente correctos», el sistema híbrido genera de forma más sistemática formulaciones matemáticas válidas y bien construidas. En el conjunto de datos IndustryOR, más exigente, la precisión disminuye con ambos métodos, pero por motivos distintos. Muchos problemas de IndustryOR incluyen estructuras combinatorias, como el enrutamiento de vehículos, la secuenciación de tareas y la asignación de personal, que superan las capacidades de optimización lineal que admite actualmente nuestro backend de solucionadores.

El análisis de los tipos de fallo muestra que los LLM independientes incumplen con frecuencia las restricciones obligatorias, como se ilustra a continuación:

Ejemplo 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

El LLM independiente genera una solución con menos grasa total, pero incumple el requisito de que los menús de pavo no representen más del 40 % de las comidas. El enfoque híbrido aplica correctamente esta restricción dura y devuelve una respuesta válida.

Ejemplo 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

El LLM independiente vuelve a generar una solución con menos altas hospitalarias, pero supera el límite máximo permitido de analgésicos. El enfoque híbrido aplica correctamente esa restricción dura y devuelve una respuesta válida.

Latencia y uso de tokens

Los datos de latencia y uso de tokens revelan una distinción importante. El enfoque híbrido presenta una latencia media y un uso de tokens mayores que un único prompt para un LLM, pero esto responde a decisiones arquitectónicas, no a una falta de eficiencia.

El proceso híbrido incluye:

  1. Una o varias llamadas a un LLM para extraer variables, restricciones y objetivos estructurados.

  2. Un paso de autoverificación para detectar incoherencias internas.

Aunque estos pasos añaden sobrecarga frente a un único prompt, la latencia se mantiene acotada y predecible, y la ejecución del solucionador suele ser rápida cuando el problema está bien formulado. El trabajo adicional crea representaciones intermedias explícitas, reutilizables y auditables. En cambio, los enfoques basados únicamente en LLM condensan el razonamiento en una generación opaca y trasladan los costes a los reintentos, las comprobaciones manuales y los fallos posteriores. Las futuras iteraciones pueden reducir esta sobrecarga mediante:

  • Almacenar en caché los esquemas extraídos.

  • Actualizar las restricciones de forma incremental.

  • Mejorar la orquestación de prompts y llamadas.

Transparencia y auditabilidad

Por último, incluso cuando ambos métodos fallan, el tipo de fallo es radicalmente distinto.

  • Con un LLM independiente, los fallos suelen pasar inadvertidos: el modelo puede devolver un resultado sutilmente incorrecto.

  • Con el enfoque híbrido, la formulación explícita del problema hace visibles los fallos y ayuda a los equipos a identificar qué parte de la formulación causó el error.

Las versiones futuras podrían mostrar estas formulaciones en una interfaz para que los usuarios las auditen o verifiquen antes de ejecutar el solucionador. Esta transparencia mejora la precisión medida y facilita la depuración y el perfeccionamiento del sistema, algo esencial para implantarlo en entornos reales.

Conclusión principal

En todos los conjuntos de referencia y en la mayoría de los modelos subyacentes probados, los resultados refuerzan una conclusión central de nuestro trabajo:

Los LLM son potentes para comprender y traducir intenciones, pero los solucionadores deterministas son esenciales para garantizar la corrección.

El enfoque híbrido transforma el lenguaje natural, que deja de ser una fuente de ambigüedad para convertirse en una interfaz fiable para tomar decisiones con rigor matemático, y acerca la IA empresarial a sistemas no solo inteligentes, sino también dignos de confianza.

Próximo paso: un motor reutilizable de IA formal para la empresa

Las restricciones empresariales rara vez se encuentran en esquemas ordenados o prompts perfectamente redactados. Están dispersas entre bases de datos, hojas de cálculo, políticas internas y contratos. Las solicitudes de los usuarios pueden estar incompletas, ser ambiguas o contradecir las reglas de negocio. Para aplicar este enfoque a gran escala, estamos creando un motor de backend reutilizable que transforma esta complejidad en una capacidad empresarial fiable.

Diagrama del motor empresarial de IA formal, con reglas de negocio, traducción para el solucionador y toma de decisiones auditable.

La plataforma

En esencia, este motor actúa como estructura formal de los sistemas de decisión basados en IA y ofrece:

  • Una base de conocimiento simbólica con adaptadores que incorporan reglas de negocio, restricciones, variables y objetivos.

  • Una capa de traducción que compila esquemas en código para el solucionador.

  • Interfaces que permiten a los equipos inspeccionar, auditar y modificar restricciones.

Ámbitos en los que aporta valor

Aunque estos experimentos se centran actualmente en la optimización, el mismo método puede ampliarse a la verificación lógica. Entre sus posibles aplicaciones empresariales se incluyen:

  • Realizar de forma puntual una planificación, un enrutamiento y una asignación de recursos dinámicos, respetando todas las restricciones operativas.

  • Generar respuestas y recomendaciones que respeten sistemáticamente las reglas de negocio.

  • Diseñar y validar objetos 3D, vídeos y arquitecturas complejos, detectando los diseños inviables antes de la producción.

Reflexiones finales

La IA actual es potente, pero las empresas necesitan algo más que potencia: necesitan corrección, coherencia y control. Nuestro sistema híbrido de LLM y solucionadores es un paso hacia un mundo en el que:

  • Los agentes no inventan reglas ni restricciones.

  • La deducción lógica y la optimización son matemáticamente rigurosas.

  • El lenguaje natural sirve de interfaz universal para los sistemas deterministas.

Autor

Peng Seng Ang