Navegación principal

Combinar LLM y solucionadores formales para tomar decisiones de IA confiables

Una arquitectura híbrida combina la flexibilidad de los LLM con solucionadores deterministas para generar decisiones empresariales confiables y verificables.

Los modelos de lenguaje de gran tamaño (LLM) han logrado avances extraordinarios en la comprensión del lenguaje natural, la generación de respuestas fluidas y la creación de experiencias totalmente nuevas para clientes y empleados. Sin embargo, como los LLM son inherentemente estocásticos, su uso para razonamientos numéricos o lógicos complejos ofrece pocas garantías de que sus resultados cumplan las normas o sean óptimos. Por ejemplo:

  • Un gerente le dice a un asistente de planificación con IA: “Envía todo lo posible la próxima semana y mantén bajos los costos”, y el sistema entrega un plan agresivo que parece eficiente, pero excede silenciosamente la capacidad del almacén e incumple las garantías de entrega.

  • Un coordinador le dice a un asistente de IA: “Reasigna los equipos para reducir las pernoctaciones y minimizar las interrupciones”, y el modelo genera un cronograma de menor costo que parece óptimo, pero infringe las restricciones obligatorias sobre las horas de servicio o descanso.

  • Un asistente de IA para operaciones financieras debe aprobar transacciones bajo estrictas restricciones regionales y de riesgo, pero autoriza una transacción sospechosa al inventar una justificación que parece cumplir las normas, aunque infringe la política interna.

En entornos con requisitos operativos estrictos, combinar LLM con solucionadores formales ayuda a garantizar que las decisiones basadas en lenguaje natural respeten los límites definidos y eviten resultados inviables, subóptimos o que incumplan las normas.

Nuestro equipo de I&D investiga un enfoque híbrido que combina la creatividad y flexibilidad de los LLM con el rigor, las garantías y la transparencia de solucionadores matemáticos formales como Z3, Pyomo y OR-Tools. También estamos desarrollando un motor reutilizable de IA formal para convertir esta capacidad en un componente estándar de la infraestructura tecnológica empresarial. La plataforma permitirá a las organizaciones incorporar reglas de negocio directamente desde sus sistemas actuales, verificar continuamente las decisiones frente a esas reglas e implementar agentes de IA de forma segura dentro de límites claramente definidos.

Nuestra visión es reducir el riesgo operativo y, al mismo tiempo, acelerar la toma de decisiones a gran escala. Los líderes obtienen decisiones más rápidas y acordes con las políticas a partir de entradas en lenguaje natural, mientras las organizaciones pueden automatizar cambios ad hoc en programación, asignación de recursos de la cadena de suministro, operaciones financieras, verificación de políticas e incluso diseño de video o 3D. Las medidas de protección integradas evitan que resultados inviables, contrarios a las normas o inseguros lleguen a producción.

En experimentos controlados con problemas de optimización similares a los de logística y tres conjuntos de referencia públicos, nuestro enfoque híbrido demostró sistemáticamente:

  • Mayor precisión

  • Mayor interpretabilidad y capacidad de auditoría

La arquitectura híbrida

Nuestro enfoque invierte el paradigma habitual de “el LLM lo hace todo” y adopta este diseño:

Diagrama que compara cómo los modelos de lenguaje de gran tamaño y los solucionadores deterministas combinan la comprensión del lenguaje natural con una optimización verificable.

Este enfoque separa claramente las responsabilidades: los LLM extraen reglas y restricciones del lenguaje natural, mientras que solucionadores deterministas como OR-Tools, Z3 y Pyomo se encargan de la optimización y la verificación. El resultado combina las fortalezas de ambos enfoques:

LLM

Solucionadores

Híbrido (LLM + solucionador)

Comprender la intención humana en distintos ámbitos

✅ Excelente

❌ Ninguna

✅ Excelente

Comportamiento determinista

❌ No

✅ Garantizado

✅ Sí

Corrección demostrable en razonamiento matemático y optimización con múltiples restricciones

⚠️ Frágil

✅ Garantizada

✅ Sí

Capacidad de auditoría e interpretabilidad

⚠️ Frágil

✅ Clara

✅ Clara

Resistencia al ruido y a la inyección de prompts

❌ Vulnerable

✅ Inmune

✅ Alta

Línea experimental 1: logística y asignación de personal

El ámbito del problema

Comenzamos con un desafío que enfrentan algunos de nuestros clientes:

Convertir solicitudes en lenguaje natural en decisiones óptimas y en tiempo real sobre los recursos, con un cumplimiento estricto de las restricciones operativas, normativas y de costos.

Este desafío es fundamental para la logística y las cadenas de suministro modernas, incluida la programación de personal, la asignación de activos, la planificación de rutas y entregas, y la gestión de capacidad. También es un ámbito donde los LLM y los solucionadores formales deben trabajar juntos para crear sistemas confiables. Para nuestra evaluación, creamos escenarios de prueba controlados, fuentes de datos y restricciones, junto con 240 consultas sintéticas. Algunos ejemplos:

  • Revisa el cronograma actual tras una cancelación. La instalación de destino debe estar completamente abastecida para el 24 de diciembre de 2025. Cuando sea posible, obtén el inventario de un almacén cercano y envíalo a través de un punto de consolidación específico. La fecha de inicio más temprana permitida es el 14 de diciembre de 2025.

  • Solicitud de último minuto: una persona VIP llegará a la ubicación A en tres horas. Necesitamos que el personal requerido esté en el lugar dentro de dos horas. Ajusta las asignaciones de personal y minimiza los cambios al cronograma actual.

Las consultas muestran que el sistema debe extraer y aplicar de forma confiable restricciones estrictas y flexibles directamente de las solicitudes en lenguaje natural:

  • Las restricciones estrictas no son negociables (por ejemplo, las fechas de inicio más tempranas, las condiciones contractuales y los límites de capacidad). Infringir cualquiera de ellas invalida la solución.

  • Las restricciones flexibles representan preferencias, como minimizar retrasos, reducir costos y limitar cambios. El objetivo es optimizar sin sobrepasar los límites estrictos.

Algunos aspectos de estos problemas de optimización no pueden predefinirse por completo. Deben configurarse dinámicamente a partir no solo de restricciones y objetivos predefinidos en la lógica empresarial estructurada, los documentos internos y los datos operativos, sino también de la solicitud del usuario.

Los enfoques que evaluamos

Para entender el desempeño de distintas técnicas en este contexto, implementamos y comparamos tres enfoques.

  1. LLM puro: el enfoque más sencillo proporciona todos los datos relevantes y la solicitud del usuario en lenguaje natural a un único prompt para un LLM, al que se le pide generar un plan o una asignación óptimos. Aunque esto puede funcionar con problemas pequeños o con pocas restricciones, deja de ser eficaz a medida que aumenta la complejidad. El modelo puede ignorar restricciones, priorizar el objetivo equivocado o generar planes que parecen razonables, pero son inviables, sin una forma confiable de detectar o prevenir las fallas.

  2. LLM + intérprete de código: en este enfoque, el LLM interpreta la solicitud y usa herramientas para acceder a fuentes de datos y generar código de optimización ejecutable. Esto aporta flexibilidad y observabilidad, pero la confiabilidad sigue siendo un problema. El LLM aún debe traducir las restricciones en código correcto, y pequeños errores de razonamiento o programación pueden producir resultados inválidos o subóptimos, sobre todo al aumentar la cantidad de restricciones.

  3. Híbrido: LLM → restricciones estructuradas → solucionador determinista: el tercer enfoque separa las responsabilidades. El LLM nunca “decide” el resultado; ayuda a formalizar las variables, restricciones y objetivos. Un solucionador de optimización probado aplica las restricciones, garantiza la viabilidad y genera resultados que pueden verificarse y auditarse. La función del LLM se limita a traducir solicitudes en lenguaje natural en restricciones explícitas y estructuradas mediante esquemas predefinidos. Esas restricciones se compilan automáticamente en código para solucionadores, como OR-Tools, que calcula de forma determinista una solución viable y óptima.

Resultados

Probamos los métodos con varios LLM, incluidos GPT-5, GPT-5.1 y GPT-5.2. Como esperábamos, el enfoque híbrido superó a las alternativas:

Método

Precisión de la asignación

Latencia promedio

Tokens usados por consulta

LLM puro

70–78 %

62–190 s

~175 000

LLM + intérprete de código

82–84 %

62–140 s

~9 000

LLM → solucionador (híbrido)

95–97 %

6–25 s

~2 000

Nuestro método híbrido demuestra un aumento considerable de la precisión, una eficiencia de tokens más de 4 veces mayor y una reducción de la latencia de un orden de magnitud.

Línea experimental 2: optimización de uso general a partir del lenguaje natural

Nuestro próximo paso es crear una interfaz generalizable y reutilizable que convierta el lenguaje natural en representaciones semánticas estructuradas, que nuestro backend pueda traducir en código listo para el solucionador. Para este experimento, nos centramos en problemas de optimización lineal y evaluamos el enfoque con tres conjuntos de datos públicos (NLP4LP, NL4OPT e IndustryOR).

Los enfoques que evaluamos

  1. LLM independiente

  2. Método híbrido (LLM → reglas estructuradas → solucionador → resultado verificado)

Diagrama del flujo de trabajo híbrido: desde solicitudes en lenguaje natural hasta restricciones estructuradas, resolución determinista y resultados verificados.

  • Usar un LLM para extraer variables, restricciones y objetivos de la entrada, y formular un problema de optimización estructurado.

  • Enviar el problema estructurado y la solicitud original a un LLM para su autoverificación.

  • Traducir el problema estructurado en código de OR-Tools para calcular la asignación óptima.

Resultados

Evaluamos este enfoque con modelos propios de vanguardia, incluidos GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max y GPT-5.2, además de modelos de código abierto como Kimi K2, modelos GPT-OSS y MiniMax M2. Los diagramas de caja resumen los resultados de cada método.

Gráfico que compara modelos de lenguaje de gran tamaño independientes y enfoques híbridos basados en solucionadores en conjuntos de referencia de optimización.

El enfoque híbrido produce sistemáticamente resultados más precisos, estables y verificables que una referencia basada en un LLM independiente en casi todos los modelos de lenguaje subyacentes evaluados. Aunque el desempeño absoluto varía entre modelos, las mejoras relativas del enfoque híbrido se mantienen constantes. Esto indica que las mejoras se deben a separar la comprensión del lenguaje natural de la optimización formal, en lugar de depender de la capacidad de razonamiento de un único modelo.

Precisión

En NLP4LP y NL4OPT, compuestos principalmente por problemas de programación lineal, el método híbrido alcanza una precisión cercana al máximo y supera el uso de prompts con LLM independientes. En lugar de generar un razonamiento “aproximadamente correcto”, el sistema híbrido produce con mayor consistencia formulaciones matemáticas válidas y bien estructuradas. En el conjunto de datos IndustryOR, que presenta mayores desafíos, la precisión disminuye con ambos métodos, pero por razones distintas. Muchos problemas de IndustryOR incluyen estructuras combinatorias, como planificación de rutas de vehículos, secuenciación de tareas y asignación de personal, que superan las capacidades de optimización lineal que actualmente admite el backend de nuestro solucionador.

El análisis de los tipos de falla muestra que los LLM independientes infringen con frecuencia las restricciones obligatorias, como se ilustra a continuación:

Ejemplo 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

El LLM independiente genera una solución con menos grasa total, pero infringe el requisito de que las cenas con pavo no representen más del 40 % de las comidas. El enfoque híbrido aplica correctamente esta restricción estricta y devuelve una respuesta válida.

Ejemplo 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

El LLM independiente vuelve a generar una solución con menor cantidad de altas, pero supera el límite máximo permitido de analgésicos. El enfoque híbrido aplica correctamente esa restricción estricta y devuelve una respuesta válida.

Latencia y uso de tokens

Los datos de latencia y uso de tokens revelan una distinción importante. El enfoque híbrido tiene una latencia promedio y un uso de tokens mayores que un único prompt para un LLM, pero esto se debe a decisiones arquitectónicas, no a ineficiencias.

El flujo híbrido incluye:

  1. Una o más llamadas al LLM para extraer variables estructuradas, restricciones y objetivos.

  2. Un paso de autoverificación para detectar inconsistencias internas.

Aunque estos pasos agregan sobrecarga frente a un único prompt, la latencia sigue siendo limitada y predecible, y la ejecución del solucionador suele ser rápida una vez que el problema está bien formulado. El trabajo adicional crea representaciones intermedias explícitas, reutilizables y auditables. En cambio, los enfoques con LLM independientes condensan el razonamiento en una sola generación opaca y trasladan los costos a los reintentos, las revisiones manuales y las fallas posteriores. Las próximas iteraciones pueden reducir esta sobrecarga mediante:

  • El almacenamiento en caché de los esquemas extraídos.

  • La actualización incremental de las restricciones.

  • La mejora de la coordinación de prompts y llamadas.

Transparencia y capacidad de auditoría

Por último, incluso cuando ambos métodos fallan, el tipo de falla es fundamentalmente distinto.

  • Con un LLM independiente, las fallas suelen ser silenciosas: el modelo puede devolver un resultado con errores sutiles.

  • Con el enfoque híbrido, la formulación explícita del problema hace visibles las fallas y ayuda a los equipos a identificar qué parte de la formulación causó el error.

Las versiones futuras podrían mostrar estas formulaciones en una interfaz para que los usuarios puedan auditarlas o verificarlas antes de ejecutar el solucionador. Esta transparencia mejora la precisión medida y facilita depurar y perfeccionar el sistema, algo esencial para implementarlo en el mundo real.

Conclusión principal

En todos los conjuntos de referencia y en la mayoría de los modelos subyacentes evaluados, los resultados refuerzan una conclusión central de nuestro trabajo:

Los LLM son potentes para comprender y traducir la intención, pero los solucionadores deterministas son esenciales para garantizar la corrección.

El enfoque híbrido transforma el lenguaje natural: deja de ser una fuente de ambigüedad y se convierte en una interfaz confiable para tomar decisiones matemáticamente sólidas. Así, la IA empresarial se acerca a sistemas que no solo son inteligentes, sino también confiables.

Próximo paso: un motor reutilizable de IA formal para empresas

Las restricciones empresariales rara vez se presentan en esquemas ordenados o prompts perfectamente redactados. Están dispersas en bases de datos, hojas de cálculo, políticas internas y contratos. Las solicitudes de los usuarios pueden estar incompletas, ser ambiguas o contradecir las reglas de negocio. Para aplicar este enfoque a gran escala, estamos desarrollando un motor de backend reutilizable que convierte esta complejidad en una capacidad empresarial confiable.

Diagrama del motor empresarial de IA formal, que incluye reglas de negocio, traducción para el solucionador y toma de decisiones auditable.

La plataforma

En esencia, este motor funciona como una estructura formal para los sistemas de decisión basados en IA y proporciona:

  • Una base de conocimiento simbólica con adaptadores que incorporan reglas de negocio, restricciones, variables y objetivos.

  • Una capa de traducción que compila esquemas en código para solucionadores.

  • Interfaces que permiten a los equipos revisar, auditar y modificar restricciones.

Dónde genera valor

Aunque estos experimentos se centran actualmente en la optimización, el mismo método puede extenderse a la verificación lógica. Entre las posibles aplicaciones empresariales se incluyen:

  • Realizar programación dinámica ad hoc, planificación de rutas y asignación de recursos sin dejar de aplicar ninguna restricción operativa.

  • Generar respuestas y recomendaciones que respeten sistemáticamente las reglas de negocio.

  • Diseñar y validar objetos 3D, videos y arquitecturas complejos, y detectar diseños inviables antes de la producción.

Reflexiones finales

La IA actual es potente, pero las empresas necesitan más que potencia: necesitan corrección, consistencia y control. Nuestro sistema híbrido de LLM y solucionadores es un paso hacia un mundo donde:

  • Los agentes no inventan reglas ni restricciones.

  • La deducción lógica y la optimización son matemáticamente sólidas.

  • El lenguaje natural sirve como interfaz universal para los sistemas deterministas.

Autor

Peng Seng Ang