Los modelos de lenguaje de gran tamaño (LLM) han avanzado extraordinariamente en la comprensión del lenguaje natural, la generación de respuestas fluidas y la creación de experiencias totalmente nuevas para clientes y empleados. Sin embargo, dado que los LLM son inherentemente estocásticos, su uso para razonamientos numéricos o lógicos complejos ofrece pocas garantías de que los resultados sean conformes u óptimos. Por ejemplo:
Un responsable indica a un asistente de planificación con IA: «Envía todo lo posible la próxima semana manteniendo los costes bajos». El sistema entrega un plan agresivo que parece eficiente, pero supera discretamente la capacidad del almacén e incumple las garantías de entrega.
Un coordinador indica a un asistente de IA: «Reasigna los equipos para reducir las pernoctaciones y minimizar las interrupciones». El modelo genera un calendario de menor coste que parece óptimo, pero incumple las restricciones obligatorias sobre el tiempo de servicio o descanso.
Un asistente de IA para operaciones financieras debe aprobar transacciones sujetas a estrictas restricciones regionales y de riesgo, pero autoriza una transacción sospechosa inventando una justificación que parece conforme aunque infringe la política interna.
En entornos con requisitos operativos estrictos, combinar LLM con solucionadores formales ayuda a garantizar que las decisiones basadas en lenguaje natural respeten los límites definidos y eviten resultados inviables, subóptimos o no conformes.
Nuestro equipo de I+D investiga un enfoque híbrido que combina la creatividad y flexibilidad de los LLM con el rigor, las garantías y la transparencia de solucionadores matemáticos formales como Z3, Pyomo y OR-Tools. También estamos creando un motor reutilizable de IA formal para convertir esta capacidad en un componente estándar de la infraestructura tecnológica empresarial. La plataforma permitirá a las organizaciones incorporar reglas de negocio directamente desde sus sistemas actuales, verificar continuamente las decisiones según esas reglas e implantar agentes de IA de forma segura dentro de límites claramente definidos.
Nuestra visión es reducir el riesgo operativo y acelerar la toma de decisiones a gran escala. Los responsables toman decisiones más rápidas y conformes con las políticas a partir de entradas en lenguaje natural, mientras las organizaciones pueden automatizar cambios puntuales en la planificación, la asignación de recursos de la cadena de suministro, las operaciones financieras, la verificación de políticas e incluso el diseño de vídeo o 3D. Las salvaguardas integradas impiden que resultados inviables, no conformes o inseguros lleguen a producción.
En experimentos controlados con problemas de optimización logística y tres conjuntos de referencia públicos, nuestro enfoque híbrido demostró sistemáticamente:
Mayor precisión
Mayor interpretabilidad y auditabilidad
Nuestro enfoque invierte el paradigma habitual de que «el LLM lo hace todo» y adopta este diseño:


Este enfoque separa claramente las responsabilidades: los LLM extraen reglas y restricciones del lenguaje natural, mientras que solucionadores deterministas como OR-Tools, Z3 y Pyomo se encargan de la optimización y la verificación. El resultado combina las ventajas de ambos enfoques:
LLM | Solucionadores | Híbrido (LLM + solucionador) | |
|---|---|---|---|
Comprender la intención humana en distintos ámbitos | ✅ Excelente | ❌ Ninguna | ✅ Excelente |
Comportamiento determinista | ❌ No | ✅ Garantizado | ✅ Sí |
Corrección demostrable en razonamiento matemático y optimización con múltiples restricciones | ⚠️ Frágil | ✅ Garantizada | ✅ Sí |
Auditabilidad e interpretabilidad | ⚠️ Frágil | ✅ Clara | ✅ Clara |
Resistencia al ruido y a la inyección de prompts | ❌ Vulnerable | ✅ Inmune | ✅ Alta |
Partimos de un reto al que se enfrentan algunos de nuestros clientes:
Convertir solicitudes en lenguaje natural en decisiones óptimas sobre recursos y en tiempo real, aplicando estrictamente las restricciones operativas, normativas y de costes.
Este reto es fundamental para la logística y las cadenas de suministro modernas, incluida la planificación de personal, la asignación de activos, el enrutamiento, la planificación de pedidos y la gestión de la capacidad. También es un ámbito en el que los LLM y los solucionadores formales deben colaborar para crear sistemas fiables. Para la evaluación, creamos escenarios de prueba, fuentes de datos y restricciones controlados, junto con 240 consultas sintéticas. Algunos ejemplos:
Revise el calendario actual tras una cancelación. El centro de destino debe estar plenamente abastecido antes del 24 de diciembre de 2025. Cuando sea posible, obtenga las existencias de un almacén cercano y hágalas pasar por un punto de consolidación específico. La fecha de inicio más temprana permitida es el 14 de diciembre de 2025.
Solicitud de última hora: una persona VIP llegará a la ubicación A dentro de tres horas. Necesitamos que el personal requerido esté allí en dos horas. Ajuste las asignaciones de personal minimizando los cambios en el calendario actual.
Las consultas muestran que el sistema debe extraer y aplicar de forma fiable restricciones duras y blandas directamente desde solicitudes en lenguaje natural:
Las restricciones duras no son negociables (p. ej., fechas de inicio más tempranas, condiciones contractuales y límites de capacidad). Incumplir cualquiera de ellas invalida la solución.
Las restricciones blandas representan preferencias, como minimizar los retrasos, reducir los costes y limitar los cambios. El objetivo es optimizar sin traspasar los límites estrictos.
Algunos aspectos de estos problemas de optimización no pueden predefinirse por completo. Deben construirse dinámicamente a partir de las restricciones y los objetivos predefinidos en la lógica de negocio estructurada, los documentos internos y los datos operativos, además de la solicitud del usuario.
Para comprender el rendimiento de distintas técnicas en este contexto, implementamos y comparamos tres enfoques.
LLM puro: el enfoque más sencillo envía todos los datos pertinentes y la solicitud del usuario en lenguaje natural a un único prompt para un LLM, al que se pide que genere un plan o una asignación óptimos. Aunque puede funcionar con problemas pequeños o con pocas restricciones, deja de hacerlo a medida que aumenta la complejidad. El modelo puede ignorar restricciones, priorizar un objetivo equivocado o generar planes que parecen razonables pero son inviables, sin ninguna forma fiable de detectar o evitar los fallos.
LLM + Intérprete de código: en este enfoque, el LLM interpreta la solicitud y utiliza herramientas para acceder a fuentes de datos y generar código de optimización ejecutable. Esto aporta flexibilidad y observabilidad, pero la fiabilidad sigue siendo un problema. El LLM aún debe traducir las restricciones a código correcto, y pequeños errores de razonamiento o programación pueden generar resultados no válidos o subóptimos, especialmente al aumentar el número de restricciones.
Híbrido: LLM → restricciones estructuradas → solucionador determinista: el tercer enfoque separa las responsabilidades. El LLM nunca «decide» el resultado; ayuda a formalizar las variables, restricciones y objetivos. Un solucionador de optimización probado aplica las restricciones, garantiza la viabilidad y genera resultados que pueden verificarse y auditarse. La función del LLM se limita a traducir las solicitudes en lenguaje natural a restricciones explícitas y estructuradas mediante esquemas predefinidos. Estas restricciones se compilan automáticamente en código para un solucionador, como OR-Tools, que calcula de forma determinista una solución viable y óptima.
Probamos los métodos con varios LLM, incluidos GPT-5, GPT-5.1 y GPT-5.2. Como esperábamos, el enfoque híbrido superó a las alternativas:
Método | Precisión de la asignación | Latencia media | Tokens utilizados por consulta |
|---|---|---|---|
LLM puro | 70–78 % | 62–190 s | ~175 000 |
LLM + Intérprete de código | 82–84 % | 62–140 s | ~9 000 |
LLM → solucionador (híbrido) | 95–97 % | 6–25 s | ~2 000 |
Nuestro método híbrido demuestra un aumento considerable de la precisión, una eficiencia de tokens más de cuatro veces mayor y una reducción de la latencia de un orden de magnitud.
Nuestro siguiente paso es crear una interfaz generalizable y reutilizable que convierta el lenguaje natural en representaciones semánticas estructuradas, que nuestro backend pueda traducir a código listo para el solucionador. Para este experimento, nos centramos en problemas de optimización lineal y evaluamos el enfoque con tres conjuntos de datos públicos (NLP4LP, NL4OPT e IndustryOR).
LLM independiente
Método híbrido (LLM → reglas estructuradas → solucionador → resultado verificado)


Utilizar un LLM para extraer variables, restricciones y objetivos de la entrada y formular un problema de optimización estructurado.
Enviar el problema estructurado y la solicitud original a un LLM para su autoverificación.
Traducir el problema estructurado a código de OR-Tools para calcular la asignación óptima.
Evaluamos este enfoque con modelos propios de vanguardia, incluidos GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max y GPT-5.2, además de modelos de código abierto como Kimi K2, los modelos GPT-OSS y MiniMax M2. Los diagramas de caja resumen los resultados de cada método.


El enfoque híbrido genera sistemáticamente resultados más precisos, estables y verificables que un LLM independiente de referencia en casi todos los modelos de lenguaje subyacentes evaluados. Aunque el rendimiento absoluto varía entre modelos, las mejoras relativas del enfoque híbrido se mantienen constantes. Esto indica que las mejoras proceden de separar la comprensión del lenguaje natural de la optimización formal, en lugar de depender de la capacidad de razonamiento de un único modelo.
Precisión
En NLP4LP y NL4OPT, compuestos principalmente por problemas de programación lineal, el método híbrido alcanza una precisión cercana al máximo y supera el uso de prompts con LLM independientes. En lugar de producir razonamientos «aproximadamente correctos», el sistema híbrido genera de forma más sistemática formulaciones matemáticas válidas y bien construidas. En el conjunto de datos IndustryOR, más exigente, la precisión disminuye con ambos métodos, pero por motivos distintos. Muchos problemas de IndustryOR incluyen estructuras combinatorias, como el enrutamiento de vehículos, la secuenciación de tareas y la asignación de personal, que superan las capacidades de optimización lineal que admite actualmente nuestro backend de solucionadores.
El análisis de los tipos de fallo muestra que los LLM independientes incumplen con frecuencia las restricciones obligatorias, como se ilustra a continuación:
Ejemplo 1:
Plain Text
El LLM independiente genera una solución con menos grasa total, pero incumple el requisito de que los menús de pavo no representen más del 40 % de las comidas. El enfoque híbrido aplica correctamente esta restricción dura y devuelve una respuesta válida.
Ejemplo 2:
Plain Text
El LLM independiente vuelve a generar una solución con menos altas hospitalarias, pero supera el límite máximo permitido de analgésicos. El enfoque híbrido aplica correctamente esa restricción dura y devuelve una respuesta válida.
Latencia y uso de tokens
Los datos de latencia y uso de tokens revelan una distinción importante. El enfoque híbrido presenta una latencia media y un uso de tokens mayores que un único prompt para un LLM, pero esto responde a decisiones arquitectónicas, no a una falta de eficiencia.
El proceso híbrido incluye:
Una o varias llamadas a un LLM para extraer variables, restricciones y objetivos estructurados.
Un paso de autoverificación para detectar incoherencias internas.
Aunque estos pasos añaden sobrecarga frente a un único prompt, la latencia se mantiene acotada y predecible, y la ejecución del solucionador suele ser rápida cuando el problema está bien formulado. El trabajo adicional crea representaciones intermedias explícitas, reutilizables y auditables. En cambio, los enfoques basados únicamente en LLM condensan el razonamiento en una generación opaca y trasladan los costes a los reintentos, las comprobaciones manuales y los fallos posteriores. Las futuras iteraciones pueden reducir esta sobrecarga mediante:
Almacenar en caché los esquemas extraídos.
Actualizar las restricciones de forma incremental.
Mejorar la orquestación de prompts y llamadas.
Transparencia y auditabilidad
Por último, incluso cuando ambos métodos fallan, el tipo de fallo es radicalmente distinto.
Con un LLM independiente, los fallos suelen pasar inadvertidos: el modelo puede devolver un resultado sutilmente incorrecto.
Con el enfoque híbrido, la formulación explícita del problema hace visibles los fallos y ayuda a los equipos a identificar qué parte de la formulación causó el error.
Las versiones futuras podrían mostrar estas formulaciones en una interfaz para que los usuarios las auditen o verifiquen antes de ejecutar el solucionador. Esta transparencia mejora la precisión medida y facilita la depuración y el perfeccionamiento del sistema, algo esencial para implantarlo en entornos reales.
Conclusión principal
En todos los conjuntos de referencia y en la mayoría de los modelos subyacentes probados, los resultados refuerzan una conclusión central de nuestro trabajo:
Los LLM son potentes para comprender y traducir intenciones, pero los solucionadores deterministas son esenciales para garantizar la corrección.
El enfoque híbrido transforma el lenguaje natural, que deja de ser una fuente de ambigüedad para convertirse en una interfaz fiable para tomar decisiones con rigor matemático, y acerca la IA empresarial a sistemas no solo inteligentes, sino también dignos de confianza.
Las restricciones empresariales rara vez se encuentran en esquemas ordenados o prompts perfectamente redactados. Están dispersas entre bases de datos, hojas de cálculo, políticas internas y contratos. Las solicitudes de los usuarios pueden estar incompletas, ser ambiguas o contradecir las reglas de negocio. Para aplicar este enfoque a gran escala, estamos creando un motor de backend reutilizable que transforma esta complejidad en una capacidad empresarial fiable.


En esencia, este motor actúa como estructura formal de los sistemas de decisión basados en IA y ofrece:
Una base de conocimiento simbólica con adaptadores que incorporan reglas de negocio, restricciones, variables y objetivos.
Una capa de traducción que compila esquemas en código para el solucionador.
Interfaces que permiten a los equipos inspeccionar, auditar y modificar restricciones.
Aunque estos experimentos se centran actualmente en la optimización, el mismo método puede ampliarse a la verificación lógica. Entre sus posibles aplicaciones empresariales se incluyen:
Realizar de forma puntual una planificación, un enrutamiento y una asignación de recursos dinámicos, respetando todas las restricciones operativas.
Generar respuestas y recomendaciones que respeten sistemáticamente las reglas de negocio.
Diseñar y validar objetos 3D, vídeos y arquitecturas complejos, detectando los diseños inviables antes de la producción.
La IA actual es potente, pero las empresas necesitan algo más que potencia: necesitan corrección, coherencia y control. Nuestro sistema híbrido de LLM y solucionadores es un paso hacia un mundo en el que:
Los agentes no inventan reglas ni restricciones.
La deducción lógica y la optimización son matemáticamente rigurosas.
El lenguaje natural sirve de interfaz universal para los sistemas deterministas.