Navegação principal

Combinar LLM e resolvedores formais para decisões de IA fiáveis

Uma arquitetura híbrida combina a flexibilidade dos LLM com resolvedores determinísticos para gerar decisões empresariais fiáveis e verificáveis.

Os grandes modelos de linguagem (LLM) fizeram progressos extraordinários na compreensão da linguagem natural, na geração de respostas fluentes e na criação de experiências totalmente novas para clientes e colaboradores. No entanto, como os LLM são inerentemente estocásticos, a sua utilização em raciocínios numéricos ou lógicos complexos oferece poucas garantias de que os resultados cumpram os requisitos ou sejam ideais. Por exemplo:

  • Um gestor diz a um assistente de planeamento com IA: “Ship as much as possible next week while keeping costs low,” e o sistema apresenta um plano agressivo que parece eficiente, mas excede silenciosamente a capacidade do armazém e viola as garantias de entrega.

  • Um coordenador diz a um assistente de IA: “Reassign crews to reduce overnight stays and minimize disruption,” e o modelo cria um horário de menor custo que parece ideal, mas viola limites obrigatórios de tempo de serviço ou descanso.

  • Um assistente de IA para operações financeiras tem de aprovar transações sujeitas a rigorosas restrições regionais e de risco, mas autoriza uma transação suspeita ao inventar uma justificação que parece estar em conformidade, embora viole a política interna.

Em ambientes com requisitos operacionais rigorosos, combinar LLM com resolvedores formais ajuda a garantir que as decisões baseadas em linguagem natural respeitam os limites definidos e evitam resultados inviáveis, subótimos ou não conformes.

A nossa equipa de I&D está a investigar uma abordagem híbrida que combina a criatividade e a flexibilidade dos LLM com o rigor, as garantias e a transparência de resolvedores matemáticos formais como Z3, Pyomo e OR-Tools. Estamos também a desenvolver um motor de IA formal reutilizável para tornar esta capacidade numa componente habitual da infraestrutura tecnológica empresarial. A plataforma permitirá às organizações importar regras empresariais diretamente dos sistemas existentes, verificar continuamente as decisões face a essas regras e implementar agentes de IA em segurança, dentro de limites claramente definidos.

A nossa visão é reduzir o risco operacional e, simultaneamente, acelerar a tomada de decisões em grande escala. Os líderes obtêm decisões mais rápidas e conformes com as políticas a partir de instruções em linguagem natural, enquanto as organizações podem automatizar alterações pontuais no agendamento, na afetação de recursos da cadeia de abastecimento, nas operações financeiras, na verificação de políticas e até na conceção de vídeo ou 3D. As salvaguardas integradas impedem que resultados inviáveis, não conformes ou inseguros cheguem à produção.

Em experiências controladas com problemas de otimização semelhantes aos da logística e três referenciais públicos, a nossa abordagem híbrida demonstrou consistentemente:

  • Maior precisão

  • Maior interpretabilidade e auditabilidade

A arquitetura híbrida

A nossa abordagem inverte o paradigma habitual de que «o LLM faz tudo» e segue antes esta conceção:

Diagrama que compara a forma como grandes modelos de linguagem e resolvedores determinísticos combinam a compreensão da linguagem natural com uma otimização verificável.

Esta abordagem separa claramente as responsabilidades: os LLM extraem regras e restrições da linguagem natural, enquanto resolvedores determinísticos como OR-Tools, Z3 e Pyomo tratam da otimização e da verificação. O resultado combina os pontos fortes de ambas as abordagens:

LLM

Resolvedores

Híbrido (LLM + resolvedor)

Compreender a intenção humana em diferentes domínios

✅ Excelente

❌ Nenhuma

✅ Excelente

Comportamento determinístico

❌ Não

✅ Garantido

✅ Sim

Correção comprovável no raciocínio matemático e na otimização com múltiplas restrições

⚠️ Frágil

✅ Garantido

✅ Sim

Auditabilidade e interpretabilidade

⚠️ Frágil

✅ Clara

✅ Clara

Resistência a ruído e injeção no prompt

❌ Vulnerável

✅ Imune

✅ Forte

Vertente experimental 1: logística e afetação de trabalhadores

O domínio do problema

Começámos por um desafio enfrentado por alguns dos nossos clientes:

Transformar pedidos em linguagem natural em decisões ideais sobre recursos, em tempo real, garantindo rigorosamente o cumprimento das restrições operacionais, de políticas e de custos.

Este desafio está no centro da logística e das cadeias de abastecimento modernas, incluindo o agendamento de trabalhadores, a afetação de ativos, o encaminhamento, o planeamento do processamento de encomendas e a gestão de capacidade. É também aqui que os LLM e os resolvedores formais têm de colaborar para criar sistemas dignos de confiança. Para a nossa avaliação, criámos cenários de teste, fontes de dados e restrições controlados, bem como 240 consultas sintéticas. Alguns exemplos:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

As consultas mostram que o sistema tem de extrair e aplicar de forma fiável restrições rígidas e flexíveis diretamente a partir de pedidos em linguagem natural:

  • As restrições rígidas não são negociáveis (por exemplo, datas de início mais próximas, termos contratuais e limites de capacidade). A violação de qualquer uma delas invalida a solução.

  • As restrições flexíveis representam preferências, como minimizar atrasos, reduzir custos e limitar alterações. O objetivo é otimizar sem ultrapassar os limites rígidos.

Alguns aspetos destes problemas de otimização não podem ser totalmente predefinidos. Têm de ser compostos dinamicamente, recorrendo não só a restrições e objetivos predefinidos provenientes da lógica empresarial estruturada, de documentos internos e de dados operacionais, mas também ao pedido do utilizador.

As abordagens que avaliámos

Para compreender o desempenho das diferentes técnicas neste contexto, implementámos e comparámos três abordagens.

  1. LLM puro: a abordagem mais simples envia todos os dados relevantes e o pedido do utilizador em linguagem natural para um único prompt de LLM, ao qual é solicitado um plano ou uma afetação ideal. Embora possa funcionar em problemas pequenos ou com poucas restrições, esta abordagem falha à medida que a complexidade aumenta. O modelo pode ignorar restrições, dar prioridade ao objetivo errado ou criar planos que parecem razoáveis, mas são inviáveis, sem que exista uma forma fiável de detetar ou evitar falhas.

  2. LLM + Code Interpreter: nesta abordagem, o LLM interpreta o pedido e utiliza ferramentas para aceder a fontes de dados e gerar código de otimização executável. Isto acrescenta flexibilidade e observabilidade, mas a fiabilidade continua a ser um problema. O LLM continua a ter de traduzir as restrições em código correto, e pequenos erros de raciocínio ou programação podem gerar resultados inválidos ou subótimos, sobretudo à medida que aumenta o número de restrições.

  3. Híbrido: LLM → restrições estruturadas → resolvedor determinístico: a terceira abordagem separa as responsabilidades. O LLM nunca «decide» o resultado; ajuda a formalizar as variáveis, as restrições e os objetivos. Um resolvedor de otimização comprovado aplica as restrições, garante a viabilidade e produz resultados que podem ser verificados e auditados. O papel do LLM limita-se a traduzir pedidos em linguagem natural em restrições explícitas e estruturadas, utilizando esquemas predefinidos. Essas restrições são compiladas automaticamente em código para um resolvedor, como OR-Tools, que calcula de forma determinística uma solução viável e ideal.

Resultados

Testámos os métodos com vários LLM, incluindo GPT-5, GPT-5.1 e GPT-5.2. Como previsto, a abordagem híbrida superou as alternativas:

Método

Precisão da afetação

Latência média

Tokens utilizados por consulta

LLM puro

70–78%

62–190 s

~175 000

LLM + Code Interpreter

82–84%

62–140 s

~9 000

LLM → resolvedor (híbrido)

95–97%

6–25 s

~2 000

O nosso método híbrido demonstra um aumento substancial da precisão, uma eficiência de tokens mais de quatro vezes superior e uma redução da latência em uma ordem de grandeza.

Vertente experimental 2: otimização de uso geral a partir de linguagem natural

O passo seguinte é criar uma interface generalizável e reutilizável que converta linguagem natural em representações semânticas estruturadas, que o nosso back-end possa traduzir em código pronto para o resolvedor. Nesta experiência, centrámo-nos em problemas de otimização linear e avaliámos a abordagem com três conjuntos de dados públicos (NLP4LP, NL4OPT e IndustryOR).

As abordagens que avaliámos

  1. LLM autónomo

  2. Método híbrido (LLM → regras estruturadas → resolvedor → resultado verificado)

Diagrama do fluxo de trabalho híbrido, desde os pedidos em linguagem natural até às restrições estruturadas, à resolução determinística e ao resultado verificado.

  • Utilizar um LLM para extrair variáveis, restrições e objetivos dos dados de entrada e formular um problema de otimização estruturado.

  • Enviar o problema estruturado e o pedido original para um LLM efetuar a autoverificação.

  • Traduzir o problema estruturado em código OR-Tools para calcular a afetação ideal.

Resultados

Avaliámos esta abordagem com modelos de fronteira proprietários, incluindo GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max e GPT-5.2, bem como modelos de código aberto como Kimi K2, modelos GPT-OSS e MiniMax M2. Os diagramas de caixa resumem os resultados de cada método.

Gráfico que compara grandes modelos de linguagem autónomos e abordagens híbridas baseadas em resolvedores em vários referenciais de otimização.

A abordagem híbrida produz consistentemente resultados mais precisos, estáveis e verificáveis do que a referência baseada num LLM autónomo, em quase todos os modelos de linguagem subjacentes avaliados. Embora o desempenho absoluto varie entre modelos, os ganhos relativos da abordagem híbrida mantêm-se consistentes. Isto sugere que as melhorias resultam da separação entre a compreensão da linguagem natural e a otimização formal, e não da dependência da capacidade de raciocínio de um único modelo.

Precisão

Nos conjuntos NLP4LP e NL4OPT, compostos sobretudo por problemas de programação linear, o método híbrido alcança uma precisão próxima do máximo e supera os prompts para LLM autónomos. Em vez de produzir um raciocínio «aproximadamente correto», o sistema híbrido gera com maior consistência formulações matemáticas válidas e bem estruturadas. No conjunto de dados IndustryOR, mais exigente, a precisão diminui em ambos os métodos, mas por motivos diferentes. Muitos problemas do IndustryOR envolvem estruturas combinatórias, como o encaminhamento de veículos, a sequenciação de tarefas e a afetação de trabalhadores, que excedem as capacidades de otimização linear atualmente suportadas pelo back-end do nosso resolvedor.

A análise dos modos de falha mostra que os LLM autónomos violam frequentemente restrições obrigatórias, como ilustrado abaixo:

Exemplo 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

O LLM autónomo produz uma solução com menos gordura total, mas viola o requisito de que os jantares de peru não representem mais de 40% das refeições. A abordagem híbrida aplica corretamente esta restrição rígida e devolve uma resposta válida.

Exemplo 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

O LLM autónomo volta a produzir uma solução com menos altas hospitalares, mas excede o limite máximo permitido de medicação para a dor. A abordagem híbrida aplica corretamente essa restrição rígida e devolve uma resposta válida.

Latência e utilização de tokens

Os dados sobre latência e utilização de tokens revelam uma distinção importante. A abordagem híbrida apresenta uma latência média e uma utilização de tokens superiores às de um único prompt para um LLM, mas isso reflete opções arquitetónicas, não ineficiência.

O fluxo híbrido inclui:

  1. Uma ou mais chamadas ao LLM para extrair variáveis, restrições e objetivos estruturados.

  2. Uma etapa de autoverificação para detetar incoerências internas.

Embora estas etapas acrescentem sobrecarga face a um único prompt, a latência continua limitada e previsível, e a execução do resolvedor costuma ser rápida quando o problema está bem formulado. O trabalho adicional cria representações intermédias explícitas, reutilizáveis e auditáveis. Em contrapartida, as abordagens baseadas apenas em LLM condensam o raciocínio numa única geração opaca, transferindo os custos para novas tentativas, verificações manuais e falhas posteriores. Futuras iterações poderão reduzir esta sobrecarga através de:

  • Colocação em cache dos esquemas extraídos.

  • Atualização incremental das restrições.

  • Melhoria da orquestração de prompts e chamadas.

Transparência e auditabilidade

Por fim, mesmo quando ambos os métodos falham, o próprio modo de falha é fundamentalmente diferente.

  • Com um LLM autónomo, as falhas são muitas vezes silenciosas: o modelo pode devolver um resultado subtilmente incorreto.

  • Na abordagem híbrida, a formulação explícita do problema torna as falhas transparentes e ajuda as equipas a identificar a parte da formulação que causou o erro.

As versões futuras poderão apresentar estas formulações numa interface, permitindo aos utilizadores auditá-las ou verificá-las antes da execução do resolvedor. Esta transparência melhora a precisão medida e facilita a depuração e o aperfeiçoamento do sistema, algo essencial para a implementação no mundo real.

Principal conclusão

Em todos os referenciais e na maioria dos modelos subjacentes testados, os resultados reforçam uma conclusão central do nosso trabalho:

Os LLM são poderosos na compreensão e tradução da intenção, mas os resolvedores determinísticos são essenciais para garantir a correção.

A abordagem híbrida transforma a linguagem natural, que deixa de ser uma fonte de ambiguidade para passar a ser uma interface fiável para decisões matematicamente sólidas, aproximando a IA empresarial de sistemas não só inteligentes, mas também dignos de confiança.

Próximos passos: um motor de IA formal reutilizável para empresas

As restrições empresariais raramente existem em esquemas organizados ou prompts formulados na perfeição. Estão dispersas por bases de dados, folhas de cálculo, políticas internas e contratos. Os pedidos dos utilizadores podem estar incompletos, ser ambíguos ou contrariar as regras empresariais. Para aplicar esta abordagem em grande escala, estamos a desenvolver um motor de back-end reutilizável que transforma esta complexidade numa capacidade empresarial fiável.

Diagrama do motor empresarial de IA formal, incluindo regras empresariais, tradução para o resolvedor e tomada de decisões auditável.

A plataforma

Na sua essência, este motor funciona como a base formal dos sistemas de decisão orientados por IA, oferecendo:

  • Uma base de conhecimento simbólica com adaptadores que importam regras empresariais, restrições, variáveis e objetivos.

  • Uma camada de tradução que compila esquemas em código para o resolvedor.

  • Interfaces que permitem às equipas inspecionar, auditar e alterar restrições.

Onde esta abordagem cria valor

Embora estas experiências se concentrem atualmente na otimização, o mesmo método pode ser alargado à verificação lógica. As potenciais aplicações empresariais incluem:

  • Efetuar agendamento dinâmico pontual, encaminhamento e afetação de recursos, garantindo o cumprimento de todas as restrições operacionais.

  • Gerar respostas e recomendações que respeitem consistentemente as regras empresariais.

  • Conceber e validar objetos 3D, vídeos e arquiteturas complexos, detetando projetos inviáveis antes da produção.

Considerações finais

A IA atual é poderosa, mas as empresas precisam de mais do que poder: precisam de correção, consistência e controlo. O nosso sistema híbrido de LLM e resolvedores é um passo rumo a um mundo onde:

  • Os agentes não inventam regras nem restrições.

  • A dedução lógica e a otimização são matematicamente sólidas.

  • A linguagem natural funciona como interface universal para sistemas determinísticos.

Autor

Peng Seng Ang