Основная навигация

Сочетание LLM и формальных решателей для надежных решений на основе ИИ

Гибридная архитектура сочетает гибкость LLM с детерминированными решателями для надежных и проверяемых корпоративных решений.

Большие языковые модели (LLM) достигли выдающихся успехов в понимании естественного языка, создании связных ответов и разработке принципиально новых решений для клиентов и сотрудников. Однако LLM по своей природе стохастичны, поэтому при их использовании для сложных численных или логических рассуждений трудно гарантировать соответствие результатов требованиям или их оптимальность. Например:

  • Менеджер поручает ИИ-помощнику по планированию: “Ship as much as possible next week while keeping costs low,” — и система предлагает агрессивный план, который выглядит эффективным, но незаметно превышает пропускную способность склада и нарушает гарантии доставки.

  • Координатор поручает ИИ-помощнику: “Reassign crews to reduce overnight stays and minimize disruption,” — и модель составляет более дешевое расписание, которое выглядит оптимальным, но нарушает обязательные ограничения по рабочему времени или отдыху.

  • ИИ-помощник по финансовым операциям должен одобрять транзакции с учетом строгих региональных ограничений и требований к рискам, но пропускает подозрительную транзакцию, выдумав обоснование, которое лишь кажется соответствующим требованиям, хотя нарушает внутреннюю политику.

В средах со строгими операционными требованиями сочетание LLM с формальными решателями помогает удерживать решения на основе естественного языка в заданных границах и избегать невыполнимых, неоптимальных или не соответствующих требованиям результатов.

Наша команда НИОКР изучает гибридный подход, сочетающий творческие возможности и гибкость LLM со строгостью, гарантиями и прозрачностью формальных математических решателей, таких как Z3, Pyomo и OR-Tools. Мы также создаем универсальный формальный ИИ-движок, чтобы эта возможность стала стандартной частью корпоративного технологического стека. Платформа позволит организациям напрямую загружать бизнес-правила из существующих систем, непрерывно проверять решения на соответствие этим правилам и безопасно внедрять ИИ-агентов в четко заданных границах.

Наша цель — снизить операционные риски и ускорить принятие решений в масштабе всей организации. Руководители смогут быстрее принимать решения на основе запросов на естественном языке и в соответствии с политиками, а организации — автоматизировать ситуативные изменения расписаний, распределение ресурсов в цепочках поставок, финансовые операции, проверку политик и даже создание видео или 3D-дизайна. Встроенные механизмы защиты не допускают вывода в рабочую среду невыполнимых, несоответствующих требованиям или небезопасных результатов.

В контролируемых экспериментах с задачами оптимизации в логистике и тремя общедоступными бенчмарками наш гибридный подход стабильно демонстрировал:

  • Более высокую точность

  • Более высокую интерпретируемость и проверяемость

Гибридная архитектура

Наш подход переворачивает привычную парадигму «LLM делает всё» и использует следующую архитектуру:

Схема, показывающая, как большие языковые модели и детерминированные решатели сочетают понимание естественного языка с проверяемой оптимизацией.

Здесь обязанности четко разделены: LLM извлекают правила и ограничения из естественного языка, а детерминированные решатели, такие как OR-Tools, Z3 и Pyomo, выполняют оптимизацию и проверку. В результате объединяются преимущества обоих подходов:

LLM

Решатели

Гибрид (LLM + решатель)

Понимание человеческих намерений в разных областях

✅ Отлично

❌ Отсутствует

✅ Отлично

Детерминированное поведение

❌ Нет

✅ Гарантировано

✅ Да

Доказуемая корректность математических рассуждений и многокритериальной оптимизации

⚠️ Ненадежно

✅ Гарантировано

✅ Да

Проверяемость и интерпретируемость

⚠️ Ненадежно

✅ Прозрачно

✅ Прозрачно

Устойчивость к шуму и инъекциям в промпте

❌ Уязвимы

✅ Невосприимчивы

✅ Высокая

Экспериментальное направление 1: логистика и распределение персонала

Предметная область задачи

Мы начали с задачи, с которой сталкиваются некоторые наши клиенты:

Преобразование запросов на естественном языке в оптимальные решения по ресурсам в реальном времени со строгим соблюдением операционных, нормативных и стоимостных ограничений.

Эта задача лежит в основе современной логистики и цепочек поставок, включая составление графиков персонала, распределение активов, маршрутизацию, планирование выполнения заказов и управление мощностями. Именно здесь LLM и формальные решатели должны работать вместе, чтобы создавать системы, заслуживающие доверия. Для оценки мы создали контролируемые тестовые сценарии, источники данных и ограничения, а также 240 синтетических запросов. Примеры:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Из запросов видно, что система должна надежно извлекать и применять жесткие и мягкие ограничения непосредственно из запросов на естественном языке:

  • Жесткие ограничения не допускают компромиссов (например, минимальные даты начала, условия договоров и предельные мощности). Нарушение любого из них делает решение недопустимым.

  • Мягкие ограничения задают предпочтения, например минимизацию задержек, снижение затрат и ограничение числа изменений. Цель — выполнить оптимизацию, не нарушая жестких границ.

Некоторые аспекты таких задач оптимизации невозможно полностью определить заранее. Их необходимо формировать динамически, учитывая не только заранее заданные ограничения и цели из структурированной бизнес-логики, внутренних документов и операционных данных, но и запрос пользователя.

Оцениваемые подходы

Чтобы понять эффективность разных методов в этих условиях, мы реализовали и сравнили три подхода.

  1. Только LLM: в простейшем подходе все нужные данные и запрос пользователя на естественном языке передаются в одном промпте LLM, которая должна составить оптимальный план или распределение. Это может работать для небольших задач или задач с малым числом ограничений, но по мере роста сложности подход перестает справляться. Модель может игнорировать ограничения, выбрать неверную цель в качестве приоритетной или создавать планы, которые кажутся разумными, но невыполнимы, причем надежно выявить или предотвратить такие ошибки нельзя.

  2. LLM + Интерпретатор кода: при этом подходе LLM интерпретирует запрос и с помощью инструментов обращается к источникам данных и создает исполняемый код оптимизации. Это повышает гибкость и наблюдаемость, но проблема надежности сохраняется. LLM по-прежнему должна преобразовывать ограничения в корректный код, а небольшие ошибки в рассуждениях или коде могут приводить к недопустимым или неоптимальным результатам, особенно при росте числа ограничений.

  3. Гибрид: LLM → структурированные ограничения → детерминированный решатель: третий подход разделяет обязанности. LLM никогда не «принимает» итоговое решение — она помогает формализовать переменные, ограничения и целевые функции. Проверенный решатель оптимизационных задач обеспечивает соблюдение ограничений, гарантирует допустимость и выдает результаты, которые можно проверить и проаудировать. Роль LLM ограничена преобразованием запросов на естественном языке в явные структурированные ограничения по заранее заданным схемам. Эти ограничения автоматически компилируются в код решателя, например OR-Tools, который детерминированно вычисляет допустимое оптимальное решение.

Результаты

Мы протестировали методы с несколькими LLM, включая GPT-5, GPT-5.1 и GPT-5.2. Как и ожидалось, гибридный подход превзошел альтернативы:

Метод

Точность распределения

Средняя задержка

Токенов на запрос

Только LLM

70–78%

62–190 с

~175 000

LLM + Интерпретатор кода

82–84%

62–140 с

~9 000

LLM → решатель (гибрид)

95–97%

6–25 с

~2 000

Наш гибридный метод демонстрирует существенный рост точности, более чем четырехкратное повышение эффективности использования токенов и сокращение задержки на порядок.

Экспериментальное направление 2: универсальная оптимизация на основе естественного языка

Следующий шаг — создать универсальный многократно используемый интерфейс, который преобразует естественный язык в структурированные семантические представления, а наш серверный компонент — в готовый для решателя код. В этом эксперименте мы сосредоточились на задачах линейной оптимизации и оценили подход на трех общедоступных наборах данных: NLP4LP, NL4OPT и IndustryOR.

Оцениваемые подходы

  1. Автономная LLM

  2. Гибридный метод (LLM → структурированные правила → решатель → проверенный результат)

Схема гибридного процесса: от запросов на естественном языке к структурированным ограничениям, детерминированному решению и проверенному результату.

  • Использовать LLM для извлечения переменных, ограничений и целевых функций из входных данных и формирования структурированной задачи оптимизации.

  • Передать структурированную задачу и исходный запрос в LLM для самопроверки.

  • Преобразовать структурированную задачу в код OR-Tools для вычисления оптимального распределения.

Результаты

Мы оценили этот подход с помощью проприетарных передовых моделей, включая GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max и GPT-5.2, а также моделей с открытым исходным кодом, таких как Kimi K2, модели GPT-OSS и MiniMax M2. Диаграммы размаха обобщают результаты каждого метода.

Диаграмма сравнения автономных больших языковых моделей и гибридных подходов на основе решателей в бенчмарках оптимизации.

Почти для всех оцененных базовых языковых моделей гибридный подход стабильно дает более точные, устойчивые и проверяемые результаты, чем автономная LLM. Хотя абсолютные показатели различаются в зависимости от модели, относительный выигрыш гибридного подхода остается стабильным. Это указывает на то, что улучшения обусловлены разделением понимания естественного языка и формальной оптимизации, а не способностью какой-либо одной модели к рассуждениям.

Точность

На NLP4LP и NL4OPT, состоящих в основном из задач линейного программирования, гибридный метод достигает почти предельной точности и превосходит автономные промпты к LLM. Вместо «приблизительно верных» рассуждений гибридная система гораздо стабильнее создает допустимые и корректно сформулированные математические модели. На более сложном наборе данных IndustryOR точность обоих методов снижается, но по разным причинам. Многие задачи IndustryOR содержат комбинаторные структуры, например маршрутизацию транспорта, определение последовательности задач и распределение персонала, которые выходят за рамки возможностей линейной оптимизации, сейчас поддерживаемых нашим серверным решателем.

Анализ характера ошибок показывает, что автономные LLM часто нарушают обязательные ограничения, как в следующих примерах:

Пример 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Автономная LLM предлагает решение с меньшим общим содержанием жира, но нарушает требование, согласно которому обеды с индейкой должны составлять не более 40% всех приемов пищи. Гибридный подход правильно применяет это жесткое ограничение и возвращает допустимый ответ.

Пример 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Автономная LLM снова предлагает решение с меньшим объемом выписки препаратов, но превышает предельно допустимый объем обезболивающих. Гибридный подход правильно применяет это жесткое ограничение и возвращает допустимый ответ.

Задержка и расход токенов

Данные о задержке и расходе токенов показывают важное различие. Средняя задержка и расход токенов у гибридного подхода выше, чем у единичного промпта к LLM, однако это связано с особенностями архитектуры, а не с неэффективностью.

Гибридный конвейер включает:

  1. Один или несколько вызовов LLM для извлечения структурированных переменных, ограничений и целевых функций.

  2. Этап самопроверки для выявления внутренних противоречий.

Хотя эти этапы создают дополнительные издержки по сравнению с единичным промптом, задержка остается ограниченной и предсказуемой, а после корректной постановки задачи решатель обычно работает быстро. Дополнительная обработка создает явные, многократно используемые и проверяемые промежуточные представления. В отличие от этого, автономные LLM сворачивают рассуждения в одну непрозрачную генерацию, перекладывая издержки на повторные попытки, ручные проверки и устранение последующих сбоев. В следующих версиях эти издержки можно сократить за счет:

  • Кэширования извлеченных схем.

  • Инкрементального обновления ограничений.

  • Улучшения оркестрации промптов и вызовов.

Прозрачность и проверяемость

Наконец, даже когда оба метода дают сбой, характер сбоя принципиально различается.

  • При использовании автономной LLM сбои часто остаются незаметными: модель может вернуть результат с неочевидной ошибкой.

  • В гибридном подходе явная постановка задачи делает сбои прозрачными и помогает командам определить, какая часть формулировки привела к ошибке.

В будущих версиях эти формулировки можно отображать в интерфейсе, чтобы пользователи могли изучить или проверить их до запуска решателя. Такая прозрачность повышает измеряемую точность и упрощает отладку и совершенствование системы, что крайне важно для внедрения на практике.

Главный вывод

Результаты всех бенчмарков и большинства протестированных базовых моделей подтверждают главный вывод нашей работы:

LLM отлично понимают и преобразуют намерения, но для обеспечения корректности необходимы детерминированные решатели.

Гибридный подход превращает естественный язык из источника неоднозначности в надежный интерфейс для принятия математически обоснованных решений, приближая корпоративный ИИ к системам, которые не только интеллектуальны, но и заслуживают доверия.

Следующий шаг: универсальный формальный ИИ-движок для предприятий

Корпоративные ограничения редко представлены в виде аккуратных схем или идеально сформулированных промптов. Они разбросаны по базам данных, электронным таблицам, внутренним политикам и договорам. Запросы пользователей могут быть неполными, неоднозначными или противоречить бизнес-правилам. Чтобы масштабировать этот подход, мы создаем универсальный серверный движок, который превращает эту сложность в надежный корпоративный инструмент.

Схема корпоративного формального ИИ-движка, включающая бизнес-правила, преобразование для решателя и принятие проверяемых решений.

Платформа

Этот движок служит формальной основой систем принятия решений на базе ИИ и предоставляет:

  • Символьную базу знаний с адаптерами для загрузки бизнес-правил, ограничений, переменных и целевых функций.

  • Уровень преобразования, который компилирует схемы в код решателя.

  • Интерфейсы, позволяющие командам изучать, проверять и изменять ограничения.

Где это создает ценность

Хотя сейчас эксперименты сосредоточены на оптимизации, тот же метод применим и к логической проверке. Возможные бизнес-приложения:

  • Динамически составлять расписания, прокладывать маршруты и распределять ресурсы по ситуативным запросам с соблюдением всех операционных ограничений.

  • Формировать ответы и рекомендации, неизменно соответствующие бизнес-правилам.

  • Проектировать и проверять сложные 3D-объекты, видео и архитектуры, выявляя невыполнимые проекты до начала производства.

Заключение

Современный ИИ обладает огромными возможностями, но предприятиям этого недостаточно: им нужны корректность, согласованность и контроль. Наша гибридная система на основе LLM и решателя — шаг к миру, в котором:

  • Агенты не выдумывают правила и ограничения.

  • Логические выводы и оптимизация математически обоснованы.

  • Естественный язык служит универсальным интерфейсом для детерминированных систем.

Автор

Peng Seng Ang