Большие языковые модели (LLM) достигли выдающихся успехов в понимании естественного языка, создании связных ответов и разработке принципиально новых решений для клиентов и сотрудников. Однако LLM по своей природе стохастичны, поэтому при их использовании для сложных численных или логических рассуждений трудно гарантировать соответствие результатов требованиям или их оптимальность. Например:
Менеджер поручает ИИ-помощнику по планированию: “Ship as much as possible next week while keeping costs low,” — и система предлагает агрессивный план, который выглядит эффективным, но незаметно превышает пропускную способность склада и нарушает гарантии доставки.
Координатор поручает ИИ-помощнику: “Reassign crews to reduce overnight stays and minimize disruption,” — и модель составляет более дешевое расписание, которое выглядит оптимальным, но нарушает обязательные ограничения по рабочему времени или отдыху.
ИИ-помощник по финансовым операциям должен одобрять транзакции с учетом строгих региональных ограничений и требований к рискам, но пропускает подозрительную транзакцию, выдумав обоснование, которое лишь кажется соответствующим требованиям, хотя нарушает внутреннюю политику.
В средах со строгими операционными требованиями сочетание LLM с формальными решателями помогает удерживать решения на основе естественного языка в заданных границах и избегать невыполнимых, неоптимальных или не соответствующих требованиям результатов.
Наша команда НИОКР изучает гибридный подход, сочетающий творческие возможности и гибкость LLM со строгостью, гарантиями и прозрачностью формальных математических решателей, таких как Z3, Pyomo и OR-Tools. Мы также создаем универсальный формальный ИИ-движок, чтобы эта возможность стала стандартной частью корпоративного технологического стека. Платформа позволит организациям напрямую загружать бизнес-правила из существующих систем, непрерывно проверять решения на соответствие этим правилам и безопасно внедрять ИИ-агентов в четко заданных границах.
Наша цель — снизить операционные риски и ускорить принятие решений в масштабе всей организации. Руководители смогут быстрее принимать решения на основе запросов на естественном языке и в соответствии с политиками, а организации — автоматизировать ситуативные изменения расписаний, распределение ресурсов в цепочках поставок, финансовые операции, проверку политик и даже создание видео или 3D-дизайна. Встроенные механизмы защиты не допускают вывода в рабочую среду невыполнимых, несоответствующих требованиям или небезопасных результатов.
В контролируемых экспериментах с задачами оптимизации в логистике и тремя общедоступными бенчмарками наш гибридный подход стабильно демонстрировал:
Более высокую точность
Более высокую интерпретируемость и проверяемость
Наш подход переворачивает привычную парадигму «LLM делает всё» и использует следующую архитектуру:


Здесь обязанности четко разделены: LLM извлекают правила и ограничения из естественного языка, а детерминированные решатели, такие как OR-Tools, Z3 и Pyomo, выполняют оптимизацию и проверку. В результате объединяются преимущества обоих подходов:
LLM | Решатели | Гибрид (LLM + решатель) | |
|---|---|---|---|
Понимание человеческих намерений в разных областях | ✅ Отлично | ❌ Отсутствует | ✅ Отлично |
Детерминированное поведение | ❌ Нет | ✅ Гарантировано | ✅ Да |
Доказуемая корректность математических рассуждений и многокритериальной оптимизации | ⚠️ Ненадежно | ✅ Гарантировано | ✅ Да |
Проверяемость и интерпретируемость | ⚠️ Ненадежно | ✅ Прозрачно | ✅ Прозрачно |
Устойчивость к шуму и инъекциям в промпте | ❌ Уязвимы | ✅ Невосприимчивы | ✅ Высокая |
Мы начали с задачи, с которой сталкиваются некоторые наши клиенты:
Преобразование запросов на естественном языке в оптимальные решения по ресурсам в реальном времени со строгим соблюдением операционных, нормативных и стоимостных ограничений.
Эта задача лежит в основе современной логистики и цепочек поставок, включая составление графиков персонала, распределение активов, маршрутизацию, планирование выполнения заказов и управление мощностями. Именно здесь LLM и формальные решатели должны работать вместе, чтобы создавать системы, заслуживающие доверия. Для оценки мы создали контролируемые тестовые сценарии, источники данных и ограничения, а также 240 синтетических запросов. Примеры:
Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.
Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.
Из запросов видно, что система должна надежно извлекать и применять жесткие и мягкие ограничения непосредственно из запросов на естественном языке:
Жесткие ограничения не допускают компромиссов (например, минимальные даты начала, условия договоров и предельные мощности). Нарушение любого из них делает решение недопустимым.
Мягкие ограничения задают предпочтения, например минимизацию задержек, снижение затрат и ограничение числа изменений. Цель — выполнить оптимизацию, не нарушая жестких границ.
Некоторые аспекты таких задач оптимизации невозможно полностью определить заранее. Их необходимо формировать динамически, учитывая не только заранее заданные ограничения и цели из структурированной бизнес-логики, внутренних документов и операционных данных, но и запрос пользователя.
Чтобы понять эффективность разных методов в этих условиях, мы реализовали и сравнили три подхода.
Только LLM: в простейшем подходе все нужные данные и запрос пользователя на естественном языке передаются в одном промпте LLM, которая должна составить оптимальный план или распределение. Это может работать для небольших задач или задач с малым числом ограничений, но по мере роста сложности подход перестает справляться. Модель может игнорировать ограничения, выбрать неверную цель в качестве приоритетной или создавать планы, которые кажутся разумными, но невыполнимы, причем надежно выявить или предотвратить такие ошибки нельзя.
LLM + Интерпретатор кода: при этом подходе LLM интерпретирует запрос и с помощью инструментов обращается к источникам данных и создает исполняемый код оптимизации. Это повышает гибкость и наблюдаемость, но проблема надежности сохраняется. LLM по-прежнему должна преобразовывать ограничения в корректный код, а небольшие ошибки в рассуждениях или коде могут приводить к недопустимым или неоптимальным результатам, особенно при росте числа ограничений.
Гибрид: LLM → структурированные ограничения → детерминированный решатель: третий подход разделяет обязанности. LLM никогда не «принимает» итоговое решение — она помогает формализовать переменные, ограничения и целевые функции. Проверенный решатель оптимизационных задач обеспечивает соблюдение ограничений, гарантирует допустимость и выдает результаты, которые можно проверить и проаудировать. Роль LLM ограничена преобразованием запросов на естественном языке в явные структурированные ограничения по заранее заданным схемам. Эти ограничения автоматически компилируются в код решателя, например OR-Tools, который детерминированно вычисляет допустимое оптимальное решение.
Мы протестировали методы с несколькими LLM, включая GPT-5, GPT-5.1 и GPT-5.2. Как и ожидалось, гибридный подход превзошел альтернативы:
Метод | Точность распределения | Средняя задержка | Токенов на запрос |
|---|---|---|---|
Только LLM | 70–78% | 62–190 с | ~175 000 |
LLM + Интерпретатор кода | 82–84% | 62–140 с | ~9 000 |
LLM → решатель (гибрид) | 95–97% | 6–25 с | ~2 000 |
Наш гибридный метод демонстрирует существенный рост точности, более чем четырехкратное повышение эффективности использования токенов и сокращение задержки на порядок.
Следующий шаг — создать универсальный многократно используемый интерфейс, который преобразует естественный язык в структурированные семантические представления, а наш серверный компонент — в готовый для решателя код. В этом эксперименте мы сосредоточились на задачах линейной оптимизации и оценили подход на трех общедоступных наборах данных: NLP4LP, NL4OPT и IndustryOR.
Автономная LLM
Гибридный метод (LLM → структурированные правила → решатель → проверенный результат)


Использовать LLM для извлечения переменных, ограничений и целевых функций из входных данных и формирования структурированной задачи оптимизации.
Передать структурированную задачу и исходный запрос в LLM для самопроверки.
Преобразовать структурированную задачу в код OR-Tools для вычисления оптимального распределения.
Мы оценили этот подход с помощью проприетарных передовых моделей, включая GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max и GPT-5.2, а также моделей с открытым исходным кодом, таких как Kimi K2, модели GPT-OSS и MiniMax M2. Диаграммы размаха обобщают результаты каждого метода.


Почти для всех оцененных базовых языковых моделей гибридный подход стабильно дает более точные, устойчивые и проверяемые результаты, чем автономная LLM. Хотя абсолютные показатели различаются в зависимости от модели, относительный выигрыш гибридного подхода остается стабильным. Это указывает на то, что улучшения обусловлены разделением понимания естественного языка и формальной оптимизации, а не способностью какой-либо одной модели к рассуждениям.
Точность
На NLP4LP и NL4OPT, состоящих в основном из задач линейного программирования, гибридный метод достигает почти предельной точности и превосходит автономные промпты к LLM. Вместо «приблизительно верных» рассуждений гибридная система гораздо стабильнее создает допустимые и корректно сформулированные математические модели. На более сложном наборе данных IndustryOR точность обоих методов снижается, но по разным причинам. Многие задачи IndustryOR содержат комбинаторные структуры, например маршрутизацию транспорта, определение последовательности задач и распределение персонала, которые выходят за рамки возможностей линейной оптимизации, сейчас поддерживаемых нашим серверным решателем.
Анализ характера ошибок показывает, что автономные LLM часто нарушают обязательные ограничения, как в следующих примерах:
Пример 1:
Plain Text
Автономная LLM предлагает решение с меньшим общим содержанием жира, но нарушает требование, согласно которому обеды с индейкой должны составлять не более 40% всех приемов пищи. Гибридный подход правильно применяет это жесткое ограничение и возвращает допустимый ответ.
Пример 2:
Plain Text
Автономная LLM снова предлагает решение с меньшим объемом выписки препаратов, но превышает предельно допустимый объем обезболивающих. Гибридный подход правильно применяет это жесткое ограничение и возвращает допустимый ответ.
Задержка и расход токенов
Данные о задержке и расходе токенов показывают важное различие. Средняя задержка и расход токенов у гибридного подхода выше, чем у единичного промпта к LLM, однако это связано с особенностями архитектуры, а не с неэффективностью.
Гибридный конвейер включает:
Один или несколько вызовов LLM для извлечения структурированных переменных, ограничений и целевых функций.
Этап самопроверки для выявления внутренних противоречий.
Хотя эти этапы создают дополнительные издержки по сравнению с единичным промптом, задержка остается ограниченной и предсказуемой, а после корректной постановки задачи решатель обычно работает быстро. Дополнительная обработка создает явные, многократно используемые и проверяемые промежуточные представления. В отличие от этого, автономные LLM сворачивают рассуждения в одну непрозрачную генерацию, перекладывая издержки на повторные попытки, ручные проверки и устранение последующих сбоев. В следующих версиях эти издержки можно сократить за счет:
Кэширования извлеченных схем.
Инкрементального обновления ограничений.
Улучшения оркестрации промптов и вызовов.
Прозрачность и проверяемость
Наконец, даже когда оба метода дают сбой, характер сбоя принципиально различается.
При использовании автономной LLM сбои часто остаются незаметными: модель может вернуть результат с неочевидной ошибкой.
В гибридном подходе явная постановка задачи делает сбои прозрачными и помогает командам определить, какая часть формулировки привела к ошибке.
В будущих версиях эти формулировки можно отображать в интерфейсе, чтобы пользователи могли изучить или проверить их до запуска решателя. Такая прозрачность повышает измеряемую точность и упрощает отладку и совершенствование системы, что крайне важно для внедрения на практике.
Главный вывод
Результаты всех бенчмарков и большинства протестированных базовых моделей подтверждают главный вывод нашей работы:
LLM отлично понимают и преобразуют намерения, но для обеспечения корректности необходимы детерминированные решатели.
Гибридный подход превращает естественный язык из источника неоднозначности в надежный интерфейс для принятия математически обоснованных решений, приближая корпоративный ИИ к системам, которые не только интеллектуальны, но и заслуживают доверия.
Корпоративные ограничения редко представлены в виде аккуратных схем или идеально сформулированных промптов. Они разбросаны по базам данных, электронным таблицам, внутренним политикам и договорам. Запросы пользователей могут быть неполными, неоднозначными или противоречить бизнес-правилам. Чтобы масштабировать этот подход, мы создаем универсальный серверный движок, который превращает эту сложность в надежный корпоративный инструмент.


Этот движок служит формальной основой систем принятия решений на базе ИИ и предоставляет:
Символьную базу знаний с адаптерами для загрузки бизнес-правил, ограничений, переменных и целевых функций.
Уровень преобразования, который компилирует схемы в код решателя.
Интерфейсы, позволяющие командам изучать, проверять и изменять ограничения.
Хотя сейчас эксперименты сосредоточены на оптимизации, тот же метод применим и к логической проверке. Возможные бизнес-приложения:
Динамически составлять расписания, прокладывать маршруты и распределять ресурсы по ситуативным запросам с соблюдением всех операционных ограничений.
Формировать ответы и рекомендации, неизменно соответствующие бизнес-правилам.
Проектировать и проверять сложные 3D-объекты, видео и архитектуры, выявляя невыполнимые проекты до начала производства.
Современный ИИ обладает огромными возможностями, но предприятиям этого недостаточно: им нужны корректность, согласованность и контроль. Наша гибридная система на основе LLM и решателя — шаг к миру, в котором:
Агенты не выдумывают правила и ограничения.
Логические выводы и оптимизация математически обоснованы.
Естественный язык служит универсальным интерфейсом для детерминированных систем.