Główna nawigacja

Łączenie LLM z formalnymi solverami na potrzeby wiarygodnych decyzji AI

Architektura hybrydowa łączy elastyczność LLM z deterministycznymi solverami, umożliwiając podejmowanie wiarygodnych i weryfikowalnych decyzji biznesowych.

Duże modele językowe (LLM) poczyniły niezwykłe postępy w rozumieniu języka naturalnego, generowaniu płynnych odpowiedzi oraz tworzeniu zupełnie nowych doświadczeń klientów i pracowników. Ponieważ jednak LLM są z natury stochastyczne, ich wykorzystanie do złożonego rozumowania numerycznego lub logicznego daje ograniczone gwarancje zgodności bądź optymalności wyników. Na przykład:

  • Kierownik mówi asystentowi AI do planowania: “Ship as much as possible next week while keeping costs low,” a system opracowuje ambitny plan, który wygląda na efektywny, lecz po cichu przekracza przepustowość magazynu i narusza gwarancje dostaw.

  • Koordynator mówi asystentowi AI: “Reassign crews to reduce overnight stays and minimize disruption,” a model tworzy tańszy harmonogram, który wygląda na optymalny, lecz narusza obowiązkowe limity czasu pracy lub wymogi dotyczące odpoczynku.

  • Asystent AI ds. operacji finansowych musi zatwierdzać transakcje zgodnie ze ścisłymi ograniczeniami regionalnymi i dotyczącymi ryzyka, ale akceptuje podejrzaną transakcję, wymyślając uzasadnienie, które brzmi zgodnie z zasadami, choć narusza wewnętrzną politykę.

W środowiskach o rygorystycznych wymaganiach operacyjnych połączenie LLM z solverami formalnymi pomaga zagwarantować, że decyzje podejmowane na podstawie języka naturalnego mieszczą się w określonych granicach i nie prowadzą do niewykonalnych, nieoptymalnych ani niezgodnych wyników.

Nasz zespół badawczo-rozwojowy analizuje podejście hybrydowe, które łączy kreatywność i elastyczność LLM z rygorem, gwarancjami i przejrzystością formalnych solverów matematycznych, takich jak Z3, Pyomo i OR-Tools. Tworzymy również uniwersalny formalny silnik AI, aby ta funkcja stała się standardową częścią stosu technologicznego przedsiębiorstw. Platforma umożliwi organizacjom pobieranie reguł biznesowych bezpośrednio z istniejących systemów, ciągłe weryfikowanie decyzji pod kątem tych reguł oraz bezpieczne wdrażanie agentów AI w jasno określonych granicach.

Naszą wizją jest ograniczenie ryzyka operacyjnego przy jednoczesnym przyspieszeniu podejmowania decyzji na dużą skalę. Liderzy szybciej uzyskują zgodne z zasadami decyzje na podstawie danych w języku naturalnym, a organizacje mogą automatyzować doraźne zmiany w harmonogramach, przydziale zasobów łańcucha dostaw, operacjach finansowych, weryfikacji zasad, a nawet projektowaniu filmów i obiektów 3D. Wbudowane zabezpieczenia nie dopuszczają do wdrożenia niewykonalnych, niezgodnych lub niebezpiecznych wyników.

W kontrolowanych eksperymentach obejmujących problemy optymalizacyjne z dziedziny logistyki oraz trzy publiczne testy porównawcze nasze podejście hybrydowe konsekwentnie wykazywało:

  • Większą dokładność

  • Większą interpretowalność i audytowalność

Architektura hybrydowa

Nasze podejście odwraca typowy paradygmat „LLM robi wszystko” i opiera się na następującym projekcie:

Schemat pokazujący, jak duże modele językowe i deterministyczne solvery łączą rozumienie języka naturalnego z weryfikowalną optymalizacją.

Podejście to wyraźnie rozdziela obowiązki: LLM wyodrębniają reguły i ograniczenia z języka naturalnego, natomiast deterministyczne solvery, takie jak OR-Tools, Z3 i Pyomo, odpowiadają za optymalizację i weryfikację. Wynik łączy zalety obu podejść:

LLM

Solvery

Hybryda (LLM + solver)

Rozumienie intencji człowieka w różnych dziedzinach

✅ Doskonałe

❌ Brak

✅ Doskonałe

Działanie deterministyczne

❌ Nie

✅ Gwarantowane

✅ Tak

Możliwa do udowodnienia poprawność rozumowania matematycznego i optymalizacji przy wielu ograniczeniach

⚠️ Zawodne

✅ Gwarantowane

✅ Tak

Audytowalność i interpretowalność

⚠️ Zawodne

✅ Przejrzyste

✅ Przejrzyste

Odporność na zakłócenia i ataki typu prompt injection

❌ Podatne

✅ Odporne

✅ Wysoka

Ścieżka eksperymentalna 1: logistyka i przydzielanie pracowników

Dziedzina problemu

Zaczęliśmy od wyzwania, z którym mierzą się niektórzy nasi klienci:

Przekształcanie próśb w języku naturalnym w optymalne decyzje dotyczące zasobów podejmowane w czasie rzeczywistym, przy rygorystycznym egzekwowaniu ograniczeń operacyjnych, kosztowych i wynikających z zasad.

Wyzwanie to leży u podstaw współczesnej logistyki i łańcuchów dostaw, w tym planowania pracy, przydzielania zasobów, wyznaczania tras, planowania realizacji zamówień i zarządzania przepustowością. To również obszar, w którym LLM i formalne solvery muszą współpracować, aby tworzyć godne zaufania systemy. Na potrzeby oceny przygotowaliśmy kontrolowane scenariusze testowe, źródła danych i ograniczenia oraz 240 syntetycznych zapytań. Przykłady:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Z zapytań wynika, że system musi niezawodnie wyodrębniać i egzekwować twarde oraz miękkie ograniczenia bezpośrednio z próśb w języku naturalnym:

  • Twarde ograniczenia nie podlegają negocjacji (np. najwcześniejsze daty rozpoczęcia, warunki umów i limity przepustowości). Naruszenie choćby jednego z nich unieważnia rozwiązanie.

  • Miękkie ograniczenia opisują preferencje, takie jak minimalizowanie opóźnień, obniżanie kosztów i ograniczanie zmian. Celem jest optymalizacja bez przekraczania twardych granic.

Niektórych aspektów tych problemów optymalizacyjnych nie można w pełni zdefiniować z góry. Muszą być tworzone dynamicznie nie tylko na podstawie uprzednio zdefiniowanych ograniczeń i celów wynikających z ustrukturyzowanej logiki biznesowej, dokumentów wewnętrznych i danych operacyjnych, ale także z prośby użytkownika.

Oceniane podejścia

Aby zrozumieć skuteczność różnych technik w tym środowisku, wdrożyliśmy i porównaliśmy trzy podejścia.

  1. Czysty LLM: Najprostsze podejście przekazuje wszystkie istotne dane i prośbę użytkownika w języku naturalnym w jednym poleceniu dla LLM, który ma opracować optymalny plan lub przydział. Może to działać w przypadku małych lub luźno ograniczonych problemów, ale zawodzi wraz ze wzrostem ich złożoności. Model może ignorować ograniczenia, nadawać priorytet niewłaściwemu celowi lub tworzyć plany, które brzmią rozsądnie, lecz są niewykonalne, bez niezawodnego sposobu wykrywania awarii lub zapobiegania im.

  2. LLM + Interpreter kodu: W tym podejściu LLM interpretuje prośbę i za pomocą narzędzi uzyskuje dostęp do źródeł danych oraz generuje wykonywalny kod optymalizacyjny. Zwiększa to elastyczność i obserwowalność, ale niezawodność nadal stanowi problem. LLM nadal musi przełożyć ograniczenia na poprawny kod, a drobne błędy rozumowania lub programowania mogą prowadzić do nieprawidłowych bądź nieoptymalnych wyników, szczególnie przy rosnącej liczbie ograniczeń.

  3. Hybryda: LLM → ustrukturyzowane ograniczenia → deterministyczny solver: Trzecie podejście rozdziela obowiązki. LLM nigdy nie „decyduje” o wyniku — pomaga sformalizować zmienne, ograniczenia i cele. Sprawdzony solver optymalizacyjny egzekwuje ograniczenia, gwarantuje wykonalność i generuje wyniki, które można zweryfikować i poddać audytowi. Rola LLM ogranicza się do przekładania próśb w języku naturalnym na jawne, ustrukturyzowane ograniczenia przy użyciu uprzednio zdefiniowanych schematów. Ograniczenia te są automatycznie kompilowane do kodu solvera, takiego jak OR-Tools, który deterministycznie wyznacza wykonalne i optymalne rozwiązanie.

Wyniki

Przetestowaliśmy metody z użyciem kilku LLM, w tym GPT-5, GPT-5.1 i GPT-5.2. Zgodnie z oczekiwaniami podejście hybrydowe przewyższyło alternatywy:

Metoda

Dokładność przydziału

Średnie opóźnienie

Tokeny użyte na zapytanie

Czysty LLM

70–78%

62–190 s

~175 000

LLM + Interpreter kodu

82–84%

62–140 s

~9000

LLM → solver (hybryda)

95–97%

6–25 s

~2000

Nasza metoda hybrydowa zapewnia znaczny wzrost dokładności, ponad czterokrotnie większą efektywność wykorzystania tokenów oraz dziesięciokrotne skrócenie opóźnienia.

Ścieżka eksperymentalna 2: optymalizacja ogólnego przeznaczenia na podstawie języka naturalnego

Kolejnym krokiem jest stworzenie uniwersalnego interfejsu wielokrotnego użytku, który przekształca język naturalny w ustrukturyzowane reprezentacje semantyczne, tłumaczone przez nasz backend na kod gotowy dla solvera. W tym eksperymencie skupiliśmy się na problemach optymalizacji liniowej i oceniliśmy podejście na podstawie trzech publicznych zbiorów danych (NLP4LP, NL4OPT i IndustryOR).

Oceniane podejścia

  1. Samodzielny LLM

  2. Metoda hybrydowa (LLM → ustrukturyzowane reguły → solver → zweryfikowany wynik)

Schemat hybrydowego procesu prowadzącego od próśb w języku naturalnym przez ustrukturyzowane ograniczenia i deterministyczne rozwiązanie do zweryfikowanego wyniku.

  • Użycie LLM do wyodrębnienia zmiennych, ograniczeń i celów z danych wejściowych oraz sformułowania ustrukturyzowanego problemu optymalizacyjnego.

  • Przekazanie ustrukturyzowanego problemu i pierwotnej prośby do LLM w celu samodzielnej weryfikacji.

  • Przełożenie ustrukturyzowanego problemu na kod OR-Tools w celu obliczenia optymalnego przydziału.

Wyniki

Oceniliśmy to podejście z użyciem własnych pionierskich modeli, w tym GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Maks i GPT-5.2, oraz modeli open source, takich jak Kimi K2, modele GPT-OSS i MiniMax M2. Wykresy pudełkowe podsumowują wyniki każdej metody.

Wykres porównujący samodzielne duże modele językowe i hybrydowe podejścia oparte na solverach w testach optymalizacyjnych.

W przypadku niemal wszystkich ocenianych bazowych modeli językowych podejście hybrydowe konsekwentnie zapewnia dokładniejsze, stabilniejsze i łatwiejsze do zweryfikowania wyniki niż samodzielny LLM stanowiący punkt odniesienia. Choć bezwzględna skuteczność różni się zależnie od modelu, względne korzyści z podejścia hybrydowego pozostają stałe. Sugeruje to, że poprawa wynika z oddzielenia rozumienia języka naturalnego od formalnej optymalizacji, a nie z polegania na zdolności rozumowania jednego konkretnego modelu.

Dokładność

W testach NLP4LP i NL4OPT, obejmujących głównie problemy programowania liniowego, metoda hybrydowa osiąga dokładność bliską maksymalnej i przewyższa samodzielne wykonywanie poleceń przez LLM. Zamiast generować „w przybliżeniu poprawne” rozumowanie system hybrydowy znacznie częściej tworzy prawidłowe i poprawnie sformułowane modele matematyczne. W trudniejszym zbiorze danych IndustryOR dokładność obu metod spada, lecz z innych powodów. Wiele problemów IndustryOR obejmuje struktury kombinatoryczne, takie jak wyznaczanie tras pojazdów, ustalanie kolejności zadań i przydzielanie pracowników, które wykraczają poza możliwości optymalizacji liniowej obsługiwane obecnie przez backend naszego solvera.

Analiza rodzajów błędów pokazuje, że samodzielne LLM często naruszają wymagane ograniczenia, co ilustrują poniższe przykłady:

Przykład 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Samodzielny LLM tworzy rozwiązanie o niższej całkowitej zawartości tłuszczu, ale narusza wymóg, zgodnie z którym dania z indykiem mogą stanowić maksymalnie 40% posiłków. Podejście hybrydowe prawidłowo egzekwuje to twarde ograniczenie i zwraca poprawną odpowiedź.

Przykład 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Samodzielny LLM ponownie tworzy rozwiązanie z wcześniejszym wypisem, ale przekracza maksymalny dozwolony limit leków przeciwbólowych. Podejście hybrydowe prawidłowo egzekwuje to twarde ograniczenie i zwraca poprawną odpowiedź.

Opóźnienie i użycie tokenów

Dane dotyczące opóźnień i użycia tokenów ujawniają istotną różnicę. Podejście hybrydowe cechuje się większym średnim opóźnieniem i użyciem tokenów niż pojedyncze polecenie dla LLM, ale wynika to z decyzji architektonicznych, a nie z nieefektywności.

Proces hybrydowy obejmuje:

  1. Co najmniej jedno wywołanie LLM w celu wyodrębnienia ustrukturyzowanych zmiennych, ograniczeń i celów.

  2. Etap samodzielnej weryfikacji pozwalający wykryć wewnętrzne niespójności.

Choć kroki te zwiększają narzut w porównaniu z pojedynczym poleceniem, opóźnienie pozostaje ograniczone i przewidywalne, a po prawidłowym sformułowaniu problemu solver zazwyczaj działa szybko. Dodatkowa praca pozwala tworzyć jawne, wielokrotnego użytku i audytowalne reprezentacje pośrednie. Natomiast samodzielne LLM zamykają rozumowanie w jednym nieprzejrzystym procesie generowania, przenosząc koszty na ponowne próby, ręczne kontrole i późniejsze awarie. W przyszłych wersjach narzut ten można ograniczyć przez:

  • Buforowanie wyodrębnionych schematów.

  • Przyrostowe aktualizowanie ograniczeń.

  • Usprawnienie organizacji poleceń i wywołań.

Przejrzystość i audytowalność

Co więcej, nawet gdy obie metody zawodzą, charakter awarii jest zasadniczo inny.

  • W przypadku samodzielnego LLM awarie często pozostają niezauważone: model może zwrócić wynik zawierający trudny do wykrycia błąd.

  • W podejściu hybrydowym jawne sformułowanie problemu uwidacznia awarie i pomaga zespołom ustalić, która część sformułowania spowodowała błąd.

Przyszłe wersje mogłyby prezentować te sformułowania w interfejsie, umożliwiając użytkownikom ich audyt lub weryfikację przed uruchomieniem solvera. Ta przejrzystość zwiększa mierzoną dokładność oraz ułatwia debugowanie i udoskonalanie systemu, co ma kluczowe znaczenie przy rzeczywistych wdrożeniach.

Najważniejszy wniosek

Wyniki ze wszystkich testów porównawczych i większości bazowych modeli potwierdzają główny wniosek z naszej pracy:

LLM świetnie rozumieją i przekładają intencje, lecz deterministyczne solvery są niezbędne do zapewnienia poprawności.

Podejście hybrydowe przekształca język naturalny ze źródła niejednoznaczności w niezawodny interfejs do podejmowania matematycznie uzasadnionych decyzji, przybliżając biznesowe systemy AI, które są nie tylko inteligentne, ale również godne zaufania.

Co dalej: uniwersalny formalny silnik AI dla przedsiębiorstw

Ograniczenia biznesowe rzadko występują w przejrzystych schematach lub idealnie sformułowanych poleceniach. Są rozproszone po bazach danych, arkuszach kalkulacyjnych, wewnętrznych zasadach i umowach. Prośby użytkowników mogą być niepełne, niejednoznaczne lub niezgodne z regułami biznesowymi. Aby zastosować to podejście na dużą skalę, tworzymy uniwersalny silnik backendowy, który przekształca tę złożoność w niezawodne rozwiązanie dla przedsiębiorstw.

Schemat formalnego silnika AI dla przedsiębiorstw, obejmujący reguły biznesowe, tłumaczenie na potrzeby solvera i audytowalne podejmowanie decyzji.

Platforma

Silnik ten stanowi formalny fundament systemów decyzyjnych opartych na AI i zapewnia:

  • Symboliczną bazę wiedzy z adapterami pobierającymi reguły biznesowe, ograniczenia, zmienne i cele.

  • Warstwę translacji, która kompiluje schematy do kodu solvera.

  • Interfejsy umożliwiające zespołom przeglądanie, audytowanie i modyfikowanie ograniczeń.

Obszary zastosowań

Choć eksperymenty koncentrują się obecnie na optymalizacji, tę samą metodę można rozszerzyć na weryfikację logiczną. Potencjalne zastosowania biznesowe obejmują:

  • Doraźne dynamiczne planowanie, wyznaczanie tras i przydzielanie zasobów z zachowaniem wszystkich ograniczeń operacyjnych.

  • Generowanie odpowiedzi i rekomendacji, które zawsze są zgodne z regułami biznesowymi.

  • Projektowanie i sprawdzanie złożonych obiektów 3D, filmów oraz architektur, aby wykrywać niewykonalne projekty przed produkcją.

Podsumowanie

Dzisiejsza AI ma ogromne możliwości, ale przedsiębiorstwa potrzebują czegoś więcej: poprawności, spójności i kontroli. Nasz hybrydowy system łączący LLM z solverem jest krokiem w stronę świata, w którym:

  • Agenci nie wymyślają nieistniejących reguł ani ograniczeń.

  • Dedukcja logiczna i optymalizacja są poprawne matematycznie.

  • Język naturalny pełni funkcję uniwersalnego interfejsu do systemów deterministycznych.

Autor

Peng Seng Ang