Pangunahing nabigasyon

Pagsasama ng mga LLM at formal solver para sa maaasahang desisyon ng AI

Pinagsasama ng hybrid na architecture ang flexibility ng LLM at mga deterministic solver upang makagawa ng maaasahan at mabeberipikang desisyon sa enterprise.

Malaki ang naging pagsulong ng mga LLM sa pag-unawa sa natural na wika, pagbuo ng matatas na tugon, at pagbibigay-daan sa ganap na bagong karanasan para sa mga customer at empleyado. Gayunman, dahil likas na stochastic ang mga LLM, limitado ang katiyakang magiging sumusunod sa mga tuntunin o optimal ang mga output ng mga ito kapag ginamit sa masalimuot na numerikal o lohikal na pangangatwiran. Halimbawa:

  • Sinabi ng isang manager sa AI planning assistant, “Ship as much as possible next week while keeping costs low,” at nagbigay ang system ng agresibong planong mukhang episyente ngunit palihim na lumalampas sa kapasidad ng warehouse at hindi tumutupad sa mga garantiya sa paghahatid.

  • Sinabi ng isang coordinator sa AI assistant, “Reassign crews to reduce overnight stays and minimize disruption,” at gumawa ang modelo ng iskedyul na mas mababa ang gastos at mukhang optimal ngunit lumalabag sa mga obligadong limitasyon sa oras ng duty o pahinga.

  • Kailangang mag-apruba ng AI assistant para sa mga operasyong pinansyal ng mga transaksyon alinsunod sa mahihigpit na panrehiyon at pang-risk na limitasyon, ngunit inaprubahan nito ang isang kahina-hinalang transaksyon sa pamamagitan ng pag-imbento ng katuwirang tila sumusunod sa mga tuntunin kahit lumalabag ito sa panloob na patakaran.

Sa mga kapaligirang may mahihigpit na kinakailangan sa operasyon, nakatutulong ang pagsasama ng mga LLM at formal solver upang matiyak na nananatili sa itinakdang hangganan ang mga desisyong batay sa natural na wika at maiwasan ang mga resultang hindi maisasagawa, suboptimal, o hindi sumusunod sa mga tuntunin.

Sinisiyasat ng aming R&D team ang isang hybrid na pamamaraang pinagsasama ang pagkamalikhain at flexibility ng mga LLM sa higpit, mga garantiya, at transparency ng mga formal mathematical solver gaya ng Z3, Pyomo, at OR-Tools. Bumubuo rin kami ng reusable na formal AI engine upang maging karaniwang bahagi ng enterprise technology stack ang kakayahang ito. Magbibigay-daan ang platform sa mga organisasyon na direktang kunin ang mga tuntunin sa negosyo mula sa kanilang mga kasalukuyang system, tuloy-tuloy na beripikahin ang mga desisyon batay sa mga tuntuning iyon, at ligtas na mag-deploy ng mga AI agent sa loob ng malinaw na itinakdang hangganan.

Ang aming bisyon ay bawasan ang panganib sa operasyon habang pinabibilis ang malawakang pagdedesisyon. Mas mabilis na makapagdedesisyon ang mga lider mula sa mga input sa natural na wika habang sumusunod sa patakaran, at maaaring i-automate ng mga organisasyon ang mga ad hoc na pagbabago sa pag-iiskedyul, paglalaan ng mga resource sa supply chain, mga operasyong pinansyal, pagberipika ng patakaran, at maging sa video o 3D design. Pinipigilan ng mga built-in na safeguard na umabot sa production ang mga resultang hindi maisasagawa, hindi sumusunod sa mga tuntunin, o hindi ligtas.

Sa mga kontroladong eksperimento sa mga problema sa optimization na katulad ng sa logistics at sa tatlong pampublikong benchmark, palaging ipinakita ng aming hybrid na pamamaraan ang sumusunod:

  • Mas mataas na accuracy

  • Mas madaling maipaliwanag at ma-audit

Ang hybrid na architecture

Binabaligtad ng aming pamamaraan ang karaniwang paradigm na “LLM ang gumagawa ng lahat” at sa halip ay sumusunod sa disenyong ito:

Diagram na naghahambing kung paano pinagsasama ng mga LLM at deterministic solver ang pag-unawa sa natural na wika at mabeberipikang optimization.

Malinaw na pinaghihiwalay ng pamamaraang ito ang mga responsibilidad: kinukuha ng mga LLM ang mga tuntunin at limitasyon mula sa natural na wika, habang ang mga deterministic solver gaya ng OR-Tools, Z3, at Pyomo ang nangangasiwa sa optimization at pagberipika. Pinagsasama ng resulta ang mga kalakasan ng dalawang pamamaraan:

Mga LLM

Mga solver

Hybrid (LLM + Solver)

Pag-unawa sa layunin ng tao sa iba’t ibang domain

✅ Napakahusay

❌ Wala

✅ Napakahusay

Deterministic na pagkilos

❌ Hindi

✅ Garantisado

✅ Oo

Mapatutunayang tama sa matematikal na pangangatwiran at optimization sa maraming limitasyon

⚠️ Hindi matatag

✅ Garantisado

✅ Oo

Kakayahang ma-audit at maipaliwanag

⚠️ Hindi matatag

✅ Malinaw

✅ Malinaw

Resistensya sa prompt noise at injection

❌ Bulnerable

✅ Imyun

✅ Malakas

Experimental track 1: logistics at pagtatalaga ng workforce

Ang saklaw ng problema

Nagsimula kami sa isang hamong kinakaharap ng ilan sa aming mga kliyente:

Gawing optimal at real-time na mga desisyon sa resource ang mga kahilingan sa natural na wika habang mahigpit na ipinapatupad ang mga limitasyon sa operasyon, patakaran, at gastos.

Mahalaga ang hamong ito sa makabagong logistics at mga supply chain, kabilang ang pag-iiskedyul ng workforce, paglalaan ng asset, pagruruta, fulfillment planning, at pamamahala ng kapasidad. Dito rin kailangang magtulungan ang mga LLM at formal solver upang makabuo ng mga mapagkakatiwalaang system. Para sa aming pagsusuri, bumuo kami ng mga kontroladong test scenario, source ng data, at limitasyon, kasama ang 240 synthetic query. Kabilang sa mga halimbawa ang:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Makikita sa mga query na kailangang maaasahang kunin at ipatupad ng system ang mga hard at soft constraint nang direkta mula sa mga kahilingan sa natural na wika:

  • Hindi maaaring ikompromiso ang mga hard constraint (hal., pinakamaagang petsa ng pagsisimula, mga tuntunin sa kontrata, at maximum na kapasidad). Kapag nilabag ang kahit isa sa mga ito, magiging invalid ang solusyon.

  • Kinakatawan ng mga soft constraint ang mga preference, gaya ng pagbabawas ng pagkaantala at gastos at paglilimita ng mga pagbabago. Layunin nitong mag-optimize nang hindi lumalampas sa mga hard boundary.

Hindi ganap na matutukoy nang maaga ang ilang aspeto ng mga problemang ito sa optimization. Kailangang dynamic na buuin ang mga ito gamit hindi lamang ang mga paunang itinakdang limitasyon at objective mula sa structured na business logic, panloob na dokumento, at operational data, kundi pati ang kahilingan ng user.

Ang mga pamamaraang sinuri namin

Upang maunawaan ang performance ng iba’t ibang technique sa sitwasyong ito, ipinatupad at inihambing namin ang tatlong pamamaraan.

  1. Purong LLM: Sa pinakasimpleng pamamaraan, ipinapasa ang lahat ng nauugnay na data at kahilingan ng user sa natural na wika sa iisang LLM prompt, na inaatasang gumawa ng optimal na plano o paglalaan. Bagama’t maaari itong gumana sa maliliit na problema o sa mga kakaunti ang limitasyon, nabibigo ito habang tumataas ang pagiging masalimuot. Maaaring balewalain ng modelo ang mga limitasyon, unahin ang maling objective, o gumawa ng mga planong tila makatwiran ngunit hindi maisasagawa, nang walang maaasahang paraan upang matukoy o maiwasan ang mga failure.

  2. LLM + Code Interpreter: Sa pamamaraang ito, binibigyang-kahulugan ng LLM ang kahilingan at gumagamit ng mga tool upang ma-access ang mga source ng data at makabuo ng executable na optimization code. Nagdaragdag ito ng flexibility at observability, ngunit nananatiling problema ang reliability. Kailangan pa ring isalin ng LLM ang mga limitasyon sa tamang code, at ang maliliit na error sa pangangatwiran o coding ay maaaring magbunga ng invalid o suboptimal na resulta, lalo na habang dumarami ang mga limitasyon.

  3. Hybrid: LLM → structured constraints → deterministic solver: Pinaghihiwalay ng ikatlong pamamaraan ang mga responsibilidad. Hindi kailanman “nagpapasya” ang LLM sa resulta; tumutulong itong gawing formal ang mga variable, limitasyon, at objective. Ipinapatupad ng subok na optimization solver ang mga limitasyon, ginagarantiyahan ang feasibility, at gumagawa ng mga resultang mabeberipika at maa-audit. Limitado ang papel ng LLM sa pagsasalin ng mga kahilingan sa natural na wika bilang tahasan at structured na mga limitasyon gamit ang mga paunang itinakdang schema. Awtomatikong kino-compile ang mga limitasyong iyon bilang solver code, gaya ng OR-Tools, na deterministic na kumukuwenta ng feasible at optimal na solusyon.

Mga resulta

Sinubukan namin ang mga pamamaraan gamit ang ilang LLM, kabilang ang GPT-5, GPT-5.1, at GPT-5.2. Gaya ng inaasahan, nahigitan ng hybrid na pamamaraan ang mga alternatibo:

Pamamaraan

Accuracy ng pagtatalaga

Average na latency

Mga token na ginamit bawat query

Purong LLM

70–78%

62–190 s

~175,000

LLM + Code Interpreter

82–84%

62–140 s

~9,000

LLM → Solver (Hybrid)

95–97%

6–25 s

~2,000

Ipinapakita ng aming hybrid na pamamaraan ang malaking pagtaas sa accuracy, mahigit 4× na mas mahusay na paggamit ng token, at sampung ulit na pagbaba sa latency.

Experimental track 2: general-purpose optimization mula sa natural na wika

Ang susunod naming hakbang ay bumuo ng generalizable at reusable na interface na ginagawang structured semantic representation ang natural na wika, na maisasalin ng aming backend sa code na handa para sa solver. Para sa eksperimentong ito, tumuon kami sa mga problema sa linear optimization at sinuri ang pamamaraan gamit ang tatlong pampublikong dataset (NLP4LP, NL4OPT, at IndustryOR).

Ang mga pamamaraang sinuri namin

  1. Standalone na LLM

  2. Hybrid na pamamaraan (LLM → structured na mga tuntunin → solver → beripikadong output)

Diagram ng hybrid na workflow mula sa mga kahilingan sa natural na wika hanggang sa structured na mga limitasyon, deterministic na paglutas, at beripikadong output.

  • Gumamit ng LLM upang kunin sa input ang mga variable, limitasyon, at objective at bumuo ng structured na problema sa optimization.

  • Ipasa ang structured na problema at orihinal na kahilingan sa isang LLM para sa self-verification.

  • Isalin ang structured na problema sa OR-Tools code upang makuwenta ang optimal na pagtatalaga.

Mga resulta

Sinuri namin ang pamamaraang ito gamit ang mga proprietary frontier na modelo, kabilang ang GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max, at GPT-5.2, kasama ang mga open-source na modelo gaya ng Kimi K2, mga modelo ng GPT-OSS, at MiniMax M2. Ibinubuod ng mga box plot ang mga resulta para sa bawat pamamaraan.

Chart na naghahambing sa mga standalone na LLM at hybrid na pamamaraang gumagamit ng solver sa iba’t ibang optimization benchmark.

Sa halos lahat ng sinuring pinagbabatayang language model, palaging mas tumpak, matatag, at mabeberipika ang mga resulta ng hybrid na pamamaraan kaysa sa standalone na LLM baseline. Bagama’t nag-iiba ang absolute performance sa bawat modelo, nananatiling consistent ang relatibong pakinabang ng hybrid na pamamaraan. Ipinahihiwatig nito na nagmumula ang mga pagpapahusay sa paghihiwalay ng pag-unawa sa natural na wika at formal optimization, sa halip na umasa sa kakayahan sa pangangatwiran ng iisang modelo.

Accuracy

Sa NLP4LP at NL4OPT, na pangunahing binubuo ng mga problema sa linear programming, nakakamit ng hybrid na pamamaraan ang halos maximum na accuracy at nahihigitan ang standalone na LLM prompting. Sa halip na gumawa ng “halos tamang” pangangatwiran, mas consistent na bumubuo ang hybrid na system ng valid at maayos na mathematical formulation. Sa mas mahirap na IndustryOR dataset, bumababa ang accuracy ng parehong pamamaraan, ngunit magkaiba ang mga dahilan. Maraming problema sa IndustryOR ang may mga combinatorial structure, gaya ng pagruruta ng sasakyan, pagsasaayos ng pagkakasunod-sunod ng gawain, at pagtatalaga ng workforce, na lampas sa mga kakayahan sa linear optimization na kasalukuyang sinusuportahan ng aming solver backend.

Ipinapakita ng pagsusuri sa mga paraan ng pagkabigo na madalas lumalabag ang mga standalone na LLM sa mga kinakailangang limitasyon, gaya ng inilalarawan sa ibaba:

Halimbawa 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

Gumagawa ang standalone na LLM ng solusyong mas mababa ang kabuuang taba, ngunit nilalabag nito ang kinakailangang hindi dapat lumampas sa 40% ng mga pagkain ang turkey dinner. Tamang ipinapatupad ng hybrid na pamamaraan ang hard constraint na ito at nagbabalik ng valid na sagot.

Halimbawa 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

Muli, gumagawa ang standalone na LLM ng solusyong mas mababa ang discharge, ngunit lumalampas ito sa maximum na pinapayagang limitasyon sa gamot para sa pananakit. Tamang ipinapatupad ng hybrid na pamamaraan ang hard constraint na iyon at nagbabalik ng valid na sagot.

Latency at paggamit ng token

Ipinapakita ng data sa latency at paggamit ng token ang isang mahalagang pagkakaiba. Mas mataas ang average na latency at paggamit ng token ng hybrid na pamamaraan kaysa sa isang single-shot na LLM prompt, ngunit bunga ito ng mga desisyon sa architecture at hindi ng kawalan ng efficiency.

Kabilang sa hybrid pipeline ang:

  1. Isa o higit pang LLM call upang kunin ang mga structured variable, limitasyon, at objective.

  2. Isang hakbang ng self-verification upang matukoy ang mga panloob na inconsistency.

Bagama’t nagdaragdag ng overhead ang mga hakbang na ito kumpara sa iisang prompt, nananatiling limitado at predictable ang latency, at karaniwang mabilis ang pagpapatakbo ng solver kapag maayos nang nabuo ang problema. Lumilikha ang karagdagang prosesong ito ng tahasan, reusable, at naa-audit na mga intermediate representation. Sa kabaligtaran, isinisiksik ng mga standalone na LLM ang pangangatwiran sa iisang hindi malinaw na generation, kaya napupunta ang gastos sa mga retry, manual na pagsusuri, at mga failure sa downstream. Maaaring bawasan ng mga susunod na bersyon ang overhead na ito sa pamamagitan ng:

  • Pag-cache ng mga nakuhang schema.

  • Incremental na pag-update ng mga limitasyon.

  • Pagpapahusay ng orchestration ng mga prompt at call.

Transparency at kakayahang ma-audit

Panghuli, kahit sa mga kasong nabigo ang dalawang pamamaraan, ibang-iba ang mismong paraan ng pagkabigo.

  • Sa standalone na LLM, madalas na hindi kapansin-pansin ang mga failure: maaaring magbalik ang modelo ng resultang may banayad na pagkakamali.

  • Sa hybrid na pamamaraan, ginagawang malinaw ng tahasang formulation ng problema ang mga failure at natutulungan ang mga team na tukuyin kung aling bahagi ng formulation ang nagdulot ng error.

Maaaring ipakita ng mga susunod na bersyon ang mga formulation na ito sa isang interface upang ma-audit o maberipika ng mga user ang mga ito bago patakbuhin ang solver. Pinahuhusay ng transparency na ito ang nasusukat na accuracy at pinadadali ang pag-debug at pagpino sa system, na mahalaga sa aktuwal na deployment.

Pangunahing punto

Sa lahat ng benchmark at karamihan ng sinubukang pinagbabatayang modelo, pinagtitibay ng mga resulta ang pangunahing konklusyon ng aming gawain:

Mahusay ang mga LLM sa pag-unawa at pagsasalin ng layunin, ngunit mahalaga ang mga deterministic solver upang maipatupad ang kawastuhan.

Ginagawang maaasahang interface ng hybrid na pamamaraan ang natural na wika mula sa pagiging pinagmumulan ng kalabuan para sa pagdedesisyong matibay sa matematika, kaya mas napapalapit ang enterprise AI sa mga system na hindi lamang matalino kundi mapagkakatiwalaan din.

Susunod: isang reusable na formal AI engine para sa enterprise

Bihirang nasa maayos na mga schema o perpektong pagkakasulat na mga prompt ang mga limitasyon ng enterprise. Nakakalat ang mga ito sa mga database, spreadsheet, panloob na patakaran, at kontrata. Maaaring kulang, malabo, o salungat sa mga tuntunin sa negosyo ang mga kahilingan ng user. Upang magamit nang malawakan ang pamamaraang ito, bumubuo kami ng reusable na backend engine na ginagawang maaasahang kakayahan ng enterprise ang komplikasyong ito.

Diagram ng enterprise formal AI engine, kabilang ang mga tuntunin sa negosyo, pagsasalin para sa solver, at naa-audit na pagdedesisyon.

Ang platform

Sa pinakapundasyon nito, nagsisilbi ang engine na ito bilang formal na backbone ng mga system sa pagdedesisyong pinapagana ng AI, na nagbibigay ng:

  • Isang symbolic knowledge base na may mga adapter na kumukuha ng mga tuntunin sa negosyo, limitasyon, variable, at objective.

  • Isang translation layer na nagko-compile ng mga schema bilang solver code.

  • Mga interface na nagbibigay-daan sa mga team na siyasatin, i-audit, at baguhin ang mga limitasyon.

Kung saan ito lumilikha ng halaga

Bagama’t nakatuon ngayon sa optimization ang mga eksperimentong ito, maaari ring gamitin ang parehong paraan sa lohikal na pagberipika. Kabilang sa mga posibleng gamit sa negosyo ang:

  • Magsagawa ng ad hoc at dynamic na pag-iiskedyul, pagruruta, at paglalaan ng resource habang ipinapatupad ang bawat limitasyon sa operasyon.

  • Bumuo ng mga sagot at rekomendasyong palaging sumusunod sa mga tuntunin sa negosyo.

  • Magdisenyo at mag-validate ng masasalimuot na 3D object, video, at architecture habang natutukoy ang mga disenyong hindi maisasagawa bago ang production.

Pangwakas na pananaw

Makapangyarihan ang AI ngayon, ngunit higit pa sa kapangyarihan ang kailangan ng mga enterprise: kailangan nila ng kawastuhan, consistency, at kontrol. Ang aming hybrid na LLM-and-solver system ay isang hakbang tungo sa mundong:

  • Hindi nag-iimbento ang mga agent ng mga tuntunin o limitasyon.

  • Matibay sa matematika ang lohikal na deduction at optimization.

  • Nagsisilbing pangkalahatang interface sa mga deterministic system ang natural na wika.

May-akda

Peng Seng Ang