メインナビゲーション

LLM と形式的ソルバーによる信頼できる AI 意思決定

LLM の柔軟性と決定論的ソルバーを組み合わせ、信頼性と検証可能性を備えた企業の意思決定を実現するハイブリッドアーキテクチャ

大規模言語モデル(LLM)は、自然言語の理解、流暢な応答の生成、まったく新しい顧客・従業員体験の実現において目覚ましい進歩を遂げています。しかし、LLM は本質的に確率的であるため、複雑な数値的・論理的推論に使用しても、出力が規則に準拠し、最適であることを十分には保証できません。たとえば、次のようなケースがあります。

  • マネージャーが AI 計画アシスタントに、「コストを抑えながら、来週できるだけ多く出荷してください」と指示すると、システムは効率的に見える積極的な計画を提示しますが、実際には倉庫の処理能力を超え、納期保証を守れません。

  • コーディネーターが AI アシスタントに、「宿泊を減らし、混乱を最小限に抑えるよう作業班を再配置してください」と指示すると、モデルは最適に見える低コストのスケジュールを作成しますが、必須の勤務時間や休息時間の制約に違反します。

  • 財務業務向け AI アシスタントは、地域やリスクに関する厳格な制約の下で取引を承認する必要があります。しかし、社内ポリシーに違反しているにもかかわらず、準拠しているように聞こえる根拠を捏造し、不審な取引を承認してしまいます。

厳格な運用要件がある環境では、LLM と形式的ソルバーを組み合わせることで、自然言語に基づく意思決定を定められた範囲内に保ち、実行不能、準最適、規則違反の結果を回避しやすくなります。

当社の研究開発チームは、LLM の創造性と柔軟性に、Z3、Pyomo、OR-Tools などの形式的な数理ソルバーが持つ厳密性、保証、透明性を組み合わせるハイブリッド手法を研究しています。また、この機能を企業のテクノロジースタックの標準要素にするため、再利用可能な形式 AI エンジンも構築しています。このプラットフォームにより、組織は既存システムからビジネスルールを直接取り込み、意思決定がそのルールに沿っているかを継続的に検証し、明確に定めた範囲内で AI エージェントを安全に導入できるようになります。

私たちが目指すのは、大規模な意思決定を加速しながら、運用リスクを低減することです。リーダーは自然言語で入力するだけで、ポリシーに準拠した意思決定を迅速に得られます。組織は、スケジュール、サプライチェーンのリソース配分、財務業務、ポリシー検証、さらには動画や 3D デザインの臨時変更も自動化できます。組み込みの安全対策により、実行不能、規則違反、または安全でない結果が本番環境に到達するのを防ぎます。

物流型の最適化問題と 3 つの公開ベンチマークを用いた対照実験で、当社のハイブリッド手法は一貫して次の成果を示しました。

  • 精度の向上

  • 解釈可能性と監査可能性の向上

ハイブリッドアーキテクチャ

当社の手法は、一般的な「LLM がすべてを行う」という発想を逆転させ、次の設計を採用しています。

大規模言語モデルと決定論的ソルバーが、自然言語理解と検証可能な最適化をどのように組み合わせるかを比較した図

この手法では責任を明確に分離します。LLM が自然言語からルールと制約を抽出し、OR-Tools、Z3、Pyomo などの決定論的ソルバーが最適化と検証を担います。その結果、両方の長所を組み合わせられます。

LLM

ソルバー

ハイブリッド(LLM + ソルバー)

多様な領域における人間の意図の理解

✅ 非常に優秀

❌ なし

✅ 非常に優秀

決定論的な動作

❌ いいえ

✅ 保証あり

✅ はい

複数の制約下での数理推論と最適化について正しさを証明可能

⚠️ 不安定

✅ 保証あり

✅ はい

監査可能性と解釈可能性

⚠️ 不安定

✅ 明確

✅ 明確

プロンプトのノイズやインジェクションへの耐性

❌ 脆弱

✅ 影響なし

✅ 強い

実験トラック 1:物流と人員配置

対象とする問題領域

まず、一部のお客様が直面している次の課題に取り組みました。

運用、ポリシー、コストの制約を厳格に適用しながら、自然言語の要求をリアルタイムで最適なリソース判断へ変換すること

この課題は、人員スケジューリング、資産配分、ルーティング、履行計画、キャパシティ管理など、現代の物流とサプライチェーンの中核にあります。信頼できるシステムを構築するには、まさにこの領域で LLM と形式的ソルバーが連携する必要があります。評価にあたり、対照テスト用のシナリオ、データソース、制約に加え、240 件の合成クエリを作成しました。例は次のとおりです。

  • キャンセルに伴い、既存のスケジュールを修正してください。対象施設への供給を 2025 年 12 月 24 日までに完了する必要があります。可能であれば近隣倉庫の在庫を使用し、指定の集約拠点を経由してください。開始可能な最も早い日は 2025 年 12 月 14 日です。

  • 緊急の依頼です。VIP が 3 時間後に地点 A へ到着します。必要なスタッフを 2 時間以内に現地へ配置する必要があります。既存スケジュールへの変更を最小限に抑えながら、スタッフの配置を調整してください。

これらのクエリから、システムは自然言語の要求からハード制約とソフト制約を直接抽出し、確実に適用する必要があると分かります。

  • ハード制約は必ず守る必要があります(開始可能な最早日、契約条件、処理能力の上限など)。いずれか 1 つでも違反すると、解は無効になります。

  • ソフト制約は、遅延の最小化、コストの削減、変更の抑制などの優先事項を表します。目的は、ハード制約を守りながら最適化することです。

こうした最適化問題には、事前に完全には定義できない要素があります。構造化されたビジネスロジック、社内文書、運用データに含まれる定義済みの制約や目的だけでなく、ユーザーの要求も取り入れて動的に構成する必要があります。

評価した手法

この環境で各技術がどのような性能を示すかを把握するため、3 つの手法を実装して比較しました。

  1. 純粋な LLM:最も単純な手法では、関連データとユーザーの自然言語による要求をすべて 1 つの LLM プロンプトに渡し、最適な計画や配分を生成させます。小規模な問題や制約の緩い問題には対応できますが、複雑さが増すと機能しなくなります。モデルが制約を無視したり、誤った目的を優先したり、妥当に聞こえても実行不能な計画を作成したりする可能性があり、失敗を確実に検出または防止する方法もありません。

  2. LLM + Code Interpreter:この手法では、LLM が要求を解釈し、ツールを使ってデータソースにアクセスして、実行可能な最適化コードを生成します。柔軟性と可観測性は高まりますが、信頼性には依然として課題が残ります。LLM は制約を正しいコードに変換しなければならず、推論やコーディングの小さな誤りでも、特に制約が増えるにつれて、無効または準最適な結果につながる可能性があります。

  3. ハイブリッド:LLM → 構造化された制約 → 決定論的ソルバー:3 つ目の手法では、責任を分離します。LLM が結果を「決定」することはありません。変数、制約、目的の形式化を支援します。実績ある最適化ソルバーが制約を適用して実行可能性を保証し、検証・監査できる結果を生成します。LLM の役割は、定義済みのスキーマを使い、自然言語の要求を明示的で構造化された制約へ変換することに限定されます。それらの制約は OR-Tools などのソルバーコードへ自動的にコンパイルされ、ソルバーが実行可能な最適解を決定論的に算出します。

結果

GPT-5、GPT-5.1、GPT-5.2 を含む複数の LLM を使用して各手法をテストしました。予想どおり、ハイブリッド手法は他の手法を上回りました

手法

割り当て精度

平均レイテンシ

クエリ当たりの使用トークン数

純粋な LLM

70~78%

62~190 秒

約 175,000

LLM + Code Interpreter

82~84%

62~140 秒

約 9,000

LLM → ソルバー(ハイブリッド)

95~97%

6~25 秒

約 2,000

当社のハイブリッド手法では、精度が大幅に向上し、トークン効率が 4 倍以上になり、レイテンシが約 10 分の 1 に短縮されました。

実験トラック 2:自然言語による汎用最適化

次のステップは、自然言語を構造化された意味表現に変換し、バックエンドでソルバー向けコードへ変換できる、汎用的で再利用可能なインターフェースの構築です。この実験では線形最適化問題に焦点を当て、3 つの公開データセット(NLP4LPNL4OPTIndustryOR)を使って手法を評価しました。

評価した手法

  1. 単独の LLM

  2. ハイブリッド手法(LLM → 構造化ルール → ソルバー → 検証済み出力)

自然言語の要求から構造化された制約、決定論的な求解、検証済み出力に至るハイブリッドワークフローの図

  • LLM を使用して入力から変数、制約、目的を抽出し、構造化された最適化問題を定式化

  • 構造化された問題と元の要求を LLM に渡して自己検証

  • 構造化された問題を OR-Tools のコードへ変換し、最適な割り当てを算出

結果

GPT-5.1、GPT-5 mini、GPT-5.1-Codex-Max、GPT-5.2 などの独自フロンティアモデルと、Kimi K2、GPT-OSS モデル、MiniMax M2 などのオープンソースモデルを使用して、この手法を評価しました。箱ひげ図は、各手法の結果を要約したものです。

最適化ベンチマークで、単独の大規模言語モデルとソルバーを用いたハイブリッド手法を比較したグラフ

評価したほぼすべての基盤言語モデルで、ハイブリッド手法は単独の LLM ベースラインよりも一貫して正確で安定し、検証可能な結果を生成しました。絶対的な性能はモデルによって異なりますが、ハイブリッド手法による相対的な向上は一貫しています。これは、特定のモデルの推論能力に依存するのではなく、自然言語理解と形式的最適化を分離することで改善が得られることを示しています。

精度

主に線形計画問題で構成される NLP4LP と NL4OPT では、ハイブリッド手法が上限に近い精度を達成し、単独の LLM プロンプトを上回りました。ハイブリッドシステムは、「おおむね正しい」推論にとどまらず、妥当で適切に構成された数理的定式化をより安定して生成します。より難易度の高い IndustryOR データセットでは、どちらの手法も精度が低下しますが、その理由は異なります。IndustryOR の多くの問題には、車両経路、タスクの順序付け、人員配置など、現在のソルバーバックエンドが対応する線形最適化の能力を超えた組合せ構造が含まれます。

失敗パターンを分析すると、次の例のように、単独の LLM が必須の制約に頻繁に違反することが分かります。

例 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

単独の LLM は総脂肪量が少ない解を生成しますが、七面鳥料理を食事全体の 40% 以下にするという要件に違反しています。ハイブリッド手法はこのハード制約を正しく適用し、妥当な回答を返します。

例 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

単独の LLM は再び排出量が少ない解を生成しますが、許容される鎮痛薬の上限を超えています。ハイブリッド手法はそのハード制約を正しく適用し、妥当な回答を返します。

レイテンシとトークン使用量

レイテンシとトークン使用量のデータから、重要な違いが明らかになります。ハイブリッド手法は、単発の LLM プロンプトより平均レイテンシとトークン使用量が多くなりますが、これは非効率性ではなく、アーキテクチャ上の選択によるものです。

ハイブリッドパイプラインには、次の処理が含まれます。

  1. 構造化された変数、制約、目的を抽出するための 1 回以上の LLM 呼び出し

  2. 内部の不整合を検出する自己検証ステップ

これらのステップは単一のプロンプトよりオーバーヘッドが大きいものの、レイテンシは一定の予測可能な範囲に収まり、問題が適切に定式化されれば、通常はソルバーも高速に実行されます。この追加処理により、明示的で再利用可能かつ監査可能な中間表現が作成されます。一方、単独の LLM は推論を不透明な 1 回の生成に集約するため、再試行、手作業での確認、後工程での障害へとコストを転嫁します。今後は、次の方法でこのオーバーヘッドを削減できます。

  • 抽出したスキーマのキャッシュ

  • 制約の差分更新

  • プロンプトと呼び出しのオーケストレーション改善

透明性と監査可能性

最後に、どちらの手法も失敗する場合であっても、その失敗のあり方は根本的に異なります。

  • 単独の LLM では、失敗が表面化しないことがよくあります。モデルがわずかに誤った結果を返す可能性があります。

  • ハイブリッド手法では、問題が明示的に定式化されるため、失敗が明確になり、チームは定式化のどの部分がエラーを引き起こしたかを特定できます。

将来のバージョンでは、こうした定式化をインターフェース上に表示し、ソルバーの実行前にユーザーが監査または検証できるようになる可能性があります。この透明性により、測定上の精度が向上し、システムのデバッグや改善も容易になります。これは実環境への導入に不可欠です。

重要なポイント

すべてのベンチマークと、テストした基盤モデルの大半において、結果は当社の取り組みの中心的な結論を裏付けています。

LLM は意図の理解と変換に優れていますが、正しさを保証するには決定論的ソルバーが不可欠です。

ハイブリッド手法は、曖昧さの原因だった自然言語を、数学的に妥当な意思決定を行うための信頼できるインターフェースへと変えます。これにより、企業向け AI は、知的であるだけでなく信頼もできるシステムへ一歩近づきます。

次の展開:企業向けの再利用可能な形式 AI エンジン

企業の制約が、整然としたスキーマや完璧な表現のプロンプトとして存在することはほとんどありません。制約はデータベース、スプレッドシート、社内ポリシー、契約書に分散しています。ユーザーの要求は、不完全、曖昧、またはビジネスルールと矛盾している場合があります。この手法を大規模に活用するため、当社はこうした複雑さを信頼できる企業向け機能へ変換する、再利用可能なバックエンドエンジンを構築しています。

ビジネスルール、ソルバーへの変換、監査可能な意思決定を含む、企業向け形式 AI エンジンの図

プラットフォーム

このエンジンは、AI を活用した意思決定システムの形式的な基盤として機能し、次の機能を提供します。

  • ビジネスルール、制約、変数、目的を取り込むアダプターを備えた記号的知識ベース

  • スキーマをソルバーコードにコンパイルする変換レイヤー

  • チームが制約を確認、監査、変更できるインターフェース

価値を生み出す領域

現在の実験は最適化に重点を置いていますが、同じ手法を論理検証にも拡張できます。想定されるビジネス用途は次のとおりです。

  • すべての運用制約を適用しながら、臨時かつ動的なスケジューリング、ルーティング、リソース配分を実行

  • ビジネスルールに常に準拠した回答と推奨事項を生成

  • 複雑な 3D オブジェクト、動画、アーキテクチャを設計・検証し、本番制作前に実現不能な設計を検出

おわりに

現在の AI は強力ですが、企業が必要としているのは能力だけではありません。正しさ、一貫性、制御性も必要です。当社の LLM とソルバーによるハイブリッドシステムは、次のような世界に向けた一歩です。

  • エージェントがルールや制約を捏造しない

  • 論理的推論と最適化が数学的に妥当である

  • 自然言語が決定論的システムの共通インターフェースとなる

著者

Peng Seng Ang