Kết hợp LLM và bộ giải hình thức để AI ra quyết định đáng tin cậy

Kiến trúc lai kết hợp tính linh hoạt của LLM với bộ giải tất định để đưa ra các quyết định doanh nghiệp đáng tin cậy và có thể kiểm chứng.

Các mô hình ngôn ngữ lớn (LLM) đã đạt những bước tiến vượt bậc trong việc hiểu ngôn ngữ tự nhiên, tạo phản hồi trôi chảy và mang đến những trải nghiệm hoàn toàn mới cho khách hàng lẫn nhân viên. Tuy nhiên, do LLM vốn có tính ngẫu nhiên, việc dùng chúng cho các tác vụ suy luận số học hoặc logic phức tạp khó bảo đảm kết quả tuân thủ yêu cầu hoặc đạt mức tối ưu. Ví dụ:

  • Một quản lý yêu cầu trợ lý AI lập kế hoạch: “Ship as much as possible next week while keeping costs low,” và hệ thống đưa ra một kế hoạch quyết liệt, trông có vẻ hiệu quả nhưng âm thầm vượt quá sức chứa của kho và vi phạm các cam kết giao hàng.

  • Một điều phối viên yêu cầu trợ lý AI: “Reassign crews to reduce overnight stays and minimize disruption,” và mô hình tạo ra một lịch trình có chi phí thấp hơn, trông có vẻ tối ưu nhưng vi phạm các giới hạn bắt buộc về thời gian làm nhiệm vụ hoặc nghỉ ngơi.

  • Một trợ lý AI phụ trách vận hành tài chính phải phê duyệt giao dịch theo các giới hạn nghiêm ngặt về khu vực và rủi ro, nhưng lại thông qua một giao dịch đáng ngờ bằng cách bịa ra lý do nghe có vẻ tuân thủ dù thực tế vi phạm chính sách nội bộ.

Trong các môi trường có yêu cầu vận hành nghiêm ngặt, việc kết hợp LLM với bộ giải hình thức giúp bảo đảm các quyết định dựa trên ngôn ngữ tự nhiên luôn nằm trong ranh giới đã xác định, tránh kết quả bất khả thi, chưa tối ưu hoặc không tuân thủ.

Đội ngũ R&D của chúng tôi đang nghiên cứu một phương pháp lai, kết hợp tính sáng tạo và linh hoạt của LLM với tính chặt chẽ, khả năng bảo đảm và tính minh bạch của các bộ giải toán học hình thức như Z3, Pyomo và OR-Tools. Chúng tôi cũng đang xây dựng một công cụ AI hình thức có thể tái sử dụng để đưa năng lực này thành thành phần tiêu chuẩn trong hệ thống công nghệ doanh nghiệp. Nền tảng này sẽ cho phép các tổ chức tiếp nhận quy tắc kinh doanh trực tiếp từ hệ thống hiện có, liên tục kiểm chứng quyết định theo các quy tắc đó và triển khai tác nhân AI an toàn trong những ranh giới được xác định rõ.

Tầm nhìn của chúng tôi là giảm rủi ro vận hành, đồng thời đẩy nhanh quá trình ra quyết định trên quy mô lớn. Lãnh đạo có thể đưa ra quyết định nhanh hơn, đúng chính sách từ dữ liệu đầu vào bằng ngôn ngữ tự nhiên; còn tổ chức có thể tự động hóa các thay đổi đột xuất trong lập lịch, phân bổ nguồn lực chuỗi cung ứng, vận hành tài chính, kiểm chứng chính sách, thậm chí cả thiết kế video hoặc 3D. Các biện pháp bảo vệ tích hợp ngăn những kết quả bất khả thi, không tuân thủ hoặc không an toàn đi vào môi trường vận hành thực tế.

Trong các thử nghiệm có kiểm soát đối với bài toán tối ưu hóa kiểu logistics và ba bộ tiêu chuẩn công khai, phương pháp lai của chúng tôi luôn cho thấy:

  • Độ chính xác cao hơn

  • Khả năng diễn giải và kiểm toán tốt hơn

Kiến trúc lai

Phương pháp của chúng tôi đảo ngược mô hình quen thuộc “LLM làm mọi việc” và thay vào đó áp dụng thiết kế sau:

Sơ đồ minh họa cách mô hình ngôn ngữ lớn và bộ giải tất định kết hợp khả năng hiểu ngôn ngữ tự nhiên với quy trình tối ưu hóa có thể kiểm chứng.

Phương pháp này phân định rõ trách nhiệm: LLM trích xuất quy tắc và giới hạn từ ngôn ngữ tự nhiên, còn các bộ giải tất định như OR-Tools, Z3 và Pyomo đảm nhiệm việc tối ưu hóa và kiểm chứng. Kết quả kết hợp thế mạnh của cả hai phương pháp:

LLM

Bộ giải

Phương pháp lai (LLM + Bộ giải)

Hiểu ý định của con người trong nhiều lĩnh vực

✅ Xuất sắc

❌ Không có

✅ Xuất sắc

Hành vi tất định

❌ Không

✅ Được bảo đảm

✅ Có

Có thể chứng minh tính đúng đắn khi suy luận toán học và tối ưu hóa với nhiều giới hạn

⚠️ Thiếu ổn định

✅ Được bảo đảm

✅ Có

Khả năng kiểm toán và diễn giải

⚠️ Thiếu ổn định

✅ Rõ ràng

✅ Rõ ràng

Khả năng chống nhiễu và tấn công chèn câu lệnh

❌ Dễ bị ảnh hưởng

✅ Miễn nhiễm

✅ Mạnh

Hướng thử nghiệm 1: logistics và phân công nhân sự

Lĩnh vực bài toán

Chúng tôi bắt đầu với một thách thức mà một số khách hàng đang gặp phải:

Chuyển yêu cầu bằng ngôn ngữ tự nhiên thành quyết định tối ưu về nguồn lực theo thời gian thực, đồng thời thực thi nghiêm ngặt các giới hạn về vận hành, chính sách và chi phí.

Thách thức này nằm ở trọng tâm của logistics và chuỗi cung ứng hiện đại, bao gồm lập lịch nhân sự, phân bổ tài sản, định tuyến, lập kế hoạch hoàn tất đơn hàng và quản lý năng lực. Đây cũng là lĩnh vực mà LLM và bộ giải hình thức cần phối hợp để tạo ra những hệ thống đáng tin cậy. Để đánh giá, chúng tôi đã xây dựng các tình huống thử nghiệm, nguồn dữ liệu và giới hạn có kiểm soát, cùng 240 truy vấn tổng hợp. Ví dụ gồm:

  • Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.

  • Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.

Qua các truy vấn, có thể thấy hệ thống phải trích xuất và thực thi đáng tin cậy các giới hạn cứng và mềm trực tiếp từ yêu cầu bằng ngôn ngữ tự nhiên:

  • Giới hạn cứng là những điều kiện không thể thương lượng (ví dụ: ngày bắt đầu sớm nhất, điều khoản hợp đồng và mức trần năng lực). Chỉ cần vi phạm một giới hạn cũng khiến giải pháp mất hiệu lực.

  • Giới hạn mềm thể hiện các ưu tiên như giảm thiểu chậm trễ, chi phí và số lượng thay đổi. Mục tiêu là tối ưu hóa mà không vượt qua các ranh giới cứng.

Không thể xác định trước đầy đủ một số khía cạnh của các bài toán tối ưu hóa này. Chúng phải được tập hợp linh hoạt theo từng tình huống, không chỉ dựa trên các giới hạn và mục tiêu định sẵn từ logic kinh doanh có cấu trúc, tài liệu nội bộ và dữ liệu vận hành mà còn từ yêu cầu của người dùng.

Các phương pháp chúng tôi đánh giá

Để tìm hiểu hiệu quả của các kỹ thuật khác nhau trong bối cảnh này, chúng tôi đã triển khai và so sánh ba phương pháp.

  1. LLM thuần túy: Phương pháp đơn giản nhất chuyển mọi dữ liệu liên quan và yêu cầu bằng ngôn ngữ tự nhiên của người dùng vào một câu lệnh LLM duy nhất, rồi yêu cầu tạo kế hoạch hoặc phương án phân bổ tối ưu. Cách này có thể hiệu quả với bài toán nhỏ hoặc ít giới hạn, nhưng sẽ mất hiệu quả khi độ phức tạp tăng lên. Mô hình có thể bỏ qua giới hạn, ưu tiên sai mục tiêu hoặc tạo kế hoạch nghe có vẻ hợp lý nhưng bất khả thi, trong khi không có cách đáng tin cậy để phát hiện hay ngăn ngừa lỗi.

  2. LLM + Trình Thông dịch Mã: Trong phương pháp này, LLM diễn giải yêu cầu và dùng công cụ để truy cập nguồn dữ liệu cũng như tạo mã tối ưu hóa có thể thực thi. Điều này tăng tính linh hoạt và khả năng quan sát, nhưng độ tin cậy vẫn là một vấn đề. LLM vẫn phải chuyển giới hạn thành mã chính xác; những lỗi nhỏ trong suy luận hoặc lập trình có thể tạo ra kết quả không hợp lệ hoặc chưa tối ưu, nhất là khi số lượng giới hạn tăng lên.

  3. Phương pháp lai: LLM → giới hạn có cấu trúc → bộ giải tất định: Phương pháp thứ ba phân tách trách nhiệm. LLM không bao giờ “quyết định” kết quả; nó giúp hình thức hóa các biến, giới hạn và mục tiêu. Một bộ giải tối ưu hóa đã được kiểm chứng sẽ thực thi các giới hạn, bảo đảm tính khả thi và tạo ra kết quả có thể kiểm chứng, kiểm toán. Vai trò của LLM chỉ giới hạn ở việc chuyển yêu cầu bằng ngôn ngữ tự nhiên thành các giới hạn rõ ràng, có cấu trúc bằng những lược đồ định sẵn. Các giới hạn đó được tự động biên dịch thành mã cho bộ giải như OR-Tools, rồi bộ giải tính toán theo cách tất định để tìm ra giải pháp khả thi và tối ưu.

Kết quả

Chúng tôi đã thử nghiệm các phương pháp bằng một số LLM, gồm GPT-5, GPT-5.1 và GPT-5.2. Đúng như dự kiến, phương pháp lai vượt trội hơn các phương án khác:

Phương pháp

Độ chính xác phân công

Độ trễ trung bình

Số token dùng cho mỗi truy vấn

LLM thuần túy

70–78%

62–190 giây

~175.000

LLM + Trình Thông dịch Mã

82–84%

62–140 giây

~9.000

LLM → Bộ giải (Lai)

95–97%

6–25 giây

~2.000

Phương pháp lai của chúng tôi cho thấy độ chính xác tăng đáng kể, hiệu quả sử dụng token cao hơn hơn 4 lầnđộ trễ giảm một bậc độ lớn.

Hướng thử nghiệm 2: tối ưu hóa đa dụng từ ngôn ngữ tự nhiên

Bước tiếp theo là xây dựng một giao diện có khả năng khái quát và tái sử dụng, chuyển ngôn ngữ tự nhiên thành các biểu diễn ngữ nghĩa có cấu trúc để backend dịch thành mã sẵn sàng cho bộ giải. Trong thử nghiệm này, chúng tôi tập trung vào các bài toán tối ưu hóa tuyến tính và đánh giá phương pháp trên ba bộ dữ liệu công khai (NLP4LP, NL4OPTIndustryOR).

Các phương pháp chúng tôi đánh giá

  1. LLM độc lập

  2. Phương pháp lai (LLM → quy tắc có cấu trúc → bộ giải → kết quả đã kiểm chứng)

Sơ đồ quy trình lai từ yêu cầu bằng ngôn ngữ tự nhiên đến giới hạn có cấu trúc, quá trình giải tất định và kết quả đã kiểm chứng.

  • Dùng LLM để trích xuất biến, giới hạn và mục tiêu từ dữ liệu đầu vào, rồi thiết lập một bài toán tối ưu hóa có cấu trúc.

  • Chuyển bài toán có cấu trúc và yêu cầu ban đầu cho LLM để tự kiểm chứng.

  • Chuyển bài toán có cấu trúc thành mã OR-Tools để tính phương án phân bổ tối ưu.

Kết quả

Chúng tôi đánh giá phương pháp này bằng các mô hình tiên phong độc quyền, gồm GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max và GPT-5.2, cùng những mô hình nguồn mở như Kimi K2, các mô hình GPT-OSS và MiniMax M2. Các biểu đồ hộp tóm tắt kết quả của từng phương pháp.

Biểu đồ so sánh mô hình ngôn ngữ lớn độc lập và phương pháp lai dựa trên bộ giải qua các bộ tiêu chuẩn tối ưu hóa.

Trên hầu hết mô hình ngôn ngữ nền tảng được đánh giá, phương pháp lai luôn tạo ra kết quả chính xác, ổn định và dễ kiểm chứng hơn so với mốc cơ sở là LLM độc lập. Dù hiệu năng tuyệt đối khác nhau giữa các mô hình, mức cải thiện tương đối từ phương pháp lai vẫn nhất quán. Điều này cho thấy cải thiện đến từ việc tách khả năng hiểu ngôn ngữ tự nhiên khỏi tối ưu hóa hình thức, thay vì phụ thuộc vào năng lực suy luận của một mô hình riêng lẻ.

Độ chính xác

Trên NLP4LP và NL4OPT—chủ yếu gồm các bài toán quy hoạch tuyến tính—phương pháp lai đạt độ chính xác gần mức tối đa và vượt trội so với việc chỉ dùng câu lệnh cho LLM độc lập. Thay vì tạo ra suy luận “gần đúng”, hệ thống lai tạo ra các cách thiết lập toán học hợp lệ, đúng cấu trúc một cách nhất quán hơn. Trên bộ dữ liệu IndustryOR khó hơn, độ chính xác của cả hai phương pháp đều giảm, nhưng vì những nguyên nhân khác nhau. Nhiều bài toán IndustryOR liên quan đến cấu trúc tổ hợp như định tuyến phương tiện, sắp xếp trình tự nhiệm vụ và phân công nhân sự, vượt quá khả năng tối ưu hóa tuyến tính mà backend bộ giải của chúng tôi hiện hỗ trợ.

Phân tích các dạng lỗi cho thấy LLM độc lập thường xuyên vi phạm những giới hạn bắt buộc, như minh họa dưới đây:

Ví dụ 1:

Plain Text

"A bodybuilder buys prepared meals: a turkey dinner and a tuna salad sandwich. The turkey dinner contains 20 grams of protein, 30 grams of carbohydrates, and 12 grams of fat. The tuna salad sandwich contains 18 grams of protein, 25 grams of carbohydrates, and 8 grams of fat. The bodybuilder needs at least 150 grams of protein and 200 grams of carbohydrates. Because turkey dinners are expensive, no more than 40% of the meals should be turkey dinners. How many of each meal should the bodybuilder eat to minimize total fat intake?"

LLM độc lập tạo ra một giải pháp có tổng lượng chất béo thấp hơn, nhưng vi phạm yêu cầu rằng các suất ăn gà tây không được chiếm quá 40% tổng số bữa ăn. Phương pháp lai thực thi chính xác giới hạn cứng này và trả về một đáp án hợp lệ.

Ví dụ 2:

Plain Text

"A hospitalized patient can take two pills: Pill 1 and Pill 2. Each Pill 1 provides 0.2 units of pain medication and 0.3 units of anxiety medication. Each Pill 2 provides 0.6 units of pain medication and 0.2 units of anxiety medication. Pill 1 causes 0.3 units of discharge, while Pill 2 causes 0.1 units. At most 6 units of pain medication may be provided, and at least 3 units of anxiety medication must be provided. How many of each pill should the patient receive to minimize total discharge?"

LLM độc lập một lần nữa tạo ra giải pháp có mức xả thải thấp hơn, nhưng vượt quá giới hạn tối đa cho phép về thuốc giảm đau. Phương pháp lai thực thi chính xác giới hạn cứng đó và trả về một đáp án hợp lệ.

Độ trễ và mức sử dụng token

Dữ liệu về độ trễ và mức sử dụng token cho thấy một điểm khác biệt quan trọng. Phương pháp lai có độ trễ trung bình và mức sử dụng token cao hơn một câu lệnh LLM chạy một lần, nhưng điều này phản ánh lựa chọn kiến trúc chứ không phải sự kém hiệu quả.

Quy trình lai bao gồm:

  1. Một hoặc nhiều lần gọi LLM để trích xuất các biến, giới hạn và mục tiêu có cấu trúc.

  2. Một bước tự kiểm chứng để phát hiện các điểm thiếu nhất quán nội bộ.

Dù các bước này làm tăng chi phí xử lý so với một câu lệnh duy nhất, độ trễ vẫn có giới hạn và có thể dự đoán; bộ giải thường chạy nhanh sau khi bài toán được thiết lập đầy đủ. Phần xử lý bổ sung này tạo ra các biểu diễn trung gian rõ ràng, có thể tái sử dụng và kiểm toán. Ngược lại, phương pháp chỉ dùng LLM nén toàn bộ quá trình suy luận vào một lần tạo kết quả thiếu minh bạch, chuyển chi phí sang việc thử lại, kiểm tra thủ công và xử lý lỗi ở hạ nguồn. Các phiên bản sau có thể giảm chi phí này bằng cách:

  • Lưu vào bộ nhớ đệm các lược đồ đã trích xuất.

  • Cập nhật dần các giới hạn.

  • Cải thiện việc điều phối câu lệnh và lượt gọi.

Tính minh bạch và khả năng kiểm toán

Cuối cùng, ngay cả khi cả hai phương pháp đều thất bại, bản chất của cách thức thất bại vẫn hoàn toàn khác nhau.

  • Với một LLM độc lập, lỗi thường diễn ra âm thầm: mô hình có thể trả về kết quả sai ở những điểm khó nhận thấy.

  • Với phương pháp lai, cách trình bày bài toán rõ ràng giúp lỗi trở nên minh bạch và cho phép các nhóm xác định phần nào trong cách thiết lập đã gây ra lỗi.

Các phiên bản sau có thể hiển thị những cách thiết lập này trên giao diện để người dùng kiểm toán hoặc kiểm chứng trước khi bộ giải chạy. Tính minh bạch này cải thiện độ chính xác đo được, đồng thời giúp hệ thống dễ gỡ lỗi và tinh chỉnh hơn—những yếu tố thiết yếu để triển khai trong thực tế.

Kết luận chính

Trên tất cả bộ tiêu chuẩn và phần lớn mô hình nền tảng được thử nghiệm, kết quả củng cố một kết luận trọng tâm trong nghiên cứu của chúng tôi:

LLM rất mạnh trong việc hiểu và chuyển đổi ý định, nhưng bộ giải tất định là yếu tố thiết yếu để bảo đảm tính đúng đắn.

Phương pháp lai biến ngôn ngữ tự nhiên từ nguồn gây mơ hồ thành một giao diện đáng tin cậy cho việc ra quyết định vững chắc về mặt toán học, đưa AI doanh nghiệp tiến gần hơn đến những hệ thống không chỉ thông minh mà còn đáng tin cậy.

Bước tiếp theo: công cụ AI hình thức có thể tái sử dụng cho doanh nghiệp

Các giới hạn trong doanh nghiệp hiếm khi tồn tại dưới dạng lược đồ gọn gàng hoặc câu lệnh được diễn đạt hoàn hảo. Chúng nằm rải rác trong cơ sở dữ liệu, bảng tính, chính sách nội bộ và hợp đồng. Yêu cầu của người dùng có thể không đầy đủ, mơ hồ hoặc không nhất quán với quy tắc kinh doanh. Để áp dụng phương pháp này trên quy mô lớn, chúng tôi đang xây dựng một công cụ backend có thể tái sử dụng nhằm biến sự phức tạp đó thành một năng lực doanh nghiệp đáng tin cậy.

Sơ đồ công cụ AI hình thức dành cho doanh nghiệp, gồm quy tắc kinh doanh, quá trình chuyển đổi cho bộ giải và việc ra quyết định có thể kiểm toán.

Nền tảng

Về cốt lõi, công cụ này đóng vai trò là xương sống hình thức cho các hệ thống ra quyết định dựa trên AI, cung cấp:

  • Một cơ sở tri thức ký hiệu cùng các bộ điều hợp để tiếp nhận quy tắc kinh doanh, giới hạn, biến và mục tiêu.

  • Một lớp chuyển đổi biên dịch lược đồ thành mã cho bộ giải.

  • Các giao diện cho phép nhóm kiểm tra, kiểm toán và sửa đổi giới hạn.

Những lĩnh vực có thể khai mở giá trị

Dù các thử nghiệm này hiện tập trung vào tối ưu hóa, phương pháp tương tự cũng có thể mở rộng sang kiểm chứng logic. Các ứng dụng kinh doanh tiềm năng gồm:

  • Thực hiện việc lập lịch động đột xuất, định tuyến và phân bổ nguồn lực, đồng thời thực thi mọi giới hạn vận hành.

  • Tạo câu trả lời và đề xuất luôn tuân thủ các quy tắc kinh doanh.

  • Thiết kế và xác thực các vật thể 3D, video và kiến trúc phức tạp, đồng thời phát hiện thiết kế bất khả thi trước khi sản xuất.

Lời kết

AI ngày nay rất mạnh, nhưng doanh nghiệp cần nhiều hơn sức mạnh: họ cần tính đúng đắn, nhất quán và khả năng kiểm soát. Hệ thống lai giữa LLM và bộ giải của chúng tôi là một bước hướng tới thế giới nơi:

  • Các tác nhân không bịa ra quy tắc hoặc giới hạn.

  • Suy diễn logic và tối ưu hóa có cơ sở toán học vững chắc.

  • Ngôn ngữ tự nhiên đóng vai trò là giao diện chung cho các hệ thống tất định.

Tác giả

Peng Seng Ang