대규모 언어 모델(LLM)은 자연어 이해와 유창한 응답 생성에서 놀라운 발전을 이루었으며, 완전히 새로운 고객 및 직원 경험을 구현하고 있습니다. 하지만 LLM은 본질적으로 확률적이므로, 복잡한 수치 또는 논리 추론에 활용할 경우 결과의 규정 준수나 최적성을 충분히 보장하기 어렵습니다. 예를 들면 다음과 같습니다.
관리자가 AI 계획 도우미에게 “Ship as much as possible next week while keeping costs low,”라고 지시하자, 시스템은 효율적으로 보이지만 창고 용량을 남몰래 초과하고 배송 보장을 어기는 무리한 계획을 내놓습니다.
코디네이터가 AI 도우미에게 “Reassign crews to reduce overnight stays and minimize disruption,”라고 지시하자, 모델은 최적으로 보이는 저비용 일정을 만들지만 의무 근무 시간이나 휴식 시간 제약을 위반합니다.
금융 운영 AI 도우미는 엄격한 지역 및 위험 제약에 따라 거래를 승인해야 하지만, 내부 정책을 위반하면서도 규정을 준수하는 것처럼 들리는 근거를 지어내 의심스러운 거래를 승인합니다.
운영 요건이 엄격한 환경에서 LLM과 정형 솔버를 결합하면 자연어 기반 의사결정이 정해진 범위를 벗어나지 않도록 하고, 실행 불가능하거나 최적이 아니거나 규정을 위반하는 결과를 방지할 수 있습니다.
저희 R&D 팀은 LLM의 창의성과 유연성을 Z3, Pyomo, OR-Tools 같은 정형 수학 솔버의 엄밀성, 보장성, 투명성과 결합하는 하이브리드 접근법을 연구하고 있습니다. 또한 이 기능을 엔터프라이즈 기술 스택의 표준 구성 요소로 만들기 위해 재사용 가능한 정형 AI 엔진을 구축하고 있습니다. 이 플랫폼을 통해 조직은 기존 시스템에서 비즈니스 규칙을 직접 수집하고, 해당 규칙에 따라 의사결정을 지속적으로 검증하며, 명확히 정의된 범위 안에서 AI 에이전트를 안전하게 배포할 수 있습니다.
저희의 비전은 대규모 의사결정을 가속하는 동시에 운영 위험을 줄이는 것입니다. 리더는 자연어 입력을 바탕으로 정책을 준수하는 결정을 더 빠르게 내릴 수 있고, 조직은 일정 관리, 공급망 자원 배분, 금융 운영, 정책 검증은 물론 영상이나 3D 설계의 임시 변경까지 자동화할 수 있습니다. 기본 제공 안전장치는 실행 불가능하거나 규정을 위반하거나 안전하지 않은 결과가 프로덕션에 반영되지 않도록 막습니다.
물류형 최적화 문제와 3개의 공개 벤치마크를 대상으로 한 통제 실험에서 하이브리드 접근법은 일관되게 다음과 같은 성과를 보였습니다.
더 높은 정확도
더 높은 해석 가능성과 감사 가능성
저희 접근법은 일반적인 ‘LLM이 모든 것을 처리하는’ 패러다임을 뒤집고 다음 설계를 따릅니다.


이 접근법은 역할을 명확히 분리합니다. LLM은 자연어에서 규칙과 제약을 추출하고, OR-Tools, Z3, Pyomo 같은 결정론적 솔버는 최적화와 검증을 담당합니다. 그 결과 두 접근법의 강점을 모두 활용할 수 있습니다.
LLM | 솔버 | 하이브리드(LLM + 솔버) | |
|---|---|---|---|
다양한 영역에서 인간의 의도 이해 | ✅ 탁월함 | ❌ 불가능 | ✅ 탁월함 |
결정론적 동작 | ❌ 아니요 | ✅ 보장됨 | ✅ 예 |
여러 제약이 있는 수학적 추론 및 최적화에서 입증 가능한 정확성 | ⚠️ 취약함 | ✅ 보장됨 | ✅ 예 |
감사 가능성과 해석 가능성 | ⚠️ 취약함 | ✅ 명확함 | ✅ 명확함 |
프롬프트 노이즈 및 인젝션에 대한 내성 | ❌ 취약함 | ✅ 영향 없음 | ✅ 강함 |
저희는 일부 고객이 겪는 다음 과제에서 출발했습니다.
운영, 정책, 비용 제약을 엄격히 적용하면서 자연어 요청을 최적의 실시간 자원 의사결정으로 전환하는 것.
이 과제는 인력 일정 관리, 자산 배분, 경로 설정, 주문 처리 계획, 용량 관리 등 현대 물류 및 공급망의 핵심에 자리합니다. 신뢰할 수 있는 시스템을 만들기 위해 LLM과 정형 솔버가 협력해야 하는 영역이기도 합니다. 평가를 위해 통제된 테스트 시나리오, 데이터 소스, 제약과 함께 240개의 합성 쿼리를 구성했습니다. 예시는 다음과 같습니다.
Please revise the existing schedule following a cancellation. The target facility must be fully supplied by 24 December 2025. When possible, source inventory from a nearby warehouse and route it through a specific consolidation point. The earliest allowable start date is 14 December 2025.
Last-minute request: a VIP will arrive at location A in three hours. We need the required staff on site within two hours. Please adjust staff allocations while minimizing changes to the existing schedule.
이러한 쿼리에서 볼 수 있듯이, 시스템은 자연어 요청에서 하드 제약과 소프트 제약을 직접 추출해 안정적으로 적용해야 합니다.
하드 제약은 타협할 수 없는 조건입니다(예: 가장 이른 시작일, 계약 조건, 최대 용량). 이 중 하나라도 위반하면 해법은 무효가 됩니다.
소프트 제약은 지연 최소화, 비용 절감, 변경 제한 같은 선호 사항을 나타냅니다. 목표는 하드 제약의 경계를 넘지 않으면서 최적화하는 것입니다.
이러한 최적화 문제의 일부 요소는 완전히 미리 정의할 수 없습니다. 구조화된 비즈니스 로직, 내부 문서, 운영 데이터에 미리 정의된 제약과 목표뿐 아니라 사용자 요청도 활용해 동적으로 구성해야 합니다.
이 환경에서 각 기법의 성능을 파악하기 위해 세 가지 접근법을 구현하고 비교했습니다.
순수 LLM: 가장 단순한 접근법으로, 모든 관련 데이터와 사용자의 자연어 요청을 단일 LLM 프롬프트에 전달하고 최적의 계획이나 배정을 생성하도록 합니다. 작거나 제약이 느슨한 문제에서는 효과가 있을 수 있지만, 복잡성이 커지면 제대로 작동하지 않습니다. 모델이 제약을 무시하거나 잘못된 목표를 우선시하거나, 합리적으로 들리지만 실행 불가능한 계획을 만들 수 있으며, 이러한 실패를 안정적으로 감지하거나 방지할 방법도 없습니다.
LLM + 코드 인터프리터: 이 접근법에서는 LLM이 요청을 해석하고 도구를 사용해 데이터 소스에 접근하며 실행 가능한 최적화 코드를 생성합니다. 유연성과 관찰 가능성이 높아지지만 신뢰성은 여전히 문제입니다. 여전히 LLM이 제약을 정확한 코드로 변환해야 하며, 특히 제약이 늘어나면 사소한 추론이나 코딩 오류도 유효하지 않거나 최적이 아닌 결과를 낳을 수 있습니다.
하이브리드: LLM → 구조화된 제약 → 결정론적 솔버: 세 번째 접근법은 역할을 분리합니다. LLM은 결과를 직접 ‘결정’하지 않으며 변수, 제약, 목표를 정형화하는 역할을 합니다. 검증된 최적화 솔버가 제약을 적용하고 실행 가능성을 보장하며, 검증하고 감사할 수 있는 결과를 생성합니다. LLM의 역할은 미리 정의된 스키마를 사용해 자연어 요청을 명시적이고 구조화된 제약으로 변환하는 데 한정됩니다. 이러한 제약은 OR-Tools 같은 솔버 코드로 자동 컴파일되며, 솔버는 실행 가능하고 최적인 해법을 결정론적으로 계산합니다.
GPT-5, GPT-5.1, GPT-5.2를 비롯한 여러 LLM으로 각 방법을 테스트했습니다. 예상대로 하이브리드 접근법은 다른 방법보다 뛰어난 성능을 보였습니다.
방법 | 배정 정확도 | 평균 지연 시간 | 쿼리당 사용 토큰 |
|---|---|---|---|
순수 LLM | 70~78% | 62~190초 | 약 175,000 |
LLM + 코드 인터프리터 | 82~84% | 62~140초 | 약 9,000 |
LLM → 솔버(하이브리드) | 95~97% | 6~25초 | 약 2,000 |
저희 하이브리드 방법은 정확도를 크게 높이고, 토큰 효율을 4배 이상 향상하며, 지연 시간을 10분의 1 수준으로 단축합니다.
다음 단계는 자연어를 구조화된 의미 표현으로 변환하고, 백엔드에서 이를 솔버 실행용 코드로 바꿀 수 있는 범용적이고 재사용 가능한 인터페이스를 구축하는 것입니다. 이 실험에서는 선형 최적화 문제에 집중하고 세 가지 공개 데이터세트(NLP4LP, NL4OPT, IndustryOR)를 기준으로 접근법을 평가했습니다.
독립형 LLM
하이브리드 방법(LLM → 구조화된 규칙 → 솔버 → 검증된 출력)


LLM을 사용해 입력에서 변수, 제약, 목표를 추출하고 구조화된 최적화 문제를 정형화합니다.
자체 검증을 위해 구조화된 문제와 원래 요청을 LLM에 전달합니다.
구조화된 문제를 OR-Tools 코드로 변환해 최적의 배정을 계산합니다.
GPT-5.1, GPT-5 mini, GPT-5.1-Codex-Max, GPT-5.2를 비롯한 독점 프런티어 모델과 Kimi K2, GPT-OSS 모델, MiniMax M2 같은 오픈 소스 모델을 사용해 이 접근법을 평가했습니다. 상자 수염 그림은 각 방법의 결과를 요약합니다.


평가한 기반 언어 모델 거의 모두에서 하이브리드 접근법은 독립형 LLM 기준선보다 일관되게 더 정확하고 안정적이며 검증 가능한 결과를 냅니다. 절대 성능은 모델마다 다르지만 하이브리드 접근법의 상대적 개선 효과는 일관되게 나타납니다. 이는 성능 개선이 특정 모델의 추론 능력에 의존해서가 아니라 자연어 이해와 정형 최적화를 분리한 데서 비롯됨을 시사합니다.
정확도
주로 선형 계획법 문제로 구성된 NLP4LP와 NL4OPT에서 하이브리드 방법은 상한에 가까운 정확도를 달성하며 독립형 LLM 프롬프트보다 뛰어난 성능을 보입니다. 하이브리드 시스템은 ‘대략 맞는’ 추론을 내놓는 대신 유효하고 올바르게 구성된 수학적 정형식을 더 일관되게 생성합니다. 더 어려운 IndustryOR 데이터세트에서는 두 방법 모두 정확도가 낮아지지만 그 이유는 서로 다릅니다. 많은 IndustryOR 문제에는 차량 경로 설정, 작업 순서 지정, 인력 배정 같은 조합 구조가 포함되며, 이는 현재 솔버 백엔드가 지원하는 선형 최적화 역량을 넘어섭니다.
실패 양상을 분석한 결과, 아래 예시와 같이 독립형 LLM이 필수 제약을 자주 위반하는 것으로 나타났습니다.
예시 1:
Plain Text
독립형 LLM은 총지방이 더 적은 해법을 내놓지만, 칠면조 식사가 전체 식사의 40%를 넘지 않아야 한다는 요건을 위반합니다. 하이브리드 접근법은 이 하드 제약을 정확히 적용해 유효한 답을 반환합니다.
예시 2:
Plain Text
독립형 LLM은 다시 더 적은 배출량을 내는 해법을 제시하지만, 허용된 진통제 최대 한도를 초과합니다. 하이브리드 접근법은 해당 하드 제약을 정확히 적용해 유효한 답을 반환합니다.
지연 시간과 토큰 사용량
지연 시간과 토큰 사용량 데이터는 중요한 차이를 보여 줍니다. 하이브리드 접근법은 단일 실행 LLM 프롬프트보다 평균 지연 시간과 토큰 사용량이 많지만, 이는 비효율이 아니라 아키텍처 설계에서 비롯된 결과입니다.
하이브리드 파이프라인에는 다음이 포함됩니다.
구조화된 변수, 제약, 목표를 추출하기 위한 한 번 이상의 LLM 호출.
내부 불일치를 포착하는 자체 검증 단계.
이러한 단계는 단일 프롬프트보다 오버헤드가 크지만 지연 시간은 제한적이고 예측 가능하며, 문제가 제대로 정형화되면 솔버 실행은 대개 빠릅니다. 이 추가 작업을 통해 명시적이고 재사용 가능하며 감사 가능한 중간 표현이 생성됩니다. 반면 독립형 LLM 접근법은 추론을 불투명한 단일 생성 과정에 압축해 재시도, 수동 검사, 후속 장애로 비용을 전가합니다. 향후에는 다음 방법으로 이러한 오버헤드를 줄일 수 있습니다.
추출된 스키마 캐싱.
제약의 점진적 업데이트.
프롬프트 및 호출 오케스트레이션 개선.
투명성과 감사 가능성
마지막으로 두 방법이 모두 실패하는 경우에도 실패 양상 자체는 근본적으로 다릅니다.
독립형 LLM에서는 실패가 드러나지 않는 경우가 많습니다. 모델이 미묘하게 잘못된 결과를 반환할 수 있습니다.
하이브리드 접근법에서는 문제를 명시적으로 정형화하므로 실패가 투명하게 드러나며, 팀은 정형화 과정의 어느 부분이 오류를 일으켰는지 파악할 수 있습니다.
향후 버전에서는 이러한 정형화 내용을 인터페이스에 표시해 사용자가 솔버 실행 전에 감사하거나 검증할 수 있도록 할 수 있습니다. 이러한 투명성은 측정 정확도를 높이고 시스템의 디버깅과 개선을 용이하게 합니다. 이는 실제 환경에 배포할 때 필수적입니다.
핵심 요점
모든 벤치마크와 테스트한 기반 모델 대부분에서 나타난 결과는 저희 작업의 핵심 결론을 뒷받침합니다.
LLM은 의도를 이해하고 변환하는 데 뛰어나지만, 정확성을 강제하려면 결정론적 솔버가 필수적입니다.
하이브리드 접근법은 모호성의 원천이던 자연어를 수학적으로 타당한 의사결정을 위한 신뢰할 수 있는 인터페이스로 바꾸어, 엔터프라이즈 AI가 지능적일 뿐만 아니라 신뢰할 수 있는 시스템에 한 걸음 더 가까워지게 합니다.
엔터프라이즈의 제약이 깔끔한 스키마나 완벽하게 작성된 프롬프트 형태로 존재하는 경우는 드뭅니다. 이러한 제약은 데이터베이스, 스프레드시트, 내부 정책, 계약서 곳곳에 흩어져 있습니다. 사용자 요청은 불완전하거나 모호할 수 있으며 비즈니스 규칙과 모순될 수도 있습니다. 이 접근법을 대규모로 구현하기 위해 저희는 이러한 복잡성을 신뢰할 수 있는 엔터프라이즈 기능으로 전환하는 재사용 가능 백엔드 엔진을 구축하고 있습니다.


이 엔진은 AI 기반 의사결정 시스템의 정형화된 중추 역할을 하며 다음 기능을 제공합니다.
비즈니스 규칙, 제약, 변수, 목표를 수집하는 어댑터가 포함된 기호 지식 베이스.
스키마를 솔버 코드로 컴파일하는 변환 계층.
팀이 제약을 검사, 감사, 수정할 수 있는 인터페이스.
현재 실험은 최적화에 초점을 맞추고 있지만 같은 방법을 논리 검증에도 확장할 수 있습니다. 잠재적인 비즈니스 활용 사례는 다음과 같습니다.
모든 운영 제약을 적용하면서 임시 동적 일정 관리, 경로 설정, 자원 배분 수행.
비즈니스 규칙을 일관되게 준수하는 답변과 추천 생성.
복잡한 3D 객체, 영상, 아키텍처를 설계하고 검증하며 프로덕션 전에 실행 불가능한 설계 감지.
오늘날 AI는 강력하지만, 기업에는 성능만으로는 부족합니다. 정확성, 일관성, 통제력이 필요합니다. 저희의 하이브리드 LLM·솔버 시스템은 다음과 같은 세상을 향한 한 걸음입니다.
에이전트가 존재하지 않는 규칙이나 제약을 지어내지 않습니다.
논리적 연역과 최적화가 수학적으로 타당합니다.
자연어가 결정론적 시스템을 위한 범용 인터페이스 역할을 합니다.