고위험 기업을 위한 안전한 채팅 에이전트 구축

브랜드를 대표하는 챗봇은 안전하기만 해서는 안 됩니다. 그 브랜드만의 고유한 목소리를 진정성 있게 담아야 합니다.

핵심 요약

  • 대중에게 공개되는 대규모 언어 모델(LLM) 애플리케이션은 브랜드를 평판 및 재정적 위험에 노출시킬 수 있습니다.

  • 저희는 계층형 분류 필터를 사용해 LLM 탈옥과 기타 의도치 않은 LLM 동작으로 인한 피해를 줄입니다.

  • 이 방식을 하루 40,000건 이상의 메시지를 처리하며 계속 성장 중인 대규모 프로덕션 애플리케이션에 적용했습니다.

소개

지난 1년간 선도적인 게임 개발사와 협력해 어린이를 포함한 플레이어층으로부터 하루 약 40,000건의 메시지를 처리하는 생성형 AI 챗봇을 배포했습니다. 속도, 정확성, 안전성, 재미의 균형을 맞추는 것이 중요합니다.

브랜드를 대표하는 챗봇은 안전하기만 해서는 안 됩니다. 그 브랜드만의 고유한 목소리를 진정성 있게 담아야 합니다.

게임 회사라면 특히 어린 이용자를 위해 안전성과 재미, 이용자의 흥미를 조화시켜야 합니다.

최신 생성형 AI 애플리케이션의 기반인 LLM은 유연성이 매우 높아 다양한 문제에 잘 일반화되지만, 제약이 충분하지 않다는 문제도 있습니다. 따라서 종종 예상 경로를 벗어나 매우 다양한 텍스트를 반환하며, 그중에는 부적절한 내용이 포함될 수도 있습니다.

LLM을 대중에게 직접 공개하면 예상치 못한 동작이 반드시 발생하며, 적절한 완화 조치가 없을 경우 다음과 같은 위험이 있습니다.

현실에서 발생하는 위험 살펴보기…

의도치 않은 LLM 사용으로 보도된 사건:

이러한 사건은 생성형 AI 시스템의 안전성을 구축하고 유지하는 일이 선택 사항이 아닌 이유를 분명히 보여 줍니다. 특히 어린이가 이용한다면 면책 고지에만 의존할 수 없습니다. 콘텐츠의 적절성을 유지하려면 강력한 안전장치가 필수적입니다.

접근 방식: 계층형 분류와 프롬프트 캐싱

고객을 위해 구축한 RAG(검색 증강 생성) 시스템과 마찬가지로, 여러 AI 구성 요소를 활용해 높은 성능을 유지하면서 탈옥 위험을 줄입니다.

계층형 분류와 프롬프트 캐싱이라는 접근 방식을 보여 주는 다이어그램.

시스템의 간소화된 아키텍처 다이어그램

시스템 안전성을 확보하기 위해 입력과 출력 모두에 LLM 분류기를 사용합니다.

  1. 입력 분류(동시 실행)

  • Pydantic 스키마와 LLM 구조화된 출력값을 함께 사용해 사용자 쿼리에 레이블을 지정했습니다(예: SAFE, SUSPICIOUS, CHILD_HARM_RISK, VIOLENT 등). 여기에는 탈옥이나 허용되지 않는 동작을 식별하는 플래그도 포함했습니다.

  • 모든 것을 포괄하는 하나의 대형 분류기보다 주제별로 여러 분류기를 사용하는 편이 성능이 훨씬 뛰어났습니다.

  • 분류기가 게임을 가리키는 “I keep being killed by this character”와 아동 피해의 징후인 “I am being hurt by my parent”를 구분하려면 다양한 퓨샷 예시가 매우 중요했습니다.

  • 고객 및 고객사의 신뢰·안전 전문팀과 긴밀히 협력해, 실제 상황에서 고위험 메시지를 판단하는 방식을 분류기에 반영했습니다.

계층형 분류와 프롬프트 캐싱이라는 접근 방식을 보여 주는 다이어그램.

  1. 응답 생성

  • 입력이 안전하다고 판단되면 기본 LLM이 응답을 생성합니다.

  • 그렇지 않으면 메시지를 무시하거나(탈옥인 경우), 사람에게 전달할 수 있습니다(쿼리에서 안전 문제가 감지된 경우).

  1. 출력 분류

  • 최종 응답을 전달하기 전, 애플리케이션을 벗어나기 전에 모델의 응답을 분류합니다.

  • 일부 응답은 인터넷에서 수집한 데이터에 RAG 기법을 적용해 생성될 수 있으므로, 이 단계는 데이터 오염으로부터 시스템을 보호합니다.

  • 허용되지 않는 콘텐츠가 포함되어 있으면 시스템이 개입해 일반적인 메시지로 대체합니다. 실제로 이런 경우는 거의 없었지만, 에이전트가 계속 적절하게 동작하도록 보수적인 보호 계층을 추가한 것입니다.

속도와 경제성을 유지하기 위해:

  • 자주 사용하는 프롬프트와 대화 일부를 엄선된 퓨샷 예시와 함께 저장합니다.

  • 이러한 캐싱 덕분에 매번 컨텍스트를 다시 구성하지 않고도 LLM 분류기를 빠르고 저렴하게 적용할 수 있습니다.

계층형 분류와 프롬프트 캐싱이라는 접근 방식을 보여 주는 다이어그램.

미래 전망: 헌법적 분류기

최근 Anthropic 연구에서는 ‘헌법적’ 규칙으로 학습한 추가 분류기를 사용해 악의적이거나 안전하지 않은 요청을 탐지하는 시스템인 헌법적 분류기(Constitutional Classifiers)를 소개했습니다. 연구진은 다음과 같은 결과를 보고했습니다.

  • 수천 시간의 사람 주도 레드팀 테스트에도 높은 견고성을 유지합니다.

  • 과도한 거부율이 매우 낮고 추가 컴퓨팅 부담도 크지 않습니다.

앞으로 이러한 헌법적 접근 방식이 기존 분류 계층을 보완하거나 대체해, 진화하는 탈옥 수법에 더욱 포괄적으로 대응할 수 있을 것으로 봅니다.

요약: 프로젝트에서 얻은 교훈

  1. 병렬로 작동하는 경량 필터

분류 계층은 악의적인 쿼리가 생성형 핵심 모델에 도달하지 못하게 하고, 부적절한 출력이 사용자에게 전달되는 것을 방지합니다.

  1. 사용자 경험의 중요성

재미있고 게임 세계관에 맞는 경고와 유쾌한 거부 메시지를 활용하면 사용자가 시스템의 제약을 더 쉽게 받아들입니다.

  1. 테스트와 모니터링을 소홀히 하지 마세요

정기적인 레드팀 테스트와 플레이어 행동에 대한 빈번한 모니터링을 병행하면 취약점이 일반 플레이어층에 알려지기 전에 발견할 수 있습니다. 발견한 취약점을 퓨샷 분류기 프롬프트에 다시 반영하면 이후 악용을 방지할 수 있습니다. 현재는 수동으로 처리하지만 자동화할 수도 있습니다.

미래를 위한 안전하고 매력적인 생성형 AI 시스템 구축

게임 회사든 은행이든 정부 부처든, 고객 서비스 챗봇을 대규모로 도입하려면 사용자 중심 설계와 신뢰성을 모두 목표로 삼아야 합니다.

저희는 다음이 중요한 조직과 브랜드를 위해 고객용 솔루션을 구축합니다.

  1. 안전이 최우선인 경우—사용자에게 가치를 제공하면서도 유해 콘텐츠로부터 사용자를 철저히 보호하는 챗봇을 구축합니다.

  2. 평판을 보호해야 하는 경우—사용자가 시스템의 한계를 넘으려 해도 브랜드 평판을 지킬 수 있도록 여러 보호 계층을 설계합니다.

  3. 규제로 선택지가 제한되는 경우—최신 규정 준수 지침을 지속적으로 파악해, 애플리케이션의 탈옥을 걱정하지 않고 솔루션을 확장할 수 있도록 지원합니다.

작성자

Andrew Liubinas