대규모 실시간 음성 경험을 구현하는 핵심 요소

타이밍, 끼어들기, 침묵, 대화 회복은 단어만큼이나 경험을 좌우합니다.

핵심 요약

  • 실시간 음성은 AI 기반 애플리케이션과 상호작용하는 방식을 근본적으로 바꾼다. 사용자는 입력하거나 메뉴를 탐색하는 대신 자연스럽게 말하고, 실시간 속도감과 감정적 맥락이 담긴 응답을 받는다.

  • 뛰어난 실시간 음성 경험을 구축하려면 라이브 상호작용을 조율해야 한다. 진정한 제품 개발은 여기서 시작된다. 실시간 경험은 즉각적이고 생생하다. 이를 지속적으로 제공하는 애플리케이션을 구축하는 일은 별개의 엔지니어링 과제다.

  • 모델은 시스템의 한 부분일 뿐이다. 프로덕션 애플리케이션에는 음성 중심 인프라, 대화 흐름과 심층 추론의 명확한 분리, 진행 중인 세션을 관리하는 이벤트 기반 제어가 필요하다.

  • 남아 있는 어려움의 상당 부분은 가드레일과 평가에 있다. 안전 검사는 라이브 오디오의 속도를 따라가야 한다. 타이밍, 어조, 대화 흐름처럼 순간적으로 나타나는 대화 특성은 기존 평가 전략으로 측정하기 어렵다.

소개: 제품 접점으로서의 실시간 음성

오늘날 대부분의 음성 지원 AI 애플리케이션은 여전히 같은 방식으로 작동한다. 음성이 입력되면 텍스트로 바뀌고, 모델이 생각한 뒤 합성 음성이 답변을 읽어 준다. 이 방식도 작동한다. 하지만 상호작용은 대화가 아니라 파이프라인처럼 느껴진다. 실제로도 그렇기 때문이다.

실시간 음성은 이를 바꾼다. 사용자는 자연스럽게 말하고 속도감과 어조, 감정적 맥락이 담긴 응답을 받는다. 연쇄형 음성-텍스트 변환 파이프라인보다 빠르고 유연하며, 시스템을 조작하기보다 사람과 대화하는 느낌에 가깝다.

이로 인해 파이프라인 아키텍처로는 구현하기 어려운 제품 접점이 열리는 것을 확인했다. 실시간 음성 에이전트는 길고 제한적인 IVR 메뉴와 부서 간 연결이 필요했던 고객 서비스 상호작용을 처리할 수 있다. 코칭과 온보딩을 제공하고, 여러 매체에서 접근성을 지원하는 등 다양한 역할도 수행할 수 있다. 텍스트 기반 인터페이스보다 음성 대화가 유리한 곳이라면 어디든 실시간 음성을 구축할 가치가 있다.

연쇄형과 실시간 방식: 내부에서는 무엇이 달라지는가

대부분의 음성 지원 애플리케이션은 음성-텍스트 변환, 언어 처리, 텍스트-음성 변환을 담당하는 개별 모델을 연결한 이른바 ‘연쇄형 접근 방식’을 사용한다. 이러한 시스템은 원활하게 작동하고 폭넓은 기회를 열어 주지만, 오디오는 파이프라인의 양 끝에만 존재한다. 분리된 각 단계는 정해진 구조와 지연을 더해 실제 대화보다 부자연스러운 상호작용을 만든다.

실시간 음성은 다른 방식을 취한다. 듣기, 생각하기, 말하기에 각각 별도의 모델을 쓰지 않고 단일 모델이 세 가지를 모두 기본적으로 처리하며, 오디오와 전사문을 동시에 이해하고 생성한다. 입력과 출력이 연속적으로 이루어지므로 시스템은 자연스러운 타이밍과 감정이 담긴 응답으로 라이브 대화의 현실적인 리듬을 유지할 수 있다. 그 결과 타이밍, 어조, 끼어들기 처리가 제품의 핵심 요소가 된다.

연쇄형 음성 파이프라인과 사용자 오디오에서 오디오 및 전사문을 직접 출력하는 실시간 음성 모델을 비교한 다이어그램.

실시간 경험은 즉각적이어서 매력적이지만 어느 쪽도 차례를 기다리지 않기에 구현하기 어렵다. 이를 지원하려면 빠르고 정확한 오디오 생성만으로는 부족하다. 어려운 부분은 그 밖의 모든 요소다. 모델은 라이브 세션 안에서 작동한다. 따라서 모델을 둘러싼 상태, 안전, 오케스트레이션, 제어도 대화와 같은 실시간 속도로 함께 작동해야 한다.

연쇄형 음성 애플리케이션에서는 턴 기반 대화가 명확한 주고받기 구조를 제공한다. 사용자가 말하고 시스템이 응답한 뒤 다음 단계가 시작된다. 실시간 음성에는 이런 구조가 없다. 양쪽이 동시에 말할 수도 있고, 아무도 말하지 않아 침묵이 이어질 수도 있다. 사용자는 응답 도중에 끼어들거나 시스템이 말을 마치기 전에 후속 질문을 할 수 있다. 끼어들기는 더 이상 예외적인 상황이 아니라 핵심 상호작용 패턴이 된다.

이 패턴 때문에 실시간 애플리케이션은 근본적으로 조율의 문제가 되며, 모델을 둘러싼 시스템도 모델 자체만큼 중요해진다.

프로덕션에 필요한 요소

이러한 시스템을 대규모로 지원하려면 라이브 상호작용에 맞춰 설계해야 한다. 프로덕션에 도달한 시스템에서 반복적으로 나타나는 세 가지 요소가 있다.

음성 중심 인프라

실시간 음성 세션은 오디오 스트리밍, 발화 순서 조정, 끼어들기, 연결 수명 주기, 에이전트 실행을 처리해야 한다. 애플리케이션이 배포되는 환경에 따라 전화 통신 지원도 필요할 수 있다. 이들은 경험의 토대이자 애플리케이션 확장의 핵심 요소다.

첫 번째 요건은 음성 중심의 세션 계층이다. 실시간 통신(RTC) 프레임워크는 애플리케이션이 참여자를 관리하고 오디오를 스트리밍하며 전화 통신 환경에서 에이전트를 실행할 기반을 제공한다. 경험상 특히 Livekit이 유용했다. 고품질 노이즈 제거와 지터 감소 기능을 기본 제공하는 저지연 WebRTC 스택을 갖추고 있다. 복잡성을 감수하면서 이 계층을 직접 구현할 가치는 거의 없다.

말하기와 생각하기를 분리하라(적어도 지금은)

실시간 음성을 위한 멀티 에이전트 아키텍처의 핵심은 관심사 분리다.

실시간 음성 모델은 대화형 오디오 스트리밍에는 매우 효과적이지만 심층 추론에 최적화되어 있지는 않다. 도구 호출, 검색, 구조화된 의사 결정과 같은 작업은 다른 모델에서 실행하는 편이 더 효과적이다.

유용한 패턴으로 응답기–사고기 아키텍처가 있다.

응답기는 실시간 음성 에이전트다. 듣기, 말하기, 끼어들기 처리, 대화 흐름 유지를 비롯한 라이브 상호작용을 담당한다. 응답기의 설계에서는 반응 속도, 명확성, 감정적 연속성을 우선한다.

사용자 오디오가 응답기로 전달되어 오디오로 출력되고, 사고기가 도구를 조율해 맥락을 다시 응답기에 전달하는 응답기-사고기 아키텍처 다이어그램.

사고기는 추론 역량을 갖춘 모델로 구동되는 별도의 에이전트다. 대화 경로 밖에서 작동하며 도구 사용, 검색, 계획 같은 작업을 처리한다. 응답기는 필요할 때 사고기를 호출하고 그 결과를 다시 대화에 반영할 수 있다.

경우에 따라 사고기가 추론을 직접 처리할 수도 있다. 또는 여러 전문 에이전트를 조율하는 오케스트레이터 역할을 할 수도 있다. 핵심은 추론 작업에 더 적합한 모델이 이 일을 맡는다는 것이다.

이점은 명확하다. 응답기는 빠르고 자연스러운 대화에 집중하는 한편, 사고기는 더 많은 시간이나 맥락, 구조가 필요한 작업을 처리할 수 있다.

향후 프런티어 모델의 발전으로 이 접근 방식이 불필요해질 수도 있다. 하지만 현재로서는 이 패턴이 단일 에이전트 방식보다 일관되게 뛰어난 성능을 보였다.

이벤트 기반 제어

실시간 음성 시스템에서는 자연스럽게 이벤트가 끊임없이 발생한다.

사용자는 말을 시작하고, 멈추고, 끼어든다. 전사문은 점진적으로 업데이트된다. 응답이 생성되고 스트리밍된다. 외부 결과가 도착한다. 세션 내부의 조건이 변한다. 이 모든 요소는 현재의 구체적인 대화 상태를 만든 핵심 이벤트로 포착하고 스트리밍하며 저장할 수 있다. 이벤트가 없으면 세분화되고 정밀한 개입을 할 수 없다.

이벤트 기반 접근 방식은 이를 관리하는 명확한 방법을 제공한다. 시스템은 이벤트가 발생할 때 이를 포착하고 세션 상태를 업데이트한 뒤 적절한 후속 조치를 실행한다.

가벼운 핸들러가 실시간 경로의 반응성을 유지하는 동안 상태 머신 업데이트, 지표 기록, 민감 정보 제거, 데이터베이스 업데이트, 세션 종료처럼 복잡한 작업은 비동기 백그라운드 작업으로 실행된다.

기능이 추가되면 이러한 백그라운드 작업의 수가 빠르게 늘어날 수 있다. 작은 제품 변경만으로도 새로운 이벤트 흐름과 종속성이 생길 수 있다. 동시성을 체계적으로 다루는 아키텍처는 시스템이 발전해도 이해하기 쉽고 안정적으로 유지하는 데 중요하다.

이벤트 기반 접근 방식은 대화 자체를 설계한다는 중요한 제품 과제도 지원한다. 실시간 오디오 시스템은 단순히 답변을 생성하는 데 그치지 않는다. 대화 속도를 조절하고 침묵과 끼어들기를 처리하며 세션을 언제, 어떻게 마칠지 결정한다. 이러한 동작은 제품 경험의 일부이므로 명시적으로 설계할수록 좋다.

턴 수, 경과 시간, 사용자 행동에 따라 세션 상태가 변하면 시스템은 응답기에 맞춤형 지침을 전달할 수 있다. 예를 들어 세션 제한에 가까워지면 에이전트가 사용자의 마무리를 돕도록 유도하거나, 상호작용이 정체되면 설명을 제공하게 할 수 있다. 이러한 개입은 가볍지만 경험을 의도적이고 일관되게 느끼도록 만든다.

잘 설계된 시스템은 누가 말하고 있는지, 대화가 어떻게 진행되는지, 어떤 조건이 충족되었는지 등 세션 상태를 명확히 파악한다. 이벤트 스트림을 통해 계속 업데이트되는 이 상태를 바탕으로 적시에 적절한 지침을 제공할 수 있다.

가드레일도 실시간 속도에 맞춰 작동해야 한다

사용자 대상 AI에서 가드레일은 선택 사항이 아니다. 가드레일은 안전, 규정 준수, 오용, 안정성을 관리한다. 턴 기반 시스템에서는 가드레일을 실행할 명확한 시점이 있다. 사용자가 말을 마친 뒤나 응답을 전달하기 전이다.

실시간 음성에서는 이처럼 여유 있는 점검 시점이 대부분 사라진다. 사용자 입력은 끊임없이 들어온다. 오디오 출력도 이미 스트리밍 중일 수 있다. 완성된 전사문은 실제 음성보다 늦게 나오는 경우가 많다. 시스템이 메시지가 완성될 때까지 기다렸다가 검사하면 대화는 더 이상 실시간처럼 느껴지지 않는다.

따라서 생생한 상호작용을 유지하려면 대화와 동시에 가드레일을 가동해야 한다. 한 가지 방법은 오디오를 버퍼로 스트리밍하면서 전사문 조각이 나오는 대로 비동기 평가하는 것이다. 그러면 상호작용을 차단하지 않고 거의 실시간으로 안전 검사를 실행할 수 있다.

세션 중 라이브 오디오와 전사문 조각을 검사하는 실시간 가드레일과 응답 전후에 입력 및 출력을 검사하는 턴 기반 가드레일을 비교한 다이어그램.

가드레일이 작동하면 시스템은 맥락에 맞춰 대화의 방향을 바꾸거나 행동을 조정하고, 필요한 경우 세션을 종료할 수 있다. 이렇게 하면 사용자 경험을 저해하지 않으면서 가드레일을 실시간으로 작동시킬 수 있다.

실시간 평가는 어렵다

실시간 대화 시스템 평가에서 가장 어려운 점은 핵심 품질 요소인 타이밍, 끼어들기, 대화 흐름, 어조를 전사문만으로는 평가할 수 없다는 것이다.

일반적인 평가 파이프라인은 현실적인 시나리오를 시스템에 입력하고 출력을 관찰해 점수를 매긴다. 텍스트 기반 시스템이나 연쇄형 오디오 시스템에서는 간단하다. 텍스트를 입력하고 출력된 텍스트를 확인하면 된다. 실시간 시스템의 입력은 라이브 오디오이며, 가장 중요한 대화 역학은 시간의 흐름 속에서 드러난다. 에이전트가 겹치는 발화를 어떻게 처리하는지, 얼마나 빨리 응답하는지, 끼어들기 후 어떻게 대화를 회복하는지가 중요하다.

에이전트와 직접 대화하는 수동 테스트는 이러한 특성을 포착하지만 대규모로 확장하기 어렵다. 전사문 기반 자동화는 확장할 수 있지만 좋은 실시간 경험과 나쁜 경험을 가르는 신호를 제거한다.

한 가지 방법만으로는 충분하지 않다. 실용적인 해법은 다음 방법을 함께 사용하는 것이다.

  • 에이전트 간 평가: 특정 사용자 페르소나를 연기하도록 지시받은 두 번째 실시간 에이전트가 테스트 대상 시스템과 대화한다. 세 번째 LLM이 심사자 역할을 맡아 상호작용을 평가한다. 이를 통해 타이밍과 끼어들기 처리를 포함한 전체 오디오 경로를 대규모로 테스트할 수 있다.

  • 비기능 지표: 첫 오디오 출력까지 걸린 시간과 전사문 감성 분석은 대화 품질을 정량적으로 가늠할 수 있는 대리 지표다.

  • 수동 정성 검토: 자동화 지표가 놓치는 문제, 특히 어조와 자연스러움에 관한 문제를 발견하는 데 여전히 필수적이다.

어느 한 가지 방법도 모든 요소를 다루지는 못한다. 실시간 에이전트를 프로덕션에 배포하려면 세 가지 방법을 모두 함께 사용해야 한다. 그럼에도 실시간 오디오 평가 도구는 텍스트 기반 AI 평가 도구보다 아직 미성숙하다.

결론

실시간 음성은 제품의 형태를 바꾼다. 사용자는 단어만큼이나 타이밍, 끼어들기, 침묵, 대화 회복을 직접 경험한다.

즉, 모델은 시스템의 한 부분일 뿐이다. 프로덕션용 실시간 음성 시스템에는 음성 중심의 세션 계층, 말하기와 추론의 명확한 분리, 라이브 세션을 둘러싼 이벤트 기반 제어가 필요하다. 가드레일은 여전히 지연 시간의 병목이지만 창의적인 접근 방식으로 실시간 경험을 상당 부분 유지할 수 있다.

기술 스택에서 가장 취약한 부분은 여전히 평가다. 실시간 음성 경험의 품질을 좌우하는 타이밍, 어조, 끼어들기 처리, 대화 흐름을 테스트할 확립된 방법은 아직 없다. 그런 방법이 나오기 전까지 이 기술을 활용하는 팀은 자동화 테스트, 에이전트 간 실행, 수동 검토를 병행해야 한다.

작성자

Oliver Wood 및 Sam Smith