인셉션(Inception)이 음성 에이전트용 언어 모델 ‘머큐리 보이스(Mercury Voice)’를 기업 고객에게 정식 출시했다. 인셉션은 현지 시각 9월 29일 공식 블로그에서 출시를 발표했다. 머큐리 보이스는 9월 8일 머큐리 2.5와 함께 미리 공개된 모델이다.
머큐리 보이스는 확산 방식 언어 모델(dLLM)이다. 기존 언어 모델은 단어를 앞에서부터 하나씩 생성하지만, 확산 모델은 대략적인 답을 먼저 만든 뒤 여러 위치를 동시에 다듬어 답을 완성한다. 머큐리 보이스는 추론과 도구 호출을 지원하고 긴 시스템 프롬프트를 따를 수 있다. 시스템 프롬프트는 모델의 역할과 규칙을 미리 정해 두는 지시문을 말한다.
인셉션은 실제 고객 상담 프롬프트로 첫 답변 토큰이 나오기까지 걸린 시간을 측정했다. 중앙값은 320밀리초였고, 요청 100건 중 95건이 750밀리초 안에 응답했다. 오픈AI GPT-6 루나(추론 미사용)보다 5.9배 빠른 수치다. 사람과 자연스럽게 대화하려면 500밀리초 안팎에서 답이 나와야 하는데, 인셉션은 비교 모델 가운데 중앙값이 500밀리초보다 짧은 모델은 머큐리 보이스의 낮은 추론 강도 설정뿐이었다고 밝혔다.
답변 품질은 통신·소매·항공 고객 상담을 재현한 τ³-벤치와 지시 이행 평가 IFBench, 도구 호출 평가 BFCL v4를 묶은 종합 점수로 비교했다. 머큐리 보이스는 젬마 4 31B와 GPT-6 루나, GLM-5.3-플래시, 큐원3.5-397B보다 높은 점수를 기록했다.
추론 강도는 낮음·중간·높음 세 단계로 조절할 수 있고, 맥락창은 12만 8,000토큰, 최대 출력은 5만 토큰이다. 맥락창은 모델이 한 번에 참고할 수 있는 텍스트 양을 뜻한다. 가격은 100만 토큰당 입력 0.40달러(약 540원), 출력 1.50달러이며, 출시 할인으로 절반 가격인 0.20달러와 0.75달러를 적용한다. 할인 종료일은 공개하지 않았다. 인셉션은 대화 1분당 비용이 약 0.009달러로 GPT-4.1(약 0.045달러)보다 5배가량 저렴하다고 설명했다.
드라이브스루 주문 AI를 만드는 오디비(Audivi AI)와 금융기관을 대신해 상환 계획을 협상하는 음성 에이전트 기업 알투르(Altur), 오픈콜(OpenCall)이 머큐리 보이스를 사용하고 있다. 페드로 페르난데스 알투르 최고기술책임자는 “지금까지 시험한 모델 중 가장 빠르다”며 “언어 모델 때문에 응답이 늦어지지 않은 것은 처음”이라고 말했다.
머큐리 보이스는 기업 고객에게만 제공되며, 오픈AI와 호환되는 API로 연결한다. 라이브킷(LiveKit)과 파이프캣(Pipecat), 바피(Vapi), 레트엘(Retell) 같은 음성 에이전트 개발 도구와 함께 쓸 수 있다.
자세한 내용은 인셉션 공식 블로그에서 확인할 수 있다.
이미지 출처: 인셉션
AI Matters 뉴스레터 구독하기




아