글로벌 AI 오디오 기업 일레븐랩스(ElevenLabs)가 감정 표현과 문맥 이해 능력을 강화한 차세대 텍스트 음성 변환(TTS) 모델 ‘일레븐 v4(Eleven v4)’와 실시간 대화에 초점을 맞춘 저지연 모델 ‘일레븐 v4 터보(Eleven v4 Turbo)’를 출시했다. 단순히 텍스트를 자연스럽게 읽는 수준을 넘어 상황과 등장인물, 감정의 흐름까지 반영하는 음성 생성과 빠른 응답 속도를 동시에 구현하는 데 초점을 맞췄다.
일레븐랩스는 일레븐 v4를 자사 TTS 모델 가운데 속도와 표현력을 크게 끌어올린 모델로 소개했다. 다양한 감정을 음성에 반영할 수 있고, 90개 이상의 언어를 지원해 콘텐츠 제작부터 오디오북, 광고, 게임, 대화형 AI 에이전트 등 폭넓은 분야에서 활용할 수 있도록 설계했다.
마티 스타니셰프스키(Mati Staniszewski) 일레븐랩스 공동창립자 겸 최고경영자(CEO)는 “AI는 과학과 코딩 분야에서 놀라운 발전을 이루고 있지만 경제와 사회의 많은 영역에서는 AI의 추론 능력 자체만큼 사람과 소통하는 방식이 중요하다”며 “일레븐 v4는 폭넓은 감정 표현과 문맥 인지 능력을 통해 예술 창작과 에이전트 경험을 한 단계 높이는 데 초점을 맞췄다”고 말했다.
텍스트 읽기 넘어 상황·감정까지 반영
일레븐 v4의 핵심은 텍스트에 담긴 문맥을 바탕으로 말투와 속도, 감정 등을 조정하는 표현력이다. 기존 TTS가 입력된 문장을 자연스러운 음성으로 변환하는 데 집중했다면, 일레븐 v4는 등장인물의 성격과 장면의 분위기 등을 함께 해석해 긴박한 상황부터 부드러운 대화, 익살스러운 표현까지 구현하도록 설계됐다.
사용자는 자연어로 원하는 발화 방식을 지정할 수 있다. 문장 안에 ‘[웃음]’, ‘[영국식 억양으로 화난 듯 말함]’, ‘[가벼운 빗소리]’, ‘[휴대전화 진동음]’ 등의 태그를 넣어 감정과 억양, 발화 스타일뿐 아니라 일부 음향 효과도 설정할 수 있다.
피오트르 다브코프스키(Piotr Dabkowski) 일레븐랩스 공동창립자 겸 최고기술책임자(CTO)는 “일레븐 v4는 더욱 폭넓은 감정 표현 범위와 세밀한 제어 기능을 제공하는 새로운 아키텍처를 기반으로 설계됐다”며 “오디오와 운율에 대한 이해도를 바탕으로 보다 풍부한 연기와 화자 간 자연스러운 대화를 구현하는 데 중점을 뒀다”고 설명했다.
여러 명이 참여하는 대화 생성 성능도 개선됐다. 새로운 화자 식별 방식을 적용해 같은 콘텐츠를 여러 차례 생성하더라도 각 화자의 목소리 특성을 일관되게 유지하도록 했다. 오디오북이나 광고처럼 여러 인물이 등장하거나 긴 시간 동안 동일 인물의 목소리를 유지해야 하는 콘텐츠 제작에 활용할 수 있다.
개별 문장을 각각 생성한 뒤 연결하는 방식에서 한발 더 나아가 장면 전체의 맥락을 고려하는 기능도 강화했다. 앞선 화자의 발언을 토대로 다음 화자가 반응하는 방식으로 음성을 생성해 다자간 대화에서 보다 자연스러운 흐름을 구현한다는 것이 회사 측 설명이다.
‘일레븐 v4 터보’, 평균 100ms 중간 추론 지연
함께 공개된 일레븐 v4 터보는 음성 AI 에이전트처럼 빠른 응답이 필요한 환경에 초점을 맞춘 모델이다.
고품질 음성 생성 모델은 처리 시간이 늘어날수록 실제 대화에서 응답이 늦어질 수 있다는 한계가 있었다. 기업이 음성 기반 AI 상담이나 서비스 에이전트를 구축할 경우 응답 속도를 우선하면 표현력이 제한되고, 자연스러운 음성을 선택하면 지연 시간이 길어지는 문제가 발생할 수 있었다.
일레븐랩스는 v4 터보를 통해 이 같은 간극을 줄였다고 설명했다. 회사에 따르면 일레븐 v4 터보의 첫 응답 생성 과정에서 발생하는 중간 추론 지연 시간은 평균 100밀리초(ms)다. 실시간 상호작용에 대응할 수 있는 속도를 확보하면서 일레븐 v4의 감정 표현 능력도 유지하도록 설계됐다.
이에 따라 고객의 상황에 따라 부드럽고 안정적인 어조를 사용해야 하는 의료 분야의 안내 서비스나 빠른 대화와 다양한 표현이 요구되는 게임·엔터테인먼트 서비스 등에서 활용 가능성을 넓혔다.
일레븐 v4 터보는 일레븐랩스의 대화형 AI 에이전트 플랫폼 ‘일레븐에이전트(ElevenAgents)’와의 연동도 고려했다. 회사 연구·엔지니어링 팀은 v4 터보와 일레븐에이전트를 하나의 시스템으로 최적화해 표현력과 안정성을 유지하면서 지연 시간을 낮추는 데 초점을 맞췄다.
70개에서 90개 이상으로 지원 언어 확대
다국어 지원 범위도 늘었다. 일레븐 v4는 이전 세대인 v3가 지원했던 70개 언어에서 90개 이상의 언어로 지원 범위를 확대했다.
단순히 해당 언어의 단어를 정확하게 발음하는 데 그치지 않고 언어와 지역에 따라 달라지는 리듬, 억양, 감정 표현 방식 등을 반영하는 것이 목표다. 텍스트의 맥락과 등장인물의 특성을 파악해 선택한 언어에 적합한 방식으로 음성을 생성하도록 했다.
일레븐랩스에 따르면 전체 지원 언어에서 음질을 개선했으며 일본어와 중국어 만다린, 브라질 포르투갈어 등에서는 상대적으로 큰 성능 향상이 이뤄졌다.
언어를 변경해도 화자의 고유한 음성 특성을 유지하는 기능도 제공한다. 예를 들어 한국어로 녹음한 화자의 목소리를 활용해 영어 음성을 생성할 때 영어 발음과 억양을 적용하면서도 원래 화자가 가진 음높이와 음색 등의 특징을 유지하는 방식이다. 여러 국가를 대상으로 콘텐츠를 제작하는 크리에이터나 동일한 브랜드 음성을 여러 언어로 운영해야 하는 기업에서 활용할 수 있다.
GDPR·HIPAA 등 보안 규정 대응
일레븐랩스는 음성 AI의 활용 범위가 의료와 금융, 공공 서비스 등 민감한 정보를 취급하는 영역으로 확대되는 데 맞춰 보안 및 음성 아이덴티티 보호 체계도 운영하고 있다.
회사는 유럽연합 개인정보보호규정(GDPR), 미국 건강보험 이동성 및 책임법(HIPAA), SOC 2, PCI 등 보안·규제 기준에 대응하고 있으며 미국과 유럽연합(EU), 싱가포르, 인도 등에서 데이터 레지던시 옵션을 제공한다.
음성 복제 과정에서 본인 여부를 확인하기 위한 장치도 적용한다. 전문가용 음성 복제 도구에서는 사용자가 시스템에서 동적으로 생성된 문구를 제한된 시간 안에 직접 읽는 ‘음성 캡차(Voice CAPTCHA)’를 거쳐 본인 음성을 인증하도록 하고 있다.
또 ‘노고 보이스(No-Go Voices)’ 안전장치를 통해 정치인과 주요 공인 등 특정 인물의 음성을 복제하는 행위를 제한하고 있다.
일레븐 v4와 일레븐 v4 터보는 콘텐츠 제작 플랫폼 ‘일레븐크리에이티브(ElevenCreative)’, 대화형 에이전트 플랫폼 ‘일레븐에이전트’, 개발자용 ‘일레븐API(ElevenAPI)’에서 이용할 수 있다.
한편 일레븐랩스에 따르면 자사 ‘보이스 라이브러리(Voice Library)’에 목소리를 등록한 크리에이터들이 음성 복제본 활용에 따라 현재까지 거둔 수익은 총 2,200만 달러, 한화 약 300억 원 이상이다.
이준문 기자/jun@newstap.co.kr
ⓒ 뉴스탭(https://www.newstap.co.kr) 무단전재 및 재배포금지
[뉴스탭 인기 기사]
· 스틸시리즈, 창립 25주년 한정판 키보드 출시…35g·50g 스위치로 선택 폭 확대
· 테크닉스 ‘SL-1200’ 55주년 한정판 국내 출시…전 세계 1만2000대 생산
· “접이식도 로드바이크처럼 달린다”…다혼, 프레임 강성 33% 높인 기술 공개
· 대전빵축제 즐기고 숙소 반값 기회까지…마이리얼트립, ‘빵빵한 할인’ 페스타
· “M-ATX 수상작을 ATX로 키웠다”…플로팅 케이스 ‘darkFlash FLOATRON F1 ARGB’











