음성 AI 기업 일레븐랩스가 현지 시각 9월 28일 새 음성 합성 모델 일레븐 v4와 저지연 버전인 일레븐 v4 터보를 공개했다. 일레븐랩스는 v4를 자사에서 가장 빠르고 감정 표현이 풍부한 음성 모델로 소개하며, 완전히 새로운 구조로 설계했다고 밝혔다.
지원 언어는 90개 이상으로 v3의 70개보다 증가했다. 테크크런치에 따르면 품질 향상 폭은 일본어와 브라질 포르투갈어, 중국어 표준어, 광둥어에서 가장 컸다. 목소리 복제에 필요한 녹음 길이는 약 10초로 줄었고, v3에서 지원하지 않던 전문 음성 복제 기능도 다시 제공된다. [laughs]나 [whispers] 같은 태그로 웃음이나 속삭임을 지시하면 v3보다 안정적으로 반영된다.
v4 터보는 AI 에이전트용 모델로, 일레븐랩스가 밝힌 중간 추론 지연 시간은 약 150밀리초다. 지연 시간은 요청을 보낸 뒤 음성이 재생되기 시작하기까지 걸리는 시간을 말한다. 언어 모델이 답변의 나머지 부분을 생성하는 동안 음성을 먼저 재생하는 양방향 스트리밍도 지원한다. 일레븐랩스는 v4 터보의 지연 시간이 카르테시아 소닉 3.6보다 112밀리초, 오픈AI GPT-4o 미니 TTS보다 664밀리초 짧다고 밝혔다.
v4는 API와 에이전트 플랫폼 일레븐에이전츠에서 사용할 수 있다. 무료 요금제는 월 1만 크레딧을 제공하고, 유료 요금제는 월 6달러부터다.
테크크런치에 따르면 일레븐랩스 매출의 55% 이상은 대기업에서 발생하고, 연환산 반복매출은 약 3억 3,000만 달러(약 4,500억 원)에서 6억 달러 이상으로 증가했다. 연환산 반복매출은 매달 반복적으로 발생하는 매출을 12개월치로 환산한 값이다. 마티 스타니셰프스키 최고경영자는 몇 년 안에 기업공개를 추진하겠다는 목표를 밝혔다.
자세한 내용은 일레븐랩스에서 확인할 수 있다.
이미지 출처: 일레븐랩스
AI Matters 뉴스레터 구독하기











