스페이스XAI가 음성을 텍스트로 바꾸는 모델 ‘그록 보이스 트랜스크라이브 2.0’을 공개했다. 스페이스XAI 공식 블로그에 따르면 이 모델은 실사용 환경 평가에서 1.0 버전보다 두 배 정확하며 가격은 동일하다.
2.0 버전은 그록 보이스의 기반이 된 오디오 파운데이션 모델 위에서 개발됐다. 그록 보이스는 하루 수만 건의 고객 지원 통화와 수백만 시간 분량의 영상 내레이션을 처리하고, 테슬라 차량의 그록 어시스턴트를 포함한 물리 제품의 음성 에이전트로도 운영된다. 훈련에는 실시간이면서 잡음이 많은 다국어 오디오 데이터가 사용됐다.
공개 벤치마크인 아티피셜 애널리시스 리더보드에서 스트리밍 모델 32종 중 정확도 1위를 기록했다. 회사는 고객 지원 통화의 전화 음성, 그록과의 대화, 계정 코드나 이메일 주소 같은 음성 자격 증명, 19개 언어의 짧은 음성 명령을 내부 평가 항목으로 삼았고 모두 1.0보다 개선됐다고 밝혔다. 전화 음성에서는 시험한 모든 모델보다 정확도가 높았다.
차량 내 명령 같은 짧은 발화에서는 단어 오류율(WER)이 20.6%에서 6.8%로 낮아졌다. 짧은 구문 인식의 개선 폭이 가장 컸다. 단어 오류율은 받아쓴 결과에서 틀린 단어의 비율이다. 다국어 정확도도 1.0 대비 크게 개선됐으며, 수십 개 언어를 지원하고 언어를 자동으로 감지해 녹음 중간에 언어가 바뀌어도 한 번에 처리한다.
이 모델은 배치·스트리밍 변환과 단어 단위 타임스탬프, 화자 분리, 최대 100개 키워드 바이어싱, 8채널 멀티채널, 필러 단어 제거, 스마트 턴 감지를 지원한다. 타임스탬프에는 신뢰도 점수가 함께 제공된다. 산찬 색세나 아틀라시안 팀워크 컬렉션 부사장은 룸(Loom) 영상에서 이 모델이 기존 방식보다 정확하다고 평가했다. 가격은 배치 기준 오디오 1시간당 0.10달러, 스트리밍 기준 0.20달러로 1.0과 같다.
그록 보이스 트랜스크라이브 2.0은 곧 음성-텍스트 API의 기본 모델이 된다. 1.0 버전은 수주 안에 지원이 종료되며, 전환 기간에 1.0을 계속 쓰려면 모델 ID를 grok-voice-transcribe-1.0으로 고정하면 된다.
자세한 내용은 스페이스XAI(SpaceXAI)에서 확인할 수 있다.
이미지 출처: 스페이스XAI
AI Matters 뉴스레터 구독하기



