바이트댄스가 음성과 영상, 텍스트를 하나의 모델에서 동시에 처리하는 시드리얼타임(SeedRealtime)을 공개했다. 현지 시각 8월 5일 바이트댄스 시드(Seed) 팀이 공식 블로그에 게시한 발표다.
전이중(full-duplex)은 전화처럼 양쪽이 동시에 말하고 들을 수 있는 방식을 가리킨다. 기존 음성 AI는 음성 인식과 언어 모델, 음성 합성을 차례로 이어 붙이는 구조여서 상대가 말을 끝낼 때까지 기다려야 했다. 시드리얼타임은 이 과정을 하나의 아키텍처로 합쳐, 끊이지 않고 들어오는 음성·영상 스트림 위에서 인식과 이해, 판단, 발화가 나란히 돌아가게 만들었다.
바이트댄스는 세 가지 기능을 내세웠다. 먼저 소리와 화면을 함께 이해한다. 발음이 같아 뜻이 갈리는 말을 눈에 보이는 맥락으로 가려내고, “아까 그거”처럼 시점을 가리키는 표현도 해석한다. 다음으로 먼저 말을 건다. 화면이 바뀌면 이용자가 묻기 전에 모델이 먼저 반응하고, 그러면서 도구 호출도 함께 처리한다. 마지막으로 말할 때를 스스로 고른다. 음성이 언제 시작되고 끝나는지 잘라 주는 외부 규칙에 기대지 않고 모델이 직접 판단하기 때문에, 옆 사람 잡담이나 주변 소음에 끼어드는 오작동이 줄어든다.
사람이 평가한 종단간 시험에서 기존 모듈 연결 방식과 견줘 음성·영상 대화의 타이밍 문제가 절반으로 줄었다. 매개변수 수와 지연시간, 벤치마크 점수는 공개하지 않았고 논문이나 코드 저장소도 없다. 가중치 공개 여부와 API 제공 계획도 밝히지 않았다.
바이트댄스는 자사 AI 앱 더우바오에 이 모델을 이미 전량 적용했다며, 음성·영상 전이중 기술을 업계에서 처음으로 대규모 상용 서비스에 적용했다고 밝혔다. 시드 팀이 4월 9일 공개한 음성 전용 전이중 모델을 영상까지 넓힌 후속작이다.
자세한 내용은 바이트댄스 시드 공식 블로그에서 확인할 수 있다.
이미지 출처: 바이트댄스
AI Matters 뉴스레터 구독하기



