현지 시각 9월 1일 월드랩스(World Labs)가 텍스트, 이미지, 영상, 3D를 통합 처리하는 공간 지능 모델 아틀라스(Atlas)를 공개했다. 아틀라스는 멀티모달 자기회귀 확산 트랜스포머로, 모든 입력을 공유된 공간 맥락으로 결합해 그 다음에 올 내용을 생성한다. 월드랩스는 아틀라스가 본 모든 것과 3D로 일관성을 유지하며 그 너머를 상상한다고 설명했다.
아틀라스는 카메라 제어 기반 생성 기능을 제공하는 제품이다. 하나 이상의 참조 이미지에서 사용자가 지정한 카메라 위치와 각도에 따라 새로운 시점을 생성한다. 생성된 시점은 입력 이미지의 내용과 기하학을 유지하며, 입력에 보이지 않는 장면의 일부를 상상해 확장한다. 최대 1분 길이의 1440p 영상을 생성할 수 있다.
아틀라스는 공간 재구성 기능도 제공한다. 하나에서 수십 개의 입력 이미지로 실제 장면을 재구성하며, 새로운 시점의 이미지 프레임과 명시적인 3D 출력을 모두 생성한다. 월드랩스는 아틀라스가 3D 재구성에 특화된 최신 모델보다 우수한 성능을 보였다고 밝혔다. 아틀라스는 포인트 클라우드나 3D 가우시안 스플랫 형태로 세계를 출력할 수 있다.
해당 제품은 시공간 시뮬레이션 기능도 제공하고 있다. 공간 구조와 시간에 따른 세계의 변화를 모두 이해하며, 이를 활용해 영상을 리프레이밍하거나 로봇 시뮬레이션을 지원한다. 월드랩스는 아틀라스가 몇 대의 카메라로 촬영한 영상을 이용해 불릿타임 같은 다중 시점 캡처 스튜디오를 구현할 수 있다고 설명했다.
이미지 생성 기능 역시 제공 중이다. 월드랩스는 이미지 생성이 아틀라스의 주요 초점은 아니지만, 복잡한 프롬프트를 따르고 텍스트를 렌더링하며 다양한 시각 스타일을 생성할 수 있다고 설명했다. 텍스트나 이미지 프롬프트에서 360도 파노라마 이미지도 생성할 수 있다.
월드랩스는 아틀라스가 규모에 따라 성능이 향상되도록 설계됐다고 설명했다. 아틀라스는 대규모 멀티모달 데이터로 처음부터 사전 훈련됐으며, 훈련 컴퓨팅이 늘어날수록 성능이 개선되는 추세를 보였다. 아틀라스는 현재 일부 파트너와 함께 초기 접근 단계에 있으며, 월드랩스는 조기 접근을 신청할 수 있는 양식을 공개했다.
자세한 내용은 월드랩스에서 확인할 수 있다.
이미지 출처: 월드랩스
AI Matters 뉴스레터 구독하기











