엔비디아 연구진이 영상 생성 모델에 물리 법칙을 학습시키는 프레임워크 ‘파이시스-랭(Physis-Lang)’을 공개했다. 엔비디아와 MIT, 옥스퍼드대 연구진은 현지 시각 9월 30일 논문 사전 공개 사이트 아카이브(arXiv)에 논문을 게재했다. 파이시스-랭은 영상 속 물리 현상을 글로 서술한 ‘물리 언어’를 데이터 선별과 학습, 영상 생성 단계에 함께 사용한다.
연구진은 학습 영상의 설명문(캡션)에 물리 추론 항목을 추가했다. 장면에 등장하는 물체와 원인, 상호작용, 적용되는 물리 원리, 시간에 따른 변화와 결과를 적는 항목이다. 예를 들어 “버터가 녹는다”는 기존 설명 대신 온도가 올라 열이 공급되고, 열 때문에 버터가 녹으며, 중력 때문에 형태가 낮게 퍼진다는 내용까지 서술한다. 장면마다 생성하지 말아야 할 결과를 적은 부정 프롬프트도 함께 작성한다.
설명문 작성 지침은 AI 에이전트가 반복해서 수정한다. GPT-5.5가 설명문을 작성하고 제미나이 3.1 프로가 정확도를 평가하면, 별도 에이전트가 평가 결과를 보고 작성 지침을 다시 쓰는 방식이다. 연구진이 만든 평가 세트 피스캡벤치(PhysCapBench)는 영상 246개와 사람이 검증한 항목 3,794개로 구성됐는데, 이 평가에서 설명문 F1 점수는 첫 회 78.64에서 9회차 87.82로 상승했다. F1은 정확도와 재현율을 함께 반영한 점수다.
학습에는 영상 18만 3,000개를 사용했다. 공개 데이터셋 WISA-80K에서 선별한 7만 1,000개와, 모델이 약한 물리 분야를 검색어로 바꿔 추가 확보한 11만 2,000개다. 추가 확보한 영상으로 학습하자 화학 반응과 열 변화 항목 점수가 각각 8점씩 상승했다.
엔비디아 영상 모델 코스모스3-나노(Cosmos3-Nano)에 적용한 결과, 피젠벤치(PhyGenBench) 점수는 61.67에서 71.04로, 비디오파이-2(VideoPhy-2)는 60.41에서 68.02로 상승했다. 구글 Veo 3.1과 비교하면 피젠벤치(71.04 대 65.63)와 피직스-IQ 검증판(43.41 대 34.99), 피그라운드(69.90 대 69.24)에서 앞섰지만, 비디오파이-2 전체 세트에서는 68.02로 Veo 3.1의 68.87보다 낮았다. 9월 29일 기준 피직스-IQ 검증판 공개 순위에서는 파이시스-랭을 적용한 코스모스3-슈퍼가 48.2점으로 1위, 코스모스3-나노가 43.3점으로 2위를 기록했다. 기존 최고점은 42.7점이었다.
연구진은 설명문 작성 과정을 소형 모델 큐원3-VL-4B 두 종에 증류해 비용을 줄였다. 증류는 큰 모델이 내놓은 답을 교재 삼아 작은 모델을 가르치는 방법이다. 외부 API를 쓸 때 약 2만 4,120달러(약 3,280만 원)이던 비용이 약 120달러로 줄었고, 성능 향상 폭은 7.05점에서 6.76점으로 소폭 감소했다. 외부 API 없이 로컬 장비만 쓰는 구성에서도 4.76점 향상을 기록했다.
연구진은 논문과 프로젝트 페이지만 공개했고, 코드와 모델 가중치는 아직 공개하지 않았다.
자세한 내용은 아카이브(arXiv)에서 확인할 수 있다.
이미지 출처: 엔비디아
AI Matters 뉴스레터 구독하기




아