비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

[위클리_피지컬AI] 퀄컴 NPU 최적화해 로봇팔 작업 속도 3배 개선한 노타 외

2026.09.24. 17:00:13
조회 수
55

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

[IT동아 강형석 기자] 생성형 인공지능(AI)이 세상을 바꿨다면, 피지컬 AI(실물 인공지능)는 세상을 뒤흔들 것으로 전망된다. 생성형 AI는 온라인상에서 원하는 결과물을 얻고 창의적인 활동을 가능케 하지만, 피지컬 AI는 산업현장부터 일상환경, 재해극복까지 사람이 하기 어려운 영역을 폭넓게 풀어낼 잠재력을 지녔기 때문이다. 현재 전 세계 기술 기업들이 피지컬 AI 경쟁에 뛰어들었고, 기술 개발도 활발하게 이어진다. [위클리_피지컬AI]는 지난 한 주간 주목받은 기술 기업 소식과 연구 성과를 다루고자 한다.

‘로봇팔 작업 속도 3배 가속’ 노타, 퀄컴 NPU로 피지컬 AI 최적화 실증

피지컬 AI 기술의 핵심 중 하나는 주변을 살피고 언어 지시를 분석한 뒤 관절을 어떻게 회전시킬지 실시간으로 판단하는 비전·언어·행동(VLA) 모델이다. VLA 모델이 진화하면서 휴머노이드와 산업용 로봇 기술도 빠르게 발전했지만, 걸림돌은 실시간 처리에 필요한 연산량이다. 수십억 개가 넘는 매개변수를 쉼 없이 처리하려면 고성능 엣지 단말기가 필요하고, 그만큼 비용도 불어난다. 이 난제를 최적화 기술로 풀어낸 사례가 나와 눈길을 끈다.

인공지능 모델 경량화·최적화 전문 기업 노타(Nota AI)는 2026년 9월 22일 퀄컴(Qualcomm) 드래곤윙 IQ-9075의 신경망 처리장치(NPU)를 활용, 외부 서버나 그래픽 처리장치(GPU)의 도움 없이 로봇팔의 작업 속도를 끌어올린 실증 결과를 발표했다.

노타가 퀄컴 드래곤윙 프로세서의 NPU를 최적화해 피지컬 AI 처리 성능을 개선했다 / 출처=노타
노타가 퀄컴 드래곤윙 프로세서의 NPU를 최적화해 피지컬 AI 처리 성능을 개선했다 / 출처=노타

노타는 NPU가 VLA 모델을 직접 구동하고, 로봇에 장착된 엣지 AI 보드 안에서 추론 연산이 모두 끝나도록 체계를 구축했다. 클라우드 서버를 거치지 않고 칩셋의 저전력 연산 성능만으로 지시를 해석해 관절을 제어하는 온-디바이스(On-Device) 로보틱스를 구현한 셈이다.

실증은 언어 명령을 받은 로봇팔이 큐브를 집어 올려 반대편 매트로 옮기는 방식으로 진행됐다. 노타 발표 자료에 따르면 카메라 영상과 명령어를 입력받아 다음 동작 궤적을 계산하는 추론 속도는 최적화 전보다 최대 7배 빨라졌다. 추론 지연이 줄어든 덕에 로봇팔이 목표를 완수하기까지 걸리는 시간도 36초에서 12초로 단축돼 작업 속도가 3배 향상됐다. 작업 성공률은 92%로 원본 모델의 93%와 비교해 1% 낮은 수준에 그쳤다.

피지컬 AI에서 추론 속도는 작업 효율을 넘어 시스템의 안정성까지 좌우하는 요소로 손꼽힌다. 판단이 몇 초만 늦어져도 오작동으로 직결되기 때문이다. 서버 연결이 끊겨도 현장에서 즉각 판단하고 행동하는 경량화 소프트웨어 역량은 앞으로 산업용 협동로봇과 서비스·물류 로봇의 경제성을 가르는 경쟁력으로 부각될 전망이다.

현대차그룹·보스턴 다이내믹스, 미국에 로보틱스 제조 훈련 거점 개소

2026년 9월 21일, 현대자동차그룹과 보스턴 다이내믹스(Boston Dynamics)는 미국 조지아주 서배너의 메타플랜트 아메리카(HMGMA) 부지 안에 차세대 로봇 제조 훈련 거점 ‘로보틱스 메타플랜트 애플리케이션 센터(RMAC)’를 정식 개소했다. 현장 실증 학습을 거치면 보스턴 다이내믹스의 휴머노이드 로봇 ‘아틀라스’의 완성도가 한층 높아질 것으로 전망된다.

RMAC에서 아틀라스 로봇들은 부품 물류 관리와 실시간 서열화(Sequencing) 공정에 투입돼 자율 작업 훈련을 수행한다. 서열화 작업은 혼류 생산 방식으로 조립되는 완성차 라인에 맞춰 수만 가지 부품을 정확한 순서와 위치로 분류해 운반하는 복잡한 물리 공정이다.

보스턴 다이내믹스가 휴머노이드 아틀라스의 피지컬 AI 학습 역량을 확장한다 / 출처=보스턴 다이내믹스
보스턴 다이내믹스가 휴머노이드 아틀라스의 피지컬 AI 학습 역량을 확장한다 / 출처=보스턴 다이내믹스

기존 산업용 로봇팔은 라인을 재배치할 때 비용 부담이 크다. 반면 이동성과 양손 조작 능력을 겸비한 휴머노이드는 공장 설비를 크게 손보지 않고도 작업자 동선에 맞춰 투입할 수 있다는 점이 차별점으로 꼽힌다. 보스턴 다이내믹스는 부품 물류 최적화를 시작으로 훈련 영역을 단계적으로 넓혀, 오는 2030년까지 고난도 부품 직접 조립 공정에도 아틀라스를 투입할 계획이다.

보스턴 다이내믹스는 2027년 현행 RMAC보다 10배 큰 규모의 새 시설로 이전한다. 새 시설에는 다양한 로봇 학습 환경이 구축될 것으로 예상된다. 산업 환경별 행동 학습이 뒷받침돼야 폭넓은 피지컬 AI 제어 알고리듬과 작업 데이터셋을 확보할 수 있기 때문이다. 보스턴 다이내믹스는 이를 토대로 제조업을 비롯해 항공우주, 반도체, 물류 허브, 식음료, 바이오·제약 등 정밀 조작이 필요한 산업 전반에서 피지컬 AI 모델 경쟁력을 갖추겠다는 구상이다.

체화된 인지와 에이전트 능력을 통합한 ‘ME-VLM’

자율주행 차량이나 로봇에 탑재되던 인공지능 시스템은 상위의 ‘에이전트 플래너(의사결정 순서 조율)’와 하위의 ‘체화 인지 컨트롤러(로봇 제어 장치)’로 나뉘어 순차적으로 동작하는 직렬 처리 구조였다. 이런 분리형 구조는 현실에서 치명적인 결함을 드러내곤 한다. 디지털 환경에서 언어로 계획을 세우는 상위 플래너는 언어적 맥락상 그럴듯해 보여도 현실 공간에서는 불가능한 명령을 남발한다. 반대로 하위 컨트롤러는 물체를 잡으려다 미끄러지는 물리적 실패가 벌어져도 이 상태를 상위 플래너와 실시간으로 공유하지 못한다. 결국 동작이 그대로 멈추는 ‘물리적 환각(Physical Hallucination)’ 현상을 겪는다.

중국 자동차 기업 리오토(Li Auto)의 기초모델 연구팀은 이 문제를 풀기 위해 ‘고속체화된 시각·언어모델(MachEmbodied-VLM, 이하 ME-VLM)’을 제안했다. 시각·공간 감각과 물리 법칙을 이해하는 ‘체화 인지’ 능력, 장기 계획과 도구 호출을 수행하는 ‘멀티모달 에이전트’ 역량을 하나의 비전·언어 모델로 통합한 구조다.

ME-VLM의 학습 구조 / 출처=ME-VLM 논문
ME-VLM의 학습 구조 / 출처=ME-VLM 논문

ME-VLM은 주변 환경을 인식해 대응하는 전 과정을 ▲인지 ▲추론 ▲행동 ▲검증 ▲재계획의 다섯 단계로 나눈 단일 폐루프(Closed Loop) 체계로 구축했다.

인지는 환경을 관측하는 첫 단계다. 객체 라벨링을 비롯해 주변 사물의 3차원 위치 관계와 표면 재질, 로봇이 접촉했을 때 일어날 수 있는 물리적 상호작용을 뜻하는 행동 유도성(Affordance)까지 파악한다. 이어 목표 달성에 필요한 세부 과제를 도출하는 추론을 거쳐, 구체적인 하위 스킬 함수나 외부 도구를 호출해 움직임을 구현한다.

행동을 마치면 검증에 들어간다. 센서로 수집한 새 영상과 물리 신호를 대조해 명령이 제대로 실행됐는지 확인하는 과정이다. 결과가 의도와 어긋나거나 물체가 미끄러졌을 때는 재계획으로 넘어가 즉시 대안 경로를 설정한다.

연구진은 ME-VLM을 구현하기 위해 체화 지도 미세조정(Embodied SFT), 분리형 전문가 강화학습(Separate Expert RL), 다중 교사 온폴리시 증류(Multi-teacher On-policy Distillation)로 이뤄진 세 가지 학습 과정을 설계했다.

체화 지도 미세조정은 수백만 건의 고정밀 데이터로 물리 상태와 공간 관계, 행동의 실현 가능성을 학습시키는 과정이다. 분리형 전문가 강화학습은 모델을 에이전트 전문가와 체화 인지 전문가로 나눠, 전자에는 계획 수립과 도구 활용, 후자에는 물리 제어와 실패 복구 능력을 각각 강화한다. 다중 교사 온폴리시 증류는 학생 모델이 각 상황을 마주할 때마다 두 교사의 판단에 서로 다른 가중치를 부여해 지식을 전달하는 방식이다. 덕분에 추론 단계에서는 단일 모델만으로 전문성과 물리 제어 능력을 동시에 구현한다.

ME-VLM의 벤치마크 점수를 비교한 자료 / 출처=ME-VLM 논문
ME-VLM의 벤치마크 점수를 비교한 자료 / 출처=ME-VLM 논문

연구진은 ME-VLM을 40억 매개변수(4B) 모델과 350억 매개변수 기반 혼합 전문가(35B-A3B) 모델로 나눠 개발하고 검증을 마쳤다고 밝혔다. 물리 인지와 작업 계획, 동작 실행, 오류 복구 역량을 아우르는 26개 체화 벤치마크에서 4B 모델은 평균 63.4점, 35B 모델은 평균 70.9점을 기록했다는 주장이다. 이 외에 ME-VLM은 상위 플래너와 하위 컨트롤러를 오가는 직렬 구조 대신 단일 모델이 추론을 끝내는 만큼, 응답 지연시간도 줄어들 것으로 기대된다.

IT동아 강형석 기자 (redbk@itdonga.com)

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
벤틀리, 브랜드 최초 전기 SUV 토르칼 공개 글로벌오토뉴스
'2026 K-스타트업 혁신창업리그/AI리그' 시상식 개최... 100대1 경쟁률 뚫은 스타트업은? IT동아
[위클리_피지컬AI] 퀄컴 NPU 최적화해 로봇팔 작업 속도 3배 개선한 노타 외 IT동아
[르포] 암스테르담 수변에 자리한 여행 플랫폼의 심장…'부킹닷컴' 본사를 가다 IT동아
유재윤 에너자이 CTO “엣지 AI는 양자화 넘어 풀스택 최적화 향할 것” IT동아
에이수스, ROG 20주년 맞아 커스텀 PC 파트너십 확대…영재 컴퓨터 합류 뉴스탭
퀄컴, 첫 2나노 모바일 칩 공개…매개변수 300억 개 모델을 휴대폰에서 직접 실행 AI matters
베이스캠프 리서치, 1,896억 원 유치…엔비디아·앤트로픽이 AI 설계 치료제에 투자 AI matters
구글 딥마인드, 프라이빗 AI 컴퓨트에 암호화 메모리 추가…해독 열쇠는 이용자 기기에만 보관 AI matters
에포크 AI “같은 성능을 내는 비용, 분기마다 47% 하락”…18개월 만에 725분의 1 AI matters
버라이즌, 948억 원 규모 무료 AI 교육 발표…IBM·구글·앤트로픽 교재를 한곳에 모은다 AI matters
엔베다, 4,211억 원 유치…AI로 찾은 천연물 신약 후보를 후기 임상으로 보낸다 AI matters
팔로알토 네트웍스, 상시 침투 시험 서비스 출시…클로드 미토스 5·GPT-5.6 사이버 투입 AI matters
오픈AI, 패트리온 공동창업자 샘 얌 영입…크리에이터 제품 조직 신설 AI matters
아마존, 판매자 도구를 외부 AI에 개방…클로드에서 재고와 가격을 관리한다 AI matters
마이크로소프트, AI 피싱 플랫폼 에빌토큰스 차단…계정 1만 2,000개 침해 AI matters
500만 배송 데이터 ‘디버’, AI·자율주행·로봇으로 차세대 물류 인프라 구현 [스타트업-ing] IT동아
미국 AI 관련주 (2026년 9월 24일) 국채금리 5.11%에 반도체 하락, 전력주는 상승 AI matters
T&E, “유럽, 지정학 혼란에 일일 2억 유로 디젤 프리미엄 부담” 글로벌오토뉴스
“기업의 AX를 위한 기술·정책·전략을 논하다” AI경영정보서비스분과 정기세미나 IT동아
이 시간 HOT 댓글!
1/4