스마트폰이 AI 답변을 만드는 동안 소모하는 전력의 60% 이상은 실제 계산이 아니라 데이터를 이리저리 나르는 데 쓰인다. 상하이자오퉁대학교와 취리히연방공대(ETH Zurich) 연구진이 2026년 6월 공개한 논문은 이 문제를 정면으로 다룬 온디바이스 AI 가속 기술 코즘(COSM)을 제안한다. 코즘(COSM)은 메모리 안에 계산 장치를 넣는 프로세싱 인 메모리(PIM) 기술과 기존 CPU가 서로 방해하지 않고 협력하도록 만드는 메모리 스케줄링 방식이다. 챗봇을 인터넷 연결 없이 폰에서 직접 돌리는 시대가 오면서, 발열과 배터리를 잡는 이 기술이 왜 중요한지 살펴본다.
전력의 60%를 삼키는 데이터 이동
스마트폰에서 AI가 답을 만드는 과정의 진짜 병목은 계산 속도가 아니라 데이터 이동이다. 논문에 따르면 현재 스마트폰의 프로세서 중심 구조는 AI 추론 과정에서 전체 에너지의 60% 이상을 데이터를 옮기는 데 소모한다. AI 모델이 답을 만들려면 메모리에 저장된 방대한 숫자 데이터를 계산 장치로 계속 실어 날라야 하는데, 이 왕복 과정이 전력을 잡아먹고 열을 만든다. 70억 개 규모의 파라미터를 가진 모델을 모바일 신경망처리장치(NPU)에서 돌리면 순간 전류가 450밀리암페어를 넘어서고, 메모리가 데이터를 주고받는 통로의 폭이 초당 80기가바이트 미만으로 좁아 긴 문장을 생성할 때 응답 속도가 들쭉날쭉해진다. 즉 폰이 뜨거워지고 배터리가 빨리 닳는 원인은 AI가 똑똑한 답을 계산하기 때문이 아니라, 그 답을 만들기 위한 데이터 심부름이 지나치게 많기 때문이다.
메모리 안에 계산기를 넣는 발상, 프로세싱 인 메모리
프로세싱 인 메모리는 데이터를 계산 장치로 옮기는 대신, 데이터가 저장된 메모리 칩 바로 옆에 작은 계산 장치를 붙여 그 자리에서 처리하는 기술이다. 멀리 있는 창고에서 물건을 사무실로 실어 나르는 대신, 창고 안에 작업대를 두는 셈이다. 이렇게 하면 느린 통로를 거치지 않고 데이터를 즉석에서 처리해 전력 낭비와 지연을 크게 줄인다. 실제로 삼성이 공개한 저전력 메모리 기반 PIM 시제품은 전력 소모를 70% 낮추면서 초당 102.4기가바이트의 대역폭을 확보했다. 데이터 이동이 병목인 AI 시대에 PIM이 유력한 해법으로 떠오르는 이유다.
문제는 CPU와 PIM이 같은 메모리를 두고 싸운다는 것
PIM의 진짜 걸림돌은 계산 능력이 아니라, 기존 CPU와 같은 메모리 공간을 나눠 쓰면서 생기는 충돌이다. 스마트폰은 메모리 값이 비싸고 회로 기판 공간도 좁아 PIM 전용 메모리를 따로 두기 어렵다. 결국 CPU와 PIM이 하나의 메모리를 공유해야 하는데, 둘이 동시에 같은 저장 구역과 명령 통로를 붙잡으려 하면 서로 발목을 잡는다. 논문의 실험은 이 충돌이 얼마나 심각한지 보여준다. PIM이 데이터를 옮기는 작업을 CPU 작업과 동시에 돌리면 CPU 성능이 80% 넘게 떨어졌고, 이는 전체 CPU 성능으로 환산해도 40%가량의 손실로 이어졌다. 메모리 접근이 살짝만 지연돼도 타격이 큰데, 16사이클의 지연만으로 CPU 성능이 5% 이상 떨어졌고, 128사이클에서는 일부 작업의 성능이 40% 이상 무너졌다.
그동안의 해법들은 한쪽을 살리면 다른 쪽이 죽는 딜레마에 갇혀 있었다. CPU를 우선하는 방식은 폰의 반응 속도는 지켰지만 PIM이 놀아 대역폭을 낭비했고, 반대로 대역폭을 꽉 채우는 방식은 PIM은 빨라졌지만 폰이 느려졌다. 두 마리 토끼를 함께 잡는 방법이 없었다.
서로의 빈틈을 노린다, 코즘의 협력 스케줄링
코즘(COSM)의 핵심 발상은 CPU와 PIM이 정반대 성향을 가졌다는 관찰에서 출발한다. CPU는 메모리 바깥으로 데이터를 실어 나르는 통로(외부 대역폭)를 많이 쓰지만 메모리 내부에서 처리하는 통로(내부 대역폭)는 거의 놀린다. PIM은 그 반대다. 그렇다면 CPU가 바깥 통로를 쓰느라 비워둔 내부의 빈 시간에 PIM 작업을 슬쩍 끼워 넣으면, 둘이 부딪히지 않고 같은 메모리를 나눠 쓸 수 있다. 코즘은 이를 위해 두 가지 장치를 마련했다. 하나는 PIM이 계산 도중이라도 CPU가 끼어들면 즉시 멈췄다가 이어서 재개하는 중단 가능한 명령 방식이고, 다른 하나는 CPU의 요청 흐름을 실시간으로 지켜보며 언제 빈틈이 생기는지 미리 예측해 그 틈에 PIM 작업을 배치하는 유휴 시간 감지 스케줄링이다.
결과는 뚜렷했다. 코즘은 PIM의 처리량을 기존 방식 대비 최대 2.8배 끌어올리면서도 CPU 성능 손실은 2% 미만으로 막았다. AI 모델을 돌린 실험에서도 추론 처리량이 2.6배 빨라지는 동안 동시에 실행되는 일반 작업의 성능 저하는 2.2% 아래에 머물렀다. 토큰 하나를 만드는 데 드는 에너지도 기존 방식보다 1.34배에서 1.61배까지 줄었다. 이런 이득을 얻기 위해 추가로 필요한 반도체 면적은 메모리 컨트롤러 기준 7.4%에 불과해, 실제 칩에 넣기에도 부담이 적다.
그림1. 코즘(COSM)과 경쟁 방식의 AI 처리량 및 CPU 성능 비교 그래프 (출처: 논문 Figure 8)
폰 속 AI 시대, 발열과 배터리를 가르는 숨은 승부처
코즘이 겨냥한 지점은 성능 수치를 넘어, 인터넷 없이 폰 안에서 AI를 돌리는 온디바이스 시대의 사용자 경험 그 자체다. 애플, 화웨이, 퀄컴, 삼성, 비보 같은 제조사들이 10억에서 30억 파라미터급 AI를 이미 기기에 심으면서, 이제 관건은 얼마나 똑똑하냐가 아니라 얼마나 오래 뜨겁지 않게 돌아가느냐로 옮겨가고 있다. 다만 이 연구는 실제 칩이 아니라 시뮬레이터를 통한 검증이라는 점, 그리고 연구진이 밝혔듯 GPU나 NPU 같은 다른 가속기까지 아우르는 확장은 앞으로의 과제로 남겨둔 점은 함께 고려할 필요가 있다. 그럼에도 데이터 이동이라는 오래된 병목을 메모리 스케줄링이라는 소프트웨어적 재배치로 풀어낸 접근은, 앞으로 폰 속 AI 경쟁의 승부가 계산 성능보다 메모리 관리에서 갈릴 가능성을 시사한다.
FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)
Q. 프로세싱 인 메모리(PIM)가 정확히 무엇인가요?
데이터를 저장하는 메모리 칩 안에 작은 계산 장치를 함께 넣어, 데이터를 멀리 있는 프로세서로 옮기지 않고 그 자리에서 바로 처리하는 기술입니다. 데이터 이동에 드는 전력과 시간을 줄여 발열과 배터리 소모를 낮추는 것이 핵심입니다.
Q. 코즘(COSM)을 쓰면 실제로 제 폰이 빨라지고 덜 뜨거워지나요?
논문의 시뮬레이션 결과로는 AI 처리 속도가 최대 2.8배 빨라지고 토큰당 에너지 소모가 최대 1.61배 줄었습니다. 다만 아직 실제 상용 칩에 적용된 단계는 아니며, 상용화까지는 시간이 더 필요합니다.
Q. 왜 스마트폰에서 AI를 직접 돌리려고 하나요?
데이터를 외부 서버로 보내지 않아 개인정보가 기기 안에 머물고, 음성 비서나 실시간 번역처럼 즉각적인 반응이 필요한 기능을 빠르게 처리할 수 있기 때문입니다. 대신 제한된 전력과 메모리 안에서 돌려야 해 발열과 배터리 관리가 큰 과제로 남습니다.
기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다.
리포트명: COSM: A Cooperative Scheduling Framework for Concurrent PIM and CPU Execution on Mobile Devices
이미지 출처: AI 생성 콘텐츠
해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다.
AI Matters 뉴스레터 구독하기



