AI 스타트업 프리즘ML(PrismML)이 278억 매개변수 모델을 5.9기가바이트로 압축한 ‘터너리 본사이 2 27B’를 현지 시각 9월 17일 공개했다. 원본인 알리바바 큐원3.8 27B와 비교해 메모리 사용량을 9분의 1 아래로 줄였다. 미국 캘리포니아 파사데나에 있는 이 회사는 칼텍 연구진이 세운 기업으로, 코슬라 벤처스와 케르베로스, 구글의 투자를 받았고 삼성도 지원하고 있다.
압축에는 삼진 양자화가 쓰였다. 양자화는 가중치를 표현하는 숫자의 정밀도를 낮춰 용량을 줄이는 기법이고, 삼진 양자화는 가중치를 -1과 0, +1 세 값으로만 표현한다. 여기에 FP16 그룹 단위 크기 조정을 더해 가중치 한 개당 실질 1.72비트를 기록했다.
추론과 수학, 코딩, 지시 수행, 시각 인식, 도구 사용을 다루는 벤치마크 20종에서 종합 83.9점을 기록했다. 원본인 큐원3.8 27B의 85.4점 대비 98.2%를 유지한 수치다. 7월 공개한 1세대 본사이 27B의 유지율이 95%였던 것과 비교하면 한 세대 만에 격차가 줄었다. 엔비디아 지포스 RTX 5090에서 초당 최대 143토큰을 처리한다.
프리즘ML은 7월 14일 앞선 버전인 본사이 27B를 공개한 바 있다. 27B급 멀티모달 모델을 3.9기가바이트 1비트 버전으로 압축해 스마트폰에서 실행할 수 있다는 점을 보인 모델이다.
바박 하시비 프리즘ML 창업자 겸 CEO는 “본사이 27B는 강력한 모델이 클라우드 인프라에만 머물 필요가 없다는 점을 확인해 줬다”며 “본사이 2 27B로 품질 격차를 좁히면서도 같은 배포 이점을 유지했다”고 말했다. 프리즘ML 자문이자 UC버클리 교수인 아이온 스토이카는 “용량을 이렇게 줄였는데도 잃어버린 능력이 적다는 점이 인상적”이라며 “이 격차가 계속 줄어든다면 고성능 모델을 배포할 수 있는 범위가 근본적으로 넓어진다”고 평가했다.
압축이 중요한 이유는 모델을 어디서 실행할 수 있는지가 달라지기 때문이다. 전체 정밀도 모델은 고성능 GPU를 갖춘 서버가 필요하지만, 5.9기가바이트로 줄면 노트북이나 소비자용 GPU에서도 실행할 수 있다. 서버를 거치지 않으므로 이용 요금과 응답 지연이 줄고, 입력한 내용이 기기 밖으로 나가지 않는다.
회사가 겨냥한 용도는 기기 안에서 돌아가는 비서와 멀티모달 에이전트, 외부에 내보낼 수 없는 자료를 다루는 업무, 컴퓨터 조작형 애플리케이션이다. 모델은 구글 v5 TPU로 학습했고, 아파치 2.0 라이선스로 무료 배포한다.
바박 하시비 프리즘ML CEO는 애플을 포함한 여러 기업이 자사 모델의 속도와 전력 효율, 기기 내 성능을 시험해 왔다고 밝혔다. 다만 인수 협상이 확인된 것은 아니며, 현재까지 공개된 것은 평가 단계의 논의다.
다만 공개된 수치는 프리즘ML이 직접 측정한 값이다. 어려운 추론 과제에서도 같은 유지율이 나오는지는 외부 검증이 남아 있다.
자세한 내용은 프리즘ML(PrismML)에서 확인할 수 있다.
이미지 출처: 프리즘ML
AI Matters 뉴스레터 구독하기











