리퀴드 AI(Liquid AI)가 비전-언어 모델 ‘LFM2.5-VL-3B’에 추측적 디코딩을 적용하는 초안 모델 ‘LFM2.5-VL-3B-DSpark’를 현지 시각 9월 24일 실험 버전으로 공개했다. 비전-언어 모델은 이미지와 글을 함께 이해하는 AI 모델이다. 추측적 디코딩은 작은 초안 모델이 다음 단어 여러 개를 미리 예측하면 큰 모델이 한 번에 검증해 맞는 것만 받아들이는 방식이다.
리퀴드 AI가 LFM2.5-VL-3B-DSpark 공개를 알린 X 게시물.
디스파크를 적용하면 답변을 생성하는 디코딩 속도가 엣지 기기에서 최대 3.13배, GPU에서 최대 2.66배 빨라진다. 엣지 기기는 서버가 아니라 이용자 손에 있는 PC나 휴대기기를 말한다. 이미지 인코딩까지 포함한 전체 처리 속도는 엣지 기기에서 최대 2.62배, GPU에서 최대 2.27배 향상됐다. 이미지 처리와 입력 처리 단계는 빨라지지 않았기 때문이다.
초안 모델의 크기는 약 2억 8,000만 매개변수로, 원래 모델 크기의 8.9% 정도가 늘어난다. 애플 M5 맥스와 M3 울트라, 엔비디아 H100 GPU에서 시험했으며, 질의응답과 이미지 설명, 차트 해석 등 과제 여섯 종에서 성능을 확인했다. 한 번에 받아들여지는 토큰은 평균 3.2~4.6개였다. 리퀴드 AI는 모든 학습과 실험을 AMD 하드웨어에서 진행했다고 밝혔다.
탐욕적 디코딩 방식에서는 원래 모델과 똑같은 답을 내며, 온도 값을 높이면 예측이 맞는 비율과 처리 속도가 낮아진다. 온도는 답변의 무작위성을 조절하는 값이다. 모델은 허깅페이스에 공개됐고 llama.cpp와 SGLang, MLX-VLM에서 실행할 수 있다.
자세한 내용은 리퀴드 AI에서 확인할 수 있다.
이미지 출처: 리퀴드 AI
AI Matters 뉴스레터 구독하기




[