AMD가 현지 시각 9월 22일 ROCm 블로그에 제브라-하이로(Zebra-HyLo)를 공개했다. 이미 학습을 마친 트랜스포머 모델을 긴 문맥에 맞춘 혼합 구조로 전환하는 방법이며, 라이선스는 아파치 2.0이다.
공개 범위에는 라마-3.2-1B·3B와 큐원3-1.7B에서 파생한 체크포인트 14종과 학습 코드가 포함된다. 체크포인트는 특정 시점의 모델 가중치를 저장한 파일을 말한다.
전환은 처음부터 다시 사전 학습하지 않는 방식이다. AMD는 2단계 증류로 약 100억 토큰만 사용해 기존 모델을 MLA와 선형 블록을 섞은 혼합 구조로 바꿨다고 밝혔다. 증류는 큰 모델이 내놓은 출력을 교재 삼아 다른 모델을 학습시키는 방법이다.
효과는 메모리 사용량에서 나타난다. AMD는 기준 트랜스포머 대비 KV 캐시를 92~98% 줄였다고 밝혔다. KV 캐시는 모델이 앞서 읽은 내용을 다시 계산하지 않으려고 쌓아 두는 작업 기억에 해당하며, 문맥이 길어질수록 메모리를 많이 차지한다. 사용 가능한 문맥 길이는 최대 32배 확대됐고, 인스팅트 MI300X 8장으로 200만 토큰 길이의 입력을 처리한다.
코드와 가중치는 허깅페이스에 공개됐다. 저자는 파르사 아슈라피 파시를 비롯한 AMD 연구진이며, 사용된 기법에는 맘바-2와 게이티드 델타넷이 포함된다.
자세한 내용은 AMD에서 확인할 수 있다.
이미지 출처: AMD
AI Matters 뉴스레터 구독하기











