스탠퍼드대와 엔비디아 연구진이 AI 에이전트의 선택 작업에 특화된 ‘대조 언어 모델(Contrastive Language Model)’ CLM-8B를 아파치 2.0 라이선스로 공개했다. 벤처비트는 현지 시각 9월 25일 연구진의 테스트에서 CLM-8B가 타입세이프의 결정 모델 Jev보다 최대 9배 빠르게 작동했다고 보도했다. Jev는 타입세이프가 9월 15일 공개한, 문장 대신 답과 확신도만 출력하는 모델이다.
일반 언어 모델은 어떤 도구를 쓸지 고를 때도 도구 이름을 한 글자씩 생성한다. CLM-8B는 현재 상황과 선택지를 각각 숫자 벡터로 바꾼 뒤 가장 가까운 선택지를 고른다. 선택지 표현은 미리 계산해 저장해 둘 수 있어, 같은 선택지를 반복해서 고르는 업무일수록 속도 차이가 커진다. 예를 들어 비밀번호 재설정이나 티켓 발급처럼 승인된 작업 50종을 고르는 사내 IT 에이전트라면, 매 요청마다 상황만 새로 계산하면 된다.
모델은 알리바바의 큐원3-8B를 고정한 채 상황용·선택지용 투사층만 학습했다. 학습 데이터는 질의응답 약 6,000만 쌍, 비슷하지만 틀린 답을 섞은 예시 약 3,000만 건, 에이전트 작업 기록 약 100만 건이다.
도구 호출 평가 BFCL v4에서 CLM-8B는 95.2%로 Jev의 99.2%보다 정확도가 낮았고, 위키 문서 이동 과제에서는 30개 중 26개를 완료해 Jev(30개)에 못 미쳤다. 대형 모델이 만든 코드 답안 가운데 하나를 고르는 검증 역할에서는 딥SWE 81.6%, 터미널 벤치 2.1 87.6%로 Jev의 71.1%, 83.1%보다 높았고, 응답 지연은 4.1~5.7배 짧았다.
연구 책임자인 스탠퍼드대 재키 곽은 “생성과 추론은 대형 모델에 맡기고, CLM으로 결과를 저렴하게 고르고 검증하는 구조를 권한다”고 말했다. 수학 풀이나 긴 글 작성처럼 선택지가 정해지지 않은 작업에는 적합하지 않다고 덧붙였다. 연구진은 멀티모달 모델 CLM-35B-A3B를 10월 초 공개할 예정이다.
자세한 내용은 벤처비트에서 확인할 수 있다.
이미지 출처: CLM 연구팀
AI Matters 뉴스레터 구독하기



