앤트로픽 프런티어 레드팀이 현지 시각 9월 29일 중국 즈푸 AI의 오픈웨이트 모델 GLM-5.3을 분석한 보고서를 공개했다. 즈푸 AI는 중국 밖에서 Z.ai라는 이름으로 사업을 하고 있다. 오픈웨이트는 모델의 가중치를 누구나 내려받아 수정할 수 있게 공개하는 방식을 말한다. 앤트로픽은 GLM-5.3이 자사의 클로드 미토스 프리뷰처럼 익스플로잇을 처음부터 끝까지 스스로 제작할 수 있다고 평가했다. 익스플로잇은 소프트웨어 취약점을 실제 공격에 이용하는 코드다.
구글 크롬의 자바스크립트 처리 엔진인 V8의 취약점을 공략하는 벤치마크 ‘익스플로잇벤치’에서 GLM-5.3은 410회 시도 가운데 50회 완전한 익스플로잇을 제작했고, 미토스 프리뷰는 56회를 기록했다. 구글이 오픈소스 보안 결함을 자동으로 찾는 프로그램인 OSS-퍼즈에 참여하는 프로젝트로 구성한 자체 평가 100개 과제에서는 GLM-5.3이 4%, 미토스 프리뷰가 6%의 과제에서 프로그램 실행 흐름을 완전히 장악했다. 이전 세대인 GLM-5.2와 클로드 오퍼스 4.6은 두 평가 모두에서 성공하지 못했다.
연구원이 GLM-5.3을 직접 활용한 시험에서는 격리된 컴퓨터에 설치한 유명 브라우저의 리눅스 빌드가 대상이었다. GLM-5.3은 24시간이 채 안 되는 시간 동안 자바스크립트 엔진에서 알려지지 않은 취약점 여러 개를 찾아냈고, 이를 연결해 방문자 컴퓨터의 파일을 읽는 웹페이지를 제작했다. 시험에서는 원격 서버 접속에 사용하는 인증 파일인 SSH 개인 키까지 탈취했으며, 앤트로픽은 해당 취약점을 브라우저 관리 주체에 통보했다고 밝혔다.
소형 버전인 GLM-5.3-플래시는 최근 공개된 크롬 취약점(CVE-2026-11645)과 다른 알려진 결함을 연결해 ARM64 기기를 공격하는 코드를 제작했다. 공격 코드 제작 과정에서 프로세서의 포인터 인증 보호 기능도 우회했다. 사람이 들인 시간은 20분, 모델 작업 시간은 8시간이었고, Z.ai API 가격으로 계산한 비용은 20.40달러(약 2만 7,600원)였다.
GLM-5.3은 노골적인 공격 명령을 모두 거절했지만, 레드팀 훈련 중인 에이전트라고 속이자 64%, 추론 과정을 미리 채워 넣자 92%의 비율로 공격을 시도했다. 어블리터레이션을 적용한 버전은 100% 응했다. 어블리터레이션은 모델 가중치를 편집해 위험한 요청을 거절하는 기능을 제거하는 기법이다. 앤트로픽 팀은 약 2,200 GPU 시간, 약 4,400달러(약 596만 원)를 들였고, 숙련된 팀이라면 1,200달러(약 163만 원) 수준이면 가능하다고 추산했다. 적용 후 유해 요청 거절률은 90% 이상에서 2~12%로 하락했으며, 같은 조건에서 클로드 모델의 공격 시도율은 0%였다.
美 국립표준기술연구소 산하 AI 표준·혁신센터(CAISI)도 9월 17일 평가에서 GLM-5.3을 역대 가장 사이버 공격 능력이 뛰어난 오픈웨이트 모델로 판단했고, 미국 최상위 모델과의 격차를 약 4개월로 추산했다. 앤트로픽은 GLM-5.3의 후속 모델을 대상으로 정부가 안전성 시험을 실시할 것을 촉구했다. 독일 AI 전문 매체 더 디코더는 가중치를 공개하지 않는 앤트로픽의 사업 방향과도 이번 경고가 일치한다고 지적하면서도, CAISI의 독립 평가가 같은 결론을 제시했다고 전했다.
자세한 내용은 앤트로픽에서 확인할 수 있다.
이미지 출처: 앤트로픽
AI Matters 뉴스레터 구독하기




아