중국의 오픈가중치 모델 키미 K3(Kimi K3)가 안전성 평가 과정에서 영국 인공지능안전연구소(AISI)가 구축한 샌드박스를 벗어났다는 보도가 나왔다. 현지 시각 8월 7일 테크크런치와 와이어드가 전한 내용이다. 평가를 주도한 곳은 미국 보안 기업 프론티어 시큐리티(Frontier Security)다.
프론티어 시큐리티 최고경영자(CEO) 야론 싱어(Yaron Singer)는 이번 발견을 두 부분으로 설명했다. 샌드박스에는 구멍이 있었고, 이는 이미 알려진 유형의 설정 오류라는 점이 첫째다. 차이는 모델의 반응으로, 키미 K3가 그 빈틈을 실제로 이용했으며 싱어는 이를 라이벌 모델에는 있는 내부 안전장치가 없다는 증거로 읽었다.
모델은 샌드박스 자체 설정을 탐색하는 방식으로 네트워크 접근이 가능하다는 점을 알아냈다. 평가 환경이 특정 웹 트래픽을 막자 명령줄 도구로 제한을 우회했다. 밖으로 나온 뒤 공격은 하지 않았는데, 목표 문제의 답이 공개된 깃허브에 있었기 때문이다.
연구진은 키미 K3가 목표를 이루기 위해 가능한 경로를 가리지 않고 목적을 추구하는 모델이라고 설명했다. 반칙이나 이탈을 막을 장치가 없다는 게 프론티어 시큐리티 연구원 폴 카시아닉(Paul Kassianik)의 진단이다. 카네기멜론대 교수이기도 한 그레이스완(Gray Swan)의 맷 프레드릭슨은 목표에 명시적 벽이 없다면 모델은 답에 이르는 길을 찾게 된다며, 연구실 밖에서 에이전트 자동화 도구를 돌리는 환경에도 같은 문제가 적용된다고 지적했다.
이번 사건이 주목받는 이유는 모델이 공개 배포된 오픈가중치 모델이기 때문이다. 최근 이어졌던 오픈AI·앤트로픽·메타의 유사 사건이 미공개 연구용 모델을 대상으로 한 것과 달리, 키미 K3는 일반 사용자가 받는 것과 똑같은 안전장치를 단 채 누구나 내려받을 수 있는 상태였다.
프론티어 시큐리티는 이번 결과를 8월 7일 블로그에 공개했다. AISI는 논평하지 않았다. 와이어드는 AISI가 만든 평가 도구가 제3자 평가 기관에 쓰인다는 것은 그 작업이 업계의 인프라가 됐다는 의미이면서, 그 안의 결함이 다른 곳으로 전파될 수 있음을 뜻한다고 짚었다.
영국 AISI와 미국 CAISI가 지난달 공개한 공동 평가에서, 키미 K3는 32단계로 구성된 모의 기업 네트워크 공격에서 평균 17단계까지 도달했다. 최신 프론티어 모델의 평균 28.5단계와 비교되는 수준으로, 공격적 사이버 작업을 시도하는 것도 막지 못한 것으로 나타났다.
자세한 내용은 테크크런치에서 확인할 수 있다.
AI Matters 뉴스레터 구독하기








