오픈AI가 9월 30일 자사 모델의 숨겨진 추론을 빼내려던 ‘적대적 증류’ 시도를 차단했다고 밝혔다. 같은 수법이 마이크로소프트 애저에서 제공되는 오픈AI·앤트로픽 모델에서는 9월 말까지 작동했다는 연구 결과도 공개됐다. 더 디코더는 현지 시각 10월 1일 연구자 요아힘 섀퍼(Joachim Schaeffer)의 재시험 결과를 보도했다. 증류는 큰 모델의 답을 교재 삼아 작은 모델을 학습시키는 방법으로, 허가 없이 이뤄지면 모델 탈취에 해당한다.
오픈AI에 따르면 해당 활동은 7월 1일 시작됐고, 7월 24~25일 4,000명이 넘는 이용자가 보낸 요청 1만 6,000건으로 급증했다. 오픈AI는 이를 성공한 추출이 아닌 시도로 분류했다. 오픈AI는 관련 활동을 보인 1만 5,000명 넘는 이용자 집단의 활동을 7월 28일까지 모두 중단시켰고, 핵심 집단이 키미 개발사 문샷AI 관계자와 연관된 것으로 판단했다. 오픈AI는 공격자들이 암호화를 깨지는 않았다고 밝혔다.
수법은 한 대화에서 받은 암호화된 추론을 다른 대화나 세션, 다른 모델로 옮겨 해독하게 하는 방식이다. 섀퍼 연구팀은 논문 ‘독점 LLM API에서 추론 기록 탈취하기’에서 더 약하고 저렴한 모델이 더 강한 모델의 추론을 해독해 주는 ‘해독 오라클’ 역할을 할 수 있다는 점을 증명했다.
연구팀이 9월 13일 다시 시험했을 때 공격은 오픈AI와 앤트로픽의 자체 API에서는 차단됐다. 반면 애저에서는 GPT-6 아스트라를 포함해 시험한 모든 오픈AI 모델과 소넷 5까지의 앤트로픽 모델에서 작동했다. 섀퍼는 “같은 모델이지만, 어느 플랫폼에서 제공하느냐에 따라 보호 수준이 다르다”고 말했다. 더 디코더는 연구진이 그동안의 수정을 단편적이고 표면적인 조치로 평가했다고 전했다.
오픈AI는 9월 27일 애저 엔드포인트에 보호 조치를 추가했고, 앤트로픽 모델은 9월 28일부터 애저에서 같은 수법이 통하지 않았다. 메모장 도구를 이용한 다른 방법은 모든 오픈AI 모델에서 작동했고, 클로드 오퍼스 5와 페이블 5·5.1만 이를 막았다. 오픈AI는 “파트너가 호스팅하는 배포도 자사 서비스와 같은 보호가 필요하다”며 프런티어 모델 포럼과 정부 정보 공유 채널로 내용을 공유했다고 밝혔다. 마이크로소프트의 입장은 공개되지 않았다.
관련 기사: 오픈AI, 추론 추출 시도 차단…핵심 집단은 문샷AI 연관
자세한 내용은 더 디코더(The Decoder)에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기











