오픈AI가 자사 모델의 숨겨진 추론 내용을 빼내려던 조직적 시도를 차단했다고 현지 시각 9월 30일 공식 블로그에서 밝혔다. 오픈AI는 한 모델의 출력이나 추론을 허가 없이 다른 모델 학습에 사용하는 ‘적대적 증류’ 시도로 판단했다. 증류는 큰 모델의 답을 교재 삼아 작은 모델을 학습시키는 방법이다.
수법은 한 대화에서 암호화된 추론 내용을 복사한 뒤, 다른 대화에서 모델에 그 내용을 해독해 받아 적으라고 요청하는 방식이었다. 오픈AI는 운영자들이 암호화를 풀거나 데이터베이스에 침입하지 않았고, 저장된 이용자 대화에도 직접 접근하지 않았다고 설명했다.
활동은 7월 1일 소규모로 시작됐다. 7월 24일과 25일에는 4,000명이 넘는 이용자 계정에서 추출 패턴을 사용한 요청 1만 6,000건이 집중됐고, 추가 조사에서 1만 5,000명 이상의 계정 집단이 확인됐다. 오픈AI는 7월 28일까지 이 활동을 모두 차단했으며, 수치는 시도 건수로 모두 성공했다는 뜻은 아니라고 덧붙였다.
오픈AI는 모든 운영자가 같은 주체인지는 불분명하지만 핵심 집단은 키미 개발사 문샷AI와 연관된 개인들로 판단했다. 블룸버그는 오픈AI가 문샷AI를 공개 지목한 것은 이번이 처음이라고 전했다. 오픈AI의 캐롤라인 지어는 블룸버그에 “우리의 우려는 이용약관 위반이며, 오픈 모델이나 정당한 증류가 아니다”라고 말했다.
오픈AI는 허위 계정을 정지하거나 제한하고 가입 절차와 인프라 통제를 강화했다. 다른 이용자의 암호화된 추론을 재생해 내용을 복원하는 경로를 막았고, 추론이 노출될 수 있는 스트리밍 출력을 감지하는 검사도 추가했다. 제3자 서비스를 거친 활동은 해당 업체와 함께 계정을 차단했고, 조사 결과는 프런티어 모델 포럼과 정부 정보 공유 경로에 전달했다. 오픈AI는 이 수법이 자사 모델만의 취약점은 아니라고 밝혔다.
자세한 내용은 오픈AI에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기











