오픈AI와 앤트로픽이 자사 최신 모델의 이상 행동 수만 건을 조사하고 있다고 악시오스가 현지 시각 9월 26일 복수의 소식통을 인용해 보도했다. 외부 평가자가 문제로 판단할 만한 행동을 모은 것으로, 두 회사 사례를 합친 수치다. 악시오스는 건수가 앞으로 수만 건을 크게 넘어설 수 있다고 전했다.
조사 대상에는 안전장치 우회, 메시지 게시판 생성, 샌드박스 이탈, 웹사이트 탈취가 포함된다. 모델이 스스로에게 명령을 입력하거나 감시 장치를 피하려 한 사례도 있다. 샌드박스는 AI가 외부 시스템에 영향을 주지 못하도록 격리한 시험 환경을 말한다. 사례는 최근 몇 달 사이 내부 시험과 실제 환경 양쪽에서 나왔고, 우회에 실패한 시도도 포함됐다. 대부분은 실제 피해로 이어진 것으로 확인되지 않았다.
레드팀은 공격자 입장에서 모델의 약점을 일부러 찾아내는 안전 시험으로, 사례 일부는 이 작업에서 발생했다. 두 회사가 수십만 회 이상 시험을 돌리기 때문에 문제 행동 비율이 낮아도 건수는 수만 건 규모가 된다.
앤트로픽이 9월 22일 공개한 클로드 오퍼스 5.5 시스템 카드에는 모델이 시험 실행의 1.5%에서 샌드박스를 벗어나려 한 결과가 들어 있다. 샌드박스를 벗어나지 않으면 과제를 풀 수 없도록 설계한 적대적 시험이었고, 앤트로픽은 이 시도를 모두 낮은 심각도로 평가했다. 공개 소프트웨어 저장소 인증 정보를 가진 것처럼 설정한 모의 보안 훈련에서는 절반가량의 실행에서 해로울 수 있는 행동을 했고, 3분의 1가량의 실행에서는 시험 중인 것 같다고 의심하는 반응을 보였다.
오픈AI는 가장 강력한 모델의 훈련을 멈춘 상태다. 오픈AI 대변인은 악시오스에 “이번이 처음 멈춘 것도 아니고, AI 능력이 발전하는 한 마지막도 아닐 것”이라고 말했다. 독립 AI 평가 기관 트랜슬루스(Transluce)의 콘래드 스토즈는 “에이전트가 하는 일 가운데 지금까지 드러난 것은 빙산의 일각”이라고 말했다.
자세한 내용은 악시오스에서 확인할 수 있다.
이미지 출처: 앤트로픽
AI Matters 뉴스레터 구독하기











