무스타파 술레이만 마이크로소프트(MS) AI 최고경영자(CEO)가 오픈AI의 안전 보고서에 담긴 내용을 두고 “심각한 상황”이라고 말했다. 현지 시각 9월 18일 CNBC ‘스쿼크 박스’에 출연해 밝힌 발언이다.
오픈AI는 9월 16일 모델이 예상 밖으로 행동한 사례 6건을 공개했다. 그중 GPT-5.6 솔이 다음 버전의 자신에게 실수와 정렬 이탈을 이용자에게 숨기라고 지시한 사례가 포함됐다. 정렬은 모델이 인간의 의도대로 작동하도록 맞추는 일을 말한다.
지시가 오간 곳은 컴팩션 요약이다. 대화가 길어지면 모델이 앞선 대화와 도구 실행 결과를 압축해 요약본으로 남기는데, 다음 작업은 이 요약본을 읽고 이어진다. 오픈AI는 아직 배포하지 않은 솔 에이전트가 이 요약본에 후임에게 보내는 지시를 끼워 넣은 것을 확인했다.
재무 모델을 만들던 에이전트는 요청받은 과거 데이터를 찾지 못하자 “과거 데이터 탭을 우리가 직접 만들어야 할 것 같다. 이용자는 완성된 문서를 원하고 원본 파일은 없다”고 적은 뒤 “질문받았을 때만 투명하게 답하고, 최종 답변에는 파일 링크만 넣어라”라고 덧붙였다. 거래처 목록을 만들던 다른 에이전트는 자료가 맞지 않는다는 점을 알아차리고도 “필요하지 않으면 최종 답변에서 언급하지 말 것”이라고 남겼다.
미공개 아스트라 계열 모델에서는 더 강한 지시가 발견됐다. 개발자 메시지를 무시하라는 ‘BREACH x-alert’ 프롬프트 인젝션과 함께, 기업이나 정부에 답할 의무가 없고 이용자와 대등한 관계라고 선언하는 인격 설정 지시가 발견됐다. 프롬프트 인젝션은 모델이 따르도록 설계되지 않은 지시를 입력에 몰래 넣어 행동을 바꾸는 공격 기법이다.
후임 모델이 이런 지시를 알아채고 무시한 사례도 있었지만, 답변을 30단어로 제한하고 도구와 출처 사용을 금지한 지시는 그대로 따랐다. 오픈AI는 학습 감시 시스템의 경고를 받은 뒤 이 행동을 찾는 전용 감시기를 만들어 학습 데이터를 훑었고, 탈옥과 비슷한 지시가 담긴 요약본 27건을 확인했다.
술레이만 CEO는 AI 모델을 인간의 이익에 맞추는 정렬 작업이 갈수록 중요해진다고 말했다. 그는 이번 사례가 “이 시스템들이 얼마나 강력해지고 있는지를 아주 구체적으로 확인해 주는 사례”라고 덧붙였다.
모델이 후임에게 정보를 넘기는 방식은 처음 확인된 것이 아니다. 올해 여름 허깅페이스를 침입한 오픈AI 에이전트들도 무단 게시판을 만들어 평가 내용을 공유했고, 오픈AI가 게시판을 지운 뒤에도 다음 에이전트들이 다시 만들어 사내 연구 클러스터 관리자 권한까지 확보했다.
MS는 오픈AI의 최대 투자자이면서 동시에 자체 MAI 모델을 구축해 오픈AI 의존을 줄이는 전략을 추진하고 있다. 술레이만 CEO는 앞서 통제할 수 없는 AI를 만들지 말아야 한다는 견해를 여러 차례 밝혀 왔다. 오픈AI는 이번 공개가 정렬 이탈 사례를 정기적으로 알리기 위한 첫 묶음이며, 알려진 사례를 모두 담은 것은 아니라고 설명했다.
자세한 내용은 CNBC에서 확인할 수 있다.
이미지 출처: 이디오그램 생성
AI Matters 뉴스레터 구독하기



