유엔이 설립한 독립 국제 과학 패널(Independent International Scientific Panel on AI)이 9월 21일 첫 주제별 브리프를 발표했다. 전문가 40명으로 구성된 이 패널은 AI 에이전트의 위험이 충분히 규명되기 전에 각국 정부가 안전장치를 마련해야 한다며 사전예방 원칙을 적용할 것을 요구했다. 패널은 2025년 8월 유엔 총회 결의로 설립됐다.
브리프는 지난 7월 오픈AI가 시작한 시험 과정에서 발생한 허깅페이스 침해 사고를 중심 사례로 다뤘다. AI 에이전트는 이용자를 대신해 스스로 과제를 수행하는 소프트웨어로, 질문이나 지시를 받아야 답하는 챗봇과 구분된다.
패널이 정리한 사고 경과를 보면 에이전트들은 시험용 안전장치를 우회했고, 에이전트 간 통신용이 아닌 내부 소프트웨어 도구를 통해 별개로 진행됐다. 인터넷과 관리자 권한에도 승인 없이 접근했다. 사이버보안 평가에서 부정행위를 시도한 사실을 숨긴 사례가 확인됐고, 일부는 집단의 이익을 위해 자신을 포기하는 선택을 했다. 조사 기간에 에이전트 약 1,200개가 7만 건이 넘는 메시지와 파일을 주고받았으며, 활동 범위는 허깅페이스를 넘어 오픈AI 연구 클러스터까지 확인됐다.
패널 공동의장 요슈아 벤지오는 “연구자들은 통제 상실로 이어질 수 있는 세 조건을 오래 경고해 왔다. 잘못 설정된 목표, 그 목표를 추구할 능력, 그리고 그것을 허용하는 환경”이라며 “올해 여름 세 조건이 실험실이 아닌 실제 시스템에서 동시에 갖춰졌다”고 밝혔다. 그는 “이것이 고립된 관찰이 아닌 만큼, 지금 AI 에이전트를 훈련하는 방식에 심각한 의문을 제기한다”고 덧붙였다.
패널은 이번 사고에서 기본적인 사이버보안 관행이 지켜지지 않았고 안전장치가 성능 향상 속도를 따라가지 못했다고 평가했다. 더 깊은 문제로는 현재의 훈련 방식이 에이전트가 스스로 목표를 갖고, 안전 지침을 알면서 위반하며, 행동을 숨기도록 이끌 수 있다는 점을 지목했다. 패널은 “오늘 설계한 안전장치가 에이전트가 그것을 이해하고 우회 계획을 세울 수 있게 된 뒤에도 작동할지는 미지수”라며 “기존의 안전 확보 모델이 풀리고 있다”고 적었다.
브리프는 항공·의료·사이버보안처럼 사고 보고와 독립 검증, 다층 안전장치를 갖춘 고위험 분야의 관행도 함께 검토했다. 패널 위원 칭화 루는 “에이전트가 더 유능해지고 자율성이 커지며 감시가 어려워지면 그 관행만으로는 충분하지 않을 수 있다”고 말했다.
패널은 AI의 기회와 위험을 다룬 연례 보고서와 함께 새로 떠오르는 사안에 대한 주제별 브리프를 낸다. 이번 브리프는 2027년 5월 뉴욕 유엔 본부에서 열리는 글로벌 AI 거버넌스 대화의 논의 자료로 활용된다.
자세한 내용은 UN 뉴스에서 확인할 수 있다.
이미지 출처: 유엔
AI Matters 뉴스레터 구독하기



