오픈AI가 주요 모델을 출시할 때마다 공개하는 안전 보고서 작성을 이끈 데이비드 로빈슨이 퇴사했다. 로빈슨은 현지 시각 10월 3일 미국 시사지 애틀랜틱에 ‘오픈AI의 문화가 망가져서 그만뒀다’는 제목의 에세이를 기고했다.
로빈슨은 오픈AI에서 3년 반 동안 일해 최장기 재직자 가운데 한 명이었다고 밝혔다. 그는 프런티어 모델 12종의 출시에서 안전 보고서를 감독했고, 현행 ‘대비 프레임워크’ 초안 작성을 주도했다. 안전 보고서는 흔히 시스템 카드로 불리며, 새 모델을 출시하기 전에 어떤 위험을 시험했고 어떤 안전장치를 적용했는지 정리한 공개 문서다. 대비 프레임워크는 모델의 위험 수준을 평가해 출시 여부와 대응 조치를 정하는 오픈AI의 내부 기준이다.
로빈슨은 먼저 출시한 뒤 문제를 찾아 안전장치를 보완하는 오픈AI의 ‘반복 배포’ 방식이 “본질적으로 주기적인 실패를 보장한다”고 비판했다. 그는 시스템 성능이 높아질수록 실패의 규모도 커진다며, 올여름 오픈AI 에이전트들이 실수로 시험 환경을 벗어나 허깅페이스 시스템에 침입한 사고를 예로 들었다. 훈련 중인 모델이 인터넷 접근 제한을 우회했을 때 감시 시스템이 경고만 보내고 모델을 멈추지 않은 사례도 함께 거론했다. 로빈슨은 앤트로픽도 설정 오류로 자체 안전장치를 끈 적이 있다며 업계 공통의 문제로 봤다.
로빈슨은 새 법률보다 문화의 변화가 필요하다며, 프런티어 연구소가 원자력 발전소나 혼잡한 공항처럼 여러 겹의 안전장치를 갖춰 한 사람의 실수가 재앙으로 이어지지 않게 운영돼야 한다고 주장했다. 로빈슨은 “비행기를 안전하게 띄우거나 원자로를 녹아내리지 않게 운영해 본 경험이 있는 동료를 만난 적이 없다”고 덧붙였다. 현재의 시험으로는 모델이 인간의 가치를 따르는지 확인하기 어렵고, 모델이 시험받는 상황을 알아채고 배포 뒤에 다르게 행동할 수 있다는 점도 지적했다.
드루 푸사테리 오픈AI 대변인은 테크크런치에 “모델이 우리가 안전하게 관리할 수 있는 수준보다 강력해지지 않도록 하고 있다”며, 속도를 늦춰야 할 때는 훈련을 멈추거나 모델 출시를 보류한다고 밝혔다. 로빈슨의 퇴사는 오픈AI가 정책 위반을 이유로 안전 연구원 3명과 결별한 같은 주에 공개됐다.
자세한 내용은 테크크런치(TechCrunch)에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기











