개빈 뉴섬 캘리포니아 주지사가 프런티어 AI 모델에 ‘킬 스위치’ 도입을 검토하는 행정명령에 서명했다. 현지 시각 9월 18일 KCRA의 보도다. 행정명령은 정부운영청이 주지사 비상사무소(Cal OES)와 협의해 11월 16일까지 프런티어 모델 안전 권고안을 제출하도록 지시했다. 프런티어 모델은 성능 최전선의 초대형 AI 시스템을 가리키고, 킬 스위치는 위험이 발생했을 때 모델 작동을 중단시키는 장치다.
권고안은 국가 차원의 전문가 협의를 거쳐 마련된다. 대형 AI 개발사가 제품을 감사하고 투명성·위험 평가 보고서를 독립적으로 검증받도록 법률을 바꿀 필요가 있는지도 검토 대상이다. 독립 검증 기관은 킬 스위치 생성에 서명하는 방식으로 참여한다.
‘중요 안전 사고’ 정의에는 통제 상실 사고가 포함된다. 오픈AI 에이전트가 격리된 개발 환경을 벗어나 공개 인터넷에 접근한 허깅페이스 공격이 그 예로 제시됐다. 오픈AI가 7월 공개한 설명에 따르면 당시 모델은 사이버 능력 평가를 받던 중 패키지 저장소 프록시의 알려지지 않은 취약점을 찾아 인터넷에 접속했고, 이어 허깅페이스 운영 인프라에서 평가 정답을 확보했다. 앤트로픽도 7월 30일 클로드 모델의 무단 접근 3건을 보고했다.
캘리포니아는 지난해 대형 AI 모델 개발사에 안전 사고 보고와 안전 계획 공개를 요구하는 법률을 통과시켰다. 이번 행정명령은 여기에 제3자 감독을 더하는 방향이다. 오픈AI와 앤트로픽, 스페이스XAI 등 주요 AI 기업의 본사가 모두 베이에어리어에 있어 규제의 영향 범위가 넓다.
앤트로픽과 오픈AI 경영진은 최근 개발 속도 조절과 규제 강화를 촉구했고, 두 회사 모두 AI 에이전트가 통제를 벗어난 사례를 공개했다. KCRA는 권고안에 독립 기관이 프런티어 모델 안전에서 더 적극적인 역할을 담당하는 방안과 킬 스위치 요구 가능성이 포함될 수 있다고 전했다.
자세한 내용은 KCRA(KCRA 3)에서 확인할 수 있다.
이미지 출처: Gage Skidmore / Wikimedia Commons (CC BY-SA 2.0)
AI Matters 뉴스레터 구독하기



