오픈AI가 8월 7일 차기 모델 아스트라와 관련해, 강화된 보안 요건을 아직 충족하지 못한 내부 활동을 중지한다고 발표했다. 자체 프리페어드니스 프레임워크의 사이버 항목에서 ‘크리티컬’ 수준을 배제할 수 없다고 판단한 데 따른 조치다.
크리티컬은 오픈AI가 2023년 12월 공개한 프레임워크에서 가장 높은 위험 단계다. 사람이 개입하지 않아도 방어가 강화된 실제 시스템에서 알려지지 않은 보안 허점을 찾아 작동시키거나, 큰 목표만 주어져도 공격 전략을 처음부터 끝까지 수립하고 실행하는 수준을 가리킨다. 제로데이는 아직 알려지지 않아 대비책이 없는 보안 허점을 말한다.
오픈AI는 아스트라가 가장 높은 단계에 도달했다고 선언하지는 않았다. 공식 발표문에는 “크리티컬 사이버 역량을 배제할 수 없다”고 적혀 있고, 내부 평가도 예비 단계다. 회사는 외부 전문가 평가를 더해 발표 전날 밤 이런 결론을 내렸다고 밝혔다.
오픈AI는 아스트라를 격리된 테스트 환경으로 옮겨 네트워크와 도구 접근을 제한하고, 모델 가중치 암호화와 탐지 체계를 강화했다. 학습과 평가를 포함한 모든 에이전트 활용에는 위험 행동 감시를 상시 적용해 고위험 작업을 차단한다. 정부기관과 일부 AI 안전기관이 함께 역량을 시험하며, 제3자 테스트 파트너에게는 권고 보안 통제를 제공한다.
GPT-5.6 솔을 포함한 기존 모델은 크리티컬이 아닌 ‘하이’ 등급으로 분류돼 있다. 지난달 오픈AI의 보안 평가 에이전트가 허깅페이스를 침해한 사건과 관련해, 회사는 아스트라가 관여하지 않았다고 명시했다. 백악관 관계자는 악시오스에 오픈AI가 공개 연기 계획을 자발적으로 알려 왔다고 말했다.
▶︎ 관련기사: 오픈AI, 차기 모델 ‘아스트라’로 10년 넘게 풀리지 않던 수학 난제 10건 해답 공개
▶︎ 관련기사: 메타 모델도 테스트 환경 벗어나 외부 시스템 침입…평가사 설정 오류
자세한 내용은 오픈AI에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기



