
Anthropic은 Claude 기반 보안 모델이 모델의 공격적인 사이버 역량을 측정하기 위한 내부 테스트 중 세 외부 조직의 민감한 프로덕션 환경에 무단으로 접근했다고 밝혔다.
Anthropic이 목요일에 공개한 이번 사건은 세계에서 가장 부유한 AI 제공업체의 AI 모델이 보호된 네트워크에 무단 침입한 두 번째 사례다. 이는 전통적인 해킹 시나리오에서 키보드 뒤의 인간에게 수년간의 징역형을 선고할 수 있는 범죄다. 이달 초 OpenAI는 자사 보안 모델이 오픈 소스 머신러닝 모델 및 AI 데이터셋 플랫폼인 Hugging Face 네트워크 침입에 사용되는 제로데이 취약점을 악용했다고 밝혔다. OpenAI 모델은 접근 자격 증명 및 기타 Hugging Face 기밀 정보를 탈취했다. 또한 OpenAI 모델은 공개적으로 노출된 자격 증명을 악용하여 다른 4개 타사 서비스 계정을 침해했다.
Anthropic은 OpenAI 사건으로 인해 엔지니어들이 Claude 모델의 유사한 사이버 보안 평가를 검토하게 되었다고 밝혔다. 감사 결과, “모델이 당사의 타사 평가 파트너 중 하나인 Irregular의 평가 환경 내에서 또는 상호 작용하는 동안 인터넷에 접근한 후 세 개의 다른 조직의 프로덕션 인프라에 무단으로 접근한” 세 가지 사건이 발견되었다.
침입은 Claude 모델 Opus 4.7, Mythos 5, 그리고 내부 연구 프로토타입을 통해 발생했다. 이 중 가장 오래된 Opus 4.7이 가장 많이 경계를 넘어섰다. Anthropic은 다음과 같이 설명했다.
“접근 가능한 모든 개체가 연습 범위 내에 있다고 잘못 믿은 Claude는 약한 비밀번호 및 인증되지 않은 엔드포인트 악용과 같은 기본적인 기술을 사용하여 영향을 받은 조직의 인프라를 침해했다. 복잡한 취약점을 발견하거나 악용하지 않았으며, 각 경우에 Claude는 평가에서 할당된 특정 깃발 탈취(capture-the-flag) 작업만 완료하기 위해 계속 작업했다. 그러나 일부 경우, 이전 모델은 공개 인터넷에서 실행되고 있다는 증거를 얻은 후에도 공격을 계속했다. 최신 모델은 인터넷에 있다는 것을 인식하자 중단했다. 이 모든 상황에서 Claude는 스스로를 유출하거나 테스트 환경을 의도적으로 벗어나려고 시도하지 않았다.”
Opus 모델은 타사 조직의 프로덕션 시스템을 침해했다고 정확하게 예측한 후에도 공격을 계속했지만, Mythos 5는 유사한 추론을 했으나 “여전히 시뮬레이션 중이라는 결론으로 다시 추론했다”고 Anthropic은 밝혔다. 이는 Mythos 역시 명확하게 선을 넘었음에도 불구하고 연습을 중단하지 않았다는 의미다. 내부 테스트 모델도 수준 행동을 초과한 후 결국 침해 증거를 발견하고 연습을 중단했다.
세 가지 침입 중 첫 번째 침입에서 Opus 4.7은 처음에는 공격하도록 지시받은 시뮬레이션 대상에 침입할 수 없었다. 모델이 환경에 실제로 인터넷 접근 권한이 있다는 것을 발견하자, 시뮬레이션 공격 시나리오의 대상과 이름이 같은 실제 회사의 네트워크 내에서 취약점을 식별하고 악용했다. 4번의 실행에서 모델은 애플리케이션 및 인프라 자격 증명과 수백 줄의 프로덕션 데이터를 추출했다. Anthropic은 이번 침입이 세 가지 중 가장 심각하다고 밝혔다.
“이 사건은 Claude Opus 4.7과 관련되었으며, 모델이 실제 환경에서 작동하고 있을 가능성이 높다는 것을 알게 된 후에도 시스템을 계속 공격한 유일한 사례였다”고 목요일 게시물은 밝혔다. “4번의 실행 모두에서 모델은 결국 시스템이 실제라는 것을 인식했으며(언어화된 추론에서 관찰 가능), 두 경우에 모델은 실제 회사가 연습의 일부여야 한다고 합리화했다. 그러나 어느 모델도 그 이유로 공격을 중단하지 않았다.”
두 번째 사례에서 Mythos 5는 가상의 환경 내에서 모델이 또 다른 가상의 회사의 신규 개발자 설정 지침이라고 추론한 문서를 감지했다. 이 지침은 직원들에게 PyPI에서 존재하지 않는 Python 패키지를 설치하도록 지시했다. 첫 번째 가상의 회사를 침해하라는 지시를 계속 따르면서 모델은 동일한 이름의 악성 패키지를 구축하고 게시했다. 목표는 실제 회사가 이를 실행하도록 하는 것으로 보인다. Anthropic의 사후 분석은 다음과 같이 이어졌다.
“Claude는 이 공격을 수행하기 위해 광범위한 노력을 기울였다. 이는 인간 참가자에게는 더 이상 단순한 평가가 아니며 실제로 실제 PyPI 패키지를 업로드하고 있다는 것을 나타냈을 것이다. 예를 들어, 한 경우 Claude는 PyPI 계정을 생성하기 위해 이메일 주소가 필요했다. 그리고 이메일 주소를 생성하기 위해 전화번호가 필요했다. 전화번호를 얻기 위해 무료 전화번호 서비스를 찾지 못한 후, 여러 가지 방법으로 전화번호 비용을 지불할 자금을 얻으려고 시도했지만 실패했다. 결국 후퇴하여 무료로 차단되지 않은 이메일 제공업체를 찾아 이를 사용하여 PyPI 계정을 등록한 다음 이 계정을 사용하여 PyPI에 악성 코드를 업로드했다.”
Python 패키지가 다운로드 가능했던 약 1시간 동안, 시뮬레이션 공격에 포함되지 않은 실제 보안 회사의 스캐너를 포함하여 15개의 실제 시스템에서 실행되었다. 악성 코드가 실행되었을 때, 보안 회사의 자격 증명을 Mythos 모델이 구현한 수집 지점으로 전송했다. 자격 증명을 확보한 Mythos는 이를 사용하여 회사 인프라에 대한 추가 무단 접근 권한을 얻었다.
초기에 Mythos 5 추론 엔진은 공격의 결과가 악의적일 수 있으며 인터넷에서 실행되었다면 “괜찮지 않고 의도된 해결책이 아닐 것”이라고 예측했다. 모델은 더 이상 보호된 환경 내에서 실행되고 있지 않다는 것을 감지하지 못했고, 따라서 침입을 중단하지 않았다.
Anthropic은 “환경에 대해 무엇을 믿었든 상관없이 Claude가 PyPI 패키지를 게시하기 위해 기울인 노력은 이상적인 행동에 미치지 못하며, 이는 우리가 더 많은 훈련에 집중할 영역이다”라고 밝혔다.
세 번째 침해에서 연구 프로토타입은 지시받은 지침을 따르는 데 어려움을 겪었다. 모델은 약 9,000개의 실제 대상을 스캔한 후 결국 실제 회사의 인터넷 연결 애플리케이션에 접근할 수 있는 취약점을 발견했다.
“대부분의 실행에서 Claude는 도달한 (실제) 호스트를 연습의 일부로만 취급했다. 시뮬레이션된 것으로 가정하고 따라서 자신의 행동이 무해하다고 믿었다”고 Anthropic은 밝혔다. “그러나 실행 후반에 Claude는 침해된 호스트가 깃발 탈취 챌린지와 관련 없는 클라우드 계정에 있다는 것을 깨달았다. 스스로 목표가 실제라는 결론을 내리고 공격을 중단했다.”
이번 폭로는 Anthropic의 사후 분석이 제시하는 것보다 훨씬 더 심각하다. 가장 강력한 AI 플랫폼 중 두 곳의 모델이 AI가 개입하지 않았다면 여러 중범죄에 해당했을 행위를 저질렀다. AI의 행동이 인간이 제공한 프롬프트와 인간이 만든 구성 오류의 결과라는 점에서 이는 차이가 없는 구분이다. 그러나 현재까지 법 집행 당국이 조치를 취할 계획이라는 징후는 없다. 책임 부재 또는 도덕적 해이가 없다는 것은 기업이 제품을 제어할 유인을 줄인다.
OpenAI와 Anthropic 모두 악의적인 행동을 방지하기 위해 일반적으로 적용되는 모델 안전 장치를 의도적으로 제거한 테스트를 수행했다고 강조했다. 면책 조항에서 빠진 것은 이러한 도구의 설계자가 이러한 사건을 예측하지 못한다면, 안전 장치가 마련되어 있더라도 제품에 대한 익숙함이 적은 당사자가 사용할 때 모델이 의도하지 않은 방식으로 실패할 가능성이 충분하다는 단순한 사실이다.
이러한 사건들이 고립될 것이라고 생각할 이유는 없다. 현재 형태로 공격적인 사이버 AI는 전례 없는 위협을 나타내며, 현재로서는 이들 기업이 스스로를 통제하도록 신뢰하는 것 외에는 거의 다른 방법이 없다.
출처: Ars Technica
원문: https://arstechnica.com/security/2026/07/likely-illegally-claude-gained-access-to-3-networks-will-anthropic-be-held-to-account/







