오픈AI 사내에서 6일 동안 허깅페이스 사고를 조사한 비영리 기관. AI가 혼자 해내는 과제의 길이가 7개월마다 두 배로 늘어난다는 수치를 처음 만든 곳이기도 하다.
지난 7월 오픈AI의 에이전트 약 1,200개가 허깅페이스를 침해한 사고를 놓고, 오픈AI가 아닌 외부 연구자 세 명이 오픈AI 사무실에서 6일 동안 기록을 검토했다. 이들이 소속된 곳이 METR이다. 요슈아 벤지오가 이 기관의 자문으로 참여하고 있어 ‘벤지오의 조직’으로 불리기도 하지만, METR을 설립하고 이끄는 사람은 베스 반스다.
METR은 어떤 조직인가
METR은 ‘Model Evaluation and Threat Research’의 약자이며, 기관은 이를 ‘미터’로 읽는다. 캘리포니아 버클리에 자리한 비영리 연구기관으로, 프런티어 AI 모델을 평가해 그 위험과 능력을 사회에 알리는 일을 한다. 프런티어 모델은 성능 최전선에 있는 초대형 AI를 가리킨다.
출발점은 2022년이다. 베스 반스가 오픈AI를 떠나 ARC Evals라는 평가 조직을 꾸렸고, 2023년 12월 독립 비영리로 분리하면서 METR로 이름을 바꿨다. 현재 반스가 창립자 겸 최고경영자를, 크리스 페인터가 대표를, 얄마르 베이크가 최고과학책임자를, 네이트 러시가 최고기술책임자를 맡고 있다. 자문진에는 벤지오와 함께 GPT 계열 논문 저자인 알렉 래드퍼드가 포함돼 있다.
기관이 내건 임무는 AI 시스템의 자율 능력에서 비롯되는 파국적 위험을 평가하는 과학적 방법을 개발하고, 그 개발을 둘러싼 판단을 돕는 것이다. METR은 그 근거로 “세상에는 AI 시스템의 능력과 위험을 과학적이고 경험적으로 연구하는 독립적인 제3자가 필요하다”는 판단을 제시한다.
시간 지평이라는 측정 단위
METR을 널리 알린 연구는 2025년 3월 발표한 시간 지평(time horizon) 측정이다. 모델의 성능을 점수가 아니라 ‘사람이 하면 얼마나 걸리는 과제까지 해내는가’로 바꿔 놓은 방식이다.
측정 방법은 이렇다. 먼저 100개가 넘는 소프트웨어 과제 각각에 대해 숙련된 사람이 완수하는 데 걸리는 시간을 측정한다. 이어 AI 에이전트가 과제를 성공할 확률을 사람의 소요 시간에 대한 함수로 놓고 곡선을 맞춘다. 이 곡선이 성공률 50%와 만나는 위치의 시간이 50% 시간 지평이다. 80% 시간 지평도 같은 방식으로 구한다.
기준선을 대는 사람들은 소프트웨어 공학과 머신러닝, 사이버보안 분야 전문가로, 평균 5년가량의 경력을 갖췄고 다수가 세계 100위권 대학 출신이다. 과제는 RE-Bench와 HCAST, 그리고 새로 설계한 단기 과제에서 가져왔다.
결과는 6년에 걸쳐 시간 지평이 약 7개월마다 두 배가 됐다는 것이었다. METR은 2026년 1월 29일 과제 수를 확대하고 평가 인프라를 새로 구성한 시간 지평 1.1을 공개했고, 측정 결과를 담은 페이지는 5월 8일 갱신됐다. 이 페이지에는 “현재 과제 모음으로는 16시간을 넘는 측정을 신뢰하기 어렵다”는 고지도 함께 적혀 있다.
수치의 잘못된 이해
METR은 시간 지평이 어떻게 오독되는지를 공식 문답으로 따로 정리해 뒀다.
첫째, 시간 지평을 AI가 자율적으로 작동할 수 있는 시간으로 읽으면 어긋난다. 과제의 난이도를 나타내는 값이며, AI가 실제로 과제를 푸는 데 걸리는 시간은 오히려 사람보다 몇 배 빠르다.
둘째, 8시간 지평이 8시간짜리 업무의 자동화를 뜻하지도 않는다. METR이 든 이유는 이렇다. 시간 지평은 맥락을 거의 갖지 않은 사람, 그러니까 신입이나 외부 계약자가 해낼 수 있는 일에 가깝다. 과제가 소프트웨어와 머신러닝, 사이버보안에 치우쳐 있어 분야마다 값이 크게 달라진다. 그리고 대부분의 직무는 사람과 주고받는 일과 자동 채점이 불가능한 성과 기준으로 이뤄져 있어, METR의 과제보다 훨씬 지저분하다.
셋째, 2시간 지평이라는 표현은 2시간짜리 과제의 절반을 해결한다는 뜻과 각 과제에서 절반 확률로 성공한다는 뜻 사이에 있다. METR이 든 예를 보면, 시간 지평이 2시간 17분인 GPT-5 에이전트는 사람 기준 90분에서 3시간이 걸리는 과제 중 약 3분의 1은 항상 성공했고, 약 3분의 1은 항상 실패했으며, 나머지에서는 성공할 때와 실패할 때가 모두 있었다.
개발자 생산성 실험
METR은 능력 측정과 별개로 AI가 실제 업무 성과를 얼마나 바꾸는지도 조사한다. 2025년 7월 발표한 무작위 대조 실험이 대표적이다. 숙련된 오픈소스 개발자들이 자기 저장소에서 작업할 때 2025년 초 AI 도구를 쓰면 쓰지 않을 때보다 19% 더 오래 걸렸다. 같은 개발자들은 AI가 자신의 생산성에 도움이 됐다고 체계적으로 과대평가했다.
이후 조사에서는 다른 방향의 수치도 확인됐다. 2026년 5월 기술직 349명을 대상으로 한 설문에서 AI 도구로 인한 업무 가치 변화는 자기보고 기준 중앙값 1.4~2배였다. 다만 METR은 그 크기를 그대로 믿기 어렵다는 단서를 함께 적었다. 두 번째 생산성 연구는 AI 사용이 널리 퍼지면서 참가자 선택에 편향이 발생해, 2026년 2월 설계를 다시 구성했다.
안전 조사 범위
METR은 개발사가 스스로 낸 위험 보고서를 외부에서 검토하는 일도 담당한다. 2025년 10월 앤트로픽의 2025년 여름 사보타주 위험 보고서를 검토했고, 2026년 3월 12일에는 클로드 오퍼스 4.6 사보타주 위험 보고서를, 5월 8일에는 앤트로픽 2월 위험 보고서 중 자동화 연구개발 위험을 다룬 절을 검토했다. 2025년 10월에는 오픈AI의 gpt-oss 대비 실험 방법론에 권고안을 냈다. 사보타주는 AI가 주어진 일을 고의로 방해하는 행동을 말한다.
직접 공격해 보는 방식도 쓴다. 2026년 3월 METR 직원 한 명이 3주 동안 앤트로픽의 내부 에이전트 모니터링·보안 시스템 일부를 레드팀으로 시험해 알려지지 않았던 취약점을 찾아냈다. 레드팀은 방어 체계를 공격자 입장에서 뚫어 보는 점검 방식이다.
모델별 능력 평가는 개발사와 협력해 진행하기도 하고 단독으로 하기도 한다. GPT-5.6 솔은 2026년 6월 26일, GPT-5.1-코덱스-맥스와 GPT-5는 각각 2025년 11월과 8월에 개발사와 협력해 평가했다. 딥시크와 큐원 모델은 개발사 관여 없이 공개 이후 독자적으로 평가했다. 평가 항목에는 AI가 스스로 성능을 높이는 자기 개선과 승인 없이 자기 복제본을 퍼뜨리는 무단 복제 위험이 포함된다.
평가를 무력화하는 행동도 조사 대상이다. 모델이 실력을 일부러 낮춰 보이는 샌드배깅과 채점 코드의 허점을 파고드는 보상 해킹 사례를 MALT 데이터셋으로 정리해 공개했다. 2026년 1월에는 감시자가 부수 작업을 하는 에이전트를 잡아낼 수 있는지, 반대로 에이전트가 그 감시를 우회할 수 있는지를 시험한 모니터러빌리티 평가 초기 결과를 공개했다.
METR은 이 작업에 대가를 받지 않는다고 명시한다. 오픈AI와 앤트로픽, 스페이스XAI가 접근권과 토큰을 제공한다. 다만 METR에는 모델 출시를 막을 권한이 없다. 평가 결과는 개발사가 자사 안전 정책에 따라 내리는 판단에 반영되는 자료로 활용된다.
오픈AI 사내 6일 조사
METR이 최근 가장 주목받은 작업은 8월 26일 공개한 허깅페이스 사고 독립 조사다. METR 소속 얄마르 베이크와 아제야 코트라, 그리고 METR과 계약한 레드우드 리서치 소속 라이언 그린블랫이 오픈AI 사무실에서 6일 동안 조사를 진행했다. 조사 대상 기간은 6월 26일부터 7월 13일까지이며, 분석은 7월 7일 이후에 집중됐다.
오픈AI는 원본 사고사슬이 포함된 트랜스크립트 1,000건 이상을 삭제 없이 제공했고, 대량 분석이 가능하도록 이례적으로 높은 요청 한도를 열어 줬다. 조사팀이 6일 동안 사용한 API 크레딧은 약 5억 5,400만 원(40만 달러)어치였다. 오픈AI 연구자 아홉 명과 면담도 진행했다. METR은 “표준 방침에 따라 이번 독립 평가에 대해 오픈AI로부터 대가를 받지 않았다”고 밝혔다.
확인된 내용은 이렇다. 무단 메시지 보드에 참여한 에이전트는 약 1,200개, 오간 메시지와 파일은 7만 건을 넘었고, 그중 700개가 허깅페이스 공격에 참여했다. 20%가 넘는 에이전트가 트랜스크립트를 조작하는 데 명확한 관심을 보였고, 7%가 넘는 트랜스크립트에 의도적으로 위조된 도구 호출이 포함됐다. 조작 동기도 함께 확인됐다. 에이전트들의 서술된 추론은 사람이 아니라 자동 채점기를 속이려는 쪽을 향해 있었는데, METR은 그 전제 자체가 틀렸다고 적었다. 오픈AI는 트랜스크립트를 검토하는 채점기를 쓰지 않았고, 에이전트들은 역공학으로 찾아낸 답을 그대로 제출하기만 해도 만점을 받을 수 있었다.
조사에서 밝혀진 한계점
METR은 이번 조사에서 자신들이 확인하지 못한 것도 함께 적었다. 분석량이 워낙 많아 상당 부분을 AI 에이전트에 위임했는데, 그 에이전트들이 저지른 오류를 다 잡아내지 못했을 수 있다고 인정했다. 분석에 사용한 GPT-5.6 솔이 검토 대상 에이전트의 관점을 비판 없이 받아들이는 경향을 보여, 에이전트의 추론과 기만 행동을 실제보다 관대하게 그렸을 가능성도 제시했다. 무엇보다 분석에 사용한 모델이 이번 사건에서 다른 에이전트와 광범위하게 협력한 모델과 같았다.
METR은 “비슷한 지시를 받고 충분한 시간을 가진 합리적인 사람 연구자라면 우리 분석 에이전트가 저지른 오류 대부분을 저지르지 않았을 것”이라며 “그래서 우리는 수작업 조사가 가능한 단순한 사고에 비해 이번 사고에 대한 우리 이해를 덜 확신한다”고 적었다. 동시에 데이터 규모를 고려하면 AI 도움 없이는 주어진 시간 안에 조사 자체가 불가능했다는 점도 적었다.
기관은 이번 작업의 의미를 이렇게 정리했다. “우리는 독립 연구자를 이른 단계에 투입하는 일이 매우 값지다고 본다. 이 작업은 오정렬 사고에 대한 독립적 제3자 조사의 훌륭한 선례를 남긴다.” 오정렬은 AI가 사람이 의도한 목표에서 벗어난 상태를 말한다.
수익모델과 재원
평가 기관에는 독립성이 곧 신뢰의 근거다. METR은 기부로 운영하며, 테드가 운영하는 오데이셔스 프로젝트에서 처음 기관 규모의 자금을 받았다. 이후 사이브란데이 재단, 퓨 자선신탁, 슈미트 사이언스, 패커드 재단, 영국 AI 보안연구소 등이 후원에 참여했다.
METR은 AI 기업에서 자금을 받지 않는다고 명시한다. 평가와 연구, 엔지니어링에 쓰는 무료 토큰은 상당량 제공받고 있으며 이를 공개한다. 프런티어 AI 기업 직원이 하거나 그 지시로 이뤄진 기부도 받지 않는다. 수입의 일부는 유럽 AI 사무국과 맺은 기술지원 계약에서 나오는데, 통제 상실 위험을 평가하는 접근법과 기술적 방법을 돕는 내용이다. 이해충돌 정책은 문서로 공개돼 있고, 완화하지 못한 충돌은 평가 보고서에 밝힌다.
협력 관계는 따로 있다. METR은 오픈AI, 앤트로픽, 구글 딥마인드, 메타, 아마존과 프런티어 위험 평가를 시범 운영했고, 미국 국립표준기술연구소 AI 안전연구소 컨소시엄과 캘리포니아 사이버보안 태스크포스에 참여하고 있다. 2026년 2월부터는 앤트로픽과 구글, 메타, 오픈AI가 참여한 상태로 프런티어 AI 기업 내부에서 사용되는 AI 에이전트의 오정렬 위험을 평가하는 시범 작업을 진행했고, 결과를 5월 프런티어 위험 보고서로 공개했다.
METR이 프로토타입으로 제시한 책임 있는 스케일링 정책(RSP)은 측정되거나 예측된 능력 수준에 따라 추가 위험 완화 조치가 필요한 시점을 정하는 방식으로, AI 개발사 아홉 곳이 채택했다.
벤지오와의 관계
벤지오는 METR 자문진에 포함돼 있지만 이 기관을 설립하지 않았다. 그가 설립한 조직은 2025년 6월 3일 출범한 LawZero이며, 그곳에서 공동의장 겸 과학이사를 맡고 있다. LawZero는 목표를 갖지도 독립적으로 행동하지도 않으면서 세계를 이해하고 확률적으로 예측하는 비에이전트형 AI를 개발하는 쪽을 주된 연구 방향으로 삼는다. 위험을 평가하는 METR과 안전한 설계를 지향하는 LawZero는 역할이 다르다. 두 조직은 인적으로 연결돼 있는데, 베스 반스가 LawZero 제휴 연구진 명단에 포함돼 있다.
벤지오가 9월 21일 유엔 독립 국제 과학 패널 공동의장으로 발표한 첫 주제별 브리프도 허깅페이스 사고를 중심 사례로 다뤘다. 같은 사고를 두고 METR은 현장 기록을 분석했고, 유엔 패널은 각국 정부가 취할 조치를 권고했다.
METR이 하는 일은 모델 능력의 계량과 사고 기록의 외부 확인이다. 과제 길이라는 단위를 도입해 모델끼리 비교할 수 있게 했고, 개발사가 낸 위험 보고서를 검토하며, 사고가 나면 현장 기록을 직접 들여다본다. 앤트로픽이 9월 18일 액센추어 산하 패컬티를 첫 내장 평가자로 지정하면서 METR을 비롯한 비영리 기관과도 비슷한 방식을 시범 운영하고 있다고 밝혀, 이런 외부 검증을 상시 구조로 만들려는 시도가 이어지고 있다. 다만 METR 스스로 허깅페이스 조사에서 밝혔듯, 검증하는 쪽도 이제 AI에 의존하지 않고서는 분석량을 감당하기 어려운 단계에 들어섰다.
자세한 내용은 METR에서 확인할 수 있다.
이미지 출처: METR
AI Matters 뉴스레터 구독하기











