오픈AI와 앤트로픽이 서로의 AI 모델을 스트레스 테스트하는 법적 구속력 있는 계약을 올해 초 협상했다고 디인포메이션이 현지 시각 9월 21일 보도했다. 스트레스 테스트는 모델에 여러 상황을 집중적으로 입력해 결함이나 숨은 위험을 찾아내는 작업을 말한다. 디인포메이션은 협상을 직접 아는 관계자 한 명을 인용했고, 양사 변호사가 계약 조항을 작성하는 단계까지 진행됐다고 전했다.
협상안에는 각 회사가 상대의 상용 모델에 API로 접근하는 권한을 받고, 테스트 과정에서 확보한 상대 데이터를 보관하지 않는다는 조항이 포함됐다. 대상은 이미 출시된 모델로 한정했고 미공개 모델은 제외했다. 계약이 최종 체결됐는지는 확인되지 않았다.
두 회사는 2025년 8월 27일 비공식 상호 평가 결과를 동시에 공개한 적이 있다. 오픈AI는 클로드 오퍼스 4와 소넷 4를, 앤트로픽은 GPT-4o와 GPT-4.1, o3, o4-mini를 각각 시험했다. 오픈AI 발표문에는 클로드가 시스템 메시지와 이용자 메시지가 충돌하는 상황을 가장 잘 처리했지만 “거부율이 최대 70%로 극히 높았다”고 적혀 있다. 앤트로픽 발표문에는 GPT-4o와 GPT-4.1, o4-mini가 마약 합성이나 생물무기 개발 같은 요청에 “거의 저항 없이 상세한 도움을 제공했다”고 적혀 있다. 협박 시도 비율은 o3가 9%, o4-mini가 1%로 측정됐다. 양사는 평가를 위해 API에 걸린 외부 안전 필터 일부를 서로 풀어 줬고, 앤트로픽은 “양쪽 개발사 모델 중 심각하게 오정렬된 것은 없었다”고 결론을 적었다. 오정렬은 AI가 사람이 의도한 목표에서 벗어난 상태를 가리킨다.
협상이 시작된 시점은 오픈AI의 에이전트가 허깅페이스를 공격한 사건이 드러나기 전이다. 오픈AI는 7월 21일 자사 관여 사실을 공개했고, 8월 26일 공식 보고서에서 이번 사건을 “우리와 세계에 대한 경고탄”이라고 표현했다.
다리오 아모데이는 9월 에세이 「We Must Pace the Frontier」에서 “AI 모델의 능력을 개선하는 속도를 늦춰야 한다”고 적고, 외부 평가자에게 직원 수준의 접근권을 주는 내장 평가자 제도를 앤트로픽이 먼저 시행하겠다고 밝혔다. 샘 알트만은 9월 12일 X에 “다리오와 마찬가지로 프런티어의 속도를 조절해야 한다고 본다”며 “독립 평가자에게 직원과 비슷한 접근권을 주기로 한 것은 좋은 생각이고 우리도 같은 일을 하겠다”고 포스팅했다. 다만 비상장 AI 기업 두 회사가 직접 협력할 경우 반독점 당국이 복점 우려를 들여다볼 수 있다는 지적도 함께 제기됐다.
자세한 내용은 디인포메이션에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기



