앤트로픽이 컨설팅 기업 액센추어와 프런티어 AI 독립 평가 파트너십을 체결했다. 앤트로픽 공식 블로그에 따르면 두 회사는 앞으로 5년간 이 분야 역량 구축에 각각 최소 10억 달러(약 1조 3,830억 원), 합계 20억 달러(약 2조 7,660억 원)를 투입한다.
파트너십은 액센추어의 AI 전문 기업 페컬티(Faculty)가 주도한다. 페컬티는 모델 평가와 레드팀 운영, 정렬 평가, 모델 안전장치 시험을 담당한다. 레드팀은 모델의 안전장치를 의도적으로 공격해 취약점을 찾는 작업이고, 정렬 평가는 모델이 인간의 의도대로 작동하는지 확인하는 절차다. 액센추어는 기업과 정부가 AI를 배포하는 현장 경험을 평가에 반영한다.
임베디드 평가는 평가자가 AI 기업 내부에서 직원과 유사한 접근 권한을 갖고 모델 개발 과정을 관찰하는 방식이다. 훈련 과정에서 모델이 어떻게 형성되는지 확인하고, 안전 약속 이행 여부를 점검하며, 사고가 발생하면 보고할 수 있다. 앤트로픽은 이번 협력이 아모데이 CEO가 에세이에서 약속한 임베디드 평가 도입의 첫 단계라고 설명했다.
앤트로픽은 임베디드 평가가 회사의 책임을 줄이는 것이 아니라 검증 가능하게 만드는 절차라고 강조했다. 모델 안전의 최종 책임은 앤트로픽에 남는다는 입장이다. 평가자가 어떤 정보에 접근할 수 있고 어떻게 보고할지에 대한 기준은 아직 정해지지 않았다.
앤트로픽은 6월 공개한 고급 AI 프레임워크에서 장기적으로 공동 기금이나 정부 재원에서 비용이 나와야 한다고 밝혔지만, 현재는 그런 제도가 없어 액센추어의 작업 비용을 직접 부담한다. 평가 기관이 자금을 대는 기업을 평가하는 구조가 된다. 앤트로픽은 비영리 평가 기관 METR 등과도 각자의 재원으로 임베디드 평가의 일부를 시범 적용하는 방안을 논의하고 있다.
앤트로픽은 이번 계약을 비독점으로 맺어 다른 평가 기관과도 협력할 예정이고, 액센추어 역시 다른 AI 개발사와 유사한 역할을 담당할 수 있다. 줄리 스위트 액센추어 회장 겸 CEO는 “임베디드 평가는 새로운 분야이며 안전 환경의 중요한 부분”이라고 말했다. 앤트로픽은 앞으로 수주 안에 추가 평가 기관을 공개한다.
자세한 내용은 앤트로픽(Anthropic)에서 확인할 수 있다.
이미지 출처: 앤트로픽
AI Matters 뉴스레터 구독하기











