오픈AI가 현지 시각 9월 22일 제3자 안전 평가에 관한 우선순위와 원칙을 공식 블로그에 게재했다. 학습과 평가, 배포 전 과정에서 독립 평가 기관에 깊은 수준의 접근을 제공하겠다는 내용이며, 작성자는 라마 아마드다.
그동안 업계 표준은 개발이 끝난 모델을 출시 직전에 검증하는 방식이었다. 오픈AI는 이 접근이 평가 기관으로 하여금 회사의 가정에 반박하고, 회사가 놓쳤을 수 있는 위험을 찾아내며, 안전장치의 효과에 대해 독자적인 결론에 도달할 수 있게 해야 한다고 적었다.
오픈AI가 외부 기관에 요청하려는 검토 대상은 네 영역이다. 첫째, 회사가 “이 모델은 안전하다”고 말할 때 그 근거가 실제로 맞는지 확인하는 작업이다. 모델을 학습시킬 때, 성능을 시험할 때, 사내에서 쓸 때, 외부에 공개할 때를 모두 확인한다. 둘째, 위험한 요청을 막는 장치가 실제로 작동하는지 확인하는 작업이다. 모델 자체에 적용한 제한, 이용자 계정을 차단하는 장치, 보안 장치, 모델이 지시를 벗어나는지 감시하는 장치가 대상이다. 셋째, 화학·생물 무기와 해킹, AI가 스스로 성능을 높이는 능력처럼 오픈AI가 위험하다고 분류해 둔 항목을 회사가 제대로 시험하고 있는지 확인하는 작업이다. 시험 문제가 너무 쉬워지지는 않았는지, 합격선을 적절히 정했는지도 함께 확인한다. 넷째, 모델이 실제로 사고를 일으켰을 때 무슨 일이 있었는지 외부가 직접 조사하는 작업이다. 오픈AI는 허깅페이스 사고를 동일 예로 들었다.
원칙으로는 평가 착수 전 범위와 검증 대상 주장을 사전 등록할 것, 법적·보안·지식재산 제약 안에서 비례적 접근을 제공할 것, 방법론과 판단 기준을 공개할 것, 이해 상충을 공개하고 보상 구조가 결과에 영향을 주지 않도록 할 것, 평가 기관이 편집 독립성을 유지하되 기업의 비공개 요청이 있으면 그 사실과 평가에 미친 영향을 함께 적을 것 등이 제시됐다.
블룸버그는 오픈AI가 METR, 레드우드 리서치와 이 평가를 논의하고 있다고 보도했다. 학습 단계까지 범위를 넓히는 이유로는 모델이 자신이 평가받는 상황임을 알아차리는 능력이 언급된다. 완성된 모델만 시험하면 놓치는 신호를 학습 과정 기록에서 확인할 수 있다는 것이다.
이번 발표는 지난 9월 18일 전문가들이 공개서한을 통해 개발사에 소속된 평가자가 독립성을 유지할 수 있는지 문제를 제기한 뒤에 공개됐다.
자세한 내용은 오픈AI에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기











