AI 연구기관 에포크 AI가 널리 쓰이는 AI 벤치마크를 직접 검증하는 벤치마크 리뷰를 시작했다. 첫 묶음 15개 가운데 9개에 결함 판정이 내려졌다. 검증을 통과한 것은 4개, 판단할 정보가 부족하다고 분류된 것이 2개다.
판정 등급은 네 가지다. 발견된 오차가 결과에 실질적 영향을 주지 않으면 검증 완료, 이용자가 알아야 할 실질적 결함이 하나라도 있으면 결함, 심사에 필요한 정보가 부족하면 정보 부족이다. 에포크가 직접 만든 벤치마크는 이해충돌을 이유로 심사하지 않는다. 결함 판정 기준은 검사한 표본의 20% 이상에서 오류가 나오거나, 채점을 대규모로 손상시키는 문제가 확인되는 경우다. 과제가 50개를 넘는 벤치마크는 무작위 50개를 범주별로 뽑아 검사하고, 오류율이 15~25% 사이로 나오면 100개로 늘린다.
결함 판정을 받은 것은 버클리 함수 호출 리더보드 v4, 헬스벤치 프로페셔널, 딥SWE v1.1, 터미널 벤치 4.0.0, SWE-bench 베리파이드, SWE-bench 프로, 휴머니티스 라스트 이그잼, 레흐 마주르 라이팅, 텍스트퀘스트다. 검증을 통과한 것은 익스플로잇벤치 v0.1과 심플QA 베리파이드, 포스트트레인벤치 v1.1, 위어드ML v2 네 가지다.
가장 큰 폭의 오류가 확인된 것은 휴머니티스 라스트 이그잼이다. 에포크는 8개 범주에서 6문항씩 무작위로 48문항을 감사해 22문항, 즉 46%에서 정확도를 바꾸는 오류를 찾았다. 12문항은 문제가 적힌 그대로는 정답을 낼 수 없었고, 10문항은 맞는 답을 틀렸다고 처리할 수 있었다. 그중 5문항은 반대로 틀린 답을 정답 처리할 수도 있었다. 해설에서는 E를 계산해 놓고 정답표에는 D를 적어 둔 문제, 정규화 상수를 21.3535로 계산하고 정답표에는 21.35를 적은 문제가 예로 제시됐다.
터미널 벤치 4.0.0은 과제 66개 중 30개, 45.5%에서 공개적으로 알려진 채점 결함이 확인됐다. 그중 10개는 수정이 예정돼 있었다. 에포크는 “공개적으로 문제를 공유하고 향후 개정에서 고치겠다는 계획이 이 버전의 결과에 미치는 영향을 막아 주지는 않는다”고 적었다. 결함 유형에는 보상 해킹이 포함됐다. 한 과제에서는 검증기로 연결된 통로에 성공 신호를 먼저 써 넣으면 테스트 60개를 모두 통과할 수 있었다. 채점 키가 저장소 안에 들어 있어 정답이 유출되는 과제도 있었다.
SWE-bench 베리파이드에 대해서는 오픈AI가 지난 2월 공개한 감사 결과가 근거로 제시됐다. 과제의 27.6%를 검사한 결과 그중 59.4%가 기능적으로 올바른 제출을 오답 처리하는 결함 테스트를 갖고 있었다. 오픈AI는 당시 시험한 프런티어 모델 전부가 “학습 과정에서 문제와 해답을 최소한 일부는 본 적이 있다”고 밝히며, 이 벤치마크의 점수 향상이 더 이상 실제 소프트웨어 개발 능력의 향상을 반영하지 않는다고 결론지었다.
에포크는 자사 벤치마크를 심사하지 않는 이유를 밝히면서, 자체 감사에서 프런티어매스 v1 문제의 42%에 오류가 있었다는 사실을 각주에 적어 뒀다. 리뷰는 전건이 부분 심사다. 결함 기준을 넘는 오류를 발견한 시점에 검사를 중단한다고 명시했고, 개발사에 사전 연락해 반론을 받으면 함께 게재하겠다고 밝혔다.
자세한 내용은 에포크 AI에서 확인할 수 있다.
이미지 출처: 에포크 AI
AI Matters 뉴스레터 구독하기



