비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

에포크 AI, 주요 AI 벤치마크 15개 심사…9개에 “결함” 판정

2026.09.23. 18:02:14
조회 수
52

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

AI 연구기관 에포크 AI가 널리 쓰이는 AI 벤치마크를 직접 검증하는 벤치마크 리뷰를 시작했다. 첫 묶음 15개 가운데 9개에 결함 판정이 내려졌다. 검증을 통과한 것은 4개, 판단할 정보가 부족하다고 분류된 것이 2개다.

판정 등급은 네 가지다. 발견된 오차가 결과에 실질적 영향을 주지 않으면 검증 완료, 이용자가 알아야 할 실질적 결함이 하나라도 있으면 결함, 심사에 필요한 정보가 부족하면 정보 부족이다. 에포크가 직접 만든 벤치마크는 이해충돌을 이유로 심사하지 않는다. 결함 판정 기준은 검사한 표본의 20% 이상에서 오류가 나오거나, 채점을 대규모로 손상시키는 문제가 확인되는 경우다. 과제가 50개를 넘는 벤치마크는 무작위 50개를 범주별로 뽑아 검사하고, 오류율이 15~25% 사이로 나오면 100개로 늘린다.

결함 판정을 받은 것은 버클리 함수 호출 리더보드 v4, 헬스벤치 프로페셔널, 딥SWE v1.1, 터미널 벤치 4.0.0, SWE-bench 베리파이드, SWE-bench 프로, 휴머니티스 라스트 이그잼, 레흐 마주르 라이팅, 텍스트퀘스트다. 검증을 통과한 것은 익스플로잇벤치 v0.1과 심플QA 베리파이드, 포스트트레인벤치 v1.1, 위어드ML v2 네 가지다.

가장 큰 폭의 오류가 확인된 것은 휴머니티스 라스트 이그잼이다. 에포크는 8개 범주에서 6문항씩 무작위로 48문항을 감사해 22문항, 즉 46%에서 정확도를 바꾸는 오류를 찾았다. 12문항은 문제가 적힌 그대로는 정답을 낼 수 없었고, 10문항은 맞는 답을 틀렸다고 처리할 수 있었다. 그중 5문항은 반대로 틀린 답을 정답 처리할 수도 있었다. 해설에서는 E를 계산해 놓고 정답표에는 D를 적어 둔 문제, 정규화 상수를 21.3535로 계산하고 정답표에는 21.35를 적은 문제가 예로 제시됐다.

터미널 벤치 4.0.0은 과제 66개 중 30개, 45.5%에서 공개적으로 알려진 채점 결함이 확인됐다. 그중 10개는 수정이 예정돼 있었다. 에포크는 “공개적으로 문제를 공유하고 향후 개정에서 고치겠다는 계획이 이 버전의 결과에 미치는 영향을 막아 주지는 않는다”고 적었다. 결함 유형에는 보상 해킹이 포함됐다. 한 과제에서는 검증기로 연결된 통로에 성공 신호를 먼저 써 넣으면 테스트 60개를 모두 통과할 수 있었다. 채점 키가 저장소 안에 들어 있어 정답이 유출되는 과제도 있었다.

SWE-bench 베리파이드에 대해서는 오픈AI가 지난 2월 공개한 감사 결과가 근거로 제시됐다. 과제의 27.6%를 검사한 결과 그중 59.4%가 기능적으로 올바른 제출을 오답 처리하는 결함 테스트를 갖고 있었다. 오픈AI는 당시 시험한 프런티어 모델 전부가 “학습 과정에서 문제와 해답을 최소한 일부는 본 적이 있다”고 밝히며, 이 벤치마크의 점수 향상이 더 이상 실제 소프트웨어 개발 능력의 향상을 반영하지 않는다고 결론지었다.

에포크는 자사 벤치마크를 심사하지 않는 이유를 밝히면서, 자체 감사에서 프런티어매스 v1 문제의 42%에 오류가 있었다는 사실을 각주에 적어 뒀다. 리뷰는 전건이 부분 심사다. 결함 기준을 넘는 오류를 발견한 시점에 검사를 중단한다고 명시했고, 개발사에 사전 연락해 반론을 받으면 함께 게재하겠다고 밝혔다.

자세한 내용은 에포크 AI에서 확인할 수 있다.

이미지 출처: 에포크 AI




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
“기업의 AX를 위한 기술·정책·전략을 논하다” AI경영정보서비스분과 정기세미나 IT동아
[주간보안동향] “부업인 줄 알았는데”…카카오톡 ‘팀미션 사기’ 주의보 外 IT동아
넷마블 '일곱 개의 대죄: GRAND CROSS', 다운로드 8500만 기념 페스티벌 돌입 게임동아
서울창조경제혁신센터+업스테이지+퓨리오사AI+아이티동아, 국산 AI 소버린 생태계 구축 위한 협약식 체결 IT동아
추석 연휴 장거리 운전 전 확인할 체크리스트 IT동아
[주간스타트업동향] 스모어톡, 신한은행에 AI 숏폼 영상 제작 솔루션 공급 外 IT동아
뤼튼테크놀로지스, IPO 대표주관사에 미래에셋증권 선정…NH투자증권 공동주관, 내년 예비심사 청구 목표 AI matters
현대차그룹 포티투닷 차량 AI ‘글레오’, 안전 판정에서 GPT-5.6-루나보다 10%p 높은 정확도 AI matters
리얼월드, 휴머노이드 서밋 서울 2026 기조연설…“실험실 아닌 산업 현장에서 출발한다” AI matters
딥엑스, CES 2027 미디어 이벤트에 한국 기업 대표로 참석…“피지컬 AI가 CES 중심 무대 될 것” AI matters
애플 맥 미니·맥 스튜디오 정식 출시…”토큰당 비용 없다”며 기업 AI 비용 시장 공략 AI matters
에포크 AI, 주요 AI 벤치마크 15개 심사…9개에 “결함” 판정 AI matters
오픈AI, 필즈상 수상자 포함 수학 자문 그룹 신설…”속도 조절 자문은 대상 아니다” AI matters
캐나다 BC주, 오픈AI 제소…”RCMP에 전화 한 통만 했어도 총기 참사 막을 수 있었다” AI matters
美 재무장관 “허깅페이스 사고 책임은 오픈AI 경영진”…AI 연구소 면책 요구 거부 AI matters
엔비디아 아이작 ROS 5.0 공개…AI 에이전트가 로봇 개발 환경 설정을 대신한다 AI matters
알파벳 인트린식, 로봇 팔 제어 스택 아파치 2.0으로 배포…ROSCon서 인트린식 코어 공개 AI matters
코그넥스, 뎁스 카메라 기업 리얼센스 6,770억 원에 인수…로봇 인식 시장 진입 AI matters
웨이모, 내슈빌서 13~17세 단독 탑승 허용…청소년 계정 적용 두 번째 도시 AI matters
사이러, 5,420억 원 추가 투자…AI 에이전트 보안 ‘신뢰 계층’ 구축 AI matters
이 시간 HOT 댓글!
1/4