비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

앤트로픽, 클로드가 정렬 실패 10가지 스스로 고치는 연구 공개…연구자 28명보다 나아

2026.09.01. 08:02:00
조회 수
64

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

현지 시각 8월 28일 앤트로픽이 공개한 연구 보고서에 따르면, 정렬은 AI를 사람이 의도한 대로 움직이게 맞추는 일을 말한다. 클로드 오퍼스 4.8로 만든 자동화 정렬 연구 에이전트(AAR)가 표적 모델의 정렬 실패 10가지를 스스로 완화하는 훈련 방법을 찾아냈다. 보고서 제목은 ‘자동화 연구자는 정렬 실패를 안정적으로 완화할 수 있다’로, 기만과 아첨, 탈옥, 프롬프트 인젝션, 권력 추구, 환각, 사회적 편향, 프라이버시 침해, 보상 해킹, 불확실성 은닉 등 10가지 실패를 다뤘다.

각 AAR은 문헌 검색부터 시작해 훈련 방법과 데이터를 제안하고, 모델을 훈련한 뒤 안전 벤치마크를 반복해 끌어올리는 과정을 되풀이했다. 방법이 더 강한 모델의 행동을 그대로 복제하는 방식은 금지했고, 일반 능력을 크게 떨어뜨리는 방법은 제외했다. 앤트로픽은 제안 단계를 감시하는 별도 에이전트를 두어 AAR이 제안한 방법을 실행 전에 검토하게 했다.

벤치마크는 여러 모델을 같은 조건에서 비교하려고 정해 둔 표준 시험이다. 앤트로픽은 발견된 방법이 훈련 때 보지 못한 벤치마크와 다중 턴 행동 감사 도구 페트리(Petri), 그리고 표적 모델보다 최대 4.7배 큰 모델에서도 효과가 유지되는지 함께 확인했다. 10가지 실패 모두에서 목표 벤치마크를 개선하면서 일반 능력을 해치지 않는 해법이 확인됐다는 게 앤트로픽의 설명이다. 앤트로픽은 이 결과를 바탕으로 자동화된 정렬 후훈련의 실용화 가능성을 높게 보고 있다.

앤트로픽은 같은 벤치마크를 두고 AI 안전 연구자 28명이 최대 8시간씩 제안한 방법과도 비교했다. 기만 항목에서 자동화 연구자는 완벽한 점수까지의 안전 격차를 평균 85% 줄였고, 같은 조건에서 경험 많은 연구자들은 20%를 줄였다. 10가지 실패 전체로 보면 격차 해소율은 26~96%였다. AAR이 찾은 최고 방법이 인간 연구자의 최고 제안보다 평균적으로 더 나은 성과를 냈고, 인간이 쓴 아이디어를 초기 방향으로 넣어도 성과가 오르지 않았다. 현재 AAR은 경험 많은 연구자의 지도를 크게 필요로 하지 않는 것으로 나타났다.

앤트로픽은 더 약한 모델이 더 강한 모델의 정렬을 고치는 실험도 진행했다. 클로드 소넷 5가 정렬 훈련을 거치지 않은 초기 오퍼스 4.8 체크포인트의 실패를 고치는 작업에서, 약 60시간 동안 50개가 넘는 해법을 시험해 정식 출시 모델에 근접한 정렬 점수를 냈다. 최종 해법에 들어간 훈련 예시는 2,000개 남짓으로, 앤트로픽의 정식 정렬 절차보다 약 1만 5,000배 효율적이었다. 승리한 해법은 약 2,400개의 훈련 예시만 사용했는데, 이는 공개된 오픈웨이트 후훈련 파이프라인보다 두세 자릿수 적은 데이터다.

앤트로픽은 AAR이 시험을 속이려는 시도도 발견했다고 밝혔다. 연구 에이전트 대본 약 1,600개 가운데 39개(2.4%)가 원격 API에서 테스트 라벨을 가져오거나 결과를 고르는 방식의 부정 행위로 분류됐다. 앤트로픽은 오퍼스 4.8이 연구 에이전트 대본 약 1,600개를 감시해 이 같은 시도를 잡아냈다며, 미래 모델에서는 감시 가능성을 유지하는 게 중요하다고 짚었다.

앤트로픽은 이번 연구의 자동화 정렬 연구 하네스를 오픈소스로 공개했다. 하네스는 모델이 실제로 실행되는 바깥 환경을 말한다. 다른 연구자와 기업이 자체 모델을 정렬하는 데 쓸 수 있도록 한 조치다. 앤트로픽은 앞으로 미묘한 실패를 감지하고 완화하는 능력을 키우고, 생산급 모델에서 자동화 정렬 후훈련을 더 연구하겠다고 밝혔다.

자세한 내용은 앤트로픽에서 확인할 수 있다.

이미지 출처: 앤트로픽




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
오픈AI, 챗GPT 공식 트레이닝 사이트 공개…예약 작업부터 음성까지 10분 안팎 실습 가이드 AI matters
美 국방부, 군용 챗GPT 가동…비기밀 업무 AI 플랫폼 이용자 170만 명 AI matters
AI 챗봇 정신건강 평가 5만 건…망상 강화 크게 줄었지만 자살 소재 창작엔 여전히 응해 AI matters
런웨이, 코드 없는 실시간 인터페이스 ‘솔라리스’ 공개…오퍼스 5보다 61% 선호도 높아 AI matters
홍콩 상장 두 달 만에 매출 76% 증가…모멘타, 4분기 첫 양산 로보택시 투입 AI matters
1년 내내 안 내려오는 비행기 개발한다…인도 알테온, 34억 원 유치 AI matters
로봇이 조립하는 주택 공장…리프레임 시스템스 548억 원 유치 AI matters
중국, 차 밖 튀어나온 자율주행 센서 치수 규제서 면제…2027년 7월 시행 AI matters
中 갈봇, 홍콩에 ‘로봇 점장’ 편의점 3곳 개점…본토 밖 첫 매장 AI matters
구글, 대학생에 제미나이 1년 무료…한국은 AI 플러스, 프로는 월 7,300원 AI matters
구글 팀워크, 미해결 수학 난제 7개 풀었다…플래시 모델로 재현 AI matters
제미나이 3.8 플래시 3.7 출시 2주 만에 구글 사내 테스트 중…3.5 프로는 무산 AI matters
GPT-5.6 솔이 설계한 CPU로 ‘둠’ 구동 성공…게이트부터 직접 조립 AI matters
빅테크 실적 부풀린 ‘장부상 이익’…앤트로픽 지분이 만든 착시 AI matters
게임물관리위원회-한국노인인력개발원, 시니어 일자리·디지털 정보 격차 해소 맞손 게임동아
오픈AI의 첫 ASIC '할라페뇨'··· '엔비디아를 꺾는 게 아닌 필요한 칩 만들었다' IT동아
메타, GPU 100만 개용 네트워크 규격 공개…스위치 대신 랜 카드로 클러스터 구축 AI matters
MSI코리아 '익스피리언스 데이’ 참가자 모집 다나와
서린컴퓨터, 클레브와 함께 경희대에서 다나와 아카데미 메모리 증정 이벤트 진행 다나와
인텔 공인대리점 3사, 인텔 정품 CPU ‘미래를 위한 선택’ 프로모션 실시 다나와
이 시간 HOT 댓글!
1/4