구글 리서치가 AI 에이전트의 하네스를 스스로 개선하는 방법 RRSI를 공개하고 코드를 아파치 2.0 라이선스로 배포했다. 논문은 9월 21일 아카이브에 올라왔고, 깃허브 저장소에는 세 분야의 실행 예제가 함께 들어 있다.
하네스는 모델 가중치를 제외한 나머지 구성을 가리킨다. 프롬프트와 제어 흐름, 도구, 메모리, 맥락 관리가 여기에 들어간다. 같은 모델을 쓰더라도 하네스를 어떻게 구성하느냐에 따라 에이전트의 성능이 달라지기 때문에, 하네스를 자동으로 수정해 가며 점수가 오르는 방향을 찾는 시도가 이어져 왔다.
문제는 그 방식이 평가에 쓴 과제 묶음에만 맞춰진다는 점이었다. 구글 리서치는 기존 방식에서 세 가지 실패 양상을 제시했다. 특정 벤치마크에만 통하는 규칙을 학습하는 것, 통계적 잡음을 성능 개선으로 오인하는 것, 수정이 쌓이면서 구조가 복잡해지는 것이다. 그 결과 평가에 쓴 과제에서는 점수가 크게 올라도 처음 보는 과제에서는 개선 폭이 줄거나 사라졌다.
RRSI는 수정할 수 있는 범위는 그대로 두고 탐색 과정에 제약을 건다. 한 후보가 한 번에 묶을 수 있는 수정 개수를 회차가 진행될수록 줄이고, 수정 이력 전체를 제안 단계에 함께 넣어 이미 틀린 것으로 확인된 가설을 다시 꺼내지 않게 했다. 선택 단계에서는 별도의 검토 모듈이 특정 평가 묶음에만 통하는 논리가 들어갔는지 미리 거르고, 평가 편차 범위 안에 들어오는 점수 상승은 개선으로 인정하지 않는다. 추론 토큰이 늘어난 수정은 그만큼의 성능 개선을 입증해야 하며, 효과가 사라진 구성 요소는 제거된다.
구글 리서치가 공개한 수치를 보면, 클로드 오퍼스 4.8을 고정 모델로 두고 코딩 분야에서 터미널벤치 2.1 점수가 74.2에서 80.2로 올랐다. 평가에 쓰지 않은 SWE벤치 베리파이드에서는 82.0에서 83.8이 됐다. 업무 처리 분야에서는 잡벤치가 36.0에서 40.7로, GDPval이 48.8에서 52.3으로, 에이펙스-에이전츠가 34.2에서 37.9로 올랐다. 공학 설계 분야의 엔지디자인은 50.0에서 54.9를, 프런티어-엔지는 17.7에서 22.0을 기록했다.
비용도 함께 제시됐다. 제약 없이 탐색한 하네스는 과제당 평균 380만 토큰을 썼지만 RRSI로 찾은 하네스는 242만 토큰을 썼다. 고정 모델을 제미나이 3.5 플래시로 바꾼 경우에도 터미널벤치 2.1 점수가 64.6에서 78.7로 올랐다.
자세한 내용은 구글 리서치 RRSI 저장소에서 확인할 수 있다.
이미지 출처: 구글
AI Matters 뉴스레터 구독하기




아