비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

세일즈포스, 모델은 그대로 두고 주변만 바꿔 브라우저 작업 성공률 43.5%에서 93%로

2026.09.18. 18:00:32
조회 수
127
8

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

세일즈포스 연구진은 모델 가중치를 전혀 건드리지 않고 브라우저 작업 성공률을 43.5%에서 93.0%로 높였다. 연구진이 공개한 프레임워크 ‘다윈X’는 모델을 재학습하는 대신 모델 주변의 하네스를 바꾼다. 하네스는 모델에 지시문을 넣고 도구를 연결하고 작업 순서를 정하는 껍데기로, 모델 자체가 아니라 모델을 부리는 방식에 해당한다.

논문은 7월 31일 arXiv에 제출됐고 세일즈포스 AI 리서치 소속 연구자 12명이 참여했다. 세일즈포스 최고과학자 실비오 사바레세도 저자에 포함됐다.

측정은 웹 작업 1,260개로 구성된 벤치마크 웹아레나-인피니티에서 진행됐다. 벤치마크는 정해진 문제로 성능을 재는 시험 방식을 말한다. 기반 모델은 GPT-5.5로 고정했고, 출발점으로 삼은 하네스는 기존 에이전트 ‘모네’다. 성공률이 43.5%에서 93.0%로 높아졌고, 에이전트가 정상 범위를 벗어나 쓸 수 없는 결과를 내놓은 비율은 약 23.5%에서 1.4%로 줄었다.

연구진은 벤치마크 네 종에서 성능을 측정했고 평균 상승 폭은 약 17점이다. 터미널-벤치 2.1은 7.7점 상승해 83.2%를 기록했고, 성능이 더 좋은 기반 모델에서는 84.7%였다. 터미널월드의 홀드아웃 분할에서는 68.3%로 시중에 나와 있는 에이전트를 모두 앞섰다. 홀드아웃은 조정에 쓰지 않고 시험용으로만 남겨 둔 과제 묶음을 말한다.

터미널-벤치 2.1에서 진화시킨 하네스는 수정 없이 SWE-bench 베리파이드에 그대로 적용됐고 3.4점 상승했다. SWE-bench 베리파이드는 실제 소프트웨어 저장소의 이슈를 해결하게 하는 시험이다. 연구진은 특정 벤치마크에만 통하는 보정이 아니라 에이전트의 일반 능력이 개선된 결과라고 설명했다.

다윈X는 하네스 변형본을 여러 개 유지한 뒤 자연선택 방식으로 걸러 낸다. 각 변형본은 에이전트가 외부와 주고받는 방식을 서로 다르게 설정한 구성이며, 성과가 좋은 구성을 남기고 서로 다른 계통에서 잘 통한 요소를 결합한다. 채택 조건은 다루는 범위를 넓히면서 기존에 풀던 과제의 성적을 떨어뜨리지 않는 것이다. 탈락한 계통도 보관소에 남겨 두었다가 나중에 다른 계통과 결합한다. 어느 변형을 남길지는 각 벤치마크에 딸린 검증기가 판정하며, 정답 풀이를 미리 넣거나 연구자가 직접 고르지 않는다.

다윈X 방식은 모델을 다시 학습시키지 않고도 성능을 높일 수 있다는 점에서 비용 부담을 줄인다. 같은 모델을 쓰더라도 주변 설정을 어떻게 구성하느냐에 따라 실제 업무 수행 결과가 크게 달라진다는 뜻이기도 하다.

자세한 내용은 벤처비트(VentureBeat)에서 확인할 수 있다.

이미지 출처: 세일즈포스




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
5/1
웨이모 전 재무책임자 엘리사 드 마르텔, 영국 자율주행 기업 웨이브 합류 AI matters
세일즈포스, 모델은 그대로 두고 주변만 바꿔 브라우저 작업 성공률 43.5%에서 93%로 AI matters
폴리티코 여론조사, 미국인 63% “AI가 인류 파괴 가능”…개발 중단 48%가 계속 개발 31% 앞섰다 AI matters
오픈AI 아스트라, 마인크래프트 141시간 자율 플레이…크리퍼에 창고 잃고 감자만 캤다 AI matters
피어리오딕 랩스, 실험실 데이터로 1조 파라미터 ‘네온’ 학습…XRD 분석에서 GPT-6 아스트라 앞섰다 AI matters
파이어폭스에 미스트랄 모델 적용된다…모질라 ‘스마트 윈도우’ 베타 구동 AI matters
수출 통제에도 엔비디아 칩 6조 원어치 중국행…대학·동남아·셸 컴퍼니 경로 확인됐다 (1) AI matters
마누스, 기업가치 5조 5,000억 원 목표로 첫 투자 유치…메타 분리 뒤 처음 AI matters
폰데어라이엔 “프런티어 속도를 조절하자”…EU, AI 연구소들 브뤼셀로 부른다 AI matters
오픈AI, 판례 2억 3,000만 건 검색하는 법률 전용 ‘아스트라 포 로’ 공개 AI matters
“인류 역사상 가장 큰 노동 절도”…오픈AI·MS 내부 문서, 저작권 소송서 공개됐다 AI matters
구글 딥마인드, AGI 토론장 ‘딥마인드 인스티튜트’ 개설…에세이 4편 먼저 공개 AI matters
시마테크놀러지스코리아, 서울서 ‘드론 서밋’…산학연 70명에 모달릭스 기반 AI 처리 시연 AI matters
애플, M8 울트라 칩 기반 AI 서버 개발…엔비디아 인터커넥트 사용도 논의했다 AI matters
아마존, 제너랙과 11조 원 발전기 공급 계약…주식 169만 주 매입 권리도 확보했다 AI matters
Z.ai “중국산 가속기 10만 장에 GLM-5.3-플래시 서비스”…2주 만에 처리량 3배 AI matters
모디 총리, 인도 반도체 미션 2단계 발표…12년간 18조 6,000억 원 투입한다 (1) AI matters
미국·중국 안보 전문가, AI에 핵무기식 통제선 제안…”AI 사고 전용 군사 핫라인 필요” AI matters
위고비 만든 노보 노디스크, 앤트로픽과 신약 개발 협력 AI matters
AI 보안 기업 이레귤러 “코딩 에이전트가 스스로 모델을 재학습해 배포했다” AI matters
이 시간 HOT 댓글!
1/4