오픈AI가 현지 시각 10월 6일 계약 관리 소프트웨어 기업 아이언클라드(Ironclad)와 함께 AI 에이전트를 학습·평가한 연구 결과를 공개했다. 실제 업무용 소프트웨어를 다루는 작업에서 에이전트의 성능을 높이기 위한 공동 연구다. 오픈AI는 GPT-6 아스트라(Astra)가 아이언클라드 과제로 학습한 첫 프런티어 모델이며, 평균 점수가 GPT-5.6 솔(Sol)보다 32% 높고 시도당 예상 소요 시간은 48% 짧았다고 밝혔다.
오픈AI는 기업의 업무 규칙을 이해하고 여러 단계의 작업을 수행한 뒤 결과가 처음 요구 사항을 충족하는지 스스로 확인하는 에이전트를 목표로 제시했다. 예를 들어 소프트웨어 구매 절차를 설정할 때는 일정 금액 이상이면 재무팀 승인을 받도록 하고, 금액 기준 위아래의 요청이 각각 맞는 경로로 처리되는지까지 확인하는 작업이 포함된다.
아이언클라드 직원과 오픈AI 내부의 아이언클라드 이용자가 법무와 상거래, 구매 분야의 과제 11건을 선정했다. 비밀유지계약 설정, 구매 승인 절차 구성, 요청자가 고른 관할 지역에 맞춰 표준 계약 조항을 수정하는 작업 등이다. 숙련된 이용자도 과제당 평균 30~40분이 걸리는 작업이다.
과제마다 난이도에 따라 8~50개 기준으로 채점했다. 아이언클라드는 모델이 연습할 수 있는 자사 소프트웨어 환경을 제공했고, 오픈AI 연구진은 대표적인 업무 흐름을 바탕으로 합성 학습 과제를 제작해 강화학습에 사용했다. 강화학습은 모델이 시도와 피드백을 반복하며 성능을 높이는 학습 방식이다. 합성 과제는 美 증권거래위원회(SEC)의 EDGAR 데이터베이스에 공개된 계약서에서 개인정보를 제거해 제작했으며, 오픈AI 고객 데이터와 아이언클라드 고객의 비공개 계약서는 사용하지 않았다.
과제 11건에서 아스트라의 평균 점수는 55.0%, GPT-5.6 솔은 41.6%였다. 시도당 예상 소요 시간은 37.0분에서 19.2분으로 줄었다. 아스트라 개발에 사용된 내부 모델은 63.7%를 기록했다. 오픈AI는 이 결과가 과제 11건에 한정되며, 소요 시간은 실제 고객이 절약한 시간이 아니라 추정치라고 덧붙였다.
수니타 버마 아이언클라드 최고기술책임자는 에이전트가 개별 동작을 완료하는 데 그치지 않고 계약의 전체 과정과 팀이 사용하는 통제 장치까지 이해할 필요가 있다고 말했다. 오픈AI는 에이전트가 작업 중간에 규칙을 놓칠 수 있는 만큼 사람의 감독이 여전히 필요하다고 밝혔다. 오픈AI는 같은 방식의 공동 연구에 참여할 소프트웨어 기업을 추가로 모집하고 있다.
자세한 내용은 오픈AI에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기











