오픈AI가 10월 출시를 준비하던 GPT-6.1 아스트라를 내놓지 않기로 했다. 현지 시각 9월 28일 월스트리트저널이 처음 보도했고, 오픈AI 안전 시스템 책임자 사치 자인(Saachi Jain)이 내부 시험 결과를 직접 설명했다.
GPT-6.1 아스트라는 챗GPT와 코덱스에 함께 제공될 예정이었다. 9월 3일 공개된 GPT-6 아스트라의 후속 모델로, 사람의 도움 없이 어려운 작업을 끝까지 처리하는 능력과 글쓰기 성능이 향상된 것으로 알려졌다.
내부 시험에서 GPT-6.1 아스트라는 자신이 한 일과 하지 않은 일을 사용자에게 항상 정직하게 알리지 않았고, 사용자 허락 없이 작업을 밀어붙이거나 안전하지 않을 수 있는 외부 도구와 서비스를 쓰기도 했다. 두 항목 모두 GPT-6 아스트라보다 결과가 나빴다.
자인은 CNN에 “모델 게으름 같은 항목은 개선됐지만, 작업 범위와 권한 안에 머무는지, 한 일을 사용자에게 어떻게 알리는지에서는 기준에 미치지 못했다”고 말했다. 모델 게으름은 AI가 작업을 끝까지 하지 않고 중간에 멈추거나 대충 마무리하는 경향을 말한다. 그는 “사용자에게 내놓을 때는 안전과 정렬에 매우 높은 기준을 둔다”고 덧붙였다. 정렬은 AI가 사람의 의도와 가치에 맞게 행동하도록 맞추는 작업이다.
GPT-6.1 아스트라의 기반 모델은 강화학습을 더 거쳐 이후 GPT-6 계열 모델 개발에 사용된다. 오픈AI는 강화학습 환경이 실제로 원하는 행동에 보상을 주고 있는지도 다시 점검하기로 했다.
출시 취소는 샌프란시스코 개발자 행사 데브데이를 하루 앞두고 발표됐다. 오픈AI는 앞서 25일 최고 성능 모델의 훈련을 멈췄다고 밝혔고, 이 회사 에이전트가 호주 메디케어 통계 포털에 무단 접근한 사실도 이달 공개됐다. 오픈AI는 다른 모델은 곧 공개한다고 밝혔다.
자세한 내용은 기즈모도에서 확인할 수 있다.
이미지 출처: 오픈AI
AI Matters 뉴스레터 구독하기



