오픈AI(OpenAI)가 GPT-6 아스트라에 이어 ‘GPT-6 솔(Sol)’과 ‘GPT-6 루나(Luna)’를 출시하며 GPT-6 제품군을 확대했다. 고성능이 필요한 핵심 업무부터 속도와 비용 효율이 중요한 일상 업무까지 작업의 복잡도와 규모, 예산에 따라 모델을 선택할 수 있도록 선택지를 넓힌 것이 특징이다.
GPT-6 솔과 루나는 GPT-6 아스트라와 유사한 방식으로 학습됐으며 전문 업무와 사실 정확성, 코딩, 컴퓨터 사용, 정렬 등에서 각각 이전 세대인 GPT-5.6 솔과 GPT-5.6 루나보다 성능을 높였다.
GPT-6 아스트라가 높은 수준의 성능이 요구되는 중요 작업에 초점을 맞춘 모델이라면 GPT-6 솔과 루나는 향상된 성능을 보다 빠르고 비용 효율적으로 제공해 GPT-6를 일상적인 업무와 서비스에도 폭넓게 적용할 수 있도록 설계됐다.
복잡한 도구 활용 업무 성능 강화
여러 도구를 연계해 실제 업무를 처음부터 끝까지 수행하는 능력도 개선됐다.
영업과 마케팅, 운영, 고객 지원, 재무, 인사 등 실제 업무 환경에서 47개 도구를 활용하는 능력을 평가하는 ‘AutomationBench’에서 GPT-6 솔은 xhigh 추론 수준 기준 33.2%를 기록했다. 이는 GPT-6 아스트라가 low 추론 수준에서 기록한 30.3%보다 높은 수치다.
GPT-6 루나 역시 high 추론 수준에서 GPT-5.6 루나보다 5.4%포인트 높은 점수를 기록했다. 작업당 비용은 58% 낮췄다.
추론 수준은 모델이 문제 해결 과정에 투입하는 추론 자원의 정도를 설정하는 기능이다. 복잡한 작업에서는 추론 수준을 높여 성능을 우선할 수 있고, 상대적으로 단순한 작업에서는 수준을 낮춰 응답 속도와 비용 효율을 높일 수 있다.
GPT-6 솔과 GPT-6 루나가 AutomationBench 평가에서 각각 높은 업무 수행 성능과 비용 효율성을 보였다.
실제 챗GPT 대화 기반 사실 정확성 개선
사실 정확성도 향상됐다. 오픈AI는 이용자가 이전 모델의 사실 오류를 지적했던 비식별화된 실제 챗GPT 대화를 기반으로 모델 정확성을 평가했다.
그 결과 GPT-6 솔은 GPT-5.6 솔과 비교해 오류가 약 절반 수준으로 감소했으며, GPT-6 아스트라에 근접한 사실 정확성을 보다 낮은 비용으로 구현했다.
GPT-6 루나는 높은 추론 수준에서 GPT-5.6 솔과 비슷한 정확성을 기록하면서 비용은 약 100분의 1 수준이었다.
다만 오픈AI는 해당 평가가 오류 발생 가능성이 높은 대화를 별도로 선별해 진행한 만큼, 결과값이 일반적인 챗GPT 사용 환경에서 발생하는 사실 오류 비율을 의미하지는 않는다고 설명했다.
코딩 성능 높이고 ‘잘못된 작업 설명’ 줄여
코딩 영역에서는 성능뿐 아니라 개발 비용과 응답 품질도 개선했다. 기술·코딩 관련 대화에서 과도한 전문용어나 어색한 표현, 불필요한 세부 설명을 줄이고 핵심 내용을 보다 명확하고 간결하게 전달하도록 했다.
모델이 실제 수행한 코딩 작업을 사용자에게 설명하는 정확성도 높아졌다.
오픈AI 내부 평가에서 자신이 수행한 작업을 사실과 다르게 설명한 응답 비율은 GPT-6 솔이 1.3%, GPT-6 루나는 2.8%로 나타났다. 이전 세대인 GPT-5.6 솔의 10.4%, GPT-5.6 루나의 9.5%보다 낮은 수준이다.
이 평가 역시 사실과 다른 설명을 유도할 가능성이 높은 어려운 코딩 작업을 의도적으로 선별해 진행한 것으로, 일반적인 이용 환경에서 같은 유형의 오류가 발생하는 실제 비율을 의미하지 않는다.
프롬프트 캐싱 개선…캐시 입력 토큰 90% 할인
개발자가 반복적으로 사용하는 문맥을 효율적으로 처리하기 위한 프롬프트 캐싱도 강화했다.
프롬프트 캐싱은 반복되는 입력 문맥을 매번 새롭게 처리하지 않고 기존 결과를 재사용해 응답 시간과 비용을 줄이는 기능이다. GPT-6에서는 기본 캐시 적중률을 높였으며, 캐시된 입력 토큰에는 90% 할인된 가격이 적용된다.
깃허브(GitHub)는 최근 수개월 동안 이 같은 개선을 활용한 결과 새롭게 처리해야 하는 프롬프트 토큰 비중이 50% 이상 감소했다고 밝혔다.
컴퓨터 직접 조작 성능도 비용 효율 높여
AI가 운영체제와 애플리케이션을 직접 조작하는 컴퓨터 사용 분야에서도 효율성이 개선됐다.
AI가 컴퓨터를 직접 조작하면서 여러 단계에 걸친 일상·전문 업무를 수행하는 능력을 평가하는 ‘OSWorld 2.0’ 오프라인 평가에서 GPT-6 솔과 GPT-6 루나는 각각 이전 세대 모델보다 높은 비용 효율을 기록했다.
특히 GPT-6 루나는 max 추론 수준에서 GPT-5.6 솔의 medium 추론 수준보다 높은 성능을 기록하면서도 비용은 약 10분의 1 수준으로 낮췄다.
챗GPT 워크·코덱스·API부터 제공
GPT-6 솔과 GPT-6 루나는 플러스, 프로, 비즈니스, 엔터프라이즈, 에듀 이용자를 대상으로 챗GPT 워크(ChatGPT Work)와 코덱스(Codex)를 통해 제공된다. 무료·고(Go) 요금제 이용자는 데스크톱 앱에서 GPT-6 루나를 사용할 수 있다.
API에서는 각각 ‘gpt-6-sol’과 ‘gpt-6-luna’ 모델명으로 제공된다.
GPT-6 솔의 API 이용 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러다. GPT-5.6 솔의 프로모션 가격과 비교하면 50% 낮은 수준이다.
GPT-6 루나는 입력 100만 토큰당 0.10달러, 출력 100만 토큰당 0.50달러로 책정됐다. 이 역시 GPT-5.6 루나 프로모션 가격 대비 50% 낮다.
두 모델은 출시 당일부터 챗GPT 워크와 코덱스에 순차적으로 적용된다. 다만 현재 챗GPT의 일반 챗(Chat)에는 제공되지 않는다.
이준문 기자/jun@newstap.co.kr
ⓒ 뉴스탭(https://www.newstap.co.kr) 무단전재 및 재배포금지
[뉴스탭 인기 기사]
· 소니 첫 어안 줌 G 렌즈 나왔다…8mm 원형부터 14mm 대각선 어안까지
· “접이식도 로드바이크처럼 달린다”…다혼, 프레임 강성 33% 높인 기술 공개
· 배럴, 뉴욕 정원의 꽃을 수영복에…‘26FW NYBG 플라워 시리즈’ 출시
· DDR5 192GB도 ‘6000 CL26’…코잇, 바이윈 하이엔드 메모리 ‘VORTEX’ 국내 출시
· 게임은 콘솔처럼, 활용은 PC처럼…‘MSI 클로 8 EX AI+’











