스페이스XAI가 9월 21일 코딩과 지식 업무용 모델 그록 4.7을 공개했다. 가격은 100만 토큰당 입력 2달러, 출력 6달러로 이전 모델인 그록 4.6과 동일하다. 출력 속도를 두 배로 높인 변형은 두 배 가격으로 제공된다.
그록 4.7은 그록 4.6보다 큰 기반 모델을 사용했고, 더 긴 강화학습을 거쳤다. 학습 과제는 여러 시간이 걸리는 문제 비중을 높여 구성했다. 스페이스XAI는 이 모델이 자기 작업을 검증하는 능력과 긴 맥락을 관리하는 능력에서 개선됐다고 설명했다. 그록 봇 하네스를 기본적으로 이해하도록 학습시켜 대화형 과제와 지식 업무 처리도 함께 개선했다. 하네스는 모델이 도구를 호출하고 결과를 주고받도록 감싸는 실행 환경을 말한다.
벤치마크 결과를 보면 긴 코딩 과제를 평가하는 커서벤치 4.0에서 46.3%를 기록해 그록 4.6의 40.4%와 GPT-5.6 솔의 41.7%를 앞섰고, 클로드 페이블 5.1의 51.8%에는 못 미쳤다. 딥SWE v1.1은 71.0%, 전기공학 평가 EE벤치는 64.0%, 터미널벤치 4.0은 38.0%, 임상 추론 평가 헬스벤치 프로페셔널은 56.7%였다. 하비 법률 에이전트 벤치마크에서는 19.6%로, GPT-5.6 솔의 2.5%와 페이블 5.1의 6.7%를 크게 앞섰다.
변호사와 간호사, 재무 분석가가 하는 업무를 평가하는 GDPval에서 그록 4.7은 일로 점수 1,695를 기록했다. 페이블 5.1이 1,735, 그록 4.6이 1,605, GPT-6 아스트라가 1,542였다.
안전 측면에서 스페이스XAI는 안전장치 구성을 새로 설계했다고 밝혔다. 래치바이오 생물 안전 벤치마크에서 62.4%로 1위를 기록했고, 위험하거나 악의적인 사이버 과제를 평가하는 자체 벤치마크 해커벤치 v0.3에서는 위험한 이중 용도 프롬프트의 3.3%만 통과시켰다. 이중 용도는 방어와 공격 양쪽에 쓰일 수 있는 기술을 가리킨다. 회사는 일부 사이버보안 협력사에 초대 방식으로 그록 4.7의 레드팀 기능을 제공하기 시작했다.
그록 4.7은 커서와 그록 빌드에서 바로 쓸 수 있고, 그록 API와 서드파티 코딩 하네스, 모델 라우터와 클라우드 플랫폼을 통해서도 제공된다.
자세한 내용은 SpaceXAI에서 확인할 수 있다.
이미지 출처: 스페이스XAI
AI Matters 뉴스레터 구독하기











