엔비디아가 투자한 미국 AI 스타트업 리플렉션 AI(Reflection AI)가 현지 시각 10월 5일 첫 오픈웨이트 모델 ‘빔(Beam)’을 공개했다. 오픈웨이트는 학습으로 정해진 모델 내부 수치인 가중치를 내려받아 직접 실행하고 수정할 수 있게 공개하는 방식이다. 리플렉션은 이달 중 아파치 2.0 라이선스로 가중치와 기술 보고서, 모델 카드를 공개할 예정이며, 현재는 일부 이용자에게 사전 체험 신청을 받고 있다.
빔은 전체 매개변수 5,010억 개 중 230억 개만 작동하는 전문가 혼합(MoE) 방식으로 설계됐다. MoE는 입력마다 일부 전문가 모듈만 골라 계산해 비용을 줄이는 설계를 말한다. 23조 8,000억 토큰으로 사전 학습했고, 한 번에 참고할 수 있는 맥락 길이는 100만 토큰이다. 텍스트만 처리하며 코딩·추론·에이전트 작업에 맞춰 학습했다.
리플렉션은 고급 추론 벤치마크에서 중국 Z.ai의 GLM-5.2와 비슷한 점수를 내면서 추론 연산은 3~4분의 1만 쓴다고 주장했다. 회사가 공개한 표에 따르면 빔은 SWE-벤치 베리파이드 80.9%, 터미널 벤치 v2.1 80.1%를 기록했다. 터미널 벤치에서 딥시크 V4.1 플래시는 90.6%였고, 리플렉션도 문샷 AI의 키미 K3가 성능에서 앞선다고 인정했다. 테크크런치는 리플렉션의 성능 주장이 외부에서 검증되지 않았다고 전했다.
강화학습에는 엔비디아 GB300 그래픽처리장치(GPU) 1만 500개를 4주 동안 투입해 1억 건이 넘는 풀이 기록(롤아웃)을 생성했다. 강화학습은 모델이 과제를 풀고 결과에 따라 보상을 받으며 성능을 개선하는 학습 방식이다. 사전 학습은 GB300 6,144개로 4주 안에 마쳤다. 리플렉션은 강화학습 연산을 늘리는 동안 평가 점수가 계속 상승했고 정체 신호는 없었다고 밝혔다.
리플렉션은 2024년 구글 딥마인드 출신 연구원 두 명이 설립했고, 피치북 집계로 엔비디아와 세쿼이아캐피털 등에서 약 47억 달러(약 6조 3,000억 원)를 유치했다. 6~7월에는 스페이스X·네비우스와 70억 달러 이상 규모의 연산 계약을 맺어 2029년까지 엔비디아 GB300을 확보했다. 회사는 기업과 국가가 자체 데이터로 모델을 학습해 쓰는 ‘AI 팩토리’ 사업을 추진하고 있으며, 한국 신세계그룹과 소버린 AI 팩토리 협력을 시험하고 있다. 소버린 AI는 국가나 기업이 외부에 의존하지 않고 직접 운영하는 AI를 말한다.
자세한 내용은 리플렉션 AI(Reflection AI)에서 확인할 수 있다.
이미지 출처: 리플렉션 AI
AI Matters 뉴스레터 구독하기




"