샤오미가 현지 시각 9월 22일 미모(MiMo)-V2.6 시리즈를 출시하고 오픈소스로 공개했다. 프로와 플래시 두 종이며 텍스트와 이미지, 음성을 함께 처리한다. 출시에 앞서 샤오미는 두 모델의 강화학습 훈련 과정을 웹페이지(mimo.xiaomi.com/rl)에 6일 동안 실시간으로 공개했다. 강화학습은 모델이 문제를 풀고 그 결과에 점수를 받아 스스로 답을 고쳐 나가는 훈련 방식으로, 사전 학습을 마친 모델의 성능을 끌어올리는 단계에 쓰인다.
대시보드에는 단계마다 투입한 프롬프트 수와 소모 토큰, 보상 값, 벤치마크 통과율과 함께 누적 훈련 비용이 표시됐다. 9월 22일 현재 두 모델 모두 30단계에서 훈련을 마쳤고, 프로는 262만 670달러(약 36억 3,000만 원), 플래시는 85만 4,044달러(약 11억 8,000만 원)를 썼다. 합치면 347만 달러, 약 48억 원이다. 학습한 궤적은 두 모델을 합해 약 75만 건이다.
실제 소프트웨어 개발 과제를 다루는 딥SWE v1.1에서 프로는 58.4점에서 72.6점으로, 플래시는 48.8점에서 65.7점으로 올랐다. 훈련 과제의 평균 통과율은 각각 12%, 25% 상대 개선됐다.
아티피셜 애널리시스 지능 지수에서 프로는 46점을 기록해 키미 K3와 큐원3.8 맥스를 넘어섰다고 샤오미는 밝혔다. 다만 클로드 페이블 5.1, GPT-6 아스트라 같은 폐쇄형 최상위 모델과는 격차가 있다고 함께 적었다. 에이전트 평가 대부분에서는 클로드 오퍼스 5, GPT-5.6 솔과 비슷한 수준이라고 설명했다.
가격은 V2.5 시리즈와 같다. 샤오미는 같은 지능 수준을 기준으로 프로의 가격이 해외 모델의 20분의 1에서 60분의 1 수준이라고 밝혔다.
장애 기록도 대시보드에 그대로 남아 있다. 전문가 부하 불균형으로 GPU 메모리가 초과돼 프로 학습을 17단계에서 다시 시작했다는 기록, 학습 클러스터와 채점기 사이 네트워크 연결이 끊겨 재시작했다는 기록, 롤아웃 기록에서 이상한 패턴이 관찰돼 보안 데이터셋을 제외했다는 기록이 적혀 있다. 샤오미는 훈련 규모를 키우면서 전문가 선택 경로를 고정해 부하 쏠림을 억제하고, 모델이 보상만 노려 편법을 쓰는 보상 해킹을 막는 검증 체계를 함께 구축했다고 설명했다.
기술 보고서와 훈련 환경, 강화학습 코드는 모두 공개됐다. 샤오미는 다른 연구자가 결과를 재현하고 검증할 수 있게 하려는 것이라고 밝혔다.
자세한 내용은 샤오미 미모 공식 발표에서 확인할 수 있다.
이미지 출처: 샤오미
AI Matters 뉴스레터 구독하기











