1B 모델의 반란: 테스트 시간 확장으로 405B 대형 언어 모델 능가 : 다나와 DPG는 내맘을 디피지

Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling

테스트 시간 확장이 작은 언어 모델의 성능을 비약적으로 향상

테스트 시간 확장(Test-Time Scaling, TTS)은 추론 단계에서 추가적인 계산을 활용해 대형 언어 모델(LLM)의 성능을 향상시키는 중요한 방법이다. 상하이 AI 연구소와 칭화대학교 연구진의 연구에 따르면, 이 방법을 통해 작은 규모의 언어 모델이 자신보다 훨씬 큰 모델의 성능을 능가할 수 있다는 놀라운 결과가 확인됐다.

특히 주목할 점은 1B 규모의 언어 모델이 적절한 테스트 시간 확장 기법을 적용했을 때 405B 규모의 모델보다 더 나은 성능을 보여줬다는 것이다. MATH-500 및 AIME24 수학 벤치마크에서 컴퓨팅 최적화된 테스트 시간 확장을 적용한 Llama-3.2-3B 모델은 Llama-3.1-405B 모델을 각각 78.2% 대 71.4%, 30.0% 대 23.3%의 점수로 앞섰다. 이는 언어 모델의 크기만이 성능을 결정하는 유일한 요소가 아니라는 것을 시사한다.

최적 테스트 계산 전략은 정책 모델, 보상 모델, 문제 난이도에 따라 차별화

연구진은 테스트 시간 확장의 최적 계산 전략이 정책 모델(policy model), 과정 보상 모델(Process Reward Model, PRM), 그리고 문제 난이도에 크게 의존한다는 것을 발견했다. 다양한 크기(0.5B에서 72B까지)의 정책 모델과 여러 종류의 과정 보상 모델을 사용한 광범위한 실험을 통해, 서로 다른 조합에 따라 최적의 테스트 시간 확장 전략이 다르게 나타난다는 것이 확인됐다.

실험 결과, 작은 정책 모델에는 검색 기반 방법이, 큰 정책 모델에는 Best-of-N 방법이 더 효과적이었으며, Math-Shepherd와 RLHFlow PRMs에는 Best-of-N이, Skywork와 Qwen2.5-Math PRMs에는 검색 기반 방법이 더 효과적인 것으로 나타났다. 연구진은 이러한 관찰을 바탕으로 보상 모델의 특성을 고려한 보상 인식 계산 최적 테스트 시간 확장 전략을 제안했다.

소형 모델의 대반전: 0.5B 모델이 GPT-4o 뛰어넘고, 7B 모델은 o1 능가

가장 놀라운 연구 결과 중 하나는 매우 작은 모델들이 최적화된 테스트 시간 확장 전략을 통해 훨씬 큰 모델들을 능가할 수 있다는 점이다. MATH-500 및 AIME24 벤치마크에서 0.5B 규모의 모델이 GPT-4o보다 우수한 성능을 보였으며(Qwen2.5-0.5B-Instruct: 76.4% vs GPT-4o: 74.6%), 3B 모델은 405B 모델을 뛰어넘었다.

더욱 인상적인 점은 7B 규모의 DeepSeek-R1-Distill-Qwen-7B 모델이 OpenAI의 o1(MATH-500: 95.2% vs 94.8%, AIME24: 83.3% vs 79.2%)과 DeepSeek-R1(AIME24: 83.3% vs 79.8%)과 같은 최첨단 추론 모델보다 더 높은 점수를 획득했다는 것이다. 이는 이전 TTS 연구에서의 결과(23배 크기 차이)를 487.0% 향상시켜 135배 더 큰 모델도 능가할 수 있음을 입증했다.

소형 모델에서 최대 154.6% 성능 향상: 테스트 시간 확장의 효율성 검증

연구에 따르면 테스트 시간 확장을 적용했을 때 성능 향상 효과는 모델 크기에 따라 달라진다. 특히 소형 모델에서 가장 극적인 성능 향상이 관찰되었다. Llama-3.2-1B-Instruct 모델의 경우 일반적인 추론 방식(CoT) 대비 154.6%의 성능 향상을 보였으며, Qwen2.5-0.5B-Instruct 모델은 141.8%의 성능 향상을 기록했다. 또한 테스트 시간 확장은 다수결 투표 방식보다 최대 256배 더 효율적인 것으로 나타났다.

반면 모델 크기가 커질수록 성능 향상 폭은 감소하는 경향을 보였다. 예를 들어, Qwen2.5-72B-Instruct 모델의 경우 성능 향상률은 9.5%에 불과했다. 이는 강력한 추론 능력을 갖춘 대형 모델의 경우 테스트 시간 확장의 이점이 제한적일 수 있음을 시사한다.

연산량 비교: 소형 모델의 TTS가 대형 모델보다 100~1000배 더 효율적

연구진은 테스트 시간 확장을 적용한 소형 모델과 일반 추론을 사용한 대형 모델 간의 연산량(FLOPS)을 비교했다. 그 결과, Llama-3.2-3B-Instruct(테스트 시간 확장 적용)는 Llama-3.1-405B-Instruct보다 같은 성능을 내면서도 훨씬 적은 추론 연산량을 사용했으며, 총 연산량은 100~1000배 감소시킬 수 있었다.

구체적으로, Llama-3.2-3B-Instruct의 사전 학습 FLOPS는 1.62 × 10^23, 추론 FLOPS는 3.07 × 10^17인 반면, Llama-3.1-405B-Instruct는 사전 학습 FLOPS가 3.65 × 10^25, 추론 FLOPS가 4.25 × 10^17로 측정됐다. 이는 테스트 시간 확장이 대형 모델의 대안으로 컴퓨팅 자원을 효율적으로 사용할 수 있는 방법임을 보여준다.

TTS vs 장문 사고 방식(Long-CoT): 기존 방법들과 성능 비교

연구진은 테스트 시간 확장을 최근 발표된 장문 사고 방식(Long-CoT) 기반 메서드들과 비교했다. rStar-Math, Eurus-2, SimpleRL, Satori 등과 같은 방법들과 비교한 결과, TTS를 적용한 Qwen2.5-7B-Instruct 모델은 MATH-500(88.0% vs 82.4%)과 AIME24(33.3% vs 26.7%)에서 SimpleRL보다 더 나은 성능을 보였다.

그러나 DeepSeek-R1-Distill-Qwen-7B와 같은 강력한 추론 모델에서 증류된 모델과 비교했을 때는 MATH-500에서는 비슷한 성능을, AIME24에서는 상당한 성능 차이를 보였다. 이는 TTS가 MCTS를 통해 생성된 데이터에 직접 RL이나 SFT를 적용하는 방법보다 효과적이지만, 강력한 추론 모델에서 증류하는 방법보다는 덜 효과적일 수 있음을 시사한다.

PRMs의 한계와 도전: 과적합, 에러 무시, 편향된 점수 매기기 문제

연구진은 과정 보상 모델(PRM)의 여러 한계점도 발견했다. 테스트 시간 확장 출력을 분석한 결과, PRMs에는 (1) 수학적으로 올바른 단계에도 낮은 점수를 부여하는 과도한 비판, (2) 명백한 수학적 오류를 감지하지 못하는 에러 무시, (3) 실제 오류 위치가 아닌 곳에 낮은 점수를 부여하는 오류 위치 편향, (4) 중간 단계의 토큰 길이와 같은 훈련 데이터 특성에 대한 점수 편향 등의 문제가 있었다.

이러한 문제들은 추론 검색 과정을 왜곡하고 전반적인 성능을 저하시키며 PRM 기반 추론의 신뢰성을 감소시킨다. 연구진은 이러한 편향을 해결하기 위해 향후 모델 아키텍처와 훈련 절차의 개선이 필요하다고 강조했다.

FAQ

Q: 테스트 시간 확장(TTS)이란 정확히 무엇인가요?

A: 테스트 시간 확장은 언어 모델이 추론(인퍼런스) 단계에서 추가적인 계산을 활용하여 성능을 향상시키는 방법입니다. 내부 TTS와 외부 TTS 두 가지 방식이 있으며, 이번 연구는 주로 샘플링이나 탐색 기반 방법을 사용한 외부 TTS에 초점을 맞추고 있습니다.

Q: 작은 언어 모델이 큰 모델을 능가한다는 것이 왜 중요한가요?

A: 작은 모델은 훈련 및 배포에 필요한 컴퓨팅 자원이 훨씬 적게 들어 비용 효율적입니다. 이번 연구 결과는 거대 모델을 만들기 위한 막대한 자원 투자 없이도 테스트 시간 확장을 통해 뛰어난 성능을 얻을 수 있음을 보여줍니다. 실제로 소형 모델이 테스트 시간 확장을 통해 대형 모델을 능가하면서 총 계산량은 100~1000배 감소시킬 수 있었습니다.

해당 기사에 인용된 논문 원문은 링크에서 확인할 수 있다.

기사는 클로드와 챗GPT-4o를 활용해 작성되었습니다.

AI Matters 뉴스레터 구독하기

[창간] 코딩 안 하는 개발사 시대 온다…AI가 바꾸는 게임 개발의 문법 (1)	게임동아
올 해는 메르세데스 벤츠 브랜드 100주년이자 자동차 발명 140주년의 해 (1)	글로벌오토뉴스
테슬라, 2분기 예상 판매 40만 대 넘긴다지만 '성장률은 고작 5.7%' (1)	오토헤럴드
폭스바겐그룹, 최대 10만 명 감원 검토 '브랜드 분사까지 나왔다'	오토헤럴드
현대차 투싼 ,'주행 중 계기판 화면 꺼짐' 현상으로 10만 여대 리콜	오토헤럴드
BYD 아태 부총재 “한국 전기차 속도 세계 최고"…소비자 접점 강화 주력	글로벌오토뉴스
베일 벗은 5세대 신형 BMW X5, 파격적 디자인 변혁과 다재다능한 파워트레인	글로벌오토뉴스
AI와 로보틱스가 바꾸는 자동차 공장의 풍경	글로벌오토뉴스
넥센타이어, BYD와 첫 신차용 타이어 공급 계약 체결	글로벌오토뉴스
유럽, 2027년 의무화 디지털 배터리 여권 대비 배터리패스-레디 테스트 플랫폼 가동	글로벌오토뉴스
폴스타, 커넥티드카 규제로 2027년형부터 미국 시장 판매 중단	글로벌오토뉴스
BMW, 차세대 휴머노이드 로봇 피겨 03 미국 공장 투입… 물류 자동화 가속	글로벌오토뉴스
다임러트럭과 볼보 합작사 코레투라, 액센츄어와 협력 상용차 SDV 표준 플랫폼 개발 가속	글로벌오토뉴스
미국 아마존 죽스, 양산형 로보택시 개량형 공개	글로벌오토뉴스
포르쉐, 전기·하이브리드·내연기관 넘나드는 4모드 파워트레인 특허 출원	글로벌오토뉴스
CATL, BMW/볼보/르노/샤오미 등과 글로벌 배터리 순환경제 동맹 결성	글로벌오토뉴스
르노코리아, 그랑 콜레오스 5차 무선 업데이트 진행	글로벌오토뉴스
현대자동차, 미래 정비 혁신 거점 '수원하이테크센터' 개관	글로벌오토뉴스
BMW 그룹 코리아, BMW·MINI 순수전기차 전 수량 무상 안전점검 실시	글로벌오토뉴스
포르쉐코리아-삼성카드, 럭셔리 브랜드 경험 확대를 위한 MOU 체결	글로벌오토뉴스
지커, 전기 SUV '7X' 잠재 고객 대상 테크 워크샵 성료	글로벌오토뉴스
현대자동차, ESG 리스크 관리와 지속가능 전략 담은 '2026 지속가능성 보고서' 발간	글로벌오토뉴스
람보르기니, 전 세계 럭셔리 드라이빙 투어 ‘에스페리엔자 2026’ 라인업 공개	글로벌오토뉴스
BMW 그룹 코리아, 수도방위사령부 군사경찰단 모터사이클 훈련 무상 지원	글로벌오토뉴스
르망 24시간을 완주한 제네시스 마그마 레이싱(GMR), 그러나 부족한 한 가지	글로벌오토뉴스
인도 뉴델리 정부, 대기오염 완화 위한 노후차 전기차 교체 보조금 조치 확정	글로벌오토뉴스
지프, 2030년까지 유럽 라인업 6종으로 확대	글로벌오토뉴스
폭스바겐-보쉬, 15억 유로 투입한 '자율주행 동맹' 청산 조율…새 파트너 선정 착수	글로벌오토뉴스
개소세 인하 종료 전 차량 인도… 르노코리아, '당일 출고'로 세금 감면 및 프로모션 혜택 동시 적용	글로벌오토뉴스
토요타, 5월 글로벌 판매 7.2% 감소…중국 시장 급감으로 4개월 연속 역성장	글로벌오토뉴스
넷플릭스 ‘페르소나’ 실사 드라마 제작한다 (1)	게임메카
키리코 포함 6종, 오버워치 x 요아소비 컬래버 스킨 공개	게임메카
프로수스, AI 쇼핑 비서로 커머스 전략 강화…연간 핵심이익 84% 급증	AI matters
미 정부, 메타에도 ‘AI 자발적 안전성 검증’ 동참 압박	AI matters
위메이드, '이미르컵 월드 챔피언십 시즌2' 'Kings' 우승 영예	게임동아
‘타워 오브 판타지’, 6.1 버전 ‘종말의 나라에서’ 정식 업데이트	게임동아
넷마블 신작 '솔: 인챈트', 신규 던전 '신의 탑' 업데이트	게임동아
1998년 연애 시뮬레이션 ‘센티멘탈 그래피티’, 리메이크로 돌아온다! (1)	게임동아
‘페르소나’가 실사 드라마로? “넷플릭스 프로젝트 추진 중”	게임동아
AI뉴스 GPT‑5.6, Bidi 1, 할라피뇨, Unite Seoul 2026, Claude Tag, 애플 가격, Wan Streamer, 시댄스 2.5, Krea 2 등 동영상 있음	조코딩 JoCoding
직장인 '볼따구'의 애환? 트릭컬 파티마 베일 벗었다	게임메카
네오위즈 ‘아바(A.V.A)’, 서비스 19주년 맞이 업데이트·특별 이벤트 실시	게임동아
넷마블 '페이트/그랜드 오더', '미스터리 하우스 크래프터즈' 이벤트 완료 시 '4성 반 고흐(마이너)' 증정	게임동아
킹넷, 신작 MMORPG '열혈강호: 넥스트' 사전 등록 돌입	게임동아
'아히나' 유창호, 2026 KEL FC 모바일 제패했다	게임메카
[롤짤] 서커스와 함께, 페이커 MSI 최초 100승 달성	게임메카
로저 주니어와 함께, 철권 8 ‘밥’ 트레일러 공개 (1)	게임메카
신규 티저 예고, 넷플릭스 '사펑 엣지러너 2' 가을 방영 (1)	게임메카
리그 오브 레전드 미니언 막타 표시, 랭크게임에는 보류	게임메카
언리얼5로 바뀐 마비노기 이터니티, 올 가을 테스트	게임메카
옛날 롤 그립다면 주목, 리그 오브 레전드 클래식 예고 (1)	게임메카
2026 부산모빌리티쇼 개막…'디 올 뉴 아반떼·iX3’ 등 신차 ‘눈길’ (1)	IT동아
한국레노버 ‘탭 플러스 2세대’ 출시… 실시간 번역·AI 노트 등 온디바이스 AI 강화	AI matters
위로보틱스, ALLEX 시뮬레이션 모델 공개… ‘피지컬 AI’ 개발 생태계 연다 (1)	AI matters
GPT-5.6도 7월로… 오픈AI, 정부 요청에 ‘속도 조절’ 출시 늦췄다	AI matters
구글 제미나이 3.5 프로, 끝내 7월로… I/O 약속 두 번 연속 불발	AI matters
AI 기업들은 올해 694조원을 썼다… AI 자본지출이 던진 ROI 질문 (1)	AI matters
엔비디아가 끌어안은 그로크, 약 1조원 펀딩으로 ‘AI 추론 클라우드’ 가속	AI matters
게임플레이로 공간을 배운 AI… 제너럴 인튜이션, 4900억원 유치	AI matters
‘추론’이 AI 최대 격전지로… 베이스튼, 2조원대 투자 유치 (1)	AI matters
GPT-4.5, 챗GPT에서 퇴장… ‘GPT-4 시대’의 마침표	AI matters
앤트로픽, 클로드 개발자 플랫폼 손질… 요금제 3종으로 단순화	AI matters
중국 즈푸 GLM, 미국 톱모델 코앞까지… 비용은 5분의 1 (1)	AI matters
오픈AI, 앤트로픽 겨냥 토큰 가격 인하 검토… ‘토큰맥싱’ 시대 저문다	AI matters
고지우·이예원·방신실 출격…KLPGA ‘맥콜·모나 용평 오픈’ 막 올랐다	뉴스탭
골프공 넣은 건강기능식품까지…스포츠 마케팅이 달라졌다	뉴스탭
신일, 생활가전 418점 기부…아름다운가게와 자원순환 나눔 협력	뉴스탭
다이어트 경험 10명 중 7명…식품업계가 주목한 ‘로우 스펙 푸드’	뉴스탭
피부과 안 가고 집에서 관리…Z세대가 찾는 여름 셀프케어 디바이스	뉴스탭
젠틀몬스터, 프라다와 협업 컬렉션 공개…사카구치 켄타로 티저 등장	뉴스탭
펄사, 창립 6주년 맞아 글로벌 ‘슈퍼 위크’ 연다	뉴스탭
단 두 개 모델로 1만대 넘긴 폴스타…한국 프리미엄 전기차 시장서 통했다	뉴스탭
시스코, 보안 인재 200명 키운다…과기정통부와 ‘VIP 2026’ 시행	뉴스탭
위스키가 어려운 소비자도 쉽게 즐긴다…더 글렌그란트, 성수동에 미식 페어링 팝업 열	뉴스탭
권은비, 글로벌 아이웨어 브랜드 볼론 새 얼굴 됐다	뉴스탭
애스턴마틴, 스파 24시서 ‘4대 24시간 레이스 포디움’ 도전	뉴스탭
‘서든어택’, 디렉터 쇼케이스 개최.. "2026 시즌3 업데이트 계획 발혀"	게임동아
마케터가 AI에 던지는 질문 10개 중 9개는 ‘검색’에 머물렀다	AI matters
'운전대 없는 자율주행차 현실로' 아마존 죽스, 양산형 로보택시 공개	오토헤럴드
토요타, 해외 생산 10만 대 축소 '불티나게 팔리는 RAV4 공급난 심화'	오토헤럴드
'8분 충전의 시대' BMW, 첫 공용 400kW 초급속 충전기 가동 시작	오토헤럴드
혹평 쏟아졌던 페라리 순수 전기 '루체'의 반전… 중국서 88대 완판	오토헤럴드
HS효성더클래스, 메르세데스 트로피 2026 지역 예선 성료	글로벌오토뉴스
스트라드비젼, 글로벌 완성차와 E2E 자율주행 양산 계약 체결	글로벌오토뉴스
스타트럭코리아, 제주서 메르세데스-벤츠 유니목 안전교육 전개	글로벌오토뉴스
현대차그룹, 채비와 PnC 충전 서비스 본격 개시	글로벌오토뉴스
현대차, GS25와 협업해 ‘현차는 빵빵’ 아이스크림 출시… 차량 띠부씰 동봉	글로벌오토뉴스
현대모비스, 3년간 협력사에 157조 지급… 공급망 상생경영 강화	글로벌오토뉴스
기아 PV5 WAV, 국내 최초 유니버설 디자인 택시로 서울 시내 달린다	글로벌오토뉴스
현대차·기아 ‘비전 펄스’, 칸 라이언즈 동상 수상… 첨단 안전기술로 글로벌 광고계 사로잡아	글로벌오토뉴스
현대차, 칸 라이언즈 2026 그랑프리·동상 동시 수상	글로벌오토뉴스
혼다코리아, ‘더 고’ 카페서 모터사이클 토크 콘서트 개최	글로벌오토뉴스
BMW 그룹 코리아, 국내 최초 공용 400kW 초급속 충전기 도입	글로벌오토뉴스
글로벌 로보택시 업계, 영국 런던서 3파전 예고	글로벌오토뉴스
EU, 2035년 내연기관차 퇴출 원안 유지 기류 형성	글로벌오토뉴스
폴스타, 미국 정부 규제로 2027년형 모델부터 현지 판매 중단	글로벌오토뉴스
조지 러셀, 오스트리아 GP서 폴투윈…시즌 2번째 우승 달성	글로벌오토뉴스
현대 어스 콘셉트의 디자인	글로벌오토뉴스
BYD 아태 부총재 “한국 시장, 구체적 판매 목표 없어…기술과 서비스로 승부”	글로벌오토뉴스
KCC오토그룹, 벤틀리 공식 딜러십 획득…하이엔드 럭셔리 시장 진출	글로벌오토뉴스

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

1B 모델의 반란: 테스트 시간 확장으로 405B 대형 언어 모델 능가

비교하고 잘 사는, 다나와 : 가격비교 사이트

RanKING 100 도움말 보기

GNB 메뉴

GNB 메뉴

1B 모델의 반란: 테스트 시간 확장으로 405B 대형 언어 모델 능가

공유하기

공감/비공감