비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

인공지능의 깊이 있는 사고, 구글 딥마인드가 해냈다...자연어 계획 분야 98% 정확도 달성

2025.01.22. 18:17:11
조회 수
499
14
댓글 수
1

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

Evolving Deeper LLM Thinking


마인드 에볼루션으로 한 단계 도약...TravelPlanner 100%, Meeting Planning 98.4% 달성

구글 딥마인드가 2025년 1월 발표한 연구에 따르면, 마인드 에볼루션(Mind Evolution)이라는 새로운 진화 검색 전략을 통해 대규모 언어 모델의 추론 능력을 크게 향상시켰다. 기존의 1회성 추론 방식으로는 TravelPlanner에서 5.6%, Meeting Planning에서 20.8%의 낮은 성공률을 보였으나, 마인드 에볼루션을 적용한 제미니 1.5 프로는 각각 100%와 98.4%의 성공률을 달성했다. 특히 제미니 1.5 플래시 모델만으로도 TravelPlanner에서 95.6%의 높은 성공률을 기록했다.



진화적 접근으로 최적화...4개 집단 800회 시도로 최고 성능 달성

마인드 에볼루션은 10세대에 걸친 진화적 검색을 수행하며, 4개의 독립적인 집단에서 각각 5개의 대화를 진행하고 매 대화마다 4번의 순차적 개선을 시도한다. 이는 총 800회의 시도를 통해 최적의 해결책을 찾는 과정이다.

연구팀은 3세대마다 성과가 낮은 집단을 리셋하고, 매 세대마다 각 집단 간 이주를 통해 다양성을 유지하는 전략을 채택했다. 이러한 방식은 기존의 Best-of-N이나 Sequential Revision보다 더 효율적으로 해결책을 탐색할 수 있게 했다.

복잡도 증가에도 강건한 성능...도시 10개 방문 계획도 87.5% 해결

Trip Planning 과제에서는 방문 도시 수가 증가함에 따른 성능 변화를 분석했다. 도시 수가 3개에서 10개로 증가하는 상황에서도 마인드 에볼루션은 87.5%의 높은 성공률을 유지했다. Meeting Planning에서도 미팅 대상이 10명까지 증가하는 복잡한 상황에서 85% 이상의 성공률을 보였다. 이는 기존 방식들의 성능이 복잡도 증가에 따라 급격히 저하되는 것과 대조적이다.

컴퓨팅 효율성 확보...평균 API 비용 0.28달러로 95% 이상 성공

마인드 에볼루션은 TravelPlanner 테스트에서 평균 167회의 API 호출과 3.02M의 입력 토큰, 0.18M의 출력 토큰으로 95.2%의 성공률을 달성했다. 이는 약 0.28달러의 API 비용에 해당한다. Sequential Revision이 280회 호출에 2.75달러를 소비한 것과 비교하면 훨씬 효율적이다. Trip Planning에서도 평균 196회 호출로 94.1%의 성공률을 달성했다.

실험 분석으로 입증된 효과...비평적 사고와 텍스트 피드백의 중요성

연구팀은 실험을 통해 마인드 에볼루션의 핵심 요소들의 효과를 검증했다. 비평가 역할의 도입으로 성공률이 46.1%에서 71.1%로 향상되었고, 전략/질문 프롬프트를 추가하자 76.1%로 개선되었다. 텍스트 피드백과 LLM을 활용한 리셋을 모두 적용하자 최종적으로 95.6%까지 성능이 향상되었다.

StegPoet으로 증명한 확장성...시와 에세이의 숨겨진 메시지 87% 해독

새로운 벤치마크 StegPoet에서도 마인드 에볼루션의 우수성이 입증되었다. 에세이나 시에 숨겨진 메시지를 찾아내는 이 과제에서 제미니 1.5 프로는 검증 세트의 87.1%, 테스트 세트의 79.2%를 성공적으로 해결했다. 반면 Best-of-N은 검증 세트에서 1%의 성공률을 기록했고, Sequential Revision도 19.8%에 그쳤다. 본 연구는 형식적인 해결기(formal solver) 없이도 자연어 계획 문제에서 최고 수준의 성과를 달성한 첫 사례로 평가받고 있다.

해당 기사에서 인용한 논문은 링크에서 확인할 수 있다.

이미지출처: 구글딥마인드 이미지 편집

기사는 클로드 3.5 Sonnet과 챗GPT-4o를 활용해 작성되었습니다.




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
이제 AI 까지 접목된 물리, 사이버 보안 솔루션의 모든 것 SECON 2026 에서 만난 티피링크 브레인박스
삼성에 "감사" 외친 젠슨 황, 평택 찾은 리사 수··· 봄 맞은 한국의 AI 산업 IT동아
[AI써봄] 구글 지메일 속 제미나이 사이드 패널···메일 관리 더 편해질까 IT동아
“AI 시대 맞춤형 기술ㆍ디자인을 제안하다” 마이크로닉스 2026년 신제품 공개 IT동아
[스타트업리뷰] “파편화된 문서 작업은 그만”…비즈니스 특화 AI ‘라이너 라이트’ (1) IT동아
어르신들도 손쉽게 AI 활용, 이렇게 한다면? IT동아
나이키, 2026 한국 축구대표팀 유니폼 공개…‘백호’와 ‘기습’ 서사 입혔다 (1) 뉴스탭
키링 하나로 ‘나’를 표현한다…캔바, 잘파세대 커스텀 굿즈 열풍 이끈다 뉴스탭
마이크로닉스, GPU 중심 시대 승부수…차세대 PSU·케이스 대거 출격 뉴스탭
마이크로닉스, ‘2026 인텔&다나와 아카데미 페스티벌’서 PC 케이스·파워·쿨링 솔루션 공개 뉴스탭
MSI, 아크 월드 투어 2025-2026 파이널 공식 모니터 맡았다…격투 게임 대회 현장 공략 뉴스탭
K-컬처 타고 세계로 간 소주 문화… 퍼니준 『How to Drink Soju』 출간 뉴스탭
에이수스, GTC 2026서 ‘풀 수냉 AI 인프라’ 공개…전력 효율 최대 10배 혁신 뉴스탭
GTC 2026 점령한 로봇들…엔비디아, 차세대 AI 로보틱스 총집결 뉴스탭
128GB에 멈춘 기기들… ‘세계 백업의 날’이 던진 저장공간 경고 뉴스탭
EGF 넘어 FGF까지… 성분 따지는 소비자, 안티에이징 시장 판 바꾼다 뉴스탭
클레브 메모리부터 조립 PC까지…서린씨앤아이, 대학 캠퍼스서 체험형 부스 운영 뉴스탭
“단 10대 하이퍼카가 게임 속으로”…배틀그라운드 모바일, 아폴로와 초고성능 협업 뉴스탭
쿠쿠, 국내 에어프라이어 시장 2년 연속 1위…판매량·점유율 모두 선두 뉴스탭
스마트카라, NS홈쇼핑서 ‘블레이드 X AI’ 판매…월 2만원대 구매 혜택 뉴스탭
이 시간 HOT 댓글!
1/4