비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

영국 정부가 연구비 ‘대박’ 후보를 AI에 골라내게 했더니, 정확도 90.5%로 1위를 차지한 건 챗GPT가 아니었다

2026.08.16. 23:52:33
조회 수
67
5

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

영국 정부가 세금으로 나가는 연구비를 더 똑똑하게 쓰려고 인공지능(AI)에게 숙제를 하나 맡겼다. 산더미처럼 쌓인 연구 제안서를 읽고, 그 안에서 다음 대박이 될 만한 유망 분야를 미리 찾아내라는 것이었다. 그런데 성적표를 열어보니 가장 유명한 챗GPT(ChatGPT)도 단독 1위를 차지하지 못했고, 정부가 직접 만든 전용 도구는 오히려 뒤처졌다. 영국 연구혁신기구(UKRI)가 발표한 이번 실험은 AI가 국가의 연구 투자 방향까지 넘보기 시작했다는 신호이자, 크고 비싼 모델이 늘 이기는 것은 아니라는 사실을 보여준다.

정부가 연구 제안서에서 ‘유니콘’을 찾는 이유

영국 연구혁신기구(UKRI)가 진행한 이번 프로젝트의 이름은 ‘별과 유니콘 추적하기(Tracking Stars and Unicorns)’다. 여기서 유니콘(unicorn)이란 아직 주목받지 못했지만 앞으로 큰 성과를 낼 가능성이 있는 새로운 연구 분야를 뜻한다. 정부가 연구비를 나눠줄 때 이런 씨앗을 남들보다 먼저 알아채면, 같은 예산으로 훨씬 큰 성과를 거둘 수 있다. 문제는 방식이다. 연구자들이 제출하는 제안서는 매년 수십만 건에 달하고, 사람이 일일이 다 읽어 유망 분야를 골라내기란 사실상 불가능하다. 실제 이번 프로젝트가 궁극적으로 다루려는 UKRI 제안서는 약 35만 건에 이른다. 그래서 연구진은 AI에게 제안서를 대신 읽고 핵심 주제를 뽑아내는 일을 맡겨보기로 했다.

세 선수의 대결, 챗GPT와 미스트랄 그리고 정부 전용 도구

이번 실험은 서로 다른 세 가지 도구의 성능을 정면으로 겨루게 한 대결이었다. 첫 번째는 오픈AI(OpenAI)의 챗GPT를 움직이는 GPT-4o, 두 번째는 기관 내부에서 직접 돌릴 수 있는 경량 모델 미스트랄(Mistral), 세 번째는 영국 과학혁신기술부(DSIT)와 이노베이션 그로스 랩이 연구 분석용으로 따로 만든 전용 도구 ‘DSIT-택소노미(DSIT-Taxonomies)’다. 연구진은 영국의 7개 국가 연구위원회와 전문 연구기관에서 실제 지원을 받은 제안서 42건의 제목과 초록을 골라 세 도구에 똑같이 읽혔다.

그림1. 연구 제안서의 개념 추출부터 주제 분류까지 AI 처리 흐름도 (출처: arXiv 논문 2606.30304v1)

그림1. 연구 제안서의 개념 추출부터 주제 분류까지 AI 처리 흐름도 (출처: arXiv 논문 2606.30304v1)



여기서 각 도구가 해야 할 일은 두 가지였다. 하나는 제안서에서 핵심 개념(연구 엔티티)을 뽑아내는 것, 다른 하나는 그 개념이 어느 연구 분야에 속하는지 정확히 분류하는 것이다. 참고로 연구 엔티티(research entity)란 특정 연구가 다루는 주제, 방법론, 사용한 데이터나 소프트웨어처럼 그 연구를 구성하는 의미 있는 최소 단위를 말한다.

90.5% 대 71.4%, 작은 모델이 정부 도구를 앞선 순간

결과는 통념을 뒤집었다. 미스트랄이 뽑아낸 개념을 바탕으로 연구 주제를 분류했을 때 정확도는 90.5%였고, 정부가 직접 만든 DSIT-택소노미 방식은 71.4%에 그쳤다. 42건 중 미스트랄은 38건을 맞히고 4건만 틀린 반면, 정부 도구는 12건이나 틀렸다. 흥미로운 점은 개념을 더 많이 뽑아냈다고 더 좋은 게 아니었다는 사실이다. 정부 도구는 제안서 한 건당 평균 25.22개의 개념을 뽑아 미스트랄(15.94개)이나 GPT-4o(14.3개)보다 훨씬 많았지만, 그 안에는 ‘제공하다’ 같은 동사나 ‘수천’ 같은 수량 표현처럼 연구와 무관한 잡음이 잔뜩 섞여 있었다. 예를 들어 ‘신호 증폭기(signal amplifier)’라는 하나의 개념을 ‘신호’와 ‘증폭기’ 두 개로 잘못 쪼개는 식이었다. 개수는 많지만 알맹이가 부실했던 셈이다. 결국 얼마나 많이 찾느냐가 아니라 얼마나 정확하게 찾느냐가 승부를 갈랐다.

GPT-4o와 대등한 미스트랄, 실무에서 앞선 두 가지 이유

같은 언어 모델끼리 비교하면 미스트랄과 GPT-4o의 실력은 막상막하였다. 두 모델이 뽑아낸 개념이 서로 얼마나 겹치는지를 재는 자카드 유사도(Jaccard similarity)는 0.374로, 정부 도구와의 유사도(약 0.19)보다 두 배 가까이 높았다. 서로 비슷한 답을 내놓았다는 뜻이다. 그런데 미스트랄에는 두 가지 결정적 강점이 있었다. 첫째는 환각(hallucination)이 적다는 점이다. 환각이란 원문에 없는 내용을 AI가 마치 있는 것처럼 지어내는 현상을 말한다. 미스트랄의 제안서당 평균 오류는 1.56건으로 GPT-4o(2.84건)보다 크게 낮았고, 아예 오류가 하나도 없던 제안서도 미스트랄은 16건, GPT-4o는 7건이었다. 둘째는 몸집이 가볍다는 점이다. 미스트랄은 외부 서버로 데이터를 보내지 않고 기관 내부의 보안 시스템 안에서 직접 돌릴 수 있다. 연구비 제안서처럼 외부 유출이 민감한 자료를 다루는 정부 기관 입장에서는, 성능이 비슷하다면 데이터를 밖으로 내보내지 않아도 되는 쪽이 훨씬 매력적이다.

크고 유명한 AI가 늘 정답은 아니다

이번 결과가 던지는 메시지는 분명하다. 가장 크고 이름값 높은 AI가 모든 상황에서 최선은 아닐 수 있다는 것이다. 미스트랄은 GPT-4o와 견줄 성능을 내면서도, 지어내는 오류가 적고 내부에서 안전하게 돌릴 수 있다는 실용적 이점으로 정부 업무에 더 잘 맞는 후보가 됐다. 다만 몇 가지는 여전히 지켜볼 필요가 있다. 이번 평가는 제안서 42건이라는 비교적 작은 표본을 사람이 직접 검토한 결과이고, 개념 추출 성능은 사람이 정한 정답과 비교한 것이 아니라 모델끼리 얼마나 비슷한 답을 내는지를 측정한 것에 가깝다. 연구진도 이 점을 인정하며, 다음 단계로 지원에 성공한 제안서와 탈락한 제안서를 합쳐 35만 건 전체로 분석을 확장할 계획이라고 밝혔다. AI가 국가의 연구 지도를 그리고 투자 우선순위를 가늠하는 데까지 쓰이려면, 대규모 데이터에서도 같은 성능이 유지되는지가 앞으로의 관건이 될 가능성이 있다.

FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)

Q. 연구 ‘유니콘’이 정확히 무슨 뜻인가요?
아직 널리 주목받지는 못했지만 앞으로 큰 성과나 파급 효과를 낼 가능성이 있는 새로운 연구 분야를 뜻합니다. 정부가 이런 분야를 남보다 먼저 발굴하면 한정된 연구 예산을 더 효율적으로 쓸 수 있어, 조기 발굴이 중요한 과제로 꼽힙니다.

Q. 미스트랄이 GPT-4o를 완전히 이긴 건가요?
개념을 뽑아내는 성능 자체는 두 모델이 거의 비슷했습니다. 다만 미스트랄은 없는 내용을 지어내는 오류가 GPT-4o보다 크게 낮았고, 데이터를 외부로 보내지 않고 기관 내부에서 직접 돌릴 수 있다는 실용적 장점이 있어 민감한 정부 자료 분석에 더 적합하다는 평가를 받았습니다.

Q. AI가 실제로 정부의 연구비 배분을 결정하게 되나요?
아직은 아닙니다. 이번 실험은 42건의 제안서를 대상으로 한 초기 단계 연구이며, AI는 사람이 판단할 자료를 정리해 주는 역할에 가깝습니다. 연구진은 35만 건 규모로 분석을 넓혀 신뢰성을 더 검증한 뒤 실제 정책에 활용할 수 있을지 살펴볼 예정입니다.

기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다.
리포트명: Research Entity Extraction and Topic Detection from UKRI Grant Proposals
이미지 출처: AI 생성 콘텐츠
해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다.




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
[리뷰] AI로 보컬 제거하는 휴대용 마이크, JBL 이지싱 마이크 미니 IT동아
빅블루가 오픈AI 편에 섰다…IBM, 컨설팅에 GPT-5.6 심는다 AI matters
웨이모·테슬라에 도전장…일본 자율주행 튜링, 미국 상륙 예고 AI matters
8조를 베팅하다…앤트로픽이 이스라엘 영상 AI를 탐내는 이유 AI matters
‘AI가 알아서 처리한다’…앤트로픽, 클로드 코드 자동 모드 기본 탑재 AI matters
월가가 기다리는 그 서류…오픈AI 상장 청사진 공개 임박 AI matters
속도의 전쟁, GPT-5.6이 14배 빨라졌다…오픈AI ‘울트라패스트’의 정체 AI matters
2026년 8월 14일 미국 AI 관련주 — 마이크론 4.23% 상승, 팔란티어 4.66% 동반 상승 AI matters
김용하 넥슨게임즈 본부장 "다가오는 AI 시대, 개발자의 취향과 안목이 중요해" 게임동아
추론 AI 시대 '메모리'가 승부처··· 하이퍼엑셀, 생태계 확장에 가속 페달 IT동아
유저조이, ‘환세록 리메이크’ 9월 10일 정식 출시 확정 게임동아
영국 정부가 연구비 ‘대박’ 후보를 AI에 골라내게 했더니, 정확도 90.5%로 1위를 차지한 건 챗GPT가 아니었다 AI matters
드라마 장악한 웹툰, 게임도 경쟁 본격화! 네이버웹툰, 카카오게임즈가 움직였다 게임동아
[BIC 2026] 요시다 슈헤이 대표가 말하는 퍼블리셔의 인디게임 선택법 "명확한 자기소개” 게임동아
[BIC 2026] BIC 조직위, 인도네시아와 협력 강화 “동남아 게임 시장 진출 허브로” 게임동아
발은 빼는데 문은 못 닫는다…MS의 아슬아슬한 중국 줄타기 AI matters
대원씨티에스, Corsair 제품 구매 고객 대상 대규모 경품 증정 이벤트 다나와
현대차그룹·육군·산업부, 국방 피지컬 AI 및 첨단기술 활용 확대 MOU 체결 글로벌오토뉴스
페라리, SF90 스트라달레 기반 원오프 모델 '페라리 CZ26' 공개 글로벌오토뉴스
이노스, 전문가급 색재현 27인치 QHD 게이밍 모니터 ‘27QL180M’ 예약판매 다나와
이 시간 HOT 댓글!
1/4