영국 정부가 세금으로 나가는 연구비를 더 똑똑하게 쓰려고 인공지능(AI)에게 숙제를 하나 맡겼다. 산더미처럼 쌓인 연구 제안서를 읽고, 그 안에서 다음 대박이 될 만한 유망 분야를 미리 찾아내라는 것이었다. 그런데 성적표를 열어보니 가장 유명한 챗GPT(ChatGPT)도 단독 1위를 차지하지 못했고, 정부가 직접 만든 전용 도구는 오히려 뒤처졌다. 영국 연구혁신기구(UKRI)가 발표한 이번 실험은 AI가 국가의 연구 투자 방향까지 넘보기 시작했다는 신호이자, 크고 비싼 모델이 늘 이기는 것은 아니라는 사실을 보여준다.
정부가 연구 제안서에서 ‘유니콘’을 찾는 이유
영국 연구혁신기구(UKRI)가 진행한 이번 프로젝트의 이름은 ‘별과 유니콘 추적하기(Tracking Stars and Unicorns)’다. 여기서 유니콘(unicorn)이란 아직 주목받지 못했지만 앞으로 큰 성과를 낼 가능성이 있는 새로운 연구 분야를 뜻한다. 정부가 연구비를 나눠줄 때 이런 씨앗을 남들보다 먼저 알아채면, 같은 예산으로 훨씬 큰 성과를 거둘 수 있다. 문제는 방식이다. 연구자들이 제출하는 제안서는 매년 수십만 건에 달하고, 사람이 일일이 다 읽어 유망 분야를 골라내기란 사실상 불가능하다. 실제 이번 프로젝트가 궁극적으로 다루려는 UKRI 제안서는 약 35만 건에 이른다. 그래서 연구진은 AI에게 제안서를 대신 읽고 핵심 주제를 뽑아내는 일을 맡겨보기로 했다.
세 선수의 대결, 챗GPT와 미스트랄 그리고 정부 전용 도구
이번 실험은 서로 다른 세 가지 도구의 성능을 정면으로 겨루게 한 대결이었다. 첫 번째는 오픈AI(OpenAI)의 챗GPT를 움직이는 GPT-4o, 두 번째는 기관 내부에서 직접 돌릴 수 있는 경량 모델 미스트랄(Mistral), 세 번째는 영국 과학혁신기술부(DSIT)와 이노베이션 그로스 랩이 연구 분석용으로 따로 만든 전용 도구 ‘DSIT-택소노미(DSIT-Taxonomies)’다. 연구진은 영국의 7개 국가 연구위원회와 전문 연구기관에서 실제 지원을 받은 제안서 42건의 제목과 초록을 골라 세 도구에 똑같이 읽혔다.
그림1. 연구 제안서의 개념 추출부터 주제 분류까지 AI 처리 흐름도 (출처: arXiv 논문 2606.30304v1)
여기서 각 도구가 해야 할 일은 두 가지였다. 하나는 제안서에서 핵심 개념(연구 엔티티)을 뽑아내는 것, 다른 하나는 그 개념이 어느 연구 분야에 속하는지 정확히 분류하는 것이다. 참고로 연구 엔티티(research entity)란 특정 연구가 다루는 주제, 방법론, 사용한 데이터나 소프트웨어처럼 그 연구를 구성하는 의미 있는 최소 단위를 말한다.
90.5% 대 71.4%, 작은 모델이 정부 도구를 앞선 순간
결과는 통념을 뒤집었다. 미스트랄이 뽑아낸 개념을 바탕으로 연구 주제를 분류했을 때 정확도는 90.5%였고, 정부가 직접 만든 DSIT-택소노미 방식은 71.4%에 그쳤다. 42건 중 미스트랄은 38건을 맞히고 4건만 틀린 반면, 정부 도구는 12건이나 틀렸다. 흥미로운 점은 개념을 더 많이 뽑아냈다고 더 좋은 게 아니었다는 사실이다. 정부 도구는 제안서 한 건당 평균 25.22개의 개념을 뽑아 미스트랄(15.94개)이나 GPT-4o(14.3개)보다 훨씬 많았지만, 그 안에는 ‘제공하다’ 같은 동사나 ‘수천’ 같은 수량 표현처럼 연구와 무관한 잡음이 잔뜩 섞여 있었다. 예를 들어 ‘신호 증폭기(signal amplifier)’라는 하나의 개념을 ‘신호’와 ‘증폭기’ 두 개로 잘못 쪼개는 식이었다. 개수는 많지만 알맹이가 부실했던 셈이다. 결국 얼마나 많이 찾느냐가 아니라 얼마나 정확하게 찾느냐가 승부를 갈랐다.
GPT-4o와 대등한 미스트랄, 실무에서 앞선 두 가지 이유
같은 언어 모델끼리 비교하면 미스트랄과 GPT-4o의 실력은 막상막하였다. 두 모델이 뽑아낸 개념이 서로 얼마나 겹치는지를 재는 자카드 유사도(Jaccard similarity)는 0.374로, 정부 도구와의 유사도(약 0.19)보다 두 배 가까이 높았다. 서로 비슷한 답을 내놓았다는 뜻이다. 그런데 미스트랄에는 두 가지 결정적 강점이 있었다. 첫째는 환각(hallucination)이 적다는 점이다. 환각이란 원문에 없는 내용을 AI가 마치 있는 것처럼 지어내는 현상을 말한다. 미스트랄의 제안서당 평균 오류는 1.56건으로 GPT-4o(2.84건)보다 크게 낮았고, 아예 오류가 하나도 없던 제안서도 미스트랄은 16건, GPT-4o는 7건이었다. 둘째는 몸집이 가볍다는 점이다. 미스트랄은 외부 서버로 데이터를 보내지 않고 기관 내부의 보안 시스템 안에서 직접 돌릴 수 있다. 연구비 제안서처럼 외부 유출이 민감한 자료를 다루는 정부 기관 입장에서는, 성능이 비슷하다면 데이터를 밖으로 내보내지 않아도 되는 쪽이 훨씬 매력적이다.
크고 유명한 AI가 늘 정답은 아니다
이번 결과가 던지는 메시지는 분명하다. 가장 크고 이름값 높은 AI가 모든 상황에서 최선은 아닐 수 있다는 것이다. 미스트랄은 GPT-4o와 견줄 성능을 내면서도, 지어내는 오류가 적고 내부에서 안전하게 돌릴 수 있다는 실용적 이점으로 정부 업무에 더 잘 맞는 후보가 됐다. 다만 몇 가지는 여전히 지켜볼 필요가 있다. 이번 평가는 제안서 42건이라는 비교적 작은 표본을 사람이 직접 검토한 결과이고, 개념 추출 성능은 사람이 정한 정답과 비교한 것이 아니라 모델끼리 얼마나 비슷한 답을 내는지를 측정한 것에 가깝다. 연구진도 이 점을 인정하며, 다음 단계로 지원에 성공한 제안서와 탈락한 제안서를 합쳐 35만 건 전체로 분석을 확장할 계획이라고 밝혔다. AI가 국가의 연구 지도를 그리고 투자 우선순위를 가늠하는 데까지 쓰이려면, 대규모 데이터에서도 같은 성능이 유지되는지가 앞으로의 관건이 될 가능성이 있다.
FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)
Q. 연구 ‘유니콘’이 정확히 무슨 뜻인가요?
아직 널리 주목받지는 못했지만 앞으로 큰 성과나 파급 효과를 낼 가능성이 있는 새로운 연구 분야를 뜻합니다. 정부가 이런 분야를 남보다 먼저 발굴하면 한정된 연구 예산을 더 효율적으로 쓸 수 있어, 조기 발굴이 중요한 과제로 꼽힙니다.
Q. 미스트랄이 GPT-4o를 완전히 이긴 건가요?
개념을 뽑아내는 성능 자체는 두 모델이 거의 비슷했습니다. 다만 미스트랄은 없는 내용을 지어내는 오류가 GPT-4o보다 크게 낮았고, 데이터를 외부로 보내지 않고 기관 내부에서 직접 돌릴 수 있다는 실용적 장점이 있어 민감한 정부 자료 분석에 더 적합하다는 평가를 받았습니다.
Q. AI가 실제로 정부의 연구비 배분을 결정하게 되나요?
아직은 아닙니다. 이번 실험은 42건의 제안서를 대상으로 한 초기 단계 연구이며, AI는 사람이 판단할 자료를 정리해 주는 역할에 가깝습니다. 연구진은 35만 건 규모로 분석을 넓혀 신뢰성을 더 검증한 뒤 실제 정책에 활용할 수 있을지 살펴볼 예정입니다.
기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다.
리포트명: Research Entity Extraction and Topic Detection from UKRI Grant Proposals
이미지 출처: AI 생성 콘텐츠
해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다.
AI Matters 뉴스레터 구독하기



