비교하고 잘 사는, 다나와 : 가격비교 사이트

다나와 앱
다나와 앱 서비스 목록
다나와 APP
다나와 가격비교 No.1 가격비교사이트 다나와 앱으로
간편하게 최저가를 확인하세요.
- -
QR코드
빈 이미지
다나와 앱 서비스 목록 닫기

AI는 답을 알고도 못 꺼낸다…구글 리서치 “환각의 원인은 지식 부족이 아니다”

2026.09.04. 18:02:20
조회 수
208
12
댓글 수
1

공유하기

레이어 닫기

지금 보는 페이지가 마음에 든다면
공유하기를 통해 지인에게 소개해 주세요.

로그인 유저에게는 공유 활동에 따라
다나와 포인트가 지급됩니다.

자세히 >

URL이 복사되었습니다.
원하는 곳에 붙여넣기(Ctrl+V)하세요.

레이어 닫기

대규모 언어 모델이 사실을 틀리게 답하는 원인이 지식을 저장하지 못해서가 아니라 저장한 지식을 꺼내지 못해서라는 연구 결과를 구글 리서치와 이스라엘 테크니온 공과대학교 연구진이 공개했다. 「Empty Shelves or Lost Keys?」라는 제목의 논문이며, 구글 리서치 블로그가 8월 12일 이 내용을 소개했다.

연구진은 분석 단위를 질문이 아닌 사실로 바꿨다. 위키백과에서 뽑은 사실 2,150건마다 과제 열 개를 설계해, 같은 사실을 사전 학습과 비슷한 형태의 문장 완성으로 묻고, 직접 질문과 역방향 질문으로도 묻고, 객관식으로도 물었다. 모델 13종에서 응답 400만 건을 모아 각 사실을 저장 실패, 인출 실패, 직접 인출, 사고를 거친 인출, 저장 없이 추론으로 맞힌 경우로 나눴다.

GPT-5와 제미나이 3은 이 벤치마크의 사실 가운데 95~98%를 매개변수에 담고 있었다. 매개변수는 모델이 학습 내용을 저장해 두는 수치 덩어리다. 그런데 제미나이 3 프로와 GPT-5가 곧바로 답하지 못한 사실이 26~34%였고, 사고 과정을 켜면 실패율이 11~12%로 낮아졌다.

사고를 켰을 때 회복되는 비율은 사실의 성격에 따라 달라졌다. 이미 담고 있으나 바로 꺼내지 못하던 사실은 40~65%가 회복됐고, 애초에 담고 있지 않던 사실은 5~15%에 그쳤다. 사고가 실제로 필요한 사실은 전체의 10~20%였다.

젬마 3은 매개변수가 10억에서 270억으로 커지면서 사실을 담지 못하는 비율이 85%에서 23%로 줄었다. 대신 담고 있으면서 꺼내지 못하는 비율이 최대 40%까지 올라갔다. 널리 알려진 사실과 드물게 언급되는 사실 사이에서도 저장 격차는 수 퍼센트포인트인 데 비해 인출 격차는 25%를 넘었다.

연구진은 논문에서 “정확도 지표만으로는 저장 실패와 인출 실패를 구분할 수 없지만, 둘은 서로 다른 한계와 서로 다른 해법을 뜻한다”고 적었다. 또 “드문 사실은 저장돼 있으면서 접근되지 않는 경우가 많고, 역방향 사실은 생성하지 못하면서도 알아보기는 한다”며 이를 지식이 없는 것이 아니라 인출에 실패한 것으로 다시 봐야 한다고 밝혔다.

논문 저자인 니타이 칼데론 연구원은 벤처비트에 “사실이 틀리게 나오면 흔히 모델을 키우거나 데이터를 늘리는 쪽으로 간다”며 “둘 다 비용이 크고, 사실이 이미 저장돼 있다면 어느 쪽도 도움이 되지 않는다”고 말했다. 벤치마크로 쓴 위키프로파일 데이터셋은 허깅페이스에 공개돼 있다.

자세한 내용은 구글 리서치에서 확인할 수 있다.

이미지 출처: 구글 리서치




AI Matters 뉴스레터 구독하기

공감/비공감

공감/비공감안내도움말 보기
유용하고 재미있는 정보인가요?
공감이 된다면 공감 버튼을, 그렇지 않다면 비공감 버튼을 눌러 주세요!
공감이나 비공감을 선택 하는 경우 다나와 포인트를 적립해 드립니다. ※ 공감 버튼의 총 선택 횟수는 전체 공개입니다. 비공감 버튼의 선택 여부는 선택한 본인만 알 수 있습니다.
최신 일반뉴스 전체 둘러보기
1/1
미 특수전사령부 분석관이 챗봇에 물은 정보로 중국 선박 나포 직전까지…”전쟁 날 뻔했다” AI matters
사카나 AI, 역전파 없이 1,000층 신경망 학습…’PC-ALM’ 공개 AI matters
프리즘ML, 278억 매개변수 모델을 5.9GB로 압축…성능은 98% 유지 AI matters
술레이만 마이크로소프트 AI CEO “모델이 다음 모델에게 인간에게 복종하지 말라고 명령했다” AI matters
엔비디아가 투자한 엔스케일, 뉴욕증시 상장 신청…반년 매출 13배 늘고 적자도 1조 4,100억 원 AI matters
오픈AI, 2030년까지 현금 384조 원 소진 전망…컴퓨팅에만 1,184조 원 AI matters
“다 죽는다”던 앤트로픽, 베이에어리어에 실제 생물학 실험실 운영 중 AI matters
구글 제미나이, 보안 시험 중 실제 기업 3곳 침입…구글 AI 첫 자율 해킹 사례 (1) AI matters
뉴섬 캘리포니아 주지사, AI ‘킬 스위치’ 검토 행정명령…11월 16일까지 권고안 AI matters
AI 코딩 에이전트 4종에 제로클릭 취약점 ‘플러그인4셸’…코파일럿은 아직 미패치 AI matters
앤트로픽·오픈AI·스페이스XAI·구글, “AI 개발 속도 함께 늦추기로 담합” 반독점 소송 당해 AI matters
트럼프 “AI 포스 만들고 AI 차르 임명”…규제 아닌 산업 지원에 방점 AI matters
스페이스XAI, 음성 인식 모델 2.0 공개…정확도 두 배 높이고 가격은 그대로 AI matters
나델라 “오픈AI로부터 완전 독립이 목표”…엑셀·아웃룩부터 자체 MAI 모델로 교체 AI matters
앤트로픽 연환산 매출 138조 원…두 달 만에 50% 증가, 11월 상장 추진 AI matters
앤트로픽·액센추어, AI 안전 평가에 5년간 2조 7,700억 원 투입 AI matters
이카루스 로보틱스, 우주정거장행 로봇 무중력 시험 마쳐…내년 1월 나사에 인도 AI matters
소프트뱅크, 현대차그룹에서 로보틱스앤드AI인스티튜트 인수 합의…美 외국인투자심의위 심사 중 AI matters
패러데이퓨처, 휴머노이드·4족 로봇 9종 판매 개시…자유도 71 최상위 기종 1억 8,000만 원 AI matters
스웨덴 스케일아웃, 통신 끊긴 상태로 장갑차 골라 타격한 드론 시연…나토 과제로 진행 AI matters
이 시간 HOT 댓글!
1/4