챗GPT에게 게임처럼 만든 공부법은 싫다고 분명히 말해 놓고도 잠시 뒤 게임 같은 학습법을 추천받는 경험은 보통 AI의 기억력 탓으로 여겨지지만, 새 논문은 기억 대신 점수 배분을 들여다봤다. 난양공과대학교(Nanyang Technological University)와 캘리포니아대학교 버클리, 난징대학교 연구진은 2026년 6월 29일 공개한 논문에서 AI가 사용자의 취향을 읽기는 하지만 학습 때 굳어진 비중 그대로만 반영한다고 봤다. 연구진은 답변에 매기는 점수를 질문 점수와 취향 점수로 쪼갠 뒤 취향 쪽 비중만 답변을 만드는 순간에 키우는 방법을 고안하고 재정렬 보상(REAR)이라는 이름을 붙였으며, 모델을 다시 학습시키지 않고도 취향을 명시한 평가에서 점수를 10.7점 끌어올렸다. AI 취향 반영 실패가 기억이 아니라 점수 배분에 가까운 문제라면, 사용자가 프롬프트를 아무리 다듬어도 근본적으로 해결되지 않는 영역이 있다는 뜻이기도 하다.
대화 100턴에서 67점이 4점으로, AI 취향 반영 실패의 실체
AI가 사용자의 취향을 반영하는 능력은 대화가 길어질수록 급격히 무너진다. 연구진이 큐원2.5(Qwen2.5-7B-Instruct) 모델을 PrefEval이라는 평가 도구로 측정한 결과, 대화를 처음 시작할 때 67.0점이던 취향 반영 점수는 대화가 100번 오간 뒤에는 4.0점으로 떨어졌다. PrefEval은 사용자가 앞서 밝힌 취향을 모델이 기억하고 적용하는지를 시험하는 평가 도구로, GPT-4.1이 심판을 맡아 답변이 얼마나 도움이 됐는지와 취향을 어겼는지를 항목별로 채점한 뒤 하나로 종합한 점수를 낸다.
이 100번의 대화가 특별히 긴 것도 아니다. 연구진이 밝힌 문맥 길이는 1만 6000개 토큰인데, 토큰은 AI가 글을 잘게 쪼개 처리하는 최소 단위를 말한다. 실험은 사용자가 취향을 밝힌 시점과 질문을 던지는 시점 사이에 다른 대화를 끼워 넣는 방식으로 짰다. 사용자가 취향을 번복한 적도 없고 그 내용이 대화 기록에서 지워진 것도 아닌데 점수가 떨어졌다는 뜻이다. 정보가 사라졌다기보다 그 정보가 답변을 고르는 과정에서 점점 가벼워졌다고 볼 수 있는 대목이다.
연구진이 제안한 방식을 적용하면 같은 100번 대화 지점에서 점수가 7.2점으로 올라간다. 절대값만 보면 여전히 낮지만 기본 방식의 4.0점과 견주면 80% 높은 수치이고, 대화가 다섯 번 오간 지점에서는 13.3점이 33.4점으로 20.1점 뛰었다. 이 차이는 실제 사용에서 이렇게 나타난다. 대화 초반에 예산 상한을 정해 둔 조건이 몇 번의 질문을 주고받은 뒤에도 답변에 남아 있느냐 사라지느냐다.
다섯 개 평가에서 최대 10.7점 오른 재정렬 보상 REAR
연구진이 제안한 재정렬 보상(REAR)은 다섯 개 평가 항목 전부에서 기존 방식들보다 높은 점수를 기록했다. 재정렬 보상이란 AI가 답변 후보들을 스스로 채점할 때 사용자의 취향이 차지하는 비중만 따로 키워 다시 계산하는 점수를 말한다. 연구진은 이 점수에 REAR라는 이름을 붙였다.
연구진은 REAR 점수를 두 가지 방식에 붙여 실험했다. 하나는 답변 후보 16개를 통째로 만들어 놓고 점수가 가장 높은 하나를 고르는 방식이고, 다른 하나는 답변을 한 줄씩 만들어 가면서 갈림길마다 점수가 높은 쪽으로 가지를 뻗는 나무 탐색 방식이다. 취향을 명시적으로 밝힌 과제에서 기본 방식은 67.0점이었지만 나무 탐색 방식은 77.7점을 기록해 10.7점 높았고, 취향을 직접 말하지 않고 넌지시 드러낸 과제에서는 12.0점이 19.1점으로 올랐다. 역할극 대화 평가에서는 후보 16개를 비교하는 방식이 2.97점을 3.07점으로 끌어올려 더 나은 성적을 냈다. 다섯 항목을 평균 내면 REAR 기반 나무 탐색은 기본 방식보다 11.6%, AI가 자기 답변을 스스로 심사하는 방식보다 8.3% 높았다.
격차는 대화가 길어질 때 더 벌어졌다. 기존의 추론 단계 정렬 기법인 아뮬렛(Amulet)과 선형 정렬(Linear Alignment)은 긴 대화 실험에서 메모리 부족으로 아예 실행되지 못해 비교에서 빠졌고, AI가 자기 답변을 스스로 심사하게 하는 방식은 대화가 20번 오간 지점에서 6.7점을 기록해 기본 방식과 똑같아졌다. 연구진은 길어진 대화 기록이 심사하는 AI의 판단을 흐트러뜨렸을 가능성이 크다고 설명했다.
질문 점수와 취향 점수를 나누는 보상 분해
REAR의 원리는 AI가 답변에 매기는 하나의 점수를 두 개로 쪼개는 데서 출발한다. 연구진은 이를 보상 분해라고 불렀는데, 보상 분해란 AI가 답변을 평가할 때 쓰는 점수를 질문에 제대로 답했는지 보는 몫과 사용자의 취향을 지켰는지 보는 몫으로 나누는 것을 말한다. 두 몫의 비율은 원래 모델이 학습 과정에서 스스로 정해 놓은 값이고, 사용자는 그 값을 건드릴 수 없다.
연구진이 한 일은 이 비율에 사람이 돌릴 수 있는 손잡이를 다는 것이었다. 논문에서 람다로 표기한 이 손잡이를 1로 두면 평소의 AI와 똑같고, 20으로 올리면 취향 쪽 점수를 학습 때보다 20배 무겁게 쳐서 답변 후보들의 순위를 다시 매긴다. 앞서 든 수학 공부 이야기가 바로 논문 첫머리에 실린 그림이다. 수학 공부를 재미있게 하는 법을 물으면서 게임 방식은 싫다고 밝힌 사용자에게, 모델은 게임처럼 만든 학습법과 함께 공부하는 학습법을 모두 후보로 떠올린다. 손잡이를 올리기 전에는 게임형 답변이 선택되지만, 올린 뒤에는 협동 학습형 답변이 더 높은 점수를 받아 최종 답으로 나간다.
이 계산이 실용적인 이유는 새 모델을 붙이지 않아도 되기 때문이다. REAR 점수는 이미 답변을 만들고 있는 모델이 각 단어를 내놓을 때의 확률값만 두 번 계산해 더하고 빼면 나온다. 그래서 후보 16개를 비교하는 방식은 답변 하나에 2.80초가 걸렸다. 한 번에 답을 내놓는 기본 방식의 0.20초보다는 느리지만, 자기 답변을 심사하게 하는 방식의 4.00초나 별도의 심사용 AI를 띄우는 방식의 4.70초보다는 빠르다. 점수가 가장 높았던 나무 탐색 방식은 9.60초로 더 걸렸으나, 기존 정렬 기법인 아뮬렛의 18.34초에는 미치지 않았다. AI 서비스를 운영하는 쪽에서 보면 서버를 한 대 더 사지 않고 기존 모델만으로 개인화 성능을 끌어올릴 수 있다는 뜻이다.
관련 없는 지시문에서 74.8%에 멈춘 취향 문구의 조건
손잡이를 올리기만 하면 되는 것이 아니라, 손잡이에 물리는 문장이 과제와 맞물려야 효과가 난다. 연구진이 수학 문제 500개를 모은 MATH500 평가에서 취향 자리에 넣는 지시문만 바꿔 가며 실험한 결과가 이를 보여 준다. 이 실험에서는 지시문을 취향 정보 자리에 넣어 답변 후보 16개를 만든 뒤 REAR 점수가 가장 높은 하나를 골랐다. 지시문 없이 한 번에 답하게 한 기본 방식의 정답률은 74.6%였는데, “엄밀한 수학자처럼 행동하라”로 시작해 “거꾸로 계산하거나 다른 방법을 써서 결과를 다시 확인하라”로 끝나는 상세한 지시문을 넣자 82.6%로 올랐다. “이 수학 문제를 단계별로 풀어라”라는 짧은 지시문을 같은 절차로 넣었을 때도 81.8%가 나왔다. 지시문을 길고 정교하게 다듬는 데 들인 공은 0.8%포인트만큼만 값을 했다.
반대쪽 결과가 더 흥미롭다. “당신은 창의적인 소설 작가다”라는 과제와 무관한 지시문을 같은 절차로 넣었을 때 정답률은 74.8%로, 아무 지시문도 넣지 않은 74.6%와 사실상 같았다. 후보를 16개나 만들어 하나하나 점수를 매기고 고르는 수고를 들였는데도 성능이 제자리였다는 뜻이다. 그럴듯한 문장을 아무거나 얹으면 AI가 똑똑해지는 것이 아니라, 지시문과 과제가 실제로 맞물릴 때만 점수 계산이 달라진다. 연구진은 이 결과를 근거로 REAR가 일반적인 생성 편향을 만들어 내는 것이 아니라 지시문과 과제 사이의 진짜 연결을 활용한다고 해석했다.
같은 원리는 이미지를 다루는 모델에도 통했다. 이미지 속 내용을 묻는 평가에서 이미지와 질문에 근거해서만 말하고 확실하지 않으면 그렇다고 밝히라는 취지의 지시문을 넣고 REAR로 답을 고르자, 환각 비율이 28.12%에서 21.87%로 내려갔다. 환각이란 AI가 이미지에 없는 내용을 있다고 말하는 현상이다. 여기 쓰인 모델은 큐원 계열의 이미지 인식 모델이었고, 회사를 건너뛴 검증은 따로 이뤄졌다. 연구진이 라마3.1(Llama-3.1-8B-Instruct)에 같은 손잡이 값 20을 별도 조정 없이 그대로 적용하자 취향을 명시한 과제 점수가 11.8점 올라 86.4점이 됐다.
취향 볼륨 20배와 답변 품질의 맞교환
손잡이를 끝까지 올리는 것이 정답은 아니었다. 연구진이 손잡이 값을 1에서 200까지 올리며 답변을 두 축으로 나눠 채점한 결과, 취향을 지켰는지 보는 점수는 1일 때 약 72점에서 3일 때 약 77점으로 급등한 뒤 그 부근에서 평평해졌다. 반대로 질문에 얼마나 도움이 되는 답을 했는지 보는 점수는 99.0점에서 시작해 손잡이를 올릴수록 계속 내려가 200에서는 96.2점까지 떨어졌다. 두 선은 손잡이 값 1과 3 사이에서 교차한다.
그림1. 취향 비중을 키울수록 취향 점수는 오르고 질문 응답 점수는 내려간다 (자료: REAR 논문 Figure 7)
종합 점수가 정점을 찍는 지점은 20 부근이었다. 후보 16개를 비교하는 방식에서 취향을 명시한 과제와 네 개 보기 중 하나를 고르게 하는 과제 모두 손잡이 값 20에서 가장 높은 점수가 나왔고, 그 뒤로는 다시 내려갔다. 사용자 입장에서 이 곡선은 이렇게 읽힌다. 내 취향을 지나치게 강하게 반영하라고 요구하면 AI는 취향은 잘 지키되 정작 질문에는 성의 없는 답을 내놓는다. 옷 가게에서 무조건 파란색만 고집하면 파란 옷은 확실히 받지만 그 옷이 계절에 맞는지는 보장되지 않는 것과 비슷하다.
연구진도 이 손잡이가 사용자에게 그대로 노출된다는 점을 한계로 밝혔다. 손잡이 값 20이 대체로 안전한 기본값이라는 사실은 실험 데이터를 8대 2로 나눠 검증용 데이터에서만 값을 고르는 방식으로도 확인했고, 여덟 개 조합 가운데 일곱 개에서 같은 값이 다시 선택됐다. 다만 취향의 성격이 크게 다른 환경에서는 별도의 조정이 필요할 수 있다고 덧붙였다. 성능을 얼마나 끌어올릴지와 계산 비용을 얼마나 치를지 사이에서 적정 지점을 찾는 일도 앞으로의 과제로 남겼다.
학습 단계 대신 답변 순간에서 이뤄지는 개인화
이 연구가 시사하는 바는 개인화가 이뤄지는 지점이 학습 단계에서 답변을 만드는 순간으로 내려올 가능성이다. 지금까지 AI를 사용자 취향에 맞추는 일은 대체로 취향 데이터를 모아 모델을 다시 학습시키는 방식이었고, 여기에는 데이터를 모으는 비용과 계산 자원이 크게 들었다. REAR는 이미 만들어진 모델의 내부 확률값만 다시 배분해 같은 목적을 달성하려는 시도이며, 답변 하나에 2.8초에서 9.6초를 더 쓰는 것으로 그 값을 치른다.
다만 이 연구가 취향 반영 실패를 완전히 해결했다고 보기는 어렵다. 대화가 100번 오간 지점에서 점수는 4.0점에서 7.2점으로 올랐지만 처음의 67.0점과 비교하면 여전히 10분의 1 수준이다. 긴 대화에서 개인 취향이 희미해지는 현상 자체는 남아 있고, 점수 배분을 바꾸는 방식만으로 이 문제가 근본적으로 풀릴지는 두고 볼 필요가 있다. 역할극 평가에서 나무 탐색 방식이 오히려 단순 비교 방식보다 낮은 점수를 받은 것도 눈여겨볼 대목인데, 연구진은 갈림길마다 다양한 답변을 탐색하는 구조가 긴 대화에서 설정한 인물상으로부터 멀어지게 만들었을 가능성을 제시했다. 개인화를 강하게 밀어붙일수록 다른 무언가가 흔들린다는 사실은 손잡이의 양쪽 끝 어디에서나 반복되는 셈이다.
FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)
Q1. AI가 제가 말한 취향을 자꾸 잊는 것 같은데, 정말 잊어버리는 건가요?
논문은 정보가 사라지는 것이 아니라 그 정보에 매겨지는 내부 점수가 낮아지는 쪽으로 설명합니다. 취향 내용은 대화 기록 안에 그대로 남아 있지만, 대화가 길어질수록 모델이 그 정보를 답변 선택에 반영하는 비중이 줄어듭니다. 실제 측정에서도 대화가 100번 오간 뒤 취향 반영 점수는 67.0점에서 4.0점까지 떨어졌습니다.
Q2. 프롬프트를 길고 자세하게 쓰면 AI 성능이 정말 좋아지나요?
과제와 관련 있는 지시문일 때만 효과가 있습니다. REAR로 답변 후보 16개 중 하나를 고르게 한 수학 문제 평가에서 “이 수학 문제를 단계별로 풀어라”라는 짧은 지시문은 81.8%, 훨씬 상세한 지시문은 82.6%로 차이가 0.8%포인트에 그쳤습니다. 반면 “당신은 창의적인 소설 작가다”라는 무관한 지시문은 74.8%로, 지시문 없이 한 번에 답하게 한 74.6%와 사실상 같았습니다.
Q3. 이 기술은 일반 사용자가 지금 바로 쓸 수 있나요?
현재는 연구 단계의 방법이며 서비스 화면에 노출된 기능은 아닙니다. 다만 별도의 AI를 추가로 띄우지 않고 기존 모델의 확률값만 다시 계산하는 구조여서, AI 서비스를 만드는 쪽에서는 비교적 적은 비용으로 적용할 수 있습니다. 연구진은 코드를 공개했습니다.
기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다.
리포트명: REAR: Test-time Preference Realignment through Reward Decomposition (arXiv:2606.30339v1)
이미지 출처: AI 생성 콘텐츠
해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다.
AI Matters 뉴스레터 구독하기











