AI 답변 신뢰도 평가는 왜 낯선 질문에 약해지나…RIKEN 참여 ProbeDrift 연구가 던진 경고
언어모델의 내부 신호로 답변 신뢰도를 추정하는 ‘불확실성 평가 탐침’도 학습 때 보지 못한 데이터에서는 빠르게 흔들릴 수 있다는 결과가 나왔다.
일본 RIKEN AIP가 2026년 9월 30일 EMNLP 2026 채택 논문으로 소개한 국제 공동연구는, 신뢰도 평가 도구 자체도 실제 사용 환경에 맞춰 따로 검증해야 한다는 점을 보여준다.
AI가 내놓은 답이 맞는지, 혹은 얼마나 믿을 만한지 자동으로 점수화하려는 시도는 생성형 AI 시대의 핵심 과제다. 문제는 그 점수를 매기는 도구 역시 익숙한 시험장 밖으로 나가면 약해질 수 있다는 점이다. 일본 RIKEN 산하 혁신지능통합연구센터(AIP)가 9월 30일 소개한 EMNLP 2026 채택 논문은 바로 이 지점을 정면으로 다뤘다.
해당 논문은 2026년 4월 13일 처음 공개됐고 8월 30일 수정본(v2)이 올라왔다. 저자 구성도 일본 단독이 아니라 영국 셰필드대, 하버드대 켐프너연구소, 아부다비 MBZUAI, 도호쿠대, RIKEN이 함께한 국제 공동연구다. 연구진은 ‘ProbeDrift’라는 평가 틀을 만들고 2000개가 넘는 불확실성 평가 탐침을 훈련·비교해, 데이터 분포 변화가 커질수록 기존 방식의 일반화 성능이 빠르게 떨어진다고 보고했다.
정확도와 신뢰도 평가는 다른 문제다
이번 연구가 다루는 대상은 언어모델 자체의 정답률이 아니라, 언어모델이 낸 답변의 신뢰도를 추정하는 별도 장치다. 이런 탐침은 모델의 은닉상태나 어텐션 같은 내부 표현을 입력으로 받아 “이 답은 틀릴 가능성이 높다”거나 “자신감이 과도하다”는 식의 신호를 계산한다. 서비스 운영자 입장에서는 재질문 유도, 사람 검토 연결, 자동 거절 기준 설정에 활용할 수 있어 중요성이 크다.
여기서 분포 변화는 훈련에 쓰인 질문과 실제 입력이 달라지는 현상을 뜻한다. 같은 질의응답이라도 짧은 상식형 문제에서 학습한 평가기가 긴 의학 답변이나 요약 과제로 넘어가면 성질이 달라진다. 익숙한 데이터에서 높은 점수를 보였다는 사실만으로, 새로운 데이터에서도 같은 수준의 신뢰도 평가가 유지된다고 볼 수 없는 이유다.
가까운 변화에는 버텼지만, 큰 변화 앞에서는 급격히 약해졌다
연구진은 분포 변화의 강도를 단계적으로 나눠 평가했다. 같은 분포 안에서 훈련·평가하는 경우를 기준으로, 비슷한 데이터셋 하나를 빼고 시험하는 근거리 OOD, 같은 과제이지만 다른 데이터셋으로 옮기는 경우, 아예 다른 과제로 옮기는 경우 등을 비교했다. 결론은 명확했다. 일부 방법은 가까운 OOD에서는 성능을 유지했지만, 과제 자체가 달라지거나 훈련 데이터와의 거리가 커지면 성능 저하가 빨라졌다.
논문은 PRR이라는 지표를 사용해 불확실성 추정이 무작위보다 얼마나 나은지 측정했다. v2 본문에 따르면 Llama 3.1-8B에서 중간층 은닉표현을 쓰는 대표 탐침의 평균 성능은 짧은 답변 과제 기준 분포 내 평가에서 0.58 수준이었지만, 근거리 OOD에서는 0.29, 다른 과제 OOD에서는 0.25로 낮아졌다. 더 강한 이동에서는 일부 설정이 우연 수준이나 그 이하로 내려가기도 했다. 이는 “평가기가 낸 자신감”이 멀리 벗어난 데이터에서는 오히려 오판 신호가 될 수 있음을 뜻한다.
겉으로 비슷해 보여도 설계 차이가 결과를 갈랐다
흥미로운 점은 어떤 설계가 강건성을 좌우하는지가 분포 내 성능만 봐서는 잘 드러나지 않았다는 점이다. 연구진은 입력 특성의 종류, 토큰 정보를 어떻게 모으는지, 어떤 정답성 신호로 학습시키는지에 따라 결과가 크게 달라진다고 분석했다. 특히 최종층보다 중간층 은닉표현이 OOD 환경에서 더 안정적이었고, 한 토큰만 보는 방식보다 응답 전반을 집계하는 방식이 유리했다.
긴 답변 과제에서는 학습 신호의 선택이 더 민감했다. 연구진은 AlignScore, exact match, ROUGE-L, LLM-as-a-judge 같은 서로 다른 정답성 함수를 비교했는데, 장문 생성에서는 무엇을 ‘맞은 답’으로 간주하느냐에 따라 탐침의 강건성 판단이 크게 달라졌다. 다시 말해 신뢰도 평가기 자체가 무엇을 정답으로 배웠는지부터 따져야 한다는 뜻이다.
서비스 적용 전 확인해야 할 조건
이 연구를 곧바로 “모든 AI 서비스의 신뢰도 평가는 믿기 어렵다”는 결론으로 넓힐 수는 없다. 실험은 특정 모델, 특정 데이터셋, 특정 탐침 계열을 체계적으로 비교한 결과이지 전체 산업의 실패율을 측정한 보고서는 아니다. 다만 최소한 하나는 분명해졌다. 신뢰도를 재는 도구가 있다고 해서 그 도구의 신뢰도까지 자동으로 확보되는 것은 아니라는 점이다.
실무에서는 세 가지를 구분해 볼 필요가 있다. 첫째, 언어모델의 답변 정확도와 평가기의 판별력은 별개다. 둘째, 분포 내 벤치마크 점수와 실제 운영 환경의 점수는 다를 수 있다. 셋째, 짧은 QA와 긴 요약·설명처럼 출력 형식이 달라지면 같은 평가기를 그대로 옮겨 쓰기 어렵다. 연구진이 제안한 Hybrid Back-Off 전략처럼, 입력이 훈련 분포에서 멀어질수록 감독학습 탐침보다 단순한 비지도 신호를 더 많이 섞는 방식은 하나의 보완책이지만, 그것 역시 추가 검증의 대상이다.
신뢰도 점수에도 ‘사용 환경 검증’이 필요하다
생성형 AI 경쟁이 모델 성능에서 운영 신뢰성으로 옮겨가면서, 불확실성 평가는 안전장치처럼 취급돼 왔다. ProbeDrift 연구는 그 안전장치도 낯선 환경에서 흔들릴 수 있음을 보여준다. 결국 “AI 답변의 신뢰도를 매기는 도구도 낯선 질문에서는 믿기 어려울 수 있는가”라는 질문에 대해, 현재 확인된 근거 범위에서는 “그렇다, 특히 학습 때와 거리가 큰 데이터에서는 그렇다”가 가장 정확한 답에 가깝다.
따라서 앞으로의 기준은 단순하다. 어떤 신뢰도 평가 도구를 보더라도 분포 내 성능만이 아니라 얼마나 먼 OOD 조건까지 시험했는지, 어떤 정답성 신호로 학습했는지, 짧은 답변과 긴 답변에서 결과가 어떻게 달라지는지 함께 확인해야 한다. AI의 자신감 점수는 편리한 숫자이지만, 그 숫자가 어디까지 믿을 수 있는지는 별도의 검증 없이 알 수 없다.
