트렌드·인사이트

AI는 자신감 88%, 실제 정답률 79%…미 UC버클리 연구가 짚은 ‘과신의 9%포인트’

11개 주요 대형언어모델 시험에서 평균 자기보고 신뢰도는 88%, 실제 정답률은 79%로 나타났다.

문제는 환각의 유무만이 아니라, 모델이 스스로 표시하는 확신을 얼마나 믿을 수 있느냐는 ‘확률 보정’에 있다.

인공지능이 “이 답이 맞을 가능성이 높다”고 말할 때 그 수치를 그대로 믿어도 될까. 10월 5일 미국 UC버클리 하스경영대학원이 소개한 연구에 따르면, 적어도 이번에 시험한 11개 주요 대형언어모델에서는 그렇지 않았다. 연구진이 관찰한 평균 자기보고 신뢰도는 88%였지만 실제 정답률은 79%였고, 격차는 9%포인트였다.

이 수치는 AI가 늘 틀린다는 뜻이 아니다. 오히려 더 중요한 메시지는 정확도와 신뢰도가 같은 문제가 아니라는 데 있다. 어떤 모델이 상당수 질문에 정답을 내더라도, 틀릴 때조차 지나치게 확신한다면 사용자는 어느 답을 다시 검증해야 하는지 구분하기 어려워진다. 생성형 AI의 신뢰 문제를 ‘환각을 줄였는가’라는 이분법만으로 볼 수 없는 이유다.


정답률보다 먼저 봐야 할 ‘보정’의 문제


연구진이 집중한 개념은 보정, 영어로는 캘리브레이션이다. 이는 모델이 제시하는 확신의 정도가 실제 정답 가능성과 얼마나 맞아떨어지는지를 뜻한다. 90% 확신한다고 말한 답들이 장기적으로 정말 90% 안팎의 정확도를 보여야 잘 보정된 시스템이라고 할 수 있다.

이 기준에서 보면 높은 성능과 높은 신뢰도는 다르다. 예컨대 어떤 모델이 전체적으로는 우수한 정답률을 보이더라도 모든 답변을 거의 확실한 듯 말한다면, 남아 있는 오류는 사용자가 걸러내기 더 어려워진다. 특히 법률, 의료, 금융, 연구보조처럼 사용자가 답의 우선순위를 나눠 검토해야 하는 영역에서는 이 차이가 실무 위험으로 이어질 수 있다.


11개 모델에서 확인된 공통 패턴


이번 연구는 오픈AI, 구글, 앤스로픽, 메타 계열을 포함한 11개 모델을 대상으로 진행됐다. UC버클리 하스와 연구진이 공개한 작업논문에 따르면, 이 연구는 사전등록된 설계로 진행됐고 대형언어모델의 신뢰도 보정을 다양한 과제에서 점검했다. 평균적으로는 자신감이 정확도를 앞질렀고, 연구진은 이를 인간의 과신과 유사한 패턴으로 해석했다.

연구에서 함께 제시된 LifeEval은 이런 차이를 보기 위한 시험 도구다. 특정 사람의 성별과 나이를 주고 기대수명을 추정하게 한 뒤, 정부 생명표 데이터에 비춰 답의 정확성과 모델이 스스로 제시한 확신을 비교하는 방식이다. 질문의 난도를 조금씩 조정하면서도 과제의 형태 자체는 크게 바꾸지 않아, 어려운 문제와 쉬운 문제에서 신뢰도가 어떻게 달라지는지 비교하기 쉽다는 점이 특징이다.


어려울수록 더 확신하는 ‘하드-이지 효과’


흥미로운 대목은 과신이 모든 상황에서 같은 강도로 나타나지 않았다는 점이다. 연구진은 문제 난도가 올라갈수록 과신이 커지고, 반대로 쉬운 문제에서는 오히려 자신감을 낮게 잡는 경향도 확인했다. 심리학에서 오래 연구된 ‘하드-이지 효과’가 AI에서도 관찰됐다는 것이다.

이 현상은 사용자 경험과도 맞닿아 있다. 사람은 AI가 자신 있게 말할수록 답의 품질도 높다고 직관적으로 받아들이기 쉽다. 그러나 어려운 질문일수록 바로 그 자신감이 실제 성능보다 더 부풀려질 수 있다면, 사용자는 가장 조심해야 할 순간에 오히려 경계를 늦추게 된다. AI의 말투나 단정적인 문장 구조를 신뢰 신호로 오해하는 문제가 여기서 생긴다.


RLHF가 만든 유용성의 역설


연구진은 이런 경향의 한 배경으로 RLHF, 즉 인간 피드백을 통한 강화학습을 거론했다. 공개 전 단계에서 사람 평가자가 더 선호하는 답변을 학습시키는 과정인데, 이때 사람은 종종 조심스러운 답보다 단호하고 매끄러운 답을 더 높게 평가할 수 있다. 정확히 모를 때의 유보보다, 일단 답을 내놓는 태도가 시스템에 보상으로 입력될 가능성이 있다는 뜻이다.

물론 이번 연구만으로 RLHF가 과신의 원인이라고 단정할 수는 없다. 다만 친절하고 협조적인 챗봇을 만들려는 설계 목표와, 불확실성을 솔직하게 드러내는 시스템을 만드는 목표 사이에 긴장이 존재한다는 점은 분명해졌다. 사람에게 기분 좋은 AI와, 산업 현장에서 위험을 낮추는 AI가 언제나 같은 방식으로 최적화되지는 않는다는 이야기다.


최신 추론형 모델이 더 낫지만, 해답은 아니다


연구진은 최신 추론형 모델들이 일반 대화형 모델보다 보정 상태가 더 나았다고 설명했다. 스스로 검토하고 추론 단계를 거치는 설계가 신뢰도 개선에 일부 도움이 될 수 있다는 의미다. 다만 더 낫다는 것과 충분하다는 것은 다르다. 연구진도 이들 모델이 여전히 불완전하다고 적시했다.

따라서 이번 결과를 모든 AI 전체의 본성처럼 일반화할 수는 없다. 88%와 79%는 개별 모델 수치가 아니라 이번 시험 대상 11개 모델의 평균이다. 그럼에도 이 연구가 던지는 질문은 분명하다. 생성형 AI를 평가할 때 이제는 “틀리느냐 맞느냐”뿐 아니라 “자신의 불확실성을 얼마나 정확히 표현하느냐”를 함께 봐야 한다는 것이다.

기업과 기관이 AI 도입 성과를 말할 때도 정답률, 벤치마크 순위, 응답 속도만으로는 충분하지 않다. 어떤 조건에서 과신이 커지는지, 신뢰도 수치를 외부에서 검증할 수 있는지, 사용자가 재확인이 필요한 답을 식별할 장치가 있는지가 함께 공개돼야 한다. AI의 위험은 항상 엉뚱한 답을 만드는 데서만 생기지 않는다. 틀릴 수 있는 답을 너무 그럴듯하게 말하는 데서도 생긴다.

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다