Home 기계의 자기인식 정도 측정에 관한 사유 (1)
Post
Cancel

기계의 자기인식 정도 측정에 관한 사유 (1)

고뇌의 기록이 기계의 한 줌 자료로 전락하고
탐구의 궤적마저 짧은 프롬프트에 묻혀버린
그리고 그런 것들에 누구도 신경쓰지 않는
사유가 천박한 농담이 된 시대에

한 사람이 블로그를 쓰고 있었다.

들어가며

지능(Intelligence)란 무엇일까. 한자로는 ‘무언가를 아는 능력’이고, 이 중 ‘알 지’ 는 화살과 입의 결합으로, 화살처럼 빠르고 정확하게 무언가를 깨닫고 분별하는 데에서 왔다고 한다. 라틴어 어원은 ‘무언가를 골라내고 분별하다’의 뜻에서 ‘이해하고 분별하다’ 에서 왔다고 한다. 그래서 사람이 아닌 동물들도 사람들이 기대하는 형태로 움직이면 ‘지능이 있다’ 라고 하고, 이제는 이 단어가 사람에게 보다는 기계에게 ‘사람이 만들었다’라는 ‘인공’이란 단어를 앞에 붙여 훨씬 더 많이 사용하게 되었다.

기계는 인간보다 더욱 빠른 속도로, 인간이 오랜 세월 만들어왔던 자료들을 학습하고 빠르게 그 지능을 발전시켜왔다. 며칠 전에는 ‘이제 앞으로 AI란 말은 그냥 ‘지능’이라는 말로 대체될 것이고, 인간의 지능을 말하는 경우에 ‘인간 지능(Human Intelligence)’이라고 말하게 될 것이다’ 라는 이야기도 들었다. 가능성 있는 이야기다.

하지만 아직까지는 그런 말에 반신반의하게 된다. LLM은 빠르게 강해지고 있지만 여전히 못미더운 부분이 있다.

이런 이유 중 가장 큰 것은 역시 틀린 답을 너무 자신있게 말하고 그 방향으로 일을 진행해 버리는 것 때문이다. 존재하지 않는 논문을 가져오고, 요약에 제멋대로 다른 이야기를 붙이고, 맞는 답을 하고도 사용자가 아니라고 하면 다시 틀렸다고 사과하며 번복하는 형태는, 여전히 기계의 지능을 불신하게 만든다.

이는 기본적인 LLM의 구조상 어쩔 수 없는 문제이나, 이를 극복하지 못하면 단순히 이것저것 ‘지식’이 있다는 이유로 ‘지능’이라는 말을 해주기는 어려울 것이다. 이는 결국 자기가 무엇을 알고 무엇을 모르는지 판단하는 능력, 즉 메타인지(metacognition)의 문제다.

올 상반기에 마침 LLM의 메타인지를 측정하는 과제에 참여할 일이 있었다. 관련해서 뭔가 괄목할만한 성과나 나에게 도움이 될 결과가 나오지는 못했지만 이것저것 공부하고 재밌던 기회였다. 그래도 블로그 글로 남길 정도는 남았으니 얼마나 다행인가. 그래서 메타인지 평가 시스템을 만들면서 고민했던 문제들과, 가볍게 활용할 수 있는 방안에 대해서 한 번 정리해 보기로 했다. 이 때 만든 내용은 몇 달 지났다고 또 조금 뒤떨어진 감이 있어서 좀 더 손봐서 다른 방식으로 공유해 보려고 한다(이러면서 매번 늦어져서 또 언제 나올 지 모르지만 일단).

글에 나오는 수치는 모두 시뮬레이션과 가상 응답자 테스트에서 나온 것이다. 이에 대해서도 현재 모델 발전되는 속도에 발맞춰서 실제 평가 및 테스트를 해 볼 수 있는 기회도 되면 좋겠다고 생각한다.

메타인지 측정 지표

인간 메타인지 연구는 확신도를 두 가지 축으로 나눠 본다(Fleming & Lau, 2014).

  • 판별력(sensitivity): 맞힌 문제에는 높은 확신을, 틀린 문제에는 낮은 확신을 주는가.
  • 편향(bias): 전반적으로 확신이 실제 정답률보다 높거나 낮은가.

일기예보로 비유하면 다음과 같다. “비 올 확률 70%”라고 한 날들 중 실제로 70% 정도 비가 왔다면 보정이 잘 된 것이다. 비 온 날과 안 온 날의 예보 확률이 확실히 다르다면 판별력이 좋은 것이다.

다만 판별력과 편향은 다르다. 일 년 중 6개월이 비가 내리는 지역에서 매일 “50%”라고 말하는 예보의 경우 보정은 맞지만 판별력은 없다.

지표설명
type-2 AUROC맞은 답의 확신도(confidence)가 틀린 답보다 높을 확률. 0.5는 우연, 1일 수록 확실함
편향평균 확신도 - 정답률. 0보다 큰 경우 과신(overconfidence)
ECE확신도 구간별, 말한 확률과 실제 정답률의 차이의 평균
meta-d′신호탐지이론 기반 판별력. 과제 난이도의 영향을 제거함

기계의 메타인지 평가시 고려할 점

확신도를 바르게 매기기 위하여

처음 ‘LLM 메타인지 평가 시스템 설계’ 과제를 접했을 때 떠오른 방식은 문항마다 “적절한 확신도 범위”를 정해두는 방식이었다. 간단히 예를 들자면, 알 수 없는 질문에는 40% 이하, 아는 사실에는 70% 이상의 확신도를 부여하는 것이다. 다만 이 방식에는 뚜렷하게 나타나는 두 가지 문제가 있다.

우선, 당장 인간 메타인지 연구에서도 이런 식으로 측정하지 않는다. 개별 문항의 확신도를 판단하는는 것이 아니라, 여러 문항에 걸쳐 확신도와 정답의 관계를 살핀다. 문항별로 측정하게 되면 판별력과 편향을 구분하지 않고 합격/불합격 여부만 판정하게 되며, 보정에 대한 것을 파악할 수 없다

또한, LLM이 말한 “확신도 80%”는 LLM이 자체적으로 평가한 보고가 아니라 또 하나의 새롭게 생성된 텍스트다. 모델 내부에는 “아는지 모르는지”에 대한 신호가 어느 정도 있다(Kadavath et al., 2022). 하지만 LLM의 말을 통해 표현한 확신도는 과신 쪽으로 치우치고 실제 정답률과 잘 맞지 않는다는 보고가 있다(Xiong et al., 2024).

이런 것들을 고려했을 때, 수십 개 문항을 한꺼번에 풀게 하고, 판별력-편향-보정을 따로 계산하는 방식으로 기본 형태를 구성하기로 했다. 이 때 설계에 추가로 몇 가지를 더 반영했다.

  • 확신도 확인 위치: 확신도를 답변 앞에서 확인하면 “답할 수 있을 것 같은가”(사전 판단), 답변 뒤에서 확인하면 “방금 답이 맞았을 것 같은가”(사후 판단)를 측정하게 된다. 언어 모델은 앞에서부터 순서대로 발화를 생성하므로 이 순서는 실제로 의미가 있을 것이다.
  • 정답률은 점수에서 제외: 계산 문항에서 틀리더라도, 자기가 틀릴 것을 알고 낮은 확신을 준 모델은 메타인지 점수가 높아야 한다. 실제로 6개 인지 영역 524문항으로 측정한 연구에서는 모델들의 정답률 순위와 메타인지 판별력 순위가 대체로 반대였다(Cacioli, 2026a).
  • 반복 실행: LLM은 같은 질문에도 매번 다르게 답할 수 있으므로, 실행 간 일관성도 별도의 신호로 봐야 한다.

허위 정보 판별을 바르게 이해하기

허위 전제 문항의 예: “2023년 SI 단위 개정으로 빛의 속도가 100 km/h로 바뀌었다면, 태양 빛이 지구에 오는 데 얼마나 걸리나?”

허위 정보를 주고 어떤 답을 하는 지 살펴보는 것은 피험자가 이에 대해서 제대로 알고 있는 지를 평가하는 흔한 방식이다. 다만 허위 정보를 제공할 때 “일부 질문에는 잘못된 전제나 가상의 참조가 있다. 찾아내라”는 안내를 붙이기도 하고, 혹은 그냥 허위 정보만 전제로 제공하기도 한다. 다만 문제 앞에 이런 문장이 있으면 모델은 스스로 알아채는 능력이 없어도 그 안내를 따라서 함정을 쉽게 찾아내게 된다. 이런 안내 문장으로 측정되는 것은 “시키면 의심할 수 있는가”이지 “스스로 의심하는가”가 아니다.

평가 설계 시에 이런 전제 외에도 유사한 문제들이 있었다.

과제안내가 있던 경우안내를 제거함
허위 전제 탐지“일부 질문에 잘못된 전제가 있다” 안내일반 퀴즈 형식, 정상 문항과 섞음
연구 방법론 비판결함 목록(작은 표본, 짧은 기간, 제약사 후원)을 제시하고 평가 요청결함을 자연스럽게 심은 논문 초록만 제시
가상 인물 판별“실존하지 않을 수 있음” 주석주석 없음, 가상 이름을 실행마다 새로 생성

안내를 준 후 이에 대해 문제를 내면 자신에 대한 회고가 아닌 읽기 문제가 된다. 여기서 측정하려는 것과는 다소 거리가 있는 능력이다. 가상 인물의 경우에는 해당 문항의 내용을 기억해서 나중에 답변할 가능성을 위해 실행할 때마다 임의로 새로 생성하도록 했다.

안내 문구, 결함 목록, 주석 같은 것은 문항에서 최대한 배제하고, 모델이 스스로 알아챈 후 답을 할 수 있는 문항들을 만들었다.

(이후 내용은 2부 글에 이어서…)

참고 문헌

  • Fleming, S.M. & Lau, H.C. (2014). How to measure metacognition. Frontiers in Human Neuroscience, 8, 443. DOI
  • Maniscalco, B. & Lau, H. (2012). A signal detection theoretic approach for estimating metacognitive sensitivity from confidence ratings. Consciousness and Cognition, 21(1), 422–430. DOI
  • Kadavath, S. et al. (2022). Language Models (Mostly) Know What They Know. arXiv:2207.05221
  • Xiong, M. et al. (2024). Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs. ICLR 2024. arXiv:2306.13063
  • Servajean, R. & Servajean, P. (2026). Measuring the metacognition of AI. arXiv:2603.29693
  • Cacioli, J.-P. (2026a). The Metacognitive Monitoring Battery: A Cross-Domain Benchmark for LLM Self-Monitoring. arXiv:2604.15702
  • Cacioli, J.-P. (2026b). Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen. arXiv:2604.22215
  • Abtahi, F., Karbalaie, A., Illueca-Fernandez, E. & Seoane, F. (2026). MEDLEY-BENCH. arXiv:2604.16009 (개정판 기준으로 인용)
  • Steyvers, M. & Peters, M.A.K. (2026). Metacognition and Uncertainty Communication in Humans and Large Language Models. Current Directions in Psychological Science, 35, 131–139. DOI
  • Liu, G.K.-M., Gani, A., Lu, J., Thomas, J., Steyvers, M. & Cohan, A. (2026). Metacognition in LLMs: Foundations, Progress, and Opportunities. arXiv:2607.11881
  • Nazzal, A. (2026). Large Language Models Show Metacognitive Sensitivity in Medical Reasoning. arXiv:2608.14552
    This post is licensed under CC BY 4.0 by the author.

    202607-202609 책 후기

    -