아카이브
AI 논문

📄 인컨텍스트 학습 원리, LLM은 믿음 상태를 만든다

2026년 9월 17일 · 09:00 발행LLM추론

프롬프트에 예시 몇 개만 넣으면 LLM이 갑자기 새 과제를 해낸다. 인컨텍스트 학습(ICL)이라 부르는 이 현상은 이제 너무 익숙해서 신기하지도 않지만, 모델 안에서 정확히 무슨 일이 벌어지는지는 놀라울 만큼 알려진 게 없다. 2026년 9월 15일 arXiv에 올라온 연구는 여기에 꽤 구체적인 답을 내놓는다. 모델이 맥락을 읽어나가면서 "지금 상황이 어느 쪽일 확률이 얼마"라는 일종의 확률 지도를 내부에 만든다는 것이다.

어떻게 확인했나

자연어는 정답을 알 수 없다는 게 이런 연구의 근본 난점이다. 그래서 연구진은 정답이 계산 가능한 인공 환경을 썼다. 은닉 마르코프 모델(HMM)이다. HMM은 눈에 보이지 않는 상태가 정해진 확률로 옮겨 다니며 토큰을 만들어내는 장치다. 관측된 토큰 이력이 주어지면 "지금 숨은 상태가 무엇일 확률이 얼마"라는 사후확률 분포를 수학적으로 정확히 계산할 수 있다. 이것을 **믿음 상태(belief state)**라고 부른다.

연구진은 HMM이 생성한 토큰 열을 LLM에 프롬프트로 주고, 모델의 잔차 스트림(각 층을 관통하며 정보가 흘러가는 내부 통로) 활성값에서 이 믿음 상태를 선형 프로브로 복원할 수 있는지 검사했다.

항목내용
대상 모델오픈소스 LLM 6종
대상 HMM자명하지 않은 믿음 구조를 갖도록 고른 40개
프로브 결정계수(R²) 최고치0.83 ~ 0.99
나타난 층초기 층부터 후기 층까지

결정계수 0.83에서 0.99는 상당히 높은 수치다. 모델 내부 어딘가에 베이즈 계산 결과와 거의 일치하는 방향이 선형으로 존재한다는 뜻이다.

상관이 아니라 기능이라는 증거

여기서 흔한 반론이 나온다. 프로브로 무언가를 읽어낼 수 있다는 게, 모델이 그것을 실제로 쓴다는 뜻은 아니지 않냐는 것이다. 활성값에는 온갖 정보가 섞여 있고, 프로브가 우연히 상관된 축을 찾았을 수도 있다.

연구진은 이 반론을 개입 실험으로 막았다. 프로브가 찾아낸 부분공간에 직접 패칭(다른 입력에서 온 값으로 갈아 끼우기)과 스티어링(특정 방향으로 밀기)을 가했다. 만약 이 부분공간이 장식이라면 출력이 망가지거나 아무 일도 일어나지 않아야 한다. 결과는 예측 품질이 손대지 않은 모델과 비슷한 수준으로 유지된 반면, 대조군은 성능이 크게 무너졌다. 그 방향이 실제로 예측에 쓰이고 있다는 것이다.

그래서 진짜 의미하는 것

이 결과를 "LLM이 사실은 베이즈 추론기였다"로 요약하고 싶어지지만, 그것은 과장이다. 세 가지를 구분해야 한다.

첫째, 실험 환경은 HMM이다. 정답을 알 수 있다는 장점의 대가로, 실제 언어 과제와는 거리가 있다. 모델이 소설이나 파이썬 코드를 읽을 때도 똑같은 구조를 만드는지는 이 논문이 증명하지 않았다.

둘째, "근사한다"와 "이다"는 다르다. 논문의 표현은 ICL이 맥락에서 추론한 생성 모델 위에서 베이즈 최적 예측에 근사한다는 것이다. 모델이 내부에서 베이즈 정리를 실행한다는 주장이 아니라, 결과적으로 그와 비슷한 표현 구조가 나타난다는 주장이다.

셋째, 그럼에도 방향은 의미가 있다. 기존에는 HMM 데이터로 직접 학습시킨 장난감 신경망에서나 보이던 현상이었다. 이 연구는 그것이 일반 텍스트로 사전학습된 상용 규모 오픈소스 모델에서도 나타난다는 것을 보였다. 입력 분포의 구조가 활성 공간의 기하로 이어진다는 가설이 규모를 타고 살아남은 셈이다.

마무리

실무적으로 당장 바뀌는 것은 없다. 다만 이런 연구가 쌓이면 "모델이 헷갈리고 있다"를 출력의 말투가 아니라 내부 표현에서 읽어내는 길이 열린다. 불확실성 추정이나 할루시네이션 탐지가 프롬프트 기교가 아니라 계측의 문제로 옮겨가는 그림이다. 아직은 통제된 환경에서의 결과라는 점을 기억하면서 지켜볼 만하다.

출처

Daniel Balcells, Andrew Jun Lee, Chirag Rastogi 외, "Large Language Models Develop Belief State Geometry In-Context", arXiv:2609.17376v1, 2026년 9월 15일. https://arxiv.org/abs/2609.17376v1