아카이브
AI 논문

📄 AI 벤치마크 오염, 22개 모델 감사로 드러난 암기의 실체

2026년 9월 8일 · 09:00 발행벤치마크LLM

AI가 벤치마크에서 90점을 받았다는 말의 함정

새 모델이 나올 때마다 "벤치마크 최고 점수"라는 문장을 본다. 그런데 그 문제의 정답이 이미 인터넷 어딘가의 논문 표에 실려 있었다면 어떨까. 모델이 문제를 풀어서 맞힌 것인지, 아니면 예전에 읽은 숫자를 그대로 떠올린 것인지 점수만으로는 알 길이 없다. 2026년 9월 4일 arXiv에 공개된 「Molecular Déjà Vu」는 정확히 이 구분을 파고든 연구다.

무엇을 했는가

연구진은 22개 프런티어 언어모델을 12개 분자 물성 회귀 벤치마크에 올려놓고, 정확도가 아니라 축어적 검색(verbatim retrieval) 여부를 감사했다. 축어적 검색이란 모델이 물성값을 추정하는 대신, 이미 발표된 숫자를 자릿수 단위로 그대로 재현해내는 현상을 말한다.

항목결과
감사한 모델22개 프런티어 모델
감사한 벤치마크12개 회귀 데이터셋
모델 절반 이상에서 검색이 확인된 데이터셋5개
추론 수준을 높였을 때 검색 판정 증가폭89%

여기서 중요한 것은 결론이 "전부 다 오염됐다"가 아니라는 점이다. 5개 데이터셋에서는 절반이 넘는 모델이 축어적 검색을 보였지만, 나머지 데이터셋에서는 산발적인 몇몇 항목에서만 나타났다. 오염은 광범위하되 벤치마크에 따라 심하게 갈린다.

추론을 더 시켰더니 검색이 늘어났다

가장 눈에 띄는 결과는 추론 수준에 관한 것이다. 같은 분자, 같은 프롬프트로 실험했는데도 추론 수준이 높은 설정에서 검색으로 판정된 사례가 가장 낮은 설정보다 89% 더 많았다. 흔히 "생각을 더 오래 시키면 더 정직하게 풀 것"이라고 기대하지만, 적어도 이 실험에서는 방향이 반대였다. 더 오래 따져보는 설정이 기억 속의 숫자를 끄집어내는 경로를 오히려 더 잘 찾아냈다고 볼 수 있다.

연구진은 오염이 가장 심한 사례에서 검색을 끊어보는 시도도 했다. 분자를 텍스트로 적는 표기법인 SMILES 문자열을 변형해, 원래 논문의 표와 겉모습을 다르게 만든 것이다. 그런데 가장 강한 모델들은 변형된 SMILES와 원래 라벨의 조합을 여전히 알아보는 경우가 있었다.

그래서 진짜 의미하는 것

여기서 성급하게 "LLM의 과학 능력은 결국 암기였다"로 건너뛰면 논문을 오독하는 것이다. 검색을 억제했을 때 벌어진 일이 오히려 흥미롭다. 검색을 누르자 서로 다른 모델들의 예측 오차가 상대적으로 서로 가까워졌고, 반대로 각 모델이 축어적 검색을 제각기 다르게 쓰는 상태에서는 모델 간 격차가 벌어졌다. 우리가 리더보드에서 보는 '모델 간 실력 차이'의 상당 부분이 실력 차이가 아니라 암기량 차이일 수 있다는 뜻이다.

동시에 논문은 LLM의 일반적인 예측 능력이 암기한 값의 양만으로 결정되지는 않는다고 분명히 못 박는다. 암기를 걷어내도 예측 능력은 남는다. 이 두 문장을 함께 읽어야 이 연구를 제대로 이해한 것이다.

실무자에게 남는 교훈은 세 가지다. 첫째, 공개 벤치마크 점수만으로 모델을 고르는 것은 위험하다. 특히 학술 논문에 정답값이 표로 실려 있는 도메인일수록 그렇다. 둘째, 자체 평가셋을 만들 때는 인터넷에 공개된 적 없는 데이터를 일부라도 섞어야 한다. 셋째, "추론 모드를 켜면 더 믿을 만하다"는 가정은 영역에 따라 재검토가 필요하다.

한계도 짚어두자. 이 연구는 분자 물성 회귀라는 특정 영역을 다뤘고, 결과를 코딩이나 일반 상식 벤치마크에 그대로 옮길 수는 없다. 축어적 검색을 판정하는 기준 자체도 완벽한 탐지기는 아니며, 논문은 오염의 양과 깊이에 대한 개관을 제공하는 데 목적을 둔다.

마무리

벤치마크는 원래 모델을 재는 자였는데, 이제 그 자가 모델의 학습 데이터 안으로 들어가 버렸다. 이 논문은 그 뒤엉킴을 정면으로 측정한 사례다. 다음에 "역대 최고 점수"라는 문구를 볼 때, 그 점수가 무엇을 재고 있는지 한 번쯤 되물어볼 만하다.

출처: Matthias Busch, Marius Tacke, Sviatlana V. Lamaka 외, 「Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models」, arXiv:2609.05381, 2026년 9월 4일.