아카이브
AI 논문

📄 AI 코딩 대회, 국제올림피아드 인간 최고점을 넘다

2026년 9월 4일 · 09:00 발행LLM벤치마크추론

국제정보올림피아드(IOI)는 고등학생 프로그래머들이 겨루는 세계 최고 수준의 알고리즘 대회다. 출제된 문제를 제한 시간 안에 풀어야 하고, 참가자 상위 약 8%만 금메달을 받는다. 한국에서도 매년 대표팀이 나가고, 여기서 메달을 딴 이력은 그 자체로 실력의 증명서로 통한다. 그런데 9월 2일 arXiv에 올라온 한 논문은, 언어 모델이 이 대회에서 그해 인간 참가자 최고 점수를 넘겼다고 보고한다.

무엇을 했고, 점수는 얼마였나

연구진이 만든 것은 새로운 모델 구조가 아니라 후속 학습(post-training) 파이프라인이다. 이미 있는 언어 모델을 프로그래밍 경진대회라는 좁은 목표에 맞춰 다시 훈련시키는 절차를 통째로 설계했다. 결과물은 크기가 다른 두 모델, Nano-CC와 Ultra-CC다.

대회모델점수비교 기준
IOI 2025Nano-CC468금메달 커트라인 438.3
IOI 2025Ultra-CC502금메달 커트라인 438.3
IOI 2026Ultra-CC535.4 / 600인간 최고 점수 498.27

작은 쪽인 Nano-CC부터 이미 금메달 기준을 넘겼고, Ultra-CC는 IOI 2026에서 600점 만점에 535.4점을 받아 그해 인간 참가자 중 1등이 받은 498.27점보다 높았다. 금메달 커트라인은 큰 격차로 넘어섰다.

어떻게 만들었나

핵심은 두 가지다. 첫째, 데이터다. 연구진은 경진대회 유형의 문제 2만 2천 개를 엄선해 지도학습(정답 풀이를 보고 따라 배우는 방식)과 강화학습(스스로 풀고 채점 결과로 배우는 방식)을 차례로 적용했다. 프로그래밍 대회 문제는 채점기가 명확하기 때문에 강화학습의 보상 신호를 만들기 쉽다는 이점이 있다.

둘째, GenCorrect라는 테스트 시점(test-time) 전략이다. 모델이 답 하나를 내고 끝내는 대신, 여러 개의 후보 풀이를 만들고 스스로 검토해 고치는 절차를 거친다. 사람 참가자가 제출 전에 자기 코드를 다시 훑어보는 과정과 비슷하다. 학습이 끝난 뒤에도 추론에 계산을 더 쓰면 점수가 올라간다는 최근 흐름 위에 놓인 기법이다.

그래서 진짜 의미하는 것

여기서 오해하기 쉬운 지점이 있다. "AI가 인간 프로그래머를 넘어섰다"는 문장은 이 결과가 뒷받침하는 것보다 훨씬 넓은 의미를 갖는다.

IOI 문제는 개발 업무 중에서도 가장 특수한 형태다. 문제가 완결된 명세로 주어지고, 정답 여부를 기계가 즉시 판정하며, 코드는 몇백 줄을 넘지 않고, 남이 읽을 필요도 유지보수할 필요도 없다. 즉 채점 가능한 목표가 완벽하게 정의된 환경이다. 강화학습이 가장 잘 먹히는 조건이 바로 이것이며, 그래서 이 결과는 "모델이 똑똑해졌다"라기보다 "이 조건에서는 후속 학습을 이만큼 밀어붙일 수 있다"에 가깝다.

실무 소프트웨어 개발은 정반대에 가깝다. 요구사항 자체가 모호하고, 무엇이 정답인지 사람들끼리도 합의가 안 되며, 기존 코드베이스의 맥락을 읽어야 하고, 3년 뒤 남이 고칠 수 있게 써야 한다. 이 논문의 성적은 그 능력에 대해 거의 아무 말도 하지 않는다.

그럼에도 이 결과가 중요한 이유는 따로 있다. 첫째, 파이프라인이 공개되었다는 점이다. 특정 회사의 비공개 모델이 세운 기록이 아니라 데이터 구성과 학습 절차가 서술된 논문이다. 둘째, 대회 성적이라는 측정자의 수명이 거의 다했다는 신호다. IOI 점수로는 이제 모델 사이의 차이를 가늠하기 어려워졌고, 업계는 다음 기준을 찾아야 한다. 벤치마크가 포화되면 그다음 질문은 늘 "그래서 실제로 쓸모가 있느냐"로 옮겨간다.

마무리

경진대회 프로그래밍은 오랫동안 AI 능력 측정의 대표 종목이었다. 그 종목이 이번에 사실상 정복되었다. 다만 정복된 것은 종목이지 프로그래밍 자체가 아니다. 이 구분을 놓치면, 앞으로 나올 "AI가 개발자를 대체한다"류의 기사에서 무엇이 과장이고 무엇이 사실인지 가려내기 어려워진다.

출처: Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi 외 2인, "Post-Training Language Models for Gold-Medal Performance in Coding Competitions", arXiv:2609.02849, 2026년 9월 2일.