📄 SWE-bench 리더보드, 상위권 순위는 왜 의미가 없나
새 코딩 에이전트가 나올 때마다 "SWE-bench 몇 퍼센트"라는 숫자가 따라붙는다. 79.2% 대 78.8% 같은 차이를 두고 어느 쪽이 더 낫다는 이야기가 오간다. 그런데 이 0.4%p는 정말 두 시스템의 실력 차이일까, 아니면 그냥 노이즈일까. 2026년 9월 15일 arXiv에 올라온 한 감사 연구는 이 질문에 꽤 불편한 답을 내놓는다.
무엇을 했는가
연구진은 모델을 새로 돌리지 않았다. 대신 네 개 분할에 걸쳐 이미 공개된 SWE-bench 제출 기록 254건을 가져와, 어떤 문제를 맞히고 틀렸는지 인스턴스 단위로 뜯어봤다. 리더보드가 보여주는 총점 하나가 아니라, 그 총점을 만든 500개의 개별 판정을 직접 본 것이다.
| 관측 항목 | 수치 |
|---|---|
| Verified 1·2위 해결 문제 수 | 각각 500개 중 396개 |
| 상위 10개가 공유하는 성공 | 285개 |
| 상위 10개가 공유하는 실패 | 51개 |
| 실제로 결과가 갈리는 문제 | 164개 |
| 상위 30개의 점수 폭 | 8.8%p |
| 같은 모델, 다른 스캐폴드의 점수 폭 | 최대 29.8%p |
가장 인상적인 숫자는 마지막 두 줄이다. 상위 30개 시스템 전체가 8.8%p 안에 몰려 있는데, 똑같은 모델을 어떤 스캐폴드(에이전트를 감싸는 실행 루프와 도구, 프롬프트 구조)에 올리느냐에 따라 점수는 최대 29.8%p까지 움직였다. 순위표에서 읽히는 차이보다, 그 모델을 어떻게 감쌌느냐가 세 배 이상 큰 변수라는 뜻이다.
통계적으로는 어떻게 되나
연구진은 인접한 순위 쌍끼리 짝지은 맥니마(McNemar) 검정을 돌렸다. 같은 문제 집합에 대해 두 시스템의 성공과 실패 패턴이 우연으로 설명되지 않을 만큼 다른지를 보는 검정이다. 결과는 Verified 상위 30위의 인접 쌍 29개 중 유의수준 0.05에서 구분되는 쌍이 하나도 없었다. 더 큰 Test 분할에서는 23쌍 중 14쌍이 구분됐는데, 이는 문제 수가 많아지면 판별력이 생긴다는 뜻이기도 하다.
프런티어 시스템들의 해결 집합은 중첩도 중앙값 0.935를 기록했다. 점수만 보고 기대할 수 있는 값이 0.774인데 실제로는 훨씬 높다. 상위권 시스템들이 서로 다른 문제를 푸는 게 아니라, 거의 같은 문제를 풀고 거의 같은 문제에서 실패하고 있다는 의미다.
그래서 진짜 의미하는 것
여기서 조심해야 할 지점이 두 가지 있다.
첫째, "구분되지 않았다"는 "같다"가 아니다. 논문도 이 점을 분명히 한다. 통계적으로 유의하지 않다는 것은 동등하다는 증명이 아니라, 판별할 데이터가 부족하다는 신호다. 1위와 10위의 실력이 똑같다는 주장이 아니라, 500문제로는 그 차이를 확인할 수 없다는 주장이다.
둘째, 이 연구는 관측 연구지 인과 실험이 아니다. 아홉 개 셀평균 상호작용 검정 중 여섯 개가 홀름 보정 후에도 유의했지만, 저자들 스스로 이 설계로는 스캐폴드의 인과 효과를 식별할 수 없다고 적어뒀다. "스캐폴드를 바꾸면 29.8%p 오른다"가 아니라 "관측된 범위가 그만큼 넓었다"가 정확한 표현이다.
그럼에도 실무에 주는 함의는 분명하다. 모델을 고르려고 리더보드 상위권의 소수점을 비교하는 일은, 지금 시점에서는 측정 오차를 비교하는 일에 가깝다. 차라리 시스템마다 결과가 갈리는 164개 영역에서 어떤지를 보는 편이 낫고, 그보다 더 중요한 건 어떤 스캐폴드를 쓸 것인가다.
마무리
저자들은 총점 하나로 줄 세우는 대신 비교 집합별 해결률과 모델-스캐폴드 출처를 함께 보고하자고 제안하고, 다섯 단계 감사 프로토콜과 분할 데이터를 공개했다. 벤치마크가 포화되면 숫자가 아니라 숫자를 읽는 방법이 바뀌어야 한다는 이야기다. 코딩 에이전트를 도입하려는 팀이라면, 리더보드 순위보다 자사 코드베이스에서의 파일럿 결과를 먼저 보는 쪽이 여전히 안전하다.
출처
Fengshuo Liu, Ying Liu, Ruize Sun 외, "Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead", arXiv:2609.17394v1, 2026년 9월 15일. https://arxiv.org/abs/2609.17394v1