💸 RTX 5090 한 대로 2B 모델 학습, 비용은 950만원
언어모델을 밑바닥부터 학습시킨다는 것은 오랫동안 빅테크의 영역이었다. 모델을 가져다 파인튜닝하는 것과, 맨밑바닥에서 사전학습을 돌리는 것 사이에는 수백 배의 비용 격차가 있었기 때문이다.
칭화대 PACMAN 연구팀이 8월 27일 arXiv에 공개한 Puro-2B는 그 격차를 정면으로 공격한다. 이들은 데이터센터용 H100이 아니라 게이밍 GPU인 RTX 5090으로 최대 1.4조 토큰을 학습시켜, Qwen2.5-1.5B에 근접한 2B 모델을 6,900달러(약 950만 원) 미만에 만들었다고 보고했다.
150만 달러에서 950만 원으로
논문이 제시한 비교군을 보면 이 숫자의 의미가 선명해진다.
| 모델 | 학습 비용 |
|---|---|
| Llama-3.2-3B | 150만 달러 이상 |
| SmolLM3-3B 재현 | 70만 달러 이상 |
| Puro-2B (최종) | 6,900달러 미만 |
약 200배의 차이다. 물론 파라미터 규모가 다르기 때문에 일대일 비교는 아니지만, 개인 연구자나 소규모 팀이 접근할 수 있는 금액대로 내려왔다는 점은 분명하다.
비용을 줄인 다섯 가지 선택
저자들은 단일 기술이 아니라 다섯 가지를 겹친 결과라고 설명한다.
- 하드웨어 선택 — H100 대신 RTX 5090. 연산 단가 기준으로 게이밍 GPU가 훨씬 저렴하다.
- 저정밀도 학습 — FP8을 써 메모리와 연산을 동시에 줄였다.
- hyperball 최적화 — 파라미터 업데이트를 안정화해 낮은 정밀도에서도 학습이 깨지지 않게 한다.
- 커리큘럼 모델 평균화 — 학습 단계별 체크포인트를 평균 내어 추가 학습 없이 성능을 끌어올린다.
- 데이터 레시피 — 어떤 데이터를 어떤 순서로 먹일지의 설계. 주목할 점은 이 다섯 개 중 어느 것도 새로 발명된 기술이 아니라는 것이다. 이미 알려진 기법들을 비용이라는 단일 목표로 정렬했을 때 어디까지 가는가를 보여준 작업에 가깝다.
Puro Cost Scaling Law
논문의 두 번째 기여는 단일 모델이 아니라 공식이다. 저자들은 토큰 예산과 레시피 변형을 달리한 여러 Puro-2B 모델을 학습시킨 뒤, 학습 비용과 평균 성능을 잇는 경험적 관계를 도출했다.
이 법칙에 따르면 약 4,400달러 — 논문 제목이 말하는 5,090달러 아래 — 면 Qwen2-1.5B 수준에 도달한다. 제목의 $5090이 GPU 이름과 예산을 동시에 가리키는 말장난이다.
그래서 진짜 500만 원으로 LLM을 만드는가
여기서 범위를 정확히 잡을 필요가 있다. 이 숫자는 어떤 의미에서 진실이고, 어떤 의미에서 오해를 불러오기 쉽다.
진실인 부분
-
사전학습 자체의 진입 장벽이 확실히 낮아졌다
-
데이터·코드·가중치가 모두 Apache 2.0으로 공개돼 검증과 재현이 가능하다
-
프리트레이닝 데이터 커리큘럼이 사후학습 성능에 어떻게 이어지는지를 전 과정 접근권으로 분석했다 붙여야 할 단서
-
도달 성능은 Qwen2.5-1.5B 근처다. GPT급이나 최신 상용 모델과는 자리수가 다른 급수다.
-
6,900달러는 논문이 정의한 연산 비용이다. GPU 구입비, 전기요금, 장비 수명, 무엇보다 연구자의 시간은 이 숫자에 들어 있지 않다.
-
사전학습만 끝난 모델은 바로 쓸 수 없다. 지시따르기 튜닝과 정렬은 별도 비용이다.
-
데이터 확보와 전처리는 여전히 가장 큰 실무 병목이다. 즉 「500만 원으로 나만의 ChatGPT를 만든다」는 아니다. 정확히는 「500만 원으로 1.5B급 베이스 모델을 내 손으로 만들 수 있다」에 가깝다.
이 연구가 진짜로 바꾸는 것
그럼에도 이 논문이 중요한 이유는 따로 있다. 지금까지 오픈소스 진영의 공개는 대부분 가중치 공개에 멈발렀다. 모델은 받을 수 있지만, 그 모델이 어떤 데이터를 어떤 순서로 보고 만들어졌는지는 블랙박스였다.
Puro-2B는 학습 파이프라인 전체를 공개함으로써 「프리트레이닝 단계의 선택이 사후학습 결과를 어떻게 바꾸는가」 같은 통제된 실험을 대학 연구실 예산에서 가능하게 만든다. 모델 하나보다 이쪽이 더 긴 수명을 가질 기여일 가능성이 높다.
국내 관점에서도 의미가 있다. 한국어 특화 소형 모델이나 특정 도메인 전용 모델을 만들려는 팀에게, 수십억 예산 없이도 시도해볼 수 있는 실제로 검증된 레시피가 생겼다는 뜻이기 때문이다.
출처: Kairong Luo et al., Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090, arXiv:2608.27370 (2026-08-27)
모델·코드: Hugging Face thu-pacman/puro-2b (Apache 2.0)