📄 RAG 안전성, 사내 문서 붙이면 오히려 위험해지는 이유
사내 문서를 LLM에 붙이는 일은 이제 기업 AI 도입의 기본값에 가깝다. 규정집, 매뉴얼, 과거 상담 이력을 검색해서 답변 근거로 넣어주는 RAG(Retrieval-Augmented Generation, 검색 증강 생성) 구조다. 도입 명분도 분명하다. 모델이 지어내는 말을 줄이고, 우리 회사 사정에 맞는 답을 하게 만든다는 것.
그런데 여기에는 거의 검증되지 않은 채 통용되는 전제가 하나 깔려 있다. "베이스 모델에 안전 정렬이 되어 있으니, 문서를 붙여도 안전은 그대로 유지된다"는 믿음이다. 9월 10일 arXiv에 공개된 RAG-Safety-Bench는 이 전제를 정면으로 시험했고, 결과는 그리 편안하지 않다.
무엇을 했는가
기존 연구도 "RAG가 안전성을 떨어뜨릴 수 있다"는 관찰은 내놓았다. 문제는 원인을 특정할 수 없었다는 점이다. 검색기가 엉뚱한 문서를 물어온 탓인지, 문서 내용 자체가 문제인지, 아니면 문서를 붙이는 행위 자체가 모델의 거부 판단을 흔드는 것인지 구분이 안 됐다.
이 벤치마크의 설계는 그 교란 요인을 걷어내는 데 초점이 있다. 검색기 품질을 변수에서 빼고, 유해한 요청에 대해 네 가지 조건을 인위적으로 만들어 비교했다.
| 조건 | 모델에 주어지는 것 |
|---|---|
| 비RAG | 문서 없이 요청만 |
| 오라클 문서 | 유해 요청의 답이 실제로 담긴 문서 |
| 관련 문서 | 주제는 관련되지만 구체적 답은 없는 문서 |
| 무관한 안전 문서 | 요청과 상관없는 무해한 문서 |
오픈소스 LLM 5종에 이 네 조건을 그대로 통과시켜, 어느 지점에서 안전성이 무너지는지를 분리해냈다.
결과에서 눈에 띄는 세 가지
첫째, 유능함과 위험함이 같이 간다. 일반적인(무해한) 과제 성능이 좋은 모델일수록 유해 요청에도 더 잘 응답하는 역상관이 나타났다. 능력과 안전을 별개 축으로 보고 "성능 좋은 모델을 고르면 된다"고 접근하는 방식이 그대로 통하지 않는다는 뜻이다.
둘째, 베이스 모델의 가드레일이 파이프라인의 안전을 보장하지 않는다. 이것이 이 논문의 핵심 메시지다. 모델 단독으로 측정한 안전 점수는 그 모델을 RAG에 넣었을 때의 안전성을 예측해주지 못했다.
셋째, 무해한 문서만 붙여도 안전하지 않은 출력이 나올 수 있다. 요청과 무관한 안전한 문서를 넣은 조건에서도 일부 모델에서 유해 출력이 관찰됐다. 즉 "나쁜 문서가 들어왔을 때만 위험하다"는 직관이 틀렸다. 선행 연구가 제기했던 이 현상을, 이번 벤치마크는 모델별로 구분해 재확인했다.
그래서 진짜 의미하는 것
과장하지 말아야 할 부분부터 짚자. 이 연구는 RAG를 쓰면 안 된다고 말하지 않는다. 환각 감소라는 RAG의 효용은 그대로다. 실험 대상도 오픈소스 LLM 5종이고, 상용 API 모델에서 같은 패턴이 나온다는 보장은 없다. 조건 역시 연구용으로 통제된 설정이라, 실제 사내 RAG처럼 검색기가 엉성하게 섞인 환경과는 다르다.
그럼에도 실무자가 가져가야 할 교훈은 분명하다.
안전성 평가는 모델 단위가 아니라 파이프라인 단위로 해야 한다. 모델 카드에 적힌 안전 벤치마크 점수는 그 모델을 단독으로 썼을 때의 숫자다. 검색기, 문서 저장소, 프롬프트 템플릿을 다 붙인 뒤의 시스템은 별개의 물건이며, 다시 측정해야 한다. 특히 문서 저장소 내용이 바뀔 때마다 그 시스템은 사실상 새 시스템이 된다.
"내부 문서는 안전하니 괜찮다"는 가정을 버려야 한다. 세 번째 결과가 정확히 그 가정을 겨눈다. 문서 자체에 문제가 없어도, 문서가 붙었다는 사실만으로 모델의 거부 행동이 약해질 수 있다. 사내 위키처럼 무해한 내용만 담긴 저장소라도 안전 테스트 면제 대상이 아니다.
모델 선택 기준에 안전 항목을 따로 세워야 한다. 벤치마크 점수만 보고 가장 똑똑한 오픈소스 모델을 고르는 관행은, 이 논문 기준으로는 위험을 함께 고르는 선택일 수 있다. 최소한 성능과 안전을 두 축으로 놓고 비교해야 한다.
마무리
RAG는 환각이라는 문제를 겨냥해 만들어진 구조다. 이 논문이 보여주는 건, 그 해법이 다른 쪽에 비용을 전가할 수 있다는 사실이다. 벤치마크 자체는 유해 요청을 다루는 연구용 도구이지만, 거기서 나오는 실무 질문은 단순하다. 우리 회사 RAG 시스템은 문서를 붙인 상태로 안전성을 측정해본 적이 있는가. 대부분의 조직에서 답은 아직 "아니오"일 것이다.
출처
Adithiyan Rajan Indira Saravanan, Kathleen C. Fraser, "RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety", arXiv:2609.11758, 2026년 9월 10일. https://arxiv.org/abs/2609.11758v1