RAG 시스템, 성능과 자원 효율성 사이의 균형점 찾기
Balancing Reasoning and Hardware Constraints in RAG Pipelines for Ukrainian Multi-Domain Document Understanding
arXiv우크라이나 다국어 문서 이해 과제에서, 스캔된 문서를 처리하는 OCR 과정이 전체 시간의 대부분을 차지하며 시스템 운영에 심각한 병목 현상을 초래했습니다.
- 연구진은 자원 소모가 큰 추론 모델 대신, BM25 및 BGE-M3 등을 활용한 리소스 효율적인 하이브리드 RAG 파이프라인을 구축하여 안정성을 최우선했습니다.
- 이 사례는 대규모 언어 모델(LLM)을 실제 운영 환경에 적용할 때, 이론적 최고 성능보다 '시스템 안정성'과 '자원 효율성'이 더 중요한 고려 사항임을 보여줍니다.
- 다만, 이 결과는 엄격한 시간제한과 T4 GPU 같은 특정 하드웨어 환경에서 최적화되었으므로, 일반적인 상황에 적용하기 전 성능 검토가 필요합니다.
본 논문은 우크라이나 다국어 문서 이해 과제(UNLP 2026 Shared Task)에 제출된 시스템을 설명합니다. 이 과제는 엄격한 9시간 오프라인 Kaggle 실행 제한 내에서 다양한 우크라이나 PDF 문서로부터 정밀한 답변과 메타데이터를 추출하는 것을 목표로 했습니다. 평가 과정 중 스캔 문서를 처리하는 OCR 단계가 심각한 병목 현상을 일으켰는데, 이는 순차적 단일 스레드 실행으로 인해 전체 시간 예산의 5~7시간을 소모했습니다.
이러한 자원 제약은 (LLM) 추론에 할당할 수 있는 시간을 약 2시간으로 제한하는 결과를 초래했습니다. 시스템 안정성을 확보하기 위해 연구진은 BM25, BGE-M3, 그리고 Cross-Encoder 재순위 지정 기능을 활용한 리소스 효율적인 하이브리드 파이프라인을 구축했습니다.
가 무거운 (예: DeepSeek R1)을 사용하는 대신, 시스템의 안정성을 최우선으로 두고 4비트 된 LapaLLM 12B 모델을 이중 NVIDIA T4 환경에서 활용했습니다. 이러한 접근 방식은 복잡한 다단계 추론보다는 파이프라인 자체의 완성도를 높이는 데 중점을 두었으며, 그 결과 Private Score 0.8을 달성했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- RAG
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 추론 모델
- 답하기 전에 단계별로 생각하는 과정을 거치도록 만든 모델.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.