이질적 배치를 활용한 반복형 검색 성능 개선 기술
Efficient Iterative Retrieval with Heterogeneous Batching
arXiv최신 검색 시스템은 임베딩과 생성 모델을 함께 사용하지만, 기존 서비스는 이들을 분리 운영하여 GPU 자원 활용도가 낮고 비효율적이었습니다.
- 새로운 추론 서비스 'Orthrus'가 개발되어 이질적인 워크로드를 하나의 통합 루프에서 배치 처리하며, 최대 4.52배의 높은 처리량 향상을 입증했습니다.
- 이는 AI 기반 검색 시스템이 GPU 자원을 효율적으로 활용하고 동적 변화에 대응하게 함으로써 상용 서비스 성능을 크게 끌어올릴 수 있음을 의미합니다.
- 제시된 성능은 A100 GPU 4개와 특정 반복형 RAG 벤치마크를 기준으로 측정되었으므로, 실제 환경 적용 시 추가 검토가 필요합니다.
최신 정보 검색 시스템은 복잡한 질의 처리를 위해 모델과 생성 모델을 모두 사용하고 있습니다. 그러나 기존 서비스들은 이 두 가지 모델을 분리하여 운영하는 경향이 있어, 자원 활용도가 낮고 처리량(throughput) 측면에서 비효율적이라는 문제가 있었습니다. 특정 작업에만 GPU를 할당하는 거친 파티셔닝 방식은 동적인 워크로드를 수용하기 어려워 계산상의 병목 현상을 초래했습니다.
이러한 문제를 해결하기 위해 'Orthrus'라는 추론 서비스 시스템이 개발되었습니다. Orthrus는 이질적인 배치 처리(heterogeneous batching)를 단일 통합 추론 루프 내에서 수행합니다. 특히, 상충되는 계산 패턴을 가진 임베딩 및 생성 워크로드를 하나로 통합하고 높은 성능을 위해 배치 구성을 최적화하는 것이 핵심 과제였습니다. Orthrus는 증분 풀링(incremental pooling)을 사용한 청크 임베딩과 워크로드 인식 방식의 배치 조정을 통해 이 문제를 해결합니다.
A100 GPU 4개를 이용한 평가 결과, Orthrus가 기준선 배포 대비 제어된 워크로드에서 최대 1.28배에서 4.52배까지 높은 처리량 향상을 달성했습니다. 또한 반복형 (Retrieval-Augmented Generation) 에서는 종단 간 p99 지연 시간(end-to-end p99 latency)을 최대 55.8%까지 낮추는 성능을 입증했습니다.
용어 풀이
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
- RAG
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.