이질적 배치를 활용한 반복형 검색 성능 개선 기술 — AI 생성 일러스트AI 일러스트
리서치 연구

이질적 배치를 활용한 반복형 검색 성능 개선 기술

Efficient Iterative Retrieval with Heterogeneous Batching

arXiv9월 23일 발표 · 3분 · 심사 전 논문

최신 검색 시스템은 임베딩과 생성 모델을 함께 사용하지만, 기존 서비스는 이들을 분리 운영하여 GPU 자원 활용도가 낮고 비효율적이었습니다.

세 줄 요약arXiv 원문 기반
  1. 새로운 추론 서비스 'Orthrus'가 개발되어 이질적인 워크로드를 하나의 통합 루프에서 배치 처리하며, 최대 4.52배의 높은 처리량 향상을 입증했습니다.
  2. 이는 AI 기반 검색 시스템이 GPU 자원을 효율적으로 활용하고 동적 변화에 대응하게 함으로써 상용 서비스 성능을 크게 끌어올릴 수 있음을 의미합니다.
  3. 제시된 성능은 A100 GPU 4개와 특정 반복형 RAG 벤치마크를 기준으로 측정되었으므로, 실제 환경 적용 시 추가 검토가 필요합니다.

최신 정보 검색 시스템은 복잡한 질의 처리를 위해 모델과 생성 모델을 모두 사용하고 있습니다. 그러나 기존 서비스들은 이 두 가지 모델을 분리하여 운영하는 경향이 있어, 자원 활용도가 낮고 처리량(throughput) 측면에서 비효율적이라는 문제가 있었습니다. 특정 작업에만 GPU를 할당하는 거친 파티셔닝 방식은 동적인 워크로드를 수용하기 어려워 계산상의 병목 현상을 초래했습니다.

이러한 문제를 해결하기 위해 'Orthrus'라는 추론 서비스 시스템이 개발되었습니다. Orthrus는 이질적인 배치 처리(heterogeneous batching)를 단일 통합 추론 루프 내에서 수행합니다. 특히, 상충되는 계산 패턴을 가진 임베딩 및 생성 워크로드를 하나로 통합하고 높은 성능을 위해 배치 구성을 최적화하는 것이 핵심 과제였습니다. Orthrus는 증분 풀링(incremental pooling)을 사용한 청크 임베딩과 워크로드 인식 방식의 배치 조정을 통해 이 문제를 해결합니다.

A100 GPU 4개를 이용한 평가 결과, Orthrus가 기준선 배포 대비 제어된 워크로드에서 최대 1.28배에서 4.52배까지 높은 처리량 향상을 달성했습니다. 또한 반복형 (Retrieval-Augmented Generation) 에서는 종단 간 p99 지연 시간(end-to-end p99 latency)을 최대 55.8%까지 낮추는 성능을 입증했습니다.

용어 풀이

임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
RAG
답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Efficient Iterative Retrieval with Heterogeneous Batching같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기