모델 연구
hLLM: Single Pass Decoding for Generative Reranking
ARarXiv
LLM 기반 순위 매기기는 높은 품질을 보이지만, 토큰 단위의 순차적 디코딩 과정 때문에 속도 문제가 있었습니다.
세 줄 요약
- 연구진은 hLLM(Hungarian LLM)이라는 새로운 전략을 제시하여, 점수 행렬 전체를 한 번에 읽고 헝가리안 알고리즘으로 최적의 순열을 찾아내 추론 속도를 최대 64배 향상시켰습니다.
- 이 기술은 생성형 순위 매기기를 조합 최적화 문제와 연결하며, 실시간 고성능 추천 시스템 구현에 새로운 가능성을 열어주었다는 점에서 큰 의미가 있습니다.
- hLLM의 높은 성능을 위해서는 LoRA 기반 미세 조정과 교사 순위 증류(teacher ranking distillation) 같은 특화된 훈련 기법이 결합되어야 합니다.
LLM 기반 순위 매기기는 높은 품질을 보이지만, 토큰 단위의 순차적 디코딩 과정 때문에 속도 문제가 있었습니다.