하나의 프롬프트로 여러 질문에 답하는 효율적인 LLM 추론 기법 — AI 생성 일러스트AI 일러스트
리서치 연구

하나의 프롬프트로 여러 질문에 답하는 효율적인 LLM 추론 기법

Intra-Prompt Parallel Decoding for Common-Context Question Answering

arXiv9월 9일 발표 · 3분 · 심사 전 논문

공통 컨텍스트 기반 질의응답(CCQA)에서 발생하는 병목 현상을 해결하기 위해, 하나의 프롬프트 내에서 여러 질문을 동시에 처리하는 새로운 추론 기법 'IPPD'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. IPPD는 메모리와 계산 과정을 효율적으로 공유하며, 모든 질문의 다음 토큰 생성을 단일 단계에서 병렬로 처리하여 GPU 자원 활용도를 극대화합니다.
  2. 이 기술은 기존 방식 대비 품질 저하 없이 최대 7배에 달하는 높은 처리 속도를 제공하며, 현존하는 최적화 기법보다 뛰어난 성능을 입증했습니다.
  3. IPPD는 모델 구조 변경이나 추가 학습이 필요 없으며, 각 프롬프트가 다른 컨텍스트를 가질 때도 배치 추론과 완벽하게 호환되는 실용적인 장점을 갖습니다.

공통 컨텍스트 기반 질의응답(CCQA) 작업에서는 여러 개의 입력 질문이 하나의 공통 컨텍스트를 공유합니다. 기존 (LLM)들은 일반적으로 각 답변을 독립적인 를 사용하여 생성하는 경향이 있습니다. 이러한 방식은 배치 처리나 캐싱 기술로 병렬성을 개선하더라도, 질문들이 프롬프트별로 분리되어 있어 어텐션 과정에서 메모리 병목 현상이 발생하며 자원 활용에 한계가 있었습니다.

이를 해결하기 위해 'Intra-Prompt Parallel Decoding (IPPD)'라는 새로운 추론 방법이 제안되었습니다. IPPD는 여러 공통 컨텍스트 질문들을 단일 프롬프트 내에서 병렬로 답변을 생성합니다. 이 기법은 어텐션 과정 중 메모리와 계산 과정을 효율적으로 공유하며, 모든 질문의 다음 생성을 단일 추론 단계에서 처리하여 GPU 자원 활용도를 높입니다. IPPD는 가상 위치 ID와 어텐션 마스크 조작을 사용하므로, LLM 아키텍처 변경이나 이 필요 없으며 각 프롬프트가 다른 컨텍스트를 가질 때도 배치 추론과 완벽하게 호환됩니다.

실험 결과에 따르면 IPPD는 표준 디코딩 방식 대비 품질 저하 없이 최대 7배의 실효 처리량(effective throughput)을 제공하는 것으로 나타났습니다. 또한, 대부분의 환경에서 PagedAttention을 사용한 프리픽스 캐싱 기법보다 우수한 성능을 입증했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
프롬프트
AI에게 주는 지시나 질문 글.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
원문arXiv · Intra-Prompt Parallel Decoding for Common-Context Question Answering같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv