에이전트 LLM 워크플로우의 지연 시간 개선 연구
Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows
arXiv에이전트 기반 LLM 워크플로우는 준비되는 즉시 작업을 내보내는 방식(eager release)을 사용해왔으나, 시스템 부하가 높아지면 작업 지연 시간(tail latency)이 길어지는 문제가 있었습니다.
- 연구진은 '꼬리 위험 인식' 스케줄링 방식을 제안하여, 어떤 준비된 작업을 내보낼지 그리고 미완료 작업의 적정량을 유지할지를 동시에 결정하는 것이 핵심입니다.
- 제안된 방식은 시스템 부하가 높은 상황에서 워크플로우의 지연 시간(P95)을 크게 줄여, 최대 3.5배에 달하는 성능 향상을 입증했습니다.
- 기술적으로는 평균-조건부 위험 가치(CVaR) 목적 함수를 활용하며, 큐 압력 변화에 맞춰 미완료 작업의 예산을 동적으로 조절합니다.
기반 워크플로우는 모델 턴과 도구 상호작용으로 구성되는데, 기존 시스템들은 준비되는 즉시(eager release) 각 단계를 내보내는 방식을 사용했습니다. 그러나 이러한 방식은 시스템 부하가 높아지는 상황에서 미완료된 작업을 축적시켜, 작업 흐름 수준의 정책이 재정렬할 수 없게 만들고 결과적으로 꼬리 지연 시간(tail latency)을 증가시키는 문제가 발생합니다.
연구진은 이 문제를 해결하기 위해 '꼬리 위험 인식(tail-risk-aware)' 방식의 턴 방출 스케줄링 방법을 제안했습니다. 이 방법은 어떤 준비된 단계를 다음에 내보낼지, 그리고 미완료 작업으로 어느 정도의 양을 유지할지를 동시에 결정하는 것이 핵심입니다. 기술적으로는 평균-조건부 위험 가치(CVaR) 목적 함수를 활용하며, 큐 압력 변화에 맞춰 미완료 작업 예산을 조정하고 준비된 단계를 우선순위화합니다.
이 방법은 소프트웨어 엔지니어링 과제에서 수집한 실제 에이전트 실행 추적 데이터를 사용하여 평가되었습니다. 그 결과, 제안된 방식은 부하가 적을 때는 기존의 즉시 방출 정책과 유사한 성능을 보였으나, 시스템 부하가 높은 상황에서는 워크플로우의 P95 흐름 시간을 크게 줄여 최대 3.5배에 달하는 속도 향상을 달성했습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.