에이전트 LLM 워크플로우의 지연 시간 개선 연구 — AI 생성 일러스트
리서치 연구

에이전트 LLM 워크플로우의 지연 시간 개선 연구

Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows

arXiv9월 12일 발표 · 2분 · 프리프린트

에이전트 기반 LLM 워크플로우는 준비되는 즉시 작업을 내보내는 방식(eager release)을 사용해왔으나, 시스템 부하가 높아지면 작업 지연 시간(tail latency)이 길어지는 문제가 있었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 '꼬리 위험 인식' 스케줄링 방식을 제안하여, 어떤 준비된 작업을 내보낼지 그리고 미완료 작업의 적정량을 유지할지를 동시에 결정하는 것이 핵심입니다.
  2. 제안된 방식은 시스템 부하가 높은 상황에서 워크플로우의 지연 시간(P95)을 크게 줄여, 최대 3.5배에 달하는 성능 향상을 입증했습니다.
  3. 기술적으로는 평균-조건부 위험 가치(CVaR) 목적 함수를 활용하며, 큐 압력 변화에 맞춰 미완료 작업의 예산을 동적으로 조절합니다.

기반 워크플로우는 모델 턴과 도구 상호작용으로 구성되는데, 기존 시스템들은 준비되는 즉시(eager release) 각 단계를 내보내는 방식을 사용했습니다. 그러나 이러한 방식은 시스템 부하가 높아지는 상황에서 미완료된 작업을 축적시켜, 작업 흐름 수준의 정책이 재정렬할 수 없게 만들고 결과적으로 꼬리 지연 시간(tail latency)을 증가시키는 문제가 발생합니다.

연구진은 이 문제를 해결하기 위해 '꼬리 위험 인식(tail-risk-aware)' 방식의 턴 방출 스케줄링 방법을 제안했습니다. 이 방법은 어떤 준비된 단계를 다음에 내보낼지, 그리고 미완료 작업으로 어느 정도의 양을 유지할지를 동시에 결정하는 것이 핵심입니다. 기술적으로는 평균-조건부 위험 가치(CVaR) 목적 함수를 활용하며, 큐 압력 변화에 맞춰 미완료 작업 예산을 조정하고 준비된 단계를 우선순위화합니다.

이 방법은 소프트웨어 엔지니어링 과제에서 수집한 실제 에이전트 실행 추적 데이터를 사용하여 평가되었습니다. 그 결과, 제안된 방식은 부하가 적을 때는 기존의 즉시 방출 정책과 유사한 성능을 보였으나, 시스템 부하가 높은 상황에서는 워크플로우의 P95 흐름 시간을 크게 줄여 최대 3.5배에 달하는 속도 향상을 달성했습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Decoupling Readiness from Release for Tail-Aware Scheduling of Agentic LLM Workflows
원문 보기arXiv