자체 생성 트레이스를 활용한 심층 연구 및 장문 문맥 능력 강화 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

자체 생성 트레이스를 활용한 심층 연구 및 장문 문맥 능력 강화

Boosting Deepresearch and LongContext Ability with Self-Generated Deepresearch Rollouts Traces

arXiv9월 21일 발표 · 3분 · 심사 전 논문

웹 환경에서 깊이 있는 연구를 수행하는 AI 에이전트가 문맥을 빠르게 잃거나 긴 정보를 통합하는 데 어려움을 겪는 문제를 해결하기 위한 새로운 학습 방법론이 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. 기존의 검색 기록(trajectory)과 요약된 데이터를 원문 전체로 확장하고, 이를 장문 질문 답변(LongQA) 단계에 추가한 'DLD-RL' 방식을 핵심으로 합니다.
  2. 이 방식은 에이전트가 여러 문서를 종합적으로 분석하여 복잡한 연구 과제에 답하는 능력을 획기적으로 높여, 학술 정보 검색의 신뢰도를 끌어올릴 수 있습니다.
  3. 특히 기존 에이전트가 생성한 데이터를 재활용해 학습 데이터셋을 구축한다는 점에서 효율적이며, 실제 벤치마크에서 높은 성능 향상을 입증했습니다.

Deepresearch (DR) 는 웹 환경에서 다중 턴 검색과 방문을 통해 문맥 정보가 빠르게 증가하는 문제를 겪는다. 연구진은 DR Agentic (DR-RL) 이후에도 모델의 예측 오류 중 61.6%가 여전히 불충분한 장문 문맥 이해(긴 문맥 , 문서 간 증거 통합 실패 등)에 기인함을 관찰했다. 이러한 병목 현상을 해결하기 위해, 연구진은 기존 DR-RL 궤적을 재활용하여 검색 기록, 방문 웹페이지, 증거 스니펫 등을 해당 URL의 전체 내용으로 대체하는 `DR Rollouts to LongContext-QA (DR-to-Long)` 방법을 제안했다. 이 방법은 원래의 증거 관계를 유지하면서 훨씬 긴 다중 문서 문맥을 생성한다.

이후 DLD-RL (`DR -> LongQA -> DR`)이라는 추가적인 학습 프레임워크가 도입되었다. DLD-RL은 먼저 짧은 DR-RL 단계를 거쳐 롤아웃 궤적을 수집하고, 이를 제로 주석 비용으로 LongQA 인스턴스로 변환한다. 이후 모델은 LongQA-RL을 통해 장문 문맥 능력을 강화하는 최적화 과정을 거치며, 마지막으로 전체 DR-RL을 수행하여 에이전트의 심층 연구 역량을 지속적으로 개선한다. 실험 결과에 따르면, DLD-RL은 세 가지 Deepresearch 에서 표준 DR-RL 대비 7.3%의 성능 향상을 보였으며, 세 가지 장문 문맥 벤치마크에서는 13.5%의 성능 향상을 기록했다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
Reinforcement Learning
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
환각
AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Boosting Deepresearch and LongContext Ability with Self-Generated Deepresearch Rollouts Traces같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기