리서치 연구
Beneath the Diff: Diagnosing and Mitigating Algorithmic Mode Collapse in Code-Level Autonomous Research Loops
ARarXiv
LLM 에이전트가 코드를 수정하며 연구하는 자율 루프(ARL) 시스템에서, 내부 지표 개선만으로는 일반화된 진정한 발전이 어렵다는 '알고리즘적 모드 붕괴' 현상이 발견되었습니다.
세 줄 요약
- 연구진은 '다양성 인식 제안 샘플링(DAPS)'을 개발하여, 편집 기억과 검증 게이트를 결합해 모드 붕괴를 완화하고 독립 평가 성능을 크게 향상시켰습니다.
- 본 연구는 LLM 기반 자율 시스템이 내부 루프 지표에만 의존할 때 발생하는 한계를 명확히 보여주며, AI 에이전트의 신뢰성 평가 기준을 재정립합니다.
- 자율 연구 시스템의 성능 검증 시에는 내부 최적화 속도뿐만 아니라, 반드시 독립적인 환경에서 측정하는 '블라인드 평가'를 병행해야 합니다.
LLM 에이전트가 코드를 수정하며 연구하는 자율 루프(ARL) 시스템에서, 내부 지표 개선만으로는 일반화된 진정한 발전이 어렵다는 '알고리즘적 모드 붕괴' 현상이 발견되었습니다.