모델 연구
SWE-Prime: Fewer Trajectories, Better Performance
ARarXiv
기존 LLM 학습은 성공적인 실행 경로 전체를 사용했으나, 비효율적이거나 위험한 단계가 포함되어 데이터 노이즈 문제가 발생했습니다.
세 줄 요약
- 연구진은 트랙토리 및 의미적 세그먼트 단위의 2단계 필터링 기법인 SWE-Prime을 제안하여 고품질 학습 데이터를 선별합니다.
- SWE-Prime은 전체 데이터 중 극히 일부(10% 수준)만 사용해도 최대 24.2%에 달하는 성능 향상을 입증하며 효율성을 높였습니다.
- 이 기술은 LLM이 단순히 성공 사례를 모방하는 것을 넘어, 문제 해결 과정의 '질'과 핵심 단계만을 선별적으로 학습해야 함을 보여줍니다.
기존 LLM 학습은 성공적인 실행 경로 전체를 사용했으나, 비효율적이거나 위험한 단계가 포함되어 데이터 노이즈 문제가 발생했습니다.