모델 연구
Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
ARarXiv
LLM 추론 능력 향상에 진화 전략(ES)이 주목받으며, 기존 방식인 GRPO보다 더 넓은 범위의 추론 커버리지를 확보하는 성능 우위를 입증했습니다.
세 줄 요약
- 연구 결과, ES는 GRPO가 겪는 엔트로피 붕괴 문제를 개선하며 Pass@1과 전반적인 Pass@K 성능을 동시에 향상시키는 효과를 보였습니다.
- ES는 단순한 메모리 효율적 대안이 아닌, 모델의 기능적 변화를 유지하면서 추론 능력을 끌어올리는 독자적인 후처리(post-training) 패러다임을 제시합니다.
- 실제 적용 시 ES 효과 극대화를 위해 하이퍼파라미터 설계가 중요하며, 특히 대규모 LLM일수록 더 작은 개체군 크기를 사용하는 것이 효율적입니다.
LLM 추론 능력 향상에 진화 전략(ES)이 주목받으며, 기존 방식인 GRPO보다 더 넓은 범위의 추론 커버리지를 확보하는 성능 우위를 입증했습니다.