리서치 연구
스코어 센트링 기법으로 오프폴리시 강화학습 안정화
Score Centering Stabilizes Off-policy Reinforcement Learning
arXiv대규모 언어 모델(LLM)의 강화학습은 훈련-추론 불일치(TIM)로 인해 불안정했는데, 연구진이 이를 해결하는 '스코어 센트링' 보정 기법을 제안했습니다.
세 줄 요약
- 이 기법은 학습 과정에서 누적되는 편향인 '드리프트'를 상쇄하는 가산적 보정 항을 도입하여, 강화학습의 안정성을 근본적으로 높입니다.
- 모델 크기 확장 시에도 기존 중요도 샘플링 방식과 동등하거나 우수한 성능을 보여, 실용적인 LLM 강화학습의 걸림돌을 해소합니다.
- 스코어 센트링은 가산적 특성 덕분에 기존 중요도 샘플링 기법과 결합하여 시너지를 내며 성능을 극대화할 수 있다는 점이 핵심입니다.
(LLM)의 은 훈련-추론 불일치(TIM)에 매우 민감하여 불안정성을 보이는 것이 알려져 있습니다. TIM을 완전히 제거하는 것은 전개 효율성 측면에서 큰 비용이 발생하기 때문에 실용적이지 않습니다. 본 연구는 RL의 이러한 불안정성이 주로 '드리프트'라는 현상, 즉 훈련과 추론 엔진 사이에 발생하는 지속적인 편향에 기인하며 이 편향이 매 훈련 단계마다 누적된다고 분석했습니다.
연구진은 드리프트를 상쇄하여 TIM 하에서도 강화학습의 안정성을 확보하는 가산적인 '스코어 센트링' 보정 항을 도출했습니다. 이 스코어 센트링 기법은 RL 과정에서 발생하는 편향을 직접적으로 제거함으로써 모델 학습의 신뢰도를 높이는 것을 목표로 합니다.
실험 결과, 0.6B에서 30B 까지 모델을 훈련하는 경우, 스코어 센트링만 사용해도 환경에서의 중요도 샘플링 기반 방법들과 동등하거나 우수한 성능을 보였습니다. 또한 이 보정 항은 가산적 특성을 가지므로 기존의 중요도 샘플링 기법과 결합할 수 있으며, 이러한 조합은 순수 중요도 샘플링 기준선보다 더 나은 성능을 나타냈습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 강화학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.