LLM의 문제 해결 다양성 강화 기법: DRY-SFT
Don't Repeat Yourself: Self-Supervised Fine-Tuning for Coverage
arXivLLM이 코딩이나 수학처럼 정답 하나가 중요한 분야에서, 여러 시도 중 적어도 하나의 정답을 찾도록 유도하는 후처리 학습 기법 'DRY-SFT'가 개발되었습니다.
- DRY-SFT는 기존 모델의 구조적 다양성이 낮을수록 성능 향상 폭이 크게 나타나며, 주요 벤치마크에서 pass@100 점수를 평균 10% 이상 끌어올리는 성과를 보였습니다.
- 단순히 정답률만 높이는 것이 아니라, 모델이 다양한 방식으로 문제를 해결하도록 유도하여 LLM의 실제 복잡 문제 해결 능력과 신뢰도를 근본적으로 강화합니다.
- 별도의 보상 함수나 검증기가 필요해 적용이 용이하지만, 성능 향상은 기본 모델의 초기 구조적 다양성 수준에 따라 달라질 수 있습니다.
코딩이나 수학처럼 정답 하나가 중요한 검증 가능한 영역에서는, 개별 시도의 통과율보다 여러 번의 시도 중 적어도 하나의 올바른 해답을 찾는 것이 중요합니다. 연구진은 이러한 문제를 해결하기 위해 'Don't Repeat Yourself Supervised (DRY-SFT)'이라는 후처리 학습 방법을 개발했습니다. DRY-SFT는 의 출력 다양성과 커버리지를 높여, 여러 시도 중 정답을 찾을 확률(coverage)을 증가시키는 것을 목표로 합니다.
이 방법은 두 단계로 구성됩니다. 첫째, 주어진 문제에 대해 순차적으로 K개의 솔루션을 생성하며 모델에게 이전 시도들을 모두 보여주고 다른 해답을 요청합니다. 둘째, 이 과정에서 얻은 각 시도를 독립적으로 미세 조정(fine-tune)하고 컨텍스트에서 이전 시도들을 제거하는 방식으로 진행됩니다. DRY-SFT는 별도의 보상 함수나 검증기 없이 적용할 수 있다는 장점이 있습니다.
실제 테스트 결과, DRY-SFT를 적용했을 때 HumanEval+, MBPP+, DS-1000 등에서 각각 pass@100을 10.8%, 12.5%, 12.4% 포인트 향상시키는 성과를 보였습니다. 특히 기본 모델의 구조적 다양성이 낮을수록 DRY-SFT 적용 시 성능 향상 폭이 크게 나타나, 이 방법이 모드가 수렴된(mode-collapsed) 모델에 효과적임을 보여주었습니다.
용어 풀이
- Fine-Tuning
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.