LLM의 문제 해결 다양성 강화 기법: DRY-SFT — AI 생성 일러스트AI 일러스트
리서치 연구

LLM의 문제 해결 다양성 강화 기법: DRY-SFT

Don't Repeat Yourself: Self-Supervised Fine-Tuning for Coverage

arXiv9월 29일 발표 · 3분 · 심사 전 논문

LLM이 코딩이나 수학처럼 정답 하나가 중요한 분야에서, 여러 시도 중 적어도 하나의 정답을 찾도록 유도하는 후처리 학습 기법 'DRY-SFT'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. DRY-SFT는 기존 모델의 구조적 다양성이 낮을수록 성능 향상 폭이 크게 나타나며, 주요 벤치마크에서 pass@100 점수를 평균 10% 이상 끌어올리는 성과를 보였습니다.
  2. 단순히 정답률만 높이는 것이 아니라, 모델이 다양한 방식으로 문제를 해결하도록 유도하여 LLM의 실제 복잡 문제 해결 능력과 신뢰도를 근본적으로 강화합니다.
  3. 별도의 보상 함수나 검증기가 필요해 적용이 용이하지만, 성능 향상은 기본 모델의 초기 구조적 다양성 수준에 따라 달라질 수 있습니다.

코딩이나 수학처럼 정답 하나가 중요한 검증 가능한 영역에서는, 개별 시도의 통과율보다 여러 번의 시도 중 적어도 하나의 올바른 해답을 찾는 것이 중요합니다. 연구진은 이러한 문제를 해결하기 위해 'Don't Repeat Yourself Supervised (DRY-SFT)'이라는 후처리 학습 방법을 개발했습니다. DRY-SFT는 의 출력 다양성과 커버리지를 높여, 여러 시도 중 정답을 찾을 확률(coverage)을 증가시키는 것을 목표로 합니다.

이 방법은 두 단계로 구성됩니다. 첫째, 주어진 문제에 대해 순차적으로 K개의 솔루션을 생성하며 모델에게 이전 시도들을 모두 보여주고 다른 해답을 요청합니다. 둘째, 이 과정에서 얻은 각 시도를 독립적으로 미세 조정(fine-tune)하고 컨텍스트에서 이전 시도들을 제거하는 방식으로 진행됩니다. DRY-SFT는 별도의 보상 함수나 검증기 없이 적용할 수 있다는 장점이 있습니다.

실제 테스트 결과, DRY-SFT를 적용했을 때 HumanEval+, MBPP+, DS-1000 등에서 각각 pass@100을 10.8%, 12.5%, 12.4% 포인트 향상시키는 성과를 보였습니다. 특히 기본 모델의 구조적 다양성이 낮을수록 DRY-SFT 적용 시 성능 향상 폭이 크게 나타나, 이 방법이 모드가 수렴된(mode-collapsed) 모델에 효과적임을 보여주었습니다.

용어 풀이

Fine-Tuning
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Don't Repeat Yourself: Self-Supervised Fine-Tuning for Coverage같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv