모델 내부 신호를 활용한 선호도 데이터 필터링 기법 'AlignDiff' — AI 생성 일러스트AI 일러스트
리서치 연구

모델 내부 신호를 활용한 선호도 데이터 필터링 기법 'AlignDiff'

AlignDiff: Exploiting Model-Intrinsic Information for Better Preference Data Selection

arXiv9월 9일 발표 · 2분 · 심사 전 논문

LLM의 인간 선호도 정렬(Alignment)은 데이터 품질에 크게 의존하지만, 기존 데이터셋은 노이즈와 분포 변화로 성능 한계가 있었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 모델 내부 신호를 활용하는 필터링 프레임워크 'AlignDiff'를 제안했습니다. 이는 긍정/역방향 신호로 샘플을 선별하고 난이도 높은 데이터에 집중 학습하도록 유도합니다.
  2. AlignDiff는 데이터셋의 근본적인 품질 문제를 해결하여 LLM이 인간의 복잡하고 풍부한 선호도를 깊이 있게 학습하게 함으로써 모델 성능을 향상시킵니다.
  3. LLaMA, Qwen 등 주요 모델과 AlpacaEval 2.0, Arena-Hard 등 세 가지 표준 벤치마크에서 검증되었으며, 난이도 기반의 커리큘럼 학습 효과를 입증했습니다.

(LLM)을 인간의 선호도에 맞게 정렬하는 과정은 효과적인 정렬에 있어 선호도 데이터 품질이 매우 중요합니다. 하지만 기존 데이터셋들은 내재된 노이즈와 분포 변화로 인해 성능상의 한계를 갖는 경우가 많았습니다.

연구진은 이러한 격차를 해소하기 위해 모델 내부 신호를 활용하는 필터링 프레임워크인 AlignDiff를 제안했습니다. 이 방법은 긍정 및 역방향 신호(positive and inverse signals)를 모두 사용하여 명확한 선호도를 가진 샘플을 식별하며, 평균 음의 로그 우도 간격(average negative log-likelihood gap)을 기반으로 난이도가 높은 샘플에 우선순위를 부여하여 모델 학습을 유도합니다.

AlignDiff는 LLaMA와 Qwen 같은 두 가지 주요 모델 계열과 AlpacaEval 2.0, Arena-Hard, MT-Bench 세 가지 표준 에서 평가되었습니다. 모든 설정에서 기존의 강력한 베이스라인들을 일관되게 능가하는 성능을 보였으며, 난이도 기반 커리큘럼 학습(difficulty-based curriculum learning)이 모델 성능 향상에 기여함을 입증했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · AlignDiff: Exploiting Model-Intrinsic Information for Better Preference Data Selection같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv