LLM 미세 조정, 사람이 읽을 수 있는 텍스트가 정말 필요할까?
Is Human-Readable Text Necessary for Effective LLM Fine-Tuning?
arXivLLM 미세 조정에 반드시 사람이 읽을 수 있는 자연어 텍스트가 필수인지 의문을 제기하고, 합성 데이터 기반의 새로운 방법론 DASA를 제시했습니다.
- DASA는 활성화 기울기 피드백을 활용하여 유용한 업데이트만을 목표로 하며, 기존 자연어 데이터와 유사하거나 능가하는 성능과 높은 속도 효율성을 입증했습니다.
- 고품질 텍스트 확보가 어려운 상황에서도 LLM을 효과적으로 미세 조정할 수 있는 실용적인 대안을 제시한다는 점에서 큰 의미를 가집니다.
- Llama 및 Qwen 계열 등 다양한 규모의 모델과 지식, 수학 추론, 코드 생성 등 여러 전문 분야에서 성능이 검증되었습니다.
본 연구는 (LLM)의 효과적인 에 반드시 인간이 읽을 수 있는 자연어 텍스트가 필수적인지 의문을 제기합니다. 이를 해결하기 위해, 활성화 기울기 피드백을 활용하여 고정된 참조 모델로부터 유용한 적응 업데이트를 목표로 하는 새로운 방법론인 DASA(Desired-Update-Aligned Synthetic Data)를 제안했습니다.
DASA는 소스 텍스트의 재구축이나 언어적 유창성보다는, 활성화 기울기가 가지는 국소 위험 감소 역할에 착안하여 모델 최적화 과정에서 필요한 업데이트만을 목표로 합니다. 이 방법론을 통해 얻은 은 다운스트림 미세 조정에 직접 사용되며, 이산 투영은 질적 검사 목적으로만 활용됩니다.
Llama 및 Qwen 계열의 1B부터 32B 에 이르는 여섯 가지 모델에 대해 지식, 수학 추론, 코드 생성, 상식 추론 등 여섯 가지 벤치마크에서 실험을 진행했습니다. DASA는 일치된 LoRA 적응 설정 하에서 기존 자연어 데이터와 비교 가능한 성능을 달성했으며, 다수의 구성에서 이를 능가하는 결과를 보였습니다.
또한, 일반 도메인 및 작업 특화 소스 데이터를 평가한 결과, DASA는 GRADMM 대비 $3.6$--$4.9 imes$의 속도 향상을 제공하면서도 유사한 최고 GPU 메모리 사용량을 유지했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 합성 데이터
- 실제로 모은 것이 아니라 AI나 프로그램으로 만들어 낸 학습용 데이터.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.