모델 뉴스
충돌은 나누고, 성능은 합치다: 효율적인 LLM Post-training 전략 MERIT
NCNAVER CLOVA Tech Blog
네이버클라우드는 이질적인 데이터를 다루는 LLM 후학습 과정에서 발생하는 충돌 문제를 해결하는 MERIT 논문을 발표했다.
세 줄 요약
- MERIT은 데이터셋 간의 관계를 분석해 그룹을 구성하고, 각 그룹을 독립적으로 학습한 뒤 가중치를 평균 내어 단 한 번만 병합한다.
- Joint Training 시 발생하던 Gradient Conflict를 완화하여, LLaVA-W 같은 자유 형식 응답 평가에서 원본 모델에 가까운 성능을 유지했다.
- MERIT 적용을 위해서는 데이터셋별 Gradient 추정 및 Cosine Similarity 기반의 충돌 점수표 구축 등 사전 전처리 단계를 거쳐야 한다.
네이버클라우드는 이질적인 데이터를 다루는 LLM 후학습 과정에서 발생하는 충돌 문제를 해결하는 MERIT 논문을 발표했다.