모델 뉴스

충돌은 나누고, 성능은 합치다: 효율적인 LLM Post-training 전략 MERIT

NCNAVER CLOVA Tech Blog발표일 미상 · 1분

네이버클라우드는 이질적인 데이터를 다루는 LLM 후학습 과정에서 발생하는 충돌 문제를 해결하는 MERIT 논문을 발표했다.

세 줄 요약NAVER CLOVA Tech Blog 원문 기반
  1. MERIT은 데이터셋 간의 관계를 분석해 그룹을 구성하고, 각 그룹을 독립적으로 학습한 뒤 가중치를 평균 내어 단 한 번만 병합한다.
  2. Joint Training 시 발생하던 Gradient Conflict를 완화하여, LLaVA-W 같은 자유 형식 응답 평가에서 원본 모델에 가까운 성능을 유지했다.
  3. MERIT 적용을 위해서는 데이터셋별 Gradient 추정 및 Cosine Similarity 기반의 충돌 점수표 구축 등 사전 전처리 단계를 거쳐야 한다.

네이버클라우드는 이질적인 데이터를 다루는 LLM 후학습 과정에서 발생하는 충돌 문제를 해결하는 MERIT 논문을 발표했다.

원문NAVER CLOVA Tech Blog · 충돌은 나누고, 성능은 합치다: 효율적인 LLM Post-training 전략 MERIT같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기