MoE 기반 LLM을 위한 태스크 인식 연합 미세 조정 기법 연구
Task-Aware Federated Fine-Tuning for MoE-based Large Language Models
arXivMoE 기반 대규모 언어 모델(LLM)을 분산 환경에서 미세 조정할 때 발생하는 전문가 간 충돌 문제를 해결하는 태스크 인식 방식입니다.
- FedTAR는 SVD를 이용해 로컬 업데이트와 태스크 선호도를 좌표화하고, 유사한 작업끼리 그룹별로 집계하여 전문성을 유지합니다.
- 데이터가 이질적이고 사용자 요구사항이 충돌하는 실제 분산 환경에서도 LLM의 성능 저하를 막고 모델의 특화도를 보존할 수 있습니다.
- 다양한 비독립적(non-IID) 설정에서 기존 최첨단 방식보다 우수한 성능을 입증하며 SOTA를 달성했습니다.
(MoE) 아키텍처는 희소 전문가 활성화를 통해 모델 용량을 개선하면서도 계산 오버헤드를 제한하여, 자원이 제한적인 분산 환경에서 에 매력적으로 사용되고 있습니다. 하지만 MoE 기반 LLM을 연합 할 때 클라이언트 데이터가 이질적일 경우 어려움이 따릅니다. 각 클라이언트가 다른 작업 선호도를 가지기 때문에 로컬 업데이트를 직접 집계하면 전문가의 전문성이 약화되거나 공유된 전문가에 충돌하는 방향의 업데이트가 발생할 수 있습니다.
이를 해결하기 위해 FedTAR라는 태스크 인식 연합 미세 조정 방법을 제안합니다. FedTAR는 라우팅 출력을 통해 로컬 업데이트와 작업 선호도 간의 연관성을 확립하며, 특히 SVD(특이값 분해)를 사용하여 라우팅 특징과 로컬 업데이트 모두에서 저차원 작업 좌표 및 업데이트 방향을 추출합니다. 이 작업 좌표를 기반으로 유사한 작업 선호도를 가진 클라이언트끼리 내부 군집 집계(intra-cluster aggregation)를 수행하고, 다른 작업 그룹 간의 외부 군집 집계(inter-cluster aggregation)를 진행합니다.
이렇게 집계된 업데이트는 학습된 태스크-업데이트 매핑을 통해 재구성되며, 최종 업데이트가 작업별 최적화 방향과 일치하도록 보장합니다. FedTAR는 이 과정을 통해 전문가 전문성을 유지하고 이질적인 클라이언트 간의 파괴적 간섭을 완화할 수 있습니다. 연구진은 다양한 비독립적(non-IID) 설정 하에서 네 가지 작업을 대상으로 평가했으며, FedTAR가 기존 강력한 연합 미세 조정 기준선들을 지속적으로 능가하는 성능을 보여주며 최첨단 성과를 달성했음을 입증했습니다.
용어 풀이
- Mixture-of-Experts
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.