장기 선박 항로 예측을 위한 M3-Former 모델 제안
M3-Former: Multimodal Transformer with Mixture-of-Experts for Long-Term Vessel Trajectory Prediction
arXiv선박의 장기 항로 예측 정확도를 높이기 위해, 대규모 언어모델(LLM)을 활용한 멀티모달 트랜스포머 모델 'M3-Former'가 제안되었습니다.
- 이 모델은 선박의 정적 속성과 항해 의도 같은 의미 정보를 반영하며, 전역 경로와 국소 기동을 분리 분석하는 이중 MoE 구조를 핵심으로 합니다.
- 실제 데이터셋 실험 결과, M3-Former는 기존 최고 성능 모델 대비 장기 예측 오차(ADE/FDE)를 최대 5% 이상 줄여 뛰어난 성능을 입증했습니다.
- 따라서 단순 이동 데이터 외에 선박의 목적지나 운항 계획 같은 '맥락적 의미 정보'를 결합하는 것이 항로 예측 신뢰도를 높이는 핵심입니다.
본 논문은 행동적 성, 제한적인 의미 활용, 장기 오차 누적 등의 문제를 해결하기 위해 (대규모 언어모델)으로 강화된 멀티모달 프레임워크인 M3-Former를 제안합니다. 이 모델은 선박의 정적 속성과 항해 의도 같은 의미 정보를 활용하여 장기적인 궤적 모델링을 수행하며, 이를 통해 전역 경로 계획과 국소 움직임 변화를 모두 포착하는 것을 목표로 합니다.
M3-Former는 통합된 멀티모달 표현 공간을 구축합니다. 이 공간에서 정적 의미 정보는 사전 학습된 LLM에 의해 인코딩되며 자체 어텐션(self-attention)을 통해 동적 궤적 특징과 정렬됩니다. 또한, 전역 항해 추세를 모델링하는 시퀀스 레벨 전문가와 미세한 기동 행동을 개선하는 레벨 전문가로 구성된 이중 그레뉼러리티 아키텍처를 도입했습니다.
실제 더니시 AIS 데이터셋에 대한 실험 결과, M3-Former는 1시간부터 4시간까지의 예측 구간에서 기존 최고 성능 모델을 능가하는 성능을 보였습니다. 특히 4시간 예측 과제에서는 가장 강력한 기준선 대비 평균 변위 오차(ADE)를 4.4%, 최종 변위 오차(FDE)를 5.1% 감소시키는 결과를 입증했습니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- MoE
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.