리서치 연구
POSPAN: 위치 제약 기반 스팬 마스킹을 통한 언어 모델 사전 학습
POSPAN: Position-Constrained Span Masking for Language Model Pre-training
arXiv기존의 스팬 마스킹 방식은 구간 길이만 고려하고, 문장 내 마스크된 위치 간의 의존성을 무시하는 한계가 있었습니다.
세 줄 요약
- POSPAN은 스팬 길이 분포와 '위치 제약 조건'을 결합한 새로운 프레임워크로, 기존 모든 마스킹 방법을 통합합니다.
- 이 연구는 단어의 위치적 제약까지 고려하는 것이 언어 모델이 문맥적 의존성을 깊이 이해하고 학습하는 데 결정적인 역할을 함을 보여줍니다.
- 실험 결과, POSPAN은 기존 방식보다 월등히 높은 성능을 보였으며, 이론적 분석과 다수 NLU 벤치마크에서 그 효과를 입증했습니다.
스팬 레벨의 마스크드 언어 모델링(MLM)은 엔티티나 구문 및 그 의존성이 언어 이해에 중요하기 때문에 기존 단일 MLM보다 유리한 것으로 알려져 있습니다. 하지만 이전 연구들은 스팬 길이만을 고려했을 뿐, 마스크된 스팬들 간의 위치적 의존성을 무시하는 한계가 있었습니다. 즉, 마스크된 스팬들의 위치를 균일하게 분포한다고 가정했습니다.
본 논문은 POSPAN이라는 일반적인 프레임워크를 제시합니다. 이 프레임워크는 스팬 길이 분포와 '위치 제약 조건' 분포를 결합하여 다양한 형태의 위치 제약 기반 스팬 마스킹 전략을 구현할 수 있게 합니다. 이를 통해 기존에 존재했던 모든 스팬 레벨 마스킹 방법들을 하나의 틀로 통합하는 것이 가능합니다.
여러 NLU 데이터셋에서 POSPAN의 효과를 평가한 결과, 위치 제약 조건이 스팬 레벨 마스킹을 전반적으로 향상시키는 것으로 나타났습니다. 특히 최적화된 POSPAN 설정은 기존에 스팬 길이만 고려했던 방식이나 일반적인 MLM보다 일관되게 높은 성능을 보였습니다. 또한 이론 분석을 통해 위치 제약의 필요성과 합리성을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.