산스크리트어 문헌의 의미 변화를 측정하는 계산적 접근법
A Computational Approach to Measuring Semantic Change in Sanskrit Literature
arXiv고대 저자원 언어인 산스크리트어 문헌의 의미 변화를 추적하기 위해 새로운 컴퓨터 기반 분석 방법론을 제시했습니다.
- 음운 융합(sandhi) 등 복잡한 특징을 처리하는 전용 시스템으로 의미 변화를 측정했으며, 그 결과는 학계 연구와 높은 일치도를 보였습니다.
- 기존의 최신 언어 모델이 현대적이고 풍부한 자원에만 의존하던 한계를 극복하며 고대 언어학 분야에 중요한 방법론을 제공합니다.
- 다만, 산스크리트어의 복잡성 때문에 분석 결과가 어떤 시스템 설정(configuration)으로 모델을 구성했는지에 따라 영향을 받을 수 있습니다.
기존의 의미론적 변화 추적 방법인 통시적 단어 (Diachronic word embeddings)은 현대적이고 자원이 풍부한 언어에 주로 검증되어 왔습니다. 본 연구는 이러한 패러다임이 고대이며 저자원 언어인 산스크리트어에도 적용 가능한지 테스트했습니다. 산스크리트어는 음운 융합(sandhi), 형태론적 굴절, 복합어 형성, 다의성 등 독특한 난제를 안고 있어 분석에 어려움이 따릅니다.
연구진은 네 개의 주요 시기를 아우르는 총 2.7M 규모의 코퍼스를 구축했습니다. 이 과정에서 신경망 기반의 바이트 레벨 산디 분리기(sandhi splitter)와 표제어 추출기(lemmatizer)를 사용하여 단어 경계를 복구하고, 각 시기별로 임베딩을 학습시켰습니다. 시스템 평가는 역사학적 학술 자료로부터 선별된 검증 세트를 활용하여 앵커 변위 방식으로 방향성을 가지고 테스트되었습니다.
총 21개의 테스트 가능한 의미 변화 중 19개가 문헌학적으로 입증된 방향으로 이동하는 것이 확인되었으며, 이는 유의미한 통계적 결과(sign test, p=0.00011)를 보였습니다. 연구는 또한 산스크리트어라는 언어가 어떤 시스템 설정(configuration)을 강제하는지 보여주며 개선 기회에 대해서도 논평하고 있습니다.
용어 풀이
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.