산스크리트어 문헌의 의미 변화를 측정하는 계산적 접근법 — AI 생성 일러스트AI 일러스트
리서치 연구

산스크리트어 문헌의 의미 변화를 측정하는 계산적 접근법

A Computational Approach to Measuring Semantic Change in Sanskrit Literature

arXiv9월 23일 발표 · 2분 · 심사 전 논문

고대 저자원 언어인 산스크리트어 문헌의 의미 변화를 추적하기 위해 새로운 컴퓨터 기반 분석 방법론을 제시했습니다.

세 줄 요약arXiv 원문 기반
  1. 음운 융합(sandhi) 등 복잡한 특징을 처리하는 전용 시스템으로 의미 변화를 측정했으며, 그 결과는 학계 연구와 높은 일치도를 보였습니다.
  2. 기존의 최신 언어 모델이 현대적이고 풍부한 자원에만 의존하던 한계를 극복하며 고대 언어학 분야에 중요한 방법론을 제공합니다.
  3. 다만, 산스크리트어의 복잡성 때문에 분석 결과가 어떤 시스템 설정(configuration)으로 모델을 구성했는지에 따라 영향을 받을 수 있습니다.

기존의 의미론적 변화 추적 방법인 통시적 단어 (Diachronic word embeddings)은 현대적이고 자원이 풍부한 언어에 주로 검증되어 왔습니다. 본 연구는 이러한 패러다임이 고대이며 저자원 언어인 산스크리트어에도 적용 가능한지 테스트했습니다. 산스크리트어는 음운 융합(sandhi), 형태론적 굴절, 복합어 형성, 다의성 등 독특한 난제를 안고 있어 분석에 어려움이 따릅니다.

연구진은 네 개의 주요 시기를 아우르는 총 2.7M 규모의 코퍼스를 구축했습니다. 이 과정에서 신경망 기반의 바이트 레벨 산디 분리기(sandhi splitter)와 표제어 추출기(lemmatizer)를 사용하여 단어 경계를 복구하고, 각 시기별로 임베딩을 학습시켰습니다. 시스템 평가는 역사학적 학술 자료로부터 선별된 검증 세트를 활용하여 앵커 변위 방식으로 방향성을 가지고 테스트되었습니다.

총 21개의 테스트 가능한 의미 변화 중 19개가 문헌학적으로 입증된 방향으로 이동하는 것이 확인되었으며, 이는 유의미한 통계적 결과(sign test, p=0.00011)를 보였습니다. 연구는 또한 산스크리트어라는 언어가 어떤 시스템 설정(configuration)을 강제하는지 보여주며 개선 기회에 대해서도 논평하고 있습니다.

용어 풀이

임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
원문arXiv · A Computational Approach to Measuring Semantic Change in Sanskrit Literature같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기