브라흐미 문자 스크립트를 위한 타입 기반 토큰화 연구
Type-Driven Tokenization for Brahmic Scripts
arXiv대규모 언어 모델(LLM)의 일반 토크나이저는 데바나가리, 타밀어 등 브라흐미 문자 계열 스크립트가 가진 복잡한 철자 규칙을 처리하지 못해 오류를 발생시킵니다.
- 연구진은 이러한 문자의 조합 규칙을 '부분 반군(partial semigroup)'으로 정의하고, 이를 반영하여 토큰 경계를 정확히 지키는 `fixToken` 함수를 개발했습니다.
- 이 기술은 영어와 같은 알파벳 스크립트가 아닌, 복잡한 음절 구조를 가진 인도 계열 언어의 LLM 이해도와 처리 정확도를 획기적으로 개선합니다.
- 해당 방법론은 이론적 증명(Agda)을 넘어 실제 라이브러리 패치 및 Rust 기반의 독립형 전처리기로 구현되어 현장 적용이 가능합니다.
(LLM)에 사용되는 표준 는 데바나가리, 타밀어, 칸나다어 등 브라흐미 문자 계열 스크립트에 적용될 경우 오류를 발생시킵니다. 이 문자는 자음마다 고유의 모음을 가지고 있으며, 여기에 의존적인 부호가 결합하여 형태를 바꿀 수 있는 아부기다 체계입니다. 근본적인 문제는 이러한 토크나이저들이 영어와 같은 알파벳 스크립트에서는 발생하지 않는 복잡한 철자 제약 조건을 위반한다는 점입니다.
연구진은 이 차이를 형식화하여, 영어의 철자가 '반군(semigroup)'을 형성하는 반면 브라흐미 문자는 '부분 반군(partial semigroup)'을 형성함을 관찰했습니다. 이를 바탕으로 Agda에서 이러한 구분을 공식화하고, 유효한 브라흐미 을 전이 시스템 내의 사슬로 모델링했습니다. 그 결과, 임의의 후보 토큰을 가져와 철자 경계를 준수하도록 확장하는 'fixToken' 함수를 증명 가능한 방식으로 도출해냈습니다.
이렇게 이론적으로 증명된 방법론은 실제 적용 가능한 패치 형태로 구현되었습니다. 해당 기술은 SentencePiece에 대한 실용적인 패치를 제공할 뿐만 아니라, 독립적인 Rust 기반의 전처리기 라이브러리로도 개발되어 인도 계열 스크립트에서 관찰되던 오류들을 제거하는 데 활용될 수 있습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토크나이저
- 글을 모델이 처리할 토큰으로 잘라 주는 도구.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.