범용 바이트 레벨 인코딩(UBE)으로 다국어 토큰 비용 불균형 해소 — AI 생성 일러스트
리서치 연구

범용 바이트 레벨 인코딩(UBE)으로 다국어 토큰 비용 불균형 해소

Universal Byte-Level Encoding: UTF-8/UTF-16 Routing to Reduce Cross-Script Token-Budget Disparities

arXiv10월 1일 발표 · 3분 · 프리프린트

다국어 대규모 언어 모델(LLM)에서 발생하는 스크립트별 토큰 비용 불균형 문제를 해결하기 위해 '범용 바이트 레벨 인코딩(UBE)'이라는 새로운 토크나이저가 제안되었습니다.

왜 중요해요AI 정리

다국어 LLM에서 발생하는 스크립트별 토큰 비용 불균형을 해소하여, 고정된 컨텍스트 내에서 더 많은 정보를 처리할 수 있게 도와줘요.

세 줄 요약arXiv 원문 기반
  1. UBE는 효율적인 문자는 기존의 UTF-8 경로를 유지하고, 복잡한 문자만 UTF-16으로 처리하는 듀얼 알파벳 방식을 채택하여 최소 토큰 비용을 낮추는 것이 핵심입니다.
  2. 이 방식은 언어별 토큰 사용량 격차를 줄여 고정된 컨텍스트 창 내에서 더 많은 정보를 처리할 수 있게 하며, 특히 효율성이 낮은 스크립트의 성능 향상에 기여합니다.
  3. UBE는 기존 바이트-페어 인코딩(BPE)의 품질을 유지하면서도 전반적인 토큰 수를 줄여, 다국어 환경에서 높은 효율성과 사용 가능한 컨텍스트를 제공하는 것이 강점입니다.

다국어 (LLM)에서 사용되는 바이트-페어 인코딩(BBPE)은 모든 유니코드 텍스트를 커버한다는 장점이 있습니다. 그러나 UTF-8 기반 BBPE의 경우, 영어와 달리 많은 스크립트가 높은 '인코딩 플로어' 비용을 가집니다. 이는 학습된 병합 규칙이 적용되지 않을 때 다중 바이트 문자가 여러 개의 바이트 유도 심볼을 필요로 하기 때문입니다. 본 연구는 이러한 수 증가 및 컨텍스트 축소를 막기 위해, UTF-8 기반의 1~2바이트 문자는 기존 경로를 유지하고 3~4바이트 문자를 UTF-16으로 라우팅하는 '범용 바이트 레벨 인코딩(UBE)'을 제안했습니다.

UBE는 바이트-페어 인코딩에 제시되는 바이트 표현만 변경하며, 병합 규칙과 정확한 디코딩은 유지됩니다. 이 방식은 고토큰 프리미엄 스크립트의 3바이트 기본 다국어 평면(BMP) 문자에 대한 인코딩 플로어를 낮추면서도, 혼합 스크립트 텍스트에서 이미 효율적인 구간의 비용을 높이지 않습니다. 또한 UBE는 유니코드 17 감사 과정에서 모든 유니코드 스칼라 값과 공식 정규화, 그래프음 분리, 이모지 테스트 스위트의 입력을 정확하게 왕복(round-trip)하는 것이 확인되었습니다.

다국어 언어 모델 실험 결과에 따르면, UBE는 BBPE와 동등한 LM 품질을 유지하면서도 전반적인 토큰 수를 줄이는 효과를 보였습니다. 특히 고토큰 프리미엄 스크립트에서 가장 큰 폭으로 토큰 감소를 가져왔으며, 영어 토큰 수 또한 약간 낮추어 고정된 토큰 예산 내에서 더 많은 컨텍스트 처리와 빠른 처리를 가능하게 했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
프롬프트
AI에게 주는 지시나 질문 글.
궁금한 점AI 정리 · 원문 기반
현재 LLM에서 다국어를 사용할 때 어떤 문제가 발생하나요?

UTF-8 기반의 바이트-페어 인코딩(BBPE)은 모든 유니코드 텍스트를 커버한다는 장점이 있지만, 영어와 달리 많은 스크립트가 높은 '인코딩 플로어' 비용을 가져요. 이 때문에 토큰 수가 증가하고 모델이 처리할 수 있는 컨텍스트 길이가 줄어드는 문제가 발생해요.

UBE는 기존의 인코딩 방식과 어떻게 다른가요?

UBE는 바이트-페어 인코딩에 사용되는 바이트 표현만 변경하는 방식을 채택했어요. 구체적으로 1~2바이트 문자는 기존 UTF-8 경로를 유지하고, 3~4바이트 문자를 UTF-16으로 라우팅해요. 이 방식은 병합 규칙과 정확한 디코딩을 그대로 유지하면서 효율성을 높여요.

UBE를 사용하면 어떤 성능 개선 효과가 있나요?

UBE는 기존 BBPE와 동등한 언어 모델 품질을 유지하면서도 전반적인 토큰 수를 줄이는 효과를 보여요. 특히 고토큰 프리미엄 스크립트에서 큰 폭의 토큰 감소가 있었고, 덕분에 같은 컨텍스트 예산으로 더 많은 정보를 처리할 수 있게 되었어요.

원문arXiv · Universal Byte-Level Encoding: UTF-8/UTF-16 Routing to Reduce Cross-Script Token-Budget Disparities
궁금한 점 3개AI 정리