바이트 모델 기반 LLM의 성능 한계 돌파 연구
Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models
arXiv연구진이 소형 언어 모델의 성능 향상을 위해 토큰 기반 방식과 바이트 기반 방식을 대규모로 비교 분석했습니다.
- 초기에는 토큰 모델이 유리하지만, 데이터와 연산량이 증가할수록 바이트 모델의 성능 상한선이 높아지며 기존 모델을 능가하는 것으로 나타났습니다.
- 바이트 모델은 어휘 크기를 대폭 줄여 로짓 저장 비용과 토큰 자르기(truncation) 문제를 해결하며 데이터 효율성을 극대화합니다.
- 연구 결과, 바이트 모델은 장기적으로 최신 대형 모델들 대비 높은 성능 향상을 보일 것으로 예측되며, 이는 LLM 경량화의 새로운 방향을 제시합니다.
본 연구는 소형 언어 모델을 강화하기 위해 기반 방식과 바이트 기반 방식을 대규모로 비교 분석했습니다. 연구진은 토큰 로짓을 바이트 로짓으로 변환하는 두 가지 방법(근사치: Marginalize-It, 정확치: End-Of-Token)을 도입하여 실험을 진행했습니다. 이 연구는 토큰화 방식(Tokens, Bytes, Bytes w/ eot)과 학습 목표( vs. Cross-Entropy)라는 두 차원을 동시에 변화시키며, 약 10억 개 부터 최대 1조 바이트의 데이터까지 모델을 확장하여 총 8개의 에서 테스트했습니다.
분석 결과, Token-1B 모델이 낮은 FLOP 영역에서는 바이트 모델보다 우수한 성능을 보였으나 이는 결국 정체되는 경향을 보였습니다. 반면, 바이트 모델은 초기에는 성능이 낮았지만 더 많은 연산량을 투입할수록 Token-1B 모델의 성능 상한선을 능가하는 것으로 나타났습니다. 연구는 End-Of-Token-1B 모델이 이론적으로 Token-1B보다 최대 4%까지 우수하며, 데이터 효율성 측면에서도 기존 방식 대비 6분의 1의 학습 데이터만으로 유사한 성능을 달성할 수 있다고 예측했습니다.
바이트 모델은 약 10만 개의 토큰 대신 256개의 작은 어휘 크기를 사용함으로써 여러 이점을 확보합니다. 이는 로짓 저장 비용을 약 5분의 1로 줄이고, 로짓 덤핑 시 필요한 top-k 트렁케이션의 필요성을 우회할 수 있게 합니다. 나아가, 최종 성능 예측에 따르면 End-Of-Token-1B 모델은 평균적인 다운스트림 작업에서 Llama 3.2-1B, Gemma-3-1B-pt, Gemma 2B 모델을 각각 최대 6.5%, 8.1%, 2.1%까지 능가할 것으로 예측되었습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- Distillation
- 큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.