리서치 연구
1억 5천만 개 파라미터 터키어 언어 모델 'ufakzeka-1' 공개
ufakzeka-1: Building and Evaluating a 151M-Parameter Turkish Language Model from Scratch
arXiv연구진은 13.5B 토큰으로 학습된 1억 5천만 개 파라미터 규모의 터키어 언어 모델 'ufakzeka-1'을 공개했습니다.
세 줄 요약
- 모델 성능 자체보다 구축 과정에 초점을 맞춰, 3단계 학습 스케줄과 엄격한 평가 시스템을 제시했으며 안전성 게이트가 데이터로 '고쳐지는' 현상을 보고했습니다.
- 가중치와 데이터 레시피를 Apache-2.0으로 공개하며 소규모 LLM 개발의 투명성과 재현 가능한 방법론을 제시했다는 점에서 학계적 의미가 큽니다.
- 다만, 모델 개선의 한계가 데이터 부족보다는 크기 자체에 있을 수 있으며, 학습 시드 편차가 커 단일 비교는 신뢰하기 어렵다는 점도 지적했습니다.
연구진은 13.5B 의 오픈 라이선스 텍스트로 사전 학습된 151M개( 포함 시 182M개) 규모의 터키어 언어 모델 'ufakzeka-1'을 공개했습니다. 이 모델은 채팅에 맞게 명령어 조정(instruction-tuned)되었으며, 클라우드 및 사용 비용 등을 합쳐 총 약 $286의 비용으로 구축되었습니다.
본 연구는 단순히 모델 자체의 성능보다는, 해당 모델을 구축하고 측정하는 과정에 초점을 맞추었습니다. 구체적으로 터키어 바이트 레벨 (단어당 1.77 토큰)를 사용했으며, 3단계 사전 학습 스케줄과 오픈 라이선스 및 생성 데이터를 혼합한 후속 학습 방식을 적용했습니다. 또한, 평가 과정에서는 데이터 구축 단계에서의 오염 제거와 훈련 데이터에서 제외된 프롬프트를 활용하는 등 엄격한 검증 시스템을 갖추었습니다.
연구 결과로 안전성 게이트가 자체 질문으로 작성된 훈련 데이터를 통해 '수정'되는 현상(64/64 대 실제 수치 34/64)이 보고되었습니다. 또한, 모델의 가중치, 데이터 레시피, 평가 코드 및 지출 내역은 Apache-2.0 라이선스로 공개되어 소규모 LLM 개발 과정의 투명성과 재현 가능한 방법론을 제시했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 토크나이저
- 글을 모델이 처리할 토큰으로 잘라 주는 도구.