1억 5천만 개 파라미터 터키어 언어 모델 'ufakzeka-1' 공개 — AI 생성 일러스트AI 일러스트
리서치 연구

1억 5천만 개 파라미터 터키어 언어 모델 'ufakzeka-1' 공개

ufakzeka-1: Building and Evaluating a 151M-Parameter Turkish Language Model from Scratch

arXiv9월 23일 발표 · 2분 · 심사 전 논문

연구진은 13.5B 토큰으로 학습된 1억 5천만 개 파라미터 규모의 터키어 언어 모델 'ufakzeka-1'을 공개했습니다.

세 줄 요약arXiv 원문 기반
  1. 모델 성능 자체보다 구축 과정에 초점을 맞춰, 3단계 학습 스케줄과 엄격한 평가 시스템을 제시했으며 안전성 게이트가 데이터로 '고쳐지는' 현상을 보고했습니다.
  2. 가중치와 데이터 레시피를 Apache-2.0으로 공개하며 소규모 LLM 개발의 투명성과 재현 가능한 방법론을 제시했다는 점에서 학계적 의미가 큽니다.
  3. 다만, 모델 개선의 한계가 데이터 부족보다는 크기 자체에 있을 수 있으며, 학습 시드 편차가 커 단일 비교는 신뢰하기 어렵다는 점도 지적했습니다.

연구진은 13.5B 의 오픈 라이선스 텍스트로 사전 학습된 151M개( 포함 시 182M개) 규모의 터키어 언어 모델 'ufakzeka-1'을 공개했습니다. 이 모델은 채팅에 맞게 명령어 조정(instruction-tuned)되었으며, 클라우드 및 사용 비용 등을 합쳐 총 약 $286의 비용으로 구축되었습니다.

본 연구는 단순히 모델 자체의 성능보다는, 해당 모델을 구축하고 측정하는 과정에 초점을 맞추었습니다. 구체적으로 터키어 바이트 레벨 (단어당 1.77 토큰)를 사용했으며, 3단계 사전 학습 스케줄과 오픈 라이선스 및 생성 데이터를 혼합한 후속 학습 방식을 적용했습니다. 또한, 평가 과정에서는 데이터 구축 단계에서의 오염 제거와 훈련 데이터에서 제외된 프롬프트를 활용하는 등 엄격한 검증 시스템을 갖추었습니다.

연구 결과로 안전성 게이트가 자체 질문으로 작성된 훈련 데이터를 통해 '수정'되는 현상(64/64 대 실제 수치 34/64)이 보고되었습니다. 또한, 모델의 가중치, 데이터 레시피, 평가 코드 및 지출 내역은 Apache-2.0 라이선스로 공개되어 소규모 LLM 개발 과정의 투명성과 재현 가능한 방법론을 제시했습니다.

용어 풀이

토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
토크나이저
글을 모델이 처리할 토큰으로 잘라 주는 도구.
원문arXiv · ufakzeka-1: Building and Evaluating a 151M-Parameter Turkish Language Model from Scratch같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기