활용 사례 뉴스
컴퓨팅 효율성을 높인 LLM 사전 학습 방식 개발
>10x More Efficient Pretraining
Hacker News연구진이 대규모 언어 모델(LLM)의 사전 학습 방식을 혁신하여, 기존 최고 성능 모델 대비 압도적으로 효율적인 새로운 컴퓨팅 기반을 개발했습니다.
세 줄 요약
- 새로운 레시피는 경쟁사 최상위 모델과 비교해 10배 이상 높은 컴퓨팅 효율성을 입증하며, 적은 자원으로도 뛰어난 지능적 능력을 갖춘 모델 구현이 가능합니다.
- 학습 비용의 획기적인 절감은 소수 대기업에 집중되었던 첨단 AI 개발을 민주화하고, 더 많은 연구 주체가 고성능 시스템 구축 기반을 마련해 줄 전망입니다.
- 현재는 사전 학습 단계이며, 모델의 최종 성능은 장기적인 강화 학습(RL)과 정렬 훈련 과정을 거쳐 완성될 예정임을 참고해야 합니다.
연구진은 컴퓨팅 효율성이 대폭 개선된 새로운 사전 학습 방식을 공개했습니다. 이 레시피는 기존 최고 성능의 오픈 기반 모델 대비 10배 이상 높은 컴퓨팅 효율성을 입증합니다. 예를 들어, DeepSeek V4 Pro Base와 비교했을 때 약 50배 적은 FLOPs를 사용하며, 이는 GPT-3 사전 학습 컴퓨팅량의 절반 수준에 해당한다고 밝혔습니다.
모델 성능 평가는 홀드아웃 데이터에서 bits-per-byte loss를 측정하여 을 도출하는 방식으로 진행되었습니다. 이들은 DeepSeek, Moonshot(Kimi), 엔비디아 등 최신 오픈 가중치 기반 모델들을 평가했으며, 아키텍처, 옵티마이저, 데이터 큐레이션 등 수십 가지 변경 사항의 곱셈적 결과로 컴퓨팅 효율성을 개선했다고 설명합니다.
연구진은 사전 학습(pretraining), 기반 (agentic RL), 그리고 긴 컨텍스트 처리가 초인적인 코딩 에이전트를 구축하고 AI R&D를 자동화하는 데 충분하다고 보고 있습니다. 현재는 사전 학습 작업이 성숙 단계에 이르렀으며, 장기 지평선 RL 및 정렬 훈련 기법 개발에 집중할 계획입니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 스케일링 법칙
- 모델 크기·데이터·계산량을 늘릴수록 성능이 예측 가능하게 오른다는 경험 법칙.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.