Fireworks의 신규 모델 Ember-1: 비용 효율성을 높인 LLM
Ember-1
Hacker NewsFireworks Research가 고성능 모델 Kimi K3의 품질은 유지하면서 토큰 사용량을 획기적으로 줄인 전문화된 신규 모델 'Ember-1'을 출시했습니다.
- 이 모델은 LLM이 과도하게 사용하는 불필요한 내부 추론 과정을 효율적으로 학습하여 제거함으로써, 코딩 및 에이전트 작업에서 최대 40%에 달하는 비용 절감을 실현합니다.
- 대규모 자동화 워크로드나 다단계 에이전트 시스템 구축 시 발생하는 높은 API 호출 비용 부담을 줄여주어 운영 효율성을 극대화할 수 있습니다.
- 현재 연구 프리뷰로 제공되며, 개발자들은 이를 테스트하고 추후 자체 데이터 기반의 맞춤형 전문 모델 구축 지원도 이용 가능합니다.
Fireworks Research는 고성능 모델 Kimi K3의 품질은 유지하면서 사용량을 획기적으로 줄인 전문화된 신규 모델 'Ember-1'을 출시했습니다. 이 모델은 Kimi K3를 기반으로 하며, 이 과도하게 사용하는 불필요한 내부 추론 과정을 학습하여 제거하는 방식으로 개발되었습니다. Ember-1은 코딩 및 워크로드 등 다양한 환경에서 품질 저하 없이 비용 효율성을 높이는 것을 목표로 합니다.
개발자들은 Kimi K3의 높은 코딩 역량을 유지하면서도, 긴 추론 과정으로 인해 발생하는 대규모 자동화 작업의 높은 호출 비용을 줄일 필요성을 제기했습니다. 이에 따라 연구팀은 50개 이상의 학습 실험과 200개가 넘는 평가를 진행하며 새로운 학습 알고리즘을 개발했습니다. 이 과정에서 모델이 필수적인 자기 성찰 능력(Self-reflection)은 유지하되, 과도하고 비생산적인 추론 루프를 제거하는 데 초점을 맞췄습니다.
Ember-1의 성능은 외부 와 실제 고객 환경을 통해 검증되었습니다. 두 곳의 고객사에서 진행된 라이브 A/B 테스트 결과, Ember-1은 유사한 품질 수준을 유지하면서도 작업당 약 35% 적은 토큰 사용량을 보여주었습니다. 또한, SWE-bench Verified 같은 전문 코딩 벤치마크에서도 Kimi K3 대비 높은 성능과 비용 절감 효과를 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.