알레프 알파의 MoE 추론 모델 '콜리브리-1' 공개
Aleph-Alpha/Kolibri-1
독일어와 영어에 특화된 Aleph Alpha의 MoE(Mixture-of-Experts) 기반 추론 모델 'Kolibri-1'이 공개되었습니다. 이 모델은 명시적 추론 모드와 도구 호출 기능을 지원합니다.
이 모델은 단순한 답변 생성을 넘어 다단계 추론, 코드 작성, 외부 도구 호출 등 복잡하고 인간과의 협업이 필요한 업무 흐름을 지원하는 데 강점을 보여요.
- 총 매개변수는 780억 개지만 토큰당 활성화되는 파라미터는 약 34억 개로 효율성이 높으며, 최대 100만 토큰의 긴 컨텍스트 처리가 가능합니다.
- 단순한 답변 생성을 넘어 다단계 추론, 코드 작성, 외부 API 호출 등 에이전트 워크플로우에 최적화되어 인간과의 협업을 지원하는 데 강점을 보입니다.
- 구동에는 고성능 GPU 자원이 필요하며, 복잡하고 지연 시간에 민감한 작업의 경우 효율성을 위해 컨텍스트 길이는 26만 토큰 이하로 사용하는 것이 권장됩니다.
Kolibri는 Aleph Alpha가 개발한 (MoE) 기반 로, 독일어와 영어에 초점을 맞추고 있습니다. 이 모델은 총 78B를 가지며 당 활성화되는 파라미터는 3.46B입니다. 컨텍스트 길이는 최대 1,048,576 토큰까지 지원하지만, 효율적인 서비스와 복잡한 작업을 위해서는 262,144 토큰 이하의 컨텍스트 사용이 권장됩니다.
Kolibri는 단순한 자연어 생성 기능을 넘어 다단계 추론, 코드 작성, (RAG), 도구 호출 등 다양한 고급 작업 수행을 목표로 합니다. 이 모델은 인간과의 협업에 중점을 두었으며, 결정적인 판단보다는 근거를 제시하고 옵션을 초안하는 조언자 역할에 적합하도록 설계되었습니다.
모델 사용을 위해서는 `aleph-alpha-inference` 패키지를 설치하여 vLLM 플러그인을 이용해야 합니다. 추론 시에는 `--reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice`와 같은 옵션을 통해 추론 및 도구 호출 기능을 활성화할 수 있습니다. 또한, 오픈AI 호환 API를 사용할 경우 `chat_template_kwargs` 내의 `reasoning_effort` 매개변수를 설정하여 모델이 답변을 찾는 사고 노력 수준(low, medium, high)을 제어할 수 있습니다.
용어 풀이
- Mixture-of-Experts
- 여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
- 추론 모델
- 답하기 전에 단계별로 생각하는 과정을 거치도록 만든 모델.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 검색 증강 생성
- 답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
이 모델은 어떤 고급 작업을 수행할 수 있나요?
단순한 자연어 생성 외에도 다단계 추론, 코드 작성, 검색 증강 생성(RAG), 그리고 외부 도구 호출 같은 다양한 고급 작업 수행을 목표로 해요. 결정적인 판단보다는 근거를 제시하고 옵션을 초안하는 조언자 역할에 적합하도록 설계되었어요.
모델 사용을 위해 어떤 기술적 준비가 필요한가요?
추론 기능을 사용하려면 `aleph-alpha-inference` 패키지를 설치하고 vLLM 플러그인을 이용해야 해요. 추론 및 도구 호출 같은 고급 기능은 특정 옵션을 통해 활성화할 수 있어요.