상태와 행동을 연결하는 대비 학습 언어 모델 CLM 소개
Contrastive-LM/CLM
GitHubCLM은 '상태(State)'와 '행동' 간의 관계를 대비 학습으로 연결한 새로운 시스템 모델입니다. 이는 복잡한 의사결정 과정에서 현재 상황을 분석하고 가장 적절한 다음 행동을 식별하는 데 특화되어 있습니다.
- 컴퓨터 사용, 게임, 도구 호출 등 다양한 작업에서 기존 모델과 동등하거나 더 우수한 성능을 보이며, 최대 9배 낮은 지연 시간(latency)을 구현했습니다.
- 상태와 행동 정보를 독립적으로 처리하고 임베딩을 재활용하는 구조 덕분에, 학습 및 추론 비용을 획기적으로 낮추면서도 매우 빠른 속도를 유지합니다.
- 대규모 Q&A 학습 외에도 합성 난이도 부정 사례와 에이전트 궤적을 활용한 다단계 미세 조정이 가능하여, 다양한 AI 에이전트에 통합하기 용이합니다.
대비적 언어 모델(Contrastive Language Models, CLMs)은 '상태(State)'와 '행동' 간의 관계를 대비 학습 목표로 연결한 새로운 시스템 원 모델입니다. 이 모델은 현재 상태를 기반으로 빠르고 일반화 가능한 의사결정을 수행하는 데 특화되어 있으며, 개발자들은 이를 TypeSafe 호환 를 통해 활용할 수 있습니다.
CLM-8B는 60M개의 Nemotron Q&A 쌍으로 사전 학습되었고, 30M개의 합성 난이도 부정 사례와 1M개의 궤적을 추가로 학습했습니다. 이 모델은 컴퓨터 사용, 게임 및 도구 호출 작업에서 Jev와 동등한 성능을 보이며 최대 9배 낮은 지연 시간(latency)을 구현합니다. 또한 상태와 행동 을 독립적으로 캐싱하고 재사용하는 구조 덕분에 추론 속도가 빠르고 효율적입니다.
CLM은 세 단계에 걸쳐 학습됩니다. 첫째, Nemotron DQA 질문-답변 쌍(~60M개)으로 광범위한 의미 표현을 학습합니다. 둘째, Gemini 2.5 Flash-Lite가 생성한 합성 난이도 부정 사례(~30M개)를 InfoNCE 손실에 추가하여 그럴듯하지만 틀린 행동에 대한 미세한 구별 능력을 개발합니다. 마지막으로 에이전트 데이터 프로토콜(ADP) 등에서 얻은 에이전트 궤적(~1M개)을 통해 상태-행동 쌍을 학습하며, 이는 다양한 AI 에이전트에 통합하기 용이하게 만듭니다.
사용자는 `client.system_one()`과 같은 API를 사용하여 현재 상태와 함께 긴급도(Noul), 부서 선택(Choice), 고객 좌절도(Score) 등 유형화된 질문을 던질 수 있습니다. 또한, 특정 상태에 대해 후보 목록을 직접 순위 매기는(`rank`) 기능도 제공하여, 별도의 작업 설정 없이 다양한 추론 작업을 수행할 수 있습니다.
용어 풀이
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.