클라우드플레어의 다중 모드 의사결정 모델 'Clef' 소개
Cloudflare/clef
클라우드플레어가 다중 모드 기반의 의사결정 모델 'Clef'를 공개했습니다. 이 모델은 텍스트, 이미지, 비디오 등 다양한 형태의 상태 정보를 입력받아 구조화된 질문에 대한 확률적 답변을 제공합니다.
이 모델은 텍스트뿐만 아니라 이미지나 비디오 같은 다양한 형태의 정보를 종합하여 복잡한 의사결정 과정에서 높은 정확도의 구조화된 답변을 제공해요.
- Clef는 자유 형식 텍스트 생성을 배제하고, 미리 정의된 선택지나 순위 기반의 구조화된 출력만 가능하게 설계되어 복잡한 의사결정 과정에서 높은 정확도를 보장합니다.
- 금융이나 고객 서비스 등 전문 비즈니스 워크플로우에 특화되었으며, 성능이 우수한 Clef-flash와 같은 경량 모델도 함께 제공됩니다.
- Qwen3.8을 기반으로 하는 이 모델은 사용 시 입력 상태(state)와 질문 스키마를 명확히 정의해야 하므로, 시스템 맞춤형 정교한 데이터 전처리 과정이 필수적입니다.
Clef는 27B 규모의 모델로, 주어진 상태 정보와 구조화된 질문 스키마를 입력받아 최종적인 의사결정을 수행합니다. 이 모델은 텍스트, JSON, 이미지 또는 비디오 등 다양한 형태의 '상태(state)' 정보를 읽어들이며, 모든 허용 옵션에 대한 확률을 단일 순방향 패스(forward pass)로 반환하는 것이 특징입니다. Clef는 자유 형식의 텍스트 생성을 배제하고 구조화된 출력만을 제공합니다.
Clef는 Qwen3.8-27B를 기반으로 후처리되었으며, 백본 모델과 결합된 'Joint schema head'를 통해 상태 정보에서 각 질문으로 증거(evidence)를 라우팅하고 모든 옵션의 점수를 공동으로 산출합니다. 사용자는 입력 레코드에 상황을 설명하는 `state`와 함께, `choice`(선택지), `score`(순위), 또는 `noul`(참/거짓) 유형으로 질문 스키마를 명확히 정의해야 합니다.
Clef 는 Jev 및 SystemOne과 완벽하게 호환되며, 해당 시스템의 POST 요청 본문을 처리하고 결과를 반환합니다. 또한, 사용자는 레코드에 PIL 이미지나 비디오 프레임 배열을 추가하여 미디어 입력을 함께 처리할 수 있습니다. 이 모델은 복잡한 의사결정 과정에서 높은 구조적 정확도를 제공하는 것이 핵심입니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
Clef는 어떤 종류의 정보를 입력받아 의사결정을 하나요?
이 모델은 주어진 상태 정보와 구조화된 질문 스키마를 입력받아 의사결정을 수행해요. 텍스트, JSON, 이미지, 비디오 등 다양한 형태의 '상태' 정보를 읽어들일 수 있으며, 미디어 입력을 함께 처리할 수도 있어요.
Clef는 왜 자유 형식의 답변을 제공하지 않나요?
Clef는 구조화된 출력만을 제공하도록 설계되었기 때문이에요. 자유 형식의 텍스트 생성을 배제하고, 미리 정의된 선택지나 순위 기반의 구조화된 결과만 반환하여 복잡한 의사결정에서 높은 정확도를 보장해요.
Clef 모델은 어떤 기술적 기반을 사용하고 있나요?
Clef는 Qwen3.8-27B를 기반으로 후처리되었어요. 백본 모델과 결합된 'Joint schema head'라는 것을 통해 상태 정보에서 각 질문으로 증거를 라우팅하고 모든 옵션의 점수를 공동으로 산출해요.