클라우드플레어의 멀티모달 의사결정 모델 'Clef-Flash'
Cloudflare/clef-flash
클라우드플레어가 공개한 Clef-Flash는 90억 개(9B) 규모의 멀티모달 모델로, 주어진 상황 정보와 구조화된 질문 스키마를 기반으로 명확한 의사결정 결과를 도출하는 데 특화되어 있습니다.
복잡한 업무 흐름에서 자유로운 텍스트 생성 없이 정해진 구조에 따라 명확하고 정확한 의사결정 결과를 얻을 수 있다는 점이 중요해요.
- 텍스트, JSON, 이미지, 비디오 등 다양한 형태의 입력을 처리하며, 자유 형식 텍스트 생성 없이 각 선택지별 확률을 단일 순방향 계산(forward pass)으로 반환하는 것이 핵심 특징입니다.
- 청구서 검토나 고객 서비스 같은 복잡한 업무 워크플로우에서 높은 정확도를 보였으며, 특히 낮은 지연 시간 덕분에 실시간 의사결정 시스템 구축에 매우 유리합니다.
- 이 모델은 선택지(choice), 참/거짓(noul), 순위(score) 등 정해진 구조의 질문에 최적화되어 있으므로, 입력 데이터가 사전에 정의된 스키마를 따라야 합니다.
Clef-Flash는 90억 개(9B) 규모의 모델로, 주어진 상태 정보와 구조화된 질문 스키마를 기반으로 명확한 의사결정 결과를 도출하는 데 특화되어 있습니다. 이 모델은 텍스트뿐만 아니라 JSON, 이미지 또는 비디오 등 다양한 형태의 '상태(state)' 입력을 읽어들이며, 단일 순방향 계산을 통해 각 질문에 허용된 모든 선택지에 대한 확률을 반환합니다. 특히 자유 형식의 텍스트 생성이나 출력 파싱 과정이 없어 구조화된 의사결정 작업에 최적화되어 있습니다.
Clef-Flash는 Qwen3.5-9B를 기반으로 후속 학습(post-trained)되었으며, 비전 인코더와 결합된 '공동 스키마 헤드(joint schema head)' 구조를 가집니다. 이 헤드는 백본의 최종 은닉 상태로부터 증거를 각 질문으로 라우팅하고 모든 선택지를 공동으로 점수화합니다. 또한 Clef-Flash 는 Jev 및 SystemOne과 완벽하게 호환되며, 사용자는 `choice`(명시적 옵션), `score`(순서가 있는 옵션), 또는 `noul`(참/거짓) 등 정의된 구조에 따라 질문을 구성할 수 있습니다.
모델은 입력 데이터의 상태(state)와 질문 목록(questions)을 받아 처리하며, 이미지나 비디오 같은 미디어 데이터를 포함하는 경우에도 이를 기록으로 인코딩하여 사용할 수 있습니다. 예를 들어, 첨부된 영수증과 같은 이미지를 '상태'로 제공하고, 해당 영수증의 총액 가독성 여부를 판단하는 질문을 추가할 수 있습니다.
실제 업무 워크플로우 테스트 결과에 따르면, Clef-Flash는 고객 서비스와 관련된 시나리오에서 77.0%의 정확도를 기록하며 높은 성능을 보였습니다. 또한 이 모델은 구조화된 의사결정 작업에 특화되어 있어, 입력 데이터가 사전에 정의된 스키마를 따르는 환경에서 특히 강점을 가집니다.
용어 풀이
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
어떤 형태의 데이터를 입력으로 처리할 수 있나요?
텍스트뿐만 아니라 JSON, 이미지, 비디오 등 다양한 형태의 '상태' 입력을 읽어들일 수 있어요. 예를 들어, 첨부된 영수증 같은 이미지를 상태로 제공하고 질문을 추가하여 사용할 수 있습니다.
이 모델은 어떤 종류의 의사결정 작업에 특화되어 있나요?
주어진 상태 정보와 구조화된 질문 스키마를 기반으로 명확한 의사결정 결과를 도출하는 데 특화되어 있어요. 자유 형식의 텍스트 생성이나 출력 파싱 과정이 없어 구조화된 의사결정 작업에 최적화되어 있습니다.
모델은 어떤 방식으로 의사결정 결과를 반환하나요?
단일 순방향 계산을 통해 각 질문에 허용된 모든 선택지에 대한 확률을 반환해요. 이 방식 덕분에 구조화된 의사결정 작업에 매우 유리하며, 실시간 시스템 구축에도 적합합니다.