ZDTaichu5.0-9B: 멀티모달 기반 공간 추론 모델
TaichuAI/ZDTaichu5.0-9B
Hugging FaceZDTaichu5.0-9B는 Qwen3.5-9B와 C-RADIOv4-H를 결합한 멀티모달 모델로, 텍스트, 이미지, 비디오 등 다양한 형태의 시각 정보를 통합적으로 이해합니다.
- 일반적인 시각 이해 능력은 물론, 공간 추론과 에이전트 활용 등 고난도 영역에서 비교 대상 모델 대비 최고 수준의 성능을 보여주었습니다.
- 단순 인식 수준을 넘어, 복잡한 문서 해석, 2D/3D 공간 이해, 그리고 다단계 에이전트 작업 수행의 핵심 기반 기술로 활용 가능합니다.
- 최대 128K 토큰의 긴 컨텍스트 처리가 가능하며, 에이전트 기능 활용 시에는 외부 애플리케이션을 통해 실행 및 보안 검증이 필요합니다.
ZDTaichu5.0-9B는 일반적인 시각 이해, 공간 추론, 도구 사용 및 체화된 AI 연구를 위한 파운데이션 모델입니다. 이 모델은 Qwen3.5-9B 언어 백본과 C-RADIOv4-H 비전 인코더를 결합했으며, 텍스트, 이미지(단일/다중), 그리고 비디오까지 처리할 수 있습니다. 최대 128K 의 컨텍스트 길이를 지원하며 모든 해상도의 시각 입력을 받아들입니다.
이 모델은 일반적인 문서, 차트, 다이어그램 및 OCR 이해를 넘어선 광범위한 기능을 제공합니다. 구체적으로는 시각 수학 문제 해결과 지식 기반 VQA(Visual Question Answering)가 가능하며, 2D 관계 해석, 다중 뷰 연관성, 3D 장면 이해 등 복잡한 공간 추론 능력을 갖추고 있습니다. 또한, 다단계 및 다회전 도구 사용을 위한 에이전트 기능과 체화된 AI 적응을 위한 공간 지각 및 어포던스 이해도 지원합니다.
다양한 결과에서 ZDTaichu5.0-9B는 여러 분야에서 선두적인 성능을 보였습니다. 특히, 비교 대상 10B 규모의 일반 목적 중 최고 수준의 공간 추론 능력을 보여 SparBench에서 51.82점(최고 기록)을 달성했습니다. 에이전트 기능 측면에서는 TAU2-Bench에서 87.7점을 기록하며 가장 강력한 성능을 입증했으며, ERQA와 RoboSpatial 등 체화된 상호작용 영역에서도 높은 점수를 받았습니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- VLM
- 이미지와 글을 함께 이해하는 모델.