ZDTaichu5.0-9B: 멀티모달 기반 공간 추론 모델 — AI 생성 일러스트AI 일러스트
모델 도구

ZDTaichu5.0-9B: 멀티모달 기반 공간 추론 모델

TaichuAI/ZDTaichu5.0-9B

Hugging Face발표일 미상 · 3분

ZDTaichu5.0-9B는 Qwen3.5-9B와 C-RADIOv4-H를 결합한 멀티모달 모델로, 텍스트, 이미지, 비디오 등 다양한 형태의 시각 정보를 통합적으로 이해합니다.

세 줄 요약Hugging Face 원문 기반
  1. 일반적인 시각 이해 능력은 물론, 공간 추론과 에이전트 활용 등 고난도 영역에서 비교 대상 모델 대비 최고 수준의 성능을 보여주었습니다.
  2. 단순 인식 수준을 넘어, 복잡한 문서 해석, 2D/3D 공간 이해, 그리고 다단계 에이전트 작업 수행의 핵심 기반 기술로 활용 가능합니다.
  3. 최대 128K 토큰의 긴 컨텍스트 처리가 가능하며, 에이전트 기능 활용 시에는 외부 애플리케이션을 통해 실행 및 보안 검증이 필요합니다.

ZDTaichu5.0-9B는 일반적인 시각 이해, 공간 추론, 도구 사용 및 체화된 AI 연구를 위한 파운데이션 모델입니다. 이 모델은 Qwen3.5-9B 언어 백본과 C-RADIOv4-H 비전 인코더를 결합했으며, 텍스트, 이미지(단일/다중), 그리고 비디오까지 처리할 수 있습니다. 최대 128K 의 컨텍스트 길이를 지원하며 모든 해상도의 시각 입력을 받아들입니다.

이 모델은 일반적인 문서, 차트, 다이어그램 및 OCR 이해를 넘어선 광범위한 기능을 제공합니다. 구체적으로는 시각 수학 문제 해결과 지식 기반 VQA(Visual Question Answering)가 가능하며, 2D 관계 해석, 다중 뷰 연관성, 3D 장면 이해 등 복잡한 공간 추론 능력을 갖추고 있습니다. 또한, 다단계 및 다회전 도구 사용을 위한 에이전트 기능과 체화된 AI 적응을 위한 공간 지각 및 어포던스 이해도 지원합니다.

다양한 결과에서 ZDTaichu5.0-9B는 여러 분야에서 선두적인 성능을 보였습니다. 특히, 비교 대상 10B 규모의 일반 목적 중 최고 수준의 공간 추론 능력을 보여 SparBench에서 51.82점(최고 기록)을 달성했습니다. 에이전트 기능 측면에서는 TAU2-Bench에서 87.7점을 기록하며 가장 강력한 성능을 입증했으며, ERQA와 RoboSpatial 등 체화된 상호작용 영역에서도 높은 점수를 받았습니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
VLM
이미지와 글을 함께 이해하는 모델.
원문Hugging Face · TaichuAI/ZDTaichu5.0-9B같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기