Qwen 기반 멀티모달 LLM 'Pistis' 기술 보고서 공개 — AI 생성 일러스트
리서치 연구공식 자료논문어제 발표

Qwen 기반 멀티모달 LLM 'Pistis' 기술 보고서 공개

Pistis Technical Report

arXiv9월 25일 발표 · 3분 · 프리프린트

Qwen 기반의 멀티모달 LLM인 Pistis 모델(27B/9B)이 독자적인 학습 프레임워크와 시스템 최적화 기법을 공개하며 성능 향상을 입증했습니다.

세 줄 요약arXiv 원문 기반
  1. 핵심 기술인 IDRL은 지식 증류와 강화학습을 교차 학습하여 에이전트의 장기적 추론 능력과 안정성을 효과적으로 극대화했습니다.
  2. 에이전트 특화 모델은 도구 사용 및 반복 추론에 강력하며, 파라미터 업데이트 없이 성능을 개선하는 PAH 시스템도 도입한 것이 특징입니다.
  3. Pistis는 단순한 모델 크기 경쟁을 넘어, 학습 방법론과 시스템 레벨의 최적화를 결합하여 종합적인 AI 성능 향상을 보여줍니다.

본 보고서는 Qwen3.6 및 Qwen3.5를 기반으로 개발된 27B 및 9B 규모의 (LLM) 계열인 Pistis 모델을 소개합니다. 이 모델들은 일반적이고 확장 가능한 후처리 학습 프레임워크를 통해 구축되었으며, 초기에는 대규모 멀티모달 지도 (SFT)으로 강력한 기반을 다집니다. 이후 독자적인 방법론인 Interleaved and (IDRL)을 적용하여 온-폴리시 증류와 강화 학습을 단일 훈련 루프 내에서 교차 통합합니다.

IDRL은 두 가지 목표를 분리하거나 정적 결합하는 대신 번갈아 최적화함으로써, 효과적인 지식 전이와 높은 최적화 안정성을 확보하며 장기 에이전트 추론 경로에 대한 정확한 기여도 할당을 가능하게 합니다. 이 프레임워크는 깊은 멀티모달 추론을 강화한 Pistis-Thinking과 에이전트 행동 궤적 데이터를 추가 통합하여 장기 계획, 반복 추론 및 도구 사용에 특화된 Pistis-Agentic 두 가지 전문 변형 모델을 생성했습니다.

모델 파라미터 최적화를 넘어, 시스템 레벨의 방법인 Pistis-Auto-Harnessing (PAH)도 도입되었습니다. PAH는 에이전트의 추론 하네스(inference harness)를 반복적인 최적화를 통해 자동으로 개선하는 시스템 기법입니다. 실험 결과에 따르면, PAH는 모델 파라미터를 업데이트하거나 상호작용 예산을 증가시키지 않으면서도 모델 성능을 향상시키는 것으로 나타났습니다.

용어 풀이

매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
멀티모달
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
Distillation
큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
Reinforcement Learning
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
원문arXiv · Pistis Technical Report오늘 이야기를 다 읽었어요고른 과정과 나머지 144개 보기
원문 보기arXiv