AI 에이전트 연구

오디오-비주얼 추론을 위한 다단계 에이전트 프레임워크 'OmniSeek'

OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

ARarXiv10월 1일 발표 · 3분 · 프리프린트

오디오와 비주얼 정보를 결합한 복잡한 추론을 위해 'OmniSeek'이라는 에이전트 프레임워크가 개발되었습니다. 이 시스템은 모든 데이터를 수동으로 처리하는 대신, 필요한 증거를 능동적으로 찾아내는 것이 특징입니다.

왜 중요해요AI 정리

오디오와 비주얼 정보가 결합된 복잡한 콘텐츠에서 필요한 증거를 능동적으로 찾아내며 다단계 추론을 할 수 있게 되었어요.

세 줄 요약arXiv 원문 기반
  1. 추론 과정 자체에 증거 수집 단계를 포함시켜, 긴 맥락 속에서 필요한 시점과 모달리티(시각/청각)를 동적으로 결정합니다. 특히 두 양식 모두가 필수일 때만 보상하는 '필요성 목표'로 성능을 높였습니다.
  2. 이 기술은 기존 모델의 한계를 넘어, 길고 복잡한 오디오-비주얼 콘텐츠에서 핵심 정보를 능동적으로 추출하고 다단계 추론을 가능하게 합니다. 이는 미디어 이해 및 AI 에이전트 성능 향상에 큰 진전을 의미합니다.
  3. 시스템 구현을 위해 오디오와 비주얼 증거가 교차하는 'OmniTraj-170K'라는 대규모 데이터셋이 구축되었으며, 다단계 강화 학습으로 모델을 훈련했습니다. 고품질의 복합 모달리티 데이터 확보가 핵심입니다.

연구진은 Omni Large Language Model(Omni-)을 능동적인 다단계 추론 로 변환하는 에이전트 프레임워크인 OmniSeek을 제시했습니다. 이 시스템은 전체 오디오-비주얼 시퀀스를 단일 순방향 패스로 수동 처리하기보다, 증거 획득 자체를 추론 과정에 포함시킵니다. 따라서 긴 컨텍스트 내에서 다른 모달리티 전반에 걸쳐 희소하지만 중요한 증거를 검색할지, 들을지를 동적으로 결정합니다.

OmniSeek은 반복적인 다단계 프로토콜을 통해 작동하며, 검색된 원본 오디오 또는 비주얼 세그먼트를 컨텍스트에 다시 추가하여 후속 추론을 지원합니다. 이 기능을 구현하기 위해 OmniTraj-170K라는 대규모 데이터 엔진이 구축되었으며, 이는 교차하는 오디오 및 비주얼 증거를 포함한 다단계 사고 과정() 코퍼스입니다. 모델은 두 단계의 과 함께 양식 모두에 의존하는 성공적인 궤적에 보상을 주는 '오디오-비주얼 필요성 목표'로 최적화되었습니다.

광범위한 를 통해 실험된 결과, OmniSeek은 적응적인 교차 모달 증거 탐색 능력을 학습했으며 오디오-비주얼 추론 성능을 지속적으로 향상시키는 것으로 나타났습니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
Chain-of-Thought
답에 이르는 생각 과정을 단계별로 적게 해서 정확도를 높이는 방법.
강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
궁금한 점AI 정리 · 원문 기반
OmniSeek은 오디오-비주얼 콘텐츠를 어떻게 처리하나요?

전체 시퀀스를 한 번에 처리하는 대신, 증거 획득 자체를 추론 과정에 포함시켜요. 긴 컨텍스트 내에서 필요한 모달리티(시각 또는 청각)를 동적으로 결정합니다.

'OmniTraj-170K' 데이터셋은 어떤 역할을 하나요?

이 데이터셋은 교차하는 오디오 및 비주얼 증거를 포함한 다단계 사고 과정(Chain-of-Thought) 코퍼스예요. 이를 통해 모델이 검색된 원본 세그먼트를 컨텍스트에 다시 추가하여 후속 추론을 지원할 수 있게 되었어요.

모델의 성능은 어떤 목표로 최적화되었나요?

모델은 양식 모두가 필수일 때만 보상을 주는 '오디오-비주얼 필요성 목표'로 최적화되었습니다. 이 덕분에 두 모달리티에 의존하는 성공적인 추론 과정에서 높은 성능을 보여요.

원문arXiv · OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning
궁금한 점 3개AI 정리