에이전트의 다중 모달리티 능력을 확장하는 Omni-IO Skills
Omni-IO Skills: Harnessing Your Agent Omni-Native
arXiv기존 AI 에이전트가 텍스트, 이미지 등 다양한 모달리티에서 처리 능력이 파편화되는 문제를 해결하기 위해 'Omni-IO Skills'라는 플러그 앤 플레이형 에이전트 하네스가 개발되었습니다.
- 이 하네스는 계층적 스킬과 의존성 인식 오케스트레이션을 통해 복잡한 멀티 에셋 워크플로우를 관리하며, GPT-5.6 Sol 등의 입력 지원율을 100%까지 끌어올리는 성과를 보였습니다.
- 이 기술은 호스트 에이전트의 핵심 추론 코어를 변경하지 않고도 광범위하고 진화 가능한 '옴니' 시스템을 구축할 수 있는 실용적인 방법을 제시합니다.
- 결국, 모든 기능을 통합한 단일 모델을 대체하기보다 기존 에이전트의 능력을 보조하는 모듈식 하네스 역할을 수행하여 확장성을 극대화한다는 점에 주목해야 합니다.
일반 목적 는 장기적인 계획, 추론 및 행동을 수행할 수 있지만, 텍스트, 이미지, 오디오, 비디오, 문서, 3D 자산, 코드 등 다양한 모달리티 전반에 걸쳐 처리 능력이 파편화되는 문제가 있습니다. 기존의 방식을 확장하는 것은 비용이 많이 드는 모델 업데이트를 필요로 하거나, 전문 모델과 도구를 조합할 경우 절차, 의존성 관리, 중간 자산 조정 등의 복잡한 문제가 남아있었습니다.
이를 해결하기 위해 Omni-IO Skills라는 플러그 앤 플레이형 에이전트 하네스가 개발되었습니다. 이 시스템은 계층적 스킬, 표준화된 실행 인터페이스, 의존성 인식 오케스트레이션 및 영구 자산 레지스트리(Asset Registry)를 통해 기존 에이전트를 옴니-네이티브하게 만듭니다. 다중 자산 워크플로우는 'Declare Execution Graphs'로 표현되어 독립적인 작업을 동시에 예약하고, 성공적으로 출력된 결과를 다운스트림 및 교차 턴 재사용을 위해 등록합니다.
Omni-IO Skills는 총 27개의 스킬을 통해 7가지 아티팩트 모달리티와 4가지 역량군(이해, 생성, 추론, 검색)에 걸친 38개의 대표 작업을 지원합니다. UniM-90 테스트에서 이 하네스는 GPT-5.6 Sol의 입력 지원율을 40.00%에서 100%까지 높였으며, Claude Sonnet 5의 경우 Semantic--Quality Coupled Score를 26.99에서 74.94로, Strict Structure Score는 100.00에 도달하는 등 높은 성능을 입증했습니다.
이러한 결과들은 호스트 에이전트의 핵심 추론 코어를 변경하지 않고도 하네스 수준의 능력 조합(harness-level capability composition)을 통해 광범위하고 진화 가능한 옴니 시스템을 구축할 수 있는 실용적인 경로를 제시합니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.