리서치 연구
DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents
ARarXiv
기존 AI 모델들이 차트 이해를 독립적으로 평가했다면, DocHop은 문서의 서사적 맥락을 활용하여 여러 차트에 흩어진 데이터를 종합하는 복합 추론 능력을 측정합니다.
세 줄 요약
- 테스트 결과, 최고 성능의 모델도 인간의 정확도(90% 이상)에 크게 미치지 못했으며, 특히 추론 과정이 복잡해질수록 성능 저하가 관찰되었습니다.
- DocHop은 단순 시각 정보 읽기를 넘어 문서 전체의 논리 구조를 파악하고 데이터를 통합하는 차세대 AI 모델 개발을 위한 중요한 기준점을 제시합니다.
- 통제된 환경에서 다단계 문서 추론 능력을 테스트할 수 있는 강력한 벤치마크이지만, 모델 성능이 추론 과정의 복잡도와 깊이에 따라 크게 저하되는 경향을 보입니다.
기존 AI 모델들이 차트 이해를 독립적으로 평가했다면, DocHop은 문서의 서사적 맥락을 활용하여 여러 차트에 흩어진 데이터를 종합하는 복합 추론 능력을 측정합니다.