전력망 장애 분석을 위한 지리-시간적 KGQA 벤치마크 개발
GeoOutageBench: Benchmarking Ambiguity-aware, Ontology-grounded Geospatiotemporal KGQA for Multimodal Power Outage and Resilience Analysis
arXivLLM 기반의 지리-시간적 지식 그래프 질의응답(KGQA) 성능을 평가하는 새로운 벤치마크, 'GeoOutageBench'가 개발되었습니다.
- 기존 웹 지식을 넘어 전력망 장애 기록, 원격 감지, 날씨 등 다양한 모달리티의 공간-시간 데이터를 통합하여 사용합니다.
- 단순 검색 정확도를 넘어 복잡하고 모호한 실제 인프라 관련 질문에 대한 LLM의 추론 능력을 평가하는 기준을 제시합니다.
- 특히 자연어 해석(NL to SPARQL), 온톨로지 활용성 검증, 가설적 상황 분석 등 고도화된 지식 그래프 기반 분석이 가능합니다.
기반의 지리-시간적 지식 그래프 질의응답(KGQA) 성능을 평가하기 위해 'GeoOutageBench'가 소개되었다. 이 는 기존 웹 지식을 다루던 KGQA와 달리, 전력망 장애 기록, 원격 감지 데이터, 날씨 관측 자료 등 시각적, 텍스트적, 구조화된 데이터를 통합한 공간-시간적 지식 그래프(spatiotemporal KG)를 활용한다. 이를 통해 복합적인 모달리티 기반의 정전 및 회복 탄력성 분석을 목표로 한다.
GeoOutageBench는 단순 검색 정확도를 넘어 다양한 난이도의 역량 질의 분류 체계를 제공한다. 이 체계는 공간-시간적 포함 관계나 근접도 분석부터, 시공간 동시 발생 분석, 다중 모달리티 증거 활용, 그리고 가설적 평가에 이르기까지 폭넓은 영역을 포괄하며, 실제 인프라 회복 탄력성 분석을 지원하는 LLM-KG 시스템의 기초를 제공한다.
특히 이 벤치마크는 세 가지 고도화된 과제를 사용자 설정 방식으로 평가할 수 있도록 설계되었다. 첫째, 자연어(NL) 질문이 모호한 지리-시간적 상황에서 SPARQL 해석 능력을 측정하며, 둘째, 온톨로지 활용성을 질의 기반으로 평가하고, 셋째, 다중 모달리티 KGQA 검색의 답변 정확도를 검증한다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.