건물 KG용 자연어-SPARQL 변환 벤치마크 발표
Build2SPARQL: A Large-Scale Text-to-SPARQL Benchmark Dataset for Building Knowledge Graph Querying
arXiv건물 자동화 시스템의 지식 그래프(KG)를 활용하여 자연어 질문을 SPARQL 쿼리로 변환하는 대규모 벤치마크 데이터셋인 Build2SPARQL이 공개되었습니다.
이 데이터셋은 인공지능이 복잡한 건물 시스템의 지식 그래프에 대해 자연어 질문을 던지고 답변을 얻을 수 있게 하여 빌딩 운영 효율성을 높일 핵심 기반 기술이에요.
- 본 데이터셋은 201개 건물 KG를 기반으로 총 3만여 개의 질문과 실행 가능한 SPARQL 쿼리를 제공하며, 검색 증강 기법 적용 시 성능 향상이 두드러집니다.
- 이는 인공지능이 복잡한 건물 시스템의 지식 그래프에 대해 자연어 질의응답을 수행할 수 있게 하여 빌딩 운영 효율성을 높일 핵심 기반 기술입니다.
- 데이터셋은 쿼리 정확도를 보장하기 위해 SPARQL 검증을 별도의 그래프 탐색 코드로 분리했으며, 평가 결과 검색 증강 방식이 성능 향상에 결정적임을 입증했습니다.
빌딩 자동화 시스템은 Brick이나 ASHRAE 223P 같은 온톨로지를 사용하여 의미론적 지식 그래프(KG) 형태로 표현되고 있으며, 이는 인공지능 응용 분야를 위한 기계 판독 가능 기반을 제공합니다. 이 중 유망한 응용 사례는 자연어 질문을 SPARQL 쿼리로 변환하는 것인데, 이를 위해 대규모의 자연어/SPARQL 가 필요하지만 그 자료가 부족했습니다. 이에 Build2SPARQL은 건물 KG를 위한 대규모 벤치마크 데이터셋으로 제시되었습니다.
이 데이터셋은 SPARQL 쿼리 생성 및 검증을 그래프 탐색 코드로 완전히 수행하고, (LLM)이 자연어 질문만 생성하도록 하여 쿼리 정확도가 모델 동작에 의존하지 않도록 설계되었습니다. 이 파이프라인은 선형 체인, 분기, UNION, 집계 등 여섯 가지 질의 패턴군을 마이닝했으며, 201개의 건물 KG(Brick 180개, ASHRAE 223P 21개)에 적용하여 총 6,136개의 실행 가능한 SPARQL 쿼리와 30,680개의 질문을 산출했습니다.
평가 결과, 300개의 질문에 대한 두 명의 평가자 검증에서 98.8%의 의미적 충실도와 자연스러움이 확인되었습니다. 특히 세 가지 오픈 언어 모델을 활용한 검색 증강(retrieval-augmented) 평가를 진행했을 때, 정확도는 기준 0.2~20%에서 쓰리샷 검색 시 56~65%까지 크게 향상되는 것이 입증되었습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.
검색 증강 방식이 왜 중요한가요?
평가 결과, 검색 증강 방식을 사용했을 때 정확도가 크게 향상되는 것이 입증되었어요. 제로샷 기준으로는 0.2~20%였던 정확도가 쓰리샷 검색 시에는 56~65%까지 높아졌답니다.
어떤 종류의 건물 시스템을 다루나요?
빌딩 자동화 시스템에 사용되는 온톨로지 기반의 의미론적 지식 그래프(KG)를 활용해요. Brick이나 ASHRAE 223P 같은 KG가 적용되었어요.