한국 공공 API 기반 다단계 도구 호출 벤치마크 및 데이터 합성 방법론 — AI 생성 일러스트AI 일러스트
리서치 연구

한국 공공 API 기반 다단계 도구 호출 벤치마크 및 데이터 합성 방법론

Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe

arXiv9월 4일 발표 · 2분 · 심사 전 논문

공공 데이터 환경에서 필수적인 다단계 LLM 에이전트가 기존 모델의 성능 한계에 부딪히는 문제를 해결했습니다.

세 줄 요약arXiv 원문 기반
  1. 실제 API 실행 결과를 활용해 도구 간 데이터 흐름을 그래프화하는 'EDGE' 방법론으로, 9B 모델이 대형 모델에 근접한 높은 추론 능력을 보여주었습니다.
  2. 공공 데이터의 복잡하고 실질적인 다단계 추론 능력을 측정할 수 있는 새로운 벤치마크(KOPA-Bench)를 제시하여 학계에 기여했습니다.
  3. 특히 라이브 공공 API 호출 성공 여부를 기준으로 데이터 경로를 검증하여, 실제 운영 환경에 최적화된 강력한 추론 능력을 입증했습니다.

데이터 주권 규제에 따라 공공 기관들은 , 온프레미스 를 배포하여 라이브 정부 를 통해 여러 도구를 순차적으로 호출하는 능력이 요구됩니다. 그러나 기존의 오픈 소스 모델들은 이러한 다단계 설정에서 일관되게 성능 저하를 보였으며, 이 격차를 측정할 수 있는 가 부재했습니다. 이에 연구진은 한국 공공 API 벤치마크(KOPA-Bench)를 도입하여 총 145개의 실제 과제를 포함시켰습니다.

이러한 성능 격차를 해소하기 위해, 실행 기반 동적 그래프(EDGE)라는 데이터 합성 방법론을 제시했습니다. EDGE는 각 도구의 출력이 다른 도구의 입력으로 어떻게 연결될 수 있는지 그래프로 구축합니다. 특히 이 과정에서 실제 라이브 API 호출을 통해 성공적으로 작동하는 링크만을 걸러내어 검증된 다단계 실행 궤적을 합성하는 것이 핵심입니다.

이 방식으로 생성된 데이터셋을 활용하여 GRPO 기법으로 한 결과, 9B 모델은 동일 계열의 파인튜닝되지 않은 27B 모델과 거의 유사한 성능에 도달했습니다. 이 성과는 KOPA-Bench뿐만 아니라 BFCL 벤치마크에서도 상당한 개선을 입증하며 강력한 추론 능력을 보여주었습니다.

용어 풀이

오픈 소스
소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
원문arXiv · Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv