리서치 연구
한국 공공 API 기반 다단계 도구 호출 벤치마크 및 데이터 합성 방법론
Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe
arXiv공공 데이터 환경에서 필수적인 다단계 LLM 에이전트가 기존 모델의 성능 한계에 부딪히는 문제를 해결했습니다.
세 줄 요약
- 실제 API 실행 결과를 활용해 도구 간 데이터 흐름을 그래프화하는 'EDGE' 방법론으로, 9B 모델이 대형 모델에 근접한 높은 추론 능력을 보여주었습니다.
- 공공 데이터의 복잡하고 실질적인 다단계 추론 능력을 측정할 수 있는 새로운 벤치마크(KOPA-Bench)를 제시하여 학계에 기여했습니다.
- 특히 라이브 공공 API 호출 성공 여부를 기준으로 데이터 경로를 검증하여, 실제 운영 환경에 최적화된 강력한 추론 능력을 입증했습니다.
데이터 주권 규제에 따라 공공 기관들은 , 온프레미스 를 배포하여 라이브 정부 를 통해 여러 도구를 순차적으로 호출하는 능력이 요구됩니다. 그러나 기존의 오픈 소스 모델들은 이러한 다단계 설정에서 일관되게 성능 저하를 보였으며, 이 격차를 측정할 수 있는 가 부재했습니다. 이에 연구진은 한국 공공 API 벤치마크(KOPA-Bench)를 도입하여 총 145개의 실제 과제를 포함시켰습니다.
이러한 성능 격차를 해소하기 위해, 실행 기반 동적 그래프(EDGE)라는 데이터 합성 방법론을 제시했습니다. EDGE는 각 도구의 출력이 다른 도구의 입력으로 어떻게 연결될 수 있는지 그래프로 구축합니다. 특히 이 과정에서 실제 라이브 API 호출을 통해 성공적으로 작동하는 링크만을 걸러내어 검증된 다단계 실행 궤적을 합성하는 것이 핵심입니다.
이 방식으로 생성된 데이터셋을 활용하여 GRPO 기법으로 한 결과, 9B 모델은 동일 계열의 파인튜닝되지 않은 27B 모델과 거의 유사한 성능에 도달했습니다. 이 성과는 KOPA-Bench뿐만 아니라 BFCL 벤치마크에서도 상당한 개선을 입증하며 강력한 추론 능력을 보여주었습니다.
용어 풀이
- 오픈 소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.