계약 준수 검증을 위한 절차적 지침 매칭 프레임워크, ContractEval — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

계약 준수 검증을 위한 절차적 지침 매칭 프레임워크, ContractEval

ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance

arXiv9월 10일 발표 · 2분 · 심사 전 논문

LLM 에이전트가 복잡한 절차를 수행할 때 발생하는 미묘하고 구조적인 오류를 진단하는 프레임워크, ContractEval을 소개합니다.

세 줄 요약arXiv 원문 기반
  1. ContractEval은 절차적 지침을 '활성 의무'로 정의하고, 이를 응답 및 실행 기록과 대조하여 누락, 순서 오류 등 구체적인 구조적 위반을 식별합니다.
  2. 기존 평가 방식이 놓치기 쉬운, 절차 수행 과정상의 의무 위반(structural failures)을 명확히 찾아내어 시스템의 신뢰도를 높일 수 있습니다.
  3. 다만, 이 도구는 절차적 준수를 '감사(audit)'할 수 있게 돕는 것이며, LLM 기반 추출 정확도에 의존하므로 완벽한 보장은 아님을 유념해야 합니다.

가 단순 질문 답변을 넘어 복잡한 절차를 수행하게 되면서, 시스템의 오류가 눈에 띄지 않는 방식으로 발생할 수 있습니다. 기존의 출력 기반 평가나 추적 기록 기반 판단 방식으로는 어떤 의무(obligation)가 활성화되었는지 식별하기 어렵다는 문제가 제기되었습니다.

이에 따라 연구진은 'CONTRACTEVAL'이라는 진단 프레임워크를 도입했습니다. 이 프레임워크는 절차적 지침을 '쿼리-활성 의무(query-active obligations)'로 정의하고, 이를 응답이나 실행 기록의 증거와 대조합니다. 이를 통해 누락된 단계, 잘못된 분기 처리, 순서 오류, 불변 조건 위반 등 다양한 구조적 위반 사항들을 명확히 식별할 수 있습니다.

통제된 절차 계약 세트를 대상으로 테스트했을 때, 기존 평가 방식으로는 놓치기 쉬운 구조적 실패를 ContractEval은 감지하고 위치시킬 수 있었습니다. 다만, 이 도구는 완벽한 준수 보장(compliance guarantee)이 아니라, 절차적 준수를 감사(auditable)할 수 있도록 돕는 역할을 합니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문arXiv · ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv