AI 에이전트 연구
계약 준수 검증을 위한 절차적 지침 매칭 프레임워크, ContractEval
ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance
arXivLLM 에이전트가 복잡한 절차를 수행할 때 발생하는 미묘하고 구조적인 오류를 진단하는 프레임워크, ContractEval을 소개합니다.
세 줄 요약
- ContractEval은 절차적 지침을 '활성 의무'로 정의하고, 이를 응답 및 실행 기록과 대조하여 누락, 순서 오류 등 구체적인 구조적 위반을 식별합니다.
- 기존 평가 방식이 놓치기 쉬운, 절차 수행 과정상의 의무 위반(structural failures)을 명확히 찾아내어 시스템의 신뢰도를 높일 수 있습니다.
- 다만, 이 도구는 절차적 준수를 '감사(audit)'할 수 있게 돕는 것이며, LLM 기반 추출 정확도에 의존하므로 완벽한 보장은 아님을 유념해야 합니다.
가 단순 질문 답변을 넘어 복잡한 절차를 수행하게 되면서, 시스템의 오류가 눈에 띄지 않는 방식으로 발생할 수 있습니다. 기존의 출력 기반 평가나 추적 기록 기반 판단 방식으로는 어떤 의무(obligation)가 활성화되었는지 식별하기 어렵다는 문제가 제기되었습니다.
이에 따라 연구진은 'CONTRACTEVAL'이라는 진단 프레임워크를 도입했습니다. 이 프레임워크는 절차적 지침을 '쿼리-활성 의무(query-active obligations)'로 정의하고, 이를 응답이나 실행 기록의 증거와 대조합니다. 이를 통해 누락된 단계, 잘못된 분기 처리, 순서 오류, 불변 조건 위반 등 다양한 구조적 위반 사항들을 명확히 식별할 수 있습니다.
통제된 절차 계약 세트를 대상으로 테스트했을 때, 기존 평가 방식으로는 놓치기 쉬운 구조적 실패를 ContractEval은 감지하고 위치시킬 수 있었습니다. 다만, 이 도구는 완벽한 준수 보장(compliance guarantee)이 아니라, 절차적 준수를 감사(auditable)할 수 있도록 돕는 역할을 합니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.