세무 추론 시스템에서 모순을 포착하는 방법 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

세무 추론 시스템에서 모순을 포착하는 방법 연구

Solving versus Verifying: Catching Contradictions in Tax Reasoning Systems

arXiv9월 9일 발표 · 3분 · 심사 전 논문

LLM이 세무 문제 해결 시, 입력 데이터에 누락이나 모순 같은 결함이 있을 경우 오류를 감지하지 못하고 잘못된 결과를 도출하는 취약점이 발견되었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구 결과, 모델에게 단순히 답을 구하기보다 입력 데이터의 '모순 여부'를 먼저 검증하도록 요청하면, 결함 데이터를 효과적으로 식별할 수 있음이 확인되었습니다.
  2. 이는 높은 정확도(깨끗한 데이터 기준)만으로는 충분하지 않으며, 간단하고 저렴한 자체 점검 과정을 통해 시스템 전체의 신뢰도를 높일 수 있음을 시사합니다.
  3. 제안된 '모순 검증 게이트'는 별도의 학습이나 외부 도구 없이 단 한 번의 추가 호출로 구현 가능하며, 성능 저하도 최소화할 수 있습니다.

(LLM)은 법규 기반의 세금 계산 문제 중 90%가 넘는 잘 구성된 사례에서는 정확한 세금 부채를 산출할 수 있어, 세무 자문 및 컴플라이언스 시스템에 활용될 잠재력이 높습니다. 그러나 실제 법률 입력 데이터는 종종 결함이 있습니다. 즉, 필요한 사실 정보가 누락되었거나 제시된 사실들끼리 모순되는 경우가 많으며, 이러한 결함을 가진 입력 데이터를 그대로 처리하는 모델은 아무런 이상 신호 없이 자신감 있는 수치를 반환하는 문제가 발생합니다.

연구진은 이 문제를 해결하기 위해 모델에게 단순히 사례를 '해결(solve)'하도록 요청하는 것과 달리, 입력 데이터의 '모순 여부'를 먼저 '검증(verify)'하도록 요청할 때 결함 데이터를 효과적으로 식별할 수 있음을 확인했습니다. 가장 강력한 모델들은 사실이 누락된 경우에는 계산을 거부하지만, 주입된 모순에도 불구하고 계산을 진행하여 깨끗한 입력에 대한 답을 63-76%의 확률로 반환하는 경향을 보였습니다. 이 경우 검증 요청 시에는 대부분의 모순을 플래그 할 수 있었습니다.

이러한 발견을 바탕으로, 연구진은 '모순 검증 게이트(contradiction gate)'라는 간단한 방식을 제안했습니다. 이는 단 한 번의 추가 호출만으로 구현 가능하며 별도의 학습이나 외부 도구가 필요 없습니다. 이 방법은 깨끗한 입력에 대한 정확도 손실을 최대 약 5 퍼센트 포인트로 유지하면서, 모델이 놓쳤던 모순 검출 기능을 대부분 복구할 수 있어 시스템의 신뢰도를 높일 수 있음을 시사합니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Solving versus Verifying: Catching Contradictions in Tax Reasoning Systems같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv