문맥 변화에 취약한 의사결정 모델의 신뢰성 문제 — AI 생성 일러스트
리서치 연구

문맥 변화에 취약한 의사결정 모델의 신뢰성 문제

JevOut: Natural Context Can Flip Decision Models

arXiv9월 24일 발표 · 2분 · 프리프린트

언어 기반 의사결정 모델(Jev)이 정답을 내리더라도, 주변에 자연스럽게 삽입되는 짧은 문맥 정보만으로도 결정 자체가 오답 방향으로 바뀔 수 있음이 확인되었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구 결과, 테스트된 여러 시스템에서 원래 정답이었던 의사결정의 60% 이상이 추가된 문맥을 통해 높은 확률로 오답 옵션을 선택하는 현상이 관찰되었습니다.
  2. 이러한 모델들은 실제 서비스에서 도구 사용이나 액션 트리거 등 핵심 기능과 직결되므로, 문맥 변화에 극도로 민감하다는 점은 시스템 신뢰성에 심각한 문제를 제기합니다.
  3. 따라서 의사결정 모델의 확률 출력을 맹신하기보다, 입력 컨텍스트 설계 전반에 대한 근본적인 취약성을 인지하고 재고할 필요가 있습니다.

Jev와 같은 전용 의사결정 모델은 비정형 언어를 유한 선택지 공간의 확률 분포로 매핑하여 요청 라우팅, 도구 선택 및 액션 트리거 등의 결정을 수행합니다. 그러나 실제 환경에서 입력되는 데이터는 배경 정보와 주변 문맥을 포함하는 경우가 많습니다. 연구진은 이러한 짧고 자연스러운 문맥 추가만으로도 원래 정확했던 결정이 오답 방향으로 바뀔 수 있음을 발견했습니다.

연구팀은 이 현상을 분석하기 위해, 초기에는 정답이었던 항목에 대해 틀린 목표 옵션을 고정하고 모델의 확률 출력을 이용해 문맥을 개선하는 최적화 과정을 거쳤습니다. 그 결과, Jev 모델은 508개의 처음에 올바른 결정 중 312개(61.4%)에서 방향 전환이 일어났으며, 이 중 229건에서는 고정된 오답 옵션에 최소 0.7의 확률을 할당하는 것이 확인되었습니다.

이러한 취약성은 다른 의사결정 시스템에서도 나타났습니다. 총 일곱 개의 데이터셋에서 세 가지 추가 결정 시스템은 초기 정답률 대비 64.9%~73.2%에 달하는 표적 전환율을 보였습니다. 연구진은 이러한 결과가 현재의 의사결정 모델들이 문맥 변화에 매우 민감하며, 그 확률 출력을 신뢰할 수 있는 최종 결정 인터페이스로 간주하는 것에 대한 근본적인 우려를 제기합니다.

원문arXiv · JevOut: Natural Context Can Flip Decision Models
원문 보기arXiv