임상 LLM 에이전트의 행동 신뢰성 검증 필요성 — AI 생성 일러스트AI 일러스트
리서치 연구

임상 LLM 에이전트의 행동 신뢰성 검증 필요성

Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs

arXiv9월 15일 발표 · 2분 · 심사 전 논문

임상 LLM 에이전트가 동일한 환자 데이터를 입력받아도, 실행할 때마다 다른 의료 처방이나 행동을 내보내는 '행동 수준의 불일치' 현상이 발견되었습니다.

세 줄 요약arXiv 원문 기반
  1. 기존 임상 AI 벤치마크는 단일 시도의 최종 점수만 측정하여, 실제로는 행동 자체에서 큰 편차가 발생해도 이를 포착하지 못하는 한계가 있습니다.
  2. 따라서 의료 시스템의 신뢰성을 확보하려면 단순히 진단 결과뿐 아니라, 동일 입력에 대해 처방 과정이 반복적으로 일관적인지 검증하는 평가 방식 도입이 필수적입니다.
  3. 향후 임상 에이전트 벤치마크는 점수 기반 테스트를 넘어 '동일 입력 재실행(same-input rerun)'을 통해 행동 안정성을 측정해야 합니다.

기존 임상 AI 는 동일한 입력(identical inputs)에 대해 같은 진단 결과(verdict)를 보고하더라도, 실제로는 실행할 때마다 완전히 다른 의료 처방이나 의뢰서(materially different order)를 내보내는 '행동 수준의 불일치' 현상이 발생할 수 있습니다. 현재 벤치마크는 일반적으로 태스크당 단일 시도의 점수만 측정하여 이러한 행동적 편차를 포착하지 못하는 한계가 지적되었습니다.

이러한 격차를 측정하기 위해 연구진은 '동일 입력 재실행(same-input rerun)' 방식을 도입했습니다. 이 방식은 입력을 고정하고 태스크를 반복 실행하여 점수 대신 실제 처방 내용을 비교합니다. 해당 연구는 50개 태스크, 1000회의 MedAgentBench 실행을 통해 두 개의 오픈 모델과 다양한 온도를 적용하며 신뢰성 지표를 측정했습니다.

연구 결과, 행동 수준의 발산(action-level divergence)이 존재함이 확인되었습니다. 예를 들어, 온도 0.7인 8B 모델의 경우, 43개 모든 처방 그룹이 동일한 입력에 대해 다섯 번의 반복 실행 동안 서로 다른 순서의 처방을 내보내는 것으로 나타났습니다. 이는 점수만으로는 포착할 수 없는 중요한 신뢰성 문제입니다.

용어 풀이

벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv