임상 언어 모델의 산술 오류를 위한 결정론적 솔버 연구
Towards a Deterministic Math Solver for Clinical Language Models
arXiv임상 언어 모델의 산술 오류 문제를 해결하기 위해, 직접 계산 대신 모델이 케이스별 Python 코드를 작성하고 제한된 실행기가 이를 결정론적으로 푸는 '프로그램-해결 인터페이스'를 제안했습니다.
- 실험 결과, 대규모 모델(32B)에서 이 방식은 단순 계산보다 유의미하게 높은 성능을 보였으며, 기존 수동 라이브러리 대비 더 넓은 범위에 적용 가능함을 입증했습니다.
- 단 하나의 오류도 치명적인 임상 환경에서, 이 방법론은 모델의 신뢰성을 높이고 복잡한 계산 과정을 투명하게 검증할 수 있는 새로운 접근법을 제시합니다.
- 다만, 이 인터페이스가 만능 해결책은 아니며, 여전히 정확한 공식 검증과 신뢰성 높은 변수 추출 과정이 필수적으로 요구된다는 한계점을 지닙니다.
(LLM)은 산술 계산에 있어 신뢰성이 떨어지는 문제가 있으며, 이는 단 하나의 수치 오류가 권고 사항을 바꿀 수 있는 임상 계산기 환경에서 심각한 문제입니다. 기존의 해결책으로는 각 계산기를 검증된 함수로 개별 하드코딩하는 방식이었습니다. 본 연구에서는 모델이 직접 계산하도록 하는 대신, 케이스에 특화된 Python 코드를 작성하고 제한된 로컬 실행기가 이를 결정론적으로 풀어내는 '프로그램-해결 인터페이스'를 대안으로 제시했습니다.
연구진은 이 프로그램-해결 인터페이스를 MedCalc-Bench Verified(1,100 케이스, 55 계산기)에서 평가했으며, Qwen2.5-7B와 Qwen2.5-32B-AWQ 모델을 사용했습니다. 그 결과, 7B 모델에서는 직접 산술 계산 대비 +3.29점의 성능 향상을 보였으나(95% CI: [-3.49, 10.38]), 32B 모델에서는 +7.05점의 유의미한 개선을 확인했습니다 (95% CI: [0.47, 14.60]).
또한 이 방식은 기존에 수동으로 작성된 라이브러리 대비 장점을 보였으나, 연구진은 이 인터페이스가 만능 해결책이 아니라고 지적합니다. 모델의 성능 향상을 위해서는 여전히 정확한 공식 검증과 신뢰성 높은 변수 추출 과정이 필수적으로 요구된다는 한계점도 함께 제시했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.