LLM 생성 규칙 기반 심장병 예측 모델 성능 평가 — AI 생성 일러스트
리서치 연구

LLM 생성 규칙 기반 심장병 예측 모델 성능 평가

Evaluating LLM-Generated Rules for Heart Disease Prediction

arXiv9월 15일 발표 · 2분 · 프리프린트

심장병 예측 모델을 개발하기 위해 전통적인 머신러닝 방식과 LLM(GPT-4o, Claude)이 생성한 규칙 기반 시스템의 성능을 비교 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. 실험 결과, 랜덤 포레스트가 90.2%의 높은 정확도를 기록하며 LLM 기반 시스템보다 월등히 뛰어난 예측 성능을 보였습니다.
  2. 비록 성능은 낮지만, LLM이 생성한 규칙은 '만약 A라면 B' 형태의 해석 가능한 진단 논리를 제공하여 의료 AI의 투명성을 높일 수 있습니다.
  3. 결론적으로, 의료 인공지능 시스템 개발 시에는 '최고의 예측 성능'과 '높은 설명 가능성(해석력)' 사이의 상충 관계를 고려해야 합니다.

본 연구는 UCI 심장병 데이터셋을 활용하여 전통적인 머신러닝 분류기들과 (LLM)이 생성한 규칙 기반 시스템의 심장병 예측 성능을 비교했습니다. 로지스틱 회귀, KNN, SVM 등 여러 전통적 모델과 GPT-4o 및 Claude Sonnet 4.6으로 만든 규칙 기반 시스템을 평가했으며, 정확도, 정밀도, 재현율, F1 점수 등의 지표를 사용했습니다.

실험 결과, 전통적인 머신러닝 모델들이 LLM이 생성한 규칙 기반 시스템보다 일관되게 높은 예측 성능을 보였습니다. 특히 랜덤 포레스트가 가장 우수한 성능을 기록하여 정확도 90.2%, 정밀도 0.829, 재현율 1.0, F1 점수 0.906을 달성했습니다. 반면, LLM 기반 모델은 Claude Sonnet 4.6이 정확도 80.3% (F1-점수: 0.833), GPT-4o가 정확도 70.5% (F1-점수: 0.690)를 기록하며 낮은 성능을 나타냈습니다.

성능 차이에도 불구하고, LLM이 생성한 규칙은 'IF-THEN' 형태의 진단 논리를 제공하여 임상 의사 결정 과정에서 설명 가능성과 투명성을 높이는 장점을 가집니다. 이 연구는 의료 인공지능 시스템 개발 시 예측 성능과 해석 가능성 사이의 상충 관계(trade-off)를 고려해야 함을 강조합니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Evaluating LLM-Generated Rules for Heart Disease Prediction
원문 보기arXiv