생의학 가설 생성, 증거 기반 추론 능력을 검증하다
HypoKG: Evidence-Disciplined Biomedical Hypothesis Generation Beyond Endpoint Knowledge
arXiv대규모 언어 모델(LLM)이 생의학 가설을 생성할 때, 단순히 그럴듯한 아이디어를 내는지 아니면 과학적 증거를 바탕으로 추론하는지 검증했습니다.
- 연구 결과, 시작점과 끝점만 제공했을 때는 창의적인 가설이 나오지만, 전체 생물학적 경로(메커니즘)가 주어졌을 때 '증거 기반 추론' 능력이 극대화되었습니다.
- 이는 지식 그래프가 단순히 새로운 질병 쌍을 발견하는 것을 넘어, LLM이 복잡한 생체 메커니즘을 따라 논리적으로 사고하도록 안내하는 핵심 도구임을 입증합니다.
- 따라서 AI 기반 가설 생성의 신뢰도를 높이려면 최소 정보만으로는 부족하며, 상세하고 구조화된 경로 정보를 제공해야 합니다.
(LLM)이 생의학 가설을 생성할 때 과학적 증거를 바탕으로 추론하는지 여부를 연구하기 위해, KEGG, Rhea, UniProt 세 가지 주요 데이터베이스를 통합하여 하나의 생화학 지식 그래프를 구축했습니다. 이 는 효소 출처와 희귀 질병 종점 간 연결된 550개의 경로로 구성되었으며, 총 13,200개의 가설을 생성하는 데 사용되었습니다. 테스트는 모델이 받는 생물학적 정보(출처만, 전체 생물학적 경로, 또는 출처와 질병 종점만)에 따라 네 가지 조건에서 여섯 개의 LLM으로 진행되었습니다.
실험 결과, 모델에 출처와 질병 종점만 제공했을 때 가장 높은 점수를 받은 가설들이 있었으나, 이들은 증거 기반이 부족한 것으로 나타났습니다. 반면, 전체 생물학적 경로가 주어진 모델은 알려진 기전적 관계와 더 일치하는 가설을 생성하여 '증거 기반 추론' 능력이 높게 관찰되었습니다.
연구팀은 이러한 효과를 확인하기 위해 중간 경로 단계를 무작위로 섞었으나 종점은 고정하는 테스트를 진행했습니다. 그 결과, 증거 기반 추론 능력치가 유의미하게 감소($\Delta = -0.793, p < 0.001$)하여 모델이 실제로 경로 구조를 사용하여 추론했음을 입증했습니다. 이 연구는 지식 그래프가 가설 생성에 기여하는 방식이 단순히 문헌에 없는 생물학적 종점 쌍을 식별하는 것 외에도, LLM이 메커니즘 경로를 따라 논리적으로 사고하도록 안내함을 보여주었습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.