SMILES와 그래프 결합으로 독성 예측의 해석력을 높인 모델 — AI 생성 일러스트AI 일러스트
리서치 연구

SMILES와 그래프 결합으로 독성 예측의 해석력을 높인 모델

SMILESGNN: Interpretable Clinical Toxicity Prediction via SMILES-Graph Cross-Attention Fusion

arXiv9월 25일 발표 · 2분 · 심사 전 논문

신약 개발의 핵심 단계인 약물 독성 예측을 위해, 분자 구조를 나타내는 SMILES 문자열과 그래프 정보를 결합한 다중 모드(multimodal) 모델 'SMILESGNN'이 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. 본 모델은 SMILES 변환기와 그래프 인코더를 교차 주의(cross-attention) 방식으로 융합하여, 높은 예측 성능을 유지하면서도 독성 원인이 되는 분자 구조를 해석할 수 있는 능력을 확보했습니다.
  2. 단순히 '독성이 있다/없다'를 넘어 문제의 근거가 되는 분자 부분을 제시한다는 점에서 의미가 크며, 이는 신약 개발 과정의 과학적 신뢰도를 높이는 데 기여합니다.
  3. 연구 결과는 ClinTox 및 Tox21 등 특정 독성 데이터셋에서 우수한 성능을 입증하며, 교차 주의 방식이 예측력과 해석 가능성을 동시에 확보하는 실용적인 대안임을 보여줍니다.

약물 독성 예측은 신약 개발 과정에서 중요한 단계이지만, 클래스 불균형 및 임상적 해석 가능성의 필요성 때문에 여전히 어려운 과제입니다. 본 연구는 이러한 문제를 해결하기 위해 SMILES Transformer 인코더와 GATv2 그래프 인코더를 교차 주의(cross-attention) 방식으로 융합한 다중 모드 아키텍처인 SMILESGNN을 제안했습니다. 이 설계는 예측 파이프라인 내에 명시적인 그래프 분기를 유지하여, 독성 예측과 관련된 분자 부분 구조 분석을 지원하는 해석 가능성을 확보합니다.

SMILESGNN은 ClinTox 데이터셋에서 0.4M의 적은 만을 사용하여 AUC-ROC 0.987 및 F1 0.906을 달성했습니다. 또한 Tox21(12개 태스크)에서는 평균 AUC-ROC 0.750를 기록하며, 이는 ChemBERTa-2 단독 모델이나 동일 백본의 결합-융합 기준선과 비교 가능한 성능입니다. 이러한 결과는 교차 주의 방식이 경쟁적인 예측 성능을 유지하면서도 그래프 기반 해석 가능성을 지원하는 실용적인 대안임을 보여줍니다.

용어 풀이

파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문arXiv · SMILESGNN: Interpretable Clinical Toxicity Prediction via SMILES-Graph Cross-Attention Fusion같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv