리서치 연구
MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models
ARarXiv
다중 모드 대규모 언어 모델(MLLM)이 분자 임베딩 분야에서 일반적인 역할을 할 수 있다.
세 줄 요약
- 연구진은 MLLM을 적응시킨 경량 프레임워크 MolEmb를 개발했다. 이 모델은 양방향 대조 학습 목표로 분자 프로파일과 텍스트 설명을 공유 임베딩 공간에 정렬한다.
- 이 임베딩 모델은 분자 속성 예측에서 경쟁력을 보이며, 동일한 공간 내에서 모드 간 분자-텍스트 검색을 지원한다.
- 맥락 인식 검색용 진단 벤치마크 MolCAR를 도입했으며, 문맥 인지 분자 임베딩은 주로 지도 학습의 데이터 속성에 달려 있음을 확인했다.
다중 모드 대규모 언어 모델(MLLM)이 분자 임베딩 분야에서 일반적인 역할을 할 수 있다.