범주형 그래프 생성을 위한 임베디드 그래프 플로우
Embedded Graph Flows for Categorical Graph Generation
arXiv기존 그래프 생성 모델은 범주형 데이터를 고정된 벡터로 처리하여 구조적 제약을 가하는 한계가 있었습니다. 본 연구는 이를 개선한 '임베디드 그래프 플로우(EGF)'라는 새로운 생성 모델을 제안합니다.
- EGF는 노드와 엣지 카테고리에 연속적인 임베딩 공간을 학습하고, 순열에 불변한 트랜스포머를 이용해 가우시안 노이즈를 전파하여 그래프 구조를 생성합니다.
- QM9 및 대규모 분자 데이터셋(ZINC250k) 테스트 결과, EGF는 기존 최고 성능 대비 월등히 낮은 수치를 기록하며 높은 정확도를 입증했습니다.
- EGF는 복잡한 범주형 데이터를 연속 공간에서 처리하여 실제 분자의 국소적 구조와 유사성을 유지하는 고품질 그래프 생성이 가능함을 보여줍니다.
기존의 범주형 그래프 생성 방식은 노드와 엣지 카테고리를 고정된 원-핫 벡터로 인코딩하는 경향이 있어, 카테고리 간에 인위적인 기하학적 제약을 가한다는 한계가 있었습니다. 본 연구에서는 이러한 문제를 해결하기 위해 임베디드 그래프 플로우(EGF)라는 생성 모델을 제안합니다. EGF는 노드와 순서에 구애받지 않는 엣지 카테고리에 연속적인 공간을 학습하는 것이 특징입니다.
제안된 EGF 모델은 가우시안 노이즈를 이 학습된 끝점(endpoints)으로 전송하며, 이를 위해 순열에 불변한 그래프 를 사용합니다. 이후 터미널 리드아웃을 통해 임베딩 공간의 정보를 다시 이산적인 그래프 카테고리로 매핑하여 최종 구조를 생성합니다. 연구진은 해당 코드를 공개했습니다.
QM9 분자 에 적용했을 때, EGF는 보고된 네 가지 지표 모두에서 세 가지 방법 중 가장 우수한 성능을 보였습니다. 구체적으로 Fréchet ChemNet Distance (FCD)가 0.150으로 측정되어, 범주형-확산 기반의 DiGress(0.717)나 브릿지 기반의 GruM(0.812)보다 낮은 수치를 기록했습니다. 또한 ZINC250k와 같은 대규모 분자에서는 EGF가 가장 낮은 최대 평균 불일치(MMD)를 유지하며 높은 정확도를 입증했습니다.
용어 풀이
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.