단백질 생성을 위한 잠재 언어 모델 연구
Learning Latent Protein Languages for Autoregressive Generation
단백질 시퀀스 및 구조 생성을 위해 기존의 한계를 극복하고자 '단백질 잠재 언어(PLL)'와 '구조 잠재 언어(SLL)'라는 두 가지 학습된 표현 방식을 도입했습니다.
이 기술은 단백질 구조 예측의 정확도를 높이고, 기존 방식보다 훨씬 빠르게 작동할 수 있는 새로운 기반을 제시했어요.
- 이 기술을 적용한 모델은 단백질 구조 예측에서 검증 퍼플렉시티를 34% 낮추고, 샘플링 속도는 AlphaFold2보다 약 1,000배 빠르게 작동하는 등 뛰어난 성능을 보였습니다.
- 이는 단백질 생성 트랜스포머 모델이 규모 확장성과 효율적인 추론 시간 샘플링 능력을 획기적으로 개선할 수 있는 새로운 기반 기술을 제시했다는 점에서 중요합니다.
- 특히 SLLM의 내부 토큰 신뢰도를 활용하면 단일 결과물 이상의 높은 구조 예측 품질 개선이 가능하여 잠재 언어 모델의 추가적인 이점을 입증했습니다.
본 연구는 단백질 시퀀스 및 구조 생성에 있어 기존의 자기회귀 (autoregressive transformers)가 가진 한계를 극복하기 위해 두 가지 학습된 잠재 언어를 도입했습니다. 첫 번째인 단백질 잠재 언어(PLL)는 ESM-2 인코더를 기반으로 4,096개 상태의 문맥적 알파벳에 시퀀스를 매핑하며, 각 잔기마다 하나의 을 사용합니다. 두 번째 구조 잠재 언어(SLL)는 GCP-VQVAE Lite를 활용하고 보조적인 시퀀스 및 신뢰도 감독을 추가하여 백본 좌표로 디코딩하는 방식을 유지했습니다.
PLL과 SLL 토큰을 사용하여 각각 PLLM과 SLLM이라는 자기회귀 트랜스포머 모델을 구축하고 다음 토큰 예측 방식으로 사전 학습시켰습니다. 그 결과, 단백질 시퀀스에 대한 훈련에서 PLLM은 아미노산 자기회귀 모델 대비 적합한 컴퓨팅 스케일링 지수(compute-scaling exponent)가 0.038로 나타났으며, 무조건적 시퀀스 생성 시에는 가설적인 1.5비트 잔기 조성 엔트로피 임계값 이하 샘플 비율을 아미노산 모델 대비 54% 감소시키는 성능을 보였습니다.
구조 예측 측면에서는 SLL이 기존 GCP-VQVAE Lite 를 대체했을 때, 일치된 훈련 조건 하에서 최적 검증 퍼플렉시티를 34% 낮추는 결과를 얻었습니다. 또한 장단백질의 경우 잠재 토큰 샘플링 속도가 MSA 기반 AlphaFold2보다 약 1,000배 빠르다는 측정 결과가 나왔습니다. 연구진은 SLLM의 내부 토큰 신뢰도를 추론 시간 샘플링에 활용하면 단일 디코딩 샘플 이상의 구조 예측 품질 개선이 가능함을 확인했습니다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 토크나이저
- 글을 모델이 처리할 토큰으로 잘라 주는 도구.
단백질 잠재 언어(PLL)와 구조 잠재 언어(SLL)는 무엇인가요?
PLL은 ESM-2 인코더를 기반으로 단백질 시퀀스를 매핑하는 학습된 표현 방식이에요. SLL은 GCP-VQVAE Lite를 활용하여 백본 좌표로 디코딩하는 구조 잠재 언어예요.
기존의 알파폴드2와 비교했을 때 속도 차이가 큰가요?
장단백질의 경우, 잠재 토큰 샘플링 속도가 MSA 기반 AlphaFold2보다 약 1,000배 빠르다는 측정 결과가 나왔어요.
구조 예측의 품질은 어떻게 개선할 수 있나요?
SLLM이 가진 내부 토큰 신뢰도를 추론 시간 샘플링에 활용하면, 단일 결과물 이상의 높은 구조 예측 품질을 얻을 수 있어요.