리서치 연구

단백질 생성을 위한 잠재 언어 모델 연구

Learning Latent Protein Languages for Autoregressive Generation

ARarXiv10월 6일 발표 · 3분 · 프리프린트

단백질 시퀀스 및 구조 생성을 위해 기존의 한계를 극복하고자 '단백질 잠재 언어(PLL)'와 '구조 잠재 언어(SLL)'라는 두 가지 학습된 표현 방식을 도입했습니다.

왜 중요해요AI 정리

이 기술은 단백질 구조 예측의 정확도를 높이고, 기존 방식보다 훨씬 빠르게 작동할 수 있는 새로운 기반을 제시했어요.

세 줄 요약arXiv 원문 기반
  1. 이 기술을 적용한 모델은 단백질 구조 예측에서 검증 퍼플렉시티를 34% 낮추고, 샘플링 속도는 AlphaFold2보다 약 1,000배 빠르게 작동하는 등 뛰어난 성능을 보였습니다.
  2. 이는 단백질 생성 트랜스포머 모델이 규모 확장성과 효율적인 추론 시간 샘플링 능력을 획기적으로 개선할 수 있는 새로운 기반 기술을 제시했다는 점에서 중요합니다.
  3. 특히 SLLM의 내부 토큰 신뢰도를 활용하면 단일 결과물 이상의 높은 구조 예측 품질 개선이 가능하여 잠재 언어 모델의 추가적인 이점을 입증했습니다.

본 연구는 단백질 시퀀스 및 구조 생성에 있어 기존의 자기회귀 (autoregressive transformers)가 가진 한계를 극복하기 위해 두 가지 학습된 잠재 언어를 도입했습니다. 첫 번째인 단백질 잠재 언어(PLL)는 ESM-2 인코더를 기반으로 4,096개 상태의 문맥적 알파벳에 시퀀스를 매핑하며, 각 잔기마다 하나의 을 사용합니다. 두 번째 구조 잠재 언어(SLL)는 GCP-VQVAE Lite를 활용하고 보조적인 시퀀스 및 신뢰도 감독을 추가하여 백본 좌표로 디코딩하는 방식을 유지했습니다.

PLL과 SLL 토큰을 사용하여 각각 PLLM과 SLLM이라는 자기회귀 트랜스포머 모델을 구축하고 다음 토큰 예측 방식으로 사전 학습시켰습니다. 그 결과, 단백질 시퀀스에 대한 훈련에서 PLLM은 아미노산 자기회귀 모델 대비 적합한 컴퓨팅 스케일링 지수(compute-scaling exponent)가 0.038로 나타났으며, 무조건적 시퀀스 생성 시에는 가설적인 1.5비트 잔기 조성 엔트로피 임계값 이하 샘플 비율을 아미노산 모델 대비 54% 감소시키는 성능을 보였습니다.

구조 예측 측면에서는 SLL이 기존 GCP-VQVAE Lite 를 대체했을 때, 일치된 훈련 조건 하에서 최적 검증 퍼플렉시티를 34% 낮추는 결과를 얻었습니다. 또한 장단백질의 경우 잠재 토큰 샘플링 속도가 MSA 기반 AlphaFold2보다 약 1,000배 빠르다는 측정 결과가 나왔습니다. 연구진은 SLLM의 내부 토큰 신뢰도를 추론 시간 샘플링에 활용하면 단일 디코딩 샘플 이상의 구조 예측 품질 개선이 가능함을 확인했습니다.

용어 풀이

트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
토크나이저
글을 모델이 처리할 토큰으로 잘라 주는 도구.
궁금한 점AI 정리 · 원문 기반
단백질 잠재 언어(PLL)와 구조 잠재 언어(SLL)는 무엇인가요?

PLL은 ESM-2 인코더를 기반으로 단백질 시퀀스를 매핑하는 학습된 표현 방식이에요. SLL은 GCP-VQVAE Lite를 활용하여 백본 좌표로 디코딩하는 구조 잠재 언어예요.

기존의 알파폴드2와 비교했을 때 속도 차이가 큰가요?

장단백질의 경우, 잠재 토큰 샘플링 속도가 MSA 기반 AlphaFold2보다 약 1,000배 빠르다는 측정 결과가 나왔어요.

구조 예측의 품질은 어떻게 개선할 수 있나요?

SLLM이 가진 내부 토큰 신뢰도를 추론 시간 샘플링에 활용하면, 단일 결과물 이상의 높은 구조 예측 품질을 얻을 수 있어요.

원문arXiv · Learning Latent Protein Languages for Autoregressive Generation
궁금한 점 3개AI 정리