어텐션 메커니즘을 오토인코더로 대체한 언어 모델 구조 — AI 생성 일러스트AI 일러스트
리서치 연구

어텐션 메커니즘을 오토인코더로 대체한 언어 모델 구조

Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling

arXiv9월 28일 발표 · 2분 · 심사 전 논문

트랜스포머 기반 언어 모델의 핵심인 어텐션 메커니즘을 오토인코더 기반 혼합 모듈로 대체한 새로운 구조를 제안합니다.

세 줄 요약arXiv 원문 기반
  1. 이 아키텍처는 기존 어텐션과 동등한 성능을 유지하면서도 계산 복잡도를 약 1.9배 낮추고, 반복적인 정제 과정을 통해 정확성을 높입니다.
  2. 대규모 언어 모델(LLM)의 연산 효율성을 획기적으로 개선하여, 고성능 AI를 더 빠르고 저전력 환경에서 구동할 수 있는 기반 기술을 제공합니다.
  3. 모델 성능 극대화를 위해서는 구조 변경 외에도 희귀 토큰에 가중치를 부여하는 빈도 인식 훈련 스케줄이 필수적입니다.

기존 기반의 마스크드 언어 모델은 어텐션을 핵심 컨텍스트 혼합 메커니즘으로 사용하지만, 본 연구는 이를 저랭크 병목 오토인코더(low-rank bottleneck autoencoder)를 통해 구현된 혼합 모듈로 대체하는 대안적 아키텍처를 제안합니다. 이 구조는 어텐션 대신 스택형의 오토인코더 기반 혼합 모듈을 사용하며, 각각 지역적 근접 영역, 전체 시퀀스, 그리고 어텐션 헤드 전반에 걸쳐 입력을 압축하고 재구성하는 방식으로 작동합니다.

마스크된 위치(masked positions)에서는 반복적인 정제 절차를 도입하여 모델의 정확도를 높입니다. 이 과정은 두 단계로 구성되는데, 첫 번째는 표현을 주변 들의 가중 평균 쪽으로 끌어당기는 'pulling step'이며, 두 번째는 그 결과를 오토인코더를 통해 학습된 매니폴드로 다시 투영하는 'correcting step'입니다.

이 아키텍처는 C4 데이터셋으로 사전 훈련되었을 때 가 일치하는 BERT 및 TinyBERT 기준 모델과 동등한 성능을 달성하면서도, 계산 복잡도는 약 1.9배 낮은 FLOPs를 구현했습니다. 또한 마스킹 작업을 수행할 때는 희귀 토큰에 더 많은 를 부여하는 빈도 인식 훈련 스케줄(frequency-aware training schedule)을 적용하여 모델의 성능을 극대화합니다.

용어 풀이

트랜스포머
오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
임베딩
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문arXiv · Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv