재귀적 루프 트랜스포머(RLT-1) 구조와 성능 분석 — AI 생성 일러스트AI 일러스트
리서치 연구

재귀적 루프 트랜스포머(RLT-1) 구조와 성능 분석

yifanzhang-pro/recurrent-looped-tranformer

GitHub9월 18일 업데이트 · 3분

Recurrent Looped Transformer(RLT-1)는 디코더의 최종 은닉 상태를 다음 토큰에 재귀적으로 전달하여, 프롬프트와 응답 전체에서 일관된 계산을 수행하는 트랜스포머 구조입니다.

세 줄 요약GitHub 원문 기반
  1. 실험 결과, RLT-1은 기존 모델 대비 학습 속도가 빠르고(예: Parity 정확도), 장문 추론 및 복잡한 산술 문제 해결에서 압도적인 성능 향상을 입증했습니다.
  2. 이 구조는 글로벌 KV 메모리 캐싱과 레이어별 슬라이딩 윈도우 어텐션(SWA)을 결합하여, 깊은 추론 과정에서도 정보의 일관성을 유지하는 것이 핵심입니다.
  3. RLT-1은 대규모 언어 모델이 긴 문맥과 다단계 추론 과정에서 높은 정확도와 효율성을 동시에 달성할 수 있는 새로운 패러다임을 제시합니다.

Recurrent Looped Transformer (RLT-1)는 디코더의 최종 은닉 상태를 다음 에 재귀적으로 전달하는 방식으로 작동합니다. 이 모델은 디코더가 인코더에서 파생된 글로벌 KV 메모리를 읽고, 각 레이어마다 슬라이딩 윈도우 어텐션(SWA) 캐시를 유지하며 업데이트를 수행합니다. 이러한 과정은 와 응답 토큰 모두에 걸쳐 동일하게 적용되어, 이전 디코더 출력이 다음 토큰의 게이티드 병합(gated merge)에 반영되면서 상태가 지속됩니다.

RLT-1에는 두 가지 변형 구조가 제시되었습니다. RLT-0은 이전 출력 피드백 경로를 제거하고 글로벌 크로스 어텐션과 레이어별 SWA만 유지하는 제어 아키텍처입니다. 반면, RLT-2는 피드백 상태를 청크 단위로 고정하여 관리하며, 완전한 청크 경계에서 마지막 디코더 출력을 통해 상태를 업데이트합니다. 이 구조는 BOS와 같은 지점에서 프롬프트, 응답, 메시지 경계를 넘어 일관성을 유지하는 것이 특징입니다.

실험 결과에 따르면 RLT-1은 기존 Transformer 8 모델 대비 높은 성능을 보였습니다. 예를 들어, 'Parity' 태스크에서 RLT-1의 여러 구성(4+4부터 7+1)은 2,000 스텝 후 100.00±0.00%의 정확도를 기록한 반면, Transformer 8은 94.84±3.43%를 기록했습니다. 또한 'S5, swaps' 태스크에서도 RLT-1이 높은 정확도(예: 100.00±0.00%)를 보이며 장문 추론 및 복잡한 산술 문제 해결에서 우수한 성능을 입증했습니다.

용어 풀이

토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
프롬프트
AI에게 주는 지시나 질문 글.
원문GitHub · yifanzhang-pro/recurrent-looped-tranformer같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기