리서치 연구
The Head Complexity of Boolean Functions in Single-Layer Attention
ARarXiv
단일 레이어 셀프 어텐션 모델의 계산 능력을 '헤드 복잡도'라는 새로운 척도로 분석했습니다.
세 줄 요약
- 연구진은 헤드 개수에 따른 정확한 계층 구조를 확립하여, $k$개의 헤드는 $k$-비트 패리티는 가능하나 $(k+1)$-비트 패리티는 불가능함을 증명했습니다.
- 모델의 계산 한계가 단순히 임베딩 차원이나 정밀도 증가에 의존하는 것이 아니라, 구조적 요소인 '헤드 개수'에 의해 결정됨을 입증했습니다.
- 또한, 무한한 차원이나 정밀도가 필요하지 않으며, 모든 계산 가능한 함수는 작업 데이터(헤드 수 등) 범위 내에서 제한된다는 점도 밝혀냈습니다.
단일 레이어 셀프 어텐션 모델의 계산 능력을 '헤드 복잡도'라는 새로운 척도로 분석했습니다.