트랜스포머 구조와 작동 원리 이해하기
Transformers Explained Visually
Hacker News트랜스포머는 입력된 텍스트의 문맥을 분석하여 다음에 이어질 가장 확률 높은 토큰(단어 또는 단어 일부)을 예측하는 혁신적인 신경망 구조입니다.
- 핵심은 '셀프 어텐션' 메커니즘으로, 문장 내 모든 토큰 간의 관계를 파악해 장거리 의존성을 효과적으로 처리할 수 있게 된 것이 핵심 기술력입니다.
- 이러한 높은 범용성 덕분에 텍스트 생성(GPT), 이미지 인식, 단백질 구조 예측 등 인공지능 전반에 걸쳐 산업 혁신을 주도하고 있습니다.
- 최종 출력 단계에서 '온도'나 Top-K/Top-P 같은 하이퍼파라미터 조정은 모델의 창의성과 결정론적 특성을 제어하는 중요한 요소입니다.
는 2017년 발표된 신경망 아키텍처로, 인공지능 분야의 접근 방식을 근본적으로 변화시켰습니다. 이 모델은 기본적으로 사용자의 입력 를 받아 가장 확률 높은 다음 (단어 또는 단어 일부)을 예측하는 원리로 작동합니다. 트랜스포머의 핵심 혁신은 '셀프 어텐션 메커니즘'에 있으며, 이를 통해 이전 아키텍처보다 문장 전체 시퀀스를 처리하고 장거리 의존성을 효과적으로 포착할 수 있게 되었습니다.
트랜스포머 모델이 텍스트를 처리하기 위해서는 입력된 텍스트가 먼저 토큰화 과정을 거쳐 단어 또는 하위 단어 단위의 개별적인 토큰으로 분해되어야 합니다. 이 토큰들은 이라는 수치 벡터로 변환되며, 이때 각 토큰의 의미적 정보를 담는 것 외에도 위치 정보(Positional Encoding)가 추가됩니다. 예를 들어, GPT-2 모델은 50,257개의 고유한 토큰을 가지며, 이를 768차원의 벡터 형태로 표현합니다.
모델의 핵심 처리 단위인 트랜스포머 블록은 '멀티 헤드 셀프 어텐션'과 'MLP(다층 퍼셉트론) 레이어'로 구성됩니다. 셀프 어텐션 메커니즘에서는 각 토큰의 임베딩 벡터가 쿼리(Q), 키, 값(V) 세 가지 벡터로 변환되며, 이 QKV 값을 이용해 토큰 간의 관계를 계산합니다. 이후 MLP 레이어는 이 정보를 바탕으로 각 토큰 표현을 독립적으로 정제하고 모델의 표현 능력을 향상시킵니다.
모든 트랜스포머 블록을 거쳐 최종 출력이 나오면, 이 결과는 마지막 선형 계층(linear layer)을 통해 전체 어휘 크기(50,257차원)로 투영됩니다. 이후 소프트맥스 함수를 적용하여 확률 분포를 얻고, 이 과정에서 '온도(temperature)'와 같은 하이퍼나 Top-K/Top-P 샘플링 기법을 조정함으로써 모델의 예측 결과가 얼마나 결정론적일지 또는 창의적일지를 제어하게 됩니다.
용어 풀이
- 트랜스포머
- 오늘날 대부분의 언어 모델이 쓰는 신경망 구조. 문장 속 단어들의 관계를 한꺼번에 계산해요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.