텍스트 분류 모델의 진화: BoW부터 최신 LLM까지
Language models for text classification: From bag-of-words to Jev
Hacker News텍스트 분류 모델은 초기 단어 빈도 기반(BoW)에서 시작하여, 문장 구조와 순서 정보를 반영하는 심층 신경망 방식으로 발전해 왔습니다.
- 단순히 단어를 세는 것을 넘어 각 단어에 의미와 문맥을 부여한 '단어 임베딩'의 도입이 모델 성능 향상의 핵심 동력이었습니다.
- 모델의 역사적 흐름을 이해하면 최신 대규모 언어 모델(LLM)과 전문 분류기의 작동 원리, 강점 및 한계를 명확히 파악할 수 있습니다.
- 범용성이 높은 AI도 강력하지만, 특정 목적이 분명한 문제에서는 여전히 간단하고 효율적인 전문 분류기가 더 빠르고 경제적일 수 있습니다.
초기 텍스트 분류는 단어 빈도 기반(Bag-of-words, BoW) 방식을 주로 사용했습니다. 이 방식은 다양한 길이의 자유 형식 텍스트를 고정 크기의 입력 벡터로 변환하여 나이브 베이즈나 로지스틱 회귀 같은 클래식 분류기들이 처리할 수 있게 했습니다. 그러나 BoW는 단어 순서 정보를 상실하는 근본적인 한계를 가집니다. 예를 들어, '개가 남자를 물었다'와 '남자가 개를 물었다'라는 문장은 내용이 다름에도 불구하고 동일한 벡터로 표현될 수 있습니다.
모델 성능 향상을 위해 심층 신경망(Deep Neural Networks)이 도입되면서 단어 (Word Embeddings)을 활용하게 되었습니다. BoW가 전체 텍스트의 단어 발생 빈도를 세는 방식이라면, 단어 임베딩은 개별 단어를 학습된 밀집 벡터로 표현합니다. 이와 함께 순환 신경망(RNNs) 같은 아키텍처는 텍스트를 한 단어씩 처리하며 이전 단계의 은닉 상태를 결합하기 때문에 단어의 순서가 중요하게 작용하도록 개선되었습니다.
최근에는 GPT나 오픈 처럼 범용적인 모델들이 분류 작업을 수행할 수 있지만, Jev와 같은 전문 분류기는 이러한 작업들을 더 빠르고 저렴하게 처리할 수 있다는 장점이 있습니다. 물론 매우 좁고 정의된 문제의 경우 여전히 특수 목적의 분류기가 가장 효율적일 수 있으나, 일반적인 성능과 범용성 측면에서 LLM은 강력한 대안으로 작용합니다.
용어 풀이
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.