단어 경계를 넘어선 주제 모델링: MonoTM 프레임워크
Beyond Top Words: MonoTM for Topic Modeling with Interpretable Monosemantic Features
arXiv대규모 텍스트에서 주제를 추출하는 토픽 모델링의 한계를 극복하기 위해, 해석 가능한 의미적 특징을 활용한 'MonoTM' 프레임워크가 제안되었습니다.
- MonoTM은 전체 SAE(Sparse Autoencoder) 특징으로 주제 혼합을 추정한 후, 별도의 코퍼스 기반 의미적 어휘집에서 주제를 정의하는 방식으로 작동합니다.
- 주제가 개별 단어를 넘어선 '의미 단위'로 표현되어, 단순 키워드 나열보다 후속적인 코퍼스 분석에 높은 유용성을 제공합니다.
- 실험 결과, 주제 혼합 추정(estimation)과 의미적 해석(interpretation)을 위해 최적화되는 SAE 구성 및 특징 하위 집합이 다를 수 있음을 확인했습니다.
주제 모델은 대규모 텍스트 코퍼스에서 주제를 요약하는 데 사용되지만, 기존 방식에서 상위 순위 단어들만으로는 주제의 의미론적 표현이 제한적일 수 있습니다. 본 연구는 해석 가능한 특징을 활용하여 이러한 한계를 극복하고자 MonoTM이라는 새로운 주제 모델링 프레임워크를 제안합니다. 이 프레임워크는 주제 추론 품질과 특징의 해석 가능성 사이의 관계를 명확히 분리하는 것이 핵심입니다.
MonoTM은 두 가지 역할을 분리하여 작동합니다. 첫째, 전체 SAE(Sparse Autoencoder) 배지-오브-특징 표현을 사용하여 문서와 주제 혼합을 추정합니다. 둘째, 이 과정에서 얻어진 결과를 고정한 후, 별도의 코퍼스 기반 의미적 특징 어휘집 위에서 주제 기술자(topic descriptors)를 학습합니다. 이러한 설계는 전역적인 주제 구조를 유지하면서도 개별 단어보다 더 의미 있는 '의미 단위'로 주제를 표현할 수 있게 합니다.
실험 결과에 따르면, 문서-주제 혼합 추정(estimation)과 의미론적 해석(interpretation)을 위해 최적으로 작동하는 SAE 구성 및 특징 하위 집합이 서로 다를 수 있음을 확인했습니다. MonoTM은 이러한 분리를 통해 주제가 단순한 키워드 나열을 넘어 후속적인 코퍼스 분석에 더 유용하도록 만듭니다.