리서치 연구
법률 문서 계층 구조 기반 다국어 추출 요약 모델 'LexLattice'
LexLattice: Multilingual Extractive Summarization via Neural Cellular Automata on Document Hierarchies
arXiv법률 문서의 복잡한 계층 구조를 이해하는 새로운 다국어 추출 요약 모델 'LexLattice'가 개발되었습니다.
세 줄 요약
- 이 모델은 문서를 2차원 의미 격자로 재구성하고 신경 세포 오토마타(NCA)로 정보를 통합하여 정확도를 높입니다.
- 대규모 파라미터의 거대 모델 대신 구조적 통합에 집중함으로써, 신뢰성 높은 다국어 요약의 효율적인 대안을 제시합니다.
- 특히 고자원 언어로 학습한 지식이 미지의 언어에도 거의 손실 없이 전이되는 등 의미 기반 처리가 가능함을 입증했습니다.
법률 텍스트 요약에서 핵심 고려 사항은 원문 충실도(Faithfulness)이며, 이를 위해 출처를 추적할 수 있는 추출 방식이 중요합니다. 기존의 방법들은 문서를 구조 단위로 분리하여 순위를 매기는 경향이 있어, 문서 내 멀리 떨어진 부분에 걸쳐 분포하며 의미적으로 연결된 증거들을 통합하는 데 어려움이 있었습니다.
연구진은 이러한 문제를 해결하기 위해 LexLattice라는 추출 요약기를 개발했습니다. 이 모델은 법률 행위의 계층 구조를 2차원 의미 격자(semantic lattice)로 재구성하고, 마스크 처리된 2D 신경 세포 오토마타(NCA)를 사용하여 이를 통합합니다. 이는 대규모 기반의 지침 조정형 모델을 능가하는 효율적인 접근 방식입니다.
LexLattice는 EUR-Lex-Sum의 24개 언어 전체에서 다국어 및 교차 언어 설정 모두에서 최고 수준의 ROUGE 점수를 달성했습니다. 특히, 고자원 언어로만 학습된 통합기가 미지의 언어에도 거의 손실 없이(0.99) 지식을 전이하는 결과를 보여주었습니다. 이는 모델이 표면적인 형태가 아닌 언어에 구애받지 않는 의미론적 기하학 구조를 기반으로 작동함을 입증합니다.
용어 풀이
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.