장문 텍스트 가치 측정을 위한 증거 융합 기법 TEF
Count Evidence, Not Sentences: Tempered Evidence Fusion of LLM Judgments for Long-Text Value Measurement
arXiv장문의 소셜 미디어 게시물에서 공공 가치 성향을 측정할 때, 배경 설명이나 인용문 등 복합적인 요소가 섞여 있어 기존 방식으로는 정확한 분석이 어려웠습니다.
- 연구진은 'Tempered Evidence Fusion(TEF)'를 제안했습니다. 이는 각 문장의 정보 획득량에 따라 가중치를 부여하여, 불확실한 증거는 무시하고 핵심적인 결정적 의견만 활용합니다.
- 대규모 다국어 공공 이벤트 데이터셋(MIND) 검증 결과, TEF는 기존 최고 성능 모델 대비 평균 4.5% 이상의 정확도 향상을 입증하며 신뢰도를 높였습니다.
- 이 방법은 별도의 학습 과정 없이 적용 가능한 규칙 기반 접근 방식이므로, 복잡한 사회적 의견 분석의 객관성과 효율성을 크게 개선할 수 있습니다.
(LLM)은 장문의 소셜 미디어 게시물에서 공공 가치 성향을 측정하는 데 사용되지만, 이러한 게시물에는 배경 설명, 인용문, 양보 등의 요소가 혼재되어 있어 분석이 어렵습니다. 기존 접근 방식들은 모델에게 문서 수준의 레이블 예측을 직접 요청하여 과신할 위험이 있거나, 문장별 예측 결과를 다수결 또는 소프트 투표로 집계하는 방식으로 불확실한 문장과 결정적인 문장을 동등하게 취급한다는 한계를 가집니다.
이에 연구진은 장문 텍스트의 가치 측정을 의사결정 융합 문제로 정의하고, 'Tempered Evidence Fusion(TEF)'이라는 학습 과정이 필요 없는 규칙을 제안했습니다. TEF는 각 문장의 로그 오즈에 정규화된 정보 획득량으로 를 부여하며, 이는 일반화된 베이즈 사후 확률에서 파생됩니다. 이 방식을 통해 융합 점수는 불확실한 문장에서는 거의 사라지게 만들면서도 결정적인 증거의 최적 베이즈 가중치를 보존할 수 있습니다.
TEF는 다국어 공공 이벤트 데이터셋인 MIND(Multi-event Insight Network Dimensions)를 통해 검증되었습니다. 이 는 5년간의 중국어 및 영어 게시물 8,358건을 포함하며 6가지 가치 차원을 아우릅니다. 테스트 결과, TEF는 Direct, Majority Vote, Soft Vote 등 기존 최고 성능 모델 대비 평균 4.5%의 정확도 포인트와 4.6 마크로-F1 포인트를 달성하며 우수한 성능을 입증했습니다. MIND 데이터셋과 코드는 별도로 제공됩니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.