사실성 추론을 위한 유틸리티 기반 학습 시스템 UO-FIE 제안
UO-FIE: Combining Exact-Label Supervision with Graded Utility for Factivity Inference
arXiv중국어 문맥과 가설 쌍의 사실성(factivity)을 9단계로 분류하는 작업에 새로운 시스템 UO-FIE가 제안되었습니다.
- UO-FIE는 정확한 레이블 감독과 등급별 유틸리티를 결합하여, 기존 모델들이 가진 단일 클래스 예측 편향 문제를 해결했습니다.
- 이 연구는 단순 정답 예측을 넘어 오답과의 근접도까지 고려하는 순서형(Ordinal) 학습 방법의 중요성을 입증합니다.
- 최고 성능은 Qwen3.5-9B 기반 미세 조정 트랙에서 달성되었으며, 모델 및 평가 환경에 따라 결과가 달라질 수 있습니다.
Factivity Inference Evaluation 2026 (FIE2026)은 중국어 문맥과 가설 쌍의 사실성을 총 아홉 개의 순서형 간격으로 분류하는 작업을 다룹니다. 이 평가 지표는 정확한 예측뿐만 아니라 정답 구간에 대한 근접도까지 보상합니다. 기존 실험에서는 mDeBERTa와 같은 모델들이 특정 클래스(지배적 클래스)를 주로 예측하는 경향을 보이는 반면, Huber-regression 기반의 기준선은 오답과의 근접도는 높으나 정확한 일치 예측은 적다는 한계가 있었습니다.
이러한 문제를 해결하기 위해 유틸리티 지향 사실성 추론(UO-FIE) 시스템이 제안되었습니다. UO-FIE는 정확한 레이블 감독과 등급별 유틸리티를 결합하는 효율적인 시스템입니다. 이 모델은 아홉 개 클래스에 대한 분포를 예측하며, 하드 라벨 감독, 유틸리티 기반 소프트 타겟, 스케줄링된 클래스 , 그리고 순서형 손실(ordinal loss)을 조합하여 사용합니다.
평가 결과, Qwen3.5-9B 모델에 를 적용한 UO-FIE는 트랙에서 0.8316의 매크로 유틸리티를 기록하며 최고 성능을 달성했습니다. 별도로 진행된 기반 앙상블은 비(非)미세 조정 트랙에서 0.8450의 매크로 유틸리티를 기록하며 세 번째 순위를 차지하는 등, 모델 및 평가 환경에 따라 결과가 나타났습니다.
용어 풀이
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- LoRA
- 모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 프롬프트
- AI에게 주는 지시나 질문 글.