일본 뉴스 기사의 누락된 시간 표현 복원 기술 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

일본 뉴스 기사의 누락된 시간 표현 복원 기술 연구

Reproducing Omitted Temporal Expressions in Japanese News for Retrieval-Augmented Applications

arXiv9월 10일 발표 · 2분 · 심사 전 논문

일본 뉴스 기사는 날짜 정보가 누락되는 경우가 많아, 이를 검색 및 RAG 시스템에 활용할 경우 시간적 오류를 일으킬 수 있습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 출판일을 외부 맥락으로 활용하여 누락된 시간 표현을 구체적인 날짜로 복원하는 규칙 기반 파이프라인 'jaROTE'를 개발했습니다.
  2. 이는 대규모 언어 모델(LLM)과 경쟁할 만큼 높은 성능을 보이면서도, 빠르고 저렴하게 시스템의 정보 검색 정확도를 높일 수 있습니다.
  3. 특히 출판일을 기준으로 시간 정보를 정규화하는 것이 일본 뉴스 검색에서 시간 제약적 어휘 검색 성능을 크게 향상시키는 실용적 가치를 입증했습니다.

뉴스 기사에는 출판일과 참조해야 하는 경우도 많은 일(日) 단위 또는 월(月) 단위의 시간 표현이 생략되는 경우가 많습니다. 이러한 기사가 검색 및 시스템에서 독립적인 텍스트로 인덱싱되거나 처리될 때, 이러한 누락은 시간적 불일치와 (LLM)에 의한 불안정한 해석을 초래할 수 있습니다.

연구진은 출판일을 외부 맥락으로 활용하여 기사들이 검색 및 RAG 애플리케이션을 위해 인덱싱되기 전에, 생략된 시간 표현들을 구체적인 날짜나 기간으로 복원하는 데 중점을 두었습니다. 일본 뉴스에 특화된 규칙 기반 파이프라인인 jaROTE를 제안했으며, 이는 기존의 시간 표현 추출 및 정규화 기술을 바탕으로 구축되었습니다.

두 개의 뉴스 코퍼스에서 진행된 실험 결과, jaROTE는 높은 성능을 달성하여 LLM과 경쟁할 수 있는 수준임을 입증했습니다. 또한 이 파이프라인은 빠르고 저렴하게 운영될 수 있으며, 출판일 기반의 시간 복원 과정이 일본 뉴스 검색에서의 시간 제약적 어휘 검색 성능 향상이라는 실질적인 가치를 제공함을 보여주었습니다.

용어 풀이

RAG
답하기 전에 관련 문서를 찾아 그 내용을 근거로 답하게 하는 방법.
대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Reproducing Omitted Temporal Expressions in Japanese News for Retrieval-Augmented Applications같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv