가짜 리뷰 탐지 연구 동향: PLM부터 LLM까지의 분석
A Survey on Fake Review Detection: From Pre-trained Language Models to Large Language Models
arXiv본 논문은 온라인 리뷰의 가짜 여부 탐지 방법을 정보 융합 관점에서 포괄적으로 검토한 설문조사 연구입니다. 2018년부터 현재까지 발표된 211개 관련 연구를 분석했습니다.
- 특히 대규모 언어 모델(LLM) 등장으로 인해 정교하고 문맥에 맞는 가짜 리뷰 생성이 쉬워져, 다차원적인 정보 융합 기반의 탐지 기술 개발이 중요해졌습니다.
- 소비자의 의사결정 및 플랫폼 신뢰도에 치명적인 영향을 주는 가짜 리뷰를 막기 위해, 본 연구는 다양한 데이터 유형을 결합한 방어 지침을 제시합니다.
- 향후 연구는 적대적 생성 대응, 여러 정보 출처 누락 시의 강건성 확보, 그리고 AI가 만든 콘텐츠에 대한 신뢰도 높은 평가 방법론 마련 등에 집중해야 합니다.
온라인 리뷰는 소비자의 의사결정 및 플랫폼 운영에 중요한 역할을 하지만, 시스템에 기만적인 증거를 주입하는 방식으로 위협받고 있습니다. 특히 (LLMs)이 등장하면서 문맥을 이해하고 유창한 가짜 리뷰 생성이 가능해졌으며, 이는 기존의 탐지 방식을 변화시키고 있습니다. 본 설문조사 연구는 정보 융합 관점에서 가짜 리뷰 탐지를 검토하며, 2018년부터 현재까지 발표된 211개의 관련 연구를 분석했습니다.
연구진은 기존 작업을 증거 출처와 융합 수준에 따라 체계적으로 정리했습니다. 분석 대상에는 리뷰 텍스트 외에도 감성 정보, 평점 행동 패턴, 시간적 메타데이터, 사용자-제품 그래프, 콘텐츠, 외부 지식 등 다양한 데이터 유형이 포함됩니다. 또한 전통적인 머신러닝 및 딥러닝 방식에서 PLM 기반, LLM 기반 방법론으로의 발전 과정을 추적하고, 이러한 다차원적인 데이터를 결합하는 방식을 검토했습니다.
본 연구는 현재 남아있는 주요 기술적 과제들을 제시합니다. 특히 AI가 생성한 기만 콘텐츠에 대응하기 위해 적대적 생성(adversarial generation), 도메인 간 전이(cross-domain transfer), 불확실성 인식 융합, 정보 출처 누락 시의 강건성 확보, 해석 가능성(interpretability) 및 신뢰할 수 있는 평가 방법론 마련 등이 중요한 연구 주제로 남아있음을 지적했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.