LLM의 논쟁 능력 평가: 인신공격 방어 전략 연구
Benchmarking Argumentative Behaviour of LLMs: A Study of Defences Against Character Attacks
arXivLLM이 정치적 논쟁에서 핵심 요소인 '인신공격(ad hominem)' 같은 인격 기반 공격에 어떻게 대응하는지 심층적으로 분석했습니다.
- 연구 결과, 대부분의 LLM은 오직 논리적인 방어 전략만을 고수할 뿐, 정치 담론에서 중요한 인격적 반격을 전략적으로 활용하지 못했습니다.
- 이는 현재 AI 모델에 적용된 안전성 제약이 인간처럼 복잡하고 비논리적인 요소가 중요한 영역에서의 자연스러운 상호작용을 제한함을 시사합니다.
- 따라서 LLM이 실제 정치 논쟁의 역동성을 재현하려면, 단순한 논리를 넘어선 높은 수준의 전략적 유연성이 필수적으로 요구됩니다.
(LLMs)이 설득적 대화에서 논쟁 주체로 활용됨에 따라, 인간과의 토론 능력을 엄격하게 평가할 필요성이 제기되었다. 본 연구는 전통적으로 오류로 치부되던 '인신공격(ad hominem)'과 같은 인격 기반 공격 방어 전략에 초점을 맞추었다. 이는 정치적 설득 대화에서 명제 내용만큼이나 화자의 신뢰도(ethos)가 중요한 역할을 하기 때문에, 현대 LLM이 이러한 공격을 전략적으로 사용하고 대응하는 능력을 조사했다.
연구진은 자연어 정치 대화 코퍼스를 분석하여 인간 논쟁가들이 인격 중심 토론에서 사용하는 방어 전략들을 식별하고 이를 게임 형태로 구조화했다. 실증적 벤치마킹을 위해 미국 대통령 토론회 자료인 ElecDeb60to16-fallacy 코퍼스를 활용하여, LLM이 생성한 대화를 인간 논쟁가들의 방어 전략과 비교 분석하였다.
분석 결과, 대부분의 LLM은 오직 논리적 방어에만 엄격하게 초점을 맞추는 경향을 보였으며, 정치 담론에서 유효한 수사학적 반격을 전략적으로 활용하는 데 실패했다. 연구진은 현재 AI 모델에 적용된 안전성 (safety fine-tuning) 제약이 LLM들의 전략적 행동 공간을 제한하여, 인격 대결이 규범적으로 기대되는 영역에서의 자연스러운 상호작용을 어렵게 만든다고 주장한다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.