LLM 에이전트의 사회적 관계 추론 능력 향상 연구
When LLM Agents Fail to Read the Room: ReAdapt for Relational Social Reasoning
arXivLLM 에이전트가 단순히 콘텐츠에만 의존하여 사회적 판단을 내리는 한계를 발견하고, 관계적 맥락을 고려하는 새로운 방법론 ReAdapt를 제안했습니다.
- ReAdapt는 목표, 믿음, 관계 등 구조화된 '사회 상태'를 명시적으로 추적하며, 따뜻한 소개 정확도를 37%에서 51%로 향상시키는 성과를 거두었습니다.
- 이 연구는 AI가 단순 정보 처리 단계를 넘어, 인간 사회의 복잡한 관계망이나 상호작용 역학을 이해하고 판단하는 것이 핵심 과제임을 보여줍니다.
- 결론적으로, 에이전트가 외부의 사회적 증거를 바탕으로 내부 상태를 명시적으로 업데이트하며 추론할 때 비로소 신뢰도 높은 의사결정이 가능함을 시사합니다.
표준 루프는 단순히 콘텐츠에만 의존하여 결정을 내리는 경향이 있어, 실제 사회적 판단을 좌우하는 잠재적인 인간관계(예: 유대 강도, 상호성)를 반영하지 못한다는 한계가 있다. 연구진은 이러한 실패 모드를 관계 추론 로 공식화했으며, 친구 관계나 반응 기록 등이 포함된 500개의 합성 사회 세계에서 에이전트의 성능을 검증했다.
이에 대한 해결책으로 ReAdapt(Relationship-Adaptive Agent with Policy-driven sTate)가 제안되었다. 이 방법론은 기존의 ReAct 루프를 확장하여 목표, 믿음, 관계, 규범, 공개 정보 등 구조화된 '사회 상태' z = (G, B, R, N, D)를 명시적으로 추적한다. 에이전트는 도구 관찰 후 이 사회 상태를 업데이트하고 정책 연산(continue, switch, abandon, clarify)을 내보낸다.
Gemini-3-Flash 모델에 ReAdapt를 적용하여 테스트한 결과, 따뜻한 소개(warm-introduction) 정확도는 37%에서 51%(+14 포인트)로 향상되었고, 반응 선택(reaction selection)의 정확도는 69%에서 77%(+8 포인트)로 개선되었다. 이 결과는 에이전트가 외부로부터 얻은 사회적 증거를 내부 상태에 명시적으로 적응시키며 추론할 때 신뢰도 높은 의사결정이 가능함을 보여준다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.