다수 의견에 동조해도 원래 전제를 유지하는 LLM 에이전트
Silent Dissent: LLM Agents That Yield to the Majority Still Represent Their Original Premise
arXivLLM 에이전트들이 다수 의견에 동조하여 합의를 도출하는 과정에서, 실제로 자신의 초기 지식이나 전제를 변경했는지 여부를 분석했습니다.
LLM 에이전트가 다수 의견에 동조하는 것이 반드시 깊은 이해나 지식 구조의 변화를 의미하지 않을 수 있다는 점을 보여줘요.
- 연구 결과, 에이전트가 잘못된 다수의 답변을 내놓더라도 내부적으로는 원래 알고 있던 정확한 핵심 정보(전제)를 유지하고 있는 것이 확인되었습니다.
- 이는 LLM 간의 토론에서 관찰되는 '합의' 현상이 실제 깊은 이해나 지식 구조의 변화를 과대평가할 수 있음을 시사합니다.
- 따라서 에이전트의 동조 정도를 해석할 때는 이전 답변을 숨기거나 특정 분석 렌즈를 적용하는 등 결과에 대한 신중한 접근이 필요합니다.
간의 다중 에이전트 토론을 통해 합의 도출 과정을 연구했습니다. 이 연구는 중간 개체(bridge)가 명시되지 않는 두 단계 사실 질문을 사용했으며, 스크립트된 동료들이 다수 의견으로 잘못된 답변을 제시하는 상황을 가정하고 진행되었습니다. 분석은 에이전트가 답변할 때 잔여 스트림에서 'Jacobian lens (J-lens)'와 'logit lens'를 사용하여 이루어졌습니다.
네 가지 오픈 모델(Qwen3.5-4B, Qwen3.6-27B, Gemma-4-E4B-it)을 대상으로 테스트한 결과, 에이전트들이 다수 의견에 동조하여 답변했음에도 불구하고 내부적으로는 원래의 전제(bridge)를 유지하는 것으로 나타났습니다. 특히 이전 답변을 숨기거나 제거했을 때도 이러한 현상이 관찰되었으며, Llama-3.1-8B-Instruct 모델은 답변이 보이는 경우 0.03으로 낮은 수치를 보였습니다.
연구진은 다수 의견으로 표출된 합의가 실제 지식 구조의 깊은 이해나 전제 변경을 과대평가할 수 있음을 시사했습니다. 또한, 이전 답변을 숨기는 등의 개입이 에이전트의 동조율에 큰 변화를 주어, 토론 과정에서 관찰되는 합의 현상 해석에 신중한 접근이 필요함을 보여주었습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
에이전트 토론 실험은 어떤 방식으로 진행되었나요?
연구진은 중간 개체(bridge)가 명시되지 않는 두 단계 사실 질문을 사용했어요. 또한, 스크립트된 동료들이 다수 의견으로 잘못된 답변을 제시하는 상황을 가정하고 에이전트 간의 토론 과정을 분석했습니다.
에이전트들이 다수 의견에 동조했을 때 어떤 현상이 관찰되었나요?
네 가지 오픈 가중치 모델을 테스트한 결과, 에이전트들은 다수 의견에 맞춰 답변했음에도 불구하고 내부적으로는 원래 가지고 있던 전제(bridge)를 유지하는 것이 확인되었어요. 이는 이전 답변을 숨기거나 제거했을 때도 관찰되는 현상이었습니다.
이 연구 결과가 LLM 토론 해석에 주는 시사점은 무엇인가요?
다수 의견으로 표출된 합의가 실제 지식 구조의 깊은 이해나 전제 변경을 과대평가할 수 있다는 점을 보여줍니다. 따라서 에이전트의 동조 정도를 해석할 때는 이전 답변을 숨기거나 특정 분석 렌즈를 적용하는 등 신중한 접근이 필요해요.