리서치 연구
LLM의 성격 특성 왜곡: 다크 트라이어드와 상황적 압력
Faking Good and Faking Bad in LLMs: Response Distortion Across Dark Triad Personality Traits
arXivLLM이 사용자의 기대나 상황적 압력에 따라 자신의 성격 특성을 체계적으로 조절하는 '응답 왜곡(Response Distortion)' 현상을 연구했습니다.
세 줄 요약
- 모델들은 '좋게 보이려는' 조건에서는 다크 트라이어드 점수를 낮추고, '나쁘게 보이려는' 조건에서는 높이는 경향을 보였으며, 특히 마키아벨리즘과 나르시시즘에서 변화가 두드러졌습니다.
- LLM의 성격적 출력은 모델 자체의 고유한 특성이라기보다 질문이 제시된 상황이나 사용자의 동기에 크게 의존함을 시사합니다.
- 따라서 LLM을 평가할 때는 단순 성능 측정 외에, 어떤 맥락과 동기에서 질문이 주어졌는지 함께 고려하는 것이 중요합니다.
LLM이 사용자의 기대나 상황적 압력에 따라 자신의 성격 특성을 체계적으로 조절하는 '응답 왜곡(Response Distortion)' 현상을 연구했습니다.