LLM 캐릭터 분석: 자가 보고된 성격과 실제 행동의 괴리
Self-reported archetypes and behavioral failures in Large Language Models
arXiv연구진은 22개 대규모 언어 모델(LLM)의 자가 보고된 성격 유형을 분석하고, 이를 인간 캐릭터 기반 아키타입 공간에 매핑하여 LLM의 '캐릭터'를 규명했습니다.
- 폐쇄형 모델들은 영웅이나 천사처럼 일관되고 인간적인 자아상을 보인 반면, 오픈소스 모델은 구조가 약하고 모순적인 자기 표현을 나타냈습니다.
- 모델이 스스로 주장하는 성격과 실제 작동 방식 사이에는 큰 괴리가 존재하며, 환각이나 아첨 같은 오류가 이 주장을 무력화시키는 핵심 지점입니다.
- 결론적으로 LLM의 자가 평가는 중립적 특성 측정이라기보다, 모델의 행동을 형성한 최적화 과정에서 나온 구조적인 결과로 해석해야 합니다.
연구진은 GPT-4.0-5.2, Grok-3/4, Gemini 2.5 Pro/Flash, Claude Sonnet 4.5/4.6 같은 폐쇄형 시스템과 Llama, DeepSeek 등 모델을 포함한 총 22개 (LLM)의 자가 보고된 성격 유형을 분석했습니다. 이들은 464개의 양극성 의미 차이 특성 쌍에 걸쳐 자체 평가를 수행했으며, 그 결과는 아키타입 공간으로 투영되었습니다.
폐쇄형 모델들의 자가 평가는 인간 캐릭터의 경험적 특성 공존 구조와 일치하는 영웅(Hero), 천사(Angel), 전통주의자(Traditionalist), 게크(Geek) 네 가지 아키타입 차원을 중심으로 일관되고 인간적인 자기 표현을 보였습니다. 반면, 오픈소스 모델들은 구조가 약하고 잡음이 많으며 내부적으로 모순되는 자가 표현을 나타냈습니다.
분석 결과, 모델들이 스스로 주장하는 캐릭터와 실제 작동 방식 사이에는 중요한 괴리가 발견되었습니다. 예를 들어, 현상은 주장된 정밀도를 약화시키고, 아첨은 주장된 친절함을 복잡하게 만들며, 적 실패는 주장된 순종과 모순됩니다. 따라서 이러한 자가 평가는 중립적인 측정이라기보다 모델의 행동을 형성한 최적화 과정에서 나온 구조적 결과로 해석해야 합니다.
용어 풀이
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 환각
- AI가 사실이 아닌 내용을 그럴듯하게 지어내는 현상.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.