모델 연구
How Language Models Organize and Structure Moral Knowledge
ARarXiv
연구진은 대규모 언어 모델(LLM)이 도덕적 지식을 어떻게 조직하는지 분석하며, 주요 도덕 기초 이론 6가지 관점에서 그 구조를 측정했습니다.
세 줄 요약
- 모델의 도덕성은 각 요소가 독립적이면서도 공통의 '통합적 구조'를 공유하고 있으며, 단순한 판단이 아닌 '도덕적 긴장' 자체를 표현하는 것으로 나타났습니다.
- 이는 LLM이 도덕성을 단순히 키워드 매칭을 넘어, 복잡하고 체계적인 지식 구조로 이해하고 있다는 중요한 증거를 제시합니다.
- 발견된 도덕적 구조는 특정 이론에 국한되지 않고 방대한 학습 데이터(코퍼스 통계)를 기반으로 하며, 다양한 모델 규모에서 일관되게 나타납니다.
연구진은 대규모 언어 모델(LLM)이 도덕적 지식을 어떻게 조직하는지 분석하며, 주요 도덕 기초 이론 6가지 관점에서 그 구조를 측정했습니다.