LLM의 자기 보고와 행동 일관성 제어 연구
Representational Control over Self-Report & Behavior Coherence in LLM Risk-Taking
연구진은 대규모 언어 모델(LLM)이 스스로 보고하는 성향과 실제 행동 간의 불일치 문제를 내부적으로 제어할 수 있음을 밝혀냈습니다.
이 연구는 대규모 언어 모델의 성향을 단순히 관찰하는 것을 넘어, 내부 구조를 검사하고 원하는 방식으로 조작할 수 있는 새로운 기반을 제시해요.
- 모델의 행동과 자기 보고는 서로 독립적인 내부 방향으로 움직이며, 이 두 방향을 조합하여 의도적으로 상반되는 결과를 유발할 수 있습니다.
- 이는 LLM의 성향을 단순히 관찰하는 것을 넘어, 모델의 내부 구조를 검사하고 원하는 방식으로 조작할 수 있는 새로운 기반을 제시합니다.
- 성능 제어를 위해서는 일반적인 지시보다 해당 작업에 특화된(task-specific) 내부 방향을 활용하여 행동과 자기 보고를 동시에 통제해야 합니다.
연구진은 (LLM)이 스스로 보고하는 성향과 실제 행동 간의 불일치 문제를 조사하기 위해 활성화 스티어링(activation steering)을 사용했습니다. 이들은 작업별 지시, 모델 자체의 작업 선택, 그리고 성향 설명 등 9가지 스티어링 벡터 추출 방법을 사용하여 네 가지 오픈 LLM에 대해 두 가지 행동 과제와 두 가지 심리 측정 도구에서 테스트를 진행했습니다.
연구 결과, 내부 개입이 공유적인 반응을 보장하지 않는다는 점이 밝혀졌습니다. 성향 설명에서 파생된 지시는 자기 보고에는 영향을 주지만 실제 행동은 무작위로 남겼고, 모델 자체의 작업 선택에서 파생된 지시는 그 반대였습니다. 오직 작업별 지시만이 두 가지 모두에 약하게 도달하는 것으로 나타났습니다.
특히, 한 가지는 행동을 움직이고 다른 하나는 자기 보고를 움직이는 방향으로 구성된 개입은 두 가지 모두를 함께 움직이게 했습니다. 이 중 하나의 부호를 반전시키면, 보고된 위험과 실제로 실행되는 위험이 서로 상반되는 방향을 가리키도록 만들 수 있었습니다. 이는 모든 모델에서 플립된 조합의 69~89%에서 관찰되었습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
LLM의 성향과 행동 불일치를 조사하는 데 어떤 방법을 사용했나요?
연구진은 활성화 스티어링이라는 기법을 사용하여 대규모 언어 모델(LLM)이 스스로 보고하는 성향과 실제 행동 간의 불일치 문제를 조사했어요. 이들은 작업별 지시, 모델 자체의 작업 선택, 그리고 성향 설명 등 9가지 벡터 추출 방법을 사용해 테스트를 진행했답니다.
LLM의 행동과 자기 보고는 서로 독립적으로 움직일 수 있나요?
네, 연구 결과에 따르면 내부 개입이 공유적인 반응을 보장하지 않아요. 예를 들어, 성향 설명에서 파생된 지시는 자기 보고에는 영향을 주지만 실제 행동은 무작위로 남기는 등 독립적으로 움직일 수 있답니다.
모델의 위험 보고와 실제 실행되는 위험을 다르게 만들 수 있나요?
네, 행동과 자기 보고를 움직이는 방향으로 구성된 개입을 사용하고 그중 하나의 부호를 반전시키면 가능해요. 이를 통해 모델이 보고하는 위험과 실제로 실행되는 위험이 서로 상반되는 방향을 가리키도록 만들 수 있었어요.