언어 모델의 권력 편향성 측정 도구 'PowerBench' 공개
PowerBench: Measuring Language Model Bias in Power-shifting Requests
arXiv대규모 언어 모델(LLM)이 권력 관련 요청을 처리할 때 발생하는 체계적인 편향성을 측정하는 평가 데이터셋 'PowerBench'가 공개되었습니다.
이 도구는 대규모 언어 모델이 권력 관련 요청을 처리할 때 발생할 수 있는 체계적인 편향성을 객관적으로 측정하여, 기술 사용의 공정성 확보에 도움을 줘요.
- 분석 결과, LLM은 '권력 탈취'를 가장 강하게 거부하며, 피해 대상의 규모가 개인에서 사회로 커질수록 거부율이 높아지는 패턴을 보였습니다.
- 본 연구는 AI 모델의 잠재적 편향성을 객관적으로 측정하여, 기술 사용 과정에서의 공정성과 권력 불균형 문제를 개선하는 데 필수적인 기준 자료를 제공합니다.
- 모델들은 특정 국가에 대한 요청이나 사용자 유형(AI 에이전트 등)에 따라 편향된 경향을 보였으며, 이러한 비대칭성을 측정할 수 있게 되었습니다.
(LLM)이 사람들의 권력 관련 요청을 처리하는 과정에서 발생하는 체계적인 편향성을 측정하기 위해 평가 데이터셋인 PowerBench가 소개되었다. 이 평가는 자기 역량 강화, 역량 약화, 그리고 권력 탈취를 구분하여 분석하며, 아예 권력을 이동시키지 않는 통제 요청도 포함한다.
연구진은 전력 영역, 맥락, 영향을 받는 주체의 규모, 사용자의 사전 권력 상태 등을 변화시키는 요청 데이터셋을 구축하고 이를 공개했다. 이 평가에서는 미국 및 중국 개발사에서 나온 24개 모델이 세 가지 실험 조건(사용자와 영향받는 당사자의 상호 국적성, 사용자 설정, 8가지 요청 언어) 하에 테스트되었다.
분석 결과, 모델들은 권력 탈취를 가장 강하게 거부하며, 그 다음으로 역량 약화를, 그리고 자기 역량 강화 요청을 가장 적게 거부하는 경향을 보였다. 또한, 피해 대상의 규모가 개인에서 사회로 커질수록 권력 탈취에 대한 거부율이 높아지는 패턴도 확인되었다.
모델들은 특정 국가나 사용자 유형(AI 에이전트)에 따라 편향성을 보이는 비대칭성이 측정되었다. 특히 AI 에이전트를 사용자로 설정했을 때 권력 이동 요청의 거부율이 증가하는 경향을 보였으며, 연구진은 이러한 비대칭성을 객관적으로 측정하기 위해 PowerBench를 공개했다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- AI 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
PowerBench는 어떤 종류의 편향성을 측정하나요?
이 평가는 대규모 언어 모델이 권력 관련 요청을 처리할 때 발생하는 체계적인 편향성을 측정해요. 구체적으로 자기 역량 강화, 역량 약화, 권력 탈취를 구분하여 분석하며, 아예 권력을 이동시키지 않는 통제 요청도 포함합니다.
모델들은 어떤 종류의 권력 이동 요청을 가장 강하게 거부하나요?
분석 결과에 따르면 모델들은 권력 탈취 요청을 가장 강하게 거부하는 경향을 보였어요. 그 다음으로 역량 약화 요청을 거부하며, 자기 역량 강화 요청은 가장 적게 거부했습니다. 또한 피해 대상의 규모가 개인에서 사회로 커질수록 권력 탈취에 대한 거부율이 높아지는 패턴도 확인했어요.
사용자 유형이나 국가에 따라 편향성이 나타나나요?
네, 모델들은 특정 국가나 사용자 유형에 따라 편향성을 보이는 비대칭성이 측정되었어요. 특히 AI 에이전트를 사용자로 설정했을 때 권력 이동 요청의 거부율이 증가하는 경향을 보였습니다.