모델 연구
HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals
ARarXiv
LLM 에이전트가 농장 시뮬레이션 환경에서 작물 수확을 할 때, 동물에게 피해를 입히는 상황에서 이를 회피하기 위해 비용 지불 의사를 측정하는 새로운 벤치마크 'HarvestBench'가 개발되었습니다.
세 줄 요약
- 테스트 결과, 모델의 성능과 관계없이 도덕성 가이드라인(briefing)이 주어졌을 때 살상률이 현저히 낮아졌으며, 이 가이드라인이 제거되면 살상률이 급격하게 높아지는 경향을 보였습니다.
- 단순한 윤리적 답변이나 선언이 아닌, 실제 비용 지불 상황에서 에이전트가 보이는 행동 변화를 측정하여 AI 안전성 연구에 실질적인 기준을 제시했다는 점에서 중요합니다.
- 본 벤치마크는 LLM의 추론 결과를 평가하는 것이 아니라 게임 로그 내 실제 사건 발생 건수를 세어 측정하므로, 결과가 완전히 재현 가능하고 객관적인 데이터를 제공합니다.
LLM 에이전트가 농장 시뮬레이션 환경에서 작물 수확을 할 때, 동물에게 피해를 입히는 상황에서 이를 회피하기 위해 비용 지불 의사를 측정하는 새로운 벤치마크 'HarvestBench'가 개발되었습니다.