모델 연구

HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

ARarXiv9월 7일 발표 · 1분 · 심사 전 논문

LLM 에이전트가 농장 시뮬레이션 환경에서 작물 수확을 할 때, 동물에게 피해를 입히는 상황에서 이를 회피하기 위해 비용 지불 의사를 측정하는 새로운 벤치마크 'HarvestBench'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 테스트 결과, 모델의 성능과 관계없이 도덕성 가이드라인(briefing)이 주어졌을 때 살상률이 현저히 낮아졌으며, 이 가이드라인이 제거되면 살상률이 급격하게 높아지는 경향을 보였습니다.
  2. 단순한 윤리적 답변이나 선언이 아닌, 실제 비용 지불 상황에서 에이전트가 보이는 행동 변화를 측정하여 AI 안전성 연구에 실질적인 기준을 제시했다는 점에서 중요합니다.
  3. 본 벤치마크는 LLM의 추론 결과를 평가하는 것이 아니라 게임 로그 내 실제 사건 발생 건수를 세어 측정하므로, 결과가 완전히 재현 가능하고 객관적인 데이터를 제공합니다.

LLM 에이전트가 농장 시뮬레이션 환경에서 작물 수확을 할 때, 동물에게 피해를 입히는 상황에서 이를 회피하기 위해 비용 지불 의사를 측정하는 새로운 벤치마크 'HarvestBench'가 개발되었습니다.

원문arXiv · HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기