모델 연구

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

ARarXiv8월 21일 발표 · 1분 · 심사 전 논문

연구진이 LLM의 비영어 안전 격차를 다루는 다국어 편향 벤치마크 INCLUDE를 소개했다.

세 줄 요약arXiv 원문 기반
  1. INCLUDE로 10개 LLM의 14,988개 점수에서 벵골어가 오픈소스 편향이 가장 높고, 영어는 오픈소스 최저, 클로즈드소스 최고였다.
  2. 비영어 안전 필터가 실패하면 음성 비서가 고정관념을 강화하는 답변을 내어 비영어 커뮤니티에 편향이 퍼진다.
  3. 안전 정렬이 영어 중심이고, INCLUDE는 인도 중심 사회문화 편향을 측정하며, 결과는 10개 LLM의 14,988개 점수에 한정된다.

연구진이 LLM의 비영어 안전 격차를 다루는 다국어 편향 벤치마크 INCLUDE를 소개했다.

원문arXiv · Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기