모델 연구
Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs
ARarXiv
연구진이 LLM의 비영어 안전 격차를 다루는 다국어 편향 벤치마크 INCLUDE를 소개했다.
세 줄 요약
- INCLUDE로 10개 LLM의 14,988개 점수에서 벵골어가 오픈소스 편향이 가장 높고, 영어는 오픈소스 최저, 클로즈드소스 최고였다.
- 비영어 안전 필터가 실패하면 음성 비서가 고정관념을 강화하는 답변을 내어 비영어 커뮤니티에 편향이 퍼진다.
- 안전 정렬이 영어 중심이고, INCLUDE는 인도 중심 사회문화 편향을 측정하며, 결과는 10개 LLM의 14,988개 점수에 한정된다.
연구진이 LLM의 비영어 안전 격차를 다루는 다국어 편향 벤치마크 INCLUDE를 소개했다.