문화적 친족 용어, 인식과 생성 능력 비교 연구
Recognized but Not Produced: A Generation Benchmark for Culturally Specific Kinship Terms
arXiv기존의 객관식 방식에 의존하던 LLM 평가에서 벗어나, 연구진은 힌디어, 타밀어 등 비서구권 언어로 친족 용어를 직접 생성하게 하는 새로운 실험을 진행했습니다.
- 주요 모델들은 정답 선택(인식) 능력은 높았으나, 해당 문화적 용어를 실제로 '생성'하는 능력에서는 현저한 격차를 보이는 패턴이 확인되었습니다.
- 이는 AI가 단순히 언어 데이터를 학습하는 것을 넘어, 특정 문화권의 복잡한 사회적 관계와 맥락을 깊이 이해하고 표현할 수 있는지에 대한 중요한 시사점을 제공합니다.
- 모델 성능은 프롬프트 방식이나 언어별 특성(예: 가부장제 계보 강조)에 따라 크게 달라지므로, 평가 형식 자체의 한계를 함께 고려해야 합니다.
기존의 평가가 다국어 친족 이해를 객관식(multiple choice) 방식으로만 수행했던 한계를 극복하기 위해, 본 연구는 힌디어, 타밀어, 한국어 등 세 가지 비서구권 언어로 친족 용어를 직접 '생성'하도록 다섯 개의 오픈 LLM에 를 제공했습니다. 이 생성 능력을 매칭된 선택지 기반의 기준선(baseline)과 비교하여 평가를 진행했습니다.
연구 결과, 주요 모델들은 정답을 선택하는 인식 능력은 높게 나타났으나, 해당 문화적 친족 용어를 실제로 '생성'하는 능력에서는 현저한 격차를 보이는 패턴이 확인되었습니다. 예를 들어, GPT OSS120B는 75개의 유효 셀 중 90.67%에서 올바른 용어를 선택했으나, 실제 생성 시도 중 받아들여지는 용어 비율은 36.00%에 그쳤습니다. Llama 3.370B 역시 비슷한 패턴을 보였습니다 (각각 77.92% 대 24.24%).
모델의 성능은 프롬프트 방식이나 언어별 특성에 따라 크게 달라졌으며, 명시적으로 지정된 L3 프롬프트 조건에서 GLM-5.1은 72.29%, Llama-3.370B는 24.24%로 정확도가 차이를 보였습니다. 또한, 친족 용어의 생성 난이도는 관계가 명확히 제시되더라도 여전히 어렵다는 점을 보여주며, 평가 형식 자체의 한계를 함께 고려해야 함을 시사합니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 프롬프트
- AI에게 주는 지시나 질문 글.