이름만 다국어일까? 우르두어에서 발견된 LLM의 문화적/언어적 약점
Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu
arXiv연구진은 우르두어(Urdu)를 대상으로 세 가지 최신 LLM을 활용해 93개의 이야기를 생성하고, 이를 통해 언어적 오류 유형을 심층 분석했습니다.
- 분석 결과, LLM들은 기본적인 문법 및 의미 오류를 자주 범하며, 생성된 이야기는 일관성이 부족하고 문화적 깊이가 현저히 떨어진다는 점이 밝혀졌습니다.
- 이는 현재의 대규모 언어 모델들이 저자원 언어 환경에서 신뢰할 수 있는 콘텐츠 생성이나 정보 검색 도구로 사용되기에는 명확한 한계가 있음을 시사합니다.
- 특히 프롬프팅 기법을 개선하더라도 문화적 맥락이나 배경 지식에서 발생하는 오류는 근본적으로 해결되지 않는다는 점에 주목해야 합니다.
다국어 (LLM)은 오픈 엔디드 텍스트 생성에 활용되지만, 저자원 언어에서의 동작 방식은 여전히 불분명합니다. 본 연구는 대표적인 저자원 언어인 우르두어를 대상으로 하며, 세 가지 최신 LLM(GPT-5.1, Qwen-3-Max, DeepSeek-3.1)을 사용하여 93개의 이야기로 구성된 'Urdu-Stories' 코퍼스를 생성했습니다. 이 과정에서 발견된 오류들은 언어적, 의미적, 문화적 측면의 총 아홉 가지 레이블 분류 체계에 따라 수동으로 주석 처리되었습니다.
분석 결과, LLM들은 기본적인 문법 및 의미 오류를 자주 범하는 경향을 보였습니다. 생성된 이야기들은 전반적인 일관성이 부족하고 부자연스러운 반복이 나타났으며, 문화적으로도 깊이가 현저히 떨어진다는 점이 확인되었습니다. 또한, 소수샷 프롬프팅 기법을 사용했음에도 불구하고 이러한 문화적 및 맥락적 오류는 근본적으로 해결되지 않는 것으로 나타났습니다.
연구진은 이러한 발견을 통해 현재의 LLM들이 저자원 언어 환경에서 신뢰할 수 있는 콘텐츠 생성이나 정보 검색 도구로 사용되기에는 명확한 한계가 있음을 강조했습니다. 이는 다국어 LLM이 이름만 다국어일 뿐, 실제 활용에 제약이 따를 수 있음을 시사합니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.