이름만 다국어일까? 우르두어에서 발견된 LLM의 문화적/언어적 약점 — AI 생성 일러스트AI 일러스트
리서치 연구

이름만 다국어일까? 우르두어에서 발견된 LLM의 문화적/언어적 약점

Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu

arXiv9월 11일 발표 · 2분 · 심사 전 논문

연구진은 우르두어(Urdu)를 대상으로 세 가지 최신 LLM을 활용해 93개의 이야기를 생성하고, 이를 통해 언어적 오류 유형을 심층 분석했습니다.

세 줄 요약arXiv 원문 기반
  1. 분석 결과, LLM들은 기본적인 문법 및 의미 오류를 자주 범하며, 생성된 이야기는 일관성이 부족하고 문화적 깊이가 현저히 떨어진다는 점이 밝혀졌습니다.
  2. 이는 현재의 대규모 언어 모델들이 저자원 언어 환경에서 신뢰할 수 있는 콘텐츠 생성이나 정보 검색 도구로 사용되기에는 명확한 한계가 있음을 시사합니다.
  3. 특히 프롬프팅 기법을 개선하더라도 문화적 맥락이나 배경 지식에서 발생하는 오류는 근본적으로 해결되지 않는다는 점에 주목해야 합니다.

다국어 (LLM)은 오픈 엔디드 텍스트 생성에 활용되지만, 저자원 언어에서의 동작 방식은 여전히 불분명합니다. 본 연구는 대표적인 저자원 언어인 우르두어를 대상으로 하며, 세 가지 최신 LLM(GPT-5.1, Qwen-3-Max, DeepSeek-3.1)을 사용하여 93개의 이야기로 구성된 'Urdu-Stories' 코퍼스를 생성했습니다. 이 과정에서 발견된 오류들은 언어적, 의미적, 문화적 측면의 총 아홉 가지 레이블 분류 체계에 따라 수동으로 주석 처리되었습니다.

분석 결과, LLM들은 기본적인 문법 및 의미 오류를 자주 범하는 경향을 보였습니다. 생성된 이야기들은 전반적인 일관성이 부족하고 부자연스러운 반복이 나타났으며, 문화적으로도 깊이가 현저히 떨어진다는 점이 확인되었습니다. 또한, 소수샷 프롬프팅 기법을 사용했음에도 불구하고 이러한 문화적 및 맥락적 오류는 근본적으로 해결되지 않는 것으로 나타났습니다.

연구진은 이러한 발견을 통해 현재의 LLM들이 저자원 언어 환경에서 신뢰할 수 있는 콘텐츠 생성이나 정보 검색 도구로 사용되기에는 명확한 한계가 있음을 강조했습니다. 이는 다국어 LLM이 이름만 다국어일 뿐, 실제 활용에 제약이 따를 수 있음을 시사합니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv