고전 중국 시의 미학적 추론 능력을 평가하는 벤치마크 — AI 생성 일러스트
리서치 연구

고전 중국 시의 미학적 추론 능력을 평가하는 벤치마크

Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry

arXiv9월 18일 발표 · 2분 · 프리프린트

대규모 언어 모델(LLM)이 고전 중국 시에 대한 진정한 추론 능력을 갖추었는지 검증하는 새로운 평가 벤치마크, ‘Neo-Classic’이 공개되었습니다.

세 줄 요약arXiv 원문 기반
  1. 실험 결과, 모델들은 과거의 문학 패턴을 학습했으나, 현대적이고 복잡한 구문에서는 최대 50%에 달하는 성능 격차를 보였습니다.
  2. 이는 현존하는 LLM이 단편적인 형식 구조는 파악해도, 전체를 아우르는 고차원적인 '계층적 추론'에는 근본적인 한계를 가짐을 보여줍니다.
  3. 심지어 전문가의 도움을 받아도 인간 최고 전문가와는 상당한 성능 차이가 발생하며, AI가 아직 도달하지 못한 영역이 명확합니다.

(LLM)이 고전 중국 시에 대한 진정한 언어-미학적 추론 능력을 갖추었는지 검증하기 위해 'Neo-Classic'이라는 새로운 평가 가 소개되었다. 이 벤치마크는 기존의 역사적 코퍼스 기반 검증이나 생성 방식과 달리, 현대 전문가들이 작성한 엄격하게 운율을 갖춘(metrical) 시를 사용하며 구성주의적인 샘플 외 데이터셋(OOS)과 역방향 이해 세트를 결합하여 직접 검색 가능성을 낮췄다.

연구진은 Qwen3-Max, Gemini-3-Pro, DeepSeek-V3.2 등 최신 모델들을 대상으로 계층적 제약 만족을 테스트하는 다섯 가지 행동 프롬프트를 적용했다. 그 결과, 모델들이 역사적 텍스트에서 현대적 텍스트로 전환될 때 20%에서 50%에 달하는 성능 격차가 나타나는 것이 확인되었다. 또한, 담론 수준의 순서 지정 작업에서는 표준 정확도가 0%에서 13% 사이로 낮게 측정되었다.

이러한 결과는 현재 LLM들이 국지적인 형식 패턴은 포착할 수 있지만, 견고한 언어-미학적 추론에 필요한 전역적인 계층적 계획(global hierarchical planning)에는 어려움을 겪음을 시사한다. 전문가의 도움을 받아도 성능이 향상된 모델은 36% 수준이었으나, 여전히 인간 최고 전문가와는 상당한 격차가 존재했다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
프롬프트
AI에게 주는 지시나 질문 글.
원문arXiv · Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
원문 보기arXiv