고전 중국 시의 미학적 추론 능력을 평가하는 벤치마크
Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
arXiv대규모 언어 모델(LLM)이 고전 중국 시에 대한 진정한 추론 능력을 갖추었는지 검증하는 새로운 평가 벤치마크, ‘Neo-Classic’이 공개되었습니다.
- 실험 결과, 모델들은 과거의 문학 패턴을 학습했으나, 현대적이고 복잡한 구문에서는 최대 50%에 달하는 성능 격차를 보였습니다.
- 이는 현존하는 LLM이 단편적인 형식 구조는 파악해도, 전체를 아우르는 고차원적인 '계층적 추론'에는 근본적인 한계를 가짐을 보여줍니다.
- 심지어 전문가의 도움을 받아도 인간 최고 전문가와는 상당한 성능 차이가 발생하며, AI가 아직 도달하지 못한 영역이 명확합니다.
(LLM)이 고전 중국 시에 대한 진정한 언어-미학적 추론 능력을 갖추었는지 검증하기 위해 'Neo-Classic'이라는 새로운 평가 가 소개되었다. 이 벤치마크는 기존의 역사적 코퍼스 기반 검증이나 생성 방식과 달리, 현대 전문가들이 작성한 엄격하게 운율을 갖춘(metrical) 시를 사용하며 구성주의적인 샘플 외 데이터셋(OOS)과 역방향 이해 세트를 결합하여 직접 검색 가능성을 낮췄다.
연구진은 Qwen3-Max, Gemini-3-Pro, DeepSeek-V3.2 등 최신 모델들을 대상으로 계층적 제약 만족을 테스트하는 다섯 가지 행동 프롬프트를 적용했다. 그 결과, 모델들이 역사적 텍스트에서 현대적 텍스트로 전환될 때 20%에서 50%에 달하는 성능 격차가 나타나는 것이 확인되었다. 또한, 담론 수준의 순서 지정 작업에서는 표준 정확도가 0%에서 13% 사이로 낮게 측정되었다.
이러한 결과는 현재 LLM들이 국지적인 형식 패턴은 포착할 수 있지만, 견고한 언어-미학적 추론에 필요한 전역적인 계층적 계획(global hierarchical planning)에는 어려움을 겪음을 시사한다. 전문가의 도움을 받아도 성능이 향상된 모델은 36% 수준이었으나, 여전히 인간 최고 전문가와는 상당한 격차가 존재했다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 프롬프트
- AI에게 주는 지시나 질문 글.