개발도구 연구
Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture
ARarXiv
기존의 영어 중심 코딩 에이전트 평가 방식의 한계를 극복하고자, 언어, 지역, 문화를 반영한 다국어 코딩 벤치마크 'Terminal-Bench-LILT'가 개발되었습니다.
세 줄 요약
- 아랍어, 한국어 등 10개 언어로 구성된 300개의 실제 과제를 통해 평가한 결과, 최신 모델조차 평균 63.1% 수준의 낮은 통과율을 기록했습니다.
- 이 벤치마크는 국제화나 인코딩 등 비영어권 특유의 문제를 다루며, 다국어 코딩 능력이 일반적인 범용 능력과는 별개의 중요한 역량임을 입증합니다.
- 언어별 성능 편차가 크게 나타나는 점은 단순한 지표로는 측정할 수 없는 전문적이고 세분화된 '다국어 코딩 역량'의 중요성을 시사합니다.
기존의 영어 중심 코딩 에이전트 평가 방식의 한계를 극복하고자, 언어, 지역, 문화를 반영한 다국어 코딩 벤치마크 'Terminal-Bench-LILT'가 개발되었습니다.