개발도구 연구

Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture

ARarXiv9월 1일 발표 · 1분 · 심사 전 논문

기존의 영어 중심 코딩 에이전트 평가 방식의 한계를 극복하고자, 언어, 지역, 문화를 반영한 다국어 코딩 벤치마크 'Terminal-Bench-LILT'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 아랍어, 한국어 등 10개 언어로 구성된 300개의 실제 과제를 통해 평가한 결과, 최신 모델조차 평균 63.1% 수준의 낮은 통과율을 기록했습니다.
  2. 이 벤치마크는 국제화나 인코딩 등 비영어권 특유의 문제를 다루며, 다국어 코딩 능력이 일반적인 범용 능력과는 별개의 중요한 역량임을 입증합니다.
  3. 언어별 성능 편차가 크게 나타나는 점은 단순한 지표로는 측정할 수 없는 전문적이고 세분화된 '다국어 코딩 역량'의 중요성을 시사합니다.

기존의 영어 중심 코딩 에이전트 평가 방식의 한계를 극복하고자, 언어, 지역, 문화를 반영한 다국어 코딩 벤치마크 'Terminal-Bench-LILT'가 개발되었습니다.

원문arXiv · Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기