언어 모델 평가 난이도를 높이는 'HARDEN' 방법론 연구
HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases
arXiv기존 언어 모델 평가 데이터셋이 실제 복잡성을 반영하지 못하는 한계를 극복하기 위해 'HARDEN'이라는 새로운 방법을 제안했습니다.
- HARDEN은 원래의 정답을 유지하면서도 난이도를 높인 테스트 케이스를 생성하며, 평균 22.7%의 정확도 하락 등 까다로운 평가가 가능함을 입증했습니다.
- 이는 언어 모델이 실제 기업 환경에 투입될 때 발생할 수 있는 잠재적 성능 저하를 예측하고 대비하는 데 중요한 기준을 제시합니다.
- 특히 난이도를 높이는 과정에서도 '작업 의미'와 '실행 유효성' 같은 핵심 제약 조건을 유지하여 평가의 신뢰성을 확보했습니다.
기존 언어 모델들은 실제 기업 환경의 복잡성을 충분히 반영하지 못하는 선별된 를 통해 평가되는 경향이 있습니다. 이에 연구진은 HARDEN이라는 제약적 진화 탐색(constrained evolutionary search) 방법을 도입했습니다. 이 방법은 기존 평가 케이스의 입력값을 수정하여 난이도를 높인 변형 케이스를 생성하면서도, 해당 케이스가 기대하는 출력값은 고정시키는 것이 핵심입니다.
HARDEN은 도메인 특화 복잡성 축을 따라 탐색을 수행하며, 이 과정에서 작업 의미(task semantics), 현실성(realism), 실행 유효성(execution validity)과 같은 필수적인 실현 가능성 제약 조건들을 강제합니다. 이러한 제약을 통해 평가의 신뢰성을 유지하면서도 모델에게 더 까다로운 테스트 환경을 제공할 수 있습니다.
이 방법론은 FinQA, PubMedQA, ContractNLI 등 여러 벤치마크와 Qwen3.5 모델 세 가지 규모(35B-A3B, 122B-A10B, 397B-A17B)를 대상으로 테스트되었습니다. 그 결과, HARDEN은 평균적으로 작업-모델 정확도를 22.7% 감소시켰으며, 동일한 실현 가능성 검사를 사용했을 때 단일 패스 기준선 대비 최대 49.9%까지 상대적인 정확도 하락을 보여주었습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.