대규모 데이터셋에서 추론 난이도를 분석하는 새로운 방법 제시
No More Free Lunch: Corpus Task Complexity Matters as Corpora Grow
arXiv대규모 데이터셋에서 질문의 난이도가 코퍼스 크기에 따라 어떻게 증가하는지 측정하는 '코퍼스 태스크 복잡성(CTC)' 개념을 정의하고, 기존 연구가 간과했던 고난도 과제들을 제시했습니다.
- 특히 난이도가 급증하는 고-CTC 작업에서는 효율적인 어텐션 방식들이 오히려 성능 저하를 보여, 이전의 모델링 결론을 뒤집는 현상이 발견되었습니다.
- 이는 단순히 긴 문맥 처리를 넘어, 코퍼스 전체를 활용해야 하는 고차원적이고 복합적인 추론 능력이 LLM에게 여전히 큰 도전 과제임을 시사합니다.
- 따라서 대규모 코퍼스 기반의 복잡한 추론을 위해서는 높은 연산 비용을 해결할 수 있는 새로운 스케일링 및 모델링 기법 연구가 필수적입니다.
본 연구는 대규모 코퍼스를 활용할 때 질문의 난이도가 어떻게 변화하는지 측정하는 '코퍼스 태스크 복잡성(CTC)' 개념을 정의했습니다. 예를 들어, 단순 검색 질의는 코퍼스를 한 번 선형적으로 통과하는 것만으로 충분하지만, 모순되는 주장을 찾는 작업은 기하급수적으로 증가하는 쌍의 검토가 필요합니다. 기존 연구들은 주로 난이도가 코퍼스 크기에 따라 선형적으로 증가하는 저-CTC(low CTC) 과제에 초점을 맞추어 왔습니다.
연구진은 이러한 한계를 극복하기 위해, 난이도가 코퍼스 크기에 따라 이차 이상으로 증가하는 고-CTC(high CTC)에 속하는 10개의 새로운 과제를 제시했습니다. 분석 결과, 고-CTC 과제는 LCLM(Large Context Language Models)에게 평균적으로 더 어려운 도전 과제가 되며, 저-CTC 평가만으로는 도출된 많은 모델링 결론을 뒤집는 현상이 관찰되었습니다.
특히 효율적인 블록 희소 및 하이브리드 어텐션 접근 방식들이 저-CTC 과제에서는 전체 어텐션 성능과 일치하는 모습을 보였으나, 고-CTC 과제에서는 훨씬 더 큰 성능 저하를 보이는 것으로 나타났습니다. 따라서 대규모 코퍼스 기반의 고차원적 추론은 여전히 해결해야 할 난제로 남아있으며, 연구진은 이 분야의 발전을 돕기 위해 코드와 데이터가 포함된 22개 과제 세트인 CTC-Bench를 공개했습니다.