리서치 연구
How Output Format Confounds Data Quality and Capability in Instruction Tuning
ARarXiv
대규모 언어 모델의 성능 평가(데이터 품질, 벤치마크)가 답변을 작성하는 '출력 형식'이라는 표면적 인터페이스에 의해 심각하게 왜곡될 수 있다는 연구 결과입니다.
세 줄 요약
- 모델의 실제 능력은 학습된 환경이나 인터페이스에 상대적으로 존재하며, 특정 형식에서 높은 성능을 보여도 다른 형식에서는 측정되지 않거나 오히려 큰 손실이 발생할 수 있습니다.
- 현재 AI 분야는 모델의 본질적인 내용(콘텐츠)보다 결과를 보여주는 '형식' 자체를 보고하는 경향이 있어, 실제 역량을 오해할 위험이 매우 큽니다.
- 데이터 품질과 모델 능력은 인터페이스에 따라 달라지는 조건부 양상이므로, 정확한 평가를 위해서는 단순히 결과만 보는 것이 아닌 근본적인 구조 분석이 필수적입니다.
대규모 언어 모델의 성능 평가(데이터 품질, 벤치마크)가 답변을 작성하는 '출력 형식'이라는 표면적 인터페이스에 의해 심각하게 왜곡될 수 있다는 연구 결과입니다.