리서치 연구
소형 언어 모델의 불확실성 탐지 및 활용 연구
Do small language models know what they don't know?
arXiv소형 언어 모델(SLM)의 정확도를 높이기 위해 엔트로피 기반 신호 활용 가능성을 탐구했습니다.
세 줄 요약
- 단순 토큰 엔트로피는 효과가 없었으나, 의미론적 엔트로피를 이용해 불확실한 질문을 대형 전문가 모델로 연결하자 정확도가 최대 50%p 향상되었습니다.
- SLM의 가치는 단순히 연산량 절감이 아니라, 가장 필요한 곳에 컴퓨팅 자원을 지능적으로 할당하는 데 있음을 시사합니다.
- 특히 같은 계열이 아닌 다른 전문가 모델로 연결하는 교차 라우팅(Cross-family routing) 방식이 성능 향상 면에서 더 효과적인 것으로 나타났습니다.
소형 언어 모델(SLM)의 정확도를 높이기 위해 엔트로피 기반 신호 활용 가능성을 탐구했습니다.