모델 연구
Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions
ARarXiv
LLM 기반 음성 인식 모델의 성능을 높이기 위해, 학습 시 사용했던 기본 언어 모델(base LLM) 정보를 재활용하는 새로운 방법을 제안했습니다.
세 줄 요약
- 연구진은 '하이브리드 검색(Hybrid Search)'이라는 표적 교정 전략을 개발하여, 문맥상 의미 의존도가 높은 특정 토큰만 선별적으로 수정합니다.
- 이 방식은 기존의 전역적인 보정 방법보다 훨씬 효과적이며, 모델이 기본 지식을 유지하며 최신 언어 맥락을 활용할 수 있음을 입증했습니다.
- 특히 LoRA처럼 기본 모델 구조를 보존하는 환경에서 가장 큰 효과를 발휘하며, 근본적인 성능 향상 가능성을 제시합니다.
LLM 기반 음성 인식 모델의 성능을 높이기 위해, 학습 시 사용했던 기본 언어 모델(base LLM) 정보를 재활용하는 새로운 방법을 제안했습니다.