초경량 고성능 음성 인식 모델 Phonon-2 공개
FermionResearch/Phonon-2
Hugging FaceFermionResearch가 164MB의 초경량 크기에도 불구하고 높은 정확도를 자랑하는 영어 음성 인식 모델 'Phonon-2'를 공개했습니다.
작은 용량에도 불구하고 높은 정확도를 유지하며 다양한 환경에서 빠르게 작동하는 음성 인식 기술이 개발되어 활용도가 높아요.
- 오픈 ASR 리더보드에서 평균 단어 오류율 5.21%를 기록하며, 크기가 수 배 이상 큰 대형 모델들보다 뛰어난 성능을 입증했습니다.
- 온디바이스 환경에 최적화되어 있어, 제한된 자원에서도 빠른 속도와 고성능 음성 인식 기능을 구현하는 데 매우 유리합니다.
- 엔비디아의 파라킷 모델을 기반으로 하며, 애플 실리콘부터 다양한 CPU 환경까지 폭넓은 플랫폼에서 구동 가능하여 활용도가 높습니다.
Phonon-2는 164 MB의 작은 용량을 가지면서도 높은 정확도를 자랑하는 영어 음성 인식 모델입니다. 오픈 ASR 리더보드에서 평균 단어 오류율 5.21%를 기록하며, 크기가 수 배 이상 큰 다른 대형 모델들보다 우수한 성능을 입증했습니다.
이 모델은 M5 MacBook Air 환경에서 오디오 한 시간을 약 20초 만에 전사할 수 있는 등 높은 처리 속도를 보여줍니다. 또한 Mac용 받아쓰기 앱인 [Detta] 내부의 핵심 모델로 사용되고 있습니다.
개발자는 `pip install fermion-research` 명령어로 라이브러리를 설치하고, 커맨드 라인을 통해 음성 파일을 전사할 수 있습니다. 이 패키지는 Linux와 Windows CPU 환경에서도 구동 가능하며, Docker를 이용해 또는 CPU 환경에서 실행하는 방법도 제공됩니다.
용어 풀이
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
Phonon-2 모델의 성능과 크기는 어떤가요?
164MB라는 작은 용량임에도 높은 정확도를 자랑해요. 오픈 ASR 리더보드에서 평균 단어 오류율 5.21%를 기록하며, 크기가 훨씬 큰 대형 모델들보다 우수한 성능을 입증했어요.
이 음성 인식 모델은 어떤 환경에서 사용할 수 있나요?
M5 MacBook Air 같은 기기나 Linux, Windows CPU 환경에서 사용할 수 있어요. 또한 Docker를 이용하면 GPU 또는 CPU 환경에서도 실행할 수 있어 활용도가 높아요.
음성 인식의 처리 속도는 어느 정도인가요?
M5 MacBook Air 환경에서 오디오 한 시간을 약 20초 만에 전사할 수 있을 정도로 높은 처리 속도를 보여줘요.