기기 내 개체명 인식(NER) 배포 가능성 연구: 정확도와 신뢰성을 중심으로
On-Device Named-Entity Recognition: A Deployability Study of Accuracy, Cost, Reliability, and Confidence
arXiv기기 내 개체명 인식(NER) 모델의 실질적 배포 가능성을 연구하며, 정확도 외에 지연 시간과 출력 안정성 등 다각적인 평가 기준을 제시했습니다.
AI를 기기에 직접 탑재할 때는 단순히 성능 점수가 높기보다, 자원 소모가 적고 장시간 사용에도 오류 없이 작동하는 신뢰성이 가장 중요한 판단 기준이 돼요.
- 최고 정확도의 대규모 언어 모델(LLM)보다, 인코더 기반 전문 모델이 크기 효율성과 오류 없는 안정성 면에서 실제 기기 배포에 더 적합함을 입증했습니다.
- AI를 기기에 직접 탑재할 때는 높은 성능 점수보다 자원 소모가 적고 장시간 사용에도 오류 없이 작동하는 신뢰성이 핵심 판단 기준이 됩니다.
- 모델의 신뢰도 지표는 정확도를 잘 반영하지만 과신할 수 있으므로, 실제 환경에서의 엄격한 검증과 보정 과정이 필수적입니다.
개체명 인식(NER)은 를 사용하지 않고 기기 자체에서 낮은 지연 시간으로 데이터를 로컬에 유지하는 것이 중요해지고 있다. 본 연구는 단순히 모델의 정확도를 평가하는 것을 넘어, 실제 배포 가능성 측면에서 모델들의 지연 시간과 출력 유효성을 함께 분석했다.
정확도만 놓고 보면 4B 규모의 명령어(instruct) 이 경쟁력을 갖추지만, 인코더 기반 전문 모델은 기기 배포에 더 적합하다는 결과가 나왔다. 이들 인코더 모델은 크기가 1/9에서 1/24 수준이며, 지연 시간과 함께 오류 없는 출력을 보장했다. 반면, 가장 작은 생성형 모델조차 긴 입력에서는 최대 27%의 유효하지 않은 출력을 내보내는 문제가 확인되었다.
모델의 신뢰도 지표는 정확도를 잘 반영하지만 과신할 수 있다. 예를 들어 GLiNER는 AUROC가 0.76에서 0.86 사이로 높은 정확도를 보였으나, ECE 값(0.24~0.47)을 통해 과신하는 경향이 확인되었다. 따라서 실제 환경에서는 엄격한 검증과 보정 과정이 필수적이다.
용어 풀이
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
기기 자체에서 개체명 인식을 할 때 어떤 모델이 가장 적합한가요?
정확도만 놓고 보면 명령어(instruct) LLM이 경쟁력을 갖추지만, 실제 기기 배포에는 크기가 작고 오류 없이 출력을 보장하는 인코더 기반 전문 모델이 더 적합해요. 이들 인코더 모델은 원래 크기의 1/9에서 1/24 수준으로 매우 효율적이에요.
모델의 정확도 지표를 그대로 믿어도 괜찮을까요?
아니요. 모델의 신뢰도 지표는 정확도를 잘 반영하지만, 과신할 수 있어요. 따라서 실제 환경에서는 엄격한 검증과 보정 과정이 반드시 필요해요. 예를 들어 GLiNER 같은 모델은 높은 정확도를 보여도 과신하는 경향이 확인되었어요.
기기 자체에서 개체명 인식을 하는 것이 왜 중요한가요?
API를 사용하지 않고 기기 자체에서 처리하면 낮은 지연 시간으로 데이터를 로컬에 안전하게 유지할 수 있기 때문이에요. 이 연구는 단순히 정확도뿐 아니라 실제 배포 가능성 측면의 지연 시간과 출력 유효성을 함께 분석했어요.