모델 연구
Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA
ARarXiv
최근 연구는 다중 모드 대규모 언어 모델(MLLMs)이 자원이 부족하고 복잡한 크메르어 문서에 대한 이해도를 진단하는 파일럿 테스트를 진행했습니다.
세 줄 요약
- 외부 OCR 도구를 활용했을 때 정확도가 최대 61.9%까지 향상되었으나, MLLM 자체의 성능은 여전히 제한적이며 특히 현지 스크립트 답변에서 어려움을 보였습니다.
- AI가 구조화된 영어 데이터나 숫자 처리에는 강점을 보이지만, 비라틴 문자 또는 저자원 언어 문서 이해에 큰 기술적 난관이 있음을 보여줍니다.
- 결과적으로 크메르어 스크립트 답변은 다른 필드보다 훨씬 어려워, 현존하는 MLLMs의 신뢰성 있는 네이티브 언어 처리 능력이 주요 과제로 남아있습니다.
최근 연구는 다중 모드 대규모 언어 모델(MLLMs)이 자원이 부족하고 복잡한 크메르어 문서에 대한 이해도를 진단하는 파일럿 테스트를 진행했습니다.