리서치 연구

법률 텍스트 분류를 위한 LLM과 전통적 기계 학습 비교 연구

Legal text classification in Korean sexual offense cases: from traditional machine learning to large language models with XAI insights

ARarXiv10월 2일 발표 · 2분 · 프리프린트

법률 문서 분류의 어려움을 해결하기 위해 전통적인 기계 학습부터 대규모 언어 모델(LLM)까지 다양한 AI 기술을 비교 분석했습니다.

왜 중요해요AI 정리

법률 문서 분류와 같은 전문 분야에서는 모델의 크기보다 해당 도메인에 맞춰 데이터를 미세 조정하는 것이 높은 정확도를 얻는 데 훨씬 중요해요.

세 줄 요약arXiv 원문 기반
  1. 연구 결과, 범용 모델보다 법률 데이터에 특화하여 미세 조정된 소규모 모델이 높은 정확도를 보여 도메인 적응의 중요성을 입증했습니다.
  2. 법률 분야 AI 활용 시 단순히 성능만 볼 것이 아니라, 예측 근거를 설명하는 해석 가능성(XAI) 확보가 필수적임을 강조합니다.
  3. 높은 분류 성능에도 불구하고, 모델이 실제 법률 사례처럼 암묵적인 문맥이나 미묘한 맥락을 완벽히 이해하는 데는 여전히 한계가 존재함을 확인했습니다.

본 연구는 한국 성범죄 판례의 열 가지 범주를 사용하여 법률 문서 분류 모델을 평가했습니다. 분석은 전통적인 머신러닝 기술부터 (LLMs)에 이르기까지 다양한 모델들을 비교했으며, 법률 텍스트가 가진 복잡성과 미묘한 차이로 인해 정확한 분류가 어렵다는 점에 주목했습니다.

연구 결과, KLUE-BERT와 같은 소규모 모델을 법률 데이터에 맞게 (fine-tuning)한 것이 GPT-3.5나 GPT-4.0과 같은 범용 모델이나 전통적인 머신러닝 모델보다 우수한 성능을 보였습니다. 특히 KLUE-BERT는 99.3%의 높은 정확도를 달성하여, 법률 문서 분류에서는 모델 크기보다 도메인 적응 및 미세 조정이 중요함을 보여주었습니다.

또한, 연구진은 설명 가능한 AI(XAI) 기법을 활용해 모델 예측과 오분류 사례를 분석했습니다. 이 과정에서 언어적 특징이 모델 결정에 영향을 주는 것을 파악했으나, 실제 법률 기록과 유사한 KICS 데이터를 사용했을 때도 모델이 암묵적인 문맥적 단서를 해석하는 데 어려움을 겪는 한계점도 확인했습니다.

용어 풀이

대규모 언어 모델
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
궁금한 점AI 정리 · 원문 기반
법률 문서 분류 시 어떤 모델이 가장 효과적이었나요?

KLUE-BERT와 같은 소규모 모델을 법률 데이터에 맞게 미세 조정하는 것이 GPT-3.5나 GPT-4.0과 같은 범용 모델이나 전통적인 머신러닝 모델보다 더 우수한 성능을 보였어요. 이는 법률 문서 분류에서는 모델의 크기보다는 도메인 적응이 중요함을 보여줍니다.

AI가 법률 문맥을 이해하는 데 어떤 한계점이 있나요?

모델이 언어적 특징에 의해 결정되는 것은 파악했지만, 실제 법률 기록과 유사한 데이터를 사용했을 때도 암묵적인 문맥적 단서를 해석하는 데 어려움을 겪는 한계점이 확인되었어요.

연구에서 모델의 예측 근거를 분석하기 위해 어떤 기술을 활용했나요?

설명 가능한 인공지능(XAI) 기법을 활용하여 모델의 예측과 오분류 사례를 분석했어요. 이 과정을 통해 언어적 특징이 모델 결정에 영향을 주는 것을 파악할 수 있었습니다.

원문arXiv · Legal text classification in Korean sexual offense cases: from traditional machine learning to large language models with XAI insights
궁금한 점 3개AI 정리