리서치 연구
병렬 디코딩으로 이커머스 제품 속성 대규모 추출
Scaling E-Commerce Attribute Extraction with Parallel Decoding
arXiv이 기술은 복잡하고 비정형적인 이커머스 카탈로그에서 고객의 구매 결정에 중요한 핵심 제품 속성을 자동으로 추출하는 2단계 LLM 파이프라인을 제시합니다.
세 줄 요약
- 카테고리별로 구매 구별적 속성 스키마를 먼저 발견한 후, 경량화된 모델과 하이퍼-병렬 디코딩(HPD)으로 추론 비용을 92% 절감하며 높은 정확도를 유지했습니다.
- 이는 다양한 제품군에 걸쳐 일관되고 비교 가능한 구조화된 지식 기반을 자동으로 구축하여, 검색 및 추천 시스템 같은 후속 애플리케이션 성능 향상에 기여합니다.
- 단순 속성 추출이 아닌, 구매 구별적 스키마를 먼저 발견하는 2단계 과정과 경량 LLM 기술 적용이 이 파이프라인의 핵심 강점입니다.
이커머스 카탈로그는 비정형적이며, 고객의 구매 결정에 중요한 특정 제품 속성을 식별하고 이를 대규모로 추출하는 것이 어렵습니다. 기존의 표준 속성 값 추출(AVE) 시스템은 모든 속성을 동등하게 취급하여, 소비자가 제품을 차별화하는 데 사용하는 요소를 반영하지 못하는 크고 일관성이 부족한 속성 세트를 생성하는 문제가 있었습니다.
이 문제를 해결하기 위해 두 단계로 구성된 파이프라인이 제시되었습니다. 첫 번째 단계에서는 각 제품 카테고리별로 구매 구별적 속성의 간결하고 순위가 매겨진 스키마를 먼저 발견합니다. 이후 된 경량 LLM(Qwen3-4B)과 하이퍼-병렬 디코딩(HPD)을 사용하여 해당 속성 값들을 카탈로그 텍스트에서 추출하는 방식으로 작동합니다.
이 파이프라인은 기초 LLM 수준인 85%의 추출 정확도를 달성하면서도, 기존 기초 LLM 대비 추론 비용을 92% 절감했습니다. 이러한 효율성은 제품 발견 및 카탈로그 강화에 필요한 프로덕션 규모 사용을 가능하게 하며, 다양한 제품군에 걸쳐 일관되고 비교 가능한 구조화된 지식 기반을 자동으로 구축합니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.