병렬 디코딩으로 이커머스 제품 속성 대규모 추출 — AI 생성 일러스트AI 일러스트
리서치 연구

병렬 디코딩으로 이커머스 제품 속성 대규모 추출

Scaling E-Commerce Attribute Extraction with Parallel Decoding

arXiv9월 10일 발표 · 2분 · 심사 전 논문

이 기술은 복잡하고 비정형적인 이커머스 카탈로그에서 고객의 구매 결정에 중요한 핵심 제품 속성을 자동으로 추출하는 2단계 LLM 파이프라인을 제시합니다.

세 줄 요약arXiv 원문 기반
  1. 카테고리별로 구매 구별적 속성 스키마를 먼저 발견한 후, 경량화된 모델과 하이퍼-병렬 디코딩(HPD)으로 추론 비용을 92% 절감하며 높은 정확도를 유지했습니다.
  2. 이는 다양한 제품군에 걸쳐 일관되고 비교 가능한 구조화된 지식 기반을 자동으로 구축하여, 검색 및 추천 시스템 같은 후속 애플리케이션 성능 향상에 기여합니다.
  3. 단순 속성 추출이 아닌, 구매 구별적 스키마를 먼저 발견하는 2단계 과정과 경량 LLM 기술 적용이 이 파이프라인의 핵심 강점입니다.

이커머스 카탈로그는 비정형적이며, 고객의 구매 결정에 중요한 특정 제품 속성을 식별하고 이를 대규모로 추출하는 것이 어렵습니다. 기존의 표준 속성 값 추출(AVE) 시스템은 모든 속성을 동등하게 취급하여, 소비자가 제품을 차별화하는 데 사용하는 요소를 반영하지 못하는 크고 일관성이 부족한 속성 세트를 생성하는 문제가 있었습니다.

이 문제를 해결하기 위해 두 단계로 구성된 파이프라인이 제시되었습니다. 첫 번째 단계에서는 각 제품 카테고리별로 구매 구별적 속성의 간결하고 순위가 매겨진 스키마를 먼저 발견합니다. 이후 된 경량 LLM(Qwen3-4B)과 하이퍼-병렬 디코딩(HPD)을 사용하여 해당 속성 값들을 카탈로그 텍스트에서 추출하는 방식으로 작동합니다.

이 파이프라인은 기초 LLM 수준인 85%의 추출 정확도를 달성하면서도, 기존 기초 LLM 대비 추론 비용을 92% 절감했습니다. 이러한 효율성은 제품 발견 및 카탈로그 강화에 필요한 프로덕션 규모 사용을 가능하게 하며, 다양한 제품군에 걸쳐 일관되고 비교 가능한 구조화된 지식 기반을 자동으로 구축합니다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
원문arXiv · Scaling E-Commerce Attribute Extraction with Parallel Decoding같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv