검색 광고 최적화를 위한 다중 목적 정책 학습 방법론 — AI 생성 일러스트AI 일러스트
리서치 연구

검색 광고 최적화를 위한 다중 목적 정책 학습 방법론

UniPolicy: Unified Objective-Specific Policies for Generative Search Advertising

arXiv9월 17일 발표 · 3분 · 심사 전 논문

검색 광고 시스템이 관련성, 클릭률 등 상충하는 여러 목표를 동시에 최적화하기 어렵다는 문제를 해결한 'UniPolicy' 프레임워크가 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. UniPolicy는 목표별 파라미터 분리(MoE-LoRA)와 다중 정책 검색을 결합하여, 각 비즈니스 목적에 맞는 최적화된 결과를 도출합니다.
  2. 실제 광고 시스템에서 CTR 0.71%, RPS 1.58%, 광고 수익 1.32% 향상을 입증하며 사용자 경험과 상업적 가치를 동시에 개선했습니다.
  3. 이 기술은 단일 목표 최적화를 넘어, 복잡하고 다양한 비즈니스 요구사항을 통합적으로 처리하는 차세대 검색 시스템의 방향성을 제시합니다.

검색 광고 시스템은 사용자 의도와 상업 콘텐츠를 연결하며 플랫폼 수익화에 중요한 역할을 합니다. 기존의 검색 광고 시스템들은 관련성, 클릭 성향(click propensity), 상업 가치 등 이질적인 여러 목표들을 동시에 최적화하는 데 어려움을 겪어왔습니다. 이러한 다중 목적 환경에서는 단일 비즈니스 보상만 사용하거나 단순한 보상 융합 방식으로는 사용자 경험과 비즈니스 가치를 균형 있게 확보하기 어렵기 때문입니다.

연구진은 목표 인지(objective-aware) 기반의 다중 정책 정렬 프레임워크인 UniPolicy를 제안했습니다. 이 방법론은 객체별 접두사 , 희소 - 라우팅, 그리고 목적별 잔여 FFN을 결합하여 공유 백본 내에서 를 계층적으로 분리합니다. 이를 통해 다양한 비즈니스 목표에 대해 차별화된 매개변수 및 정책 표현 공간을 제공하며, 다단계 행동 피드백으로부터 쌍별 선호도를 구성하여 성능을 강화했습니다.

UniPolicy는 추론 단계에서 병렬적이고 비즈니스 맞춤형의 다중 정책 빔 검색을 지원합니다. 대규모 오프라인 실험 결과, UniPolicy는 단일 목표 강화를 초과하는 균형 잡힌 개선을 보였습니다. 특히 실제 검색 광고 시스템에 적용한 7일간의 온라인 A/B 테스트에서는 CTR이 0.71% 향상되었고, RPS가 1.58%, 광고 수익은 1.32% 증가했으며 안정적인 서비스 지연 시간을 유지했습니다.

용어 풀이

토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
MoE
여러 하위 모델 중 일부만 골라 계산하는 구조. 모델이 커도 실행 비용을 줄일 수 있어요.
LoRA
모델 전체 대신 작은 추가 부분만 학습시켜 적은 비용으로 미세 조정하는 기법.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문arXiv · UniPolicy: Unified Objective-Specific Policies for Generative Search Advertising같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기