자율주행 정책 개선을 위한 온-폴리시 미세 조정 기법 OPTED — AI 생성 일러스트AI 일러스트
로보틱스 연구

자율주행 정책 개선을 위한 온-폴리시 미세 조정 기법 OPTED

OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

arXiv9월 17일 발표 · 3분 · 심사 전 논문

자율주행 정책의 안전한 배포를 위해, 강화학습과 주행 정책 학습 과정을 분리하는 'OPTED'라는 온-폴리시 미세 조정 기법이 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. OPTED는 HD 지도 등 벡터화된 입력으로 '선생(teacher)' 모델을 훈련시키고, 이 선생님의 감독 하에 사전 학습된 주행 정책('학생')을 안전하게 개선합니다.
  2. 기존 방식 대비 시뮬레이션 상호작용 횟수를 대폭 줄이면서도 자율주행 성능을 크게 향상시켜 실질적인 안전성을 확보했습니다.
  3. 본 연구는 실제 주행 로그의 3D 재구성 환경에서 검증되었으며, 다양한 센서 및 조건에서의 적용 가능성을 추가로 확인해야 합니다.

자율주행 분야에서 엔드투엔드 주행 정책은 인간의 시연 데이터 기반 행동 복제(behavior cloning)를 통해 사전 훈련됩니다. 그러나 폐쇄 루프 환경에서 배포될 때 발생하는 누적 오차는 차량을 훈련 데이터 분포 밖으로 이탈시킬 위험이 있으며, 이는 안전에 치명적인 사고로 이어질 수 있습니다. 기존의 폐쇄 루프 후속 훈련 방식은 센서 기반 정책에 대해 비용이 많이 드는 시뮬레이션을 요구하는 한계가 있었습니다.

본 연구에서 제안된 OPTED(on-policy for end-to-end driving)는 과 엔드투엔드 정책의 후속 훈련 과정을 분리합니다. 이 방식은 특권 교사(privileged teacher)를 벡터화된 입력(HD 지도 및 바운딩 박스)을 사용하여 RL로 훈련시키고, 이 교사가 폐쇄 루프 후속 훈련 과정에서 사전 학습된 학생 모델에 감독 역할을 제공하여 안전성을 높입니다.

OPTED는 두 가지 카메라 기반 모델인 TransFuser와 VaVAM에 적용되었으며, 실제 주행 로그의 신경 재구성(3DGS) 환경을 활용해 AlpaSim에서 미세 조정되었습니다. 그 결과, 각각 1.6배 및 9.5배의 주행 점수 증가를 기록했습니다. 특히 OPTED는 직접적인 RL 후속 훈련 방식 대비 약 세 자릿수 적은 시뮬레이터 상호작용으로 유사한 성능을 달성하며 인간의 사전 지식(human prior)에 더 가깝게 유지되는 장점을 보였습니다.

용어 풀이

fine-tuning
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
원문arXiv · OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv