로봇의 자율 개선을 위한 RPG 프레임워크 소개
Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
로봇이 자체적으로 능력을 향상시키는 새로운 방법론으로, 모델 가중치를 업데이트하지 않고도 학습 및 개선을 수행하는 'RPG' 프레임워크가 개발되었습니다.
이 프레임워크는 로봇이 인간의 개입 없이도 시뮬레이션과 실제 환경에서 스스로 능력을 개선할 수 있는 가능성을 제시해요.
- 이 프레임워크는 시뮬레이션 연습과 피드백 기반의 개선 과정을 거쳐 초기 성공률 28.6%를 95.0%까지 끌어올렸으며, 실제 물리 환경에서도 높은 성능을 입증했습니다.
- 기존에 방대했던 로봇 개발 및 유지보수에 필요한 막대한 인적 자원 투입을 줄이고, AI 에이전트가 인간의 개입 없이 지속적으로 능력을 발전시킬 수 있는 가능성을 제시합니다.
- 다만, 이 시스템은 오프라인 데이터를 활용해 연습 과제를 설계하며, 실제 로봇 적용을 위해서는 하드웨어에 맞는 정밀한 보정과 적응 과정이 필수적으로 요구됩니다.
Reconstruct, Practice, Go Real(RPG)은 로봇 실행 시스템이 모델 를 업데이트하지 않고도 다양한 작업에서 신뢰할 수 있는 능력을 자율적으로 향상시키기 위해 개발된 프레임워크입니다. 이 방법론은 오프라인 데이터셋을 활용하여 조작 능력을 식별하고, 이를 기반으로 시뮬레이션 환경 내에 관련 연습 과제를 구성하는 것이 핵심입니다.
RPG는 연습 과정에서 실행 피드백, 특권화된 시뮬레이터 상태, 그리고 사용 가능한 데이터셋 비디오를 종합적으로 사용하여 시스템의 실패 원인을 진단합니다. 이 진단을 바탕으로 재사용 가능한 새로운 기호적 스킬을 개발하거나 기존 스킬을 개선하고 를 수정하며, 교차 작업 평가를 통해 변경 사항과 통합된 개정본을 검증하는 과정을 거칩니다.
테스트 시점에는 (LLM)이 최종적으로 확립된 시스템 와 스킬 라이브러리를 활용하여 로봇의 인식 및 제어를 조정합니다. 이 방법론은 22가지 조작 작업에 대한 초기화 테스트에서 첫 번째 연습 라운드 이후 성공률을 28.6%에서 95.0%로 향상시켰으며, ASPIRE(75.5%)와 CaP-를 포함한 모든 평가 기준보다 우수한 성능을 입증했습니다.
실제 물리 환경에서의 적용 사례도 보고되었습니다. Agent0이 GPT-6 Astra Pro 기반으로 사용되었으며, 일반적인 교정 및 하드웨어 적응 절차를 거친 후 세 가지 작업 각각에 대해 총 30회의 물리적 테스트에서 모두 성공하는 결과를 보여주었습니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 시스템 프롬프트
- 대화가 시작되기 전에 AI의 역할과 규칙을 정해 두는 지시문.
- 멀티모달
- 글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 프롬프트
- AI에게 주는 지시나 질문 글.
RPG 프레임워크는 어떤 원리로 로봇 능력을 향상시키나요?
이 방법론은 오프라인 데이터셋을 활용하여 조작 능력을 파악하고, 시뮬레이션 환경 내에 연습 과제를 구성하는 것이 핵심이에요. 여기서 실행 피드백과 데이터를 종합적으로 진단하여 새로운 스킬을 개발하거나 시스템 프롬프트를 수정하며 개선 과정을 거칩니다.
로봇의 성능 향상은 어느 정도였나요?
22가지 조작 작업에 대한 초기화 테스트에서 첫 연습 라운드 이후 성공률이 28.6%에서 95.0%로 크게 향상되었어요. 이 결과는 다른 평가 기준보다 우수한 성능을 입증한 것이에요.
실제 물리 환경에서도 적용이 가능한가요?
네, 실제 물리 환경에서의 적용 사례도 보고되었어요. Agent0을 기반으로 테스트를 진행했으며, 일반적인 보정과 하드웨어 적응 절차를 거친 후 세 가지 작업 각각에 대해 총 30회의 물리적 테스트에서 모두 성공하는 결과를 보여주었어요.