로봇 물리 AI 추론 연산의 클라우드/엣지 분산화 연구 결과
Offloaded inference for real-world physical AI robotics
Microsoft Research기존처럼 온보드 GPU에만 의존하던 로봇 AI 추론 연산을 엣지/클라우드로 분산시키는 것이 효율적임을 입증했습니다.
- 연산 분산은 로봇의 작업 성공률 및 정확도를 높일 뿐만 아니라, 전력 효율을 개선하여 배터리 작동 시간을 크게 연장합니다.
- 이는 로봇이 제조, 가정 등 예측 불가한 실세계 환경에서 안정적이고 안전하게 작동하기 위한 필수적인 AI 시스템 기반을 마련합니다.
- 다만, 연산을 외부로 분산할 때는 성능 향상 외에도 네트워크 지연 시간, 대역폭, 자원 할당 등의 복잡한 균형(트레이드오프)을 반드시 고려해야 합니다.
기존 로봇 AI 시스템은 를 온보드에 장착하여 추론을 수행하는 방식이 일반적이었으나, 이는 로봇 성능과 배터리 수명, 확장성에 한계를 가져옵니다. 물리 AI 모델의 크기와 복잡성이 커짐에 따라 온보드 컴퓨팅 자원의 제약은 더욱 명확해지고 있습니다. 연구진들은 이러한 문제를 해결하기 위해 추론 연산을 엣지 또는 클라우드의 GPU로 분산(offloading)하는 것이 로봇 성능 향상에 큰 이점을 제공함을 입증했습니다.
실제 모바일 조작 작업 환경에서 추론 연산을 외부로 분산시키자, 로봇의 작업 성공률과 정확도가 크게 개선되었습니다. 예를 들어, 온보드 GPU로는 처리하기 어려웠던 모바일 조작 스택을 구동할 수 있게 되었으며, 충분한 메모리를 가진 A100 대비 매핑 및 계획 단계가 최대 383%까지 느려지는 현상도 관찰되었습니다. 또한, 온보드 GPU는 배터리 소모를 크게 유발하여, 이를 Raspberry Pi-5 보드로 대체하고 데이터를 외부로 전송하는 방식은 배터리 수명을 개선하는 효과를 가져왔습니다.
이러한 분산 추론 시스템을 구현하기 위해 Kubernetes 기반의 툴셋이 개발되어, 로봇 워크로드를 컨테이너화하고 로봇 본체, 엣지 GPU, 클라우드 전반에 걸쳐 배포 및 오케스트레이션할 수 있게 되었습니다. 다만, 연산을 외부로 분산하는 과정에서는 성능 향상뿐만 아니라 네트워크 지연 시간(latency), 대역폭, 그리고 사용 가능한 GPU 자원 간의 복잡한 트레이드오프를 반드시 고려해야 합니다.
용어 풀이
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.