로봇 공학에 LLM을 적용한 자율 작동 실험 과정 보고
Getting out of the way: my robotics crash course
Hacker News소프트웨어 개발자가 로봇 팔을 이용해 물체를 집고 옮기는 실험 과정을 기록하며, 대규모 언어 모델(LLM)의 물리적 자율 작동 능력을 입증했습니다.
- 개발자가 부재한 사이, LLM은 카메라 피드백과 저항 감지 기능을 활용하여 복잡한 물체 분류 및 배치 작업을 스스로 수행하는 성과를 보여주었습니다.
- 이는 AI가 단순 코딩을 넘어 물리적 환경에서 자율적으로 문제를 해결하고 학습할 수 있음을 입증하며 로봇 공학의 새로운 가능성을 제시합니다.
- 다음 목표는 LLM 훈련 과정을 VLA(Vision-Language Action) 데이터로 전환하는 것이며, 궁극적으로는 젠가 쌓기 등 더 복잡한 작업 수행이 과제로 남아있습니다.
소프트웨어 개발자는 로봇 팔 프로젝트를 위해 3D 프린팅된 LeRobot SO-101 키트(배터리 포함, $415 선적가)와 웹캠을 구매하여 시스템을 구축했습니다. 초기 단계에서는 서보 모터 보호 및 과부하 방지 소프트웨어를 작성하고, 인쇄된 AprilTags를 사용하여 작은 움직임과 보정 작업을 진행했습니다. 이 과정에서 직렬 링크가 모터 작동 시 끊기는 문제와 더불어, 전원 공급 장치가 모든 서보 모터를 동시에 구동할 수 없어 한 번에 하나의 서보만 동력을 공급할 수 있다는 문제를 발견했습니다.
개발자는 초기 계획이었던 공간 매핑 및 역기구학 계산이 실제 움직임에서 오차가 크다는 것을 확인한 후, 초점을 '물체 집기 및 배치(pick-and-place)' 작업으로 전환했습니다. 개발자가 자리를 비운 사이, 에게 저항 피드백과 오버헤드 카메라, 손목 카메라를 모두 사용하여 정확한 위치를 파악하고 작업을 수행하도록 지시했습니다. 이 과정을 통해 시스템은 블록을 찾아 집는 동작을 성공적으로 수행했으며, 테스트 과정에서 흰색 테이프를 빨간색 마스킹 테이프로 교체하여 시각적 대비를 높였습니다.
최종 목표로 여러 색상의 블록(보라색, 빨간색, 파란색)을 지정된 구역에 배치하도록 LLM에게 지시했습니다. 그 결과, 시스템은 모든 목표 블록을 해당 영역에 성공적으로 배치하는 결과를 보여주었습니다. 이 과정에서 LLM이 주기적으로 촬영한 스크린샷들을 수집하여 타임랩스 비디오를 제작할 수 있었습니다. 향후 계획으로는 이 LLM 훈련 과정을 (Vision-Language Action) 데이터로 전환하고, 궁극적으로는 젠가 쌓기 같은 더 복잡한 작업을 목표로 하고 있습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- VLA
- 시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.