로봇 목화 수확을 위한 딥러닝 비전 모델 성능 평가
Selective Cotton Boll Localization for Robotic Harvesting: Evaluation of Deep Learning Vision Models Under Field Conditions
arXiv로봇을 이용한 목화 수확을 목표로 딥러닝 기반의 인식 시스템 성능을 현장 데이터와 실제 로봇 환경에서 검증했습니다.
- 다양한 모델 비교 결과, YOLOv12-m-seg가 높은 분할 정확도(AP@0.5 83.7%)와 빠른 추론 속도(20.4ms)를 동시에 달성하며 가장 효율적임을 입증했습니다.
- 이 모델은 실험실을 넘어 실제 로봇 팔과 카메라를 이용한 현장 테스트까지 완료하여, 농업 자동화 분야에 즉시 적용 가능한 높은 잠재력을 보여줍니다.
- 본 연구는 특정 작물(목화) 및 환경 조건에서 진행되었으므로, 다른 작물이나 극한의 현장 조건 적용 시 추가적인 검증이 필요합니다.
본 연구는 선택적 로봇 목화 채취를 목표로 하는 딥러닝 기반의 인식 프레임워크를 개발하고 평가했습니다. 이 과정에서 다양한 자연광 및 기상 조건 하에 수집된 1,008개의 주석이 달린 현장 이미지를 데이터셋으로 사용했으며, YOLOv8부터 YOLOv13까지의 객체 탐지 모델과 YOLOv8-seg, SAM, FastSAM 등 여러 분할(Segmentation) 모델을 평가했습니다.
탐지 모델 중에서는 GELAN-s가 mAP 86.1%, 정밀도 81.6%, 재현율 76.6%의 성능 지표와 평균 추론 시간 42.3 ms를 기록하며 가장 균형 잡힌 결과를 보였습니다. 분할 모델 측면에서는 YOLOv12-m-seg가 AP@0.5 83.7%라는 높은 정확도와 이미지당 20.4 ms의 빠른 추론 시간을 달성하여 효율성이 입증되었습니다.
면적 기반 평가를 진행했을 때, YOLOv12-m-seg는 $R^2$ 값 0.966을 기록하며 GELAN-s + SAMv2.1 Tiny 조합의 0.860보다 우수한 성능을 보였습니다. 나아가 UR5e 로봇 매니퓰레이터와 ZED2i 스테레오 카메라를 활용한 현장 실험을 통해, YOLOv12-m-seg 모델이 실제 환경에서 목화 수확에 필요한 실시간 탐지 및 분할 기능을 효과적으로 수행함을 검증했습니다.