엣지 디바이스에서 대규모 행동 모델을 실시간 구동하는 InstinctFlash — AI 생성 일러스트
로보틱스 뉴스

엣지 디바이스에서 대규모 행동 모델을 실시간 구동하는 InstinctFlash

Show HN: InstinctFlash – Run 5B world-action models in real time on Jetson Thor

Hacker News9월 22일 발표 · 2분

InstinctFlash는 대규모 세계 행동 모델을 Jetson Thor 같은 엣지 디바이스부터 고성능 워크스테이션까지 실시간으로 구동하는 통합 AI 추론 프레임워크입니다.

세 줄 요약Hacker News 원문 기반
  1. FP8 양자화 및 최적화된 실행 환경을 통해 최대 33.78배의 속도 향상을 달성하며, 모델 성능 저하 없이 높은 처리량을 입증했습니다.
  2. 복잡한 LLM 기반의 로봇 행동 계획을 실제 현장(엣지) 환경에 적용하는 기술적 장벽을 낮추어, AI 로봇 시스템 상용화에 기여합니다.
  3. 단일 Runtime API를 통해 모델 선언부터 최적화 계획, 실행까지 모든 과정을 관리하며, 다양한 하드웨어 및 정밀도 설정을 지원합니다.

InstinctFlash는 대규모 세계 행동 모델(world-action models)을 Jetson Thor와 같은 엣지 디바이스부터 고성능 워크스테이션까지 실시간으로 구동할 수 있도록 설계된 통합 추론 프레임워크입니다. 이 시스템은 FP8 및 최적화를 통해 최대 33.78배의 속도 향상을 달성했으며, 실제 로봇 테스트 환경에서 작업 성능 저하 없이 높은 처리량을 입증했습니다.

프레임워크는 모델 선언(declaration), 최적화 계획 수립, 런타임 실행 및 증거를 단일 Runtime 로 관리합니다. 이를 통해 사용자는 Python API 또는 `instinctflash serve` 명령어를 사용하여 접근할 수 있으며, Jetson Thor 외에도 RTX 4090과 RTX 5090 같은 다양한 워크스테이션 환경을 지원합니다.

성능 최적화는 모델의 변경(MODEL)부터 실행 방식 개선(GRAPH, CACHE 등), 그리고 하드웨어 레벨(HARDWARE)까지 총 6개 계층에 걸쳐 이루어집니다. 이 구조를 통해 프레임워크는 체크포인트가 증명 가능한 최적화만 판단하여 적용하며, 모든 과정을 단일하고 검증 가능한 경로로 유지합니다.

용어 풀이

양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
API
프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
원문Hacker News · Show HN: InstinctFlash – Run 5B world-action models in real time on Jetson Thor
원문 보기Hacker News