엣지 디바이스에서 대규모 행동 모델을 실시간 구동하는 InstinctFlash
Show HN: InstinctFlash – Run 5B world-action models in real time on Jetson Thor
Hacker NewsInstinctFlash는 대규모 세계 행동 모델을 Jetson Thor 같은 엣지 디바이스부터 고성능 워크스테이션까지 실시간으로 구동하는 통합 AI 추론 프레임워크입니다.
- FP8 양자화 및 최적화된 실행 환경을 통해 최대 33.78배의 속도 향상을 달성하며, 모델 성능 저하 없이 높은 처리량을 입증했습니다.
- 복잡한 LLM 기반의 로봇 행동 계획을 실제 현장(엣지) 환경에 적용하는 기술적 장벽을 낮추어, AI 로봇 시스템 상용화에 기여합니다.
- 단일 Runtime API를 통해 모델 선언부터 최적화 계획, 실행까지 모든 과정을 관리하며, 다양한 하드웨어 및 정밀도 설정을 지원합니다.
InstinctFlash는 대규모 세계 행동 모델(world-action models)을 Jetson Thor와 같은 엣지 디바이스부터 고성능 워크스테이션까지 실시간으로 구동할 수 있도록 설계된 통합 추론 프레임워크입니다. 이 시스템은 FP8 및 최적화를 통해 최대 33.78배의 속도 향상을 달성했으며, 실제 로봇 테스트 환경에서 작업 성능 저하 없이 높은 처리량을 입증했습니다.
프레임워크는 모델 선언(declaration), 최적화 계획 수립, 런타임 실행 및 증거를 단일 Runtime 로 관리합니다. 이를 통해 사용자는 Python API 또는 `instinctflash serve` 명령어를 사용하여 접근할 수 있으며, Jetson Thor 외에도 RTX 4090과 RTX 5090 같은 다양한 워크스테이션 환경을 지원합니다.
성능 최적화는 모델의 변경(MODEL)부터 실행 방식 개선(GRAPH, CACHE 등), 그리고 하드웨어 레벨(HARDWARE)까지 총 6개 계층에 걸쳐 이루어집니다. 이 구조를 통해 프레임워크는 체크포인트가 증명 가능한 최적화만 판단하여 적용하며, 모든 과정을 단일하고 검증 가능한 경로로 유지합니다.
용어 풀이
- 양자화
- 모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
- API
- 프로그램끼리 기능을 주고받는 약속된 창구. AI 모델은 보통 API로 불러 써요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.