NanoJev: 다중 환경에 적용 가능한 0.6B 병렬 의사결정 모델
TianyuCodings/NanoJev
GitHubNanoJev는 0.6B 규모의 병렬 의사결정 모델로, 상태와 질문을 입력받아 완전한 확률 분포를 직접 출력합니다. ViZDoom이나 미로 찾기 등 다양한 게임 환경에 적용되었습니다.
- 기존 모델 대비 압도적인 성능 향상을 보여, ViZDoom Basic에서 128/128의 최고 성공률을 기록했습니다. 하나의 작은 백본으로 여러 게임에 적용하는 효율성이 핵심 강점입니다.
- 단순한 언어 생성을 넘어, 복잡하고 장기적인 목표를 설정하고 단계별 행동을 계획하는 능력을 입증했습니다. 이는 범용 인공지능(AGI) 개발의 새로운 방향성을 제시합니다.
- 총 18,760개에 달하는 방대한 의사결정 질문으로 학습되어 높은 범용성을 보입니다. 다만, 현재는 특정 시뮬레이션 환경에 최적화된 모델임을 염두에 두어야 합니다.
NanoJev는 0.6B 규모의 병렬 의사결정 모델로, 상태(state)와 질문(question)을 입력받아 완전한 확률 분포를 직접 출력하는 것이 특징입니다. 이 모델은 답변 생성을 거치지 않고도 행동에 대한 순위 지정, 선택 또는 샘플링이 가능하며, 하나의 작은 백본 구조가 Maze, Snake 및 ViZDoom과 같은 네 가지 게임 작업 전반에 걸쳐 재사용됩니다.
NanoJev는 여러 환경에서 기존 모델 대비 높은 성능을 입증했습니다. 예를 들어, ViZDoom Basic 테스트에서는 128/128의 성공률을 기록하며 이전 Jev 모델의 56/128보다 향상되었습니다. 또한, 50x50 미로(Maze) 찾기에서도 NanoJev는 225회 시도로 출구에 도달한 반면, Jev 모델은 2,738회, Untuned Qwen은 4,726회를 기록했습니다.
이 모델은 총 18,760개의 의사결정 질문을 포함하는 방대한 데이터셋으로 학습되었으며, ViZDoom Predict Position과 ViZDoom Basic 등 각 작업별로 다양한 분할(train, dev, calibration, test, OOD)에 걸쳐 사용됩니다. 이 과정에서 모델은 Maze, Snake, Basic, Predict Position 네 가지 작업을 1/3, 1/3, 1/6, 1/6으로 혼합하여 학습합니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.