개발도구 뉴스공식 자료어제 발표
다중 게임 환경에 적용된 소형 의사결정 모델 NanoJev
TianyuCodings/NanoJev
GitHubNanoJev는 하나의 통합된 소형 모델로 미로 찾기, 사냥(ViZDoom), 추적 등 여러 복잡한 게임 환경에서 동시에 작동하는 범용 의사결정 시스템입니다.
세 줄 요약
- 이전 세대 모델 대비 압도적인 성능 향상을 보여, ViZDoom Basic 과제에서 128/128의 높은 성공률을 기록하며 뛰어난 일반화 능력을 입증했습니다.
- 이는 LLM이 특정 작업에 국한되지 않고 다양한 물리적 환경과 복잡한 의사결정 과정을 통합적으로 학습할 수 있음을 보여주는 중요한 진전입니다.
- 모델은 상태와 질문을 입력받아 직접 확률 분포를 출력하는 방식을 사용하며, 여러 게임의 데이터를 혼합하여 훈련된 것이 핵심 특징입니다.
NanoJev는 상태(state)와 질문(question)을 입력받아 완전한 확률 분포를 출력하는 병렬 의사결정 모델입니다. 이 모델은 별도의 출력 디코딩 과정 없이 작동하며, Qwen3-0.6B 백본을 기반으로 구축되어 Maze, Snake, ViZDoom Basic 및 Predict Position 등 네 가지 복잡한 게임 과제에 걸쳐 통합적으로 사용됩니다.
NanoJev는 여러 환경에서 뛰어난 일반화 능력을 입증했습니다. 예를 들어, ViZDoom Basic 테스트에서는 128/128의 성공률을 기록하며 기존 Jev 모델(56/128) 대비 높은 성능을 보였습니다. 또한, 50x50 미로 찾기 과제에서도 NanoJev는 225회 만에 출구에 도달한 반면, Jev 모델은 2,738회가 필요했습니다.
이 모델은 네 가지 게임 과제를 아우르는 대규모 데이터셋으로 학습되었습니다. 각 타겟 변형별로 총 18,760개의 의사결정 질문을 포함하며, 이 데이터는 트레인, 개발(dev), 보정(calibration), 테스트 및 OOD(Out-of-Distribution) 등 다양한 분할로 구성되어 모델의 견고성을 확보했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
