적응형 사고를 결합한 의사결정 모델 GEV-26B-Decide 공개
autotrust/GEV-26B-Decide
오픈 웨이트 의사결정 모델 GEV-26B-Decide가 공개되었으며, 빠르고 정확한 판단을 위해 시스템 1의 즉각적 추론과 필요할 때만 작동하는 적응형 사고(Adaptive thinking) 기능을 결합했습니다.
이 모델은 인공지능이 단순한 텍스트 생성을 넘어, 불확실성이 존재하는 복잡한 상황에서 스스로 추론하고 판단하여 다단계 작업을 수행할 수 있는 능력을 갖추었음을 보여주는 중요한 진전이에요.
- 이 모델은 논리 퍼즐 등 지식 추론 영역에서 성능을 크게 끌어올렸으며, 컴퓨터 사용이나 로봇 팔 제어 같은 시각 기반 작업에서도 높은 성공률과 빠른 처리 속도를 입증했습니다.
- 이는 인공지능이 단순한 텍스트 생성을 넘어, 불확실성이 존재하는 복잡한 상황에서 스스로 추론하고 판단하여 다단계 작업을 수행할 수 있는 능력을 갖추었음을 보여주는 중요한 진전입니다.
- 다만, 적응형 사고는 명시적인 규칙 기반의 논리 퍼즐에 가장 효과적이며, 순수한 지각이나 장기적인 연속 동작(예: 게임 플레이)에서는 성능 향상에 한계가 있다는 점을 고려해야 합니다.
autotrust/GEV-26B-Decide는 Gemma-4-26B-A4B-it을 기반으로 개발된 의사결정 모델입니다. 이 모델은 시스템 1의 즉각적인 추론과 필요할 때만 작동하는 적응형 사고(Adaptive thinking) 기능을 결합하여, Decision Index 0.2.1 (balanced skill)에서 62.48점을 기록했습니다. 이는 기존 TypeSafe Jev 1.13 모델이 기록한 57.91점과 비교됩니다.
모델은 컴퓨터 사용 및 로봇 팔 제어와 같은 시각 기반 다단계 작업에서도 높은 성능을 보였습니다. 컴퓨터 사용 테스트에서 60개의 무작위 다단계 작업을 약 85ms/클릭으로 95% 성공했으며, 이는 JEV-27B-VL과 동일한 성공률이지만 3배 빠른 속도입니다. 로봇 팔 제어에서는 20개 장면 중 40%를 완료하는 등, 시스템 1 기반의 빠르고 정확한 판단 능력을 입증했습니다.
적응형 사고 기능은 논리 퍼즐 영역에서 특히 효과적입니다. 이 모델은 기본적으로 System 1을 통해 확률 분포(p1)를 빠르게 도출하며, 만약 최고 옵션의 신뢰도가 임계값(기본값 0.8) 미만일 경우에만 System 2가 추론 과정을 거쳐 답변에 반영합니다. 그 결과, Minesweeper 같은 퍼즐에서 성공률이 무작위 확률 25.0%에서 86.0%로 크게 향상되었습니다.
다만, 적응형 사고는 명시적인 규칙 기반의 논리 퍼즐이나 전술적 추론에 가장 큰 효과를 보이며, 순수한 지각(스케치)이나 장기적인 연속 동작(2048 게임 또는 전체 Connect Four 게임 등)에서는 성능 향상에 한계가 있다는 점이 확인되었습니다.
이 모델은 어떤 방식으로 추론을 수행하나요?
기본적으로 시스템 1을 통해 확률 분포를 빠르게 도출해요. 만약 최고 옵션의 신뢰도가 임계값(기본값 0.8) 미만일 경우에만 시스템 2가 추론 과정을 거쳐 답변에 반영하는 방식으로 작동합니다.
시각 기반의 다단계 작업에서도 높은 성능을 보이나요?
네, 컴퓨터 사용 테스트에서 60개의 무작위 다단계 작업을 약 85ms/클릭으로 95% 성공했어요. 로봇 팔 제어에서도 시스템 1 기반의 빠르고 정확한 판단 능력을 입증했습니다.
이 모델이 가장 효과적인 작업 유형은 무엇인가요?
적응형 사고 기능은 명시적인 규칙 기반의 논리 퍼즐이나 전술적 추론에 가장 큰 효과를 보여요. 다만, 순수한 지각이나 장기적인 연속 동작에서는 성능 향상에 한계가 있다는 점을 고려해야 해요.