서바이버 승자 예측 머신러닝 모델 분석
A Model for Winning Survivor
Hacker News생존 게임 '서바이버'의 승자를 예측하기 위해 투표 기록, 우위 점수, 참가자 인구통계 등 다양한 데이터를 활용한 머신러닝 모델이 개발되었습니다.
- 모델은 무작위 추측 대비 약 2배 높은 정확도를 보였으며, 단순히 탈락을 피하는 것(생존)과 최종 승리에는 영향을 미치는 핵심 요소가 다름을 분석했습니다.
- 승패에 있어 편집 과정에서 드러나는 '스토리텔링'이나 참가자의 연령대 등 정량화된 요소들이 통계적으로 중요한 역할을 할 수 있음을 보여줍니다.
- 다만, 이 모델은 데이터 기반의 예측일 뿐이며, 현장의 변수나 운, 복잡한 인간 심리 등 정량화할 수 없는 전략적 요소는 반영하지 못한다는 한계를 가집니다.
본 글은 리얼리티 생존 게임인 '서바이버'의 승자를 예측하기 위해 개발된 머신러닝 모델에 대한 내용을 다룹니다. 이 모델은 참가자들이 캠프 생활, 도전 경쟁, 투표 등을 거치는 과정을 분석하며, 궁극적으로 누가 최종 우승자가 될지 예측하는 것을 목표로 합니다. 필자는 이러한 사회적 전략 게임을 수학적 모델링의 관점에서 체계화하고 검증할 수 있다고 설명합니다.
모델은 'survivor' 깃허브 저장소에서 얻은 투표 기록, 도전 결과, 인구통계학적 정보 등 구조화된 데이터를 활용하여 구축되었습니다. 승리 예측 모델과 다음 에피소드 탈락 예측 모델 두 가지가 별도로 훈련되었으며, 각 모델은 참가자의 연령대(Age), 위험에 처한 횟수(Times in danger), 우위 점유 여부(Has advantage) 등 다양한 후보 변수를 사용합니다. 특히 승리 모델과 탈락 모델이 서로 다른 특징을 유지하는 것이 흥미로운 결과로 제시되었습니다.
모델의 성능은 무작위 추측 대비 평균적으로 약 2배 높은 정확도를 보였습니다. 즉, 임의로 한 플레이어를 선택했을 때 우승자를 맞힐 확률(10%)보다 높게 예측한다는 의미입니다. 다만, 필자는 이 모델이 모든 것을 알려줄 수는 없으며, 시즌 중 발생하는 수많은 정량화할 수 없는 전략적 요소와 운을 포착하지 못하는 한계가 있음을 강조합니다.
실제 사례로 50시즌(S50) 분석 결과를 공유하며 모델의 활용 가능성을 보여줍니다. 이 과정에서 모델은 최종 우승자였던 '오브리'를 시즌 내내 주요 경쟁자로 꾸준히 지목했으며, 플레이어별 승리 확률 변화 추이를 시각적으로 확인할 수 있었습니다. 이는 단순히 생존하는 것과 최종 승리하는 것이 다른 요소에 의해 결정됨을 보여주는 예시입니다.