리서치 연구
EnigmaForge: 이야기 속 논리 퍼즐 해결 능력을 테스트하다
EnigmaForge: The Question Is Hidden in the Story
arXiv기존 벤치마크가 질문을 제시하는 것과 달리, EnigmaForge는 오래된 문서 더미와 이야기만 제공하여 그 속에 숨겨진 논리 퍼즐을 풀도록 설계되었습니다.
세 줄 요약
- 25개 최첨단 모델 대상 테스트 결과, 명시적 질문 없이 '직관적 추론 능력'만을 측정했을 때 최대 22배에 달하는 성능 편차가 발견되어 모델 간 격차가 매우 큰 것으로 나타났습니다.
- 이는 AI가 단순한 사실 검색을 넘어, 복잡한 이야기 속에서 스스로 논리적 관계를 파악하고 깊이 있게 추론하는 능력이 핵심 역량임을 시사합니다.
- 다만, 일부 모델이 퍼즐에 도달하기 전에 자체 콘텐츠 필터에 의해 차단되는 현상이 관찰되어, 순수한 추론 능력 외에 필터링 작동 여부를 측정할 수 있다는 한계도 지적됩니다.
기존 벤치마크가 질문을 제시하는 것과 달리, EnigmaForge는 오래된 문서 더미와 이야기만 제공하여 그 속에 숨겨진 논리 퍼즐을 풀도록 설계되었습니다.