EnigmaForge: 이야기 속 논리 퍼즐 해결 능력을 테스트하다 — AI 생성 일러스트AI 일러스트
리서치 연구

EnigmaForge: 이야기 속 논리 퍼즐 해결 능력을 테스트하다

EnigmaForge: The Question Is Hidden in the Story

arXiv9월 24일 발표 · 1분 · 심사 전 논문

기존 벤치마크가 질문을 제시하는 것과 달리, EnigmaForge는 오래된 문서 더미와 이야기만 제공하여 그 속에 숨겨진 논리 퍼즐을 풀도록 설계되었습니다.

세 줄 요약arXiv 원문 기반
  1. 25개 최첨단 모델 대상 테스트 결과, 명시적 질문 없이 '직관적 추론 능력'만을 측정했을 때 최대 22배에 달하는 성능 편차가 발견되어 모델 간 격차가 매우 큰 것으로 나타났습니다.
  2. 이는 AI가 단순한 사실 검색을 넘어, 복잡한 이야기 속에서 스스로 논리적 관계를 파악하고 깊이 있게 추론하는 능력이 핵심 역량임을 시사합니다.
  3. 다만, 일부 모델이 퍼즐에 도달하기 전에 자체 콘텐츠 필터에 의해 차단되는 현상이 관찰되어, 순수한 추론 능력 외에 필터링 작동 여부를 측정할 수 있다는 한계도 지적됩니다.

기존 벤치마크가 질문을 제시하는 것과 달리, EnigmaForge는 오래된 문서 더미와 이야기만 제공하여 그 속에 숨겨진 논리 퍼즐을 풀도록 설계되었습니다.

원문arXiv · EnigmaForge: The Question Is Hidden in the Story같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv