모델 뉴스

AI models flub these intelligence tests. Can you fare any better?

MTMIT Technology Review AI8월 26일 발표 · 1분

AI 모델들이 퍼즐과 게임 같은 지적 테스트에서 여전히 취약점을 드러내고 있다.

세 줄 요약MIT Technology Review AI 원문 기반
  1. 콜롬비아 대학 연구팀은 2024년 말 최고 모델이 NYT Connections 퍼즐의 18%만 풀었으나, 2025년 초에는 거의 완벽하게 해결했다.
  2. LLM은 시각적 입력 분석 능력을 가졌음에도 불구하고, 공간 추론이나 3차원 객체 조작 같은 영역에서는 여전히 인간보다 떨어진다.
  3. 모델은 학습 과정에서 본 퍼즐과 유사한 문제에 직면하면 미묘한 차이를 간과하고 암기된 답변을 내놓는 오류를 범할 수 있다.

AI 모델들이 퍼즐과 게임 같은 지적 테스트에서 여전히 취약점을 드러내고 있다.

원문MIT Technology Review AI · AI models flub these intelligence tests. Can you fare any better?
원문 보기MIT Technology Review AI