모델 뉴스
AI models flub these intelligence tests. Can you fare any better?
MTMIT Technology Review AI
AI 모델들이 퍼즐과 게임 같은 지적 테스트에서 여전히 취약점을 드러내고 있다.
세 줄 요약
- 콜롬비아 대학 연구팀은 2024년 말 최고 모델이 NYT Connections 퍼즐의 18%만 풀었으나, 2025년 초에는 거의 완벽하게 해결했다.
- LLM은 시각적 입력 분석 능력을 가졌음에도 불구하고, 공간 추론이나 3차원 객체 조작 같은 영역에서는 여전히 인간보다 떨어진다.
- 모델은 학습 과정에서 본 퍼즐과 유사한 문제에 직면하면 미묘한 차이를 간과하고 암기된 답변을 내놓는 오류를 범할 수 있다.
AI 모델들이 퍼즐과 게임 같은 지적 테스트에서 여전히 취약점을 드러내고 있다.