리서치 연구
분자 특성 예측 모델에서 값 암기 및 검색 경향 분석
Molecular Déjà Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
arXiv대규모 언어 모델(LLM)이 분자 특성을 평가할 때, 새로운 추론보다는 이미 학습된 값을 그대로 검색하여 사용하는 경향이 광범위하게 나타났습니다.
세 줄 요약
- 특히 높은 추론 수준에서는 이러한 암기 기반 검색 현상이 두드러지게 나타나며, 이는 모델 간의 예측 능력 차이를 벌리는 주요 원인으로 작용합니다.
- 이는 LLM의 전반적인 예측 역량이 단순히 얼마나 많은 데이터를 외우고 있는지만으로는 판단할 수 없다는 중요한 시사점을 제공합니다.
- 따라서 AI 모델의 진정한 예측 능력을 평가하기 위해서는 단순한 정확도 측정 이상의 새로운 기준과 방법론이 필요합니다.
(LLM)이 분자 특성을 평가할 때, 단순히 값을 예측하는지 아니면 이미 출판된 값을 그대로 검색(retrieval)하여 사용하는지를 구분하기 어렵다는 점을 지적했습니다. 연구진은 22개의 최신 LLM을 대상으로 12가지 회귀 에서 문구 단위의 검색 현상을 감사했으며, 그 결과 이는 광범위하게 나타나지만 데이터셋별로 특성이 다름을 발견했습니다.
특히 추론 수준이 이러한 검색 현상에 큰 영향을 미치는 것으로 확인되었습니다. 동일한 분자와 를 사용한 실험을 낮은 추론 수준과 높은 추론 수준에서 비교했을 때, 높은 추론 수준에서 해당 사례가 89% 더 자주 플래그 지정되는 것을 발견했습니다.
이러한 결과는 LLM의 전반적인 예측 능력이 단순히 얼마나 많은 값을 암기하고 있는지만으로는 결정되지 않음을 시사합니다. 본 연구는 분자 회귀 벤치마크에서 나타나는 문구 단위 검색의 정도와 깊이에 대한 개요를 제공하며, AI 모델의 진정한 예측 역량을 평가하기 위한 새로운 기준과 방법론이 필요함을 강조했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 프롬프트
- AI에게 주는 지시나 질문 글.