LLM만으로는 부족한 정량적 의사결정 능력과 새로운 모델 기준 제시
Language Is an Insufficient Substrate for Quantitative Reasoning, and Consequential Domains Need Large Quantitative Models
arXiv대규모 언어 모델(LLM)이 금융 리스크 평가나 자본 배분 같은 복잡한 정량적 의사결정까지 해결할 수 있다는 기존의 통념에 근본적인 한계를 제기합니다.
- LLM은 인간의 설명(description)을 학습하기 때문에, 원본 데이터가 가진 정량적 정보 손실(lossy encoding)을 되돌릴 수 없어 정확한 재구성이 불가능하다고 지적합니다.
- 따라서 단순 성능 향상보다 결과의 '재현성'과 모든 출력값을 원본 기록까지 추적하는 '출처 이력(lineage)' 확보가 필수적인 새로운 모델 기준을 제시합니다.
- 결론적으로, 정량적 의사결정 시스템은 단순히 크기만 키우는 것이 아니라, 재현 가능성, 출처 연결성, 그리고 보정된 불확실성을 갖춰야 합니다.
기존에는 (LLMs)의 발전이 금융 리스크 평가, 자본 배분, 환자 분류 등 중요한 정량적 의사결정 영역까지 해결할 수 있을 것이라는 통념이 지배적이었습니다. 그러나 연구진은 LLM이 학습하는 기반 자체가 인간의 설명(description)을 통해 이루어지기 때문에 근본적인 한계를 가진다고 지적합니다.
LLM은 본질적으로 정량적 기록을 인간의 언어로 '설명'한 형태를 학습하며, 이 과정에서 원본 데이터가 가지고 있던 정량적 정보는 손실성 인코딩(lossy encoding) 과정을 거치게 됩니다. 연구진은 이러한 정보 손실이 되돌릴 수 없는 비가역적인 특성을 가지므로, 어떤 규모의 다운스트림 모델도 설명 단계에서 사라진 정보를 복구할 수 없다고 주장합니다.
따라서 중요한 정량적 영역에 필요한 모델은 단순히 성능을 높이는 것을 넘어, 세 가지 필수 속성을 갖춰야 합니다. 이 속성들은 재현 가능성(reproducibility), 모든 출력값을 원본 기록까지 추적하는 출처 이력(lineage from every output back to the source records), 그리고 보정된 불확실성(calibrated uncertainty)입니다. 연구진은 이러한 요구사항을 충족하는 새로운 모델 클래스를 '대규모 정량 모델(Large Quantitative Model, LQM)'로 정의합니다.
이러한 분석에 따르면, 복잡하고 중요한 의사결정을 내리는 시스템은 언어 기반의 표현만으로는 충분하지 않으며, 위에 제시된 세 가지 속성을 갖춘 전용 모델 구조가 필요하다는 결론을 도출했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.