코드로 검증된 월드 모델로 LLM 일반화 성능 높이기
World-Time Compute with Verified Code World Models
arXiv시스템의 역학을 코드로 정의하여 무한하고 정확하게 레이블링된 가상 환경(World Models)을 생성하고, 이를 학습에 활용하는 '월드-타임 컴퓨트' 방식을 제안했습니다.
- 이 방식은 코드로 검증된 환경 덕분에 레이블 오류 누적 문제를 근본적으로 해결하며, 기존 학습 대비 모델의 일반화 성능을 획기적으로 끌어올립니다.
- 데이터 확보가 어려운 복잡한 도메인에서도 LLM의 추론 능력을 향상시킬 수 있는 새로운 학습 패러다임을 제시하여 높은 신뢰도를 보장합니다.
- 현재는 시스템 역학이 코드로 표현 가능한 심볼릭 상태에 국한되며, 과제 간 전이 능력은 약하고 성능 향상은 점진적으로 포화되는 경향을 보입니다.
(LLMs)은 일반적으로 많은 실제 레이블링된 예시가 필요한데, 대부분의 도메인은 이러한 데이터를 확보하기 어렵습니다. 연구진은 이 문제를 해결하기 위해, 특정 도메인의 역학을 코드로 정의할 수 있을 때 이를 활용하는 '월드 모델' 방식을 제안했습니다. 이 방식에서는 하나의 템플릿이 실행 가능하고 검증 가능한 심볼릭 상태 기반의 여러 월드 모델로 확장되며, 각 모델은 정확하게 레이블링된 무한한 궤적을 제공하여 LLM 학습에 사용됩니다.
이렇게 생성된 다수의 가상 세계를 통해 LLM을 하는 '월드-타임 컴퓨트'는 테스트 시간의 계산과 유사한 개념으로, 모델이 한 번도 학습하지 않은 외부 세계(합성된 월드 패밀리)로 일반화 능력을 끌어올립니다. 이 방식은 코드로 검증되었기 때문에 레이블 신뢰도가 높으며, 20단계 롤아웃에서 정확성이 유지되고 10배의 분포 외 추론 문제에 대해 100%의 정답률을 보였습니다. 실제로 0.5B 모델에서는 +29점의 성능 향상이 관찰되었습니다.
실제 인 List Functions를 적용했을 때, 128개의 분리된 세계에서 학습한 어댑터는 외부 세계에서 40%의 성능을 달성하여 레이블이 손상된 대조군(6%) 대비 +34점의 향상을 보였습니다. 다만, 이러한 성능 향상은 몇 단계 추론이나 작고 약한 모델에서 가장 크며, 긴 체인이나 지각 기반 과제에서는 점진적으로 포화되는 경향을 보입니다. 현재 이 방식은 시스템 역학이 코드로 표현 가능한 심볼릭 상태에 국한됩니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.