컨텍스트 추론 학습으로 모델 성능 확장하는 방법 제시
Hermes: Learning Contextual Reasoning Unlocks Test-Time Scaling
모델이 추론 과정에서 추가 컴퓨팅 자원을 활용하는 '테스트 시간 스케일링'을 위해, 컨텍스트 할당 및 재사용 능력을 학습시키는 새로운 프레임워크가 제시되었습니다.
모델이 필요한 정보를 능동적으로 판단하고 활용하는 '맥락적 추론' 능력을 갖게 되어, 자원 제약 환경에서도 높은 성능을 내는 범용 AI 시스템 구축에 도움이 돼요.
- 기존 방식과 달리 모델 스스로 컨텍스트 관리 결정을 내리도록 유도하여, 소형 오픈소스 모델의 성능 격차를 해소하고 전반적인 성능 향상을 이끌었습니다.
- 모델이 필요한 정보를 능동적으로 판단하고 활용하는 '맥락적 추론' 능력을 갖게 되어, 자원 제약 환경에서도 높은 성능을 내는 범용 AI 시스템 구축에 기여할 전망입니다.
- 학습된 컨텍스트 추론 전략은 다양한 벤치마크와 모델 전반에 걸쳐 일반화되며, 다른 테스트 시간 스케일링 방법에도 적용 가능하다는 장점이 있습니다.
테스트 시간 스케일링은 추론 과정에서 추가 컴퓨팅 자원을 할당하여 모델의 성능을 향상시키는 기법입니다. 이 과정에서 여러 에 걸쳐 신선한 컨텍스트를 효과적으로 분배하고, 각 단계 간에 어떤 정보를 유지할지 결정하는 것이 중요하며, 이를 '맥락적 추론(contextual reasoning)' 능력이라고 정의했습니다.
연구진은 기존 방식이 이러한 결정을 외부 장치(harness)가 미리 규정하던 것과 달리, 모델 스스로 판단하도록 유도하는 새로운 프레임워크를 제시했습니다. 이 중 하나인 Hermes는 컨텍스트 할당 및 재사용에 대한 모델의 제어권을 점진적으로 변화시키는 구성 가능한 하네스를 제공하며, Hermes-Learn은 이러한 능력을 학습시키기 위한 2단계 프레임워크입니다.
연구 결과, 성능이 우수한 모델들은 이 유연성을 활용하여 추가적인 추론 시간 컴퓨팅 자원과 함께 확장할 수 있었습니다. 특히 소형 모델들이 초기에는 어려움을 겪었으나, Hermes-Learn을 통해 학습시키자 문제와 추론 진행 단계에 따라 변화하는 적응적 맥락 추론 전략이 유도되어 성능 격차를 해소했습니다. 이러한 개선점은 다양한 와 모델 전반에 걸쳐 일반화되며 다른 테스트 시간 스케일링 방법에도 적용 가능합니다.
용어 풀이
- 컨텍스트 창
- 모델이 한 번에 읽고 참고할 수 있는 입력의 최대 길이. 보통 토큰 수로 나타내요.
- 오픈소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
소형 오픈소스 모델의 성능 격차는 어떻게 해소되었나요?
Hermes-Learn을 통해 학습시키자, 문제와 추론 진행 단계에 따라 변화하는 적응적 맥락 추론 전략이 유도되면서 성능 격차가 해소되었어요.
기존 방식과 달라진 점은 무엇인가요?
이전에는 외부 장치가 컨텍스트 할당 및 재사용 결정을 미리 규정했지만, 새로운 프레임워크는 모델 스스로 판단하도록 유도한다는 점에서 차이가 있어요.
이 학습된 전략은 어디에 적용할 수 있나요?
다양한 벤치마크와 모델 전반에 걸쳐 일반화되며, 다른 테스트 시간 스케일링 방법에도 적용 가능하다는 장점이 있어요.