트로피컬 강화학습을 통한 언어 모델의 조합적 추론 개선
Tropical Reinforcement Learning
arXiv기존 강화학습이 성공 확률의 합을 계산하는 방식은 조합적 추론에 한계가 있어, 대신 최댓값을 사용하는 '트로피컬 강화학습'이라는 새로운 대수 구조를 제안했습니다.
이 기술은 언어 모델이 여러 단계를 거쳐 복잡한 문제를 해결하는 조합적 추론 능력을 근본적으로 향상시킬 수 있음을 보여줘요.
- 이 방법은 상태 가치를 가장 가능성 높은 단일 해결책의 로그 확률로 정의하여, 서로 다른 경로에서 나온 최적 접두사와 접미사를 결합하는 진정한 조합 추론을 구현합니다.
- 기존 방식으로는 모델이 어떤 해결책으로 성공했는지 파악하기 어려웠으나, 이 접근법은 언어 모델의 근본적인 조합적 추론 능력을 크게 향상시킬 수 있음을 보여줍니다.
- 제안된 TROPIC 알고리즘은 여러 에이전트 과제에서 성능을 입증했으며, 강화학습의 대수 구조 자체를 변경하는 근본적인 시도라는 점에서 큰 의미가 있습니다.
기존의 은 일반적으로 모든 성공적인 궤적 확률을 합산하여 기대 보상을 최대화하는 방식으로 작동합니다. 그러나 이러한 고전적인 합 공식으로는 모델 정책이 어떤 해결책으로 성공했는지 보고할 수 없으며, 확률의 총합이 1로 제한되어 있어 하나의 솔루션을 강화하면 다른 솔루션에 대한 학습을 방해할 위험이 있습니다. 이는 여러 단계의 추론 과정을 조합해야 하는 조합적 추론(compositional reasoning)에는 적합하지 않은 한계입니다.
이러한 문제를 해결하기 위해 트로피컬 강화학습(Tropical Reinforcement Learning)이 제안되었습니다. 이 방법은 대수 구조를 변경하여, 대체 솔루션들의 확률을 더하는 대신 최댓값을 취하는 방식(tropical semiring)에 기반합니다. 이를 통해 상태의 가치는 가장 가능성 높은 단일 해결책의 로그 확률로 정의되며, 서로 다른 경로에서 나온 최적 접두사와 접미사를 결합할 수 있는 진정한 조합 추론이 가능해집니다.
실제 적용을 위해 TROPIC이라는 학습 알고리즘이 개발되었으며, 이는 검증 가능한 결과를 가진 결정론적 환경에 사용됩니다. 이 알고리즘은 Sokoban, Countdown, FrozenLake, WebShop 등 네 가지 과제를 통해 테스트되었고, 가장 강력한 온-정책 기준 모델보다 최대 16% 포인트까지 성능 향상을 입증했습니다. 이는 강화학습의 대수 구조 자체를 변경하는 것만으로도 언어 모델의 조합적 추론 능력을 크게 개선할 수 있음을 보여줍니다.
용어 풀이
- 강화학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
기존 강화학습은 어떤 점에서 조합적 추론에 한계가 있나요?
기존의 강화학습은 모든 성공적인 궤적 확률을 합산하여 기대 보상을 최대화하는 방식으로 작동해요. 하지만 이 방식으로는 모델 정책이 어떤 해결책으로 성공했는지 보고할 수 없고, 하나의 솔루션을 강화하면 다른 솔루션 학습에 방해를 줄 위험이 있어요.
트로피컬 강화학습은 기존 방식과 어떻게 다른가요?
이 방법은 대수 구조 자체를 변경해서, 대체 솔루션들의 확률을 더하는 대신 최댓값을 취해요. 따라서 상태의 가치는 가장 가능성 높은 단일 해결책의 로그 확률로 정의되어, 서로 다른 경로에서 나온 최적 접두사와 접미사를 결합할 수 있게 돼요.
이 알고리즘은 어떤 과제들을 통해 성능을 입증했나요?
TROPIC이라는 학습 알고리즘이 개발되었고, Sokoban, Countdown, FrozenLake, WebShop 등 네 가지 에이전트 과제를 통해 테스트되었어요. 이 과정에서 가장 강력한 온-정책 기준 모델보다 최대 16% 포인트까지 성능 향상을 입증했어요.