개발도구 연구
AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking
ARarXiv
AdaThinking-E는 토큰 단위 엔트로피 조절을 이용해 적응적 사고를 학습하는 새로운 강화학습 프레임워크이다.
세 줄 요약
- 이 방법은 모델의 결정 토큰 확률 분포 엔트로피 분석으로 사고 여부를 판단하며, 고엔트로피 탐색에서 저엔트로피 수렴으로 전환한다.
- 복잡한 문제에서는 정확도를 유지하고 단순한 문제에서는 효율성을 확보하여 사용자 경험을 개선했다.
- 이 접근법은 수동 개입이나 외부 난이도 레이블 없이 모델이 스스로 언제 사고할지 발견하게 한다.
AdaThinking-E는 토큰 단위 엔트로피 조절을 이용해 적응적 사고를 학습하는 새로운 강화학습 프레임워크이다.