추론 과정의 중복성을 인식하여 효율성을 높이는 학습 방법 — AI 생성 일러스트AI 일러스트
리서치 연구

추론 과정의 중복성을 인식하여 효율성을 높이는 학습 방법

Giving Credit Where It's Due: Redundancy-Aware Learning for Efficient Reasoning

arXiv9월 24일 발표 · 3분 · 심사 전 논문

대규모 추론 모델이 생성하는 불필요하게 긴 과정을 줄이기 위해, 단계 간의 의미적 의존성을 분석하는 'RECAP' 방법을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. RECAP은 단순히 후속 역할만 보는 것이 아니라, 정답 도출 과정에서의 실제 진전 정도(단계 효능)까지 측정하여 신뢰도를 높였습니다.
  2. 이 방법은 정확도는 유지하면서 추론 토큰을 최대 31%까지 줄였으며, 이는 불필요한 연산 과정을 제거했기 때문입니다.
  3. 별도의 보상 모델이나 간결한 추론 과정이 필요 없어 적용성이 높으며, 복잡한 논리 추론의 효율성을 극대화하는 기준을 제시합니다.

대규모 은 정확하지만 불필요하게 긴 추론 과정을 생성하는 경향이 있습니다. 기존 연구들은 궤적 수준 또는 로컬 /단계 수준 신호로 추론 효율성을 개선했지만, 단계 간의 의미적 의존성(inter-step semantic dependencies)을 모델링하는 데는 한계가 있었습니다. 이 때문에 불필요한 단계를 정확도 저하 없이 줄이는 것이 어려웠습니다. 이에 연구진은 RECAP(REdundancy-aware Credit Assignment via Propagation)이라는 방법을 제안했습니다. 이는 단계의 다운스트림 역할과 문제 해결에 대한 기여도를 모두 기반으로 적절하게 크레딧을 할당합니다.

RECAP은 두 가지 핵심 신호를 정의하여 추론 과정을 개선합니다. 첫째, 구조적 책임(structural responsibility)은 최종 답변 노드에서 역전파되는 크레딧을 사용하여 나중에 해당 단계가 얼마나 강하게 의존하는지 측정함으로써 단계의 다운스트림 역할을 포착합니다. 둘째, 단순히 역할만 보는 것이 아니라 '단계 효능(step efficacy)'을 도입하여 변화를 통한 정답 지향적 진전 정도를 측정하며, 이는 gold-answer log-likelihood에 반영됩니다.

이 방법은 별도의 프로세스 보상 모델이나 미리 구성된 간결한 궤적이 필요하지 않아 적용성이 높습니다. 두 개의 7B 모델과 네 가지 수학 추론 에서 테스트 결과, RECAP은 정확도와 효율성 트레이드오프를 개선했습니다. 특히 Qwen2.5-Math-7B 모델에서는 pass@1 점수를 2.0~3.7 퍼센트포인트 향상시키면서, 네 가지 벤치마크 모두에서 GRPO 대비 추론 토큰을 8%~31%까지 줄이는 성과를 보였습니다.

용어 풀이

추론 모델
답하기 전에 단계별로 생각하는 과정을 거치도록 만든 모델.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Giving Credit Where It's Due: Redundancy-Aware Learning for Efficient Reasoning같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv