결과 기반 보정(OBC-Prune)을 통한 대규모 추론 모델 가지치기 연구
OBC-Prune: Outcome-Based Calibration for Large Reasoning Model Pruning
arXiv대규모 추론 모델(LRM)의 높은 연산 비용을 줄이기 위해 가지치기(Pruning)가 필수적이지만, 기존 방식은 정답/오답 여부를 구분하지 못해 성능 저하 문제가 있었습니다.
- 연구진이 제안한 OBC-Prune은 오답과 정답 시퀀스 쌍을 구성하고 '개입 분석'을 통해 각 추론 단계의 인과적 중요도를 측정하는 것이 핵심입니다.
- 단순히 활성화 값을 보존하는 것을 넘어, 추론 과정에서 결정적으로 중요한 '인과적 회로(Causal Circuit)' 자체를 보호하여 모델의 근본적인 능력을 향상시킵니다.
- 기존 가지치기 알고리즘을 수정할 필요 없이 인과 중요도를 가중치로 적용하며, 다양한 크기의 모델 및 벤치마크에서 성능 개선이 입증되었습니다.
대규모 (LRM)은 답변 전에 긴 사고 과정( traces)을 생성하여 상당한 추론 오버헤드를 발생시킵니다. 이러한 비용 절감을 위해 가지치기(Pruning)가 활용되지만, 기존 방식들은 의 중요도를 추정하는 데 사용되는 보정 데이터의 종류에 따라 효과가 달라집니다. 특히 이전 연구들은 모든 추론 을 균일하게 취급하여, 성공적인 추론에 기여한 부분과 그렇지 않은 부분을 구분하지 못했습니다.
이러한 한계를 극복하기 위해 OBC-Prune(Outcome-Based Calibration for Large Reasoning Model Pruning)이 제안되었습니다. OBC는 모델이 일관성 없이 답변하는 문제들로부터 정답 및 오답 시퀀스 쌍을 구성합니다. 이후 개입 기반 분석(intervention-based analysis)을 통해 각 추론 문장이 가지는 인과적 중요도를 측정하며, 이 점수를 토큰별 로 변환하여 기존의 원샷 가지치기 방법(SparseGPT, Wanda, ALPS 등)에 적용할 수 있습니다.
이러한 접근 방식은 단순히 관찰된 활성화 값을 보존하는 것을 넘어, 추론 과정에서 결정적으로 중요한 '인과적 회로' 자체를 보호합니다. DeepSeek-R1-Distill-Qwen 1.5B, 7B, 그리고 14B 모델을 대상으로 40% 및 50% 희소성(sparsity)으로 실험한 결과, OBC-Prune은 MATH500, LiveCodeBench, AIME 2025 등 다양한 에서 대부분의 모델 크기와 희소성 수준에 걸쳐 기존 최신 보정 기준선보다 일관된 성능 향상을 보여주었습니다.
용어 풀이
- 추론 모델
- 답하기 전에 단계별로 생각하는 과정을 거치도록 만든 모델.
- chain-of-thought
- 답에 이르는 생각 과정을 단계별로 적게 해서 정확도를 높이는 방법.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.