결과 기반 보정(OBC-Prune)을 통한 대규모 추론 모델 가지치기 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

결과 기반 보정(OBC-Prune)을 통한 대규모 추론 모델 가지치기 연구

OBC-Prune: Outcome-Based Calibration for Large Reasoning Model Pruning

arXiv9월 17일 발표 · 3분 · 심사 전 논문

대규모 추론 모델(LRM)의 높은 연산 비용을 줄이기 위해 가지치기(Pruning)가 필수적이지만, 기존 방식은 정답/오답 여부를 구분하지 못해 성능 저하 문제가 있었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진이 제안한 OBC-Prune은 오답과 정답 시퀀스 쌍을 구성하고 '개입 분석'을 통해 각 추론 단계의 인과적 중요도를 측정하는 것이 핵심입니다.
  2. 단순히 활성화 값을 보존하는 것을 넘어, 추론 과정에서 결정적으로 중요한 '인과적 회로(Causal Circuit)' 자체를 보호하여 모델의 근본적인 능력을 향상시킵니다.
  3. 기존 가지치기 알고리즘을 수정할 필요 없이 인과 중요도를 가중치로 적용하며, 다양한 크기의 모델 및 벤치마크에서 성능 개선이 입증되었습니다.

대규모 (LRM)은 답변 전에 긴 사고 과정( traces)을 생성하여 상당한 추론 오버헤드를 발생시킵니다. 이러한 비용 절감을 위해 가지치기(Pruning)가 활용되지만, 기존 방식들은 의 중요도를 추정하는 데 사용되는 보정 데이터의 종류에 따라 효과가 달라집니다. 특히 이전 연구들은 모든 추론 을 균일하게 취급하여, 성공적인 추론에 기여한 부분과 그렇지 않은 부분을 구분하지 못했습니다.

이러한 한계를 극복하기 위해 OBC-Prune(Outcome-Based Calibration for Large Reasoning Model Pruning)이 제안되었습니다. OBC는 모델이 일관성 없이 답변하는 문제들로부터 정답 및 오답 시퀀스 쌍을 구성합니다. 이후 개입 기반 분석(intervention-based analysis)을 통해 각 추론 문장이 가지는 인과적 중요도를 측정하며, 이 점수를 토큰별 로 변환하여 기존의 원샷 가지치기 방법(SparseGPT, Wanda, ALPS 등)에 적용할 수 있습니다.

이러한 접근 방식은 단순히 관찰된 활성화 값을 보존하는 것을 넘어, 추론 과정에서 결정적으로 중요한 '인과적 회로' 자체를 보호합니다. DeepSeek-R1-Distill-Qwen 1.5B, 7B, 그리고 14B 모델을 대상으로 40% 및 50% 희소성(sparsity)으로 실험한 결과, OBC-Prune은 MATH500, LiveCodeBench, AIME 2025 등 다양한 에서 대부분의 모델 크기와 희소성 수준에 걸쳐 기존 최신 보정 기준선보다 일관된 성능 향상을 보여주었습니다.

용어 풀이

추론 모델
답하기 전에 단계별로 생각하는 과정을 거치도록 만든 모델.
chain-of-thought
답에 이르는 생각 과정을 단계별로 적게 해서 정확도를 높이는 방법.
매개변수
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · OBC-Prune: Outcome-Based Calibration for Large Reasoning Model Pruning같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv