추론 모델의 효율적 사고 보상이 답변 포기 능력 향상에 기여 — AI 생성 일러스트
리서치 연구

추론 모델의 효율적 사고 보상이 답변 포기 능력 향상에 기여

Rewarding Efficient Reasoning Improves Abstention on Underspecified Tasks in Reasoning Models

arXiv9월 21일 발표 · 2분 · 프리프린트

대규모 추론 모델(LRM)은 정답을 찾는 능력은 뛰어나지만, 풀 수 없는 문제에 대해 언제 답변을 포기해야 하는지 판단하는 능력이 부족하다는 문제가 발견되었습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 인간의 자원 효율적 인지 과정에서 영감을 얻어 새로운 보상 시스템을 도입했고, 모델이 답변 포기 능력을 향상시키고 추론 과정을 크게 단축했습니다.
  2. AI가 스스로 한계를 인식하고 불필요한 계산을 줄이는 능력은, 모델의 신뢰성을 높이고 실제 산업 환경에서 자원 효율적인 활용을 가능하게 하는 핵심 요소입니다.
  3. 본 연구는 인간 인지 과정의 '자원 효율성' 관점을 적용했으며, 현재 4B 규모의 LRM에 성공적으로 구현하여 성능 향상을 입증한 사례라는 점이 중요합니다.

최신 대규모 (LRM)은 많은 작업에서 정확한 답변을 제공하는 데 탁월하지만, 언제 답변 생성을 멈춰야 하는지 판단하는 중요한 능력이 부족하다는 문제가 발견되었습니다. 연구진은 인간의 추론 노력을 분석하여, 풀 수 없는 작업에 대한 노력 수준이 답할 수 있는 작업을 초과하지 않는다는 점을 확인했습니다.

모델들이 풀 수 없는 에 대해 답변할 때보다 더 긴 사고 과정(CoT)을 생성하며 계산 자원을 낭비하는 경향이 있습니다. 이를 개선하기 위해 연구진은 인간 인지 과정의 '자원 효율성' 관점에서 영감을 얻어 새로운 GRPO 보상을 도입했습니다. 이 보상은 작업에 필요한 모든 정보가 포함되어 있는지 여부를 효율적으로 추론하도록 모델을 장려합니다.

실제로 여러 4B LRM을 이 보상으로 (Fine-tuning)한 결과, 모델은 인간과 유사한 수준의 답변 포기 성능 향상을 평균 +12.8% 달성했습니다. 동시에 기존의 답변 능력을 유지하면서도 모델 효율성을 높여, 평균 CoT 길이를 44% 단축하는 성과를 보였습니다.

용어 풀이

추론 모델
답하기 전에 단계별로 생각하는 과정을 거치도록 만든 모델.
프롬프트
AI에게 주는 지시나 질문 글.
미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
원문arXiv · Rewarding Efficient Reasoning Improves Abstention on Underspecified Tasks in Reasoning Models
원문 보기arXiv