모델 연구

Function-Level Execution Feedback for Code Preference Optimization

ARarXiv8월 26일 발표 · 1분 · 심사 전 논문

코드 생성 과정의 단계별 피드백을 활용하여 코드 선호도 최적화(KTO)를 위한 STEP-KTODER 프레임워크를 제시했다.

세 줄 요약arXiv 원문 기반
  1. STEP-KTODER는 분해된 다중 함수 프로그램에서 모듈 수준의 함수를 단계로 정의하고, 자동 생성 유닛 테스트로 이진 정확도 라벨을 부여한다.
  2. 함수 수준의 프로세스 감독과 전체 프로그램에 대한 결과 수준 피드백을 결합하여 코드별 KTO를 구현하며, HumanEval(+), MBPP(+), BigCodeBench 등에서 성능 향상을 입증했다.
  3. 실행 기반 라벨이 필수적이며, LLM-as-a-judge 방식의 주석은 함수 실패를 과도하게 예측해 긍정적인 단계 라벨을 오염시키고 최적화 성능을 저하시킨다.

코드 생성 과정의 단계별 피드백을 활용하여 코드 선호도 최적화(KTO)를 위한 STEP-KTODER 프레임워크를 제시했다.

원문arXiv · Function-Level Execution Feedback for Code Preference Optimization같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기