AI 에이전트 코딩: 모델 성능과 도구(하네스) 효과 분리 분석 — AI 생성 일러스트AI 일러스트
리서치 연구

AI 에이전트 코딩: 모델 성능과 도구(하네스) 효과 분리 분석

Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite

arXiv9월 14일 발표 · 3분 · 심사 전 논문

에이전트 코딩 시스템에서 모델 자체의 성능과 전용 도구(하네스)가 미치는 영향을 분리 측정하여, 현재 업계의 통념을 검증했습니다.

세 줄 요약arXiv 원문 기반
  1. 종합적으로 볼 때, 특정 모델에 최적화된 조합이 항상 압도적인 우위를 보이지 않으며, 작업 유형별로 장단점이 명확히 나타났습니다.
  2. 따라서 개발자는 단순히 벤더가 제공하는 기본 조합을 신뢰하기보다, 실제 수행할 작업의 종류와 비용 효율성을 종합적으로 검토해야 합니다.
  3. 연구 결과에 따르면, 중립적인 하네스를 사용할 경우 전용으로 최적화된 시스템 대비 해결 작업당 비용이 더 높게 발생하는 경향도 확인되었습니다.

코딩 시스템은 언어 모델을 하네스(도구, , 제어 흐름 등)와 결합하여 채팅 모델을 자율적인 소프트웨어 엔지니어로 만듭니다. 본 연구는 특정 벤더가 제공하는 기본 조합이 항상 최적의 성능을 보인다는 통념에 의문을 제기하며, 이를 검증하기 위해 독점적이고 오염 통제가 된 256개의 리포지토리 및 컨테스트 과제 세트를 사용했습니다. 이 실험에서는 동일 모델 쌍(예: claude-opus-4-8)을 사용하여 전용 하네스와 일반적인 하네스를 비교하는 대조군 분석을 수행했습니다.

전반적인 성능 측면에서, 테스트된 어떤 조합도 평균적으로 압도적인 우위를 보이지 않았습니다. Opus 4.8의 경우 -1.25 pp의 평균 차이를 기록했으며, GPT-5.5는 +1.25 pp를 기록했습니다. 다만, Opus의 평균값은 상반된 영역을 결합한 결과로, 리포지토리 과제에서는 전용 하네스가 9.0 pp 뒤처졌으나 컨테스트 과제에서는 23.7 pp 앞서는 등 작업 유형에 따라 명확한 차이가 관찰되었습니다.

효율성 측면에서도 분석이 이루어졌습니다. 사용량 기반 추정치에 따르면, 중립적인 하네스를 사용할 경우 Opus 4.8 모델에서 해결된 과제당 비용은 1.3배에서 1.6배가 발생했으며, GPT-5.5에서는 1.2배의 비용 증가가 관찰되었습니다. 이 결과는 개발자가 단순히 기본 조합을 신뢰하기보다 작업 유형과 비용 효율성을 종합적으로 고려해야 함을 시사합니다.

용어 풀이

에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
프롬프트
AI에게 주는 지시나 질문 글.
원문arXiv · Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv