AI 에이전트 코딩: 모델 성능과 도구(하네스) 효과 분리 분석
Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite
arXiv에이전트 코딩 시스템에서 모델 자체의 성능과 전용 도구(하네스)가 미치는 영향을 분리 측정하여, 현재 업계의 통념을 검증했습니다.
- 종합적으로 볼 때, 특정 모델에 최적화된 조합이 항상 압도적인 우위를 보이지 않으며, 작업 유형별로 장단점이 명확히 나타났습니다.
- 따라서 개발자는 단순히 벤더가 제공하는 기본 조합을 신뢰하기보다, 실제 수행할 작업의 종류와 비용 효율성을 종합적으로 검토해야 합니다.
- 연구 결과에 따르면, 중립적인 하네스를 사용할 경우 전용으로 최적화된 시스템 대비 해결 작업당 비용이 더 높게 발생하는 경향도 확인되었습니다.
코딩 시스템은 언어 모델을 하네스(도구, , 제어 흐름 등)와 결합하여 채팅 모델을 자율적인 소프트웨어 엔지니어로 만듭니다. 본 연구는 특정 벤더가 제공하는 기본 조합이 항상 최적의 성능을 보인다는 통념에 의문을 제기하며, 이를 검증하기 위해 독점적이고 오염 통제가 된 256개의 리포지토리 및 컨테스트 과제 세트를 사용했습니다. 이 실험에서는 동일 모델 쌍(예: claude-opus-4-8)을 사용하여 전용 하네스와 일반적인 하네스를 비교하는 대조군 분석을 수행했습니다.
전반적인 성능 측면에서, 테스트된 어떤 조합도 평균적으로 압도적인 우위를 보이지 않았습니다. Opus 4.8의 경우 -1.25 pp의 평균 차이를 기록했으며, GPT-5.5는 +1.25 pp를 기록했습니다. 다만, Opus의 평균값은 상반된 영역을 결합한 결과로, 리포지토리 과제에서는 전용 하네스가 9.0 pp 뒤처졌으나 컨테스트 과제에서는 23.7 pp 앞서는 등 작업 유형에 따라 명확한 차이가 관찰되었습니다.
효율성 측면에서도 분석이 이루어졌습니다. 사용량 기반 추정치에 따르면, 중립적인 하네스를 사용할 경우 Opus 4.8 모델에서 해결된 과제당 비용은 1.3배에서 1.6배가 발생했으며, GPT-5.5에서는 1.2배의 비용 증가가 관찰되었습니다. 이 결과는 개발자가 단순히 기본 조합을 신뢰하기보다 작업 유형과 비용 효율성을 종합적으로 고려해야 함을 시사합니다.
용어 풀이
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
- 프롬프트
- AI에게 주는 지시나 질문 글.