코그니션의 신규 코딩 에이전트 SWE-2 공개 및 성능 분석
Cognition launches new SWE-2 model, Rivaling Fable 5.1 and GPT-Astra
Hacker News코그니션이 최신 코딩 에이전트 모델 SWE-2를 공개하며, 기존 최고 수준의 AI 모델들과 경쟁할 수 있는 높은 성능과 효율성을 동시에 갖춘 기술력을 선보였습니다.
- SWE-2는 FrontierCode 1.1 Main에서 50.0%의 고성능을 기록했으며, 이는 동급 모델 대비 최대 64% 저렴한 비용 효율성을 입증하며 시장 경쟁력을 높였습니다.
- 단순히 코드를 생성하는 것을 넘어, 문제 핵심에 집중하는 '집중적 탐색'과 철저한 검증 과정을 거쳐 신뢰도 높고 완성도 높은 결과물을 제공합니다.
- 트릴리언급 매개변수 기반의 강화학습(RL)을 통해 개발되었으며, 현재 Devin Desktop 및 CLI 환경에서 순차적으로 사용자에게 배포되고 있습니다.
SWE-2는 코딩 모델로서 높은 성능과 비용 효율성을 동시에 갖춘 것이 특징이다. FrontierCode 1.1 Main에서 50.0%를 달성했으며, 이는 Fable 5.1과 근접한 수치임에도 불구하고 기존 대비 64% 더 저렴하다. 또한 SWE-2는 DeepSWE 1.1 및 FrontierCode 1.1 Main 모두에서 이전 모델인 SWE-1.7과 Grok 4.6보다 높은 점수와 낮은 비용을 기록했다. 특히 GPT-5.6 Sol 및 Fable 5/5.1에 근접한 성능을 훨씬 저렴한 가격으로 제공하며, GPT-6 Astra의 약 4분의 1 비용 수준에서 비슷한 성능을 보여준다.
SWE-2는 RL()을 최초로 수조 개 규모까지 확장하는 방식으로 개발되었다. 이 과정은 기존 SWE-1.7의 훈련 인프라와 레시피를 기반으로 하며, 모든 추론 노력을 단일 실행에서 훈련할 수 있는 RL 알고리즘이 핵심적으로 추가되어 비용 대비 성능 전반을 향상시켰다. 모델 자체는 이미 코딩에 대한 광범위한 RL을 거친 2.8T 매개변수 모델인 Kimi K3를 기반으로 후속 훈련되었다.
SWE-2는 지능 및 효율성 측면에서 개선된 행동 패턴을 보인다. 엔지니어링 판단력이 향상되어 더 완전한 솔루션을 적은 우회 경로와 중복 읽기로 작성할 수 있다. 실제로 FrontierCode 1.1 Main 테스트에서는 SWE-2 medium이 SWE-1.7보다 높은 점수를 기록했으며, 평균적으로 58% 적은 턴과 81% 낮은 비용으로 작업을 완료했다. 또한, 모델의 지능 덕분에 '집중적 탐색'이 가능해져 작업에 실제로 중요한 코드베이스 부분을 판단하고 구현 시작 시점을 앞당기는 등 효율성이 높아졌다.
용어 풀이
- 강화학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 매개변수
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.