2.8조 매개변수 Kimi K3를 후속 학습한 SWE-2는 FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1과 0.9%p 차이를 보이면서도 비용은 64% 낮음 추론 노력 수준별로 기반 모델의 비용·성능 곡선 기울기에 맞춘 선형 비용 페널티를 적용해, 한 번의 강화학습 실행으로 모든 추론 노력 수준을 함께 학습함 SWE-2 medium은 FrontierCode에서 SWE-1.7보다 높은 점수를 얻으면서 평균 작업 단계는 58%, 비용은 81% 줄임. 다만 Terminal-Bench 4 점수는 27.3%로 Fable 5.1의 55.8%, GPT-6 Astra의 57.9%에 크게 못 미침 Devin Desktop과 CLI에서 출시 당일부터 사용할 수 있으며 Web과 Fusion에도 순차 적용 중임. medium은 단순·중간 난도 작업을 빠르게 처리하고, high와 max는 복잡한 작업의 계획·탐색·검증에 더 많은 노력을 들임 길이 가중 보상 기준값과 온라인 초안 모델 학습, 저정밀도 커널, 양자화 인지 학습을 결합해 SWE-1.7보다 거의 3배 큰 기반 모델에서도 비슷한 처리량·효율과 더 낮은 추론·학습 간 불일치를 달성함 출시와 벤치마크 성능 SWE-2는 에이전트 코딩용 강화학습을 이미 광범위하게 거친 Kimi K3를 기반으로 함 SWE-1.7의 학습 인프라와 방법을 확장해 처음으로 수조 매개변수 규모에서 강화학습을 수행함 여러 벤치마크에서 기반 모델보다 5~6%p 개선하며 비용·성능 곡선 전반을 끌어올림 FrontierCode 1.1 Main과 DeepSWE 1.1에서는 SWE-1.7과 Grok 4.6을 점수와 비용 양쪽에서 앞섬 GPT-5.6 Sol 및 Fable 5/5.1에 필적하는 성능을 더 낮은 가격으로 달성함 GPT-6 Astra와는 수%p 이내 차이를 보이며 비용은 약 4분의 1임 벤치마크별 점수는 SWE-2 / Kimi K3 / Grok 4.6 / Fable 5.1 / GPT-5.6 Sol / GPT-6 Astra / SWE-1.7 순서임 FrontierCode 1.1 Main: 50.0% / 44.2% / 48.0% / 50.9% / 47.5% / 53.3% / 42.0% DeepSWE 1.1: 73.0% / 68.5% / 67.5% / 67.4% / 72.7% / 74.1% / 37.7% Terminal-Bench 2.1: 92.8% / 88.3% / 88.4% / ...
Cognition, Fable 5.1·GPT-Astra에 필적하는 코딩 모델 SWE-2 출시
3 weeks ago
22
Related
D2Coding 폰트 1.4.0 릴리즈 소식을 전합니다.
40 minutes ago
1
FE News 26년 10월 소식을 전해드립니다.
44 minutes ago
1
자율주행 데이터에서 시간은 어떻게 맞춰지는가
46 minutes ago
1
2026년 개발자 현황
53 minutes ago
1
Strands Decider 2B - 소형 오픈소스 의사결정 모델
1 hour ago
3
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
1 hour ago
3
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
2 hours ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·