동일한 노트북과 로컬 모델을 써도 하네스에 따라 첫 토큰 대기 시간이 llama.cpp 기준 12.2~225.7초로 벌어져, 모델 속도만으로 실제 응답성을 판단하기 어려움 긴 시스템 프롬프트·도구 스키마와 부가 요청은 제한된 로컬 자원을 압박함 — 데이터센터에서 부담이 작은 프리필(prefill)이 노트북에서는 수분의 대기로 이어짐 M4 MacBook Pro 24GB에서 Qwen 3.8 27B 3비트 양자화 모델로 Exercism 과제 8개를 각각 3회 실행함 — 단순한 Python 과제의 통과 수는 성능 순위가 아니며, 체감 처리량도 반복 간 최대 50% 변동함 pi·mini-swe-agent·chad는 시작 부담이 작고, dsh·cline·codex·goose는 초기 부담이 커도 안정적인 접두사 캐시로 이후 대기를 줄임 — crush·opencode는 시작에 3~4분이 걸림 chad는 서버와 에이전트 루프를 같은 프로세스에 둔 MLX 엔진과 DFlash2 조합에서 체감 처리량이 7.9→17.4토큰/초로 높아짐 — 로컬에서는 요청 설계뿐 아니라 추론 엔진과의 결합도 사용 속도를 좌우함 토큰 생성 벤치마크와 실제 응답성의 차이 llama-bench의 토큰/초 수치만으로는 코딩 하네스의 실제 응답성을 알기 어려움 첫 응답을 수분간 기다리거나 작업 도중 정체할 수 있으며, 대부분의 코딩 하네스는 로컬 모델을 염두에 두고 만들어지지 않음 이번 비교는 데이터센터 API를 localhost로 바꿨을 때의 동작을 측정함 실험자는 Apple silicon에서 Qwen 3.8 27B에 맞춰 최적화한 chad를 개발 중이므로 이 이해관계를 감안해야 함 다른 하네스의 설계 품질 자체를 평가하는 실험은 아니며, 용도와 실행 환경의 불일치가 일부 존재함 로컬 모델을 압박하는 세 가지 설계 긴 시스템 프롬프트와 도구 스키마는 모델이 작업을 시작하기 전에 읽어야 할 양을 늘림 읽기 90토큰/초, 생성 10토큰/초를 가정하면 입력 1,000토큰마다 생성 시작 전 약 11초가 추가됨 Qwen 3.8 27B에서 pi의 초기 입력은 2,008토큰, opencode는 18,046토큰임 프리필이 10,000토큰/초 이상인 데이터센터 GPU에서는 약 0.2초 대 1.8초지만, 실험 노트북에서는 약 22초 대 226초가 걸림 제한된 컨텍스트 중 일부를 하네스 자체가 먼저 사용함 사용 가능한 컨텍스트는 메모리 용량과 모델 가중치 크기에 좌우되며, 적당...
Related
D2Coding 폰트 1.4.0 릴리즈 소식을 전합니다.
39 minutes ago
1
FE News 26년 10월 소식을 전해드립니다.
43 minutes ago
1
자율주행 데이터에서 시간은 어떻게 맞춰지는가
45 minutes ago
1
2026년 개발자 현황
52 minutes ago
1
Strands Decider 2B - 소형 오픈소스 의사결정 모델
1 hour ago
3
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
1 hour ago
3
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
2 hours ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved

3 weeks ago
22








English (US) ·