55GB 원본 BF16을 17GB Q4_K_M 으로 줄여도 GPQA Diamond·IFBench·Terminal-Bench 2.1에서 눈에 띄는 성능 차이가 없었으며, 24GB RTX 4090에 약 64k 토큰 컨텍스트와 함께 올릴 수 있음 추론 강도는 양자화보다 결과를 크게 바꿀 수 있음. 기본값 xhigh는 GPQA Diamond에서 최고 성적을 냈지만, 1비트에서는 토큰 예산을 소진하고 빈 답을 반환하는 일이 늘어 오히려 점수가 낮아짐 2비트 UD-Q2_K_XL 은 IFBench에서 성능을 유지했으나 과학 문제와 에이전트 코딩에서는 하락했고, 1비트 모델은 GPQA Diamond에서 무작위 추측 수준 또는 그 이하로 떨어짐 실험은 32k 토큰당 약 2.3GB가 필요한 F16 KV 캐시를 유지한 채 수행함. 대부분의 테스트에 쓴 Unsloth v2 파일은 이후 교체돼 동일 파일로 재현하기 어렵다는 제약이 있음 로컬 실행에서는 모델과 필요한 컨텍스트가 함께 GPU 메모리에 들어가는 구성을 골라야 함. 이번 평가에서는 대다수 작업에 4비트가 충분하고 일부 간단한 작업에는 2비트도 유용했지만, 토큰 예측 일치율만으로 실제 작업 품질을 판단하기는 어려움 토큰 예측 차이보다 실제 작업 성능을 측정 앞선 Qwen3.6 27B 실험에서는 12GB에서도 SVG 펠리컨을 잘 생성했고, 16GB까지 지식 대부분을 유지함. 반면 커뮤니티에는 8비트조차 성능이 나빠진다는 불만과 로컬 LLM이 더 멍청하게 느껴지는 이유에 대한 논의가 있음 KL 발산이나 최상위 토큰 예측 일치율은 측정하기 쉽지만, 작업 해결 능력을 직접 알려주지는 않음 다른 토큰을 생성해도 같은 품질의 답을 바꿔 쓴 것일 수 있음 반대로 토큰 하나의 차이가 논리 오류를 만들거나 출력을 갑자기 끝낼 수도 있음 실제 성능은 과학 지식 평가 GPQA Diamond, 지시 준수 평가 IFBench, 에이전트 코딩 평가 Terminal-Bench 2.1으로 비교함 먼저 원본 BF16의 공식 결과를 재현한 뒤 양자화에 따른 변화를 확인함 실행 환경과 재현성 제약 Modal GPU에서 llama.cpp의 2026년 8월 16일 빌드를 사용했으며, 총비용은 약 3,000달러임 이전 빌드는 해당 모델을 지원하지 않음 원칙적으로 개인 노트북에서도 실행할 수 있지만, 이 벤치마크들은 펠리컨 생성 실험과 달리 시간이 많이 걸림 모델 양자화와 무관하게 F16 KV 캐시를 사용했으며, 3...
Qwen3.8 27B 양자화 벤치마크: 4비트는 성능 유지, 1비트는 붕괴
4 weeks ago
18
Related
Strands Decider 2B - 소형 오픈소스 의사결정 모델
53 minutes ago
1
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
56 minutes ago
2
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
1 hour ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
2 hours ago
3
토론토 기반 VPN 업체, 적법 접근 법안으로 캐나다 떠날 계획
3 hours ago
3
Claude Code의 메시지 제안 기능: 진짜 고객은 모델이라는 생각
3 hours ago
3
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
5 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·