Bonsai 2 27B, 메모리 사용량을 9분의 1 미만으로 줄인 거의 무손실 압축

2 weeks ago 17

PrismML이 Qwen3.8 27B 기반 Ternary Bonsai 2 27B를 공개함. 모델 크기는 5.9GB로 전체 정밀도 모델의 9분의 1 미만이며, 종합 벤치마크 성능의 98.2% 를 유지함 언어 모델 전체에 3진 가중치 {−1, 0, +1} 와 FP16 그룹별 스케일링을 적용해 가중치당 실효 비트 수를 1.76비트로 낮춤 추론, 수학, 코딩, 지시 따르기, 비전, 에이전트 도구 사용 평가에서 종합 83.9점을 기록함. 코딩과 수학 성능은 전체 정밀도 모델에 근접하고, 지시 따르기 점수는 이를 상회함 처리량은 RTX 5090에서 최대 143토큰/초, M5 Max에서 46.8토큰/초임. RTX 4090에서는 토큰당 0.714mWh를 소비하며, 전체 정밀도 8B 모델보다 에너지 효율이 40% 높음 262K 토큰 컨텍스트와 텍스트/이미지 입력을 지원하며 Apache 2.0 라이선스로 가중치를 공개함. 전용 저비트 커널을 통해 NVIDIA GPU의 CUDA와 Apple 기기의 MLX에서 실행됨 압축 방식과 이전 세대 대비 변화 Ternary Bonsai 2 27B는 두 달 전 공개한 첫 Bonsai 27B의 후속 모델로, 기반 모델을 Qwen3.8 27B로 변경함 추론, 코딩, 비전, 장기 에이전트 작업 성능을 개선하면서 작은 메모리 사용량, 높은 로컬 처리량, 에너지 효율을 유지함 전체 정밀도 모델 대비 성능 유지율은 이전 세대의 95%에서 98% 이상으로 높아짐 3진 가중치 {−1, 0, +1} 에 FP16 그룹별 스케일링을 결합하고, 저비트 표현을 언어 모델 전체에 적용함 가중치당 실효 비트 수는 1.76비트, 전체 모델 크기는 5.9GB임 크기는 전체 정밀도 모델의 9분의 1 미만이면서 종합 벤치마크 성능의 98.2%를 유지함 262K 토큰 컨텍스트 윈도와 멀티모달 텍스트/이미지 입력을 지원함 벤치마크 성능과 로컬 활용 사고 모드(thinking mode) 기준 종합 점수는 Ternary Bonsai 2 27B가 83.9점, Qwen3.8 27B가 85.4점, Qwen3.6 27B가 83.6점임 영역별 점수는 아래와 같으며, 수치는 Bonsai 2 / Qwen3.8 / Qwen3.6 순서임 에이전트 및 도구 호출: τ²-bench, BFCLv3에서 77.57 / 79.74 / 80.05점임 코딩: HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench에서 81.58 /...

Read Entire Article