3진 LLM의 1.58비트 장벽을 넘어서

5 hours ago 3

BITCOS는 3진 LLM 가중치의 0 비중을 활용해 저장량을 줄이는 형식으로, 조사한 29개 모델 중 26개에서 기존 5트릿 패킹보다 작고 기호만 계산하면 최소 가중치당 1.485비트를 달성함 모든 가중치에 비영 여부를 나타내는 비트 1개를 배정하고, 0이 아닌 가중치의 부호만 별도로 압축함으로써 0의 비율이 z일 때 가중치당 2 − z비트를 사용함 AVX-512/AVX2와 Intel Xe2 GPU용 복원 커널을 구현했으며, 실제 모델의 0 비율 구간에서 기존 2비트 행렬-벡터 곱 커널 대비 최대 1.28배 성능을 기록함 7개 모델의 배치 크기 1 디코딩 평가에서 기존 고성능 2비트 커널 대비 처리량이 CPU 최대 1.18배, GPU 최대 1.27배로 높아짐 저장량 감소가 항상 속도 향상으로 이어지지는 않으며, 코어당 메모리 대역폭이 높은 8코어 Lunar Lake CPU에서는 복원 명령어가 병목이 되어 평가한 모든 모델에서 기존 2비트 커널보다 느렸음 1.58비트 기준과 실제 가중치 분포 3진 가중치 양자화는 각 가중치를 {−1, 0, +1} 중 하나로 제한하고 그룹별 스케일을 적용함 세 기호의 확률이 같을 때 정보량은 log₂3 ≈ 1.585비트이며, 이것이 통상적인 3진 저장량의 기준임 5개 트릿을 1바이트에 넣으면 가중치당 1.6비트지만, 실제 구현에서 사용하는 128개 단위 블록은 5로 나누어떨어지지 않음 블록마다 ⌈128/5⌉ = 26바이트가 필요하므로 실제 기호 저장량은 가중치당 1.625비트가 됨 29개 모델의 분포 측정에서 0 비율은 약 29.7~51.5%였으며, 많은 모델에서 0이 −1이나 +1보다 자주 나타남 BitNet b1.58은 4조 토큰으로 처음부터 학습한 2B 모델임 Bonsai는 1.7B~27B 규모의 밀집 모델 체크포인트 4개를 평가함 CAT-Q는 Qwen3 1.7B~235B의 학습 후 양자화 모델 5개로, 전문가 혼합 모델 2개를 포함함 ParetoQ는 저비트 양자화 인지 학습 연구의 125M~1.5B 체크포인트 5개가 대상임 TriLM은 3진 가중치로 사전학습한 Spectra 계열의 99M~3.9B 모델 9개를 평가함 Maple은 20B-A1B 규모의 3진 전문가 혼합 추론 모델임 BitCPM-CANN은 처음부터 학습한 0.5B~8B 체크포인트 4개가 대상임 작은 배치의 LLM 디코딩은 메모리 대역폭에 제약을 받으므로, 토큰당 시간은 가중치 자료형의 비트 폭에 영향을 받음 ...

Read Entire Article