BITCOS는 3진 LLM 가중치의 0 비중을 활용해 저장량을 줄이는 형식으로, 조사한 29개 모델 중 26개에서 기존 5트릿 패킹보다 작고 기호만 계산하면 최소 가중치당 1.485비트를 달성함 모든 가중치에 비영 여부를 나타내는 비트 1개를 배정하고, 0이 아닌 가중치의 부호만 별도로 압축함으로써 0의 비율이 z일 때 가중치당 2 − z비트를 사용함 AVX-512/AVX2와 Intel Xe2 GPU용 복원 커널을 구현했으며, 실제 모델의 0 비율 구간에서 기존 2비트 행렬-벡터 곱 커널 대비 최대 1.28배 성능을 기록함 7개 모델의 배치 크기 1 디코딩 평가에서 기존 고성능 2비트 커널 대비 처리량이 CPU 최대 1.18배, GPU 최대 1.27배로 높아짐 저장량 감소가 항상 속도 향상으로 이어지지는 않으며, 코어당 메모리 대역폭이 높은 8코어 Lunar Lake CPU에서는 복원 명령어가 병목이 되어 평가한 모든 모델에서 기존 2비트 커널보다 느렸음 1.58비트 기준과 실제 가중치 분포 3진 가중치 양자화는 각 가중치를 {−1, 0, +1} 중 하나로 제한하고 그룹별 스케일을 적용함 세 기호의 확률이 같을 때 정보량은 log₂3 ≈ 1.585비트이며, 이것이 통상적인 3진 저장량의 기준임 5개 트릿을 1바이트에 넣으면 가중치당 1.6비트지만, 실제 구현에서 사용하는 128개 단위 블록은 5로 나누어떨어지지 않음 블록마다 ⌈128/5⌉ = 26바이트가 필요하므로 실제 기호 저장량은 가중치당 1.625비트가 됨 29개 모델의 분포 측정에서 0 비율은 약 29.7~51.5%였으며, 많은 모델에서 0이 −1이나 +1보다 자주 나타남 BitNet b1.58은 4조 토큰으로 처음부터 학습한 2B 모델임 Bonsai는 1.7B~27B 규모의 밀집 모델 체크포인트 4개를 평가함 CAT-Q는 Qwen3 1.7B~235B의 학습 후 양자화 모델 5개로, 전문가 혼합 모델 2개를 포함함 ParetoQ는 저비트 양자화 인지 학습 연구의 125M~1.5B 체크포인트 5개가 대상임 TriLM은 3진 가중치로 사전학습한 Spectra 계열의 99M~3.9B 모델 9개를 평가함 Maple은 20B-A1B 규모의 3진 전문가 혼합 추론 모델임 BitCPM-CANN은 처음부터 학습한 0.5B~8B 체크포인트 4개가 대상임 작은 배치의 LLM 디코딩은 메모리 대역폭에 제약을 받으므로, 토큰당 시간은 가중치 자료형의 비트 폭에 영향을 받음 ...
Related
SQL 데이터베이스 스키마란 무엇이며 어떻게 설계할까?
11 minutes ago
0
키는 빠져 있었다: 미국 운전면허증 바코드의 서명 키 복구하기
23 minutes ago
0
GNOME 51 소개
1 hour ago
2
미국 전략비축유를 뒷받침하는 공학
3 hours ago
1
백업은 단순하지 않다
3 hours ago
2
DeepMind Institute
4 hours ago
2
블로그 글에 DOI를 발급받는 방법
4 hours ago
2
Show GN: Trawling - 해외 기술 소식을 모아보는 한국어 브리핑
5 hours ago
2
Tips
click
Popular
[팟캐스트] OAuth, 제대로 이해하고 쓰고 있나요?
3 weeks ago
94
고철
3 weeks ago
91
연상호, 토론토영화제서 고레에다 감독과 대담
3 weeks ago
81
취준생 목소리에 귀기울인 '라이너 라이트'..."자소서 기능 이용자 수 13배 늘...
3 weeks ago
76
‘붉은사막’, 게임스컴 어워드 에픽·최고의 PC 게임 후보작 올라
3 weeks ago
75
잔나비, 첫 아시아 투어 곳곳서 떼창 물결…"기적같은 일"
3 weeks ago
73
김재윤 통산 220세이브…삼성, 2연패 탈출
3 weeks ago
71
컴투스, 신작 '제우스: 오만의 신' 사전 다운로드 당일 애플 앱스토어 인기 1위
3 weeks ago
68
남궁훈 아이즈 대표, 카카오게임즈 지분 1% 매입…"게임산업 다시 성장할 것"
3 weeks ago
65
© Clint IT 2026. All rights are reserved

5 hours ago
3








English (US) ·