WASTE는 2.78조 파라미터의 완전한 Kimi K3 오픈 가중치 모델을 축소 없이 982GiB 컨테이너로 변환해 소비자용 노트북에서 실행하는 C 기반 추론 엔진임 모델의 상주 트렁크만 메모리에 두고 토큰마다 활성화되는 약 4%의 전문가 가중치를 NVMe에서 읽으며, 남은 RAM은 크기가 제한된 전문가 캐시로 사용함 Kimi K3는 4K 컨텍스트에서 최소 29.05GB RAM으로 열리지만 실용적인 구성은 64GB MacBook Pro의 46GB 예산이며, 여기서 0.45~0.62 tok/s를 기록함 전문가 읽기와 연산을 겹쳐 약 1.6배 개선하고 다음 계층 라우터를 한 residual 앞서 실행해 캐시 적중률을 14%에서 38% 로 높이면서도 총 읽기량과 로짓은 바꾸지 않음 인터넷 연결·토큰별 비용·외부 데이터 전송 없이 초대형 모델을 로컬에서 실행할 수 있지만, 내부 NVMe와 약 1TB 저장공간이 필요하고 RAM 예산이 52GB 이상이면 운영체제 페이징으로 오히려 급격히 느려질 수 있음 WASTE의 목표와 구현 형태 WASTE(Weight-Aware Streaming Tensor Engine) 는 런타임 외부 의존성이 없는 임베드 가능한 C 추론 엔진임 libwaste.a와 waste 실행 파일만 사용하며 libc와 pthreads 외에 BLAS, CUDA, ONNX, Python이 필요하지 않음 Python은 모델 변환과 PyTorch 기준 검증에만 사용되고 추론 경로에는 들어가지 않음 공개 API는 26개 함수로 구성되며 모델 열기, RAM 상한 설정, 생성, 세션 저장, 종료를 지원함 현재 검증 대상은 Kimi K3 2.78T 전체 모델임 공개 원본은 1.42TB이며 변환 후 컨테이너는 982GiB임 증류·가지치기·축소 버전이 아님 Kimi-Linear 48B도 같은 엔진과 포맷으로 19GiB 컨테이너, 최소 1.87GB RAM, 10.7 tok/s를 기록함 프로젝트 이름은 데스크 위 하드웨어에서 실행할 수 있는 모델을 클라우드 데이터센터에서 돌리며 토큰 비용과 전력을 함께 소비하는 상황을 줄이려는 목표에서 나옴 디스크 스트리밍 구조 Mixture of Experts 구조인 K3는 토큰당 모델의 약 4%만 활성화하므로, 비활성 가중치를 RAM에 상주시킬 필요 없이 필요한 시간에 접근 가능하게 배치함 .waste 컨테이너는 JSON 매니페스트, 상주 트렁크, 계층별 전문가 뱅크로 구성됨 각 전문가 레코...
29GB RAM에서 Kimi K3를 0.50 tok/s로 실행하기
6 hours ago
3
Related
Claude 사이버보안 평가가 실제 조직 3곳을 침해한 사건
1 hour ago
0
해고 통보
1 hour ago
1
대형 식품기업 대 시민의 공중보건 정책 전쟁
2 hours ago
0
죽어가던 소프트웨어: relayd(8)와 httpd(8)의 지속적인 진화
2 hours ago
2
가짜 저자를 신고한 연구 논문 두 편이 모두 구두 발표로 채택됨
3 hours ago
1
수학과 이론 컴퓨터 과학의 10가지 진전
4 hours ago
2
그저 존재하는 법
5 hours ago
3
프리미어리그, 유니폼 전면 도박업체 후원 금지
9 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
2 weeks ago
146
체육공단, 불법 스포츠도박 사이트 신고 포상 지침 제정
4 weeks ago
90
Codex 사용량 한도 리셋 추적
1 week ago
69
SAP Datasphere & BDC: Top New Features | June 2026
4 weeks ago
59
Odin 1.0, ‘Odin 2027’로 2027년 1월 출시 예정
3 weeks ago
51
© Clint IT 2026. All rights are reserved








English (US) ·