Kimi K3 로컬 실행 가이드

2 hours ago 1

Moonshot AI의 Kimi K3는 전체 2.8T·활성 104B 매개변수와 네이티브 비전, 100만 토큰 문맥을 갖춘 오픈 웨이트 모델이며, Unsloth가 로컬 실행용 GGUF 양자화를 제공함 전체 정밀도 추론에는 1.56TB가 필요하지만, Dynamic 1-bit UD-IQ1_S는 594GB에서 약 78.9% Top-1 정확도를, 861.3GB의 2-bit UD-Q2_K_XL은 약 90%를 기록함 Kimi K3는 사고 흔적을 유지하는 thinking-only 모델로 Instant 모드를 지원하지 않으며, reasoning_effort로 "low", "high"", "max"를 선택하고 최대 1,048,576토큰을 처리함 Unsloth Studio는 RAM 오프로딩과 다중 GPU 감지를 자동화하며, 비전 기능을 사용하는 llama.cpp 실행에는 Kimi K3용 Unsloth 포크가 필요함 권장 UD-IQ1_S 실행에는 최소 610GB RAM이 필요하고, 대체로 RAM+VRAM을 양자화 파일 크기만큼 확보해야 하며 부족하면 디스크 오프로딩으로 크게 느려짐 모델 특성과 로컬 실행 요구사항 Moonshot AI의 Kimi K3는 코딩, 에이전트, 장문 문맥, 채팅을 겨냥한 2.8T 매개변수 오픈 웨이트 모델이며 추론 시 104B 매개변수를 활성화함 네이티브 비전과 100만 토큰 문맥 창을 지원하고 MoE 가중치에 MXFP4를 사용함 전체 정밀도 추론에는 1.56TB의 저장 공간이 필요함 Kimi-K3-GGUF는 Unsloth Studio 또는 llama.cpp에서 실행할 수 있음 NVIDIA DGX Station이나 128GB RAM 장치에 연결된 Mac Studio에서도 실행 가능함 하드웨어 요구량은 RAM과 VRAM 또는 통합 메모리의 합으로 계산하며, 구성 범위는 610GB~1.6TB임 GGUF 구현 방식 llama.cpp PR을 기반으로 구현했으며, Unsloth 포크가 비전 지원과 버그 수정을 추가함 비전 타워는 Kimi K2.5와 유사하지만 다음 차이가 있음 RMSNorm을 사용하고 bias가 없음 융합 QKV가 비정방형이며 qkv width != n_embd임 projector 뒤에 정규화를 적용함 큰 배치에서 n_tokens * 40 예산이 실패해 n_tokens * 160 으로 늘림 Kimi 채팅 템플릿을 Jinja 형식으로 변환함 기본 학습 설정이 preserved thinking을 활성화하...

Read Entire Article