Kimi K3는 2.8조 개 매개변수와 104만 8,576토큰 컨텍스트를 갖춘 오픈 가중치 네이티브 멀티모달 에이전트 모델로, 장시간 코딩·지식 작업·추론을 지원함 Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE를 결합해 896개 전문가 중 토큰마다 16개를 활성화하며, Kimi K2보다 전체 스케일링 효율이 약 2.5배 높음 공개 평가에서 GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1을 기록했지만, 모델별 하네스·추론 설정·하드웨어 차이를 함께 고려해야 함 MXFP4 가중치·MXFP8 활성값으로 양자화 인식 학습됐으며 Transformers, vLLM, SGLang, Docker와 OpenAI·Anthropic 호환 API로 실행할 수 있음 다중 턴과 도구 호출에서는 API가 반환한 reasoning_content와 tool_calls를 포함한 전체 assistant 메시지를 그대로 다시 전달해야 하며, 코드와 가중치는 Kimi K3 License로 공개됨 모델 구조와 규모 Kimi K3는 장시간 코딩, 지식 작업, 추론을 위해 설계된 오픈 가중치 네이티브 멀티모달 에이전트 모델임 총 매개변수는 2.8T, 활성 매개변수는 104B이며 93개 레이어로 구성됨 Dense 레이어 1개, KDA 레이어 69개, Gated MLA 레이어 24개를 사용함 Attention hidden dimension은 7,168, attention head는 96개임 Stable LatentMoE는 896개 전문가 중 토큰마다 16개를 선택하고 공유 전문가 2개를 사용함 Latent MoE dimension은 3,584, 전문가별 MoE hidden dimension은 3,072임 Kimi K2와 비교하면 전체 스케일링 효율이 약 2.5배 향상됨 어휘 크기는 160K, 컨텍스트 길이는 1,048,576토큰이며 활성화 함수는 SiTU-GLU임 비전 인코더로 401M 매개변수의 MoonViT-V2를 사용함 주요 기능에는 텍스트·이미지·비디오 이해가 포함되지만, 모델 요약표의 modality 항목에는 Text와 Image만 기재돼 있음 장시간 코딩과 지식 작업 최소한의 사람 감독으로 긴 엔지니어링 세션을 유지하면서 대규모 저장소를 탐색하고 터미널 도구를 조율함 GPU 커널 최적화...
Related
개발자의 PO도전기 - 개발시작을 Lean하게 해본 이야기
17 minutes ago
0
SSL에 대해 배운 모든 것이 더는 유효하지 않음 [유튜브]
6 hours ago
2
YC CEO Garry Tan이 말하는 창업자의 새로운 규칙 [유튜브]
6 hours ago
1
Computer Use와 Skills/Files API로 프로덕션 에이전트 구축하기
6 hours ago
1
Rust nightly, 차세대 트레이트 솔버 기본 활성화
7 hours ago
1
KDE에 Btrfs 스냅샷을 통합하는 KIO Snapshot
7 hours ago
1
더 나은 배터리
7 hours ago
1
Tips
click
Popular
마키나락스, 중견 제조사 현장에 AI 네이티브 팩토리 구축한다
4 weeks ago
64
제니, 빌보드 라디오 차트 1위…'골든' 이어 두 번째
3 weeks ago
62
라온시큐어 화이트해커 23명, 국제 해킹 대회 '데프콘 CTF 2026' 본선행
3 weeks ago
56
'산골총각 영웅' 차승원·김도훈 합류…임영웅과 찰떡+힐링 케미
3 weeks ago
46
© Clint IT 2026. All rights are reserved

3 weeks ago
18
![[테크 차이나] DeepSeek V4 Flash 1위… 중국 모델 강세 지속(OpenRouter 주간 AI 모델 사용량 순위)](https://img.etnews.com/news/article/2026/08/06/news-p.v1.20260806.379c2eee15bb4be5b29d934a203a6106_Z1.jpg)








English (US) ·