ARGODRIVE Deltafin은 128GB 메모리의 M5 Max MacBook Pro 한 대에서 1.45TB의 전문가 가중치를 SSD 4개로부터 스트리밍해 2.8조 파라미터 Kimi K3를 실행하며, 512토큰 생성 구간에서 1.0015토큰/초를 기록함 전문가를 제거하거나 전문가 가중치를 재인코딩해 속도를 높이지 않고, 매 토큰에 라우팅된 16개 전문가를 모두 사용함. 소형 모델의 초안도 K3가 검증하며, 최종 토큰 결정권은 K3에만 있음 가장 큰 제약은 첫 토큰 대기 시간으로, 512토큰 프롬프트 처리에 약 375초가 걸림. 프리필에서 각 층의 전문가를 8번씩 다시 읽는 문제를 확인했지만 수정은 아직 구현하지 않음 SSD 1개는 4개 구성 속도의 약 52%, 2개 완전 미러 구성은 약 73%, 3개는 약 90%에 도달함. 전체 대역폭보다 각 층의 16개 읽기 중 가장 느린 읽기가 처리 속도를 좌우함 단일 네이티브 실행 파일로 CLI와 OpenAI 호환 서버를 제공하지만, 긴 대화는 짧은 완성 작업보다 훨씬 느림. 제품보다는 소비자 하드웨어에서 대형 모델 실행의 한계를 탐구하는 실험이며, 측정값도 반복 검증된 일반 성능으로 해석해서는 안 됨 M5 Max에서 측정한 성능과 병목 ARGODRIVE Deltafin은 엔진을 만든 gavamedia/deltafin의 포크이며, ARGODRIVE를 계측에 사용함 테스트 구성은 M5 Max, 메모리 128GB, SSD 4개이며 전문가 가중치 1.45TB를 저장장치에서 스트리밍함 실행 설정은 env.sh, 실행별 로그는 results/에 공개함 초안 모델 활성화 여부에 따라 생성 길이별 처리량이 달라짐 512토큰 생성: 비활성화 시 0.9232토큰/초, 활성화 시 1.0015토큰/초 128토큰 생성: 비활성화 시 0.9261토큰/초, 활성화 시 1.1252토큰/초 이슈 #15의 공개 17토큰 프롬프트: 활성화 시 3회 중앙값 0.9631토큰/초로, 업스트림의 해당 보고값은 0.684토큰/초임 512토큰 프롬프트의 첫 토큰까지 걸린 시간은 비활성화 시 약 376초, 활성화 시 약 375초임 측정 범위에 주의가 필요함: README는 각 수치를 정확히 명시한 프롬프트로 수행한 단일 콜드 실행 결과로 규정하며, 17토큰 항목에는 별도로 3회 중앙값을 표기함 정의, 모델 동일성의 범위, 정밀도 관련 조건은 벤치마크 README에서 확인할 수 있음 SSD 개수에 따른 확장성은 선...
SSD 4개에서 스트리밍해 MacBook Pro에서 Kimi K3(2.8T)를 초당 1토큰으로 실행
4 weeks ago
12
Related
D2Coding 폰트 1.4.0 릴리즈 소식을 전합니다.
38 minutes ago
1
FE News 26년 10월 소식을 전해드립니다.
42 minutes ago
1
자율주행 데이터에서 시간은 어떻게 맞춰지는가
44 minutes ago
1
2026년 개발자 현황
51 minutes ago
1
Strands Decider 2B - 소형 오픈소스 의사결정 모델
1 hour ago
3
Tell HN: GitHub이 한 달이 지나도 제 소프트웨어의 크랙 복제본 삭제를 거부합니다
1 hour ago
3
Penguin Mail - AI를 탑재한 Linux용 오픈소스 Rust 이메일 클라이언트
2 hours ago
3
Show GN: 이메일 피싱 모의훈련을 전화로 옮겼습니다. 예고 없는 전화
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·