MicroLLM Lab은 소형 언어 모델 7개를 브라우저에서 실행하고, 채팅과 성능 비교를 할 수 있는 실험 도구임 WebGPU로 기기 GPU를 활용하며, 프롬프트와 사용자 데이터가 기기 밖으로 나가지 않고 계정이나 서버 비용 없이 동작함 Q4 양자화로 가중치를 4비트로 압축하며, 제공 모델은 약 2,580만~3억 6,200만 매개변수 규모임 벤치마크는 정규식과 정확한 토큰 일치로 판정하는 21개 테스트와 256토큰 연속 생성 속도를 측정하며, 글쓰기 품질을 평가하지는 않음 JavaScript 사용자 정의 평가와 기기별 성능 인증서 생성을 지원하며, WebGPU를 사용할 수 없으면 WASM, 이후 JavaScript로 대체 실행함 브라우저에서 실행하는 소형 모델 실험실 MicroLLM Lab은 소형 언어 모델(SLM)을 로컬에서 실행하고 속도와 정확도를 비교하는 도구임 모델을 불러오면 브라우저의 IndexedDB에 캐시하며, 별도 파일로 디스크에 다운로드하지 않음 채팅 패널에서 프롬프트를 시험하고 실시간 초당 토큰 생성 속도를 확인할 수 있음 벤치마크 실행 후 모델 간 비교와 공유 가능한 성능 인증서 생성이 가능함 소형 모델은 폭넓은 상식보다 특정 작업과 효율적인 엣지 처리에 초점을 둠 질의 분류, 스팸 필터링, 의도 추출로 고비용 클라우드 LLM 호출이 필요한지 판단하는 용도를 겨냥함 휴대전화나 노트북에서 실행하므로 프롬프트와 사용자 데이터가 외부로 나가지 않음 클라이언트 GPU를 활용해 API 비용 없이 동시 처리를 분산함 10ms 미만의 첫 토큰 지연 시간을 활용한 자동 완성과 실시간 에이전트를 겨냥함 Q4와 WebGPU 실행 방식 Q4는 16비트 부동소수점 가중치를 매개변수당 4비트로 압축해 가중치 메모리 사용량을 75% 줄임 거의 손실 없는 생성 품질을 유지하면서 1억 개 이상 매개변수 모델을 약 50~84MB의 브라우저 메모리에 담는 것을 목표로 함 WebGPU는 브라우저에서 하드웨어 GPU의 컴퓨트 셰이더를 실행하는 W3C 표준 API임 Apple Silicon의 Metal, DirectX 12, Vulkan 기반 GPU 실행을 활용함 페이지 안내 기준 WASM CPU 실행은 약 8~20토큰/초, WebGPU 실행은 100~300+토큰/초이며 속도 차이는 약 10~20배임 WebGPU 지원 브라우저와 하드웨어 가속 활성화가 필요함 안내 대상은 Chrome 113+, Edge 113+, Brave, ...
MicroLLM Lab - 브라우저에서 초소형 LLM 7개 체험하기
1 week ago
16
Related
AnyPS5 - 에뮬레이션 없이 PS5 바이너리를 PC로 포팅하는 도구(시스템 라이브러리 87% 매핑)
24 minutes ago
0
Show GN: 추천링크·UTM으로 오프라인 소개의 성과를 추적하는 구조
1 hour ago
3
소프트웨어 팩토리 패턴 시도하기
1 hour ago
3
Show GN: 웹 변경 모니터링하는 크롬 확장프로그램
2 hours ago
3
OpenAI, 확률·선택지·점수를 반환하는 Decisions API 공개 베타 시작
2 hours ago
3
제프리 카첸버그 - 세상이 바뀌고 있다: 창의성을 위한 AI
2 hours ago
3
이 모든 것이 지나간 뒤를 위한 지속 가능한 웹 커리어
2 hours ago
3
여러 팀의 시스템을 이해하기 위한 AI 집단 지성 구축하기
3 hours ago
3
Tips
click
Popular
프로들도 줄지어 샷 점검… KLPGA 스타 사랑방 된 더헤븐CC 연습장
2 weeks ago
73
iOS 27, iPadOS 27, macOS 27
3 weeks ago
69
손흥민 선제골 발판·골대 불운…LAFC, 7경기 만에 승리
3 weeks ago
65
영림원소프트랩, 나람 통합 ERP 구축…사료 제조·물류·회계 데이터 하나로
2 weeks ago
62
'이 악문' 김영범, 자유형 50m '대회 신기록' 금메달
2 weeks ago
55
© Clint IT 2026. All rights are reserved









English (US) ·