MicroLLM Lab - 브라우저에서 초소형 LLM 7개 체험하기

1 week ago 16

MicroLLM Lab은 소형 언어 모델 7개를 브라우저에서 실행하고, 채팅과 성능 비교를 할 수 있는 실험 도구임 WebGPU로 기기 GPU를 활용하며, 프롬프트와 사용자 데이터가 기기 밖으로 나가지 않고 계정이나 서버 비용 없이 동작함 Q4 양자화로 가중치를 4비트로 압축하며, 제공 모델은 약 2,580만~3억 6,200만 매개변수 규모임 벤치마크는 정규식과 정확한 토큰 일치로 판정하는 21개 테스트와 256토큰 연속 생성 속도를 측정하며, 글쓰기 품질을 평가하지는 않음 JavaScript 사용자 정의 평가와 기기별 성능 인증서 생성을 지원하며, WebGPU를 사용할 수 없으면 WASM, 이후 JavaScript로 대체 실행함 브라우저에서 실행하는 소형 모델 실험실 MicroLLM Lab은 소형 언어 모델(SLM)을 로컬에서 실행하고 속도와 정확도를 비교하는 도구임 모델을 불러오면 브라우저의 IndexedDB에 캐시하며, 별도 파일로 디스크에 다운로드하지 않음 채팅 패널에서 프롬프트를 시험하고 실시간 초당 토큰 생성 속도를 확인할 수 있음 벤치마크 실행 후 모델 간 비교와 공유 가능한 성능 인증서 생성이 가능함 소형 모델은 폭넓은 상식보다 특정 작업과 효율적인 엣지 처리에 초점을 둠 질의 분류, 스팸 필터링, 의도 추출로 고비용 클라우드 LLM 호출이 필요한지 판단하는 용도를 겨냥함 휴대전화나 노트북에서 실행하므로 프롬프트와 사용자 데이터가 외부로 나가지 않음 클라이언트 GPU를 활용해 API 비용 없이 동시 처리를 분산함 10ms 미만의 첫 토큰 지연 시간을 활용한 자동 완성과 실시간 에이전트를 겨냥함 Q4와 WebGPU 실행 방식 Q4는 16비트 부동소수점 가중치를 매개변수당 4비트로 압축해 가중치 메모리 사용량을 75% 줄임 거의 손실 없는 생성 품질을 유지하면서 1억 개 이상 매개변수 모델을 약 50~84MB의 브라우저 메모리에 담는 것을 목표로 함 WebGPU는 브라우저에서 하드웨어 GPU의 컴퓨트 셰이더를 실행하는 W3C 표준 API임 Apple Silicon의 Metal, DirectX 12, Vulkan 기반 GPU 실행을 활용함 페이지 안내 기준 WASM CPU 실행은 약 8~20토큰/초, WebGPU 실행은 100~300+토큰/초이며 속도 차이는 약 10~20배임 WebGPU 지원 브라우저와 하드웨어 가속 활성화가 필요함 안내 대상은 Chrome 113+, Edge 113+, Brave, ...

Read Entire Article