Desert Ant Labs, 기기에서 실행되는 빠른 로컬 모델 공개

3 weeks ago 25

오디오·비전·텍스트 작업을 클라우드 없이 처리하도록 유럽 AI 연구소 Desert Ant Labs가 소형 특화 모델 18개를 공개함. 안정 버전 12개와 베타 6개를 Swift·Kotlin·JavaScript용 SDK로 제공함 작업당 하나의 모델을 기기에서 실행해 호출당 비용과 서버 왕복을 없애며, 모든 모델은 월간 활성 기기 10만 대까지 무료로 사용할 수 있음 공개 성능 수치상 Voz는 iPhone에서 10분 오디오를 2초 만에 전사하고, 9MB Clear는 5분짜리 노트북 녹음을 1초 만에 스튜디오 품질로 개선함 자체 영상 앱 Detail에서 Dolby와 Claude Sonnet 등을 특화 모델로 대체했으며, iOS 27과 함께 출시할 Detail 6는 모든 클라우드 API를 자체 온디바이스 모델로 전환할 예정임 상시 작업은 소형 로컬 모델로 처리하고, 필요에 따라 더 큰 모델과 클라우드를 선택하는 계층을 구축할 계획임. 데이터를 기기에 유지하면서 비용 때문에 제한하던 기능을 모든 메시지와 상호작용에 적용하는 것이 목표임 작업별 온디바이스 모델 18개 공개 Desert Ant Labs는 효율적인 지능의 출발점을 온디바이스에 두고, 오디오·비전·텍스트용 소형 특화 모델을 개발하는 유럽 AI 연구소임 첫 공개 모델은 안정 버전 12개와 베타 6개이며, 작업마다 전용 모델을 제공함 밀리초 단위 응답, 5년 된 휴대전화에서도 실행할 수 있는 크기, 매 프레임이나 키 입력마다 활용할 수 있는 속도를 내세움 토큰 비용이나 추론 속도에 제약받지 않고 제품의 모든 상호작용에 지능을 넣는 것이 목표임 모든 모델은 월간 활성 기기 10만 대까지 무료이며, 토큰이나 로그인 없이 사용할 수 있음 아래 대표 모델 외 나머지 14개를 포함한 전체 사양과 벤치마크는 모델 목록과 Hugging Face에서 확인할 수 있음 대표 모델과 공개 벤치마크 Voz는 iPhone에서 10분 오디오를 2초 만에 전사하며, 각 단어의 시작·종료 시각을 제공함 소개 수치상 Whisper보다 4.7배 빠름 M3 Ultra에서 연속 30분 오디오를 처리한 벤치마크의 실시간 대비 배속은 Voz 319배, Apple SpeechAnalyzer 78배, Whisper large-v3-turbo 50배임 iPhone 17 Pro에서는 실시간 대비 298배에 도달함 Clear는 9MB 오디오 개선 모델로, 5분짜리 노트북 녹음을 1초 만에 스튜디오 품질로 바꿀 ...

Read Entire Article