EmbeddingGemma 2 - 개방형 경량 멀티모달 임베딩 모델

1 hour ago 3

Google이 텍스트, 코드, 이미지, 영상, 오디오를 하나의 임베딩 공간으로 통합하는 EmbeddingGemma 2를 출시함. Gemma 4 기반의 7억 4,000만 파라미터 모델이며 Apache 2.0 라이선스로 공개됨 모듈식 구조로 텍스트 전용 작업에는 2억 7,000만 파라미터만 사용하고, 필요에 따라 비전과 오디오 인코더를 추가할 수 있음 기존 EmbeddingGemma의 다국어 텍스트 성능을 유지하면서 MTEB Code 점수를 68.76에서 78.68로 개선했으며, 10억 파라미터 미만 멀티모달 임베딩 모델 가운데 코드와 오디오 벤치마크에서 선도적인 성능을 달성함 MRL로 임베딩 벡터를 768차원에서 128차원까지 줄여 저장 공간과 메모리 사용량을 최대 6분의 1로 축소할 수 있음 8K 토큰 문맥 창으로 오디오, 이미지, 영상 프레임과 이들을 섞은 입력을 처리하며, 로컬 임베딩 생성으로 완전 오프라인 교차 모달 검색과 온디바이스 RAG를 지원함 텍스트 임베딩에서 멀티모달로 확장 지난해 공개한 EmbeddingGemma는 소비자용 하드웨어에서 정보를 정리하고 검색하며 연결하는 경량 텍스트 임베딩 모델로, 2,000만 회 이상 다운로드됨 개발자들은 온디바이스 검색 도구와 개인정보 보호 우선의 검색 증강 생성(RAG) 파이프라인에 활용해 왔음 EmbeddingGemma 2는 텍스트를 넘어 코드, 이미지, 영상, 오디오를 공유 임베딩 공간에 매핑함 단일 네이티브 멀티모달 모델로 음성 메모에 맞는 영상 클립을 찾거나, 텍스트 질의로 수 시간 분량의 오디오 녹음을 검색할 수 있음 Gemma 4 아키텍처를 기반으로 하며 Gemini Embedding 모델과 같은 기술을 사용함 전체 파라미터는 7억 4,000만 개이며, 상업적 이용을 허용하는 Apache 2.0 라이선스로 공개됨 모듈식 구성과 온디바이스 자원 효율 텍스트 전용 구성에는 2억 7,000만 파라미터만 필요하며, 비전 인코더 1억 7,000만 개와 오디오 인코더 3억 개를 선택적으로 추가할 수 있음 마트료시카 표현 학습(Matryoshka Representation Learning, MRL) 을 사용해 출력 벡터를 768차원에서 512, 256, 128차원으로 동적으로 잘라낼 수 있음 로컬 벡터 데이터베이스의 저장 공간과 메모리 사용량을 최대 6분의 1로 줄일 수 있음 양자화 적용 시 Google Pixel 11 Pro에서 텍스트 전용 가중치에 필요한 ...

Read Entire Article