구글, 740M 멀티모달 임베딩 모델 'EmbeddingGemma 2' 공개…온디바이스 구동
Apache 2.0·270M 텍스트 전용 모드 지원. 로컬 RAG·미디어 검색 파이프라인 구축 시 검토 가치.
요약
구글이 텍스트, 이미지, 오디오, 비디오, 코드를 하나의 통합 임베딩 공간으로 매핑하는 멀티모달 모델 'EmbeddingGemma 2'를 공개했습니다. 이 모델은 740M 파라미터 규모로, 텍스트 전용 모드는 270M까지 경량화가 가능하며 로컬 환경에서 실행할 수 있습니다. Matryoshka Representation Learning을 적용해 기존 대비 저장 공간을 최대 6배 줄였으며, 8K 컨텍스트 윈도우를 지원합니다. Pixel 11 Pro 기준 텍스트 전용은 약 191MB, 멀티모달 모델은 약 567MB의 RAM만 사용하여 온디바이스 의미 검색, RAG, 미디어 검색 등에 최적화되어 있습니다. Apache 2.0 라이선스로 배포되며 MLX, Ollama, llama.cpp, vLLM 등 주요 로컬 AI 프레임워크와 호환됩니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ai_for_success: 🚨 Massive from Google... They just dropped EmbeddingGemma 2, a 740M parameter multimodal embedding model that runs locally. > Map
원문 보기 ↗