중요X
구글, 멀티모달 통합 임베딩 모델 'EmbeddingGemma 2' 공개 (Apache 2.0)
텍스트·이미지·영상·오디오를 단일 벡터 공간에 임베딩. 캡션 변환 없는 멀티모달 RAG 구축 검토 가치.
요약
구글이 텍스트, 코드, 이미지, 비디오, 오디오를 하나의 공유 벡터 공간에 매핑하는 새로운 모델인 EmbeddingGemma 2를 공개했다. 기존의 멀티모달 RAG가 캡션이나 전사 과정을 거쳐 텍스트 임베더를 사용하는 것과 달리, 이 모델은 단일 모델로 다양한 모달리티를 통합적으로 처리할 수 있다. 이를 통해 음성 메모로 비디오 클립을 검색하거나 텍스트로 수 시간 분량의 오디오 데이터를 검색하는 작업이 가능하다. 또한 라이선스가 Apache 2.0으로 변경되어 상업적 이용이 가능해졌다. 해당 모델의 오픈 웨이트는 관련 링크를 통해 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @MiaAI_lab: Google launched EmbeddingGemma 2 🔥 This is a bigger than you think. Most people build multimodal RAG as caption/transcribe, and t
원문 보기 ↗