참고팁Reddit
EmbeddingGemma 2를 브라우저(WebGPU)에서 구동하는 이미지 검색 구현
로컬 브라우저 환경에서 멀티모달 모델을 효율적으로 구동하는 구현 사례. 온디바이스 검색 기능 개발 시 참고.
요약
최근 공개된 EmbeddingGemma 2 모델은 이미지와 텍스트를 하나의 768차원 공간으로 매핑하여 텍스트로 사진을 검색할 수 있는 기능을 제공한다. 개발자는 이 모델의 텍스트 및 비전 타워를 TypeScript 기반의 WebGPU 추론 라이브러리인 ruNNtime에 포팅했다. 이를 통해 웹 브라우저 상에서 GPU 가속을 활용하여 사진 검색을 전적으로 로컬에서 실행할 수 있게 되었다. ruNNtime은 EmbeddingGemma 2 외에도 다양한 비전 모델을 지원한다. 실무자는 ruNNtime의 인터랙티브 문서를 통해 관련 모델들을 직접 테스트해 볼 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Image-text retrieval with EmbeddingGemma 2's vision tower, running in the browser on WebGPU
원문 보기 ↗