Multimodal 인코더 'NeoMME' 공개: 효율적인 오픈소스 문서 검색 모델
260M/800M 파라미터로 높은 검색 성능을 제공. 별도 비전 타워 없는 효율적 아키텍처로 RAG 문서 인덱싱 최적화에 활용 가능.
요약
Hugging Face는 별도의 사전 학습된 비전 타워나 인과 언어 모델을 사용하지 않는 다국어 멀티모달 인코더 NeoMME(260M, 800M)를 공개했다. 이 모델은 단일 양방향 트랜스포머가 텍스트 토큰과 원시 이미지 패치를 처리하며, 마스크된 이산 확산 목표를 사용하여 처음부터 학습되었다. 시각적 문서 검색을 위해 미세 조정된 NeoMME-Retriever는 NVIDIA L40S GPU에서 2048×2048 이미지 입력 기준 초당 약 51페이지를 인코딩하여 ColModernVBERT 대비 약 2배 빠른 처리량을 기록했다. 계층적 토큰 풀링과 비대칭 양자화를 적용해 후기 상호작용 인덱스 저장 공간을 페이지당 약 1.5MB에서 6kB로 255배 줄이면서도 베이스라인 nDCG@10 성능의 95% 이상을 유지했다. 모든 모델 체크포인트는 Apache 2.0 라이선스로 Hugging Face Transformers를 통해 사용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 *NeoMME*: an efficient Multimodal-native and Multilingual Encoder
원문 보기 ↗