← promppy_ 실시간 AI 뉴스
참고HF Blog

Multimodal 인코더 'NeoMME' 공개: 효율적인 오픈소스 문서 검색 모델

260M/800M 파라미터로 높은 검색 성능을 제공. 별도 비전 타워 없는 효율적 아키텍처로 RAG 문서 인덱싱 최적화에 활용 가능.

요약

Hugging Face는 별도의 사전 학습된 비전 타워나 인과 언어 모델을 사용하지 않는 다국어 멀티모달 인코더 NeoMME(260M, 800M)를 공개했다. 이 모델은 단일 양방향 트랜스포머가 텍스트 토큰과 원시 이미지 패치를 처리하며, 마스크된 이산 확산 목표를 사용하여 처음부터 학습되었다. 시각적 문서 검색을 위해 미세 조정된 NeoMME-Retriever는 NVIDIA L40S GPU에서 2048×2048 이미지 입력 기준 초당 약 51페이지를 인코딩하여 ColModernVBERT 대비 약 2배 빠른 처리량을 기록했다. 계층적 토큰 풀링과 비대칭 양자화를 적용해 후기 상호작용 인덱스 저장 공간을 페이지당 약 1.5MB에서 6kB로 255배 줄이면서도 베이스라인 nDCG@10 성능의 95% 이상을 유지했다. 모든 모델 체크포인트는 Apache 2.0 라이선스로 Hugging Face Transformers를 통해 사용할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 *NeoMME*: an efficient Multimodal-native and Multilingual Encoder

원문 보기 ↗
다음 뉴스 →

중요Nvidia 'RTX Spark' 탑재 첫 AI 노트북·미니 데스크톱 등장

로컬 에이전트 워크플로 최적화 하드웨어. 온디바이스 AI 개발·배포 환경 변화 주목.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스