← promppy_ 실시간 AI 뉴스
참고팁HF Blog

Hugging Face, 비전 언어 모델 가속을 위한 'LFM2.5-VL-DSpark' 공개

비전 모델 추론 속도 최적화 솔루션. llama.cpp/SGLang 등을 활용한 온디바이스/GPU 서빙 최적화 시 참고할 것.

요약

Hugging Face는 비전-언어 모델의 추론 속도를 높이기 위한 'LFM2.5-VL-DSpark' 드래프터를 공개했다. 이 모델은 기존 LFM2.5-DSpark 텍스트 드래프터와 동일한 아키텍처를 공유하며, 이미지 패치와 텍스트 토큰을 통합된 표현으로 변환해 동일한 차원의 은닉 상태 벡터에서 작동한다. 4개 레이어와 블록 크기 9로 구성된 이 드래프터는 약 2억 8천만 개의 파라미터를 가지며, 기존 모델 대비 파라미터 증가율은 8.9%에 불과하다. 비전-언어 SFT 데이터로 10 에폭 학습을 거쳐 완성되었으며, 추론 시 하드웨어 사양에 따라 블록 크기를 8 또는 9로 설정하는 것을 권장한다. 현재 llama.cpp, MLX-VLM, SGLang을 즉시 지원하며, 일반 VQA, 차트 VQA, 복합 추론 등 6가지 비전 작업에서 성능 검증을 마쳤다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Accelerating vision-language models with LFM2.5-VL-DSpark

원문 보기 ↗

광고

다음 뉴스 →

중요구글, Gemini 3.8 Live에 실시간 '라이브 아바타' 탑재… AI에 얼굴을 입히다

97개 언어 립싱크 지원하지만 현재 엔터프라이즈 한정. 고객 응대·교육용 AI 페르소나 도입 검토 가치.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

최신 뉴스