Hugging Face, 비전 언어 모델 가속을 위한 'LFM2.5-VL-DSpark' 공개
비전 모델 추론 속도 최적화 솔루션. llama.cpp/SGLang 등을 활용한 온디바이스/GPU 서빙 최적화 시 참고할 것.
요약
Hugging Face는 비전-언어 모델의 추론 속도를 높이기 위한 'LFM2.5-VL-DSpark' 드래프터를 공개했다. 이 모델은 기존 LFM2.5-DSpark 텍스트 드래프터와 동일한 아키텍처를 공유하며, 이미지 패치와 텍스트 토큰을 통합된 표현으로 변환해 동일한 차원의 은닉 상태 벡터에서 작동한다. 4개 레이어와 블록 크기 9로 구성된 이 드래프터는 약 2억 8천만 개의 파라미터를 가지며, 기존 모델 대비 파라미터 증가율은 8.9%에 불과하다. 비전-언어 SFT 데이터로 10 에폭 학습을 거쳐 완성되었으며, 추론 시 하드웨어 사양에 따라 블록 크기를 8 또는 9로 설정하는 것을 권장한다. 현재 llama.cpp, MLX-VLM, SGLang을 즉시 지원하며, 일반 VQA, 차트 VQA, 복합 추론 등 6가지 비전 작업에서 성능 검증을 마쳤다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Accelerating vision-language models with LFM2.5-VL-DSpark
원문 보기 ↗