참고HF Blog
허깅페이스, 비전-언어 모델 'LFM2.5-VL-3B' 공개
엣지 환경에서 시각 및 텍스트 처리가 가능한 3B급 경량 모델. 비전 벤치마크에서 동급 모델 대비 높은 효율성 입증.
요약
LFM2.5-VL-3B는 이전 버전 대비 4배 늘어난 시각 데이터를 학습하고, SigLIP2 400M NaFlex 비전 인코더와 LFM2.5-2.6B 텍스트 모델을 결합해 시각-언어 능력을 향상했다. 비 라틴 문자를 지원하기 위해 토크나이저를 수정해 어휘집을 기존 대비 2배인 128K로 확장했다. 모델 학습은 지식 증류와 Antidoom 학습을 포함한 지도 미세 조정(SFT) 후, 다중 보상 강화 학습(RL)을 적용하는 2단계로 진행됐다. 이 모델은 다국어 시각 이해, 문서 및 차트 해석, UI 요소 인식 등 다양한 비전 벤치마크에서 동급 모델 대비 우수한 성능을 입증했다. 실제 이미지 작업과 디지털 콘텐츠 이해에 최적화되어 엣지 환경에서 효율적인 활용이 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
원문 보기 ↗