참고Reddit
VLX-Seek-1.5-10B 공개, 로봇 및 임베디드용 시각 인식 모델
10B 규모의 경량화된 오픈소스 시각 인식 모델로, 에지 디바이스 및 로보틱스 시각 인텔리전스 구현에 활용 가능.
요약
VLX-Seek-1.5-10B는 드론, 로봇, 감시 시스템 등 엣지 환경에서 정밀한 시각적 인지와 객체 위치 파악을 위해 설계된 10B 규모의 오픈소스 모델이다. 이 모델은 기존 VLM 방식과 달리 좌표를 직접 생성하는 대신, 시각 영역을 검색하고 참조하는 방식을 채택하여 보다 정확한 위치 파악을 지원한다. 후보 시각 영역을 주소화된 객체로 처리함으로써 모델이 객체를 선택, 비교 및 참조하며 추론하는 구조를 갖췄다. 결과적으로 특정 객체의 유무를 확실히 판단하고 존재하지 않는 객체를 잘못 지목하는 오류를 줄이는 데 최적화되어 있다. 해당 모델은 다양한 엣지 기반 시각 지능 애플리케이션에서 실무적인 활용도가 높을 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 omlab/VLX-Seek-1.5-10B · Hugging Face
원문 보기 ↗