Meta, 멀티모달 모델 'Muse Spark 1.2' 공개…시각적 추론 및 로보틱스 성능 강화
시각적 데이터 기반의 코드 생성과 로봇 제어 기능이 개선됨. 멀티모달 에이전트 워크플로우를 구축하는 개발자라면 성능과 벤치마크 결과를 확인해 볼 가치가 있음.
요약
Meta는 멀티모달 작업을 지원하는 AI 모델 'Muse Spark 1.2'를 공개했다. Muse Spark 1.2는 시각 정보를 실행 가능한 코드로 변환하거나, 인지 데이터를 물리적 동작으로 연결하는 등 광범위한 멀티모달 기능을 제공한다. 또한, 실제 엔터프라이즈 환경의 영상 기반 워크플로우를 효율적으로 처리할 수 있도록 향상된 시청각 이해 능력을 갖췄다. Meta는 로봇이 비구조화된 환경에서 특정 사물을 찾아 이동하도록 안내하는 데모를 통해 해당 모델의 도구 호출 및 시각적 추론 능력을 입증했다. 이번 업데이트는 시각적 추론, 차트 이해, 지식 집약적 작업 등 다양한 영역에서의 성능 평가 결과를 포함하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @AIatMeta: Muse Spark 1.2 supports a broad range of multimodal tasks, from turning visuals into working code to translating perception into p
원문 보기 ↗