알리바바, 에이전트 특화 옴니모달 모델 'Qwen3.8-Omni-Flash' 공개
오디오·비디오 통합 추론과 100만 토큰 컨텍스트. 영상 자동편집·요약 에이전트 개발 시 검토 가치.
요약
알리바바가 에이전트 기능을 중심으로 설계된 첫 옴니모달 모델 Qwen3.8-Omni-Flash를 공개했다. 이 모델은 오디오와 비디오를 동시에 이해하고 추론하며, 도구를 활용해 브이로그 편집, 영상 번역, 영화 요약 등 복잡한 워크플로우를 자동 수행할 수 있다. 에이전트 성능 지표인 WildClawBench-MM과 UniClawBench에서 Qwen3.5-Omni-Plus 대비 평균 19.5점 향상되었으며, Gemini 3.8 Flash와 대등한 수준의 오디오-비디오 능력을 갖췄다. 1M 토큰 컨텍스트를 지원하며 OmniVideoBench 기준 기존 방식 대비 51.8% 적은 토큰으로 핵심 순간을 탐색한다. 또한 Qwen3.5-Omni-Plus 대비 영상 입력 비용을 약 89% 절감해 효율성을 높였으며, 개발자를 위한 Qwen-MM-Plugins와 Qwen-Live Harness도 오픈소스로 제공한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Alibaba_Qwen: 🚀 Meet Qwen3.8-Omni-Flash, Qwen's first omni-modal model built around agentic capabilities! Native audio-video understanding, rea
원문 보기 ↗