중요AI타임스
알리바바, 보고 듣고 행동하는 옴니모달 'Qwen3.8-Omni-Flash' 공개
오디오·비디오 입력에 함수 호출·웹 검색까지. 멀티모달 에이전트 구축 시 검토 가치.
요약
알리바바가 18일(현지시간) 텍스트와 이미지뿐만 아니라 오디오와 비디오를 처리하고 실시간 작업 실행이 가능한 옴니모달 모델 'Qwen3.8-Omni-Flash'를 공개했다. 이 모델은 최대 100만 토큰의 컨텍스트를 지원하며 콘텐츠 인식 능력을 넘어 사용자의 지시에 따라 도구를 호출하거나 웹 검색을 수행할 수 있다. 또한 함수 호출, 구조화된 출력, 컨텍스트 캐싱, 배치 호출 등 실무적인 작업 자동화 기능을 갖췄다. 알리바바는 이번 모델을 통해 단순 정보 처리를 넘어 사용자의 의도를 파악하고 직접 작업을 수행하는 에이전트형 AI 기술을 강화할 계획이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 알리바바, 보고 듣고 행동하는 옴니모달 '큐원3.8-옴니-플래시' 공개
원문 보기 ↗