MiniMax H3 오픈 웨이트 공개…텍스트·이미지·영상 통합 멀티모달 모델
강력한 성능의 오픈소스 멀티모달 모델 H3가 공개됨. 영상 생성 및 명령 이행 능력이 뛰어나 도입 및 테스트 고려 가치 있음.
요약
Hailuo AI가 범용 옴니모달 생성 모델인 MiniMax H3의 모델 가중치를 Hugging Face에 공개했다. 33B 파라미터 규모의 이 모델은 Qwen3-VL-32B를 기반으로 하며 텍스트, 이미지, 비디오, 오디오를 통합적으로 처리한다. 특히 최대 15초 분량의 2K 영상과 네이티브 스테레오 오디오를 생성할 수 있으며, 기존 주류 모델 대비 3분의 1 미만의 비용으로 서비스된다. 지시 이행 능력과 텍스트·브랜드 렌더링, 비디오 투 비디오 모션 전송 기능이 우수해 광고, 이커머스, 게임 등 다양한 산업에 활용 가능하다. 개발자는 FL2VA와 Ref2VA 체크포인트를 사용할 수 있으며 Diffusers, SGLang, vLLM 및 ComfyUI를 통한 로컬 추론을 지원한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @mark_k: MiniMax H3 is now open on Hugging Face! 🔥 @Hailuo_AI released the weights for H3, their general-purpose omni-modal generative mod
원문 보기 ↗