← promppy_ 실시간 AI 뉴스
참고X

MiniMax H3 멀티모달 활용: 12개 파일 참조 및 SGLang 구동 팁

최대 12개의 이미지·영상·오디오를 입력하는 'Ref2VA' 모델 및 SGLang 실행법 정리.

요약

중국 AI 연구소 MiniMax가 자사의 새로운 비디오 모델 H3의 오픈소스 가중치를 공개했다. H3는 비디오와 오디오 레이턴트를 하나의 33B 트랜스포머 모델에서 50개의 공유 레이어를 통해 동시에 노이즈 제거(denoising)하는 방식으로, 별도의 후처리 없이 완벽한 립싱크와 효과음을 생성한다. 사용자 본인의 사진, 비디오, 오디오 클립 등 최대 12개의 파일을 입력하면 이를 프롬프트 태그를 통해 참조하여 4~15초 분량의 영상을 제작할 수 있다. 생성된 영상은 24fps, 768p 또는 2K 해상도를 지원하며 11개 언어의 스테레오 오디오를 포함한다. 특히 기존에 LoRA 학습, 음성 복제, 편집 등 여러 단계가 필요했던 작업을 하나의 프롬프트로 처리할 수 있게 되어 실무적인 활용도가 높을 것으로 기대된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @undefinedKi: This should have existed in video models two years ago. A Chinese lab just open sourced it: you hand the model 12 of your own file

원문 보기 ↗
다음 뉴스 →

중요Cursor 클라우드 에이전트, 토큰 효율 20~30% 개선…컴퓨터 사용 시 80%↑

MCP·스킬·컴퓨터 사용 작업 비용이 크게 줄어, 예산 내에서 더 큰 작업 위임 가능.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스