참고팁Reddit
Minimax H3 기반 고퀄리티 립싱크 영상 제작 워크플로우
최신 모델을 활용해 영상 일관성을 유지하며 립싱크를 구현하는 실무 구성 및 최적화 노하우.
요약
Reddit의 StableDiffusion 커뮤니티에서 화제가 된 Minimax H3 기반 립싱크 뮤직비디오 제작 워크플로우가 공개되었습니다. 해당 작업은 FL2VA와 REF2VA Lora를 결합하여 1.4MP 해상도와 20단계(STEPS) 설정으로 렌더링하며, 4B Qwen 텍스트 인코더와 sparse attention을 사용해 5090 GPU 기준 3~4시간이 소요됩니다. 1MP 해상도와 8단계(STEPS)의 터보 Lora를 활용할 경우 20~30분 내로 효율적인 결과물을 얻을 수 있습니다. 영상은 15초 분량의 14개 클립을 이어붙여 제작되었으며, 클립 간 의상 변형 문제는 의상 참조(clothing reference) 기능을 통해 보정할 수 있습니다. 작성자는 향후 고해상도 생성을 위해 클립 길이를 7초로 단축할 계획임을 밝혔습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Lipsync Music Video - Minimax H3 + Workflow
원문 보기 ↗