Minimax H3 기반 영상 생성 캐릭터 일관성 및 음성 복제 워크플로우
영상 생성 모델에서 캐릭터와 음성의 일관성을 유지하는 컴피유아이(ComfyUI(콤피UI)) 기반 실습 사례입니다.
요약
Reddit의 r/StableDiffusion 커뮤니티에서 기존의 .char 포맷을 활용하여 캐릭터의 얼굴, 의상, 신체를 일관되게 유지하면서 음성까지 복제할 수 있는 새로운 방식이 공개되었습니다. Minimax H3 모델과 ComfyUI 워크플로우를 결합한 이 기술은 사용자가 10~30초 분량의 mp3 또는 wav 음성 샘플을 제공하면 해당 음성을 복제하여 영상 생성 시 일관된 목소리와 립싱크를 구현합니다. 이번 업데이트로 기존의 캐릭터 일관성 유지 기능을 넘어 오디오까지 통합된 완성도 높은 영상 생성이 가능해졌습니다. 상세한 노드 설정과 프롬프트 구성 방법은 Reddit 원문 및 관련 링크를 통해 확인할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Omni .char(same face, cloths & body) now with consistent voice, just by dropping a few seconds sample audio: Minimax H3(ComfyUI Workflow)
원문 보기 ↗