비디오 생성 속도 향상 기술 'Video DeltaNet' 공개
MiniMax H3 기반 하이브리드 어텐션 구조. 비디오 생성 모델의 추론 속도와 품질을 동시에 최적화하는 라이브러리.
요약
MiniMax H3 모델 기반의 하이브리드 어텐션 구조인 VDN-Minimax-H3(VDN-H3)가 공개되었습니다. VDN-H3는 8개의 B200 GPU 환경에서 8번의 노이즈 제거 단계를 통해 14.4초 분량의 영상을 11.23초 만에 생성하며 실시간보다 빠른 추론 속도를 보여줍니다. 이 모델은 효율적인 프레임별 선형 어텐션 브랜치와 시각적 품질을 유지하는 소프트맥스 브랜치를 결합한 하이브리드 구조를 채택했습니다. 또한, 백본 가중치 수정 없이도 추론 시 결합 가능한 두 개의 LoRA 어댑터와 선형 어텐션 브랜치를 활용하는 플러그 앤 플레이(Plug-and-Play) 방식을 지원합니다. 현재 가중치뿐만 아니라 최적화된 추론 스택과 학습 코드까지 포함된 전체 소스 코드가 오픈소스로 제공됩니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Video DeltaNet: Hybrid Attention to Speed Up Video Models with Near-Lossless Quality
원문 보기 ↗