참고Reddit
인터랙티브 월드 모델 'EVOKE 14B' 공개: 3단계 추론으로 지속 가능한 비디오 생성
CFG-free 방식의 autoregressive 모델로, 긴 호흡의 비디오 생성과 일관성 유지 성능을 보여줌.
요약
EVOKE 14B는 지속적이고 상호작용 가능한 월드 생성을 위해 설계된 3단계 CFG-free 자기회귀 월드 모델이다. 이 모델은 월드 상태를 생성 과정에서 분리하여 카메라 포즈를 통해 상태를 관리하며, 장기적인 상호작용이 가능한 티처 모델을 활용해 긴 세션 동안 일관성을 유지한다. EVOKE 14B는 384 × 640 해상도와 24 fps의 비디오를 생성할 수 있으며, 30초 이상의 롤아웃에서도 일관성을 유지하는 능력을 갖췄다. H200 GPU 1대 환경에서 단계당 한 번의 순전파 연산으로 2.11초마다 1.5초 분량의 비디오를 생성하는 효율성을 보인다. 현재 GitHub를 통해 모델 가중치, 코드, 문서 및 데모가 공개되어 실무자가 즉시 활용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 EVOKE 14B - a 3-step, CFG-free interactive world model
원문 보기 ↗