영상 생성과 코딩 에이전트의 결합: 'Code World Model' 아키텍처 제안
비디오 모델이 물리적 상태를 직접 관리하기보다 코딩 에이전트가 상태를 제어하고 모델이 렌더링하는 효율적 아키텍처 모델.
요약
최근 픽셀 기반의 거대 영상 모델 대신 코딩 에이전트를 '월드 브레인'으로 활용하는 'Code World Model' 접근 방식이 주목받고 있다. 이 아키텍처는 코딩 에이전트가 추론, 실행 가능한 코드 작성, 상태 유지를 담당하고, 영상 모델은 오직 코드에 정의된 상태를 시각적으로 렌더링하는 역할만 수행하도록 역할을 분리한다. 이를 통해 영상 모델이 직접 모든 사물과 물리 법칙의 일관성을 유지해야 하는 부담을 줄이고, 화면 밖의 객체 이동이나 상태 변화 등도 코드를 통해 정밀하게 기억할 수 있다. 실제로 MiniMax-H3 모델을 파인튜닝하여 코딩 에이전트가 생성한 공간 제약 조건과 상태를 정확히 따르는 인터랙티브 월드 구현에 성공했다. 복잡한 추론과 렌더링을 통합하던 기존 방식과 달리, 코드(로직)와 비디오(렌더링)를 분리함으로써 세계 모델의 성능과 일관성을 효율적으로 개선한 사례다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @mark_k: This is a really interesting new approach to world models: Instead of expecting a video model to understand the entire world from
원문 보기 ↗