게임 개발 환경을 활용한 월드 모델 RL 학습 프레임워크 'RLHEV'
엔진의 물리 검증과 개발자의 피드백을 결합해 월드 모델의 성능을 높이는 새로운 데이터 학습 패러다임.
요약
현재 월드 모델 확장 전략은 크롤링된 영상 데이터에 의존하고 있어 비효율적이며, 강화학습(RL)을 위한 정밀한 보상 신호가 부족하다는 한계가 있다. 연구진은 게임 엔진이 충돌, 물리, 이동성 등 검증 가능한 환경을 제공하므로 공간 월드 모델 학습에 최적의 보상 엔진이 될 수 있다고 제안한다. 게임 개발 과정은 코드 에이전트 사례와 같이 실행 가능한 세계 명세이자, 개발자의 승인 여부를 통해 고품질의 보상 신호를 생성할 수 있다. 이에 따라 연구진은 게임 엔진의 밀도 높은 데이터와 인간의 암묵적 피드백을 결합한 새로운 학습 패러다임인 RLHEV(Reinforcement Learning with Human-Engine Verification)를 제시한다. 이 방법론은 기존 공간 생성 모델이 CLIP 점수 같은 모호한 지표에 의존하던 문제를 해결하고, 장기적인 궤적 데이터 확보를 가능하게 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models
원문 보기 ↗