VLA 모델 로봇 제어 성능 개선 'VLAct' 학습 프레임워크 공개
제한된 로봇 데이터로 VLM 사전학습 효율을 높이는 기법. 로봇 제어 모델 연구 시 적용 고려 가능.
요약
데이터 확장이 어려운 로봇 공학 분야의 한계를 극복하기 위해, 제한된 로봇 데이터를 효과적인 시각-행동 지식으로 변환하는 VLA 모델 백본인 VLAct가 공개되었습니다. VLAct는 VLM 사전 지식을 보존하면서 다중 로봇 형태 간의 공유 행동 의미론을 강화하고, 다중 헤드 연속 행동 공동 감독 및 교차 임베디드 행동 레이아웃을 통해 학습 효율을 높였습니다. LIBERO-Plus와 RoboTwin 2.0 벤치마크에서 각각 82.6%, 92.5%의 성공률을 기록하며 ABot-M0 및 LingBot-VLA 등 기존 산업용 VLA 시스템을 능가하는 성능을 입증했습니다. 특히 RoboCasa-GR1 환경에서는 데이터의 20%만 사용하고도 전체 데이터를 활용한 GR00T-N1.6 베이스라인보다 우수한 성과를 보였습니다. 본 연구는 16개의 GPU와 오픈소스 데이터만으로도 데이터 규모 확장을 넘어선 표현 중심의 사전 학습이 VLA 모델 발전에 핵심적인 축이 될 수 있음을 시사합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
원문 보기 ↗