멀티모달 에이전트의 도시 내 공간 탐색 능력 평가 샌드박스 'UrbanGround' 공개
에이전트의 공간 지능과 실세계 환경에서의 내비게이션 성능을 정량적으로 분석할 수 있는 연구 프로젝트입니다.
요약
Multimodal Large Language Models(MLLM)의 도시 내 이동 및 공간적 상호작용 능력을 평가하기 위한 새로운 샌드박스 플랫폼 'UrbanGround'가 공개되었다. 홍콩의 3D 지리 공간 데이터를 기반으로 구축된 UrbanGround는 에이전트가 1인칭 시점으로 복잡한 도시를 탐색하고 상호작용할 수 있는 환경을 제공한다. 연구진은 로컬 장면 인식, 목적지까지의 장거리 내비게이션, 보행자 이동 상황에서의 경로 선택 등 세 가지 핵심 지표를 통해 MLLM의 성능을 분석했다. 분석 결과, 현재의 MLLM 에이전트는 시각 인식이나 단거리 공간 추론 능력은 갖췄으나, 장거리 탐색 시에는 오류가 누적되며 목적 지향적 행동을 지속하는 데 한계를 보였다. 이번 연구는 MLLM이 실제 도시 환경에서 신뢰할 수 있는 자율적인 이동 및 공간적 판단 능력을 갖추기 위해 해결해야 할 기술적 과제들을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
원문 보기 ↗