장기 비디오 스트리밍 3D 재구성 모델 'ABot-Recon' 공개
짧은 컨텍스트만으로 장기 영상의 3D 재구성이 가능해져, 에이전트의 시각적 공간 추론 효율을 높일 수 있음.
요약
ABot-Recon은 긴 비디오의 실시간 3D 재구성을 위해 메모리와 연산 비용을 제한하면서도 장기적인 안정성을 확보하는 새로운 스트리밍 모델이다. 기존 모델들이 장기 메모리를 사용하는 것과 달리, ABot-Recon은 이전 11개 프레임의 KV 특징만을 활용하는 로컬 컨텍스트 전략을 채택했다. 이 모델은 현재 카메라 좌표계 내에서 포인트 맵과 인접 프레임 간의 상대적 포즈를 예측하며, 순차적 합성을 통해 전역 포즈와 지오메트리를 복원한다. 또한 경량 시간적 리파이너(temporal refiner)를 통해 시각 및 모션 컨텍스트 기반으로 상대적 회전을 개선하고, 합성 인식 포즈 손실 함수를 적용해 누적 오차를 줄였다. Oxford Spires 벤치마크 테스트 결과, ABot-Recon은 ATE 4.35m와 RPE-R 0.12도를 기록하여 기존 최고 성능 대비 오차를 약 40% 개선하는 성과를 보였다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
원문 보기 ↗