Insider Insider
3dnchu 尚无浏览 2 分钟阅读

SpatialTrackerV2 – 能从单目视频中一口气获取相机运动、场景形状和像素运动的3D跟踪技术!

浙江大学 CAD&CG研究所、牛津大学、Ant Research(蚂蚁集团研究院)、Pixelwise AI、ByteDance Seed团队的联合研究团队发布了3D点跟踪新技术「SpatialTrackerV2」。这是一种能够将相机运动、场景形状以及各个像素的运动一并推断出来的划时代学习模型。

SpatialTrackerV2

SpatialTrackerV2 是一种用于3D点跟踪的新框架,可推断单目视频中任意2D像素在世界空间中的3D轨迹。与依赖离线深度和位姿估计的传统方法不同,我们的方法将3D运动分解为场景几何、相机自运动以及细粒度的点级运动,并通过完全可微分的端到端架构实现这一切。凭借这种统一设计,它能够对合成序列、带位姿的RGB-D视频以及无标注真实视频等多样数据源进行可扩展训练。通过联合学习几何与运动,SpatialTrackerV2 在2D跟踪和动态3D重建方面也取得了优异结果,同时明显超越了此前的3D跟踪方法,实现了大幅提升。

SpatialTrackerV2 是一款能够从单目(单摄像头)拍摄的视频中推断“像素级3D运动(轨迹)”的革新模型。以往的3D跟踪会将相机运动(自运动)、场景形状(几何)以及像素的细微运动(类似粒子的信息)分别推断,而 SpatialTrackerV2 可以通过 一个网络一次性处理 这些内容!

  • 从视频进行3D重建又快又准!
    一个序列10〜20秒即可处理完成。比传统方法快很多,精度也更高。
  • 可以按1个像素单位追踪3D运动!
    不只是对象跟踪,连背景和细节也能捕捉。
  • 全部采用端到端处理!
    无需复杂预处理,也不需要外部深度或位姿估计器。全自动且高质量。
  • 实验结果全面压制其他方法!
    性能明显优于现有所有3D跟踪方法。
  • 可用合成数据、RGB-D和实拍等多种数据进行训练!
    通用性高,对现实视频数据也很强。

这会让合成工作顺利很多!真希望能立刻实用化的技术。Github 上已公开代码,Hugging Face 上也可使用在线演示。请务必去看看!

链接

🚀 We release SpatialTrackerV2: the first feedforward model for dynamic 3D reconstruction and 3D point tracking — all at once!
Reconstruct dynamic scenes and predict pixel-wise 3D motion in seconds.
🔗 Webpage: https://t.co/B8widtJ6DT
🔍 Online Demo: https://t.co/sY9iO7wCgT pic.twitter.com/uSgatvHNGp

— Yuxi Xiao (@YuxiXiaohenry) July 8, 2025

SpatialTrackerV2: 3D Point Tracking Made Easy

Github

Demo

Screenshot of spatialtracker.github.io

Screenshot of github.com

Screenshot of huggingface.co