浙江大学 CAD&CG研究所、牛津大学、Ant Research(蚂蚁集团研究院)、Pixelwise AI、ByteDance Seed团队的联合研究团队发布了3D点跟踪新技术「SpatialTrackerV2」。这是一种能够将相机运动、场景形状以及各个像素的运动一并推断出来的划时代学习模型。
SpatialTrackerV2
SpatialTrackerV2 是一种用于3D点跟踪的新框架,可推断单目视频中任意2D像素在世界空间中的3D轨迹。与依赖离线深度和位姿估计的传统方法不同,我们的方法将3D运动分解为场景几何、相机自运动以及细粒度的点级运动,并通过完全可微分的端到端架构实现这一切。凭借这种统一设计,它能够对合成序列、带位姿的RGB-D视频以及无标注真实视频等多样数据源进行可扩展训练。通过联合学习几何与运动,SpatialTrackerV2 在2D跟踪和动态3D重建方面也取得了优异结果,同时明显超越了此前的3D跟踪方法,实现了大幅提升。
SpatialTrackerV2 是一款能够从单目(单摄像头)拍摄的视频中推断“像素级3D运动(轨迹)”的革新模型。以往的3D跟踪会将相机运动(自运动)、场景形状(几何)以及像素的细微运动(类似粒子的信息)分别推断,而 SpatialTrackerV2 可以通过 一个网络一次性处理 这些内容!
- 从视频进行3D重建又快又准!
一个序列10〜20秒即可处理完成。比传统方法快很多,精度也更高。 - 可以按1个像素单位追踪3D运动!
不只是对象跟踪,连背景和细节也能捕捉。 - 全部采用端到端处理!
无需复杂预处理,也不需要外部深度或位姿估计器。全自动且高质量。 - 实验结果全面压制其他方法!
性能明显优于现有所有3D跟踪方法。 - 可用合成数据、RGB-D和实拍等多种数据进行训练!
通用性高,对现实视频数据也很强。
这会让合成工作顺利很多!真希望能立刻实用化的技术。Github 上已公开代码,Hugging Face 上也可使用在线演示。请务必去看看!
链接
🚀 We release SpatialTrackerV2: the first feedforward model for dynamic 3D reconstruction and 3D point tracking — all at once!
Reconstruct dynamic scenes and predict pixel-wise 3D motion in seconds.
🔗 Webpage: https://t.co/B8widtJ6DT
🔍 Online Demo: https://t.co/sY9iO7wCgT pic.twitter.com/uSgatvHNGp— Yuxi Xiao (@YuxiXiaohenry) July 8, 2025
SpatialTrackerV2: 3D Point Tracking Made Easy
Github
Demo