Agent X-Ray
RuntimeNotesAbout
Notes/AI 前沿/大厂技术博客档案/第62章

D4RT:教 AI 以四维视角看世界

5 分钟 · 更新于 2026-09-01 · 原文

摘要 Google DeepMind 推出了 D4RT(Dynamic 4D Reconstruction and Tracking,动态四维重建与追踪),这是一个将动态场景重建统一到单一高效框架中的 AI 模型。D4RT 采用统一的编码器-解码器 Transformer 架构和灵活的查询机制,能够同时处理点追踪、点云重建和相机位姿估计等多项 4D 重建任务,速度比此前最先进的方法快 18 到 300 倍,可用于机器人、增强现实和世界模型等领域。

来源 原文链接:D4RT: Teaching AI to see the world in four dimensions 发布日期:2026年1月22日 | 作者:Guillaume Le Moing、Mehdi S. M. Sajjadi 原文存档:英文原文

D4RT:教 AI 以四维视角看世界

每当我们观察世界时,都在完成一项非凡的记忆与预测壮举。我们看到并理解事物在某一时刻的样子、一瞬前的样子,以及下一瞬将会变成的样子。我们的心智模型维持着对现实的持久表征,并利用该模型对过去、现在和未来之间的因果关系做出直觉判断。

为了帮助机器像我们一样看世界,我们可以为它们配备摄像头,但这只解决了输入问题。要理解这些输入,计算机必须解决一个复杂的逆问题:将视频(一系列扁平的二维投影)转换回丰富的、运动中的三维立体世界。

今天,我们推出了 D4RT(Dynamic 4D Reconstruction and Tracking,动态四维重建与追踪),一个将动态场景重建统一到单一高效框架中的全新 AI 模型,使我们更接近人工智能的下一个前沿——对动态现实的全面感知。

第四维度的挑战

为了理解二维视频中捕获的动态场景,AI 模型必须追踪每个物体的每个像素在三维空间和第四维度——时间——中的运动。此外,它还必须将物体运动与相机运动分离开来,即使物体相互遮挡或离开画面,也要维持连贯的表征。传统方法要从二维视频中捕获这种程度的几何和运动信息,需要计算密集型的处理过程,或者拼凑多个专用 AI 模型——有的负责深度,有的负责运动,还有的负责相机角度——导致 AI 重建既慢又零散。

D4RT 简化的架构和新颖的查询机制使其处于 4D 重建领域的前沿,同时比以往方法高效多达 300 倍——足以在机器人、增强现实等领域实现实时应用。

D4RT 的工作原理:基于查询的方法

D4RT 采用统一的编码器-解码器 Transformer 架构。编码器首先将输入视频处理为场景几何和运动的压缩表征。与旧系统为不同任务使用独立模块不同,D4RT 通过灵活的查询机制仅计算所需内容,而该机制围绕一个核心问题展开:

"视频中某个给定像素,在任意时刻、从选定相机视角观察时,位于三维空间中的什么位置?"

在先前工作的基础上,一个轻量级解码器查询该表征以回答上述问题的具体实例。由于查询彼此独立,可以在现代 AI 硬件上并行处理。这使得 D4RT 极其快速且可扩展,无论是追踪少数几个点还是重建整个场景。

D4RT 将一个构建视频全局丰富理解的强大编码器,与一个并行回答数千个查询的轻量级解码器相结合。通过提出具体问题——确定源像素在目标时间和相机视角下的位置——模型通过单一灵活接口高效解决追踪、深度估计和位姿估计等多种任务。

能力:快速、精准的 4D 理解

凭借这种灵活的设计,模型现在可以解决多种 4D 任务,包括:

点追踪:通过查询像素在不同时间步的位置,D4RT 可以预测其三维轨迹。重要的是,即使物体在视频的其他帧中不可见,模型也能做出预测。

点云重建:通过冻结时间和相机视角,D4RT 可以直接生成场景的完整三维结构,省去了单独的相机估计或逐视频迭代优化等额外步骤。

相机位姿估计:通过生成和对齐同一时刻从不同视角拍摄的三维快照,D4RT 可以轻松恢复相机的运动轨迹。

如底层技术报告所述,D4RT 在广泛的 4D 重建任务中超越了此前的方法。定性比较显示,其他方法在处理动态物体时往往困难重重——经常出现物体重复或完全无法重建的情况——而 D4RT 则保持了对运动世界的稳固、连续理解。

至关重要的是,D4RT 的精度并非以牺牲效率为代价。在测试中,它比此前最先进的方法快 18 到 300 倍。例如,D4RT 在单块 TPU 芯片上大约五秒钟即可处理一分钟的视频,而此前的方法需要长达十分钟——提速 120 倍。

在 MPI Sintel 基准测试中(包含具有快速运动模糊和非刚性形变的复杂合成场景),D4RT 展示了优于近期强基线的保真度。这凸显了该模型即使在物体或相机快速穿越场景时也能精确重建几何结构的能力。

使用 Aria Digital Twin 数据集的智能眼镜录像,D4RT 在 3D 点追踪中达到了顶级性能。这验证了该模型在真实家居环境中对复杂自运动和遮挡的稳健处理能力。

在 RE10k 数据集的多样室内外场景上评估相机位姿估计时,D4RT 取得了最高的 AUC 分数。该指标衡量估计位姿落入一系列严格精度阈值范围内的频率,展示了模型无需昂贵的测试时优化即可锁定稳定几何结构的能力。

下游应用

D4RT 证明了在 4D 重建中我们不需要在精度和效率之间做取舍。其灵活的、基于查询的系统可以实时捕获我们的动态世界,为下一代空间计算铺平道路。这包括:

机器人:机器人需要在充满移动人员和物体的动态环境中导航。D4RT 可以提供安全导航和灵巧操作所需的空间感知能力。

增强现实(AR):AR 眼镜要将数字物体叠加到真实世界上,需要对场景几何结构有即时、低延迟的理解。D4RT 的高效性有助于使设备端部署成为切实可行的现实。

世界模型:通过有效地分离相机运动、物体运动和静态几何结构,D4RT 使我们更接近拥有对物理现实的真正"世界模型"的 AI——这是通向 AGI 道路上的必要一步。

我们将继续探索该模型的能力及其在机器人、增强现实等领域的应用潜力。


  • 英文原文
  • 技术报告:arXiv:2512.08924
  • 项目网站:d4rt-paper.github.io

本章目录
第四维度的挑战D4RT 的工作原理:基于查询的方法能力:快速、精准的 4D 理解下游应用Related Documents
苏ICP备2025204887号-2