大家好,我是AI算法工程师七月,曾在华为、阿里任职,技术栈广泛,爱好广泛,喜欢摄影、羽毛球。目前个人在烟台有一家企业星瀚科技。

  • 关注公众号:智启七月,获取最新观察、思考和文章推送。
  • 关注知乎:七月,获取最新观察、思考和文章推送。
  • 关注CSDN:智启七月,获取最新观察、思考和文章推送。
  • 网站1 :七月
  • 网站2:zerodesk

我会在这里分享关于 编程技术独立开发行业资讯思考感悟 等内容。爱好交友,想加群滴滴我,wx:swk15688532358,交流分享。

如果本文能给你提供启发或帮助,欢迎动动小手指,一键三连 (点赞评论转发),给我一些支持和鼓励,谢谢。

作者:七月
链接:https://mp.weixin.qq.com/s/Rb2QyaBigNVi8T7lamfnTg
来源:七月
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。
在这里插入图片描述

2025 年 10 月 16 日,“AI 教母” 李飞飞领衔的 World Labs 团队正式发布实时生成式世界模型 RTFM(Real-Time Frame Model),这款仅需单块 H100 GPU 即可运行模型。

RTFM 围绕 3 个关键原则设计:

  • **效率:**RTFM 仅使用单个 H100 GPU 以交互式帧速率运行推理。
  • 可扩展性:RTFM 旨在随着数据和计算的增加而扩展。它不依赖显式 3D 表示对 3D 世界进行建模,并使用从大规模视频数据中学习的通用端到端架构。
  • 坚持性:您可以永远与 RTFM 互动,世界永远不会被遗忘。它模拟了一个持久的 3D 世界,当您转过身来时,该世界不会消失。

技术原理:端到端学习与可学习渲染器

TFM采用了与传统计算机图形学截然不同的技术路径,将自身定位为一个“可学习的渲染器”(learned renderer)。 传统渲染流程依赖显式的3D模型(如三角网格、点云等)和复杂的物理渲染管线,而RTFM通过端到端的深度学习直接从海量视频数据中学习渲染规律。其核心架构是一个自回归扩散变换器(autoregressive diffusion transformer),经过在大规模视频数据集上的训练,掌握了从已有图像帧预测新视角图像的能力,整个过程无需人工构建任何显式3D几何模型。 简单来说,RTFM将复杂的物理渲染问题转化为了数据驱动的感知建模任务——通过学习真实世界的光照、材质和空间关系,直接“想象”出新视角下场景的样子。

基于生成式视频建模的最新进展,训练一个单一的神经网络。该网络仅需输入场景的一张或多张2D图像,便能从新的视角生成该场景的2D图像,而无需构建任何显式的3D世界表示。

在这里插入图片描述

效率

李飞飞团队设定了一个简单的目标:设计一个生成式世界模型,该模型足够高效,可以立即部署,并且可以通过更多的计算量继续扩展。目标是构建一个可以部署在单个 H100 GPU上的模型,保持交互式帧速率和世界,无论与它们交互多长时间,这些帧速率都会持续存在。
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

可扩展性:作为学习渲染器的世界模型

传统的 3D 图形管道使用显式 3D 表示(例如三角形网格、高斯碎片)对世界进行建模,然后渲染以生成 2D 图像。他们使用手工设计的数据结构和算法来对 3D 几何体、材质、照明、阴影、反射等进行建模。几十年来,这些方法一直是计算机图形学值得信赖的主力,但它们并不能轻易地扩展到更多的数据和计算。

RTFM 采取了不同的方法。它建立在生成视频建模的最新进展之上,训练一个神经网络,该神经网络输入场景的一个或多个 2D 图像,并从新的视角生成该场景的 2D 图像,而无需构建任何明确的世界 3D 表示。RTFM 被实现为对帧序列进行作的自回归扩散转换器,在大规模视频数据上进行端到端训练,以预测以前一帧为条件的下一帧。
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

RTFM 可以看作是一个学习的渲染器。它的输入帧被转换为隐式表示世界的神经网络激活(KV 缓存);在生成新帧时,网络从该表示中读取(通过注意力)以创建与输入视图一致的新世界视图。将输入视图转换为世界表示,然后从这些表示中呈现新帧的机制是从数据中端到端学习的,而不是手工设计的。RTFM 只需在训练过程中观察反射和阴影,即可学会对反射和阴影等复杂效果进行建模。

通过将 RTFM 与 Marble 相结合,我们可以从单个图像创建 3D 世界。 RTFM 可以渲染复杂的效果,例如从数据中端到端学习的光照和反射。

RTFM 模糊了重建(在现有视图之间插值)和生成(创建输入视图中不可见的新内容)之间的界限,这在历史上一直被视为计算机视觉中的单独问题。当 RTFM 提供许多输入视图时,它倾向于重建,因为任务受到更多限制;当提供较少的输入视图时,它被迫外推超出它们。

我们可以使用 RTFM 从短视频中渲染真实世界的场景。

持久性:将姿势帧作为空间记忆

现实世界的一个关键属性是持久性:当你移开视线时,世界不会消失或完全改变;而且无论您离开了多少时间,您都可以随时返回以前访问过的地点。

这对于自回归帧模型来说一直是一个挑战。世界仅通过 2D 图像帧隐式表示,因此持久性要求模型在用户探索世界时对一组不断增长的帧进行推理。这意味着每个新帧的生成成本都比前一个帧更高,因此模型对世界的内存实际上受到其计算预算的限制。
在这里插入图片描述
在这里插入图片描述

RTFM 通过将每个帧建模为在 3D 空间中具有姿势(位置和方向)来规避这个问题。我们通过查询模型和要生成的帧的姿势来生成新帧。因此,模型对世界的记忆(包含在其框架中)具有空间结构;它使用姿势帧作为空间记忆。这赋予了模型一个弱先验——它建模的世界是一个三维欧几里得空间——而不会强迫它显式预测该世界中物体的 3D 几何形状。

具有上下文杂耍功能的 RTFM 使其能够在大型场景中持久化几何体,同时保持高效

RTFM 的空间内存可实现无限持久性。在生成新帧时,我们从姿势帧的空间内存中检索附近的帧,以形成模型的自定义上下文。我们将这种技术称为上下文杂耍:模型在空间的不同区域生成时使用不同的上下文帧。这使得 RTFM 能够在长时间的交互中持久化大型世界,而无需对不断增长的帧集进行推理。

大家可以去下面地址体验该模型World Labs – RTFM

更多推荐