WorldSense 技术笔记

世界模型风口被放大了:技术辨析与冷思考

2026年8月18日 · 阅读约8分钟 · 世界模型, AI风口, 行业趋势, 具身智能

说说我的看法:世界模型不是风口叙事,它是一个真实存在的技术方向,但目前市面上大量讨论关注的是生成能力,而不是世界模型真正需要解决的环境预测、因果建模和规划问题。

先厘清一个概念:现在大家说的"世界模型"其实不是一回事

LeCun 提的世界模型(JEPA 架构)和李飞飞讲的世界空间(World Space),两者关注的问题重叠——都涉及表征学习和世界理解——但技术路线和侧重点不同。LeCun 想在抽象表征空间做预测,避开像素级生成的计算开销;李飞飞更偏 3D 场景理解和生成。而工业界现在做的,比如游戏领域的 Genie、Genie 2,更接近 action-conditioned interactive world model——你给它一个动作,它预测下一个环境状态——但其主要能力仍集中在视觉环境生成和短时动态预测上。

这些东西有价值,但它们解决的问题不一样。如果把"能生成下一帧画面"等同于"形成了稳定的、可迁移的、可用于规划的环境状态表示"——这里说的"理解"不是人类语义理解,而是这个意思——那这个风口确实被放大了。

真正的难点不在预测,在于稳定的环境表征

我自己跑 DreamerV3 的时候有一个很深的体会:RSSM(Recurrent State-Space Model)确实能学到一些动态规律——比如在 MuJoCo 的 cartpole 任务上,它可以在想象空间里预测杆子的摆动轨迹,训练出来的策略还能用。但如果仔细看它想象出来的状态,会发现稍微复杂一点的任务,预测就开始模糊、发散。

原因不复杂:RSSM 学习的是任务相关的隐状态动力学,而不是显式的 3D 物理世界模型。它在训练分布内表现不错,但不一定形成类似物理规律的显式表示,因此面对分布外情况时,可能无法像物理模型一样进行可靠外推。

这个差距,就是当前世界模型研究最核心的问题。

物理先验注入,是重要方向之一

如果目标是提升世界模型的稳定性和泛化能力,单纯靠加大数据量、堆 transformer 层数可能不够。把物理约束——比如能量守恒、碰撞检测、刚体动力学——作为先验注入到模型结构里,是一条值得探索的路径,让模型在学动态的时候不是从零开始猜,而是沿着物理上合理的路径去学。

在我的实验中,加入特定物理约束后,部分任务上的训练稳定性和长时间预测表现有所改善——比如不容易出现"杆子穿模"或者"物体突然消失"这种在纯数据驱动模型里常见的问题。当然,物理先验不是唯一路线,scaling、多模态预训练、对象级学习也各有各的空间。

对象级世界模型,另一个绕不开的方向

前面说的 RSSM、JEPA 更多是在整体 latent space 或像素空间做预测。但"理解物理世界"还有另一条路径:让模型从像素或 latent 转向实体、关系和状态变化的建模——也就是 object-centric representation。通过 slot attention、scene graph 这类方法,把场景分解为独立的对象和它们之间的交互关系,然后对每个对象的动力学分别建模。

这条路线的好处是泛化性更强——你见过桌子上的杯子被推,换到桌子上的碗被推,对象级模型更容易迁移。而整体 latent 模型可能需要重新学。

世界模型和 VLA 的关系,需要更准确地看

现在行业里很火的 VLA(Vision-Language-Action)路线,比如 RT-2、π0,当前主流 VLA 主要优化视觉语言到动作的映射,而显式环境预测和长期规划能力仍然是其薄弱环节。需要注意的是,这些模型内部的 transformer 确实有 latent prediction 和 action chunking 机制,并非完全没有规划能力,只是这种规划是隐式的、短视的。

世界模型解决的是另一个层面的问题:先预测"如果我做这个动作,环境状态会变成什么样",然后在这个想象空间里做规划,选最优的路径去执行。感知只是世界模型的输入之一,不是全部。

在需要长期规划和环境预测的任务中,世界模型可能成为 VLA 之外的重要基础模块。未来架构可能是 VLA+世界模型+规划器的分层结构,也可能是端到端 VLA 直接搞定——目前没有定论。

也要想想:世界模型可能不是最终答案

说完优势也得说风险。世界模型这条路线有几个根本性的挑战:学习完整物理世界的成本可能太高,长期预测天然困难(误差会累积),planner 未必需要精确的模拟器——一个"够用"的粗糙模型可能就够了。甚至有可能,直接策略学习在某些任务上比"先学世界模型再规划"更高效。

这些问题不意味着世界模型方向错了,但意味着它可能不是唯一的终点,更可能是智能体架构中的一个关键模块。

所以,风口还是关键节点?

我的判断:世界模型不是因为"能生成未来画面"而重要,而是因为它试图解决智能体在未知环境中的预测和规划问题。但当前大多数系统仍停留在任务相关的隐状态预测阶段,距离通用物理世界理解还有明显距离。

从隐状态预测到通用物理理解,中间还有因果推理、3D 表征、Sim-to-Real 迁移可靠性等很多问题没有解决。但这也恰恰说明这个方向值得投入。如果所有问题都解决了,那才说明没什么空间了。


← 跑 DreamerV3 该租云 GPU 还是自建工作站?一个工程师的成本账 从代码理解 RSSM(一):RSSM 在 DreamerV3 中的位置与 stochastic 状态 →

评论

W
侯晓琴

西北工业大学硕士,十余年自动化与 AI 工程经验。著有《Visual C++入门很容易》《C++程序设计经典300例》。目前聚焦世界模型与具身智能方向,记录从传统自动化到机器人 AI 的转型之路。