<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>世界模型 on WorldSense 技术笔记</title><link>https://www.worldsensetech.com/zh/tags/%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/</link><description>Recent content in 世界模型 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.worldsensetech.com/zh/tags/%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B/index.xml" rel="self" type="application/rss+xml"/><item><title>机器人世界模型到底在做什么？从感知到行动的完整链路</title><link>https://www.worldsensetech.com/zh/articles/2026-08-26-world-model-in-robotics/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-26-world-model-in-robotics/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Dreamer 系列 · 第 2 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-25-dreamer-explained/"&gt;上一篇&lt;/a&gt;从架构层面拆解了 Dreamer 的整体设计。这篇把视角拉远一步：世界模型在整个机器人系统中到底处于什么位置？从传感器数据到最终执行动作，中间经历了哪些环节？本文不讨论如何训练一个通用机器人世界模型，而讨论它在机器人系统中的功能位置。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="一一个根本区别机器人世界模型和语言模型完全不同"&gt;一、一个根本区别：机器人世界模型和语言模型完全不同&lt;/h2&gt;
&lt;p&gt;过去几年，&amp;ldquo;模型&amp;quot;这个词在 AI 领域被反复使用。语言模型预测下一个 token，视觉模型预测下一帧图像，自动驾驶模型预测交通参与者的行为。它们都在做某种&amp;quot;预测&amp;rdquo;，但预测的对象和约束条件差异很大。&lt;/p&gt;
&lt;p&gt;机器人世界模型面对的问题有一个根本不同：&lt;strong&gt;它需要学习 action-conditioned future dynamics&lt;/strong&gt;——给定当前观察和行动，预测未来可能出现的状态、观测以及任务相关结果。注意这里用&amp;quot;观测&amp;quot;而不是&amp;quot;状态&amp;quot;，因为不同类型的世界模型预测的对象不同：Dreamer RSSM 在 latent space 中预测（latent → latent），video world model 在像素空间预测（action + video → future video），&amp;ldquo;state&amp;quot;并不是统一接口。&lt;/p&gt;
&lt;p&gt;想象一个场景：桌上的机械臂要推开一个杯子。在真正执行之前，它需要预测：手接触杯子后，杯子会往哪个方向滑？如果杯子太重推不动怎么办？如果桌面很滑，杯子会不会飞出去？&lt;/p&gt;
&lt;p&gt;这种预测不是从语言中学到的&amp;quot;杯子通常放在桌上&amp;quot;这种语义知识，而是&amp;quot;手以某个角度接触杯子、施加某个力，杯子会沿桌面滑动大约 10cm&amp;quot;这种与行动相关的未来预测。&lt;/p&gt;
&lt;p&gt;我觉得这是理解机器人世界模型最重要的出发点。语言模型通过海量文本学会了语言结构，视觉模型通过海量图像学会了视觉规律，而机器人世界模型需要通过交互经验学会行动与后果之间的关系。&lt;/p&gt;
&lt;p&gt;但这里有一个很重要的区分：世界模型并不需要显式恢复完整的物理规律。它可能只需要在 latent space 中预测：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;latent_t + action
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;latent_{t+1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;未来任务相关结果
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而不需要真的知道：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;摩擦系数 = 0.31
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;质量 = 247g
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;接触力 = 1.8N
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;&lt;strong&gt;世界模型不是为了&amp;quot;还原世界&amp;rdquo;，而是为了预测行动相关的未来。&lt;/strong&gt; 这条主线会贯穿整篇文章。&lt;/p&gt;
&lt;h2 id="二机器人世界模型到底在预测什么"&gt;二、机器人世界模型到底在预测什么？&lt;/h2&gt;
&lt;p&gt;用一句话概括：世界模型学习的是&amp;quot;如果执行某个动作，决策相关的状态会怎么变化&amp;quot;。&lt;/p&gt;
&lt;p&gt;技术上说，世界模型学习状态转移动态（state transition dynamics），并通常额外学习 reward、continuation 等任务相关预测头：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;WorldModel:
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; dynamics: (s_t, a_t) → s_{t+1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; heads: s_{t+1} → r_t, γ_t, ...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;实际实现中，世界模型通常不是直接预测完整的原始状态，而是在隐空间中预测 latent dynamics。&lt;/p&gt;</description></item><item><title>读懂 Dreamer：世界模型是怎么学会'想象'的？</title><link>https://www.worldsensetech.com/zh/articles/2026-08-25-dreamer-explained/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-25-dreamer-explained/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Dreamer 系列 · 第 1 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;本篇从架构层面讲清楚 Dreamer 的整体设计。如果你已经读过 &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;RSSM 代码解析系列&lt;/a&gt;，这篇可以帮你把零散的代码细节串成完整的架构理解。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Dreamer 最重要的思想，不是&amp;quot;训练一个会生成未来画面的模型&amp;quot;，而是&lt;strong&gt;训练一个足够支持决策的 latent world model，然后让策略在这个内部世界里学习&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这篇文章围绕这条主线，把 Dreamer 的设计逻辑从头到尾讲一遍。&lt;/p&gt;
&lt;h2 id="一dreamer-到底在解决什么问题"&gt;一、Dreamer 到底在解决什么问题？&lt;/h2&gt;
&lt;p&gt;强化学习的核心循环是：智能体与环境交互 → 获得奖励 → 改进策略。这个循环的问题在于，每一步交互都需要真实的环境计算——对于机器人控制这类复杂任务，这意味着大量的仿真时间甚至真实机器人时间。&lt;/p&gt;
&lt;p&gt;Dreamer 的思路是：与其在真实环境中反复试错，不如先&lt;strong&gt;学一个世界模型&lt;/strong&gt;，然后在模型的&amp;quot;想象&amp;quot;中训练策略。&lt;/p&gt;
&lt;p&gt;这听起来简单，但要做到需要解决几个关键问题：世界模型怎么表征环境状态？怎么从想象中学出有用的策略？怎么避免想象误差把策略带偏？&lt;/p&gt;
&lt;p&gt;从 V1 到 V3，Dreamer 的演进可以粗略理解成三个方向：更好的 latent representation、更稳定的 imagination learning，以及更强的跨任务泛化能力。&lt;/p&gt;
&lt;h2 id="二dreamer-为什么主要在-latent-space-中预测"&gt;二、Dreamer 为什么主要在 latent space 中预测？&lt;/h2&gt;
&lt;p&gt;在讲架构之前，先建立一个最重要的直觉。&lt;/p&gt;
&lt;p&gt;Dreamer 并不是完全不预测 observation，而是&lt;strong&gt;不需要把未来像素级视频作为策略学习的主要载体&lt;/strong&gt;。Dreamer 的关键是在 latent space 中学习对预测和决策有用的 dynamics。&lt;/p&gt;
&lt;p&gt;假设机器人当前看到一张 1024×1024 的 RGB 图像。如果世界模型每一步都必须精确预测下一帧的每一个像素，大量计算都会浪费在与决策无关的视觉细节上。Dreamer 的做法是先把观测压缩成 latent state，再在 latent space 中预测未来。只要 latent representation 保留了与预测和决策相关的信息，就不必要求世界模型精确重建未来画面的每一个像素。&lt;/p&gt;
&lt;p&gt;换句话说，&lt;strong&gt;Dreamer 不是预测世界&amp;quot;长什么样&amp;quot;，而是预测决策需要知道的世界状态。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这是理解后续所有设计的核心出发点。&lt;/p&gt;
&lt;h2 id="三全局架构图"&gt;三、全局架构图&lt;/h2&gt;
&lt;p&gt;Dreamer 的训练可以理解成两个循环：**Observe（观察）**负责从真实环境数据学习世界模型；**Imagine（想象）**负责在 latent space 中生成未来轨迹，并利用这些轨迹训练策略。&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（六）：默认配置、四条公式与代码↔数学↔语义对照</title><link>https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 6 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 6 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;
&lt;strong&gt;6. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="二十五默认配置拆成rssm-架构与world-model-训练两张表"&gt;二十五、默认配置：拆成&amp;quot;RSSM 架构&amp;quot;与&amp;quot;World-model 训练&amp;quot;两张表&lt;/h2&gt;
&lt;p&gt;为了避免把&amp;quot;RSSM 架构参数&amp;quot;和&amp;quot;world-model / agent 训练配置&amp;quot;混在一起，下面把配置拆成两张表。&lt;/p&gt;
&lt;h3 id="rssm-architecturerssm-架构"&gt;RSSM architecture（RSSM 架构）&lt;/h3&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;参数&lt;/th&gt;
					&lt;th style="text-align: right"&gt;默认值&lt;/th&gt;
					&lt;th style="text-align: left"&gt;含义&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;deter&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;8192&lt;/td&gt;
					&lt;td style="text-align: left"&gt;deterministic state 维度（会被 blocks 切分）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;stoch&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;32&lt;/td&gt;
					&lt;td style="text-align: left"&gt;categorical variable 数量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;classes&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;64&lt;/td&gt;
					&lt;td style="text-align: left"&gt;每个 categorical variable 的类别数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;blocks&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;8&lt;/td&gt;
					&lt;td style="text-align: left"&gt;Block GRU 分组数量（8192 / 8 = 1024）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;hidden&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1024&lt;/td&gt;
					&lt;td style="text-align: left"&gt;RSSM 内部 MLP hidden dimension&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;imglayers&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;2&lt;/td&gt;
					&lt;td style="text-align: left"&gt;prior 网络层数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;obslayers&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1&lt;/td&gt;
					&lt;td style="text-align: left"&gt;posterior 网络层数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;dynlayers&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1&lt;/td&gt;
					&lt;td style="text-align: left"&gt;dynamics 网络层数&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="rssm--world-model-trainingrssm-与世界模型训练配置"&gt;RSSM / world-model training（RSSM 与世界模型训练配置）&lt;/h3&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;参数&lt;/th&gt;
					&lt;th style="text-align: right"&gt;默认值&lt;/th&gt;
					&lt;th style="text-align: left"&gt;含义&lt;/th&gt;
					&lt;th style="text-align: left"&gt;归属&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;unimix&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;0.01&lt;/td&gt;
					&lt;td style="text-align: left"&gt;categorical distribution 的均匀混合比例&lt;/td&gt;
					&lt;td style="text-align: left"&gt;RSSM 内部分布&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;free_nats&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1.0&lt;/td&gt;
					&lt;td style="text-align: left"&gt;KL 的 loss floor（&lt;code&gt;max(KL, 1)&lt;/code&gt;）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;RSSM 内部&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;dyn_scale&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1.0&lt;/td&gt;
					&lt;td style="text-align: left"&gt;dynamics KL 在最终 loss 中的权重&lt;/td&gt;
					&lt;td style="text-align: left"&gt;agent loss scale&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;rep_scale&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;0.1&lt;/td&gt;
					&lt;td style="text-align: left"&gt;representation KL 在最终 loss 中的权重&lt;/td&gt;
					&lt;td style="text-align: left"&gt;agent loss scale&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;imag_length&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;15&lt;/td&gt;
					&lt;td style="text-align: left"&gt;imagination rollout 的训练步数&lt;/td&gt;
					&lt;td style="text-align: left"&gt;agent 训练配置（非 RSSM 结构）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;关键点：&lt;/strong&gt;&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（五）：Imagine、Observe/Imagine 区别、序列训练与 Reset</title><link>https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 5 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 5 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;
&lt;strong&gt;5. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="二十imagine-阶段没有-observationrssm-怎么跑"&gt;二十、Imagine 阶段：没有 observation，RSSM 怎么跑？&lt;/h2&gt;
&lt;p&gt;这是 RSSM 最漂亮的地方。&lt;/p&gt;
&lt;p&gt;训练真实轨迹时需要 observation 来计算 &lt;code&gt;q(z_t|h_t,o_t)&lt;/code&gt;。但 imagination 阶段没有真实 observation。&lt;/p&gt;
&lt;p&gt;直接使用 &lt;code&gt;p(z_t|h_t)&lt;/code&gt;，也就是 prior：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;z_t ~ p(z_t | h_t)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;源码中的 &lt;code&gt;imagine()&lt;/code&gt; 内部同样先走 &lt;code&gt;_core()&lt;/code&gt;，再用 prior 产生 latent：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;deter &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; &lt;span style="font-style:italic"&gt;self&lt;/span&gt;&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;_core(
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; carry[&lt;span style="color:#f1fa8c"&gt;&amp;#39;deter&amp;#39;&lt;/span&gt;],
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; carry[&lt;span style="color:#f1fa8c"&gt;&amp;#39;stoch&amp;#39;&lt;/span&gt;],
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; actemb
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;logit &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; &lt;span style="font-style:italic"&gt;self&lt;/span&gt;&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;_prior(deter)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; &lt;span style="font-style:italic"&gt;self&lt;/span&gt;&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;_dist(logit)&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;sample(&lt;span style="color:#ff79c6"&gt;...&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;注意：&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（四）：KL balancing、Free Nats 与最终 KL 组合</title><link>https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 4 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 4 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;
&lt;strong&gt;4. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="十四observe-阶段完整数据流observe--imagine-同一框架"&gt;十四、Observe 阶段完整数据流（Observe / Imagine 同一框架）&lt;/h2&gt;
&lt;p&gt;到这里，可以把整个 RSSM 的状态转移框架画出来，并且把 &lt;strong&gt;Observe 与 Imagine 放在同一个 &lt;code&gt;_core()&lt;/code&gt; 转移框架里&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ┌──────────────────────────┐
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ RSSM transition │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;(h_{t-1},z_{t-1}) + a_{t-1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; _core()
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; h_t
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ┌──────┴──────┐
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼ ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; Prior Observation
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; p(z_t | h_t) │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ Posterior
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ q(z_t|h_t,o_t)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ z_t
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; └───────┬─────┘
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; latent state
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; next step
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;在旁边注明两种用法，其实这就是全文最重要的两句话：&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（三）：确定性转移 _core()、deter=8192 与 Block GRU</title><link>https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/</link><pubDate>Fri, 21 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 3 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 3 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;
&lt;strong&gt;3. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="九真正的-deterministic-transition_core"&gt;九、真正的 deterministic transition：&lt;code&gt;_core()&lt;/code&gt;&lt;/h2&gt;
&lt;p&gt;这是整个 &lt;code&gt;rssm.py&lt;/code&gt; 中最值得读的部分。&lt;/p&gt;
&lt;p&gt;源码并不是简单调用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;nn&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;GRUCell(&lt;span style="color:#ff79c6"&gt;...&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而是自己构造了一个 block-wise GRU。&lt;/p&gt;
&lt;p&gt;核心输入包括：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;deter
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;首先：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; stoch&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;reshape((stoch&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;shape[&lt;span style="color:#bd93f9"&gt;0&lt;/span&gt;], &lt;span style="color:#ff79c6"&gt;-&lt;/span&gt;&lt;span style="color:#bd93f9"&gt;1&lt;/span&gt;))
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;也就是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;[B, 32, 64]
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;[B, 2048]
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后把 &lt;code&gt;deter&lt;/code&gt;、&lt;code&gt;stoch&lt;/code&gt;、&lt;code&gt;action&lt;/code&gt; 各自通过一个输入映射（注意：这里的&amp;quot;分别 Linear 映射再 concat&amp;quot;是概念示意图，&lt;strong&gt;真正的核心在于 BlockLinear 的结构化参数化&lt;/strong&gt;，见下一节）：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;deter ──► Linear ──┐
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch ──► Linear ──┼──► concat ──► Block GRU
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;action ─► Linear ──┘
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;注意：&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（二）：先验/后验、straight-through 采样与 unimix</title><link>https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 2 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 2 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;
&lt;strong&gt;2. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="四把源码翻译成数学公式注意时间索引"&gt;四、把源码翻译成数学公式（注意时间索引）&lt;/h2&gt;
&lt;p&gt;DreamerV3 的递推关系可以写成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;h_t = f(h_{t-1}, z_{t-1}, a_{t-1})
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后分别计算：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;p(z_t | h_t) [prior，不读 observation]
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;q(z_t | h_t, o_t) [posterior，读 observation]
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;p&lt;/code&gt;：prior；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;q&lt;/code&gt;：posterior；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;o_t&lt;/code&gt;：当前 observation；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;h_t&lt;/code&gt;：deterministic state。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;一个非常重要、但初学者很容易卡住的时间索引说明：&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;code&gt;h_t = f(h_{t-1}, z_{t-1}, a_{t-1})&lt;/code&gt; 中的 &lt;code&gt;h_t&lt;/code&gt; 已经融合了截至 &lt;code&gt;t-1&lt;/code&gt; 的 latent / action 历史，但&lt;strong&gt;它并不包含当前 &lt;code&gt;o_t&lt;/code&gt;&lt;/strong&gt;。当前 observation 只在 &lt;strong&gt;posterior 分支&lt;/strong&gt;中用于推断 &lt;code&gt;z_t&lt;/code&gt;，而不进入 deterministic transition。&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（一）：RSSM 在 DreamerV3 中的位置与 stochastic 状态</title><link>https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 1 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 1 篇，已加粗；上/下一篇见文末导航）：
&lt;strong&gt;1. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/strong&gt;
2. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;
3. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;
4. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;
5. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;
6. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;源码阅读提示&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;本文有意不从&amp;quot;标准 RSSM 伪代码&amp;quot;开始，而是按照 &lt;code&gt;rssm.py&lt;/code&gt; 的实际执行路径展开。阅读时可以重点关注下面几个函数：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;observe() → sequence-level wrapper，沿时间维调用 _observe()
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;_observe() → 单个时间步的状态推断（真实轨迹）
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;_core() → 单个时间步的 deterministic dynamics
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;imagine() → 无 observation 的 latent rollout
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里最容易混淆的一点是：&lt;strong&gt;&lt;code&gt;observe()&lt;/code&gt; 并不是一个&amp;quot;处理单步 transition&amp;quot;的函数&lt;/strong&gt;。它只是 sequence-level 的封装，内部通过 Ninjax 的 &lt;code&gt;nj.scan(...)&lt;/code&gt; 沿着时间维度反复调用 &lt;code&gt;_observe()&lt;/code&gt;；真正处理单个时间步的是 &lt;code&gt;_observe()&lt;/code&gt; 与 &lt;code&gt;_core()&lt;/code&gt;。把 &lt;code&gt;observe() / _observe() / _core() / imagine()&lt;/code&gt; 这一层调用关系理清，基本就能理解 DreamerV3 RSSM 的主体。&lt;/p&gt;</description></item><item><title>世界模型风口被放大了：技术辨析与冷思考</title><link>https://www.worldsensetech.com/zh/articles/2026-08-18-world-model-ai-trend/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-18-world-model-ai-trend/</guid><description>&lt;!-- raw HTML omitted --&gt;
&lt;p&gt;说说我的看法：世界模型不是风口叙事，它是一个真实存在的技术方向，但目前市面上大量讨论关注的是生成能力，而不是世界模型真正需要解决的环境预测、因果建模和规划问题。&lt;/p&gt;
&lt;h2 id="先厘清一个概念现在大家说的世界模型其实不是一回事"&gt;先厘清一个概念：现在大家说的&amp;quot;世界模型&amp;quot;其实不是一回事&lt;/h2&gt;
&lt;p&gt;LeCun 提的世界模型（JEPA 架构）和李飞飞讲的世界空间（World Space），两者关注的问题重叠——都涉及表征学习和世界理解——但技术路线和侧重点不同。LeCun 想在抽象表征空间做预测，避开像素级生成的计算开销；李飞飞更偏 3D 场景理解和生成。而工业界现在做的，比如游戏领域的 Genie、Genie 2，更接近 action-conditioned interactive world model——你给它一个动作，它预测下一个环境状态——但其主要能力仍集中在视觉环境生成和短时动态预测上。&lt;/p&gt;
&lt;p&gt;这些东西有价值，但它们解决的问题不一样。如果把&amp;quot;能生成下一帧画面&amp;quot;等同于&amp;quot;形成了稳定的、可迁移的、可用于规划的环境状态表示&amp;quot;——这里说的&amp;quot;理解&amp;quot;不是人类语义理解，而是这个意思——那这个风口确实被放大了。&lt;/p&gt;
&lt;h2 id="真正的难点不在预测在于稳定的环境表征"&gt;真正的难点不在预测，在于稳定的环境表征&lt;/h2&gt;
&lt;p&gt;我自己跑 DreamerV3 的时候有一个很深的体会：RSSM（Recurrent State-Space Model）确实能学到一些动态规律——比如在 MuJoCo 的 cartpole 任务上，它可以在想象空间里预测杆子的摆动轨迹，训练出来的策略还能用。但如果仔细看它想象出来的状态，会发现稍微复杂一点的任务，预测就开始模糊、发散。&lt;/p&gt;
&lt;p&gt;原因不复杂：RSSM 学习的是任务相关的隐状态动力学，而不是显式的 3D 物理世界模型。它在训练分布内表现不错，但不一定形成类似物理规律的显式表示，因此面对分布外情况时，可能无法像物理模型一样进行可靠外推。&lt;/p&gt;
&lt;p&gt;这个差距，就是当前世界模型研究最核心的问题。&lt;/p&gt;
&lt;h2 id="物理先验注入是重要方向之一"&gt;物理先验注入，是重要方向之一&lt;/h2&gt;
&lt;p&gt;如果目标是提升世界模型的稳定性和泛化能力，单纯靠加大数据量、堆 transformer 层数可能不够。把物理约束——比如能量守恒、碰撞检测、刚体动力学——作为先验注入到模型结构里，是一条值得探索的路径，让模型在学动态的时候不是从零开始猜，而是沿着物理上合理的路径去学。&lt;/p&gt;
&lt;p&gt;在我的实验中，加入特定物理约束后，部分任务上的训练稳定性和长时间预测表现有所改善——比如不容易出现&amp;quot;杆子穿模&amp;quot;或者&amp;quot;物体突然消失&amp;quot;这种在纯数据驱动模型里常见的问题。当然，物理先验不是唯一路线，scaling、多模态预训练、对象级学习也各有各的空间。&lt;/p&gt;
&lt;h2 id="对象级世界模型另一个绕不开的方向"&gt;对象级世界模型，另一个绕不开的方向&lt;/h2&gt;
&lt;p&gt;前面说的 RSSM、JEPA 更多是在整体 latent space 或像素空间做预测。但&amp;quot;理解物理世界&amp;quot;还有另一条路径：让模型从像素或 latent 转向实体、关系和状态变化的建模——也就是 object-centric representation。通过 slot attention、scene graph 这类方法，把场景分解为独立的对象和它们之间的交互关系，然后对每个对象的动力学分别建模。&lt;/p&gt;
&lt;p&gt;这条路线的好处是泛化性更强——你见过桌子上的杯子被推，换到桌子上的碗被推，对象级模型更容易迁移。而整体 latent 模型可能需要重新学。&lt;/p&gt;
&lt;h2 id="世界模型和-vla-的关系需要更准确地看"&gt;世界模型和 VLA 的关系，需要更准确地看&lt;/h2&gt;
&lt;p&gt;现在行业里很火的 VLA（Vision-Language-Action）路线，比如 RT-2、π0，当前主流 VLA 主要优化视觉语言到动作的映射，而显式环境预测和长期规划能力仍然是其薄弱环节。需要注意的是，这些模型内部的 transformer 确实有 latent prediction 和 action chunking 机制，并非完全没有规划能力，只是这种规划是隐式的、短视的。&lt;/p&gt;</description></item><item><title>跑 DreamerV3 该租云 GPU 还是自建工作站？一个工程师的成本账</title><link>https://www.worldsensetech.com/zh/articles/2026-08-17-dreamerv3-gpu-infrastructure/</link><pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-17-dreamerv3-gpu-infrastructure/</guid><description>&lt;p&gt;前面几篇文章讲了 DreamerV3 的环境搭建和训练技巧。但有一个更基础的问题经常被忽略：&lt;strong&gt;你在什么硬件上跑？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这个问题看似简单，实际上直接影响你的研究节奏和钱包。我用了一个月的 AutoDL 云 GPU，又花了一周时间规划自建工作站，中间还收到了供应商 ¥36,000 的整机报价。这篇文章把整个过程和算账结果分享出来，希望能给同样在纠结&amp;quot;租还是买&amp;quot;的朋友一个参考。&lt;/p&gt;
&lt;h2 id="先说结论"&gt;先说结论&lt;/h2&gt;
&lt;p&gt;如果你确认自己会长期维持较高的 GPU 使用率，自建工作站值得认真做一次成本测算。按照我实际使用的 ¥2.58/GPU 小时计算，每天 12 小时的简单静态平衡点约 29 个月，每天 18 小时约 19 个月。纯经济账并不意味着&amp;quot;买一定比租便宜&amp;quot;——12 小时并不是一个&amp;quot;买了马上省钱&amp;quot;的分界线。但高频研究场景下，本地机器在等待时间、环境稳定性和数据管理上的优势，可能具有更高价值。&lt;/p&gt;
&lt;p&gt;但&amp;quot;回本&amp;quot;不是唯一考量。自建工作站还有一个云 GPU 给不了的优势：&lt;strong&gt;随时可用、数据本地、不用排队、不用惦记关机省钱&lt;/strong&gt;。对于需要高频迭代的研究工作，这个体验差异是巨大的。&lt;/p&gt;
&lt;h2 id="第一阶段autodl-云-gpu-的实际花费"&gt;第一阶段：AutoDL 云 GPU 的实际花费&lt;/h2&gt;
&lt;p&gt;我最初的选择是 AutoDL——国内最常用的 GPU 云平台之一，按小时计费，机型丰富，不用自己维护环境。对于刚开始跑 DreamerV3 实验来说，这是最合理的选择。&lt;/p&gt;
&lt;h3 id="实际花费"&gt;实际花费&lt;/h3&gt;
&lt;p&gt;我实际使用的 AutoDL 实例折算下来约为 &lt;strong&gt;¥2.58/GPU 小时&lt;/strong&gt;（RTX 4090D 机型）。偶尔遇到过更低的短时优惠价（约 ¥1.67/h），但下面按 ¥2.58/h 这个实际常规价格估算月/年费用。&lt;/p&gt;
&lt;p&gt;两天花了 ¥100 左右。听起来不多，但换算一下：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;GPU 日均运行时长&lt;/th&gt;
					&lt;th style="text-align: left"&gt;月花费&lt;/th&gt;
					&lt;th style="text-align: left"&gt;年花费&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 4 小时（轻度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥310&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥3,764&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 8 小时（中度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥619&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥7,530&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 12 小时（重度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥929&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥11,299&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 18 小时（极限）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥1,393&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥16,943&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;注意这只是 GPU 租赁费用，还没算存储费用（AutoDL 的系统盘和数据盘另计费）和网络传输成本。&lt;/p&gt;</description></item><item><title>为什么说 2026 年，AI 在疯狂寻找物理外壳？</title><link>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</guid><description>&lt;p&gt;从 Ray-Ban Meta、PLAUD、Amazon Bee，到 Rabbit R1、机器狗和人形机器人：AI 正在一件一件地给自己补齐&amp;quot;器官&amp;quot;。&lt;/p&gt;
&lt;p&gt;如果过去两年 AI 的主流产品是 ChatGPT、Claude、Cursor，那么 2026 年让我觉得最有意思的变化，是 AI 开始从屏幕里&amp;quot;搬家&amp;quot;。&lt;/p&gt;
&lt;p&gt;它住进了眼镜、胸针、耳机、小盒子、机器狗和人形机器人。&lt;/p&gt;
&lt;p&gt;有的给 AI 一双眼睛，有的给它一双耳朵，有的给它记忆，有的给它显示器，有的甚至开始给它手和腿。&lt;/p&gt;
&lt;p&gt;所以我越来越觉得，&amp;ldquo;AI 在寻找物理外壳&amp;quot;并不是一个比喻。&lt;/p&gt;
&lt;p&gt;但这里的&amp;quot;外壳&amp;quot;不一定意味着人形机器人。它可能是一副眼镜、一枚胸针、一条腕带、一台机器狗，也可能最终是一台真正能够在现实世界里行动的人形机器人。它们其实都在尝试解决同一个问题：AI 如何从&amp;quot;理解世界&amp;rdquo;，变成&amp;quot;存在于世界&amp;quot;。&lt;/p&gt;
&lt;p&gt;我是一个做世界模型方向的工程师，日常和 MuJoCo、DreamerV3 打交道。但最近半年越来越关注 AI 硬件——因为我做的世界模型、仿真训练和 sim-to-real，最终面对的一个重要问题，就是如何让 AI 从&amp;quot;理解世界&amp;quot;走向&amp;quot;作用于世界&amp;quot;。而这些 AI，迟早需要某种物理载体。&lt;/p&gt;
&lt;p&gt;这篇文章不是技术综述，更像是一个&amp;quot;AI 硬件逛展式观察&amp;quot;。我想按一个有意思的角度来聊：AI 正在按器官逐一获得物理形态——从感知到交互再到行动，逐步构建完整的身体。当然，&amp;ldquo;器官&amp;quot;在这里是一个比喻，更准确地说，是 AI 正在获得不同的物理接口。&lt;/p&gt;
&lt;h2 id="ai-的眼睛ray-ban-meta"&gt;AI 的眼睛：Ray-Ban Meta&lt;/h2&gt;
&lt;p&gt;&lt;img src="https://www.worldsensetech.com/images/ai-shell-rayban-meta.png" alt="Ray-Ban Meta Gen 2 智能眼镜"&gt;&lt;/p&gt;
&lt;p&gt;我第一个想聊的不是机器人，而是一副眼镜。&lt;/p&gt;
&lt;p&gt;2025 年 9 月发布的 Ray-Ban Meta Gen 2，到 2026 年，它已经成为 AI 眼镜里最成熟、也最接近大众消费电子的一种产品形态。它有意思的地方恰恰在于：它看起来不像 AI 产品。没有大屏幕，没有科幻造型。它就是一副普通眼镜，但里面塞了摄像头、麦克风、扬声器和 AI。&lt;/p&gt;
&lt;p&gt;它真正有意思的能力不是&amp;quot;可以问 ChatGPT&amp;rdquo;。而是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;AI 可以看到你正在看的东西。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&amp;ldquo;这是什么植物？&amp;ldquo;&amp;ldquo;帮我翻译这个菜单。&amp;ldquo;&amp;ldquo;这个零件叫什么？&amp;quot;——AI 获得了一个非常特殊的输入：佩戴者的第一视角。&lt;/p&gt;
&lt;p&gt;我觉得它成功的关键之一，是它首先是一副正常的眼镜，然后才是一台 AI 设备。&lt;/p&gt;</description></item><item><title>世界模型架构演进：RSSM、Transformer 与统一世界模型</title><link>https://www.worldsensetech.com/zh/articles/world-model-transformer/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-transformer/</guid><description>&lt;p&gt;前面几篇文章中，我们深入讲解了 DreamerV3 的 RSSM 架构和训练技巧。RSSM 是强化学习世界模型中的经典设计，但如果你关注最近的研究，会发现一个明显的趋势：世界模型正在走向 Transformer 化。&lt;/p&gt;
&lt;p&gt;从 Google 的 UniSim 到 Wayve 的 GAIA-1，从 NVIDIA 的 Cosmos 到国内具身智能团队的方案，Transformer 正成为大规模世界模型的重要技术路线。&lt;/p&gt;
&lt;p&gt;为什么会这样？RSSM 有什么问题？Transformer 带来了什么优势？世界模型的架构演进方向是什么？&lt;/p&gt;
&lt;p&gt;这篇文章梳理这条技术路线。&lt;/p&gt;
&lt;p&gt;在展开之前，先澄清一个概念。所谓统一世界模型（unified world model），并不是指一个模型精确复制整个物理世界，而是希望通过统一的表示空间同时理解视觉、语言、动作和环境动态——让同一个模型既能&amp;quot;看&amp;quot;懂场景，又能&amp;quot;想&amp;quot;清因果，还能&amp;quot;做&amp;quot;出决策。这是当前世界模型研究的一个前沿方向。&lt;/p&gt;
&lt;h2 id="rssm-的设计逻辑与局限"&gt;RSSM 的设计逻辑与局限&lt;/h2&gt;
&lt;p&gt;先回顾一下 RSSM 为什么被设计出来。&lt;/p&gt;
&lt;p&gt;RSSM（Recurrent State-Space Model）的核心思想是将隐状态分成两个轨道：确定性状态（deterministic state）和随机性状态（stochastic state）。确定性状态用 GRU 更新，捕捉规律性的动态；随机性状态通过离散分类分布采样——DreamerV3 使用 32 个离散 categorical 变量，每个变量包含 64 个类别，组合形成容量为 64^32 的随机隐空间，捕捉环境的不确定性。&lt;/p&gt;
&lt;p&gt;这个设计有几个优点：&lt;/p&gt;
&lt;p&gt;计算效率高。GRU 是循环网络，每一步只需要上一步的隐状态，不需要处理整个序列。训练和推理的内存开销较小。&lt;/p&gt;
&lt;p&gt;隐空间结构清晰。确定性 + 随机性的双轨道设计，让模型同时学到&amp;quot;规律&amp;quot;和&amp;quot;不确定性&amp;quot;。这对物理世界的建模很重要——宏观物理规律通常具有较强确定性，而观测和环境扰动具有随机性。&lt;/p&gt;
&lt;p&gt;想象训练方便。在隐空间中可以方便地&amp;quot;想象&amp;quot;未来轨迹：从当前状态出发，用 GRU 逐步推进，每一步采样随机状态，得到一系列隐状态，再解码成观测。&lt;/p&gt;
&lt;p&gt;但 RSSM 也有几个明显的局限：&lt;/p&gt;
&lt;p&gt;长程依赖问题。RSSM 通过 deterministic hidden state 维护历史信息，但由于状态更新仍是递归形式，超长时间跨度的信息需要压缩到固定维度的隐状态中，可能造成信息瓶颈。当任务需要记住很久以前的信息时（如延迟奖励、长程因果链），RSSM 的表现可能不够好。&lt;/p&gt;
&lt;p&gt;并行化受限。循环网络在时间维度上是序列化的——每一步依赖上一步的输出。不过 RSSM 训练并非完全串行：observation encoder 可以并行处理，rollout imagination 也可以在 batch 维度并行。真正的瓶颈在于时间维度上的依赖关系，这使得训练速度受限于序列长度。&lt;/p&gt;</description></item><item><title>DreamerV3 训练技巧：从踩坑到收敛的实战经验</title><link>https://www.worldsensetech.com/zh/articles/dreamerv3-training-tips/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/dreamerv3-training-tips/</guid><description>&lt;p&gt;上一篇文章梳理了世界模型的四条表征路线。今天我们回到 DreamerV3 的实战主题，聊聊训练过程中的那些坑和技巧。本文基于 DreamerV3 commit &lt;code&gt;e3f02248&lt;/code&gt;、JAX + Haiku、MuJoCo + DM Control 的本地实验环境，不同版本的参数名和配置可能有差异。&lt;/p&gt;
&lt;p&gt;DreamerV3 是目前最开源、最成熟的世界模型实现之一。但如果你真的动手训练过，一定知道这个过程并不轻松——环境配置、超参数调优、训练不稳定、收敛慢……各种坑。&lt;/p&gt;
&lt;p&gt;这篇文章总结我在训练 DreamerV3 过程中遇到的常见问题和解决方案，希望能帮你少走弯路。&lt;/p&gt;
&lt;h2 id="环境配置的坑"&gt;环境配置的坑&lt;/h2&gt;
&lt;h3 id="1-mujoco-版本问题"&gt;1. MuJoCo 版本问题&lt;/h3&gt;
&lt;p&gt;DreamerV3 的官方实现基于 JAX + MuJoCo。但 MuJoCo 的版本选择很关键：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;MuJoCo 2.x vs 3.x。官方代码基于 MuJoCo 2.x，但 3.x 版本有性能改进。如果用 3.x，需要修改部分 API 调用。&lt;/li&gt;
&lt;li&gt;mujoco-py vs mujoco。mujoco-py 是旧的 Python 绑定，已经停止维护。建议直接用官方的 mujoco 包。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;建议：优先使用与你当前 DreamerV3 commit 匹配的 MuJoCo 版本，不要一开始就升级整个环境。&lt;/p&gt;
&lt;h3 id="2-jax-的-gpu-配置"&gt;2. JAX 的 GPU 配置&lt;/h3&gt;
&lt;p&gt;JAX 的 GPU 支持需要正确安装 CUDA 和 cuDNN。常见问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CUDA 版本不匹配。JAX 对 CUDA 版本有严格要求，安装前查看官方文档。&lt;/li&gt;
&lt;li&gt;GPU 内存不足。JAX 默认会占用所有 GPU 内存。可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_MEM_FRACTION=0.9&lt;/code&gt; 限制内存使用。如果遇到编译阶段内存峰值过高，也可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_PREALLOCATE=false&lt;/code&gt; 关闭预分配。&lt;/li&gt;
&lt;li&gt;多 GPU 问题。JAX 的多 GPU 支持和 PyTorch 不同，需要特别配置。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;下图是 DreamerV3 在 RTX 5090D 上训练时的实际 GPU 占用情况，显存占用约 25.6GB（32GB 的 78%），GPU 利用率 91%：
![DreamerV3 训练时 GPU 占用情况](/images/nvidia smi.png) 图：RTX 5090D 上 DreamerV3 训练时的 GPU 显存占用（25.6GB / 32GB，利用率 91%）&lt;/p&gt;</description></item><item><title>世界模型如何表示世界：四条表征路线与机器人适应能力</title><link>https://www.worldsensetech.com/zh/articles/world-model-representations/</link><pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-representations/</guid><description>&lt;p&gt;前面我们用 MuJoCo 和 Isaac Sim 的对比，理清了仿真器的选择。但不管用哪个仿真器，世界模型都面临一个更根本的问题：到底用什么来表示&amp;quot;世界&amp;quot;？&lt;/p&gt;
&lt;p&gt;这个问题听起来抽象，但它直接决定了世界模型能做什么、不能做什么。就像你选错了数据结构，后面的算法再精妙也救不回来。&lt;/p&gt;
&lt;p&gt;我把当前世界模型的表征方式归纳为四条主要路线。需要说明的是，这四条路线并不是严格互斥的——它们分别对应表征的不同维度：隐空间压缩是表征空间的选择，视觉生成是输出空间的选择，显式几何建模是世界几何的表示方式，对象级结构化是信息的组织方式。更准确地说，这四条路线不是互相替代的模型类别，而是世界模型设计中的四种归纳偏置（inductive bias）——不同表征给模型加入了不同的先验假设。实际系统中，它们经常交叉组合。但理解每条路线的核心逻辑和局限，是做出正确设计选择的前提。&lt;/p&gt;
&lt;h2 id="路线一隐状态latent-state"&gt;路线一：隐状态（Latent State）&lt;/h2&gt;
&lt;p&gt;代表：DreamerV3、TD-MPC2&lt;/p&gt;
&lt;p&gt;核心思路：把观测（图像、传感器数据）压缩成一个固定维度的向量，在这个隐空间里建模动态、训练策略。&lt;/p&gt;
&lt;p&gt;DreamerV3 的 RSSM 使用循环神经网络维护确定性状态（4096 维），并结合离散随机变量（32 个类别变量，每个 64 类）来表示不确定性，两者共同用于预测未来。TD-MPC2 更激进——512 维隐状态，不要求世界模型重建原始观测，而是在任务相关的隐空间中直接做模型预测控制。&lt;/p&gt;
&lt;p&gt;这个路线解决什么问题？&lt;/p&gt;
&lt;p&gt;样本效率和计算速度。隐状态是高度压缩的表征，一个 64×64×3 的图像被压缩成几千维的向量。在这个压缩空间里做想象训练，比直接在像素空间里预测快几个数量级。DreamerV3 相比像素级世界模型具有更低的计算需求，可以在有限算力下完成高效训练。TD-MPC2 在多个连续控制任务上也展示了较高的训练效率。&lt;/p&gt;
&lt;p&gt;而且隐状态天然适合做控制。策略网络可以直接从隐状态输出动作，世界模型可以在隐空间里做 rollout，不需要生成完整的图像。对于实时控制场景（如机械臂操作），这种效率是必须的。&lt;/p&gt;
&lt;p&gt;卡在哪里？&lt;/p&gt;
&lt;p&gt;隐空间是个黑箱。它通常不提供显式可访问的 3D 结构——模型内部可能编码了深度、位置等空间线索，但这些信息难以被直接用于几何推理。它学到的是&amp;quot;做了这个动作后，隐向量会从 A 变成 B&amp;quot;，但 A 和 B 里面到底包含了什么空间信息，完全不透明。&lt;/p&gt;
&lt;p&gt;这带来一个直接后果：长时间预测容易漂移。由于隐状态通常不显式约束几何一致性，每预测一步就可能引入微小误差，误差累积后，想象轨迹逐渐偏离真实动态。DreamerV3 通常采用较短的 imagination horizon（例如 15 步），这是在模型误差累积、价值估计偏差和计算成本之间的工程折中。&lt;/p&gt;
&lt;p&gt;另一个问题是迁移。如果隐空间主要由单一任务数据学习得到，其状态语义往往缺少显式结构约束，跨场景迁移时可能需要重新适配。&lt;/p&gt;
&lt;h2 id="路线二像素视频pixelvideo"&gt;路线二：像素/视频（Pixel/Video）&lt;/h2&gt;
&lt;p&gt;代表：NVIDIA Cosmos、1X World Model&lt;/p&gt;
&lt;p&gt;核心思路：直接预测未来的图像或视频帧。给世界模型一段过去的视频 + 动作序列，它生成未来的视频。&lt;/p&gt;
&lt;p&gt;Cosmos 定位为 Physical AI 的基础模型，用两条路线处理视觉信息：一条是自回归的离散视觉 token（类似 GPT 预测下一个 token），一条是扩散模型生成连续帧。它的目标不仅是预测视频，更是通过大规模视觉生成获得通用的物理先验。1X World Model 也采用类似思路，用视频生成模型预测未来画面，同时预测离散隐状态码。&lt;/p&gt;
&lt;p&gt;这个路线解决什么问题？&lt;/p&gt;</description></item><item><title>TD-MPC：世界模型如何用于机器人控制？</title><link>https://www.worldsensetech.com/zh/articles/td-mpc-world-model-control/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/td-mpc-world-model-control/</guid><description>&lt;p&gt;上一篇文章我们拆解了 RSSM 的双轨状态设计，理解了 Dreamer 系列如何在隐空间中&amp;quot;想象&amp;quot;未来。但 RSSM 并不是世界模型用于机器人控制的唯一路线。今天聊另一条重要路线：TD-MPC（Temporal Difference Model Predictive Control）。&lt;/p&gt;
&lt;p&gt;如果说 Dreamer 的核心是利用学习到的世界模型，在隐空间中进行 imagined rollout，并通过 actor-critic 方法优化策略，那 TD-MPC 的核心思路更直接：学一个世界模型，然后在模型里做规划（planning），选出最优动作序列直接执行。它不把策略网络作为唯一决策方式，而是利用世界模型进行在线规划，并结合学习到的策略先验提高搜索效率。&lt;/p&gt;
&lt;h2 id="为什么需要-model-predictive-control"&gt;为什么需要 Model Predictive Control&lt;/h2&gt;
&lt;p&gt;先退一步。传统的强化学习（比如 DQN、PPO）学的是一个策略 π(a|s)——给定当前状态，直接输出动作。这个策略是在大量试错中训练出来的，一旦训练完成，推理时只需要前向传播一次。&lt;/p&gt;
&lt;p&gt;但这种方式有两个问题：&lt;/p&gt;
&lt;p&gt;第一，样本效率低。策略需要大量交互数据才能学好，而真实机器人的交互成本很高。&lt;/p&gt;
&lt;p&gt;第二，缺乏&amp;quot;前瞻性&amp;quot;。策略网络只看当前状态就决定动作，不会主动&amp;quot;想一想如果我这样做，接下来几步会怎样&amp;quot;。&lt;/p&gt;
&lt;p&gt;Model Predictive Control（MPC）的思路完全不同：在每个时间步，基于当前状态，在模型中模拟多条未来轨迹，评估每条轨迹的累积回报，选择回报最高的那条轨迹的第一个动作执行。然后到下一个时间步，重新规划。&lt;/p&gt;
&lt;p&gt;这就像下棋：不是靠直觉走一步，而是向前推演几步，选最好的走法。&lt;/p&gt;
&lt;h2 id="td-mpc-的核心设计"&gt;TD-MPC 的核心设计&lt;/h2&gt;
&lt;p&gt;TD-MPC（Hansen et al., 2022）的关键贡献在于：它证明了一个面向控制任务学习的隐空间动力学模型，可以与 MPC 规划结合，并通过 TD 学习目标获得高效控制能力。注意，MPC 和 model-based RL 的结合并不是新概念——TD-MPC 的创新在于用 TD 目标替代重建损失来训练世界模型。&lt;/p&gt;
&lt;h3 id="世界模型的结构"&gt;世界模型的结构&lt;/h3&gt;
&lt;p&gt;TD-MPC 的核心组件包括状态编码器、隐空间动力学模型、奖励预测模型，以及用于价值评估的 Q 网络：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;状态编码器（Encoder）&lt;/li&gt;
&lt;/ol&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`z_t = Encoder(o_t)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;把高维观测（比如图像）压缩到一个低维的隐状态 z_t。这个隐状态不需要像 RSSM 那样拆成确定性和随机性两部分——TD-MPC 用的是确定性隐状态，结构更简单。&lt;/p&gt;
&lt;ol start="2"&gt;
&lt;li&gt;动力学模型（Dynamics Model）&lt;/li&gt;
&lt;/ol&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`z_{t+1} = f(z_t, a_t)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;给定当前隐状态和动作，预测下一步的隐状态。这就是世界模型的核心——它学会了环境的状态转移规律。&lt;/p&gt;</description></item><item><title>世界模型 + VLA：用想象力训练机器人</title><link>https://www.worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</guid><description>&lt;p&gt;上一篇&lt;a href="https://www.worldsensetech.com/zh/articles/world-model-lab-setup/"&gt;从零搭建世界模型实验环境&lt;/a&gt;，我们跑通了 DreamerV3。有读者问：训练好的世界模型能做什么？&lt;/p&gt;
&lt;p&gt;今天聊一个更前沿的话题：怎么用世界模型生成合成数据，来增强 VLA（视觉-语言-动作模型）的训练。这是近年来机器人基础模型领域受到广泛关注的研究方向之一。&lt;/p&gt;
&lt;h2 id="为什么-vla-需要合成数据"&gt;为什么 VLA 需要合成数据&lt;/h2&gt;
&lt;p&gt;VLA 的核心能力是让机器人&amp;quot;听懂人话&amp;quot;——你指着桌上的杯子说&amp;quot;把那个红色的拿给我&amp;quot;，它能理解语言指令并执行动作。&lt;/p&gt;
&lt;p&gt;但训练这样的模型需要海量数据：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;真实数据采集成本高：需要人类示范，每条数据都要人操作机器人&lt;/li&gt;
&lt;li&gt;场景覆盖有限：真实环境难以覆盖所有边界情况（比如光线变化、物体遮挡）&lt;/li&gt;
&lt;li&gt;危险动作无法采集：某些失败案例在真实世界太危险，无法收集&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是世界模型的价值所在——它可以在&amp;quot;想象&amp;quot;中生成大量合成数据，弥补真实数据的不足。&lt;/p&gt;
&lt;h2 id="世界模型如何生成合成数据"&gt;世界模型如何生成合成数据&lt;/h2&gt;
&lt;p&gt;回顾一下世界模型的核心能力：给定当前状态和动作，预测未来会发生什么。&lt;/p&gt;
&lt;p&gt;需要说明的是，机器人领域合成数据的来源不仅限于 Dreamer 这类 latent world model，还包括物理模拟器（MuJoCo、Isaac Sim、ManiSkill）、神经渲染环境以及基于视频生成的世界模型。Dreamer 系列是其中适合理解 model-based RL 和 latent imagination 的代表，但实际研究中数据来源更加多元。&lt;/p&gt;
&lt;p&gt;在 DreamerV3 中，RSSM（循环状态空间模型）可以在想象空间中做 rollout：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从真实观测编码初始 latent state（后验状态）&lt;/li&gt;
&lt;li&gt;采样或指定动作序列&lt;/li&gt;
&lt;li&gt;RSSM 逐步预测 latent state 转移和预期奖励&lt;/li&gt;
&lt;li&gt;通过 observation model 解码 latent state 为观测&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;世界模型生成的是潜在轨迹（latent trajectories），经过视觉解码器和任务条件映射后，可以进一步构造机器人学习需要的视觉-语言-动作数据。&lt;/p&gt;
&lt;p&gt;需要注意：DreamerV3 的 latent imagination 与近年来基于 diffusion/transformer 的大规模视频生成模型不同。DreamerV3 的核心优势在于策略学习（latent dynamics、reward prediction），而不是直接生成高保真机器人视觉数据。用 DreamerV3 decoder 直接重建的图像往往模糊、细节缺失，长时间 rollout 还可能出现物体身份漂移。这也是为什么机器人领域正在转向 video diffusion world model 和 transformer-based world model（如 UniSim、RoboGen、GAIA-1）来获取更高质量的视觉合成数据。&lt;/p&gt;</description></item><item><title>Sim-to-Real太难？世界模型驱动的自适应迁移方法</title><link>https://www.worldsensetech.com/zh/articles/sim-to-real-transfer/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/sim-to-real-transfer/</guid><description>&lt;p&gt;这是世界模型系列文章的第四篇。前三篇我们聊了世界模型的基本概念、RSSM的核心原理、以及具身智能的入门路径。今天聊一个更偏实战的话题：仿真里训练的策略，到底怎么部署到真实机器人上？&lt;/p&gt;
&lt;p&gt;这个问题困扰了机器人AI领域将近十年。世界模型在仿真环境里表现惊艳——DreamerV3的样本效率比传统RL高出10-100倍。但一旦部署到真实机器人，性能往往下降30-50%。这个差距，就是著名的&amp;quot;Sim-to-Real Gap&amp;quot;。&lt;/p&gt;
&lt;p&gt;这篇文章，我想从工程师的视角，聊聊这个问题为什么难，以及世界模型提供了哪些新的解决思路。&lt;/p&gt;
&lt;h2 id="sim-to-real的三大挑战"&gt;Sim-to-Real的三大挑战&lt;/h2&gt;
&lt;p&gt;先搞清楚问题出在哪里。仿真和真实世界之间的差距，主要来自三个方面：&lt;/p&gt;
&lt;h3 id="1-域偏移domain-shift"&gt;1. 域偏移（Domain Shift）&lt;/h3&gt;
&lt;p&gt;仿真器的物理参数和真实世界不可能完全一致。摩擦系数差0.1、质量差5克、电机响应慢10毫秒——这些微小差异在仿真里看不出来，但策略部署后会被放大。&lt;/p&gt;
&lt;p&gt;更麻烦的是，这些参数往往是未知的。你不知道真实世界的精确摩擦系数是多少，只能猜一个范围。&lt;/p&gt;
&lt;h3 id="2-未建模动态unmodeled-dynamics"&gt;2. 未建模动态（Unmodeled Dynamics）&lt;/h3&gt;
&lt;p&gt;仿真器只能模拟已知的物理规律。但真实世界有很多&amp;quot;意外&amp;quot;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;柔性物体的形变（比如抓取一块布料，布料的褶皱无法精确预测）&lt;/li&gt;
&lt;li&gt;接触非线性（两个表面接触时的粘滑效应、微小振动）&lt;/li&gt;
&lt;li&gt;传感噪声（相机图像的光照变化、力传感器的漂移）&lt;/li&gt;
&lt;li&gt;外部干扰（有人碰了一下桌子、地面轻微震动）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些动态在仿真里要么被简化，要么完全忽略。策略在仿真里学的是&amp;quot;理想世界&amp;quot;的规律，到真实世界就懵了。&lt;/p&gt;
&lt;h3 id="3-安全约束safety-constraints"&gt;3. 安全约束（Safety Constraints）&lt;/h3&gt;
&lt;p&gt;在仿真里，策略可以随便试错——撞坏了重启就行。但在真实世界，机器人撞坏了是真坏了，还可能伤到人。&lt;/p&gt;
&lt;p&gt;这意味着部署到真实世界的策略必须满足安全约束：不能超出关节限位、不能产生过大的力、不能进入危险区域。这些约束在仿真训练时往往没有被充分考虑。&lt;/p&gt;
&lt;h2 id="传统方法域随机化的局限性"&gt;传统方法：域随机化的局限性&lt;/h2&gt;
&lt;p&gt;过去几年，Sim-to-Real迁移的主流方法是域随机化（Domain Randomization）。&lt;/p&gt;
&lt;p&gt;思路很直觉：既然不知道真实世界的精确参数，那就在仿真里随机化这些参数。训练时，每次episode都用不同的摩擦系数、质量、光照条件、传感噪声。策略在这么多&amp;quot;不同的世界&amp;quot;里训练，总有一个和真实世界接近。&lt;/p&gt;
&lt;p&gt;这个方法确实有效。OpenAI的Rubik&amp;rsquo;s Cube机器人（2019年）就是用域随机化实现的——在仿真里训练，直接部署到真实世界，成功率达到90%以上。&lt;/p&gt;
&lt;p&gt;但域随机化有几个根本性的局限：&lt;/p&gt;
&lt;p&gt;第一，随机化范围难确定。如果范围太小，覆盖不到真实世界的参数；如果范围太大，策略会变得过于保守，什么都做不好。&lt;/p&gt;
&lt;p&gt;第二，只能处理已知的不确定性。域随机化只能随机化你&amp;quot;知道要随机化&amp;quot;的参数。但未建模动态（比如柔性形变）你根本不知道该怎么随机化。&lt;/p&gt;
&lt;p&gt;第三，样本效率低。为了覆盖足够大的参数空间，需要大量的训练数据。对于复杂的机器人任务，训练时间可能长达数周。&lt;/p&gt;
&lt;h2 id="新思路用世界模型作为桥梁"&gt;新思路：用世界模型作为&amp;quot;桥梁&amp;quot;&lt;/h2&gt;
&lt;p&gt;世界模型为Sim-to-Real迁移提供了一个全新的思路：不让策略直接从仿真跳到真实世界，而是让世界模型作为中间的&amp;quot;桥梁&amp;quot;。&lt;/p&gt;
&lt;p&gt;核心思想是：世界模型学习了环境的动态规律。如果这个世界模型足够好，它应该能同时模拟仿真环境和真实世界。策略在世界模型的&amp;quot;想象空间&amp;quot;中训练，而不是在仿真器中训练。这样策略学到的不是&amp;quot;仿真世界的规律&amp;quot;，而是&amp;quot;更通用的环境规律&amp;quot;。&lt;/p&gt;
&lt;p&gt;具体来说，世界模型驱动的Sim-to-Real迁移有三个关键机制：&lt;/p&gt;
&lt;h3 id="机制一世界模型驱动的域适应"&gt;机制一：世界模型驱动的域适应&lt;/h3&gt;
&lt;p&gt;传统域随机化是在仿真器层面随机化参数。世界模型方法则是在模型层面做适应。&lt;/p&gt;
&lt;p&gt;流程是这样的：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;在仿真环境中收集大量数据，训练一个世界模型&lt;/li&gt;
&lt;li&gt;在真实世界中收集少量数据（可能只有几分钟的演示）&lt;/li&gt;
&lt;li&gt;用真实数据微调世界模型，让它&amp;quot;适应&amp;quot;真实世界的动态&lt;/li&gt;
&lt;li&gt;在适应后的世界模型中重新训练策略&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这个方法的优势在于：世界模型的参数量远小于仿真器的参数量。微调世界模型比重新校准仿真器快得多，而且只需要少量真实数据。&lt;/p&gt;
&lt;p&gt;举个例子：一个机械臂抓取任务，仿真里训练的世界模型预测的摩擦力是0.3，但真实世界的摩擦力是0.35。传统方法需要重新校准仿真器的摩擦参数，可能需要几个小时。而世界模型方法只需要用真实数据微调几轮，模型就能学会正确的摩擦力，可能只要几分钟。&lt;/p&gt;
&lt;h3 id="机制二渐进式信任迁移"&gt;机制二：渐进式信任迁移&lt;/h3&gt;
&lt;p&gt;即使世界模型适应得很好，直接把策略部署到真实世界还是有风险。渐进式信任迁移的思路是：分阶段部署，每一步都有安全约束。&lt;/p&gt;
&lt;p&gt;具体分为三个阶段：&lt;/p&gt;
&lt;p&gt;阶段一：纯仿真训练&lt;/p&gt;
&lt;p&gt;策略完全在世界模型的想象空间中训练。这个阶段策略可能还不稳定，但没关系，因为在仿真里。&lt;/p&gt;
&lt;p&gt;阶段二：混合环境训练&lt;/p&gt;
&lt;p&gt;策略在仿真和真实世界之间交替训练。比如奇数episode在仿真里跑，偶数episode在真实世界里跑。真实世界的episode中，加入安全约束（比如限制速度、限制力的范围）。&lt;/p&gt;
&lt;p&gt;这个阶段的关键是信任度评估：世界模型会预测&amp;quot;在真实世界中执行这个动作的后果&amp;quot;。如果预测的不确定性太高，就降低策略的探索强度，或者切换到更保守的行为。&lt;/p&gt;
&lt;p&gt;阶段三：真实世界部署&lt;/p&gt;
&lt;p&gt;策略完全在真实世界中运行。但世界模型仍然在后台运行，持续预测环境动态。如果预测和实际观测偏差太大，触发安全机制（比如减速、停止、请求人工干预）。&lt;/p&gt;
&lt;p&gt;这种渐进式的方法，核心优势是安全。每一步都有安全保障，不会出现&amp;quot;仿真里好好的，一部署就撞坏&amp;quot;的情况。&lt;/p&gt;
&lt;h3 id="机制三在线模型适配"&gt;机制三：在线模型适配&lt;/h3&gt;
&lt;p&gt;即使部署成功了，真实世界还在不断变化。温度变了、零件磨损了、桌面被移动了——这些都会影响策略的性能。&lt;/p&gt;
&lt;p&gt;在线模型适配的思路是：部署后，世界模型持续从真实数据中学习，不断修正自己的预测。&lt;/p&gt;
&lt;p&gt;具体做法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;策略执行动作时，世界模型同时预测下一个状态&lt;/li&gt;
&lt;li&gt;真实传感器返回实际观测&lt;/li&gt;
&lt;li&gt;比较预测和实际观测，计算误差&lt;/li&gt;
&lt;li&gt;用这个误差更新世界模型的参数（在线学习）&lt;/li&gt;
&lt;li&gt;更新后的世界模型用于下一步的预测和策略更新&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这个机制让策略能够持续适应环境变化。比如机械臂的关节随着使用会磨损，摩擦力会逐渐变化。在线适配的世界模型能捕捉到这种变化，策略也能相应调整。&lt;/p&gt;
&lt;h2 id="安全约束控制屏障函数"&gt;安全约束：控制屏障函数&lt;/h2&gt;
&lt;p&gt;前面提到了安全约束，这里展开说一下具体的实现方法。&lt;/p&gt;</description></item><item><title>从1分钟到24小时：ABot-World-0突破的核心意义</title><link>https://www.worldsensetech.com/zh/articles/abot-world-0-24h-inference/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/abot-world-0-24h-inference/</guid><description>&lt;p&gt;做世界模型方向大半年，这次高德 ABot-World-0 的更新值得关注，因为它解决的是这个领域一直绕不过去的问题：长时间尺度下的世界一致性。&lt;/p&gt;
&lt;h2 id="过去交互式世界模型最大的瓶颈是什么"&gt;过去交互式世界模型最大的瓶颈是什么&lt;/h2&gt;
&lt;p&gt;不是&amp;quot;不能生成画面&amp;quot;，而是无法保持长期一致性。&lt;/p&gt;
&lt;p&gt;短时间生成（几十秒到几分钟）：人物外观还能保持，场景还能连贯，动作还能响应。&lt;/p&gt;
&lt;p&gt;但时间拉长后：物体位置漂移、场景规则变化、角色身份丢失、前后状态不一致。&lt;/p&gt;
&lt;p&gt;所以世界模型一直停留在&amp;quot;演示级&amp;quot;——能生成一段炫酷的短视频，但没法持续运行。&lt;/p&gt;
&lt;p&gt;ABot-World-0 将推理时长从分钟级提升到24小时，真正突破的是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;让模型从&amp;quot;生成一个短暂的未来&amp;quot;，变成&amp;quot;持续维护一个世界状态&amp;quot;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="第一交互式世界模型开始具备持续运行能力"&gt;第一，交互式世界模型开始具备&amp;quot;持续运行能力&amp;quot;&lt;/h2&gt;
&lt;p&gt;以前的范式：&lt;/p&gt;
&lt;p&gt;输入 → 生成几十秒未来 → 结束。&lt;/p&gt;
&lt;p&gt;现在的范式：&lt;/p&gt;
&lt;p&gt;当前世界状态 → 用户行动 → 继续演化 → 数小时甚至一天。&lt;/p&gt;
&lt;p&gt;这意味着世界模型不再像视频播放器，而更像：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;游戏服务器&lt;/li&gt;
&lt;li&gt;虚拟环境&lt;/li&gt;
&lt;li&gt;AI Agent 沙盒&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;AI 可以在里面长期探索，而不是只能观看一段生成结果。&lt;/p&gt;
&lt;h2 id="第二解决了世界模型落地最大的工程障碍时间尺度"&gt;第二，解决了世界模型落地最大的工程障碍：时间尺度&lt;/h2&gt;
&lt;p&gt;很多 AI 能力的问题，不是瞬间预测能力不足，而是：能不能在很长时间里保持正确。&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;自动驾驶需要预测几秒后的车辆行为、几分钟后的交通变化&lt;/li&gt;
&lt;li&gt;机器人需要连续执行任务、保持环境记忆&lt;/li&gt;
&lt;li&gt;游戏Agent需要在开放世界长期活动&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;24小时推理能力意味着世界模型开始接近真实应用需要的时间尺度。&lt;/p&gt;
&lt;p&gt;但需要澄清：24小时稳定推理主要证明的是稳定运行能力，不代表24小时物理完全一致、细节无漂移、或具备真实世界理解。长时间演化后质量仍会有衰减，这是当前所有自回归模型的共性问题。&lt;/p&gt;
&lt;h2 id="第三降低了世界模拟的使用门槛"&gt;第三，降低了世界模拟的使用门槛&lt;/h2&gt;
&lt;p&gt;5B参数，19GiB显存，单张RTX 5090就能跑，Apache 2.0开源。&lt;/p&gt;
&lt;p&gt;意义不是简单&amp;quot;省算力&amp;quot;，而是：&lt;/p&gt;
&lt;p&gt;以前：世界模型 = 大公司实验室资产&lt;/p&gt;
&lt;p&gt;未来：世界模型 = 开发者可以部署的基础模型&lt;/p&gt;
&lt;p&gt;类似 Stable Diffusion 让图像生成从云端服务变成开发生态。&lt;/p&gt;
&lt;h2 id="第四对机器人的意义是提供更长的想象空间"&gt;第四，对机器人的意义是提供更长的&amp;quot;想象空间&amp;quot;&lt;/h2&gt;
&lt;p&gt;机器人训练最大的成本是真实世界试错。如果世界模型可以稳定运行很长时间，机器人可以在虚拟环境里练习、模拟大量失败案例、提升策略学习效率。&lt;/p&gt;
&lt;p&gt;但要注意：ABot-World-0 目前主要突破的是视觉世界状态的长时稳定演化，距离&amp;quot;机器人可以依靠它学习复杂动作&amp;quot;还有距离。视觉演化与控制策略之间还需要打通。&lt;/p&gt;
&lt;h2 id="更准确的行业判断"&gt;更准确的行业判断&lt;/h2&gt;
&lt;p&gt;ABot-World-0 的意义不是&amp;quot;AI已经创造了真实世界模拟器&amp;quot;，而是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;ABot-World-0 标志着交互式世界模型进一步从短时生成，走向长时间尺度运行。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一步的重要性类似：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;图像生成 → 高质量图片&lt;/li&gt;
&lt;li&gt;视频生成 → 长视频&lt;/li&gt;
&lt;li&gt;世界模型 → 可持续运行的虚拟世界&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;它标志着世界模型竞争开始从&amp;quot;能不能生成一个世界&amp;quot;进入&amp;quot;这个世界能不能一直运行&amp;quot;。&lt;/p&gt;</description></item><item><title>VLA vs 世界模型，谁主沉浮？</title><link>https://www.worldsensetech.com/zh/articles/vla-vs-world-model/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/vla-vs-world-model/</guid><description>&lt;p&gt;2025年到2026年，机器人AI领域出现了两条截然不同的技术路线。一条是以RT-2、OpenVLA、π0为代表的VLA（Vision-Language-Action，视觉-语言-动作），另一条是以DreamerV3、Genie、DIAMOND为代表的世界模型（World Models）。&lt;/p&gt;
&lt;p&gt;很多同行问我：这两条路线，到底该押哪一边？我的回答是：这个问题本身就问错了。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想把这两条路线拆开来对比，讲清楚它们各自的逻辑、优势和瓶颈，最后聊聊为什么我认为它们最终会走向融合。&lt;/p&gt;
&lt;h2 id="两条路线的核心逻辑"&gt;两条路线的核心逻辑&lt;/h2&gt;
&lt;p&gt;先说VLA。&lt;/p&gt;
&lt;p&gt;VLA的思路很直接：把机器人的控制问题，变成一个&amp;quot;看图说话&amp;quot;问题。给模型一张摄像头的图片，再给它一句语言指令（比如&amp;quot;把红色杯子放到桌子上&amp;quot;），让它直接输出机器人关节应该怎么动。&lt;/p&gt;
&lt;p&gt;本质上，VLA是一个感知-决策的端到端映射。它不关心物理规律是什么，不关心动力学方程怎么解，它只关心一件事：给定当前看到的画面和语言指令，最优的动作是什么？&lt;/p&gt;
&lt;p&gt;这种方法的灵感来自大语言模型的成功。GPT能&amp;quot;看图说话&amp;quot;，那为什么不能让一个类似的模型&amp;quot;看图做动作&amp;quot;？RT-2（Google DeepMind，2023）第一次证明了这条路可行——它把机器人动作离散化成token，直接用Transformer来预测。从此，VLA成了一个热门方向。&lt;/p&gt;
&lt;p&gt;世界模型的思路完全不同。&lt;/p&gt;
&lt;p&gt;前面几篇文章我详细讲过，世界模型的核心是学习&amp;quot;如果我执行这个动作，环境会怎么变化&amp;quot;。它不是直接从观察映射到动作，而是先建立一个环境的&amp;quot;内部模拟器&amp;quot;，然后在这个模拟器中想象不同动作的后果，再选择最优的方案。&lt;/p&gt;
&lt;p&gt;打个比方：VLA像一个经验丰富的老司机，看到路况就直接打方向盘——靠的是大量驾驶数据训练出来的直觉。世界模型像一个谨慎的新手司机，每次变道前都会先在脑中模拟：&amp;ldquo;如果我变道，后面的车会怎么反应？安全吗？&amp;quot;——靠的是对物理世界的理解。&lt;/p&gt;
&lt;p&gt;一句话总结区别：VLA是&amp;quot;看到就做&amp;rdquo;，世界模型是&amp;quot;想了再做&amp;quot;。&lt;/p&gt;
&lt;h2 id="vla的优势和瓶颈"&gt;VLA的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;VLA最大的优势是数据飞轮。&lt;/p&gt;
&lt;p&gt;互联网上有海量的视觉-语言数据（图片、视频、文本），这些数据都可以用来预训练VLA模型。然后再用少量的机器人操作数据做微调。这让VLA天然具备很强的泛化能力——它能理解没见过的物体，能遵循自然语言指令，甚至能做简单的推理。&lt;/p&gt;
&lt;p&gt;2025年涌现的几个代表性工作，把这种优势发挥到了极致：&lt;/p&gt;
&lt;p&gt;π0（Physical Intelligence，2024）：用flow matching生成连续动作序列，在折叠衣服、装洗碗机等复杂家务任务上表现出色。它证明了预训练VLA可以通过少量任务微调，快速适应新任务。&lt;/p&gt;
&lt;p&gt;OpenVLA（斯坦福/UC Berkeley，2024）：开源的VLA模型，基于Llama-2视觉语言模型微调，在Open X-Embodiment数据集上达到了不错的性能。开源让中小团队也能参与VLA研究。&lt;/p&gt;
&lt;p&gt;RT-2（Google DeepMind，2023）：最早把机器人动作变成token的工作，证明了55B参数的VLA可以zero-shot泛化到没见过的物体和指令。&lt;/p&gt;
&lt;p&gt;但VLA有一个根本性的瓶颈：缺乏长程规划能力。&lt;/p&gt;
&lt;p&gt;VLA的每一次决策都是&amp;quot;看到当前画面→输出动作&amp;quot;，它没有一个长期的&amp;quot;计划&amp;quot;。对于简单的单步任务（抓一个杯子），这没问题。但对于需要多步推理的复杂任务（&amp;ldquo;整理这个房间&amp;rdquo;——需要先收桌子、再扫地、再擦窗户），VLA就容易迷失方向。&lt;/p&gt;
&lt;p&gt;另一个问题是样本效率。VLA需要海量的机器人操作数据来微调。收集这些数据非常昂贵——每个任务都需要真实机器人反复执行，或者用仿真生成再迁移。对于中小团队来说，这是一个很高的门槛。&lt;/p&gt;
&lt;h2 id="世界模型的优势和瓶颈"&gt;世界模型的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;世界模型最大的优势是样本效率和规划能力。&lt;/p&gt;
&lt;p&gt;因为世界模型学会了环境的动态规律，它可以在&amp;quot;想象&amp;quot;中生成大量的训练数据。一个训练好的世界模型，跑一天&amp;quot;想象&amp;quot;产生的数据量，可能超过真实机器人跑一个月。这大幅降低了对真实数据的依赖。&lt;/p&gt;
&lt;p&gt;DreamerV3已经证明了这一点：同一套参数，在55款Atari游戏上从零训练，只需要少量真实交互就能达到高水平表现。在机器人操控任务上，它的样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;规划能力是世界模型的另一张王牌。因为可以在想象中&amp;quot;预演&amp;quot;未来，世界模型天然适合做长程规划。比如一个机械臂要完成&amp;quot;打开抽屉→取出工具→拧螺丝&amp;quot;这样的多步任务，世界模型可以先在想象中模拟整个流程，找到最优的动作序列，再去执行。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型方向也有几个重要进展：&lt;/p&gt;
&lt;p&gt;DIAMOND（2024）：用diffusion model做世界模型，在Atari上超越了DreamerV3的表现。证明了生成模型的范式也可以用于环境建模。&lt;/p&gt;
&lt;p&gt;Genie 2（Google DeepMind，2024）：从视频中学习交互式3D环境，可以从单张图片生成可交互的虚拟世界。虽然还不完美，但方向很有想象力。&lt;/p&gt;
&lt;p&gt;但世界模型也有明显的短板。&lt;/p&gt;
&lt;p&gt;第一是规模化困难。世界模型需要学习环境的动态规律，这意味着它必须对物理世界有很精确的理解。这比VLA的&amp;quot;模式匹配&amp;quot;要难得多。目前的世界模型大多还在实验室级别的简单任务上打转，离大规模应用还有距离。&lt;/p&gt;
&lt;p&gt;第二是语言接地弱。世界模型学习的是视觉-动作的映射，它不太理解自然语言指令。要让世界模型遵循&amp;quot;把红色的杯子放到蓝色的桌子上&amp;quot;这样的指令，需要额外的语言模块，目前还没有很好的解决方案。&lt;/p&gt;
&lt;p&gt;第三是长期预测的误差累积。世界模型在想象中预测越远的未来，误差越大。这限制了它的规划深度——通常只能可靠地预测未来几十步，对于需要上百步的复杂任务，规划质量会明显下降。&lt;/p&gt;
&lt;h2 id="对比一张表看清差异"&gt;对比：一张表看清差异&lt;/h2&gt;
&lt;p&gt;把两条路线放在一起对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;VLA&lt;/th&gt;
					&lt;th&gt;世界模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;核心思路&lt;/td&gt;
					&lt;td&gt;观察→动作的直接映射&lt;/td&gt;
					&lt;td&gt;学习环境动态，想象后行动&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;类比&lt;/td&gt;
					&lt;td&gt;直觉反应（老司机）&lt;/td&gt;
					&lt;td&gt;心理模拟（谨慎新手）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;数据需求&lt;/td&gt;
					&lt;td&gt;大量（需要海量操作数据）&lt;/td&gt;
					&lt;td&gt;较少（想象空间增强）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;泛化能力&lt;/td&gt;
					&lt;td&gt;强（语言接地，可zero-shot）&lt;/td&gt;
					&lt;td&gt;中（受限于训练环境分布）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规划能力&lt;/td&gt;
					&lt;td&gt;弱（单步决策为主）&lt;/td&gt;
					&lt;td&gt;强（可多步想象推演）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;语言理解&lt;/td&gt;
					&lt;td&gt;强（天然支持语言指令）&lt;/td&gt;
					&lt;td&gt;弱（需要额外模块）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规模化&lt;/td&gt;
					&lt;td&gt;容易（可复用LLM基础设施）&lt;/td&gt;
					&lt;td&gt;困难（环境建模复杂度高）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;代表工作&lt;/td&gt;
					&lt;td&gt;RT-2, π0, OpenVLA&lt;/td&gt;
					&lt;td&gt;DreamerV3, DIAMOND, Genie 2&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;看完这张表，你可能觉得VLA全面占优。短期来看确实如此——VLA更容易工程化，更容易拿到融资，也更容易做出demo。但世界模型在样本效率和规划能力上的优势，是VLA短期内很难弥补的。&lt;/p&gt;</description></item><item><title>2026年，「世界模型」会是下一个AI风口么？</title><link>https://www.worldsensetech.com/zh/articles/world-model-2026-trend/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-2026-trend/</guid><description>&lt;p&gt;先说结论：是世界模型的风口，但不是所有人的风口。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型确实热起来了。Sora、Kling、Vidu这些视频生成模型本质上都在学&amp;quot;世界怎么变化&amp;quot;；DreamerV3在机器人控制上证明了世界模型的样本效率优势；2026年中科院的综述把四大技术范式梳理清楚，标志着这个方向从&amp;quot;散兵游勇&amp;quot;进入&amp;quot;体系化&amp;quot;阶段。&lt;/p&gt;
&lt;p&gt;但&amp;quot;风口&amp;quot;这个词需要拆开看。我分三个层面聊。&lt;/p&gt;
&lt;h2 id="技术层面确实在爆发"&gt;技术层面：确实在爆发&lt;/h2&gt;
&lt;p&gt;几个信号很明确：&lt;/p&gt;
&lt;p&gt;论文数量翻倍。2024-2025年世界模型相关的顶会论文比前两年翻了一倍多，四大范式（观测级生成、隐空间建模、强化学习驱动、对象中心表示）已经成型。&lt;/p&gt;
&lt;p&gt;大厂入场。DeepMind、OpenAI、Meta都在布局。OpenAI的Sora虽然定位是视频生成，但技术路线和世界模型高度重合。Meta的V-JEPA系列在隐空间世界模型上走得很快。&lt;/p&gt;
&lt;p&gt;应用场景拓宽。从最早的游戏仿真，扩展到机器人操控、自动驾驶决策、科学发现模拟、GUI智能体。每个场景都在催生新的技术需求。&lt;/p&gt;
&lt;p&gt;从技术成熟度曲线看，世界模型大概在&amp;quot;期望膨胀期&amp;quot;的早期阶段——技术有真实价值，但市场预期可能跑在了实际能力前面。&lt;/p&gt;
&lt;h2 id="产业层面离大规模商业化还有距离"&gt;产业层面：离大规模商业化还有距离&lt;/h2&gt;
&lt;p&gt;这是需要冷静看待的部分。&lt;/p&gt;
&lt;p&gt;Sim-to-Real还没解决。世界模型在仿真里很强，但部署到真实机器人上性能下降30-50%。这个瓶颈八年没突破，短期内也难有根本性解决方案。&lt;/p&gt;
&lt;p&gt;计算成本太高。训练一个像样的世界模型需要多张A100跑几周。对于创业公司或个人研究者，这个门槛不低。&lt;/p&gt;
&lt;p&gt;杀手级应用还没出现。大语言模型有ChatGPT，图像生成有Midjourney，世界模型的&amp;quot;ChatGPT时刻&amp;quot;还没到来。目前最接近的是机器人操控，但离消费级产品还有距离。&lt;/p&gt;
&lt;p&gt;所以从产业角度，世界模型更像是&amp;quot;2-3年后的风口&amp;quot;，不是&amp;quot;现在就能变现的风口&amp;quot;。&lt;/p&gt;
&lt;h2 id="个人层面谁适合现在入场"&gt;个人层面：谁适合现在入场&lt;/h2&gt;
&lt;p&gt;基于我自己的观察和实践，分几种情况：&lt;/p&gt;
&lt;p&gt;适合入场的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;做研究、读博、进大厂AI Lab的人——这是具身智能的核心技术，未来5-10年有持续需求&lt;/li&gt;
&lt;li&gt;有机器人/自动化背景的工程师——世界模型的应用层（任务适配、迁移工具链）离钱更近，大厂还没完全覆盖&lt;/li&gt;
&lt;li&gt;有算力资源的团队——能跑得起训练，有机会做出有影响力的工作&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要谨慎的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;想快速变现的创业者——这个方向太慢，不适合追求短期回报&lt;/li&gt;
&lt;li&gt;纯软件背景、没有物理世界经验的人——世界模型的核心难点在Sim-to-Real，需要懂机器人、懂控制、懂硬件&lt;/li&gt;
&lt;li&gt;算力有限的个人研究者——可以学原理、跑开源代码，但想做出原创贡献很难&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="我的判断"&gt;我的判断&lt;/h2&gt;
&lt;p&gt;世界模型是AI从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;的关键一步。这个方向的价值是确定的，但时间线可能比大多数人预期的要长。&lt;/p&gt;
&lt;p&gt;短期（1-2年）：技术继续突破，但商业化案例有限，主要是大厂和研究机构在推进。&lt;/p&gt;
&lt;p&gt;中期（3-5年）：Sim-to-Real问题部分解决，工业场景（机器人装配、仓储物流）开始出现规模化应用。&lt;/p&gt;
&lt;p&gt;长期（5-10年）：如果&amp;quot;统计拟合→机理理解&amp;quot;这个关口能突破，世界模型可能成为通用人工智能的基石。&lt;/p&gt;
&lt;p&gt;对于个人来说，现在入场不晚，但需要耐心。不要指望半年就能看到回报，给自己至少2-3年的时间。&lt;/p&gt;</description></item><item><title>回看世界模型8年进展，始终没突破的瓶颈是什么？</title><link>https://www.worldsensetech.com/zh/articles/world-model-8year-bottleneck/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-8year-bottleneck/</guid><description>&lt;p&gt;做世界模型方向大半年，最大的感受是：论文很多，但真正能落地的很少。最近读了一篇2026年中科院联合多所高校的综述，把八年来的进展梳理得很清楚。我结合自己的实践，聊聊几个始终没突破的瓶颈。&lt;/p&gt;
&lt;p&gt;先说进步。从2018年Ha和Schmidhuber提出世界模型概念，到DreamerV3在55款Atari游戏上统一参数跑出好成绩，再到Sora等视频生成模型的爆发，世界模型确实从&amp;quot;概念验证&amp;quot;走到了&amp;quot;技术验证&amp;quot;阶段。四大技术范式（观测级生成、隐空间建模、强化学习驱动、对象中心表示）已经成型，应用场景也从游戏扩展到了机器人、自动驾驶、科学发现等领域。&lt;/p&gt;
&lt;p&gt;但有几个核心瓶颈，八年过去了，依然没有根本性突破。&lt;/p&gt;
&lt;h2 id="瓶颈一sim-to-real鸿沟"&gt;瓶颈一：Sim-to-Real鸿沟&lt;/h2&gt;
&lt;p&gt;这是最痛的瓶颈。世界模型在仿真环境里表现很好，DreamerV3的样本效率比传统RL高出10-100倍。但仿真里训练的策略，部署到真实机器人上往往性能下降30-50%。&lt;/p&gt;
&lt;p&gt;域随机化能缓解一部分问题，但远没有解决。根本原因在于：仿真器无法完美模拟真实世界的物理动态——接触摩擦、柔性形变、传感噪声、未建模的干扰。世界模型学到的&amp;quot;世界规律&amp;quot;是仿真世界的规律，不是真实世界的。&lt;/p&gt;
&lt;p&gt;八年了，这个问题依然没有优雅的解决方案。要么花大量时间做系统辨识，要么接受性能打折。&lt;/p&gt;
&lt;h2 id="瓶颈二长程预测误差累积"&gt;瓶颈二：长程预测误差累积&lt;/h2&gt;
&lt;p&gt;世界模型的核心能力是&amp;quot;在想象中推演未来&amp;quot;。但预测不可能完美，每一步都有小误差，多步之后误差指数级放大。&lt;/p&gt;
&lt;p&gt;DreamerV3的想象步数限制在15步左右，超过这个长度预测就不可靠了。对于需要长期规划的任务（比如机器人完成一个多步骤的装配任务），15步远远不够。&lt;/p&gt;
&lt;p&gt;层级时序建模、显式因果表征这些方向有潜力，但目前都还在研究阶段，没有成熟的工程方案。&lt;/p&gt;
&lt;h2 id="瓶颈三物理一致性"&gt;瓶颈三：物理一致性&lt;/h2&gt;
&lt;p&gt;现在的模型能生成看起来很合理的画面，但经常违反物理定律。比如生成的视频里物体穿模了、重力方向不对、碰撞后动量不守恒。&lt;/p&gt;
&lt;p&gt;这是因为模型学的是数据分布的统计规律，不是物理定律。它知道&amp;quot;杯子掉在地上会碎&amp;quot;是因为训练数据里见过，而不是因为它理解了重力和材料力学。&lt;/p&gt;
&lt;p&gt;把物理约束（能量守恒、动量守恒、因果规则）嵌入模型是一个方向，但怎么嵌入、嵌入多少、会不会限制模型的表达能力，这些问题还没有共识。&lt;/p&gt;
&lt;h2 id="瓶颈四计算成本"&gt;瓶颈四：计算成本&lt;/h2&gt;
&lt;p&gt;训练一个像样的世界模型，需要多张A100跑几天到几周。推理时虽然比训练快，但对于实时控制场景（比如机器人每秒需要决策100次），延迟仍然太高。&lt;/p&gt;
&lt;p&gt;边缘设备部署更是难上加难。工业场景的机器人控制器算力有限，跑不动大模型。模型压缩、知识蒸馏这些方法能用，但会牺牲预测精度。&lt;/p&gt;
&lt;h2 id="为什么这些瓶颈难突破"&gt;为什么这些瓶颈难突破&lt;/h2&gt;
&lt;p&gt;根本原因在于：世界模型试图用数据驱动的方法解决一个需要机理理解的问题。&lt;/p&gt;
&lt;p&gt;人类理解世界靠的不只是观察统计，还有物理直觉、因果推理、抽象建模。现在的模型只有第一种能力，缺后两种。&lt;/p&gt;
&lt;p&gt;未来5年，如果能突破&amp;quot;统计拟合→机理理解&amp;quot;这个关口，世界模型才能真正成为通用人工智能和具身智能的基石。否则，它可能一直停留在*&amp;ldquo;仿真里很强，真实世界拉胯&amp;rdquo;*的状态。&lt;/p&gt;</description></item><item><title>你认为具身智能领域在2026年会有什么突破性进展？</title><link>https://www.worldsensetech.com/zh/articles/embodied-ai-2026-breakthrough/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/embodied-ai-2026-breakthrough/</guid><description>&lt;p&gt;具身智能（Embodied AI）在2025年已经明显加速了。人形机器人公司扎堆融资，大模型厂商纷纷布局机器人方向，各国政府也把具身智能列为战略重点。站在2026年的节点上，我觉得有几个方向会出现实质性突破。&lt;/p&gt;
&lt;h2 id="突破一世界模型从能想象到能决策"&gt;突破一：世界模型从&amp;quot;能想象&amp;quot;到&amp;quot;能决策&amp;quot;&lt;/h2&gt;
&lt;p&gt;2023-2024年，DreamerV3证明了世界模型可以在仿真中高效训练策略。但那时候的世界模型更像一个&amp;quot;环境模拟器&amp;quot;——能预测下一步会怎样，但和实际决策之间还隔着一层。&lt;/p&gt;
&lt;p&gt;2026年，我看到一个明显趋势：世界模型开始直接和决策系统打通。不再是&amp;quot;先建模、再训练策略&amp;quot;的两阶段流程，而是端到端的&amp;quot;建模即决策&amp;quot;。这意味着机器人可以在想象空间中直接完成从感知到规划到控制的全流程，不需要额外的策略网络。&lt;/p&gt;
&lt;p&gt;这个突破的意义在于：大幅缩短从&amp;quot;理解世界&amp;quot;到&amp;quot;采取行动&amp;quot;的链路，让机器人的反应速度接近人类水平。&lt;/p&gt;
&lt;h2 id="突破二sim-to-real迁移出现工程化方案"&gt;突破二：Sim-to-Real迁移出现工程化方案&lt;/h2&gt;
&lt;p&gt;这是我最期待的突破。过去八年，Sim-to-Real一直是世界模型落地的最大瓶颈。仿真里训练的策略，到真实世界性能打对折。&lt;/p&gt;
&lt;p&gt;2026年，几个技术路线开始 converge（汇合）：&lt;/p&gt;
&lt;p&gt;系统辨识自动化。不再需要工程师手动调参来匹配仿真和真实世界的物理参数，模型可以自动从少量真实数据中学习未建模的动态。&lt;/p&gt;
&lt;p&gt;渐进式信任迁移。策略不是一次性从仿真跳到真实世界，而是通过&amp;quot;仿真→混合环境→真实世界&amp;quot;的渐进过程，每一步都有安全约束保证不会出大问题。&lt;/p&gt;
&lt;p&gt;在线模型适配。部署到真实世界后，模型能持续从真实数据中学习，不断修正自己的预测偏差。&lt;/p&gt;
&lt;p&gt;这几个方向结合起来，2026年应该能看到第一批*&amp;ldquo;仿真训练、真实部署、性能不打折&amp;quot;的工业案例。不是实验室demo，是真正能在工厂里跑的。&lt;/p&gt;
&lt;h2 id="突破三多模态感知与物理理解的融合"&gt;突破三：多模态感知与物理理解的融合&lt;/h2&gt;
&lt;p&gt;之前的世界模型主要处理视觉信息（相机图像）。但真实世界的机器人需要融合多种感知——视觉、触觉、力觉、甚至听觉。&lt;/p&gt;
&lt;p&gt;2026年，多模态世界模型开始成熟。机器人不仅能&amp;quot;看到&amp;quot;物体，还能通过触觉反馈理解物体的材质、重量、摩擦力。这种多模态的物理理解，是灵巧操作（比如拧瓶盖、系鞋带、翻书页）的关键前提。&lt;/p&gt;
&lt;p&gt;我特别关注的是触觉传感器的进步。新一代高分辨率触觉传感器（比如GelSight的后续产品）能提供密集的接触力分布信息，让世界模型的物理预测从&amp;quot;大概合理&amp;quot;变成&amp;quot;精确可信&amp;rdquo;。&lt;/p&gt;
&lt;h2 id="突破四基础世界模型的雏形出现"&gt;突破四：基础世界模型的雏形出现&lt;/h2&gt;
&lt;p&gt;大语言模型的成功证明了一个规律：当模型足够大、数据足够多时，会涌现出意想不到的能力。世界模型领域也在走这条路。&lt;/p&gt;
&lt;p&gt;2026年，可能会出现第一批&amp;quot;基础世界模型&amp;quot;的雏形——不是针对某个特定任务训练的，而是在大规模多任务数据上预训练的通用世界模型。这种模型可以通过少量微调适配到不同的机器人任务上，就像GPT可以通过prompt适配到不同文本任务一样。&lt;/p&gt;
&lt;p&gt;当然，离真正的&amp;quot;通用世界模型&amp;quot;还很远。计算成本、数据规模、架构设计都还有大量问题。但方向是明确的，2026年应该能看到有价值的早期成果。&lt;/p&gt;
&lt;h2 id="一个需要冷静的地方"&gt;一个需要冷静的地方&lt;/h2&gt;
&lt;p&gt;说了这么多突破，也要泼一点冷水。&lt;/p&gt;
&lt;p&gt;具身智能的突破和NLP/视觉领域的突破有一个本质区别：它需要和物理世界打交道。&lt;/p&gt;
&lt;p&gt;大语言模型可以在服务器上跑，用户通过浏览器访问，边际成本几乎为零。但具身智能的每一个应用都需要硬件——机器人、传感器、执行器。这意味着规模化比纯软件慢得多，成本也高得多。&lt;/p&gt;
&lt;p&gt;所以2026年的突破更多是&amp;quot;技术验证&amp;quot;层面的，离&amp;quot;大规模商业化&amp;quot;还有距离。不要指望明年就能看到人形机器人在你家做饭——那个场景至少还要5-10年。&lt;/p&gt;
&lt;h2 id="对从业者的建议"&gt;对从业者的建议&lt;/h2&gt;
&lt;p&gt;如果你在具身智能方向工作或者想进入这个方向，2026年有几个值得关注的切入点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;世界模型 + 工业场景：这是离钱最近的方向。工厂里的机器人任务适配、质量检测、柔性制造，都有真实需求。&lt;/li&gt;
&lt;li&gt;Sim-to-Real工具链：帮企业把仿真训练的策略部署到真实机器人上，这个需求会越来越大。&lt;/li&gt;
&lt;li&gt;多模态感知融合：特别是触觉+视觉的融合，是灵巧操作的关键。&lt;/li&gt;
&lt;li&gt;基础世界模型：如果你有算力资源和大团队，这是长期价值最高的方向。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;我自己关注的是前两个方向。没有大厂的算力，也没有学术界的资源，但在工业场景的落地经验上有一些积累。用自己能做好的方式参与这个变革，就够了。&lt;/p&gt;</description></item><item><title>世界模型（world model）当下是一个好的方向吗？</title><link>https://www.worldsensetech.com/zh/articles/world-model-good-direction/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-good-direction/</guid><description>&lt;p&gt;作为一个在这个方向上摸爬滚打了大半年的工程师，说说我的看法。&lt;/p&gt;
&lt;p&gt;先说结论：是好方向，但不是所有人都适合现在入场。&lt;/p&gt;
&lt;h2 id="为什么是好方向"&gt;为什么是好方向&lt;/h2&gt;
&lt;p&gt;世界模型解决的是一个很根本的问题：让AI不只是&amp;quot;看到&amp;quot;世界，而是&amp;quot;理解&amp;quot;世界。&lt;/p&gt;
&lt;p&gt;大语言模型已经证明了，当模型足够大、数据足够多时，它能涌现出很强的能力。但语言模型理解的是文本世界，不是物理世界。机器人要真正在现实环境中工作，需要理解物理规律——重力、摩擦力、碰撞、因果。这些东西光靠文本数据学不到。&lt;/p&gt;
&lt;p&gt;世界模型的核心思想很直觉：让模型学习*&amp;ldquo;如果我执行这个动作，环境会怎么变化&amp;rdquo;。学会了这个，机器人就可以在&amp;quot;想象&amp;quot;中训练策略，而不是在真实世界里反复试错。这对机器人来说意义重大——真实世界的试错成本高、速度慢、还可能损坏硬件。&lt;/p&gt;
&lt;p&gt;DreamerV3（2023年，Danijar Hafner等）已经证明了这条路可行。同一套参数，在55款Atari游戏上都能跑出不错的成绩，在机器人操控任务上样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;2024-2025年，世界模型在视频生成领域也爆发了。Sora、Kling、Vidu这些视频生成模型，本质上也是在学&amp;quot;世界会怎么变化&amp;quot;。虽然它们目前还停留在视觉层面，没有和物理控制打通，但方向是一致的。&lt;/p&gt;
&lt;h2 id="但为什么不是所有人都适合入场"&gt;但为什么不是所有人都适合入场&lt;/h2&gt;
&lt;h3 id="第一这个方向还在早期离大规模商业化有距离"&gt;第一，这个方向还在早期，离大规模商业化有距离&lt;/h3&gt;
&lt;p&gt;世界模型在仿真环境里表现很好，但Sim-to-Real迁移仍然是个大问题。仿真里训练的策略，部署到真实机器人上往往性能下降30-50%。域随机化、系统辨识这些方法能缓解，但远没有解决。如果你是想快速变现的创业者，这个方向可能太慢了。&lt;/p&gt;
&lt;h3 id="第二计算资源门槛不低"&gt;第二，计算资源门槛不低&lt;/h3&gt;
&lt;p&gt;训练一个像样的世界模型，至少需要多张A100跑几天到几周。不像写个Web应用，一台笔记本就能搞定。个人研究者或小团队需要精打细算。&lt;/p&gt;
&lt;h3 id="第三学术竞争很激烈"&gt;第三，学术竞争很激烈&lt;/h3&gt;
&lt;p&gt;这个方向的顶会论文主要来自Stanford、CMU、Berkeley、DeepMind等机构。如果你没有这些背景，纯靠自学想做出有影响力的工作，难度很大。&lt;/p&gt;
&lt;h2 id="我的建议"&gt;我的建议&lt;/h2&gt;
&lt;p&gt;如果你是想做研究、读博、进大厂AI Lab，世界模型绝对值得投入。它是具身智能的核心技术之一，未来5-10年都会有持续的研究需求。&lt;/p&gt;
&lt;p&gt;如果你是想创业或做产品，建议关注世界模型的应用层——比如用世界模型做工业机器人的快速任务适配、做仿真-to-现实的迁移工具链。这些方向离钱更近，而且大厂还没完全覆盖。&lt;/p&gt;
&lt;p&gt;如果你只是对技术感兴趣的工程师，我的建议是：先理解原理，跑通开源代码（DreamerV3有官方实现），然后在一个具体任务上实践。不需要从头训练一个大模型，学会用、学会改、学会部署，就已经很有价值了。&lt;/p&gt;
&lt;p&gt;我自己走的是最后这条路。不是学术大牛，也没有大厂的资源，就是一个对技术有热情的工程师。通过写博客、发文章来梳理自己的理解，同时也希望能帮到同样想进入这个方向的人。&lt;/p&gt;</description></item><item><title>什么是机器人世界模型？一个工程师的深度解读</title><link>https://www.worldsensetech.com/zh/articles/world-model-intro/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-intro/</guid><description>&lt;p&gt;如果你关注AI领域的最新进展，可能已经注意到一个趋势：从ChatGPT到Sora，从AlphaFold到机器人操控，AI正在从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;。而在这个转变中，有一个概念越来越核心——世界模型（World Model）。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想从一个工程师的视角，聊聊什么是世界模型，为什么它对机器人如此重要，以及目前最有代表性的DreamerV3到底做了什么。&lt;/p&gt;
&lt;h2 id="一个直觉机器人也需要想象力"&gt;一个直觉：机器人也需要&amp;quot;想象力&amp;quot;&lt;/h2&gt;
&lt;p&gt;先做一个思想实验。&lt;/p&gt;
&lt;p&gt;想象你面前有一杯水，你伸手去推它。在你真正动手之前，你的大脑已经&amp;quot;模拟&amp;quot;了这个动作的后果——水会洒出来，杯子会滑动，你的手会变湿。你没有真正去做，但你已经&amp;quot;知道&amp;quot;了结果。&lt;/p&gt;
&lt;p&gt;这种能力，心理学家称之为&amp;quot;心智模拟&amp;quot;（Mental Simulation）。它是人类智能的核心能力之一。我们不需要每次都通过试错来学习，而是可以在脑海中&amp;quot;想象&amp;quot;行动的后果，然后选择最优的方案。&lt;/p&gt;
&lt;p&gt;传统的机器人是怎么做的呢？大多数时候，它们靠的是试错。强化学习（Reinforcement Learning）的基本逻辑就是：在环境中执行动作，观察结果，获得奖励或惩罚，然后更新策略。这就像一个蒙着眼睛的人在迷宫里乱走，靠碰壁来学习地图。&lt;/p&gt;
&lt;p&gt;问题很明显：效率太低了。一个真实的机械臂，每次试错都要消耗时间、磨损硬件，还可能造成损坏。如果机器人能像人一样，先在&amp;quot;脑海&amp;quot;中模拟一下，再决定怎么做，那效率会有质的飞跃。&lt;/p&gt;
&lt;p&gt;世界模型，就是机器人的&amp;quot;想象力&amp;quot;。&lt;/p&gt;
&lt;h2 id="世界模型到底在做什么"&gt;世界模型到底在做什么&lt;/h2&gt;
&lt;p&gt;用一句话概括：世界模型学习的是&amp;quot;如果我执行某个动作，环境会怎么变化&amp;quot;。&lt;/p&gt;
&lt;p&gt;技术上说，世界模型是一个环境的内部模拟器。它接收当前的状态和要执行的动作作为输入，输出预测的下一个状态和可能获得的奖励。形式化地表示：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`下一个状态 = 世界模型(当前状态, 动作)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;预测奖励 = 奖励函数(当前状态, 动作)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这看起来很简单，但它的能力取决于模型学到了多好的环境动态。一个好的世界模型，能够准确预测几百步甚至上千步之后的环境状态。&lt;/p&gt;
&lt;p&gt;有了世界模型之后，策略训练就变成了一个完全不同的游戏。机器人不需要在真实环境中试错，而是在世界模型构建的&amp;quot;想象空间&amp;quot;中训练。就像下棋的高手，不需要真的走每一步，而是在脑海中推演多种可能的走法，然后选择最优的。&lt;/p&gt;
&lt;h2 id="dreamerv3当前最强的世界模型之一"&gt;DreamerV3：当前最强的世界模型之一&lt;/h2&gt;
&lt;p&gt;说到世界模型在机器人领域的应用，就不得不提Dreamer系列。这是Danijar Hafner等人从2020年开始持续迭代的工作，到2023年的DreamerV3已经在多个基准测试上达到了SOTA。&lt;/p&gt;
&lt;p&gt;DreamerV3的核心架构有三个关键组件：&lt;/p&gt;
&lt;h3 id="1-rssm循环状态空间模型"&gt;1. RSSM：循环状态空间模型&lt;/h3&gt;
&lt;p&gt;RSSM（Recurrent State-Space Model）是世界模型的&amp;quot;记忆体&amp;quot;。它维护两种状态：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;确定性状态 hₜ：捕捉环境的长期趋势和规律，比如&amp;quot;物体A在桌子左边&amp;quot;这种相对稳定的信息。&lt;/li&gt;
&lt;li&gt;随机性状态 zₜ：捕捉环境的即时不确定性，比如&amp;quot;物体A的精确位置可能有几毫米的偏差&amp;quot;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;为什么需要两种状态？因为真实世界既有确定性的一面（物理规律），也有不确定性的一面（传感噪声、未建模的动态）。传统的RNN只有一种隐状态，很难同时处理这两种特性。RSSM通过双轨设计，让模型既能记住长期规律，又能表达短期不确定性。&lt;/p&gt;
&lt;h3 id="2-actor-critic在想象中训练策略"&gt;2. Actor-Critic：在想象中训练策略&lt;/h3&gt;
&lt;p&gt;有了世界模型之后，怎么训练机器人的行为策略？DreamerV3用的是Actor-Critic方法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Actor（演员）：负责选择动作。给定当前状态，输出一个动作分布。&lt;/li&gt;
&lt;li&gt;Critic（评论家）：负责评估。给定当前状态，预测未来能获得的累计奖励。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;关键创新在于：Actor和Critic的训练完全在想象空间中进行。从经验回放池中采样起始状态，然后用世界模型&amp;quot;展开&amp;quot;一条轨迹（默认15步），在这条想象的轨迹上计算损失并更新网络。&lt;/p&gt;
&lt;p&gt;这意味着什么？意味着机器人可以在&amp;quot;梦&amp;quot;中练习几百万次，而不需要动一下真实的硬件。&lt;/p&gt;
&lt;h3 id="3-对称对数损失让训练更稳定"&gt;3. 对称对数损失：让训练更稳定&lt;/h3&gt;
&lt;p&gt;DreamerV3相比前代最大的改进之一，是引入了对称对数（symlog）变换来处理奖励和价值的尺度问题。&lt;/p&gt;
&lt;p&gt;不同任务的奖励尺度可能差异巨大——有的任务奖励是0到1，有的是0到10000。传统方法需要对每个任务手动缩放奖励，这很不优雅。DreamerV3通过对称对数变换，自动将任意尺度的奖励压缩到一个合理范围内，实现了真正的&amp;quot;一个算法跑所有任务&amp;quot;。&lt;/p&gt;
&lt;h2 id="与传统强化学习的本质区别"&gt;与传统强化学习的本质区别&lt;/h2&gt;
&lt;p&gt;很多人会问：这不就是强化学习吗？有什么区别？&lt;/p&gt;
&lt;p&gt;区别在于样本效率。&lt;/p&gt;
&lt;p&gt;传统的强化学习（比如PPO、SAC）是无模型（model-free）的。它们直接从环境交互中学习策略，不需要理解环境的动态。这就像一个人通过不断试错来学骑自行车——摔了很多次之后，身体&amp;quot;记住&amp;quot;了怎么保持平衡。&lt;/p&gt;
&lt;p&gt;世界模型方法是有模型（model-based）的。它先学习环境的动态模型，然后在模型中训练策略。这更像一个人先理解自行车的物理原理（重心、角动量、转向几何），然后在脑海中模拟骑行的过程，最后再实际上车。&lt;/p&gt;
&lt;p&gt;在实际效果上，DreamerV3的样本效率通常比PPO高出10到100倍。也就是说，达到同样的性能，DreamerV3可能只需要真实环境交互10万步，而PPO需要1000万步。对于机器人来说，这意味着训练时间从几周缩短到几小时。&lt;/p&gt;
&lt;h2 id="应用场景不只是游戏"&gt;应用场景：不只是游戏&lt;/h2&gt;
&lt;p&gt;DreamerV3最初在Atari游戏上展示了惊人的能力——用同一套超参数，在55款游戏中都取得了不错的成绩。但它的能力远不止于此。&lt;/p&gt;
&lt;p&gt;在机器人领域，世界模型已经开始在以下场景中展现价值：&lt;/p&gt;
&lt;p&gt;工业装配：机器人需要学会将不同形状的零件装配到产品上。传统方法需要为每种零件编写专门的程序，而世界模型方法可以通过想象训练快速适配新零件。&lt;/p&gt;
&lt;p&gt;灵巧操作：比如翻转物体、拧瓶盖、系鞋带等需要精细力控的任务。这些任务在仿真中很难精确建模，世界模型可以从少量真实数据中学习到复杂的接触动态。&lt;/p&gt;
&lt;p&gt;导航与探索：在未知环境中规划路径。世界模型可以预测&amp;quot;如果我往那边走，会看到什么&amp;quot;，从而做出更好的探索决策。&lt;/p&gt;
&lt;h2 id="局限性与未来"&gt;局限性与未来&lt;/h2&gt;
&lt;p&gt;当然，世界模型不是万能的。它目前面临几个主要挑战：&lt;/p&gt;
&lt;p&gt;长程预测误差累积：世界模型的预测不可能完美，每一步都有小误差，多步之后误差会指数级放大。目前DreamerV3的想象步数限制在15步左右，更长的预测会变得不可靠。&lt;/p&gt;
&lt;p&gt;复杂物理场景：对于涉及流体、软体、复杂接触的场景，世界模型的预测精度还不够高。比如抓取一块布料，布料的形变很难准确预测。&lt;/p&gt;
&lt;p&gt;计算成本：训练一个高质量的世界模型需要大量的计算资源。虽然推理时很高效，但训练阶段并不便宜。&lt;/p&gt;
&lt;p&gt;这些挑战也是当前研究的前沿方向。我相信在未来2-3年内，随着模型架构的改进和计算效率的提升，世界模型会在更多真实机器人场景中落地。&lt;/p&gt;
&lt;h2 id="写在最后"&gt;写在最后&lt;/h2&gt;
&lt;p&gt;世界模型的核心思想其实很朴素：先理解世界，再决定行动。这和人类的学习方式是一致的。我们不会一开始就盲目尝试，而是先观察、理解、预测，然后才采取行动。&lt;/p&gt;</description></item></channel></rss>