<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>文章 on WorldSense 技术笔记</title><link>https://www.worldsensetech.com/zh/articles/</link><description>Recent content in 文章 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.worldsensetech.com/zh/articles/index.xml" rel="self" type="application/rss+xml"/><item><title>机器人世界模型到底在做什么？从感知到行动的完整链路</title><link>https://www.worldsensetech.com/zh/articles/2026-08-26-world-model-in-robotics/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-26-world-model-in-robotics/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Dreamer 系列 · 第 2 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-25-dreamer-explained/"&gt;上一篇&lt;/a&gt;从架构层面拆解了 Dreamer 的整体设计。这篇把视角拉远一步：世界模型在整个机器人系统中到底处于什么位置？从传感器数据到最终执行动作，中间经历了哪些环节？本文不讨论如何训练一个通用机器人世界模型，而讨论它在机器人系统中的功能位置。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="一一个根本区别机器人世界模型和语言模型完全不同"&gt;一、一个根本区别：机器人世界模型和语言模型完全不同&lt;/h2&gt;
&lt;p&gt;过去几年，&amp;ldquo;模型&amp;quot;这个词在 AI 领域被反复使用。语言模型预测下一个 token，视觉模型预测下一帧图像，自动驾驶模型预测交通参与者的行为。它们都在做某种&amp;quot;预测&amp;rdquo;，但预测的对象和约束条件差异很大。&lt;/p&gt;
&lt;p&gt;机器人世界模型面对的问题有一个根本不同：&lt;strong&gt;它需要学习 action-conditioned future dynamics&lt;/strong&gt;——给定当前观察和行动，预测未来可能出现的状态、观测以及任务相关结果。注意这里用&amp;quot;观测&amp;quot;而不是&amp;quot;状态&amp;quot;，因为不同类型的世界模型预测的对象不同：Dreamer RSSM 在 latent space 中预测（latent → latent），video world model 在像素空间预测（action + video → future video），&amp;ldquo;state&amp;quot;并不是统一接口。&lt;/p&gt;
&lt;p&gt;想象一个场景：桌上的机械臂要推开一个杯子。在真正执行之前，它需要预测：手接触杯子后，杯子会往哪个方向滑？如果杯子太重推不动怎么办？如果桌面很滑，杯子会不会飞出去？&lt;/p&gt;
&lt;p&gt;这种预测不是从语言中学到的&amp;quot;杯子通常放在桌上&amp;quot;这种语义知识，而是&amp;quot;手以某个角度接触杯子、施加某个力，杯子会沿桌面滑动大约 10cm&amp;quot;这种与行动相关的未来预测。&lt;/p&gt;
&lt;p&gt;我觉得这是理解机器人世界模型最重要的出发点。语言模型通过海量文本学会了语言结构，视觉模型通过海量图像学会了视觉规律，而机器人世界模型需要通过交互经验学会行动与后果之间的关系。&lt;/p&gt;
&lt;p&gt;但这里有一个很重要的区分：世界模型并不需要显式恢复完整的物理规律。它可能只需要在 latent space 中预测：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;latent_t + action
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;latent_{t+1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;未来任务相关结果
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而不需要真的知道：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;摩擦系数 = 0.31
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;质量 = 247g
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;接触力 = 1.8N
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;&lt;strong&gt;世界模型不是为了&amp;quot;还原世界&amp;rdquo;，而是为了预测行动相关的未来。&lt;/strong&gt; 这条主线会贯穿整篇文章。&lt;/p&gt;
&lt;h2 id="二机器人世界模型到底在预测什么"&gt;二、机器人世界模型到底在预测什么？&lt;/h2&gt;
&lt;p&gt;用一句话概括：世界模型学习的是&amp;quot;如果执行某个动作，决策相关的状态会怎么变化&amp;quot;。&lt;/p&gt;
&lt;p&gt;技术上说，世界模型学习状态转移动态（state transition dynamics），并通常额外学习 reward、continuation 等任务相关预测头：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;WorldModel:
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; dynamics: (s_t, a_t) → s_{t+1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; heads: s_{t+1} → r_t, γ_t, ...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;实际实现中，世界模型通常不是直接预测完整的原始状态，而是在隐空间中预测 latent dynamics。&lt;/p&gt;</description></item><item><title>读懂 Dreamer：世界模型是怎么学会'想象'的？</title><link>https://www.worldsensetech.com/zh/articles/2026-08-25-dreamer-explained/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-25-dreamer-explained/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Dreamer 系列 · 第 1 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;本篇从架构层面讲清楚 Dreamer 的整体设计。如果你已经读过 &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;RSSM 代码解析系列&lt;/a&gt;，这篇可以帮你把零散的代码细节串成完整的架构理解。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;Dreamer 最重要的思想，不是&amp;quot;训练一个会生成未来画面的模型&amp;quot;，而是&lt;strong&gt;训练一个足够支持决策的 latent world model，然后让策略在这个内部世界里学习&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;这篇文章围绕这条主线，把 Dreamer 的设计逻辑从头到尾讲一遍。&lt;/p&gt;
&lt;h2 id="一dreamer-到底在解决什么问题"&gt;一、Dreamer 到底在解决什么问题？&lt;/h2&gt;
&lt;p&gt;强化学习的核心循环是：智能体与环境交互 → 获得奖励 → 改进策略。这个循环的问题在于，每一步交互都需要真实的环境计算——对于机器人控制这类复杂任务，这意味着大量的仿真时间甚至真实机器人时间。&lt;/p&gt;
&lt;p&gt;Dreamer 的思路是：与其在真实环境中反复试错，不如先&lt;strong&gt;学一个世界模型&lt;/strong&gt;，然后在模型的&amp;quot;想象&amp;quot;中训练策略。&lt;/p&gt;
&lt;p&gt;这听起来简单，但要做到需要解决几个关键问题：世界模型怎么表征环境状态？怎么从想象中学出有用的策略？怎么避免想象误差把策略带偏？&lt;/p&gt;
&lt;p&gt;从 V1 到 V3，Dreamer 的演进可以粗略理解成三个方向：更好的 latent representation、更稳定的 imagination learning，以及更强的跨任务泛化能力。&lt;/p&gt;
&lt;h2 id="二dreamer-为什么主要在-latent-space-中预测"&gt;二、Dreamer 为什么主要在 latent space 中预测？&lt;/h2&gt;
&lt;p&gt;在讲架构之前，先建立一个最重要的直觉。&lt;/p&gt;
&lt;p&gt;Dreamer 并不是完全不预测 observation，而是&lt;strong&gt;不需要把未来像素级视频作为策略学习的主要载体&lt;/strong&gt;。Dreamer 的关键是在 latent space 中学习对预测和决策有用的 dynamics。&lt;/p&gt;
&lt;p&gt;假设机器人当前看到一张 1024×1024 的 RGB 图像。如果世界模型每一步都必须精确预测下一帧的每一个像素，大量计算都会浪费在与决策无关的视觉细节上。Dreamer 的做法是先把观测压缩成 latent state，再在 latent space 中预测未来。只要 latent representation 保留了与预测和决策相关的信息，就不必要求世界模型精确重建未来画面的每一个像素。&lt;/p&gt;
&lt;p&gt;换句话说，&lt;strong&gt;Dreamer 不是预测世界&amp;quot;长什么样&amp;quot;，而是预测决策需要知道的世界状态。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这是理解后续所有设计的核心出发点。&lt;/p&gt;
&lt;h2 id="三全局架构图"&gt;三、全局架构图&lt;/h2&gt;
&lt;p&gt;Dreamer 的训练可以理解成两个循环：**Observe（观察）**负责从真实环境数据学习世界模型；**Imagine（想象）**负责在 latent space 中生成未来轨迹，并利用这些轨迹训练策略。&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（六）：默认配置、四条公式与代码↔数学↔语义对照</title><link>https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 6 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 6 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;
&lt;strong&gt;6. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="二十五默认配置拆成rssm-架构与world-model-训练两张表"&gt;二十五、默认配置：拆成&amp;quot;RSSM 架构&amp;quot;与&amp;quot;World-model 训练&amp;quot;两张表&lt;/h2&gt;
&lt;p&gt;为了避免把&amp;quot;RSSM 架构参数&amp;quot;和&amp;quot;world-model / agent 训练配置&amp;quot;混在一起，下面把配置拆成两张表。&lt;/p&gt;
&lt;h3 id="rssm-architecturerssm-架构"&gt;RSSM architecture（RSSM 架构）&lt;/h3&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;参数&lt;/th&gt;
					&lt;th style="text-align: right"&gt;默认值&lt;/th&gt;
					&lt;th style="text-align: left"&gt;含义&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;deter&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;8192&lt;/td&gt;
					&lt;td style="text-align: left"&gt;deterministic state 维度（会被 blocks 切分）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;stoch&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;32&lt;/td&gt;
					&lt;td style="text-align: left"&gt;categorical variable 数量&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;classes&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;64&lt;/td&gt;
					&lt;td style="text-align: left"&gt;每个 categorical variable 的类别数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;blocks&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;8&lt;/td&gt;
					&lt;td style="text-align: left"&gt;Block GRU 分组数量（8192 / 8 = 1024）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;hidden&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1024&lt;/td&gt;
					&lt;td style="text-align: left"&gt;RSSM 内部 MLP hidden dimension&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;imglayers&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;2&lt;/td&gt;
					&lt;td style="text-align: left"&gt;prior 网络层数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;obslayers&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1&lt;/td&gt;
					&lt;td style="text-align: left"&gt;posterior 网络层数&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;dynlayers&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1&lt;/td&gt;
					&lt;td style="text-align: left"&gt;dynamics 网络层数&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id="rssm--world-model-trainingrssm-与世界模型训练配置"&gt;RSSM / world-model training（RSSM 与世界模型训练配置）&lt;/h3&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;参数&lt;/th&gt;
					&lt;th style="text-align: right"&gt;默认值&lt;/th&gt;
					&lt;th style="text-align: left"&gt;含义&lt;/th&gt;
					&lt;th style="text-align: left"&gt;归属&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;unimix&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;0.01&lt;/td&gt;
					&lt;td style="text-align: left"&gt;categorical distribution 的均匀混合比例&lt;/td&gt;
					&lt;td style="text-align: left"&gt;RSSM 内部分布&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;free_nats&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1.0&lt;/td&gt;
					&lt;td style="text-align: left"&gt;KL 的 loss floor（&lt;code&gt;max(KL, 1)&lt;/code&gt;）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;RSSM 内部&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;dyn_scale&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;1.0&lt;/td&gt;
					&lt;td style="text-align: left"&gt;dynamics KL 在最终 loss 中的权重&lt;/td&gt;
					&lt;td style="text-align: left"&gt;agent loss scale&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;rep_scale&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;0.1&lt;/td&gt;
					&lt;td style="text-align: left"&gt;representation KL 在最终 loss 中的权重&lt;/td&gt;
					&lt;td style="text-align: left"&gt;agent loss scale&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;&lt;code&gt;imag_length&lt;/code&gt;&lt;/td&gt;
					&lt;td style="text-align: right"&gt;15&lt;/td&gt;
					&lt;td style="text-align: left"&gt;imagination rollout 的训练步数&lt;/td&gt;
					&lt;td style="text-align: left"&gt;agent 训练配置（非 RSSM 结构）&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;关键点：&lt;/strong&gt;&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（五）：Imagine、Observe/Imagine 区别、序列训练与 Reset</title><link>https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 5 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 5 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;
&lt;strong&gt;5. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="二十imagine-阶段没有-observationrssm-怎么跑"&gt;二十、Imagine 阶段：没有 observation，RSSM 怎么跑？&lt;/h2&gt;
&lt;p&gt;这是 RSSM 最漂亮的地方。&lt;/p&gt;
&lt;p&gt;训练真实轨迹时需要 observation 来计算 &lt;code&gt;q(z_t|h_t,o_t)&lt;/code&gt;。但 imagination 阶段没有真实 observation。&lt;/p&gt;
&lt;p&gt;直接使用 &lt;code&gt;p(z_t|h_t)&lt;/code&gt;，也就是 prior：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;z_t ~ p(z_t | h_t)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;源码中的 &lt;code&gt;imagine()&lt;/code&gt; 内部同样先走 &lt;code&gt;_core()&lt;/code&gt;，再用 prior 产生 latent：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;deter &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; &lt;span style="font-style:italic"&gt;self&lt;/span&gt;&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;_core(
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; carry[&lt;span style="color:#f1fa8c"&gt;&amp;#39;deter&amp;#39;&lt;/span&gt;],
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; carry[&lt;span style="color:#f1fa8c"&gt;&amp;#39;stoch&amp;#39;&lt;/span&gt;],
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; actemb
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;logit &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; &lt;span style="font-style:italic"&gt;self&lt;/span&gt;&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;_prior(deter)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; &lt;span style="font-style:italic"&gt;self&lt;/span&gt;&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;_dist(logit)&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;sample(&lt;span style="color:#ff79c6"&gt;...&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;注意：&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（四）：KL balancing、Free Nats 与最终 KL 组合</title><link>https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 4 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 4 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;
&lt;strong&gt;4. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="十四observe-阶段完整数据流observe--imagine-同一框架"&gt;十四、Observe 阶段完整数据流（Observe / Imagine 同一框架）&lt;/h2&gt;
&lt;p&gt;到这里，可以把整个 RSSM 的状态转移框架画出来，并且把 &lt;strong&gt;Observe 与 Imagine 放在同一个 &lt;code&gt;_core()&lt;/code&gt; 转移框架里&lt;/strong&gt;：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ┌──────────────────────────┐
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ RSSM transition │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;(h_{t-1},z_{t-1}) + a_{t-1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; _core()
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; h_t
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ┌──────┴──────┐
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼ ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; Prior Observation
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; p(z_t | h_t) │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ Posterior
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ q(z_t|h_t,o_t)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │ z_t
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; └───────┬─────┘
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; latent state
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; next step
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;在旁边注明两种用法，其实这就是全文最重要的两句话：&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（三）：确定性转移 _core()、deter=8192 与 Block GRU</title><link>https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/</link><pubDate>Fri, 21 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 3 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 3 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;
&lt;strong&gt;3. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="九真正的-deterministic-transition_core"&gt;九、真正的 deterministic transition：&lt;code&gt;_core()&lt;/code&gt;&lt;/h2&gt;
&lt;p&gt;这是整个 &lt;code&gt;rssm.py&lt;/code&gt; 中最值得读的部分。&lt;/p&gt;
&lt;p&gt;源码并不是简单调用：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;nn&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;GRUCell(&lt;span style="color:#ff79c6"&gt;...&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而是自己构造了一个 block-wise GRU。&lt;/p&gt;
&lt;p&gt;核心输入包括：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;deter
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;action
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;首先：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch &lt;span style="color:#ff79c6"&gt;=&lt;/span&gt; stoch&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;reshape((stoch&lt;span style="color:#ff79c6"&gt;.&lt;/span&gt;shape[&lt;span style="color:#bd93f9"&gt;0&lt;/span&gt;], &lt;span style="color:#ff79c6"&gt;-&lt;/span&gt;&lt;span style="color:#bd93f9"&gt;1&lt;/span&gt;))
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;也就是：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;[B, 32, 64]
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ▼
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;[B, 2048]
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后把 &lt;code&gt;deter&lt;/code&gt;、&lt;code&gt;stoch&lt;/code&gt;、&lt;code&gt;action&lt;/code&gt; 各自通过一个输入映射（注意：这里的&amp;quot;分别 Linear 映射再 concat&amp;quot;是概念示意图，&lt;strong&gt;真正的核心在于 BlockLinear 的结构化参数化&lt;/strong&gt;，见下一节）：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;deter ──► Linear ──┐
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;stoch ──► Linear ──┼──► concat ──► Block GRU
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; │
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;action ─► Linear ──┘
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;注意：&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（二）：先验/后验、straight-through 采样与 unimix</title><link>https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 2 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 2 篇，已加粗；上/下一篇见文末导航）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;
&lt;strong&gt;2. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/blockquote&gt;
&lt;h2 id="四把源码翻译成数学公式注意时间索引"&gt;四、把源码翻译成数学公式（注意时间索引）&lt;/h2&gt;
&lt;p&gt;DreamerV3 的递推关系可以写成：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;h_t = f(h_{t-1}, z_{t-1}, a_{t-1})
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;然后分别计算：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;p(z_t | h_t) [prior，不读 observation]
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;q(z_t | h_t, o_t) [posterior，读 observation]
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;其中：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;p&lt;/code&gt;：prior；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;q&lt;/code&gt;：posterior；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;o_t&lt;/code&gt;：当前 observation；&lt;/li&gt;
&lt;li&gt;&lt;code&gt;h_t&lt;/code&gt;：deterministic state。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;一个非常重要、但初学者很容易卡住的时间索引说明：&lt;/strong&gt;&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;code&gt;h_t = f(h_{t-1}, z_{t-1}, a_{t-1})&lt;/code&gt; 中的 &lt;code&gt;h_t&lt;/code&gt; 已经融合了截至 &lt;code&gt;t-1&lt;/code&gt; 的 latent / action 历史，但&lt;strong&gt;它并不包含当前 &lt;code&gt;o_t&lt;/code&gt;&lt;/strong&gt;。当前 observation 只在 &lt;strong&gt;posterior 分支&lt;/strong&gt;中用于推断 &lt;code&gt;z_t&lt;/code&gt;，而不进入 deterministic transition。&lt;/p&gt;</description></item><item><title>从代码理解 RSSM（一）：RSSM 在 DreamerV3 中的位置与 stochastic 状态</title><link>https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;《从代码理解 RSSM》系列 · 第 1 篇 / 共 6 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;系列目录（当前在第 1 篇，已加粗；上/下一篇见文末导航）：
&lt;strong&gt;1. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-19-rssm-code-walkthrough/"&gt;（一）RSSM 的位置与 stochastic 状态&lt;/a&gt;&lt;/strong&gt;
2. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-20-rssm-stochastic-state/"&gt;（二）先验/后验、straight-through 与 unimix&lt;/a&gt;
3. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-21-rssm-deterministic-core/"&gt;（三）_core()、deter=8192 与 Block GRU&lt;/a&gt;
4. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-22-rssm-kl-balancing/"&gt;（四）KL balancing、Free Nats 与最终 KL&lt;/a&gt;
5. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-23-rssm-imagine-reset/"&gt;（五）Imagine、Observe/Imagine 区别与 Reset&lt;/a&gt;
6. &lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-24-rssm-recap/"&gt;（六）默认配置、四条公式与对照表&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;源码阅读提示&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;本文有意不从&amp;quot;标准 RSSM 伪代码&amp;quot;开始，而是按照 &lt;code&gt;rssm.py&lt;/code&gt; 的实际执行路径展开。阅读时可以重点关注下面几个函数：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;observe() → sequence-level wrapper，沿时间维调用 _observe()
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;_observe() → 单个时间步的状态推断（真实轨迹）
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;_core() → 单个时间步的 deterministic dynamics
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;imagine() → 无 observation 的 latent rollout
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这里最容易混淆的一点是：&lt;strong&gt;&lt;code&gt;observe()&lt;/code&gt; 并不是一个&amp;quot;处理单步 transition&amp;quot;的函数&lt;/strong&gt;。它只是 sequence-level 的封装，内部通过 Ninjax 的 &lt;code&gt;nj.scan(...)&lt;/code&gt; 沿着时间维度反复调用 &lt;code&gt;_observe()&lt;/code&gt;；真正处理单个时间步的是 &lt;code&gt;_observe()&lt;/code&gt; 与 &lt;code&gt;_core()&lt;/code&gt;。把 &lt;code&gt;observe() / _observe() / _core() / imagine()&lt;/code&gt; 这一层调用关系理清，基本就能理解 DreamerV3 RSSM 的主体。&lt;/p&gt;</description></item><item><title>世界模型风口被放大了：技术辨析与冷思考</title><link>https://www.worldsensetech.com/zh/articles/2026-08-18-world-model-ai-trend/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-18-world-model-ai-trend/</guid><description>&lt;!-- raw HTML omitted --&gt;
&lt;p&gt;说说我的看法：世界模型不是风口叙事，它是一个真实存在的技术方向，但目前市面上大量讨论关注的是生成能力，而不是世界模型真正需要解决的环境预测、因果建模和规划问题。&lt;/p&gt;
&lt;h2 id="先厘清一个概念现在大家说的世界模型其实不是一回事"&gt;先厘清一个概念：现在大家说的&amp;quot;世界模型&amp;quot;其实不是一回事&lt;/h2&gt;
&lt;p&gt;LeCun 提的世界模型（JEPA 架构）和李飞飞讲的世界空间（World Space），两者关注的问题重叠——都涉及表征学习和世界理解——但技术路线和侧重点不同。LeCun 想在抽象表征空间做预测，避开像素级生成的计算开销；李飞飞更偏 3D 场景理解和生成。而工业界现在做的，比如游戏领域的 Genie、Genie 2，更接近 action-conditioned interactive world model——你给它一个动作，它预测下一个环境状态——但其主要能力仍集中在视觉环境生成和短时动态预测上。&lt;/p&gt;
&lt;p&gt;这些东西有价值，但它们解决的问题不一样。如果把&amp;quot;能生成下一帧画面&amp;quot;等同于&amp;quot;形成了稳定的、可迁移的、可用于规划的环境状态表示&amp;quot;——这里说的&amp;quot;理解&amp;quot;不是人类语义理解，而是这个意思——那这个风口确实被放大了。&lt;/p&gt;
&lt;h2 id="真正的难点不在预测在于稳定的环境表征"&gt;真正的难点不在预测，在于稳定的环境表征&lt;/h2&gt;
&lt;p&gt;我自己跑 DreamerV3 的时候有一个很深的体会：RSSM（Recurrent State-Space Model）确实能学到一些动态规律——比如在 MuJoCo 的 cartpole 任务上，它可以在想象空间里预测杆子的摆动轨迹，训练出来的策略还能用。但如果仔细看它想象出来的状态，会发现稍微复杂一点的任务，预测就开始模糊、发散。&lt;/p&gt;
&lt;p&gt;原因不复杂：RSSM 学习的是任务相关的隐状态动力学，而不是显式的 3D 物理世界模型。它在训练分布内表现不错，但不一定形成类似物理规律的显式表示，因此面对分布外情况时，可能无法像物理模型一样进行可靠外推。&lt;/p&gt;
&lt;p&gt;这个差距，就是当前世界模型研究最核心的问题。&lt;/p&gt;
&lt;h2 id="物理先验注入是重要方向之一"&gt;物理先验注入，是重要方向之一&lt;/h2&gt;
&lt;p&gt;如果目标是提升世界模型的稳定性和泛化能力，单纯靠加大数据量、堆 transformer 层数可能不够。把物理约束——比如能量守恒、碰撞检测、刚体动力学——作为先验注入到模型结构里，是一条值得探索的路径，让模型在学动态的时候不是从零开始猜，而是沿着物理上合理的路径去学。&lt;/p&gt;
&lt;p&gt;在我的实验中，加入特定物理约束后，部分任务上的训练稳定性和长时间预测表现有所改善——比如不容易出现&amp;quot;杆子穿模&amp;quot;或者&amp;quot;物体突然消失&amp;quot;这种在纯数据驱动模型里常见的问题。当然，物理先验不是唯一路线，scaling、多模态预训练、对象级学习也各有各的空间。&lt;/p&gt;
&lt;h2 id="对象级世界模型另一个绕不开的方向"&gt;对象级世界模型，另一个绕不开的方向&lt;/h2&gt;
&lt;p&gt;前面说的 RSSM、JEPA 更多是在整体 latent space 或像素空间做预测。但&amp;quot;理解物理世界&amp;quot;还有另一条路径：让模型从像素或 latent 转向实体、关系和状态变化的建模——也就是 object-centric representation。通过 slot attention、scene graph 这类方法，把场景分解为独立的对象和它们之间的交互关系，然后对每个对象的动力学分别建模。&lt;/p&gt;
&lt;p&gt;这条路线的好处是泛化性更强——你见过桌子上的杯子被推，换到桌子上的碗被推，对象级模型更容易迁移。而整体 latent 模型可能需要重新学。&lt;/p&gt;
&lt;h2 id="世界模型和-vla-的关系需要更准确地看"&gt;世界模型和 VLA 的关系，需要更准确地看&lt;/h2&gt;
&lt;p&gt;现在行业里很火的 VLA（Vision-Language-Action）路线，比如 RT-2、π0，当前主流 VLA 主要优化视觉语言到动作的映射，而显式环境预测和长期规划能力仍然是其薄弱环节。需要注意的是，这些模型内部的 transformer 确实有 latent prediction 和 action chunking 机制，并非完全没有规划能力，只是这种规划是隐式的、短视的。&lt;/p&gt;</description></item><item><title>跑 DreamerV3 该租云 GPU 还是自建工作站？一个工程师的成本账</title><link>https://www.worldsensetech.com/zh/articles/2026-08-17-dreamerv3-gpu-infrastructure/</link><pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-17-dreamerv3-gpu-infrastructure/</guid><description>&lt;p&gt;前面几篇文章讲了 DreamerV3 的环境搭建和训练技巧。但有一个更基础的问题经常被忽略：&lt;strong&gt;你在什么硬件上跑？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;这个问题看似简单，实际上直接影响你的研究节奏和钱包。我用了一个月的 AutoDL 云 GPU，又花了一周时间规划自建工作站，中间还收到了供应商 ¥36,000 的整机报价。这篇文章把整个过程和算账结果分享出来，希望能给同样在纠结&amp;quot;租还是买&amp;quot;的朋友一个参考。&lt;/p&gt;
&lt;h2 id="先说结论"&gt;先说结论&lt;/h2&gt;
&lt;p&gt;如果你确认自己会长期维持较高的 GPU 使用率，自建工作站值得认真做一次成本测算。按照我实际使用的 ¥2.58/GPU 小时计算，每天 12 小时的简单静态平衡点约 29 个月，每天 18 小时约 19 个月。纯经济账并不意味着&amp;quot;买一定比租便宜&amp;quot;——12 小时并不是一个&amp;quot;买了马上省钱&amp;quot;的分界线。但高频研究场景下，本地机器在等待时间、环境稳定性和数据管理上的优势，可能具有更高价值。&lt;/p&gt;
&lt;p&gt;但&amp;quot;回本&amp;quot;不是唯一考量。自建工作站还有一个云 GPU 给不了的优势：&lt;strong&gt;随时可用、数据本地、不用排队、不用惦记关机省钱&lt;/strong&gt;。对于需要高频迭代的研究工作，这个体验差异是巨大的。&lt;/p&gt;
&lt;h2 id="第一阶段autodl-云-gpu-的实际花费"&gt;第一阶段：AutoDL 云 GPU 的实际花费&lt;/h2&gt;
&lt;p&gt;我最初的选择是 AutoDL——国内最常用的 GPU 云平台之一，按小时计费，机型丰富，不用自己维护环境。对于刚开始跑 DreamerV3 实验来说，这是最合理的选择。&lt;/p&gt;
&lt;h3 id="实际花费"&gt;实际花费&lt;/h3&gt;
&lt;p&gt;我实际使用的 AutoDL 实例折算下来约为 &lt;strong&gt;¥2.58/GPU 小时&lt;/strong&gt;（RTX 4090D 机型）。偶尔遇到过更低的短时优惠价（约 ¥1.67/h），但下面按 ¥2.58/h 这个实际常规价格估算月/年费用。&lt;/p&gt;
&lt;p&gt;两天花了 ¥100 左右。听起来不多，但换算一下：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style="text-align: left"&gt;GPU 日均运行时长&lt;/th&gt;
					&lt;th style="text-align: left"&gt;月花费&lt;/th&gt;
					&lt;th style="text-align: left"&gt;年花费&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 4 小时（轻度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥310&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥3,764&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 8 小时（中度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥619&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥7,530&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 12 小时（重度）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥929&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥11,299&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style="text-align: left"&gt;每天 18 小时（极限）&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥1,393&lt;/td&gt;
					&lt;td style="text-align: left"&gt;约 ¥16,943&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;注意这只是 GPU 租赁费用，还没算存储费用（AutoDL 的系统盘和数据盘另计费）和网络传输成本。&lt;/p&gt;</description></item><item><title>为什么说 2026 年，AI 在疯狂寻找物理外壳？</title><link>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</guid><description>&lt;p&gt;从 Ray-Ban Meta、PLAUD、Amazon Bee，到 Rabbit R1、机器狗和人形机器人：AI 正在一件一件地给自己补齐&amp;quot;器官&amp;quot;。&lt;/p&gt;
&lt;p&gt;如果过去两年 AI 的主流产品是 ChatGPT、Claude、Cursor，那么 2026 年让我觉得最有意思的变化，是 AI 开始从屏幕里&amp;quot;搬家&amp;quot;。&lt;/p&gt;
&lt;p&gt;它住进了眼镜、胸针、耳机、小盒子、机器狗和人形机器人。&lt;/p&gt;
&lt;p&gt;有的给 AI 一双眼睛，有的给它一双耳朵，有的给它记忆，有的给它显示器，有的甚至开始给它手和腿。&lt;/p&gt;
&lt;p&gt;所以我越来越觉得，&amp;ldquo;AI 在寻找物理外壳&amp;quot;并不是一个比喻。&lt;/p&gt;
&lt;p&gt;但这里的&amp;quot;外壳&amp;quot;不一定意味着人形机器人。它可能是一副眼镜、一枚胸针、一条腕带、一台机器狗，也可能最终是一台真正能够在现实世界里行动的人形机器人。它们其实都在尝试解决同一个问题：AI 如何从&amp;quot;理解世界&amp;rdquo;，变成&amp;quot;存在于世界&amp;quot;。&lt;/p&gt;
&lt;p&gt;我是一个做世界模型方向的工程师，日常和 MuJoCo、DreamerV3 打交道。但最近半年越来越关注 AI 硬件——因为我做的世界模型、仿真训练和 sim-to-real，最终面对的一个重要问题，就是如何让 AI 从&amp;quot;理解世界&amp;quot;走向&amp;quot;作用于世界&amp;quot;。而这些 AI，迟早需要某种物理载体。&lt;/p&gt;
&lt;p&gt;这篇文章不是技术综述，更像是一个&amp;quot;AI 硬件逛展式观察&amp;quot;。我想按一个有意思的角度来聊：AI 正在按器官逐一获得物理形态——从感知到交互再到行动，逐步构建完整的身体。当然，&amp;ldquo;器官&amp;quot;在这里是一个比喻，更准确地说，是 AI 正在获得不同的物理接口。&lt;/p&gt;
&lt;h2 id="ai-的眼睛ray-ban-meta"&gt;AI 的眼睛：Ray-Ban Meta&lt;/h2&gt;
&lt;p&gt;&lt;img src="https://www.worldsensetech.com/images/ai-shell-rayban-meta.png" alt="Ray-Ban Meta Gen 2 智能眼镜"&gt;&lt;/p&gt;
&lt;p&gt;我第一个想聊的不是机器人，而是一副眼镜。&lt;/p&gt;
&lt;p&gt;2025 年 9 月发布的 Ray-Ban Meta Gen 2，到 2026 年，它已经成为 AI 眼镜里最成熟、也最接近大众消费电子的一种产品形态。它有意思的地方恰恰在于：它看起来不像 AI 产品。没有大屏幕，没有科幻造型。它就是一副普通眼镜，但里面塞了摄像头、麦克风、扬声器和 AI。&lt;/p&gt;
&lt;p&gt;它真正有意思的能力不是&amp;quot;可以问 ChatGPT&amp;rdquo;。而是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;AI 可以看到你正在看的东西。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&amp;ldquo;这是什么植物？&amp;ldquo;&amp;ldquo;帮我翻译这个菜单。&amp;ldquo;&amp;ldquo;这个零件叫什么？&amp;quot;——AI 获得了一个非常特殊的输入：佩戴者的第一视角。&lt;/p&gt;
&lt;p&gt;我觉得它成功的关键之一，是它首先是一副正常的眼镜，然后才是一台 AI 设备。&lt;/p&gt;</description></item><item><title>Isaac Lab 安装避坑指南：从零到跑通全流程</title><link>https://www.worldsensetech.com/zh/articles/isaac-lab-install-guide/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/isaac-lab-install-guide/</guid><description>&lt;p&gt;上一篇介绍了 Isaac Lab 是什么、能做什么。但如果你真的动手装过，会发现从&amp;quot;克隆代码&amp;quot;到&amp;quot;跑通 example&amp;quot;之间，隔着不少坑。&lt;/p&gt;
&lt;p&gt;这篇文章记录我在 AutoDL 云 GPU 服务器（RTX 5090D/32GB）上安装 Isaac Lab 的完整过程。每一个报错都是真实遇到的，每一个解决方案都是实际验证过的。希望能帮你省掉几个小时的排查时间。&lt;/p&gt;
&lt;h2 id="为什么-isaac-lab-这么难装"&gt;为什么 Isaac Lab 这么难装？&lt;/h2&gt;
&lt;p&gt;Isaac Lab 的安装复杂度主要来自三个方面：&lt;/p&gt;
&lt;p&gt;依赖链长。Isaac Lab 依赖 Isaac Sim，Isaac Sim 依赖 NVIDIA 驱动、CUDA、特定版本的 PyTorch，而 PyTorch 又依赖特定版本的 numpy、triton 等。任何一环版本不对，都会报错。&lt;/p&gt;
&lt;p&gt;Python 版本要求高。Isaac Lab 要求 Python ≥ 3.12，而很多服务器和云 GPU 平台的基础镜像还在用 Python 3.10 或 3.11。版本不满足会直接安装失败。&lt;/p&gt;
&lt;p&gt;包体积大。PyTorch + CUDA 的 whl 文件超过 2GB，numpy 也有几十 MB。在国内网络环境下，从 PyPI 下载经常中断，而且 pip 的断点续传并不总是可靠。&lt;/p&gt;
&lt;h2 id="环境要求"&gt;环境要求&lt;/h2&gt;
&lt;p&gt;在开始安装之前，确认你的环境满足以下条件：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;GPU。NVIDIA RTX 级别以上 GPU（推荐 RTX 4090 或更高）&lt;/li&gt;
&lt;li&gt;系统。Ubuntu 22.04（推荐）或 Windows&lt;/li&gt;
&lt;li&gt;Python。3.12 或更高版本（这是硬要求，3.11 也不行）&lt;/li&gt;
&lt;li&gt;驱动。NVIDIA 驱动 525+ 和 CUDA 12+&lt;/li&gt;
&lt;li&gt;内存。16GB+（推荐 32GB）&lt;/li&gt;
&lt;li&gt;磁盘。至少 50GB 可用空间（Isaac Sim 本身体积较大）&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="第一步解决-python-版本问题"&gt;第一步：解决 Python 版本问题&lt;/h2&gt;
&lt;p&gt;这是最容易踩的第一个坑。很多服务器默认的 Python 版本是 3.10 或 3.11，直接跑 &lt;code&gt;./isaaclab.sh --install&lt;/code&gt; 会报：&lt;/p&gt;</description></item><item><title>Isaac Lab 入门：面向具身智能的 GPU 加速机器人学习平台</title><link>https://www.worldsensetech.com/zh/articles/isaac-lab-robot-rl/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/isaac-lab-robot-rl/</guid><description>&lt;p&gt;过去一周，我们在 MuJoCo + DreamerV3 这条技术路线上深入了很多——从环境搭建到视觉输入训练，再到训练技巧和世界模型的架构演进。&lt;/p&gt;
&lt;p&gt;今天换一个视角，聊聊另一套技术栈：NVIDIA 的 Isaac Lab。&lt;/p&gt;
&lt;p&gt;如果说 MuJoCo 更强调轻量、灵活的动力学研究，适合快速原型开发和算法探索；那么 Isaac Lab 更强调 GPU 加速的大规模机器人训练和 sim-to-real pipeline。两者并不互斥——很多研究团队同时使用 MuJoCo 做算法验证和 Isaac Lab 做规模训练。&lt;/p&gt;
&lt;h2 id="isaac-lab-是什么"&gt;Isaac Lab 是什么？&lt;/h2&gt;
&lt;p&gt;Isaac Lab 是 NVIDIA 基于 Isaac Sim 构建的机器人学习框架，继承自 Isaac Gym 的 GPU 并行仿真思路，提供了更完整的任务抽象和工程结构。它的核心特点是：利用 GPU 加速，实现大规模并行的强化学习训练。&lt;/p&gt;
&lt;p&gt;Isaac Lab 本身不是仿真器，也不是 RL 算法库，而是一个位于 Isaac Sim 之上的任务抽象层：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Isaac Sim（PhysX + Rendering）→ Isaac Lab（Task Abstraction + RL Integration）→ 训练策略&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;简单来说，Isaac Lab 解决的问题是：如何在短时间内训练出高质量的机器人策略。&lt;/p&gt;
&lt;p&gt;传统的 RL 训练（如我们在 MuJoCo 中用 DreamerV3）通常是单环境或少量并行环境。训练一个策略可能需要几百万步，花费几小时甚至几天。而 Isaac Lab 通过 GPU 并行化，可以同时运行数千个环境，将训练时间从几天缩短到几分钟。&lt;/p&gt;</description></item><item><title>机器人数据为什么比大模型数据更难？具身智能的数据闭环挑战</title><link>https://www.worldsensetech.com/zh/articles/robot-data-challenge/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/robot-data-challenge/</guid><description>&lt;p&gt;大语言模型的发展证明了，大规模、多样化的数据可以显著提升模型能力。但数据规模只是其中一个因素，Transformer 架构、预训练目标、scaling law 以及 RLHF 等后训练方法共同作用，才成就了今天的 LLM。&lt;/p&gt;
&lt;p&gt;但如果你做过机器人 AI，一定知道：机器人领域的数据，比语言数据难得多。&lt;/p&gt;
&lt;p&gt;为什么？机器人数据到底难在哪里？有没有解决方案？&lt;/p&gt;
&lt;p&gt;这篇文章从数据的角度，聊聊具身智能的核心挑战。&lt;/p&gt;
&lt;h2 id="机器人数据的独特挑战"&gt;机器人数据的独特挑战&lt;/h2&gt;
&lt;p&gt;从数据形式上看，文本通常可以被离散化为 token 序列进行处理，而机器人数据天然包含连续控制、多传感器、多时间尺度和物理交互。机器人一次交互涉及 RGB/RGB-D 图像、本体感知（关节状态）、力/力矩、动作轨迹、语言指令、环境状态等多模态信息，具有高维、时序、物理约束和交互依赖等特征。&lt;/p&gt;
&lt;h3 id="1-采集成本高"&gt;1. 采集成本高&lt;/h3&gt;
&lt;p&gt;语言数据可以从互联网上爬取，成本几乎为零。但机器人数据需要真实机器人执行任务，同时记录传感器数据。&lt;/p&gt;
&lt;p&gt;高质量机器人数据采集通常需要昂贵硬件、人工遥操作和大量工程维护。一个复杂任务的数据规模扩展成本远高于互联网数据——不仅需要硬件投入，还需要数据清洗、标注和反复验证。&lt;/p&gt;
&lt;h3 id="2-标注困难"&gt;2. 标注困难&lt;/h3&gt;
&lt;p&gt;语言数据的标注相对简单——分类、实体识别、情感标注，都有明确的标签体系。但机器人数据的标注复杂得多：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;动作标注。机器人动作是连续的高维序列，如何定义&amp;quot;好&amp;quot;的动作？以抓取为例，动作可以是关节轨迹 &lt;code&gt;[q1(t), q2(t)...q7(t)]&lt;/code&gt;、夹爪力、速度、接触状态等。同一个任务存在大量有效解——比如&amp;quot;打开抽屉&amp;quot;可以从左侧拉、从右侧拉、两指抓、三指抓、快速拉或慢速拉——因此机器人数据标注更接近学习一个条件分布 &lt;code&gt;p(action | observation, task)&lt;/code&gt;，而非简单的 &lt;code&gt;f(x) = label&lt;/code&gt; 式的标签预测。&lt;/li&gt;
&lt;li&gt;奖励标注。很多任务没有明确的奖励信号，需要人工设计或从演示中学习。&lt;/li&gt;
&lt;li&gt;场景标注。3D 场景理解、物体位姿、接触点等标注，需要专业工具和知识。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="3-分布狭窄"&gt;3. 分布狭窄&lt;/h3&gt;
&lt;p&gt;语言数据覆盖了各种主题、风格、语言。但机器人数据通常只覆盖：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;特定的机器人硬件&lt;/li&gt;
&lt;li&gt;特定的任务类型&lt;/li&gt;
&lt;li&gt;特定的场景环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这导致机器人模型的泛化能力远不如语言模型。在一个机器人上训练的策略，换个机器人可能就失效了。这里还存在一个更深层的问题——embodiment gap：不仅来自机器人形态差异（如 7-DoF 的 Franka 和人形机器人的手），也来自传感器配置（RGB camera vs tactile sensor vs force-torque）、控制频率（20Hz vs 200Hz）和动作空间的差异。这也是 Open X-Embodiment 等跨机器人数据集的重要性所在——它们探索如何利用跨机器人数据提升泛化能力。&lt;/p&gt;
&lt;h3 id="4-安全性要求"&gt;4. 安全性要求&lt;/h3&gt;
&lt;p&gt;机器人模型出错会直接作用于物理世界，因此安全验证要求更加严格。这意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练数据需要过滤危险行为&lt;/li&gt;
&lt;li&gt;部署前需要严格的安全验证&lt;/li&gt;
&lt;li&gt;需要人工监督和干预机制&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些安全要求，增加了数据收集和模型训练的复杂度。&lt;/p&gt;
&lt;h2 id="当前的数据获取与扩展方案"&gt;当前的数据获取与扩展方案&lt;/h2&gt;
&lt;p&gt;面对这些挑战，业界有几种主要的应对策略：&lt;/p&gt;</description></item><item><title>世界模型架构演进：RSSM、Transformer 与统一世界模型</title><link>https://www.worldsensetech.com/zh/articles/world-model-transformer/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-transformer/</guid><description>&lt;p&gt;前面几篇文章中，我们深入讲解了 DreamerV3 的 RSSM 架构和训练技巧。RSSM 是强化学习世界模型中的经典设计，但如果你关注最近的研究，会发现一个明显的趋势：世界模型正在走向 Transformer 化。&lt;/p&gt;
&lt;p&gt;从 Google 的 UniSim 到 Wayve 的 GAIA-1，从 NVIDIA 的 Cosmos 到国内具身智能团队的方案，Transformer 正成为大规模世界模型的重要技术路线。&lt;/p&gt;
&lt;p&gt;为什么会这样？RSSM 有什么问题？Transformer 带来了什么优势？世界模型的架构演进方向是什么？&lt;/p&gt;
&lt;p&gt;这篇文章梳理这条技术路线。&lt;/p&gt;
&lt;p&gt;在展开之前，先澄清一个概念。所谓统一世界模型（unified world model），并不是指一个模型精确复制整个物理世界，而是希望通过统一的表示空间同时理解视觉、语言、动作和环境动态——让同一个模型既能&amp;quot;看&amp;quot;懂场景，又能&amp;quot;想&amp;quot;清因果，还能&amp;quot;做&amp;quot;出决策。这是当前世界模型研究的一个前沿方向。&lt;/p&gt;
&lt;h2 id="rssm-的设计逻辑与局限"&gt;RSSM 的设计逻辑与局限&lt;/h2&gt;
&lt;p&gt;先回顾一下 RSSM 为什么被设计出来。&lt;/p&gt;
&lt;p&gt;RSSM（Recurrent State-Space Model）的核心思想是将隐状态分成两个轨道：确定性状态（deterministic state）和随机性状态（stochastic state）。确定性状态用 GRU 更新，捕捉规律性的动态；随机性状态通过离散分类分布采样——DreamerV3 使用 32 个离散 categorical 变量，每个变量包含 64 个类别，组合形成容量为 64^32 的随机隐空间，捕捉环境的不确定性。&lt;/p&gt;
&lt;p&gt;这个设计有几个优点：&lt;/p&gt;
&lt;p&gt;计算效率高。GRU 是循环网络，每一步只需要上一步的隐状态，不需要处理整个序列。训练和推理的内存开销较小。&lt;/p&gt;
&lt;p&gt;隐空间结构清晰。确定性 + 随机性的双轨道设计，让模型同时学到&amp;quot;规律&amp;quot;和&amp;quot;不确定性&amp;quot;。这对物理世界的建模很重要——宏观物理规律通常具有较强确定性，而观测和环境扰动具有随机性。&lt;/p&gt;
&lt;p&gt;想象训练方便。在隐空间中可以方便地&amp;quot;想象&amp;quot;未来轨迹：从当前状态出发，用 GRU 逐步推进，每一步采样随机状态，得到一系列隐状态，再解码成观测。&lt;/p&gt;
&lt;p&gt;但 RSSM 也有几个明显的局限：&lt;/p&gt;
&lt;p&gt;长程依赖问题。RSSM 通过 deterministic hidden state 维护历史信息，但由于状态更新仍是递归形式，超长时间跨度的信息需要压缩到固定维度的隐状态中，可能造成信息瓶颈。当任务需要记住很久以前的信息时（如延迟奖励、长程因果链），RSSM 的表现可能不够好。&lt;/p&gt;
&lt;p&gt;并行化受限。循环网络在时间维度上是序列化的——每一步依赖上一步的输出。不过 RSSM 训练并非完全串行：observation encoder 可以并行处理，rollout imagination 也可以在 batch 维度并行。真正的瓶颈在于时间维度上的依赖关系，这使得训练速度受限于序列长度。&lt;/p&gt;</description></item><item><title>DreamerV3 训练技巧：从踩坑到收敛的实战经验</title><link>https://www.worldsensetech.com/zh/articles/dreamerv3-training-tips/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/dreamerv3-training-tips/</guid><description>&lt;p&gt;上一篇文章梳理了世界模型的四条表征路线。今天我们回到 DreamerV3 的实战主题，聊聊训练过程中的那些坑和技巧。本文基于 DreamerV3 commit &lt;code&gt;e3f02248&lt;/code&gt;、JAX + Haiku、MuJoCo + DM Control 的本地实验环境，不同版本的参数名和配置可能有差异。&lt;/p&gt;
&lt;p&gt;DreamerV3 是目前最开源、最成熟的世界模型实现之一。但如果你真的动手训练过，一定知道这个过程并不轻松——环境配置、超参数调优、训练不稳定、收敛慢……各种坑。&lt;/p&gt;
&lt;p&gt;这篇文章总结我在训练 DreamerV3 过程中遇到的常见问题和解决方案，希望能帮你少走弯路。&lt;/p&gt;
&lt;h2 id="环境配置的坑"&gt;环境配置的坑&lt;/h2&gt;
&lt;h3 id="1-mujoco-版本问题"&gt;1. MuJoCo 版本问题&lt;/h3&gt;
&lt;p&gt;DreamerV3 的官方实现基于 JAX + MuJoCo。但 MuJoCo 的版本选择很关键：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;MuJoCo 2.x vs 3.x。官方代码基于 MuJoCo 2.x，但 3.x 版本有性能改进。如果用 3.x，需要修改部分 API 调用。&lt;/li&gt;
&lt;li&gt;mujoco-py vs mujoco。mujoco-py 是旧的 Python 绑定，已经停止维护。建议直接用官方的 mujoco 包。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;建议：优先使用与你当前 DreamerV3 commit 匹配的 MuJoCo 版本，不要一开始就升级整个环境。&lt;/p&gt;
&lt;h3 id="2-jax-的-gpu-配置"&gt;2. JAX 的 GPU 配置&lt;/h3&gt;
&lt;p&gt;JAX 的 GPU 支持需要正确安装 CUDA 和 cuDNN。常见问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CUDA 版本不匹配。JAX 对 CUDA 版本有严格要求，安装前查看官方文档。&lt;/li&gt;
&lt;li&gt;GPU 内存不足。JAX 默认会占用所有 GPU 内存。可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_MEM_FRACTION=0.9&lt;/code&gt; 限制内存使用。如果遇到编译阶段内存峰值过高，也可以设置 &lt;code&gt;XLA_PYTHON_CLIENT_PREALLOCATE=false&lt;/code&gt; 关闭预分配。&lt;/li&gt;
&lt;li&gt;多 GPU 问题。JAX 的多 GPU 支持和 PyTorch 不同，需要特别配置。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;下图是 DreamerV3 在 RTX 5090D 上训练时的实际 GPU 占用情况，显存占用约 25.6GB（32GB 的 78%），GPU 利用率 91%：
![DreamerV3 训练时 GPU 占用情况](/images/nvidia smi.png) 图：RTX 5090D 上 DreamerV3 训练时的 GPU 显存占用（25.6GB / 32GB，利用率 91%）&lt;/p&gt;</description></item><item><title>世界模型如何表示世界：四条表征路线与机器人适应能力</title><link>https://www.worldsensetech.com/zh/articles/world-model-representations/</link><pubDate>Mon, 10 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-representations/</guid><description>&lt;p&gt;前面我们用 MuJoCo 和 Isaac Sim 的对比，理清了仿真器的选择。但不管用哪个仿真器，世界模型都面临一个更根本的问题：到底用什么来表示&amp;quot;世界&amp;quot;？&lt;/p&gt;
&lt;p&gt;这个问题听起来抽象，但它直接决定了世界模型能做什么、不能做什么。就像你选错了数据结构，后面的算法再精妙也救不回来。&lt;/p&gt;
&lt;p&gt;我把当前世界模型的表征方式归纳为四条主要路线。需要说明的是，这四条路线并不是严格互斥的——它们分别对应表征的不同维度：隐空间压缩是表征空间的选择，视觉生成是输出空间的选择，显式几何建模是世界几何的表示方式，对象级结构化是信息的组织方式。更准确地说，这四条路线不是互相替代的模型类别，而是世界模型设计中的四种归纳偏置（inductive bias）——不同表征给模型加入了不同的先验假设。实际系统中，它们经常交叉组合。但理解每条路线的核心逻辑和局限，是做出正确设计选择的前提。&lt;/p&gt;
&lt;h2 id="路线一隐状态latent-state"&gt;路线一：隐状态（Latent State）&lt;/h2&gt;
&lt;p&gt;代表：DreamerV3、TD-MPC2&lt;/p&gt;
&lt;p&gt;核心思路：把观测（图像、传感器数据）压缩成一个固定维度的向量，在这个隐空间里建模动态、训练策略。&lt;/p&gt;
&lt;p&gt;DreamerV3 的 RSSM 使用循环神经网络维护确定性状态（4096 维），并结合离散随机变量（32 个类别变量，每个 64 类）来表示不确定性，两者共同用于预测未来。TD-MPC2 更激进——512 维隐状态，不要求世界模型重建原始观测，而是在任务相关的隐空间中直接做模型预测控制。&lt;/p&gt;
&lt;p&gt;这个路线解决什么问题？&lt;/p&gt;
&lt;p&gt;样本效率和计算速度。隐状态是高度压缩的表征，一个 64×64×3 的图像被压缩成几千维的向量。在这个压缩空间里做想象训练，比直接在像素空间里预测快几个数量级。DreamerV3 相比像素级世界模型具有更低的计算需求，可以在有限算力下完成高效训练。TD-MPC2 在多个连续控制任务上也展示了较高的训练效率。&lt;/p&gt;
&lt;p&gt;而且隐状态天然适合做控制。策略网络可以直接从隐状态输出动作，世界模型可以在隐空间里做 rollout，不需要生成完整的图像。对于实时控制场景（如机械臂操作），这种效率是必须的。&lt;/p&gt;
&lt;p&gt;卡在哪里？&lt;/p&gt;
&lt;p&gt;隐空间是个黑箱。它通常不提供显式可访问的 3D 结构——模型内部可能编码了深度、位置等空间线索，但这些信息难以被直接用于几何推理。它学到的是&amp;quot;做了这个动作后，隐向量会从 A 变成 B&amp;quot;，但 A 和 B 里面到底包含了什么空间信息，完全不透明。&lt;/p&gt;
&lt;p&gt;这带来一个直接后果：长时间预测容易漂移。由于隐状态通常不显式约束几何一致性，每预测一步就可能引入微小误差，误差累积后，想象轨迹逐渐偏离真实动态。DreamerV3 通常采用较短的 imagination horizon（例如 15 步），这是在模型误差累积、价值估计偏差和计算成本之间的工程折中。&lt;/p&gt;
&lt;p&gt;另一个问题是迁移。如果隐空间主要由单一任务数据学习得到，其状态语义往往缺少显式结构约束，跨场景迁移时可能需要重新适配。&lt;/p&gt;
&lt;h2 id="路线二像素视频pixelvideo"&gt;路线二：像素/视频（Pixel/Video）&lt;/h2&gt;
&lt;p&gt;代表：NVIDIA Cosmos、1X World Model&lt;/p&gt;
&lt;p&gt;核心思路：直接预测未来的图像或视频帧。给世界模型一段过去的视频 + 动作序列，它生成未来的视频。&lt;/p&gt;
&lt;p&gt;Cosmos 定位为 Physical AI 的基础模型，用两条路线处理视觉信息：一条是自回归的离散视觉 token（类似 GPT 预测下一个 token），一条是扩散模型生成连续帧。它的目标不仅是预测视频，更是通过大规模视觉生成获得通用的物理先验。1X World Model 也采用类似思路，用视频生成模型预测未来画面，同时预测离散隐状态码。&lt;/p&gt;
&lt;p&gt;这个路线解决什么问题？&lt;/p&gt;</description></item><item><title>机器人训练为什么需要虚拟世界？MuJoCo 和 Isaac Sim 全面对比</title><link>https://www.worldsensetech.com/zh/articles/mujoco-vs-isaac-sim/</link><pubDate>Sun, 09 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/mujoco-vs-isaac-sim/</guid><description>&lt;p&gt;上一篇我们聊了域随机化的工程实现。但不管是域随机化、策略训练、还是 Sim-to-Real 验证，都离不开一个基础工具：仿真环境。&lt;/p&gt;
&lt;p&gt;为什么仿真对具身智能这么重要？原因很直接：真实世界的机器人数据太贵、太慢、太危险。你不可能让一台真实机器人每天尝试几百万次抓取来学习——硬件磨损、时间成本、安全风险都不允许。仿真环境提供了一个可无限重试、可完全控制变量的训练场所，是当前具身智能规模化训练的核心基础设施。&lt;/p&gt;
&lt;p&gt;目前这个领域最主流的两个选择是 MuJoCo 和 NVIDIA Isaac Sim。这篇文章从五个维度做系统对比：物理引擎、渲染能力、RL 训练效率、生态工具、适用场景，帮你根据项目需求做出选择。&lt;/p&gt;
&lt;h2 id="物理引擎对比"&gt;物理引擎对比&lt;/h2&gt;
&lt;h3 id="mujoco"&gt;MuJoCo&lt;/h3&gt;
&lt;p&gt;MuJoCo（Multi-Joint dynamics with Contact）由 Emo Todorov 团队开发，2021年被 DeepMind 收购后开源。它的核心优势是：&lt;/p&gt;
&lt;p&gt;接触动力学精度高。MuJoCo 使用约束-based 的接触模型，能准确模拟摩擦、碰撞、关节限位等。对于机器人操作任务（抓取、推、插装），接触精度至关重要。&lt;/p&gt;
&lt;p&gt;计算速度快。MuJoCo 的求解器高度优化，单线程就能跑很快。对于需要大量 rollouts 的强化学习训练，速度是硬指标。&lt;/p&gt;
&lt;p&gt;数值稳定性好。MuJoCo 的积分器和约束求解器经过多年打磨，不容易出现仿真崩溃（比如物体穿模、关节爆炸）。&lt;/p&gt;
&lt;p&gt;渲染能力近年来有所增强，但设计重点不同。MuJoCo 近年来增强了渲染能力，支持相机观测、深度图等视觉输入，DM Control pixels benchmark、RoboSuite 图像任务、Dreamer 系列视觉控制实验都基于 MuJoCo 运行。但它的设计重点仍然是高效动力学模拟和控制研究，而不是大规模照片级合成数据生成。如果需要照片级逼真的图像输入，Isaac Sim 仍有明显优势。&lt;/p&gt;
&lt;h3 id="isaac-sim"&gt;Isaac Sim&lt;/h3&gt;
&lt;p&gt;Isaac Sim 是 NVIDIA 基于 Omniverse 平台开发的机器人仿真器。它的核心优势是：&lt;/p&gt;
&lt;p&gt;GPU 加速物理。Isaac Sim 基于 NVIDIA PhysX 5，并通过 GPU 加速和 Isaac Lab 的并行环境管理支持大规模机器人学习训练。这种架构源自 Isaac Gym 的 GPU pipeline，在 Isaac Lab 的 vectorized environments 中得到延续。&lt;/p&gt;</description></item><item><title>域随机化（Domain Randomization）：机器人 Sim-to-Real 迁移的核心技术</title><link>https://www.worldsensetech.com/zh/articles/domain-randomization-sim-to-real/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/domain-randomization-sim-to-real/</guid><description>&lt;p&gt;上一篇我们聊了 TD-MPC 如何用世界模型做机器人控制。但不管用 Dreamer、TD-MPC 还是其他方法，训练出来的策略最终都要部署到真实机器人上。这就绕不开 Sim-to-Real 迁移——而域随机化（Domain Randomization）是这条路上最基础的技术。&lt;/p&gt;
&lt;p&gt;这篇文章系统拆解域随机化：它解决什么问题、有哪些类型、工程上怎么实现、以及最新的进展。&lt;/p&gt;
&lt;h2 id="sim-to-real-gap-的根源"&gt;Sim-to-Real Gap 的根源&lt;/h2&gt;
&lt;p&gt;先回顾一下问题。仿真环境和真实世界之间存在系统性差异，这些差异统称为 Sim-to-Real Gap。其中一部分来自未建模动态（unmodeled dynamics），例如摩擦变化、接触误差、传感器噪声等：&lt;/p&gt;
&lt;p&gt;动力学层面：摩擦系数、质量分布、关节阻尼、电机响应延迟。仿真中的物理参数往往是近似值，和真实机器人有偏差。&lt;/p&gt;
&lt;p&gt;视觉层面：光照条件、相机噪声、纹理细节、背景变化。仿真渲染和真实相机看到的图像有显著差异。&lt;/p&gt;
&lt;p&gt;传感器层面：IMU 漂移、力传感器噪声、编码器精度。仿真中的传感器是理想的，真实传感器有各种非理想特性。&lt;/p&gt;
&lt;p&gt;这些差异导致了一个核心问题：在仿真中训练的策略，直接部署到真实世界时性能下降。域随机化的思路很直接——既然真实世界无法被完全建模，就让训练环境覆盖一个合理范围的可能情况，使真实环境成为训练分布中的一个可能实例。&lt;/p&gt;
&lt;h2 id="为什么域随机化现在重新受到关注"&gt;为什么域随机化现在重新受到关注？&lt;/h2&gt;
&lt;p&gt;域随机化并不是新技术——早在 2017 年左右就有系统性的工作。但近几年它的热度明显上升，原因和整个具身智能的研究范式变化有关。&lt;/p&gt;
&lt;p&gt;过去，机器人控制主要靠手工建模和专用控制器。工程师根据具体任务设计动力学模型、调参、写控制逻辑。这种方式在结构化环境中效果不错，但扩展性差——每换一个任务就要重新来一遍。&lt;/p&gt;
&lt;p&gt;现在的范式是：大模型 + 强化学习 + 仿真训练。策略不再由人手工设计，而是在仿真中通过大量试错自动学习。这意味着对训练数据的需求急剧增加。但真实世界的机器人数据太贵、太慢、太危险——不可能让真实机器人每天跑几百万次试错。&lt;/p&gt;
&lt;p&gt;于是，仿真训练成了主流选择。但仿真训练的核心瓶颈变成了：怎么让仿真中学到的能力迁移到真实世界？Sim-to-Real 不再只是一个机器人控制问题，而成为具身智能规模化训练的核心问题。域随机化作为其中最基础、最通用的技术，自然重新受到了关注。&lt;/p&gt;
&lt;h2 id="域随机化的核心思想"&gt;域随机化的核心思想&lt;/h2&gt;
&lt;p&gt;域随机化的直觉来自一个观察：如果策略在足够多样的仿真环境中都能表现良好，那它在真实世界中应该也能工作——因为真实世界只是众多可能环境中的一个。&lt;/p&gt;
&lt;p&gt;形式化地说，域随机化把仿真参数 θ 当作随机变量，从一个分布 p(θ) 中采样。训练时，每个 episode 使用不同的 θ 值。策略学到的不是&amp;quot;在某个特定仿真中怎么做&amp;quot;，而是&amp;quot;在各种可能的环境中怎么做&amp;quot;。
关键洞察：域随机化本质上是在训练数据的分布中注入多样性，让策略学到鲁棒的、不依赖于特定仿真参数的行为。&lt;/p&gt;
&lt;h2 id="域随机化的分类"&gt;域随机化的分类&lt;/h2&gt;
&lt;p&gt;根据随机化的对象，域随机化可以分为四大类：&lt;/p&gt;
&lt;h3 id="1-动力学域随机化dynamics-dr"&gt;1. 动力学域随机化（Dynamics DR）&lt;/h3&gt;
&lt;p&gt;随机化物理参数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;质量：物体质量、机器人连杆质量。工程中通常从较小范围开始（例如围绕标称值扰动），再根据真实迁移效果逐步扩大范围。&lt;/li&gt;
&lt;li&gt;摩擦：接触摩擦系数、关节摩擦。这是影响操作任务最关键的因素之一。&lt;/li&gt;
&lt;li&gt;阻尼：关节阻尼系数。影响机器人的动态响应。&lt;/li&gt;
&lt;li&gt;惯性：转动惯量。影响旋转运动的动态。&lt;/li&gt;
&lt;li&gt;延迟：控制延迟、观测延迟。模拟真实系统的响应滞后。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;动力学 DR 是最常用的类型，对大多数任务都有显著效果。&lt;/p&gt;
&lt;h3 id="2-视觉域随机化visual-dr"&gt;2. 视觉域随机化（Visual DR）&lt;/h3&gt;
&lt;p&gt;随机化视觉渲染参数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;光照：光源位置、强度、颜色。这是视觉 DR 中最重要的一项。&lt;/li&gt;
&lt;li&gt;纹理：物体表面纹理、颜色。可以用程序化纹理或随机贴图。&lt;/li&gt;
&lt;li&gt;背景：场景背景。可以用随机颜色、随机图像或随机3D场景。&lt;/li&gt;
&lt;li&gt;相机：相机位置、角度、焦距、噪声。&lt;/li&gt;
&lt;li&gt;材质：反射率、透明度、粗糙度。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;视觉 DR 对基于图像的策略特别重要。如果策略直接用相机图像作为输入，视觉 DR 几乎是必须的。&lt;/p&gt;</description></item><item><title>TD-MPC：世界模型如何用于机器人控制？</title><link>https://www.worldsensetech.com/zh/articles/td-mpc-world-model-control/</link><pubDate>Fri, 07 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/td-mpc-world-model-control/</guid><description>&lt;p&gt;上一篇文章我们拆解了 RSSM 的双轨状态设计，理解了 Dreamer 系列如何在隐空间中&amp;quot;想象&amp;quot;未来。但 RSSM 并不是世界模型用于机器人控制的唯一路线。今天聊另一条重要路线：TD-MPC（Temporal Difference Model Predictive Control）。&lt;/p&gt;
&lt;p&gt;如果说 Dreamer 的核心是利用学习到的世界模型，在隐空间中进行 imagined rollout，并通过 actor-critic 方法优化策略，那 TD-MPC 的核心思路更直接：学一个世界模型，然后在模型里做规划（planning），选出最优动作序列直接执行。它不把策略网络作为唯一决策方式，而是利用世界模型进行在线规划，并结合学习到的策略先验提高搜索效率。&lt;/p&gt;
&lt;h2 id="为什么需要-model-predictive-control"&gt;为什么需要 Model Predictive Control&lt;/h2&gt;
&lt;p&gt;先退一步。传统的强化学习（比如 DQN、PPO）学的是一个策略 π(a|s)——给定当前状态，直接输出动作。这个策略是在大量试错中训练出来的，一旦训练完成，推理时只需要前向传播一次。&lt;/p&gt;
&lt;p&gt;但这种方式有两个问题：&lt;/p&gt;
&lt;p&gt;第一，样本效率低。策略需要大量交互数据才能学好，而真实机器人的交互成本很高。&lt;/p&gt;
&lt;p&gt;第二，缺乏&amp;quot;前瞻性&amp;quot;。策略网络只看当前状态就决定动作，不会主动&amp;quot;想一想如果我这样做，接下来几步会怎样&amp;quot;。&lt;/p&gt;
&lt;p&gt;Model Predictive Control（MPC）的思路完全不同：在每个时间步，基于当前状态，在模型中模拟多条未来轨迹，评估每条轨迹的累积回报，选择回报最高的那条轨迹的第一个动作执行。然后到下一个时间步，重新规划。&lt;/p&gt;
&lt;p&gt;这就像下棋：不是靠直觉走一步，而是向前推演几步，选最好的走法。&lt;/p&gt;
&lt;h2 id="td-mpc-的核心设计"&gt;TD-MPC 的核心设计&lt;/h2&gt;
&lt;p&gt;TD-MPC（Hansen et al., 2022）的关键贡献在于：它证明了一个面向控制任务学习的隐空间动力学模型，可以与 MPC 规划结合，并通过 TD 学习目标获得高效控制能力。注意，MPC 和 model-based RL 的结合并不是新概念——TD-MPC 的创新在于用 TD 目标替代重建损失来训练世界模型。&lt;/p&gt;
&lt;h3 id="世界模型的结构"&gt;世界模型的结构&lt;/h3&gt;
&lt;p&gt;TD-MPC 的核心组件包括状态编码器、隐空间动力学模型、奖励预测模型，以及用于价值评估的 Q 网络：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;状态编码器（Encoder）&lt;/li&gt;
&lt;/ol&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`z_t = Encoder(o_t)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;把高维观测（比如图像）压缩到一个低维的隐状态 z_t。这个隐状态不需要像 RSSM 那样拆成确定性和随机性两部分——TD-MPC 用的是确定性隐状态，结构更简单。&lt;/p&gt;
&lt;ol start="2"&gt;
&lt;li&gt;动力学模型（Dynamics Model）&lt;/li&gt;
&lt;/ol&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`z_{t+1} = f(z_t, a_t)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;给定当前隐状态和动作，预测下一步的隐状态。这就是世界模型的核心——它学会了环境的状态转移规律。&lt;/p&gt;</description></item><item><title>世界模型 + VLA：用想象力训练机器人</title><link>https://www.worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-synthetic-data-for-vla/</guid><description>&lt;p&gt;上一篇&lt;a href="https://www.worldsensetech.com/zh/articles/world-model-lab-setup/"&gt;从零搭建世界模型实验环境&lt;/a&gt;，我们跑通了 DreamerV3。有读者问：训练好的世界模型能做什么？&lt;/p&gt;
&lt;p&gt;今天聊一个更前沿的话题：怎么用世界模型生成合成数据，来增强 VLA（视觉-语言-动作模型）的训练。这是近年来机器人基础模型领域受到广泛关注的研究方向之一。&lt;/p&gt;
&lt;h2 id="为什么-vla-需要合成数据"&gt;为什么 VLA 需要合成数据&lt;/h2&gt;
&lt;p&gt;VLA 的核心能力是让机器人&amp;quot;听懂人话&amp;quot;——你指着桌上的杯子说&amp;quot;把那个红色的拿给我&amp;quot;，它能理解语言指令并执行动作。&lt;/p&gt;
&lt;p&gt;但训练这样的模型需要海量数据：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;真实数据采集成本高：需要人类示范，每条数据都要人操作机器人&lt;/li&gt;
&lt;li&gt;场景覆盖有限：真实环境难以覆盖所有边界情况（比如光线变化、物体遮挡）&lt;/li&gt;
&lt;li&gt;危险动作无法采集：某些失败案例在真实世界太危险，无法收集&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这就是世界模型的价值所在——它可以在&amp;quot;想象&amp;quot;中生成大量合成数据，弥补真实数据的不足。&lt;/p&gt;
&lt;h2 id="世界模型如何生成合成数据"&gt;世界模型如何生成合成数据&lt;/h2&gt;
&lt;p&gt;回顾一下世界模型的核心能力：给定当前状态和动作，预测未来会发生什么。&lt;/p&gt;
&lt;p&gt;需要说明的是，机器人领域合成数据的来源不仅限于 Dreamer 这类 latent world model，还包括物理模拟器（MuJoCo、Isaac Sim、ManiSkill）、神经渲染环境以及基于视频生成的世界模型。Dreamer 系列是其中适合理解 model-based RL 和 latent imagination 的代表，但实际研究中数据来源更加多元。&lt;/p&gt;
&lt;p&gt;在 DreamerV3 中，RSSM（循环状态空间模型）可以在想象空间中做 rollout：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;从真实观测编码初始 latent state（后验状态）&lt;/li&gt;
&lt;li&gt;采样或指定动作序列&lt;/li&gt;
&lt;li&gt;RSSM 逐步预测 latent state 转移和预期奖励&lt;/li&gt;
&lt;li&gt;通过 observation model 解码 latent state 为观测&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;世界模型生成的是潜在轨迹（latent trajectories），经过视觉解码器和任务条件映射后，可以进一步构造机器人学习需要的视觉-语言-动作数据。&lt;/p&gt;
&lt;p&gt;需要注意：DreamerV3 的 latent imagination 与近年来基于 diffusion/transformer 的大规模视频生成模型不同。DreamerV3 的核心优势在于策略学习（latent dynamics、reward prediction），而不是直接生成高保真机器人视觉数据。用 DreamerV3 decoder 直接重建的图像往往模糊、细节缺失，长时间 rollout 还可能出现物体身份漂移。这也是为什么机器人领域正在转向 video diffusion world model 和 transformer-based world model（如 UniSim、RoboGen、GAIA-1）来获取更高质量的视觉合成数据。&lt;/p&gt;</description></item><item><title>Sim-to-Real太难？世界模型驱动的自适应迁移方法</title><link>https://www.worldsensetech.com/zh/articles/sim-to-real-transfer/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/sim-to-real-transfer/</guid><description>&lt;p&gt;这是世界模型系列文章的第四篇。前三篇我们聊了世界模型的基本概念、RSSM的核心原理、以及具身智能的入门路径。今天聊一个更偏实战的话题：仿真里训练的策略，到底怎么部署到真实机器人上？&lt;/p&gt;
&lt;p&gt;这个问题困扰了机器人AI领域将近十年。世界模型在仿真环境里表现惊艳——DreamerV3的样本效率比传统RL高出10-100倍。但一旦部署到真实机器人，性能往往下降30-50%。这个差距，就是著名的&amp;quot;Sim-to-Real Gap&amp;quot;。&lt;/p&gt;
&lt;p&gt;这篇文章，我想从工程师的视角，聊聊这个问题为什么难，以及世界模型提供了哪些新的解决思路。&lt;/p&gt;
&lt;h2 id="sim-to-real的三大挑战"&gt;Sim-to-Real的三大挑战&lt;/h2&gt;
&lt;p&gt;先搞清楚问题出在哪里。仿真和真实世界之间的差距，主要来自三个方面：&lt;/p&gt;
&lt;h3 id="1-域偏移domain-shift"&gt;1. 域偏移（Domain Shift）&lt;/h3&gt;
&lt;p&gt;仿真器的物理参数和真实世界不可能完全一致。摩擦系数差0.1、质量差5克、电机响应慢10毫秒——这些微小差异在仿真里看不出来，但策略部署后会被放大。&lt;/p&gt;
&lt;p&gt;更麻烦的是，这些参数往往是未知的。你不知道真实世界的精确摩擦系数是多少，只能猜一个范围。&lt;/p&gt;
&lt;h3 id="2-未建模动态unmodeled-dynamics"&gt;2. 未建模动态（Unmodeled Dynamics）&lt;/h3&gt;
&lt;p&gt;仿真器只能模拟已知的物理规律。但真实世界有很多&amp;quot;意外&amp;quot;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;柔性物体的形变（比如抓取一块布料，布料的褶皱无法精确预测）&lt;/li&gt;
&lt;li&gt;接触非线性（两个表面接触时的粘滑效应、微小振动）&lt;/li&gt;
&lt;li&gt;传感噪声（相机图像的光照变化、力传感器的漂移）&lt;/li&gt;
&lt;li&gt;外部干扰（有人碰了一下桌子、地面轻微震动）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些动态在仿真里要么被简化，要么完全忽略。策略在仿真里学的是&amp;quot;理想世界&amp;quot;的规律，到真实世界就懵了。&lt;/p&gt;
&lt;h3 id="3-安全约束safety-constraints"&gt;3. 安全约束（Safety Constraints）&lt;/h3&gt;
&lt;p&gt;在仿真里，策略可以随便试错——撞坏了重启就行。但在真实世界，机器人撞坏了是真坏了，还可能伤到人。&lt;/p&gt;
&lt;p&gt;这意味着部署到真实世界的策略必须满足安全约束：不能超出关节限位、不能产生过大的力、不能进入危险区域。这些约束在仿真训练时往往没有被充分考虑。&lt;/p&gt;
&lt;h2 id="传统方法域随机化的局限性"&gt;传统方法：域随机化的局限性&lt;/h2&gt;
&lt;p&gt;过去几年，Sim-to-Real迁移的主流方法是域随机化（Domain Randomization）。&lt;/p&gt;
&lt;p&gt;思路很直觉：既然不知道真实世界的精确参数，那就在仿真里随机化这些参数。训练时，每次episode都用不同的摩擦系数、质量、光照条件、传感噪声。策略在这么多&amp;quot;不同的世界&amp;quot;里训练，总有一个和真实世界接近。&lt;/p&gt;
&lt;p&gt;这个方法确实有效。OpenAI的Rubik&amp;rsquo;s Cube机器人（2019年）就是用域随机化实现的——在仿真里训练，直接部署到真实世界，成功率达到90%以上。&lt;/p&gt;
&lt;p&gt;但域随机化有几个根本性的局限：&lt;/p&gt;
&lt;p&gt;第一，随机化范围难确定。如果范围太小，覆盖不到真实世界的参数；如果范围太大，策略会变得过于保守，什么都做不好。&lt;/p&gt;
&lt;p&gt;第二，只能处理已知的不确定性。域随机化只能随机化你&amp;quot;知道要随机化&amp;quot;的参数。但未建模动态（比如柔性形变）你根本不知道该怎么随机化。&lt;/p&gt;
&lt;p&gt;第三，样本效率低。为了覆盖足够大的参数空间，需要大量的训练数据。对于复杂的机器人任务，训练时间可能长达数周。&lt;/p&gt;
&lt;h2 id="新思路用世界模型作为桥梁"&gt;新思路：用世界模型作为&amp;quot;桥梁&amp;quot;&lt;/h2&gt;
&lt;p&gt;世界模型为Sim-to-Real迁移提供了一个全新的思路：不让策略直接从仿真跳到真实世界，而是让世界模型作为中间的&amp;quot;桥梁&amp;quot;。&lt;/p&gt;
&lt;p&gt;核心思想是：世界模型学习了环境的动态规律。如果这个世界模型足够好，它应该能同时模拟仿真环境和真实世界。策略在世界模型的&amp;quot;想象空间&amp;quot;中训练，而不是在仿真器中训练。这样策略学到的不是&amp;quot;仿真世界的规律&amp;quot;，而是&amp;quot;更通用的环境规律&amp;quot;。&lt;/p&gt;
&lt;p&gt;具体来说，世界模型驱动的Sim-to-Real迁移有三个关键机制：&lt;/p&gt;
&lt;h3 id="机制一世界模型驱动的域适应"&gt;机制一：世界模型驱动的域适应&lt;/h3&gt;
&lt;p&gt;传统域随机化是在仿真器层面随机化参数。世界模型方法则是在模型层面做适应。&lt;/p&gt;
&lt;p&gt;流程是这样的：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;在仿真环境中收集大量数据，训练一个世界模型&lt;/li&gt;
&lt;li&gt;在真实世界中收集少量数据（可能只有几分钟的演示）&lt;/li&gt;
&lt;li&gt;用真实数据微调世界模型，让它&amp;quot;适应&amp;quot;真实世界的动态&lt;/li&gt;
&lt;li&gt;在适应后的世界模型中重新训练策略&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;这个方法的优势在于：世界模型的参数量远小于仿真器的参数量。微调世界模型比重新校准仿真器快得多，而且只需要少量真实数据。&lt;/p&gt;
&lt;p&gt;举个例子：一个机械臂抓取任务，仿真里训练的世界模型预测的摩擦力是0.3，但真实世界的摩擦力是0.35。传统方法需要重新校准仿真器的摩擦参数，可能需要几个小时。而世界模型方法只需要用真实数据微调几轮，模型就能学会正确的摩擦力，可能只要几分钟。&lt;/p&gt;
&lt;h3 id="机制二渐进式信任迁移"&gt;机制二：渐进式信任迁移&lt;/h3&gt;
&lt;p&gt;即使世界模型适应得很好，直接把策略部署到真实世界还是有风险。渐进式信任迁移的思路是：分阶段部署，每一步都有安全约束。&lt;/p&gt;
&lt;p&gt;具体分为三个阶段：&lt;/p&gt;
&lt;p&gt;阶段一：纯仿真训练&lt;/p&gt;
&lt;p&gt;策略完全在世界模型的想象空间中训练。这个阶段策略可能还不稳定，但没关系，因为在仿真里。&lt;/p&gt;
&lt;p&gt;阶段二：混合环境训练&lt;/p&gt;
&lt;p&gt;策略在仿真和真实世界之间交替训练。比如奇数episode在仿真里跑，偶数episode在真实世界里跑。真实世界的episode中，加入安全约束（比如限制速度、限制力的范围）。&lt;/p&gt;
&lt;p&gt;这个阶段的关键是信任度评估：世界模型会预测&amp;quot;在真实世界中执行这个动作的后果&amp;quot;。如果预测的不确定性太高，就降低策略的探索强度，或者切换到更保守的行为。&lt;/p&gt;
&lt;p&gt;阶段三：真实世界部署&lt;/p&gt;
&lt;p&gt;策略完全在真实世界中运行。但世界模型仍然在后台运行，持续预测环境动态。如果预测和实际观测偏差太大，触发安全机制（比如减速、停止、请求人工干预）。&lt;/p&gt;
&lt;p&gt;这种渐进式的方法，核心优势是安全。每一步都有安全保障，不会出现&amp;quot;仿真里好好的，一部署就撞坏&amp;quot;的情况。&lt;/p&gt;
&lt;h3 id="机制三在线模型适配"&gt;机制三：在线模型适配&lt;/h3&gt;
&lt;p&gt;即使部署成功了，真实世界还在不断变化。温度变了、零件磨损了、桌面被移动了——这些都会影响策略的性能。&lt;/p&gt;
&lt;p&gt;在线模型适配的思路是：部署后，世界模型持续从真实数据中学习，不断修正自己的预测。&lt;/p&gt;
&lt;p&gt;具体做法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;策略执行动作时，世界模型同时预测下一个状态&lt;/li&gt;
&lt;li&gt;真实传感器返回实际观测&lt;/li&gt;
&lt;li&gt;比较预测和实际观测，计算误差&lt;/li&gt;
&lt;li&gt;用这个误差更新世界模型的参数（在线学习）&lt;/li&gt;
&lt;li&gt;更新后的世界模型用于下一步的预测和策略更新&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这个机制让策略能够持续适应环境变化。比如机械臂的关节随着使用会磨损，摩擦力会逐渐变化。在线适配的世界模型能捕捉到这种变化，策略也能相应调整。&lt;/p&gt;
&lt;h2 id="安全约束控制屏障函数"&gt;安全约束：控制屏障函数&lt;/h2&gt;
&lt;p&gt;前面提到了安全约束，这里展开说一下具体的实现方法。&lt;/p&gt;</description></item><item><title>从1分钟到24小时：ABot-World-0突破的核心意义</title><link>https://www.worldsensetech.com/zh/articles/abot-world-0-24h-inference/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/abot-world-0-24h-inference/</guid><description>&lt;p&gt;做世界模型方向大半年，这次高德 ABot-World-0 的更新值得关注，因为它解决的是这个领域一直绕不过去的问题：长时间尺度下的世界一致性。&lt;/p&gt;
&lt;h2 id="过去交互式世界模型最大的瓶颈是什么"&gt;过去交互式世界模型最大的瓶颈是什么&lt;/h2&gt;
&lt;p&gt;不是&amp;quot;不能生成画面&amp;quot;，而是无法保持长期一致性。&lt;/p&gt;
&lt;p&gt;短时间生成（几十秒到几分钟）：人物外观还能保持，场景还能连贯，动作还能响应。&lt;/p&gt;
&lt;p&gt;但时间拉长后：物体位置漂移、场景规则变化、角色身份丢失、前后状态不一致。&lt;/p&gt;
&lt;p&gt;所以世界模型一直停留在&amp;quot;演示级&amp;quot;——能生成一段炫酷的短视频，但没法持续运行。&lt;/p&gt;
&lt;p&gt;ABot-World-0 将推理时长从分钟级提升到24小时，真正突破的是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;让模型从&amp;quot;生成一个短暂的未来&amp;quot;，变成&amp;quot;持续维护一个世界状态&amp;quot;。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="第一交互式世界模型开始具备持续运行能力"&gt;第一，交互式世界模型开始具备&amp;quot;持续运行能力&amp;quot;&lt;/h2&gt;
&lt;p&gt;以前的范式：&lt;/p&gt;
&lt;p&gt;输入 → 生成几十秒未来 → 结束。&lt;/p&gt;
&lt;p&gt;现在的范式：&lt;/p&gt;
&lt;p&gt;当前世界状态 → 用户行动 → 继续演化 → 数小时甚至一天。&lt;/p&gt;
&lt;p&gt;这意味着世界模型不再像视频播放器，而更像：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;游戏服务器&lt;/li&gt;
&lt;li&gt;虚拟环境&lt;/li&gt;
&lt;li&gt;AI Agent 沙盒&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;AI 可以在里面长期探索，而不是只能观看一段生成结果。&lt;/p&gt;
&lt;h2 id="第二解决了世界模型落地最大的工程障碍时间尺度"&gt;第二，解决了世界模型落地最大的工程障碍：时间尺度&lt;/h2&gt;
&lt;p&gt;很多 AI 能力的问题，不是瞬间预测能力不足，而是：能不能在很长时间里保持正确。&lt;/p&gt;
&lt;p&gt;比如：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;自动驾驶需要预测几秒后的车辆行为、几分钟后的交通变化&lt;/li&gt;
&lt;li&gt;机器人需要连续执行任务、保持环境记忆&lt;/li&gt;
&lt;li&gt;游戏Agent需要在开放世界长期活动&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;24小时推理能力意味着世界模型开始接近真实应用需要的时间尺度。&lt;/p&gt;
&lt;p&gt;但需要澄清：24小时稳定推理主要证明的是稳定运行能力，不代表24小时物理完全一致、细节无漂移、或具备真实世界理解。长时间演化后质量仍会有衰减，这是当前所有自回归模型的共性问题。&lt;/p&gt;
&lt;h2 id="第三降低了世界模拟的使用门槛"&gt;第三，降低了世界模拟的使用门槛&lt;/h2&gt;
&lt;p&gt;5B参数，19GiB显存，单张RTX 5090就能跑，Apache 2.0开源。&lt;/p&gt;
&lt;p&gt;意义不是简单&amp;quot;省算力&amp;quot;，而是：&lt;/p&gt;
&lt;p&gt;以前：世界模型 = 大公司实验室资产&lt;/p&gt;
&lt;p&gt;未来：世界模型 = 开发者可以部署的基础模型&lt;/p&gt;
&lt;p&gt;类似 Stable Diffusion 让图像生成从云端服务变成开发生态。&lt;/p&gt;
&lt;h2 id="第四对机器人的意义是提供更长的想象空间"&gt;第四，对机器人的意义是提供更长的&amp;quot;想象空间&amp;quot;&lt;/h2&gt;
&lt;p&gt;机器人训练最大的成本是真实世界试错。如果世界模型可以稳定运行很长时间，机器人可以在虚拟环境里练习、模拟大量失败案例、提升策略学习效率。&lt;/p&gt;
&lt;p&gt;但要注意：ABot-World-0 目前主要突破的是视觉世界状态的长时稳定演化，距离&amp;quot;机器人可以依靠它学习复杂动作&amp;quot;还有距离。视觉演化与控制策略之间还需要打通。&lt;/p&gt;
&lt;h2 id="更准确的行业判断"&gt;更准确的行业判断&lt;/h2&gt;
&lt;p&gt;ABot-World-0 的意义不是&amp;quot;AI已经创造了真实世界模拟器&amp;quot;，而是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;ABot-World-0 标志着交互式世界模型进一步从短时生成，走向长时间尺度运行。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;这一步的重要性类似：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;图像生成 → 高质量图片&lt;/li&gt;
&lt;li&gt;视频生成 → 长视频&lt;/li&gt;
&lt;li&gt;世界模型 → 可持续运行的虚拟世界&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;它标志着世界模型竞争开始从&amp;quot;能不能生成一个世界&amp;quot;进入&amp;quot;这个世界能不能一直运行&amp;quot;。&lt;/p&gt;</description></item><item><title>从零搭建世界模型实验环境：MuJoCo + DreamerV3 实战指南</title><link>https://www.worldsensetech.com/zh/articles/world-model-lab-setup/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-lab-setup/</guid><description>&lt;p&gt;前面写了好几篇世界模型的理论文章——从 RSSM 的数学原理到 Sim-to-Real 迁移，到 VLA 和世界模型的对比。有读者问：道理我都懂了，怎么动手跑起来？&lt;/p&gt;
&lt;p&gt;今天这篇就是回答这个问题的。我会手把手带你搭建一个完整的世界模型实验环境，从安装到训练到可视化，一步步走通。跑通之后，你就可以在这个基础上做自己的实验了。&lt;/p&gt;
&lt;p&gt;我们选用的工具链是：MuJoCo（物理仿真）+ DreamerV3（世界模型）。如果你需要更高保真度的渲染，后面可以替换为 Isaac Sim，但入门阶段 MuJoCo 足够了。&lt;/p&gt;
&lt;h2 id="工具选型为什么是这两个"&gt;工具选型：为什么是这两个&lt;/h2&gt;
&lt;p&gt;MuJoCo：目前机器人仿真领域最主流的引擎之一。物理精度高、API 简洁、速度快。2021 年被 DeepMind 收购后开源免费，现在是机器人学习研究的事实标准，也是连续控制世界模型研究中最常用的 benchmark 之一。&lt;/p&gt;
&lt;p&gt;DreamerV3：Danijar Hafner 等人开发的世界模型算法，是 Dreamer 系列的第三代。它用 RSSM（循环状态空间模型）学习环境动态，在想象空间中训练 Actor-Critic 策略。代码开源，文档清晰，是学习世界模型最好的起点。需要注意的是，DreamerV3 底层基于JAX + Haiku框架，而非 TensorFlow。&lt;/p&gt;
&lt;p&gt;日志格式说明：DreamerV3（commit e3f02248）输出自己的日志格式（&lt;code&gt;metrics.jsonl&lt;/code&gt; 和 &lt;code&gt;scores.jsonl&lt;/code&gt;），不使用 TensorBoard 的 event files。虽然名字里带&amp;quot;json&amp;quot;，但这是 JSON Lines 格式（每行一个 JSON 对象），可以用 Python 直接读取和可视化。本教程会教你如何用 Python 分析这些日志。&lt;/p&gt;
&lt;p&gt;如果你本地机器内存不足（低于 32GB），建议使用云端资源：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Google Colab：免费 GPU，内存约 12-25GB，适合快速验证。注意 Colab 的 session 有时长限制&lt;/li&gt;
&lt;li&gt;AutoDL / 矩池云：国内云平台，按小时计费，GPU 机型丰富&lt;/li&gt;
&lt;li&gt;AWS / GCP / Azure：按需启动 GPU 实例，适合长期实验&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;云端运行的好处是不受本地硬件限制，坏处是需要上传下载数据和模型。对于入门学习，Google Colab 是最经济的选择。&lt;/p&gt;</description></item><item><title>VLA vs 世界模型，谁主沉浮？</title><link>https://www.worldsensetech.com/zh/articles/vla-vs-world-model/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/vla-vs-world-model/</guid><description>&lt;p&gt;2025年到2026年，机器人AI领域出现了两条截然不同的技术路线。一条是以RT-2、OpenVLA、π0为代表的VLA（Vision-Language-Action，视觉-语言-动作），另一条是以DreamerV3、Genie、DIAMOND为代表的世界模型（World Models）。&lt;/p&gt;
&lt;p&gt;很多同行问我：这两条路线，到底该押哪一边？我的回答是：这个问题本身就问错了。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想把这两条路线拆开来对比，讲清楚它们各自的逻辑、优势和瓶颈，最后聊聊为什么我认为它们最终会走向融合。&lt;/p&gt;
&lt;h2 id="两条路线的核心逻辑"&gt;两条路线的核心逻辑&lt;/h2&gt;
&lt;p&gt;先说VLA。&lt;/p&gt;
&lt;p&gt;VLA的思路很直接：把机器人的控制问题，变成一个&amp;quot;看图说话&amp;quot;问题。给模型一张摄像头的图片，再给它一句语言指令（比如&amp;quot;把红色杯子放到桌子上&amp;quot;），让它直接输出机器人关节应该怎么动。&lt;/p&gt;
&lt;p&gt;本质上，VLA是一个感知-决策的端到端映射。它不关心物理规律是什么，不关心动力学方程怎么解，它只关心一件事：给定当前看到的画面和语言指令，最优的动作是什么？&lt;/p&gt;
&lt;p&gt;这种方法的灵感来自大语言模型的成功。GPT能&amp;quot;看图说话&amp;quot;，那为什么不能让一个类似的模型&amp;quot;看图做动作&amp;quot;？RT-2（Google DeepMind，2023）第一次证明了这条路可行——它把机器人动作离散化成token，直接用Transformer来预测。从此，VLA成了一个热门方向。&lt;/p&gt;
&lt;p&gt;世界模型的思路完全不同。&lt;/p&gt;
&lt;p&gt;前面几篇文章我详细讲过，世界模型的核心是学习&amp;quot;如果我执行这个动作，环境会怎么变化&amp;quot;。它不是直接从观察映射到动作，而是先建立一个环境的&amp;quot;内部模拟器&amp;quot;，然后在这个模拟器中想象不同动作的后果，再选择最优的方案。&lt;/p&gt;
&lt;p&gt;打个比方：VLA像一个经验丰富的老司机，看到路况就直接打方向盘——靠的是大量驾驶数据训练出来的直觉。世界模型像一个谨慎的新手司机，每次变道前都会先在脑中模拟：&amp;ldquo;如果我变道，后面的车会怎么反应？安全吗？&amp;quot;——靠的是对物理世界的理解。&lt;/p&gt;
&lt;p&gt;一句话总结区别：VLA是&amp;quot;看到就做&amp;rdquo;，世界模型是&amp;quot;想了再做&amp;quot;。&lt;/p&gt;
&lt;h2 id="vla的优势和瓶颈"&gt;VLA的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;VLA最大的优势是数据飞轮。&lt;/p&gt;
&lt;p&gt;互联网上有海量的视觉-语言数据（图片、视频、文本），这些数据都可以用来预训练VLA模型。然后再用少量的机器人操作数据做微调。这让VLA天然具备很强的泛化能力——它能理解没见过的物体，能遵循自然语言指令，甚至能做简单的推理。&lt;/p&gt;
&lt;p&gt;2025年涌现的几个代表性工作，把这种优势发挥到了极致：&lt;/p&gt;
&lt;p&gt;π0（Physical Intelligence，2024）：用flow matching生成连续动作序列，在折叠衣服、装洗碗机等复杂家务任务上表现出色。它证明了预训练VLA可以通过少量任务微调，快速适应新任务。&lt;/p&gt;
&lt;p&gt;OpenVLA（斯坦福/UC Berkeley，2024）：开源的VLA模型，基于Llama-2视觉语言模型微调，在Open X-Embodiment数据集上达到了不错的性能。开源让中小团队也能参与VLA研究。&lt;/p&gt;
&lt;p&gt;RT-2（Google DeepMind，2023）：最早把机器人动作变成token的工作，证明了55B参数的VLA可以zero-shot泛化到没见过的物体和指令。&lt;/p&gt;
&lt;p&gt;但VLA有一个根本性的瓶颈：缺乏长程规划能力。&lt;/p&gt;
&lt;p&gt;VLA的每一次决策都是&amp;quot;看到当前画面→输出动作&amp;quot;，它没有一个长期的&amp;quot;计划&amp;quot;。对于简单的单步任务（抓一个杯子），这没问题。但对于需要多步推理的复杂任务（&amp;ldquo;整理这个房间&amp;rdquo;——需要先收桌子、再扫地、再擦窗户），VLA就容易迷失方向。&lt;/p&gt;
&lt;p&gt;另一个问题是样本效率。VLA需要海量的机器人操作数据来微调。收集这些数据非常昂贵——每个任务都需要真实机器人反复执行，或者用仿真生成再迁移。对于中小团队来说，这是一个很高的门槛。&lt;/p&gt;
&lt;h2 id="世界模型的优势和瓶颈"&gt;世界模型的优势和瓶颈&lt;/h2&gt;
&lt;p&gt;世界模型最大的优势是样本效率和规划能力。&lt;/p&gt;
&lt;p&gt;因为世界模型学会了环境的动态规律，它可以在&amp;quot;想象&amp;quot;中生成大量的训练数据。一个训练好的世界模型，跑一天&amp;quot;想象&amp;quot;产生的数据量，可能超过真实机器人跑一个月。这大幅降低了对真实数据的依赖。&lt;/p&gt;
&lt;p&gt;DreamerV3已经证明了这一点：同一套参数，在55款Atari游戏上从零训练，只需要少量真实交互就能达到高水平表现。在机器人操控任务上，它的样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;规划能力是世界模型的另一张王牌。因为可以在想象中&amp;quot;预演&amp;quot;未来，世界模型天然适合做长程规划。比如一个机械臂要完成&amp;quot;打开抽屉→取出工具→拧螺丝&amp;quot;这样的多步任务，世界模型可以先在想象中模拟整个流程，找到最优的动作序列，再去执行。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型方向也有几个重要进展：&lt;/p&gt;
&lt;p&gt;DIAMOND（2024）：用diffusion model做世界模型，在Atari上超越了DreamerV3的表现。证明了生成模型的范式也可以用于环境建模。&lt;/p&gt;
&lt;p&gt;Genie 2（Google DeepMind，2024）：从视频中学习交互式3D环境，可以从单张图片生成可交互的虚拟世界。虽然还不完美，但方向很有想象力。&lt;/p&gt;
&lt;p&gt;但世界模型也有明显的短板。&lt;/p&gt;
&lt;p&gt;第一是规模化困难。世界模型需要学习环境的动态规律，这意味着它必须对物理世界有很精确的理解。这比VLA的&amp;quot;模式匹配&amp;quot;要难得多。目前的世界模型大多还在实验室级别的简单任务上打转，离大规模应用还有距离。&lt;/p&gt;
&lt;p&gt;第二是语言接地弱。世界模型学习的是视觉-动作的映射，它不太理解自然语言指令。要让世界模型遵循&amp;quot;把红色的杯子放到蓝色的桌子上&amp;quot;这样的指令，需要额外的语言模块，目前还没有很好的解决方案。&lt;/p&gt;
&lt;p&gt;第三是长期预测的误差累积。世界模型在想象中预测越远的未来，误差越大。这限制了它的规划深度——通常只能可靠地预测未来几十步，对于需要上百步的复杂任务，规划质量会明显下降。&lt;/p&gt;
&lt;h2 id="对比一张表看清差异"&gt;对比：一张表看清差异&lt;/h2&gt;
&lt;p&gt;把两条路线放在一起对比：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;维度&lt;/th&gt;
					&lt;th&gt;VLA&lt;/th&gt;
					&lt;th&gt;世界模型&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;核心思路&lt;/td&gt;
					&lt;td&gt;观察→动作的直接映射&lt;/td&gt;
					&lt;td&gt;学习环境动态，想象后行动&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;类比&lt;/td&gt;
					&lt;td&gt;直觉反应（老司机）&lt;/td&gt;
					&lt;td&gt;心理模拟（谨慎新手）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;数据需求&lt;/td&gt;
					&lt;td&gt;大量（需要海量操作数据）&lt;/td&gt;
					&lt;td&gt;较少（想象空间增强）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;泛化能力&lt;/td&gt;
					&lt;td&gt;强（语言接地，可zero-shot）&lt;/td&gt;
					&lt;td&gt;中（受限于训练环境分布）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规划能力&lt;/td&gt;
					&lt;td&gt;弱（单步决策为主）&lt;/td&gt;
					&lt;td&gt;强（可多步想象推演）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;语言理解&lt;/td&gt;
					&lt;td&gt;强（天然支持语言指令）&lt;/td&gt;
					&lt;td&gt;弱（需要额外模块）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;规模化&lt;/td&gt;
					&lt;td&gt;容易（可复用LLM基础设施）&lt;/td&gt;
					&lt;td&gt;困难（环境建模复杂度高）&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;代表工作&lt;/td&gt;
					&lt;td&gt;RT-2, π0, OpenVLA&lt;/td&gt;
					&lt;td&gt;DreamerV3, DIAMOND, Genie 2&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;看完这张表，你可能觉得VLA全面占优。短期来看确实如此——VLA更容易工程化，更容易拿到融资，也更容易做出demo。但世界模型在样本效率和规划能力上的优势，是VLA短期内很难弥补的。&lt;/p&gt;</description></item><item><title>具身智能、强化学习的前景如何？</title><link>https://www.worldsensetech.com/zh/articles/embodied-ai-rl-prospects/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/embodied-ai-rl-prospects/</guid><description>&lt;p&gt;这个问题最近被问得很多。我结合自己观察到的行业情况和招聘市场的变化，说一些实际的。&lt;/p&gt;
&lt;h2 id="先说结论前景好但分化严重"&gt;先说结论：前景好，但分化严重&lt;/h2&gt;
&lt;p&gt;具身智能和强化学习不是&amp;quot;uniformly good&amp;quot;的方向。不同细分领域、不同公司类型、不同岗位的需求差异很大。&lt;/p&gt;
&lt;p&gt;一句话总结：算法岗卷，工程岗缺，应用岗刚起步。&lt;/p&gt;
&lt;h2 id="算法岗卷但天花板高"&gt;算法岗：卷，但天花板高&lt;/h2&gt;
&lt;p&gt;强化学习算法工程师是最热门的方向之一，但竞争也很激烈。&lt;/p&gt;
&lt;p&gt;需求端：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;大厂AI Lab（DeepMind、OpenAI、Meta、字节、腾讯）：持续招聘，但门槛极高，基本要求顶会论文+名校博士&lt;/li&gt;
&lt;li&gt;人形机器人公司（宇树、智元、傅利叶等）：2024-2025年大量扩招，但2026年开始收紧，更看重实际落地能力&lt;/li&gt;
&lt;li&gt;自动驾驶公司（Waymo、小鹏、华为）：决策规划模块需要RL背景，需求稳定&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;薪资范围（2026年，国内，仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;应届博士：约40-80万/年（大厂SP offer可达100万+，但名额很少）&lt;/li&gt;
&lt;li&gt;3-5年经验：约60-120万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深/专家：150万+（这类岗位非常稀缺）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;现实问题：算法岗的HC（headcount）在减少。2024年人形机器人热潮时大量招聘，2025-2026年很多公司发现技术落地比预期慢，开始优化团队。纯算法、没有工程能力的人风险最大。&lt;/p&gt;
&lt;h2 id="工程岗缺人但要求复合背景"&gt;工程岗：缺人，但要求复合背景&lt;/h2&gt;
&lt;p&gt;这是我觉得被低估的方向。&lt;/p&gt;
&lt;p&gt;具身智能不只是算法问题，更是工程问题。把模型部署到真实机器人上，需要解决：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;实时控制：策略推理延迟要控制在10ms以内&lt;/li&gt;
&lt;li&gt;硬件集成：传感器标定、执行器驱动、通信协议&lt;/li&gt;
&lt;li&gt;系统优化：CUDA加速、模型压缩、边缘部署&lt;/li&gt;
&lt;li&gt;仿真平台：搭建和维护大规模并行仿真环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;能做这些事的人，目前市场上很缺。而且这类岗位对学历的要求相对宽松——本科+实战经验就可以，不一定需要博士。&lt;/p&gt;
&lt;p&gt;薪资范围（仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;3-5年经验：约50-90万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深工程师：约80-150万/年（高级岗位数量有限）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;不比算法岗低多少，但竞争小很多。&lt;/p&gt;
&lt;h2 id="应用岗刚起步机会最大"&gt;应用岗：刚起步，机会最大&lt;/h2&gt;
&lt;p&gt;这是我最看好的方向。&lt;/p&gt;
&lt;p&gt;具身智能的技术已经过了&amp;quot;能不能做&amp;quot;的阶段，进入&amp;quot;怎么用&amp;quot;的阶段。工厂里需要把AI能力集成到现有产线，物流公司需要机器人分拣，医院需要手术辅助——这些场景不需要你发明新算法，需要你把现有技术应用到具体问题。&lt;/p&gt;
&lt;p&gt;典型岗位：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;机器人应用工程师：负责具体场景的任务适配和部署&lt;/li&gt;
&lt;li&gt;Sim-to-Real工程师：把仿真训练的策略迁移到真实机器人&lt;/li&gt;
&lt;li&gt;技术方案工程师：对接客户需求，设计技术解决方案&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这类岗位的需求正在快速增长，但目前供给不足。因为传统机器人工程师不懂AI，AI工程师不懂机器人，两者都懂的人很少。&lt;/p&gt;
&lt;p&gt;薪资范围（仅供参考）：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;3-5年经验：约40-70万/年（因公司、地区、个人能力差异较大）&lt;/li&gt;
&lt;li&gt;资深/管理岗：约70-120万/年（这类岗位相对稀缺）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;起薪可能不如算法岗，但增长空间大，而且离业务近，不容易被优化。&lt;/p&gt;
&lt;h2 id="几个趋势判断"&gt;几个趋势判断&lt;/h2&gt;
&lt;ol&gt;
&lt;li&gt;纯算法岗会继续卷，工程和应用岗会升值。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;随着基础模型（大语言模型、基础世界模型）越来越强，&amp;ldquo;调参侠&amp;quot;的价值在下降。能把模型落地的人价值在上升。&lt;/p&gt;
&lt;ol start="2"&gt;
&lt;li&gt;跨界人才最吃香。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;懂AI + 懂机器人 + 懂行业（制造、物流、医疗）的复合型人才，未来3-5年都会很抢手。&lt;/p&gt;
&lt;ol start="3"&gt;
&lt;li&gt;创业机会在应用层。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;基础模型是大厂的游戏，但应用层有大量细分场景还没被覆盖。比如&amp;quot;用世界模型做工厂机器人快速任务适配&amp;rdquo;，这种方向大厂看不上，但市场需求真实存在。&lt;/p&gt;
&lt;ol start="4"&gt;
&lt;li&gt;地域分化明显。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;北京、上海、深圳、杭州集中了80%以上的岗位。其他城市的机会很少，除非是当地有机器人产业集群（比如东莞、苏州）。&lt;/p&gt;
&lt;h2 id="给不同背景的人的建议"&gt;给不同背景的人的建议&lt;/h2&gt;
&lt;p&gt;在校学生：如果有机会读博，读博。算法岗的门槛只会越来越高。但博士期间一定要做有工程价值的工作，不要纯理论。&lt;/p&gt;
&lt;p&gt;转行者：不要直接冲算法岗，竞争太激烈。从工程岗或应用岗切入，积累实战经验后再往算法方向转。&lt;/p&gt;
&lt;p&gt;传统机器人工程师：学PyTorch、学RL基础、学仿真工具（MuJoCo、Isaac Sim）。你已有的机器人知识是优势，补上AI这块就很有竞争力。&lt;/p&gt;
&lt;p&gt;纯软件工程师：学机器人学基础、学控制理论、了解硬件。你的编程能力是优势，补上物理世界这块。&lt;/p&gt;
&lt;h2 id="最后说一点"&gt;最后说一点&lt;/h2&gt;
&lt;p&gt;具身智能和强化学习的前景是好的，但这个&amp;quot;好&amp;quot;不是均匀的。它属于那些愿意深入理解问题、能动手解决实际问题的人，不属于只想追风口的人。&lt;/p&gt;
&lt;p&gt;我自己在做的方向是世界模型 + Sim-to-Real，属于工程和应用之间的交叉地带。没有大厂的资源，也没有学术界的背景，但通过持续输出内容、积累实战经验，慢慢建立自己的影响力。&lt;/p&gt;
&lt;p&gt;这条路不快，但走通了就很稳。&lt;/p&gt;</description></item><item><title>2026年，「世界模型」会是下一个AI风口么？</title><link>https://www.worldsensetech.com/zh/articles/world-model-2026-trend/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-2026-trend/</guid><description>&lt;p&gt;先说结论：是世界模型的风口，但不是所有人的风口。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型确实热起来了。Sora、Kling、Vidu这些视频生成模型本质上都在学&amp;quot;世界怎么变化&amp;quot;；DreamerV3在机器人控制上证明了世界模型的样本效率优势；2026年中科院的综述把四大技术范式梳理清楚，标志着这个方向从&amp;quot;散兵游勇&amp;quot;进入&amp;quot;体系化&amp;quot;阶段。&lt;/p&gt;
&lt;p&gt;但&amp;quot;风口&amp;quot;这个词需要拆开看。我分三个层面聊。&lt;/p&gt;
&lt;h2 id="技术层面确实在爆发"&gt;技术层面：确实在爆发&lt;/h2&gt;
&lt;p&gt;几个信号很明确：&lt;/p&gt;
&lt;p&gt;论文数量翻倍。2024-2025年世界模型相关的顶会论文比前两年翻了一倍多，四大范式（观测级生成、隐空间建模、强化学习驱动、对象中心表示）已经成型。&lt;/p&gt;
&lt;p&gt;大厂入场。DeepMind、OpenAI、Meta都在布局。OpenAI的Sora虽然定位是视频生成，但技术路线和世界模型高度重合。Meta的V-JEPA系列在隐空间世界模型上走得很快。&lt;/p&gt;
&lt;p&gt;应用场景拓宽。从最早的游戏仿真，扩展到机器人操控、自动驾驶决策、科学发现模拟、GUI智能体。每个场景都在催生新的技术需求。&lt;/p&gt;
&lt;p&gt;从技术成熟度曲线看，世界模型大概在&amp;quot;期望膨胀期&amp;quot;的早期阶段——技术有真实价值，但市场预期可能跑在了实际能力前面。&lt;/p&gt;
&lt;h2 id="产业层面离大规模商业化还有距离"&gt;产业层面：离大规模商业化还有距离&lt;/h2&gt;
&lt;p&gt;这是需要冷静看待的部分。&lt;/p&gt;
&lt;p&gt;Sim-to-Real还没解决。世界模型在仿真里很强，但部署到真实机器人上性能下降30-50%。这个瓶颈八年没突破，短期内也难有根本性解决方案。&lt;/p&gt;
&lt;p&gt;计算成本太高。训练一个像样的世界模型需要多张A100跑几周。对于创业公司或个人研究者，这个门槛不低。&lt;/p&gt;
&lt;p&gt;杀手级应用还没出现。大语言模型有ChatGPT，图像生成有Midjourney，世界模型的&amp;quot;ChatGPT时刻&amp;quot;还没到来。目前最接近的是机器人操控，但离消费级产品还有距离。&lt;/p&gt;
&lt;p&gt;所以从产业角度，世界模型更像是&amp;quot;2-3年后的风口&amp;quot;，不是&amp;quot;现在就能变现的风口&amp;quot;。&lt;/p&gt;
&lt;h2 id="个人层面谁适合现在入场"&gt;个人层面：谁适合现在入场&lt;/h2&gt;
&lt;p&gt;基于我自己的观察和实践，分几种情况：&lt;/p&gt;
&lt;p&gt;适合入场的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;做研究、读博、进大厂AI Lab的人——这是具身智能的核心技术，未来5-10年有持续需求&lt;/li&gt;
&lt;li&gt;有机器人/自动化背景的工程师——世界模型的应用层（任务适配、迁移工具链）离钱更近，大厂还没完全覆盖&lt;/li&gt;
&lt;li&gt;有算力资源的团队——能跑得起训练，有机会做出有影响力的工作&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要谨慎的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;想快速变现的创业者——这个方向太慢，不适合追求短期回报&lt;/li&gt;
&lt;li&gt;纯软件背景、没有物理世界经验的人——世界模型的核心难点在Sim-to-Real，需要懂机器人、懂控制、懂硬件&lt;/li&gt;
&lt;li&gt;算力有限的个人研究者——可以学原理、跑开源代码，但想做出原创贡献很难&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="我的判断"&gt;我的判断&lt;/h2&gt;
&lt;p&gt;世界模型是AI从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;的关键一步。这个方向的价值是确定的，但时间线可能比大多数人预期的要长。&lt;/p&gt;
&lt;p&gt;短期（1-2年）：技术继续突破，但商业化案例有限，主要是大厂和研究机构在推进。&lt;/p&gt;
&lt;p&gt;中期（3-5年）：Sim-to-Real问题部分解决，工业场景（机器人装配、仓储物流）开始出现规模化应用。&lt;/p&gt;
&lt;p&gt;长期（5-10年）：如果&amp;quot;统计拟合→机理理解&amp;quot;这个关口能突破，世界模型可能成为通用人工智能的基石。&lt;/p&gt;
&lt;p&gt;对于个人来说，现在入场不晚，但需要耐心。不要指望半年就能看到回报，给自己至少2-3年的时间。&lt;/p&gt;</description></item><item><title>回看世界模型8年进展，始终没突破的瓶颈是什么？</title><link>https://www.worldsensetech.com/zh/articles/world-model-8year-bottleneck/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-8year-bottleneck/</guid><description>&lt;p&gt;做世界模型方向大半年，最大的感受是：论文很多，但真正能落地的很少。最近读了一篇2026年中科院联合多所高校的综述，把八年来的进展梳理得很清楚。我结合自己的实践，聊聊几个始终没突破的瓶颈。&lt;/p&gt;
&lt;p&gt;先说进步。从2018年Ha和Schmidhuber提出世界模型概念，到DreamerV3在55款Atari游戏上统一参数跑出好成绩，再到Sora等视频生成模型的爆发，世界模型确实从&amp;quot;概念验证&amp;quot;走到了&amp;quot;技术验证&amp;quot;阶段。四大技术范式（观测级生成、隐空间建模、强化学习驱动、对象中心表示）已经成型，应用场景也从游戏扩展到了机器人、自动驾驶、科学发现等领域。&lt;/p&gt;
&lt;p&gt;但有几个核心瓶颈，八年过去了，依然没有根本性突破。&lt;/p&gt;
&lt;h2 id="瓶颈一sim-to-real鸿沟"&gt;瓶颈一：Sim-to-Real鸿沟&lt;/h2&gt;
&lt;p&gt;这是最痛的瓶颈。世界模型在仿真环境里表现很好，DreamerV3的样本效率比传统RL高出10-100倍。但仿真里训练的策略，部署到真实机器人上往往性能下降30-50%。&lt;/p&gt;
&lt;p&gt;域随机化能缓解一部分问题，但远没有解决。根本原因在于：仿真器无法完美模拟真实世界的物理动态——接触摩擦、柔性形变、传感噪声、未建模的干扰。世界模型学到的&amp;quot;世界规律&amp;quot;是仿真世界的规律，不是真实世界的。&lt;/p&gt;
&lt;p&gt;八年了，这个问题依然没有优雅的解决方案。要么花大量时间做系统辨识，要么接受性能打折。&lt;/p&gt;
&lt;h2 id="瓶颈二长程预测误差累积"&gt;瓶颈二：长程预测误差累积&lt;/h2&gt;
&lt;p&gt;世界模型的核心能力是&amp;quot;在想象中推演未来&amp;quot;。但预测不可能完美，每一步都有小误差，多步之后误差指数级放大。&lt;/p&gt;
&lt;p&gt;DreamerV3的想象步数限制在15步左右，超过这个长度预测就不可靠了。对于需要长期规划的任务（比如机器人完成一个多步骤的装配任务），15步远远不够。&lt;/p&gt;
&lt;p&gt;层级时序建模、显式因果表征这些方向有潜力，但目前都还在研究阶段，没有成熟的工程方案。&lt;/p&gt;
&lt;h2 id="瓶颈三物理一致性"&gt;瓶颈三：物理一致性&lt;/h2&gt;
&lt;p&gt;现在的模型能生成看起来很合理的画面，但经常违反物理定律。比如生成的视频里物体穿模了、重力方向不对、碰撞后动量不守恒。&lt;/p&gt;
&lt;p&gt;这是因为模型学的是数据分布的统计规律，不是物理定律。它知道&amp;quot;杯子掉在地上会碎&amp;quot;是因为训练数据里见过，而不是因为它理解了重力和材料力学。&lt;/p&gt;
&lt;p&gt;把物理约束（能量守恒、动量守恒、因果规则）嵌入模型是一个方向，但怎么嵌入、嵌入多少、会不会限制模型的表达能力，这些问题还没有共识。&lt;/p&gt;
&lt;h2 id="瓶颈四计算成本"&gt;瓶颈四：计算成本&lt;/h2&gt;
&lt;p&gt;训练一个像样的世界模型，需要多张A100跑几天到几周。推理时虽然比训练快，但对于实时控制场景（比如机器人每秒需要决策100次），延迟仍然太高。&lt;/p&gt;
&lt;p&gt;边缘设备部署更是难上加难。工业场景的机器人控制器算力有限，跑不动大模型。模型压缩、知识蒸馏这些方法能用，但会牺牲预测精度。&lt;/p&gt;
&lt;h2 id="为什么这些瓶颈难突破"&gt;为什么这些瓶颈难突破&lt;/h2&gt;
&lt;p&gt;根本原因在于：世界模型试图用数据驱动的方法解决一个需要机理理解的问题。&lt;/p&gt;
&lt;p&gt;人类理解世界靠的不只是观察统计，还有物理直觉、因果推理、抽象建模。现在的模型只有第一种能力，缺后两种。&lt;/p&gt;
&lt;p&gt;未来5年，如果能突破&amp;quot;统计拟合→机理理解&amp;quot;这个关口，世界模型才能真正成为通用人工智能和具身智能的基石。否则，它可能一直停留在*&amp;ldquo;仿真里很强，真实世界拉胯&amp;rdquo;*的状态。&lt;/p&gt;</description></item><item><title>你认为具身智能领域在2026年会有什么突破性进展？</title><link>https://www.worldsensetech.com/zh/articles/embodied-ai-2026-breakthrough/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/embodied-ai-2026-breakthrough/</guid><description>&lt;p&gt;具身智能（Embodied AI）在2025年已经明显加速了。人形机器人公司扎堆融资，大模型厂商纷纷布局机器人方向，各国政府也把具身智能列为战略重点。站在2026年的节点上，我觉得有几个方向会出现实质性突破。&lt;/p&gt;
&lt;h2 id="突破一世界模型从能想象到能决策"&gt;突破一：世界模型从&amp;quot;能想象&amp;quot;到&amp;quot;能决策&amp;quot;&lt;/h2&gt;
&lt;p&gt;2023-2024年，DreamerV3证明了世界模型可以在仿真中高效训练策略。但那时候的世界模型更像一个&amp;quot;环境模拟器&amp;quot;——能预测下一步会怎样，但和实际决策之间还隔着一层。&lt;/p&gt;
&lt;p&gt;2026年，我看到一个明显趋势：世界模型开始直接和决策系统打通。不再是&amp;quot;先建模、再训练策略&amp;quot;的两阶段流程，而是端到端的&amp;quot;建模即决策&amp;quot;。这意味着机器人可以在想象空间中直接完成从感知到规划到控制的全流程，不需要额外的策略网络。&lt;/p&gt;
&lt;p&gt;这个突破的意义在于：大幅缩短从&amp;quot;理解世界&amp;quot;到&amp;quot;采取行动&amp;quot;的链路，让机器人的反应速度接近人类水平。&lt;/p&gt;
&lt;h2 id="突破二sim-to-real迁移出现工程化方案"&gt;突破二：Sim-to-Real迁移出现工程化方案&lt;/h2&gt;
&lt;p&gt;这是我最期待的突破。过去八年，Sim-to-Real一直是世界模型落地的最大瓶颈。仿真里训练的策略，到真实世界性能打对折。&lt;/p&gt;
&lt;p&gt;2026年，几个技术路线开始 converge（汇合）：&lt;/p&gt;
&lt;p&gt;系统辨识自动化。不再需要工程师手动调参来匹配仿真和真实世界的物理参数，模型可以自动从少量真实数据中学习未建模的动态。&lt;/p&gt;
&lt;p&gt;渐进式信任迁移。策略不是一次性从仿真跳到真实世界，而是通过&amp;quot;仿真→混合环境→真实世界&amp;quot;的渐进过程，每一步都有安全约束保证不会出大问题。&lt;/p&gt;
&lt;p&gt;在线模型适配。部署到真实世界后，模型能持续从真实数据中学习，不断修正自己的预测偏差。&lt;/p&gt;
&lt;p&gt;这几个方向结合起来，2026年应该能看到第一批*&amp;ldquo;仿真训练、真实部署、性能不打折&amp;quot;的工业案例。不是实验室demo，是真正能在工厂里跑的。&lt;/p&gt;
&lt;h2 id="突破三多模态感知与物理理解的融合"&gt;突破三：多模态感知与物理理解的融合&lt;/h2&gt;
&lt;p&gt;之前的世界模型主要处理视觉信息（相机图像）。但真实世界的机器人需要融合多种感知——视觉、触觉、力觉、甚至听觉。&lt;/p&gt;
&lt;p&gt;2026年，多模态世界模型开始成熟。机器人不仅能&amp;quot;看到&amp;quot;物体，还能通过触觉反馈理解物体的材质、重量、摩擦力。这种多模态的物理理解，是灵巧操作（比如拧瓶盖、系鞋带、翻书页）的关键前提。&lt;/p&gt;
&lt;p&gt;我特别关注的是触觉传感器的进步。新一代高分辨率触觉传感器（比如GelSight的后续产品）能提供密集的接触力分布信息，让世界模型的物理预测从&amp;quot;大概合理&amp;quot;变成&amp;quot;精确可信&amp;rdquo;。&lt;/p&gt;
&lt;h2 id="突破四基础世界模型的雏形出现"&gt;突破四：基础世界模型的雏形出现&lt;/h2&gt;
&lt;p&gt;大语言模型的成功证明了一个规律：当模型足够大、数据足够多时，会涌现出意想不到的能力。世界模型领域也在走这条路。&lt;/p&gt;
&lt;p&gt;2026年，可能会出现第一批&amp;quot;基础世界模型&amp;quot;的雏形——不是针对某个特定任务训练的，而是在大规模多任务数据上预训练的通用世界模型。这种模型可以通过少量微调适配到不同的机器人任务上，就像GPT可以通过prompt适配到不同文本任务一样。&lt;/p&gt;
&lt;p&gt;当然，离真正的&amp;quot;通用世界模型&amp;quot;还很远。计算成本、数据规模、架构设计都还有大量问题。但方向是明确的，2026年应该能看到有价值的早期成果。&lt;/p&gt;
&lt;h2 id="一个需要冷静的地方"&gt;一个需要冷静的地方&lt;/h2&gt;
&lt;p&gt;说了这么多突破，也要泼一点冷水。&lt;/p&gt;
&lt;p&gt;具身智能的突破和NLP/视觉领域的突破有一个本质区别：它需要和物理世界打交道。&lt;/p&gt;
&lt;p&gt;大语言模型可以在服务器上跑，用户通过浏览器访问，边际成本几乎为零。但具身智能的每一个应用都需要硬件——机器人、传感器、执行器。这意味着规模化比纯软件慢得多，成本也高得多。&lt;/p&gt;
&lt;p&gt;所以2026年的突破更多是&amp;quot;技术验证&amp;quot;层面的，离&amp;quot;大规模商业化&amp;quot;还有距离。不要指望明年就能看到人形机器人在你家做饭——那个场景至少还要5-10年。&lt;/p&gt;
&lt;h2 id="对从业者的建议"&gt;对从业者的建议&lt;/h2&gt;
&lt;p&gt;如果你在具身智能方向工作或者想进入这个方向，2026年有几个值得关注的切入点：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;世界模型 + 工业场景：这是离钱最近的方向。工厂里的机器人任务适配、质量检测、柔性制造，都有真实需求。&lt;/li&gt;
&lt;li&gt;Sim-to-Real工具链：帮企业把仿真训练的策略部署到真实机器人上，这个需求会越来越大。&lt;/li&gt;
&lt;li&gt;多模态感知融合：特别是触觉+视觉的融合，是灵巧操作的关键。&lt;/li&gt;
&lt;li&gt;基础世界模型：如果你有算力资源和大团队，这是长期价值最高的方向。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;我自己关注的是前两个方向。没有大厂的算力，也没有学术界的资源，但在工业场景的落地经验上有一些积累。用自己能做好的方式参与这个变革，就够了。&lt;/p&gt;</description></item><item><title>强化学习应该怎么入门？</title><link>https://www.worldsensetech.com/zh/articles/reinforcement-learning-how-to-start/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/reinforcement-learning-how-to-start/</guid><description>&lt;p&gt;这个问题我很有感触。我自己就是从传统自动化转到强化学习方向的，中间踩了不少坑。说说我觉得最有效的路径。&lt;/p&gt;
&lt;h2 id="先搞清楚你要学强化学习做什么"&gt;先搞清楚：你要学强化学习做什么&lt;/h2&gt;
&lt;p&gt;强化学习的应用方向差异很大，学习路径也不同：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;玩游戏/仿真：Atari游戏、MuJoCo机器人仿真——入门最友好，资源最多&lt;/li&gt;
&lt;li&gt;机器人控制：机械臂、四足机器人、人形机器人——需要结合仿真和Sim-to-Real&lt;/li&gt;
&lt;li&gt;推荐系统/广告：互联网公司的主要应用场景——偏工程，数学要求相对低&lt;/li&gt;
&lt;li&gt;自动驾驶：决策规划模块——需要结合传统控制理论&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;先确定方向，再选择学习路径，效率会高很多。下面的建议以&amp;quot;机器人控制&amp;quot;为主线，因为这是我最熟悉的方向，也是目前最有前景的方向之一。&lt;/p&gt;
&lt;h2 id="第一阶段打基础1-2个月"&gt;第一阶段：打基础（1-2个月）&lt;/h2&gt;
&lt;h3 id="数学基础"&gt;数学基础&lt;/h3&gt;
&lt;p&gt;不需要博士级别的数学，但以下必须掌握：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;线性代数：矩阵运算、特征值分解、SVD——神经网络的基础&lt;/li&gt;
&lt;li&gt;概率论：贝叶斯定理、高斯分布、采样——RL的核心是概率决策&lt;/li&gt;
&lt;li&gt;微积分：梯度、链式法则、优化——理解反向传播和策略梯度&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推荐资源：3Blue1Brown的线性代数和微积分视频（B站有），直观易懂。&lt;/p&gt;
&lt;h3 id="深度学习基础"&gt;深度学习基础&lt;/h3&gt;
&lt;p&gt;不需要从头实现神经网络，但要理解：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;CNN、RNN、Transformer的基本原理和适用场景&lt;/li&gt;
&lt;li&gt;能用PyTorch搭建简单网络并训练&lt;/li&gt;
&lt;li&gt;理解过拟合、正则化、学习率调度等训练技巧&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推荐资源：李宏毅的机器学习课程（B站免费），讲得非常清楚。&lt;/p&gt;
&lt;h3 id="强化学习核心概念"&gt;强化学习核心概念&lt;/h3&gt;
&lt;p&gt;必须理解的概念（按顺序）：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;MDP（马尔可夫决策过程）：状态、动作、奖励、转移概率&lt;/li&gt;
&lt;li&gt;值函数和Q函数：评估&amp;quot;这个状态/动作有多好&amp;quot;&lt;/li&gt;
&lt;li&gt;策略梯度：直接优化策略参数&lt;/li&gt;
&lt;li&gt;Actor-Critic：结合值函数和策略梯度的优势&lt;/li&gt;
&lt;li&gt;探索与利用的权衡：ε-greedy、UCB、熵正则化&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;推荐资源：David Silver的强化学习课程（YouTube/B站），经典中的经典。&lt;/p&gt;
&lt;h2 id="第二阶段动手实践1-2个月"&gt;第二阶段：动手实践（1-2个月）&lt;/h2&gt;
&lt;p&gt;这是最重要的阶段。读10篇论文不如自己跑通一个项目。&lt;/p&gt;
&lt;h3 id="第一个项目cartpole"&gt;第一个项目：CartPole&lt;/h3&gt;
&lt;p&gt;用DQN或PPO在CartPole（倒立摆）上训练一个策略。这个任务简单，几分钟就能跑完，但能帮你理解整个RL训练流程：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;环境交互：agent执行动作，环境返回新状态和奖励&lt;/li&gt;
&lt;li&gt;经验收集：把交互数据存储到replay buffer&lt;/li&gt;
&lt;li&gt;策略更新：从buffer采样，计算损失，更新网络&lt;/li&gt;
&lt;li&gt;评估：定期测试策略性能，画训练曲线&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;推荐框架：Stable-Baselines3（封装好了主流算法，接口简洁）&lt;/p&gt;
&lt;h3 id="第二个项目mujoco机器人"&gt;第二个项目：MuJoCo机器人&lt;/h3&gt;
&lt;p&gt;选一个MuJoCo环境（推荐HalfCheetah或Ant），用PPO或SAC训练。&lt;/p&gt;
&lt;p&gt;这个阶段你会遇到真实的问题：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;训练不稳定，奖励曲线震荡——学习率、batch size、网络结构都可能需要调&lt;/li&gt;
&lt;li&gt;策略收敛到局部最优——需要调整探索策略&lt;/li&gt;
&lt;li&gt;训练太慢——需要理解并行化、向量化环境&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些&amp;quot;坑&amp;quot;才是真正学到的东西。&lt;/p&gt;
&lt;h2 id="第三阶段深入一个方向2-3个月"&gt;第三阶段：深入一个方向（2-3个月）&lt;/h2&gt;
&lt;p&gt;基础RL掌握后，选择一个方向深入：&lt;/p&gt;
&lt;h3 id="方向a世界模型model-based-rl"&gt;方向A：世界模型（Model-Based RL）&lt;/h3&gt;
&lt;p&gt;学习DreamerV3、TD-MPC2等算法。核心思想是先学习环境模型，再在模型中训练策略。样本效率高，适合机器人场景。&lt;/p&gt;
&lt;p&gt;入门路径：读DreamerV3论文 → 跑通官方代码 → 在自己的MuJoCo任务上实验&lt;/p&gt;
&lt;h3 id="方向b离线强化学习offline-rl"&gt;方向B：离线强化学习（Offline RL）&lt;/h3&gt;
&lt;p&gt;从固定数据集中学习策略，不需要在线交互。适合真实机器人场景（数据收集成本高）。&lt;/p&gt;
&lt;p&gt;入门路径：读CQL或IQL论文 → 在D4RL数据集上实验&lt;/p&gt;
&lt;h3 id="方向c多智能体强化学习marl"&gt;方向C：多智能体强化学习（MARL）&lt;/h3&gt;
&lt;p&gt;多个智能体协作或竞争。适合无人机编队、交通调度等场景。&lt;/p&gt;
&lt;p&gt;入门路径：读MAPPO或QMIX论文 → 在StarCraft II或Google Research Football上实验&lt;/p&gt;</description></item><item><title>世界模型（world model）当下是一个好的方向吗？</title><link>https://www.worldsensetech.com/zh/articles/world-model-good-direction/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-good-direction/</guid><description>&lt;p&gt;作为一个在这个方向上摸爬滚打了大半年的工程师，说说我的看法。&lt;/p&gt;
&lt;p&gt;先说结论：是好方向，但不是所有人都适合现在入场。&lt;/p&gt;
&lt;h2 id="为什么是好方向"&gt;为什么是好方向&lt;/h2&gt;
&lt;p&gt;世界模型解决的是一个很根本的问题：让AI不只是&amp;quot;看到&amp;quot;世界，而是&amp;quot;理解&amp;quot;世界。&lt;/p&gt;
&lt;p&gt;大语言模型已经证明了，当模型足够大、数据足够多时，它能涌现出很强的能力。但语言模型理解的是文本世界，不是物理世界。机器人要真正在现实环境中工作，需要理解物理规律——重力、摩擦力、碰撞、因果。这些东西光靠文本数据学不到。&lt;/p&gt;
&lt;p&gt;世界模型的核心思想很直觉：让模型学习*&amp;ldquo;如果我执行这个动作，环境会怎么变化&amp;rdquo;。学会了这个，机器人就可以在&amp;quot;想象&amp;quot;中训练策略，而不是在真实世界里反复试错。这对机器人来说意义重大——真实世界的试错成本高、速度慢、还可能损坏硬件。&lt;/p&gt;
&lt;p&gt;DreamerV3（2023年，Danijar Hafner等）已经证明了这条路可行。同一套参数，在55款Atari游戏上都能跑出不错的成绩，在机器人操控任务上样本效率比传统RL高出10-100倍。&lt;/p&gt;
&lt;p&gt;2024-2025年，世界模型在视频生成领域也爆发了。Sora、Kling、Vidu这些视频生成模型，本质上也是在学&amp;quot;世界会怎么变化&amp;quot;。虽然它们目前还停留在视觉层面，没有和物理控制打通，但方向是一致的。&lt;/p&gt;
&lt;h2 id="但为什么不是所有人都适合入场"&gt;但为什么不是所有人都适合入场&lt;/h2&gt;
&lt;h3 id="第一这个方向还在早期离大规模商业化有距离"&gt;第一，这个方向还在早期，离大规模商业化有距离&lt;/h3&gt;
&lt;p&gt;世界模型在仿真环境里表现很好，但Sim-to-Real迁移仍然是个大问题。仿真里训练的策略，部署到真实机器人上往往性能下降30-50%。域随机化、系统辨识这些方法能缓解，但远没有解决。如果你是想快速变现的创业者，这个方向可能太慢了。&lt;/p&gt;
&lt;h3 id="第二计算资源门槛不低"&gt;第二，计算资源门槛不低&lt;/h3&gt;
&lt;p&gt;训练一个像样的世界模型，至少需要多张A100跑几天到几周。不像写个Web应用，一台笔记本就能搞定。个人研究者或小团队需要精打细算。&lt;/p&gt;
&lt;h3 id="第三学术竞争很激烈"&gt;第三，学术竞争很激烈&lt;/h3&gt;
&lt;p&gt;这个方向的顶会论文主要来自Stanford、CMU、Berkeley、DeepMind等机构。如果你没有这些背景，纯靠自学想做出有影响力的工作，难度很大。&lt;/p&gt;
&lt;h2 id="我的建议"&gt;我的建议&lt;/h2&gt;
&lt;p&gt;如果你是想做研究、读博、进大厂AI Lab，世界模型绝对值得投入。它是具身智能的核心技术之一，未来5-10年都会有持续的研究需求。&lt;/p&gt;
&lt;p&gt;如果你是想创业或做产品，建议关注世界模型的应用层——比如用世界模型做工业机器人的快速任务适配、做仿真-to-现实的迁移工具链。这些方向离钱更近，而且大厂还没完全覆盖。&lt;/p&gt;
&lt;p&gt;如果你只是对技术感兴趣的工程师，我的建议是：先理解原理，跑通开源代码（DreamerV3有官方实现），然后在一个具体任务上实践。不需要从头训练一个大模型，学会用、学会改、学会部署，就已经很有价值了。&lt;/p&gt;
&lt;p&gt;我自己走的是最后这条路。不是学术大牛，也没有大厂的资源，就是一个对技术有热情的工程师。通过写博客、发文章来梳理自己的理解，同时也希望能帮到同样想进入这个方向的人。&lt;/p&gt;</description></item><item><title>RSSM状态空间模型详解：世界模型的核心引擎</title><link>https://www.worldsensetech.com/zh/articles/rssm-deep-dive/</link><pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/rssm-deep-dive/</guid><description>&lt;p&gt;上一篇文章我们聊了世界模型的基本概念和DreamerV3的整体架构。有读者反馈说，想更深入地了解RSSM到底是怎么工作的。这篇文章就来拆解这个Dreamer系列世界模型的核心组件。&lt;/p&gt;
&lt;p&gt;我会尽量把数学讲清楚，但不会过度形式化。毕竟我们的目标是理解原理，而不是证明定理。&lt;/p&gt;
&lt;h2 id="为什么需要状态空间模型"&gt;为什么需要状态空间模型&lt;/h2&gt;
&lt;p&gt;在讨论RSSM之前，先退一步想想：为什么我们需要状态空间模型？直接用RNN或者Transformer不行吗？&lt;/p&gt;
&lt;p&gt;先说RNN。传统RNN的问题在于，它把所有信息压缩到一个确定性的隐状态向量里。这就像让你用一个数字来描述&amp;quot;今天天气怎么样&amp;quot;——不管你怎么选这个数字，都会丢失大量信息。更关键的是，RNN没有表达不确定性的能力。如果环境有随机因素（比如一阵风吹来），RNN无法表达&amp;quot;我不确定接下来会发生什么&amp;quot;。&lt;/p&gt;
&lt;p&gt;再说Transformer。Transformer的注意力机制确实强大，但它有两个问题：一是计算复杂度随序列长度平方增长，对于需要长程记忆的机器人任务来说成本太高；二是它本质上是一个开环模型，没有显式的状态转移结构，不太适合做控制。&lt;/p&gt;
&lt;p&gt;状态空间模型（SSM）是一个折中方案。它有显式的状态转移方程，能捕捉动态系统的本质；同时通过精心设计的状态表示，在表达能力和计算效率之间取得平衡。&lt;/p&gt;
&lt;h2 id="rssm的核心思想双轨状态"&gt;RSSM的核心思想：双轨状态&lt;/h2&gt;
&lt;p&gt;RSSM的全称是Recurrent State-Space Model，循环状态空间模型。它的核心创新在于把隐状态拆成了两条轨道：&lt;/p&gt;
&lt;p&gt;确定性状态 hₜ（Deterministic State）&lt;/p&gt;
&lt;p&gt;这个状态类似于传统RNN的隐状态，通过一个GRU（门控循环单元）更新：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`hₜ = GRU(hₜ₋₁, zₜ₋₁, aₜ₋₁)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;它捕捉的是环境中的确定性规律——那些可以精确预测的部分。比如&amp;quot;如果机械臂向右移动10厘米，末端执行器的x坐标就增加10厘米&amp;quot;这种确定的物理关系。&lt;/p&gt;
&lt;p&gt;随机性状态 zₜ（Stochastic State）&lt;/p&gt;
&lt;p&gt;这个状态是从一个分布中采样得到的：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`zₜ ~ p(zₜ | hₜ) # 先验（想象时）
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;zₜ ~ q(zₜ | hₜ, oₜ) # 后验（训练时）`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;它捕捉的是环境中的不确定性——那些无法精确预测的部分。比如&amp;quot;两个表面之间的摩擦力可能在0.2到0.4之间&amp;quot;这种模糊的物理特性。&lt;/p&gt;
&lt;p&gt;为什么要这样拆分？因为真实世界就是由确定性规律和不确定性因素共同构成的。把它们分开建模，模型就能更准确地理解环境。&lt;/p&gt;
&lt;h2 id="完整的状态转移过程"&gt;完整的状态转移过程&lt;/h2&gt;
&lt;p&gt;让我们一步步走一遍RSSM的状态转移过程。假设在时刻t，我们有一个观测 oₜ（比如相机图像）和一个动作 aₜ（比如关节力矩）：&lt;/p&gt;
&lt;p&gt;第一步：更新确定性状态&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`hₜ = GRU(hₜ₋₁, zₜ₋₁, aₜ₋₁)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;把上一步的确定性状态hₜ₋₁、随机性状态zₜ₋₁和动作aₜ₋₁拼在一起，通过GRU得到新的确定性状态。这一步类似于传统RNN的更新。&lt;/p&gt;
&lt;p&gt;第二步：计算随机性状态&lt;/p&gt;
&lt;p&gt;这里有两种模式：&lt;/p&gt;
&lt;p&gt;训练时（有真实观测），我们用后验分布：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`μₜ, σₜ = Encoder(hₜ, oₜ)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;zₜ = μₜ + σₜ * ε, 其中 ε ~ N(0, I)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;推理时（没有真实观测，在想象中），我们用先验分布：&lt;/p&gt;</description></item><item><title>什么是机器人世界模型？一个工程师的深度解读</title><link>https://www.worldsensetech.com/zh/articles/world-model-intro/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-intro/</guid><description>&lt;p&gt;如果你关注AI领域的最新进展，可能已经注意到一个趋势：从ChatGPT到Sora，从AlphaFold到机器人操控，AI正在从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;。而在这个转变中，有一个概念越来越核心——世界模型（World Model）。&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想从一个工程师的视角，聊聊什么是世界模型，为什么它对机器人如此重要，以及目前最有代表性的DreamerV3到底做了什么。&lt;/p&gt;
&lt;h2 id="一个直觉机器人也需要想象力"&gt;一个直觉：机器人也需要&amp;quot;想象力&amp;quot;&lt;/h2&gt;
&lt;p&gt;先做一个思想实验。&lt;/p&gt;
&lt;p&gt;想象你面前有一杯水，你伸手去推它。在你真正动手之前，你的大脑已经&amp;quot;模拟&amp;quot;了这个动作的后果——水会洒出来，杯子会滑动，你的手会变湿。你没有真正去做，但你已经&amp;quot;知道&amp;quot;了结果。&lt;/p&gt;
&lt;p&gt;这种能力，心理学家称之为&amp;quot;心智模拟&amp;quot;（Mental Simulation）。它是人类智能的核心能力之一。我们不需要每次都通过试错来学习，而是可以在脑海中&amp;quot;想象&amp;quot;行动的后果，然后选择最优的方案。&lt;/p&gt;
&lt;p&gt;传统的机器人是怎么做的呢？大多数时候，它们靠的是试错。强化学习（Reinforcement Learning）的基本逻辑就是：在环境中执行动作，观察结果，获得奖励或惩罚，然后更新策略。这就像一个蒙着眼睛的人在迷宫里乱走，靠碰壁来学习地图。&lt;/p&gt;
&lt;p&gt;问题很明显：效率太低了。一个真实的机械臂，每次试错都要消耗时间、磨损硬件，还可能造成损坏。如果机器人能像人一样，先在&amp;quot;脑海&amp;quot;中模拟一下，再决定怎么做，那效率会有质的飞跃。&lt;/p&gt;
&lt;p&gt;世界模型，就是机器人的&amp;quot;想象力&amp;quot;。&lt;/p&gt;
&lt;h2 id="世界模型到底在做什么"&gt;世界模型到底在做什么&lt;/h2&gt;
&lt;p&gt;用一句话概括：世界模型学习的是&amp;quot;如果我执行某个动作，环境会怎么变化&amp;quot;。&lt;/p&gt;
&lt;p&gt;技术上说，世界模型是一个环境的内部模拟器。它接收当前的状态和要执行的动作作为输入，输出预测的下一个状态和可能获得的奖励。形式化地表示：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-fallback" data-lang="fallback"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;`下一个状态 = 世界模型(当前状态, 动作)
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;预测奖励 = 奖励函数(当前状态, 动作)`
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;这看起来很简单，但它的能力取决于模型学到了多好的环境动态。一个好的世界模型，能够准确预测几百步甚至上千步之后的环境状态。&lt;/p&gt;
&lt;p&gt;有了世界模型之后，策略训练就变成了一个完全不同的游戏。机器人不需要在真实环境中试错，而是在世界模型构建的&amp;quot;想象空间&amp;quot;中训练。就像下棋的高手，不需要真的走每一步，而是在脑海中推演多种可能的走法，然后选择最优的。&lt;/p&gt;
&lt;h2 id="dreamerv3当前最强的世界模型之一"&gt;DreamerV3：当前最强的世界模型之一&lt;/h2&gt;
&lt;p&gt;说到世界模型在机器人领域的应用，就不得不提Dreamer系列。这是Danijar Hafner等人从2020年开始持续迭代的工作，到2023年的DreamerV3已经在多个基准测试上达到了SOTA。&lt;/p&gt;
&lt;p&gt;DreamerV3的核心架构有三个关键组件：&lt;/p&gt;
&lt;h3 id="1-rssm循环状态空间模型"&gt;1. RSSM：循环状态空间模型&lt;/h3&gt;
&lt;p&gt;RSSM（Recurrent State-Space Model）是世界模型的&amp;quot;记忆体&amp;quot;。它维护两种状态：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;确定性状态 hₜ：捕捉环境的长期趋势和规律，比如&amp;quot;物体A在桌子左边&amp;quot;这种相对稳定的信息。&lt;/li&gt;
&lt;li&gt;随机性状态 zₜ：捕捉环境的即时不确定性，比如&amp;quot;物体A的精确位置可能有几毫米的偏差&amp;quot;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;为什么需要两种状态？因为真实世界既有确定性的一面（物理规律），也有不确定性的一面（传感噪声、未建模的动态）。传统的RNN只有一种隐状态，很难同时处理这两种特性。RSSM通过双轨设计，让模型既能记住长期规律，又能表达短期不确定性。&lt;/p&gt;
&lt;h3 id="2-actor-critic在想象中训练策略"&gt;2. Actor-Critic：在想象中训练策略&lt;/h3&gt;
&lt;p&gt;有了世界模型之后，怎么训练机器人的行为策略？DreamerV3用的是Actor-Critic方法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Actor（演员）：负责选择动作。给定当前状态，输出一个动作分布。&lt;/li&gt;
&lt;li&gt;Critic（评论家）：负责评估。给定当前状态，预测未来能获得的累计奖励。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;关键创新在于：Actor和Critic的训练完全在想象空间中进行。从经验回放池中采样起始状态，然后用世界模型&amp;quot;展开&amp;quot;一条轨迹（默认15步），在这条想象的轨迹上计算损失并更新网络。&lt;/p&gt;
&lt;p&gt;这意味着什么？意味着机器人可以在&amp;quot;梦&amp;quot;中练习几百万次，而不需要动一下真实的硬件。&lt;/p&gt;
&lt;h3 id="3-对称对数损失让训练更稳定"&gt;3. 对称对数损失：让训练更稳定&lt;/h3&gt;
&lt;p&gt;DreamerV3相比前代最大的改进之一，是引入了对称对数（symlog）变换来处理奖励和价值的尺度问题。&lt;/p&gt;
&lt;p&gt;不同任务的奖励尺度可能差异巨大——有的任务奖励是0到1，有的是0到10000。传统方法需要对每个任务手动缩放奖励，这很不优雅。DreamerV3通过对称对数变换，自动将任意尺度的奖励压缩到一个合理范围内，实现了真正的&amp;quot;一个算法跑所有任务&amp;quot;。&lt;/p&gt;
&lt;h2 id="与传统强化学习的本质区别"&gt;与传统强化学习的本质区别&lt;/h2&gt;
&lt;p&gt;很多人会问：这不就是强化学习吗？有什么区别？&lt;/p&gt;
&lt;p&gt;区别在于样本效率。&lt;/p&gt;
&lt;p&gt;传统的强化学习（比如PPO、SAC）是无模型（model-free）的。它们直接从环境交互中学习策略，不需要理解环境的动态。这就像一个人通过不断试错来学骑自行车——摔了很多次之后，身体&amp;quot;记住&amp;quot;了怎么保持平衡。&lt;/p&gt;
&lt;p&gt;世界模型方法是有模型（model-based）的。它先学习环境的动态模型，然后在模型中训练策略。这更像一个人先理解自行车的物理原理（重心、角动量、转向几何），然后在脑海中模拟骑行的过程，最后再实际上车。&lt;/p&gt;
&lt;p&gt;在实际效果上，DreamerV3的样本效率通常比PPO高出10到100倍。也就是说，达到同样的性能，DreamerV3可能只需要真实环境交互10万步，而PPO需要1000万步。对于机器人来说，这意味着训练时间从几周缩短到几小时。&lt;/p&gt;
&lt;h2 id="应用场景不只是游戏"&gt;应用场景：不只是游戏&lt;/h2&gt;
&lt;p&gt;DreamerV3最初在Atari游戏上展示了惊人的能力——用同一套超参数，在55款游戏中都取得了不错的成绩。但它的能力远不止于此。&lt;/p&gt;
&lt;p&gt;在机器人领域，世界模型已经开始在以下场景中展现价值：&lt;/p&gt;
&lt;p&gt;工业装配：机器人需要学会将不同形状的零件装配到产品上。传统方法需要为每种零件编写专门的程序，而世界模型方法可以通过想象训练快速适配新零件。&lt;/p&gt;
&lt;p&gt;灵巧操作：比如翻转物体、拧瓶盖、系鞋带等需要精细力控的任务。这些任务在仿真中很难精确建模，世界模型可以从少量真实数据中学习到复杂的接触动态。&lt;/p&gt;
&lt;p&gt;导航与探索：在未知环境中规划路径。世界模型可以预测&amp;quot;如果我往那边走，会看到什么&amp;quot;，从而做出更好的探索决策。&lt;/p&gt;
&lt;h2 id="局限性与未来"&gt;局限性与未来&lt;/h2&gt;
&lt;p&gt;当然，世界模型不是万能的。它目前面临几个主要挑战：&lt;/p&gt;
&lt;p&gt;长程预测误差累积：世界模型的预测不可能完美，每一步都有小误差，多步之后误差会指数级放大。目前DreamerV3的想象步数限制在15步左右，更长的预测会变得不可靠。&lt;/p&gt;
&lt;p&gt;复杂物理场景：对于涉及流体、软体、复杂接触的场景，世界模型的预测精度还不够高。比如抓取一块布料，布料的形变很难准确预测。&lt;/p&gt;
&lt;p&gt;计算成本：训练一个高质量的世界模型需要大量的计算资源。虽然推理时很高效，但训练阶段并不便宜。&lt;/p&gt;
&lt;p&gt;这些挑战也是当前研究的前沿方向。我相信在未来2-3年内，随着模型架构的改进和计算效率的提升，世界模型会在更多真实机器人场景中落地。&lt;/p&gt;
&lt;h2 id="写在最后"&gt;写在最后&lt;/h2&gt;
&lt;p&gt;世界模型的核心思想其实很朴素：先理解世界，再决定行动。这和人类的学习方式是一致的。我们不会一开始就盲目尝试，而是先观察、理解、预测，然后才采取行动。&lt;/p&gt;</description></item><item><title>没有博士学位，也能进入具身智能领域吗？</title><link>https://www.worldsensetech.com/zh/articles/embodied-ai-guide/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/embodied-ai-guide/</guid><description>&lt;p&gt;前几天有个读者私信问我：&amp;ldquo;我本科毕业，做了三年嵌入式开发，想转具身智能方向，是不是必须读个博士？&amp;rdquo;&lt;/p&gt;
&lt;p&gt;这个问题我想了很久。因为我自己也不是学术出身——虽然读了硕士，但离&amp;quot;学术大牛&amp;quot;差得很远。在具身智能这个方向上，身边很多同事都是名校博士，发过顶会论文。作为一个&amp;quot;普通工程师&amp;quot;，怎么在这个领域找到自己的位置？&lt;/p&gt;
&lt;p&gt;今天这篇文章，我想诚实地聊聊这个话题。不灌鸡汤，只说实际的。&lt;/p&gt;
&lt;h2 id="先说结论可以但需要策略"&gt;先说结论：可以，但需要策略&lt;/h2&gt;
&lt;p&gt;具身智能确实是一个门槛较高的领域。它需要机器人学、强化学习、计算机视觉、甚至机械设计的交叉知识。很多核心论文来自Stanford、CMU、UC Berkeley等顶尖高校的实验组，作者清一色是教授+博士生的组合。&lt;/p&gt;
&lt;p&gt;但这不意味着没有博士学位就没机会。原因有几个：&lt;/p&gt;
&lt;p&gt;第一，工业界的需求在快速增长。人形机器人、工业协作机器人、自动驾驶等领域正在快速商业化。这些公司不仅需要算法研究者，更需要能把算法落地为产品的工程师。写得了CUDA、调得了ROS、搞得定硬件集成的工程师，在很多方面比纯学术背景的人更有优势。&lt;/p&gt;
&lt;p&gt;第二，开源生态降低了入门门槛。五年前，你想做机器人强化学习，需要一个价值几十万的硬件平台。现在，MuJoCo免费了，Isaac Sim有社区版，PyBullet完全开源。DreamerV3、TD-MPC2等算法都有高质量的开源实现。你只需要一台带GPU的电脑就能开始。&lt;/p&gt;
&lt;p&gt;第三，这个领域还在早期，机会窗口仍然开放。不像计算机视觉或NLP已经形成了相对固化的学术圈子，具身智能还在快速发展中。新的问题不断出现，旧的解决方案不断被推翻。在这种环境下，实战经验和工程直觉的价值不亚于学术论文。&lt;/p&gt;
&lt;h2 id="需要掌握的核心技能"&gt;需要掌握的核心技能&lt;/h2&gt;
&lt;p&gt;具身智能的知识体系很广，但不需要全部掌握。根据你想做的方向不同，重点也不同。我把核心技能分成三层：&lt;/p&gt;
&lt;h3 id="基础层必须掌握"&gt;基础层（必须掌握）&lt;/h3&gt;
&lt;p&gt;不管你做哪个细分方向，这些是基本功：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Python编程：不需要精通，但要能熟练写数据处理、模型训练、可视化脚本&lt;/li&gt;
&lt;li&gt;深度学习基础：理解CNN、RNN、Transformer的基本原理，能用PyTorch搭建和训练模型&lt;/li&gt;
&lt;li&gt;强化学习基础：理解MDP、策略梯度、Actor-Critic、Q-learning等核心概念&lt;/li&gt;
&lt;li&gt;线性代数和概率论：矩阵运算、概率分布、贝叶斯定理——这些是理解论文的数学基础&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="核心层至少掌握一个方向"&gt;核心层（至少掌握一个方向）&lt;/h3&gt;
&lt;p&gt;根据你的兴趣和背景，选择一个方向深入：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;仿真与Sim-to-Real：掌握一个仿真器（推荐MuJoCo），理解域随机化、系统辨识等迁移方法&lt;/li&gt;
&lt;li&gt;世界模型：理解RSSM、DreamerV3的架构，能跑通开源实现并做修改&lt;/li&gt;
&lt;li&gt;操作规划：理解运动规划（RRT、优化方法）、抓取规划、力控等&lt;/li&gt;
&lt;li&gt;感知与视觉：理解6D位姿估计、点云处理、视觉伺服等&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="加分层有余力再学"&gt;加分层（有余力再学）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;ROS2：机器人操作系统，工业界标配&lt;/li&gt;
&lt;li&gt;C++/CUDA：性能优化，实时控制&lt;/li&gt;
&lt;li&gt;机械设计基础：理解机器人的物理约束&lt;/li&gt;
&lt;li&gt;控制理论：PID、MPC、阻抗控制等经典方法&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="推荐的学习路径"&gt;推荐的学习路径&lt;/h2&gt;
&lt;p&gt;如果你是从零开始，我建议按以下顺序学习。每个阶段大约需要1-2个月（假设每周投入10-15小时）。&lt;/p&gt;
&lt;p&gt;阶段一：打基础（1-2个月）&lt;/p&gt;
&lt;p&gt;目标：掌握深度学习和强化学习的基本概念。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;课程：李宏毅的机器学习课程（B站有，免费，讲得非常好）&lt;/li&gt;
&lt;li&gt;课程：David Silver的强化学习课程（YouTube/B站都有）&lt;/li&gt;
&lt;li&gt;实践：用PyTorch实现一个简单的DQN，在CartPole上跑通&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段二：进入仿真（1-2个月）&lt;/p&gt;
&lt;p&gt;目标：熟悉一个仿真环境，能训练简单的机器人策略。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;安装MuJoCo和对应的Python绑定&lt;/li&gt;
&lt;li&gt;跟着教程让一个机械臂学会 reaching（抓取目标位置）&lt;/li&gt;
&lt;li&gt;用PPO或SAC训练一个简单任务，理解训练过程中的各种参数&lt;/li&gt;
&lt;li&gt;推荐资源：MuJoCo官方文档和示例&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段三：学习世界模型（2-3个月）&lt;/p&gt;
&lt;p&gt;目标：理解DreamerV3的架构，能跑通并修改开源代码。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;读DreamerV3论文（先读一遍不求甚解，再精读关键章节）&lt;/li&gt;
&lt;li&gt;找到开源实现（GitHub上搜&amp;quot;dreamerv3&amp;quot;），跑通Atari或MuJoCo的示例&lt;/li&gt;
&lt;li&gt;尝试修改一些超参数，观察对训练的影响&lt;/li&gt;
&lt;li&gt;尝试在自己的MuJoCo任务上使用DreamerV3&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阶段四：做一个完整项目（2-3个月）&lt;/p&gt;
&lt;p&gt;目标：从零完成一个&amp;quot;仿真训练→Sim-to-Real迁移&amp;quot;的完整流程。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;选择一个具体任务（比如机械臂抓取、四足行走）&lt;/li&gt;
&lt;li&gt;在仿真中训练策略&lt;/li&gt;
&lt;li&gt;实现域随机化，测试策略的鲁棒性&lt;/li&gt;
&lt;li&gt;如果有硬件，尝试迁移到真实机器人；如果没有，做一个详细的仿真分析报告也行&lt;/li&gt;
&lt;li&gt;把过程和结果写成博客或论文&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="一些实际的建议"&gt;一些实际的建议&lt;/h2&gt;
&lt;p&gt;在学习和实践的过程中，有几点经验我想分享：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;不要试图读完所有论文。具身智能的论文数量增长非常快，每个月都有几十篇新的工作。你不可能全部读完，也不需要。选择2-3篇核心论文（比如DreamerV3、TD-MPC2、ACT），精读理解，其他的泛读了解即可。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;动手比读论文重要10倍。很多人花大量时间读论文，但从来不动手写代码。这是最大的误区。读论文理解的是&amp;quot;idea&amp;quot;，但真正的理解来自于你亲手实现、调试、看到训练曲线时的顿悟。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;写博客是最好的学习方式。当你试图把一个概念解释给别人时，你会发现自己理解中的漏洞。而且，博客是你最好的简历——它展示了你的技术深度、表达能力和持续学习的习惯。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;找到社区。一个人学习很容易放弃。加入一些社区（比如知乎的相关话题、GitHub的讨论区、线下的机器人meetup），和同行交流。很多问题你以为只有自己遇到，其实别人早就踩过了。&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;接受&amp;quot;慢&amp;quot;。具身智能是一个需要积累的领域，不像Web开发可以速成。给自己至少一年的时间来打基础，不要期望三个月就能成为专家。耐心是这个领域最重要的品质之一。&lt;/p&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="关于职业路径"&gt;关于职业路径&lt;/h2&gt;
&lt;p&gt;最后聊一下职业发展。具身智能方向的工程师，目前主要有几条路：&lt;/p&gt;
&lt;p&gt;工业机器人的AI升级：传统工业机器人厂商（ABB、KUKA、FANUC等）正在积极引入AI能力。他们需要既懂传统机器人控制，又懂强化学习的工程师。这是一个需求量大、相对稳定的方向。&lt;/p&gt;
&lt;p&gt;人形机器人公司：近两年涌现了大量人形机器人创业公司。这些公司需要全栈型人才——能从算法做到部署。风险高，但如果公司做起来了，回报也大。&lt;/p&gt;
&lt;p&gt;仿真平台与工具：做仿真器、训练框架、可视化工具的公司。这个方向更偏软件工程，适合有扎实编程基础的工程师。&lt;/p&gt;</description></item></channel></rss>