<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>机器人 on WorldSense 技术笔记</title><link>https://www.worldsensetech.com/zh/tags/%E6%9C%BA%E5%99%A8%E4%BA%BA/</link><description>Recent content in 机器人 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.worldsensetech.com/zh/tags/%E6%9C%BA%E5%99%A8%E4%BA%BA/index.xml" rel="self" type="application/rss+xml"/><item><title>机器人世界模型到底在做什么？从感知到行动的完整链路</title><link>https://www.worldsensetech.com/zh/articles/2026-08-26-world-model-in-robotics/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-26-world-model-in-robotics/</guid><description>&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;Dreamer 系列 · 第 2 篇&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.worldsensetech.com/zh/articles/2026-08-25-dreamer-explained/"&gt;上一篇&lt;/a&gt;从架构层面拆解了 Dreamer 的整体设计。这篇把视角拉远一步：世界模型在整个机器人系统中到底处于什么位置？从传感器数据到最终执行动作，中间经历了哪些环节？本文不讨论如何训练一个通用机器人世界模型，而讨论它在机器人系统中的功能位置。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id="一一个根本区别机器人世界模型和语言模型完全不同"&gt;一、一个根本区别：机器人世界模型和语言模型完全不同&lt;/h2&gt;
&lt;p&gt;过去几年，&amp;ldquo;模型&amp;quot;这个词在 AI 领域被反复使用。语言模型预测下一个 token，视觉模型预测下一帧图像，自动驾驶模型预测交通参与者的行为。它们都在做某种&amp;quot;预测&amp;rdquo;，但预测的对象和约束条件差异很大。&lt;/p&gt;
&lt;p&gt;机器人世界模型面对的问题有一个根本不同：&lt;strong&gt;它需要学习 action-conditioned future dynamics&lt;/strong&gt;——给定当前观察和行动，预测未来可能出现的状态、观测以及任务相关结果。注意这里用&amp;quot;观测&amp;quot;而不是&amp;quot;状态&amp;quot;，因为不同类型的世界模型预测的对象不同：Dreamer RSSM 在 latent space 中预测（latent → latent），video world model 在像素空间预测（action + video → future video），&amp;ldquo;state&amp;quot;并不是统一接口。&lt;/p&gt;
&lt;p&gt;想象一个场景：桌上的机械臂要推开一个杯子。在真正执行之前，它需要预测：手接触杯子后，杯子会往哪个方向滑？如果杯子太重推不动怎么办？如果桌面很滑，杯子会不会飞出去？&lt;/p&gt;
&lt;p&gt;这种预测不是从语言中学到的&amp;quot;杯子通常放在桌上&amp;quot;这种语义知识，而是&amp;quot;手以某个角度接触杯子、施加某个力，杯子会沿桌面滑动大约 10cm&amp;quot;这种与行动相关的未来预测。&lt;/p&gt;
&lt;p&gt;我觉得这是理解机器人世界模型最重要的出发点。语言模型通过海量文本学会了语言结构，视觉模型通过海量图像学会了视觉规律，而机器人世界模型需要通过交互经验学会行动与后果之间的关系。&lt;/p&gt;
&lt;p&gt;但这里有一个很重要的区分：世界模型并不需要显式恢复完整的物理规律。它可能只需要在 latent space 中预测：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;latent_t + action
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;latent_{t+1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; ↓
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;未来任务相关结果
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;而不需要真的知道：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;摩擦系数 = 0.31
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;质量 = 247g
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;接触力 = 1.8N
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;&lt;strong&gt;世界模型不是为了&amp;quot;还原世界&amp;rdquo;，而是为了预测行动相关的未来。&lt;/strong&gt; 这条主线会贯穿整篇文章。&lt;/p&gt;
&lt;h2 id="二机器人世界模型到底在预测什么"&gt;二、机器人世界模型到底在预测什么？&lt;/h2&gt;
&lt;p&gt;用一句话概括：世界模型学习的是&amp;quot;如果执行某个动作，决策相关的状态会怎么变化&amp;quot;。&lt;/p&gt;
&lt;p&gt;技术上说，世界模型学习状态转移动态（state transition dynamics），并通常额外学习 reward、continuation 等任务相关预测头：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#282a36;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;WorldModel:
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; dynamics: (s_t, a_t) → s_{t+1}
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; heads: s_{t+1} → r_t, γ_t, ...
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;实际实现中，世界模型通常不是直接预测完整的原始状态，而是在隐空间中预测 latent dynamics。&lt;/p&gt;</description></item><item><title>为什么说 2026 年，AI 在疯狂寻找物理外壳？</title><link>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</guid><description>&lt;p&gt;从 Ray-Ban Meta、PLAUD、Amazon Bee，到 Rabbit R1、机器狗和人形机器人：AI 正在一件一件地给自己补齐&amp;quot;器官&amp;quot;。&lt;/p&gt;
&lt;p&gt;如果过去两年 AI 的主流产品是 ChatGPT、Claude、Cursor，那么 2026 年让我觉得最有意思的变化，是 AI 开始从屏幕里&amp;quot;搬家&amp;quot;。&lt;/p&gt;
&lt;p&gt;它住进了眼镜、胸针、耳机、小盒子、机器狗和人形机器人。&lt;/p&gt;
&lt;p&gt;有的给 AI 一双眼睛，有的给它一双耳朵，有的给它记忆，有的给它显示器，有的甚至开始给它手和腿。&lt;/p&gt;
&lt;p&gt;所以我越来越觉得，&amp;ldquo;AI 在寻找物理外壳&amp;quot;并不是一个比喻。&lt;/p&gt;
&lt;p&gt;但这里的&amp;quot;外壳&amp;quot;不一定意味着人形机器人。它可能是一副眼镜、一枚胸针、一条腕带、一台机器狗，也可能最终是一台真正能够在现实世界里行动的人形机器人。它们其实都在尝试解决同一个问题：AI 如何从&amp;quot;理解世界&amp;rdquo;，变成&amp;quot;存在于世界&amp;quot;。&lt;/p&gt;
&lt;p&gt;我是一个做世界模型方向的工程师，日常和 MuJoCo、DreamerV3 打交道。但最近半年越来越关注 AI 硬件——因为我做的世界模型、仿真训练和 sim-to-real，最终面对的一个重要问题，就是如何让 AI 从&amp;quot;理解世界&amp;quot;走向&amp;quot;作用于世界&amp;quot;。而这些 AI，迟早需要某种物理载体。&lt;/p&gt;
&lt;p&gt;这篇文章不是技术综述，更像是一个&amp;quot;AI 硬件逛展式观察&amp;quot;。我想按一个有意思的角度来聊：AI 正在按器官逐一获得物理形态——从感知到交互再到行动，逐步构建完整的身体。当然，&amp;ldquo;器官&amp;quot;在这里是一个比喻，更准确地说，是 AI 正在获得不同的物理接口。&lt;/p&gt;
&lt;h2 id="ai-的眼睛ray-ban-meta"&gt;AI 的眼睛：Ray-Ban Meta&lt;/h2&gt;
&lt;p&gt;&lt;img src="https://www.worldsensetech.com/images/ai-shell-rayban-meta.png" alt="Ray-Ban Meta Gen 2 智能眼镜"&gt;&lt;/p&gt;
&lt;p&gt;我第一个想聊的不是机器人，而是一副眼镜。&lt;/p&gt;
&lt;p&gt;2025 年 9 月发布的 Ray-Ban Meta Gen 2，到 2026 年，它已经成为 AI 眼镜里最成熟、也最接近大众消费电子的一种产品形态。它有意思的地方恰恰在于：它看起来不像 AI 产品。没有大屏幕，没有科幻造型。它就是一副普通眼镜，但里面塞了摄像头、麦克风、扬声器和 AI。&lt;/p&gt;
&lt;p&gt;它真正有意思的能力不是&amp;quot;可以问 ChatGPT&amp;rdquo;。而是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;AI 可以看到你正在看的东西。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&amp;ldquo;这是什么植物？&amp;ldquo;&amp;ldquo;帮我翻译这个菜单。&amp;ldquo;&amp;ldquo;这个零件叫什么？&amp;quot;——AI 获得了一个非常特殊的输入：佩戴者的第一视角。&lt;/p&gt;
&lt;p&gt;我觉得它成功的关键之一，是它首先是一副正常的眼镜，然后才是一台 AI 设备。&lt;/p&gt;</description></item><item><title>Isaac Lab 入门：面向具身智能的 GPU 加速机器人学习平台</title><link>https://www.worldsensetech.com/zh/articles/isaac-lab-robot-rl/</link><pubDate>Fri, 14 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/isaac-lab-robot-rl/</guid><description>&lt;p&gt;过去一周，我们在 MuJoCo + DreamerV3 这条技术路线上深入了很多——从环境搭建到视觉输入训练，再到训练技巧和世界模型的架构演进。&lt;/p&gt;
&lt;p&gt;今天换一个视角，聊聊另一套技术栈：NVIDIA 的 Isaac Lab。&lt;/p&gt;
&lt;p&gt;如果说 MuJoCo 更强调轻量、灵活的动力学研究，适合快速原型开发和算法探索；那么 Isaac Lab 更强调 GPU 加速的大规模机器人训练和 sim-to-real pipeline。两者并不互斥——很多研究团队同时使用 MuJoCo 做算法验证和 Isaac Lab 做规模训练。&lt;/p&gt;
&lt;h2 id="isaac-lab-是什么"&gt;Isaac Lab 是什么？&lt;/h2&gt;
&lt;p&gt;Isaac Lab 是 NVIDIA 基于 Isaac Sim 构建的机器人学习框架，继承自 Isaac Gym 的 GPU 并行仿真思路，提供了更完整的任务抽象和工程结构。它的核心特点是：利用 GPU 加速，实现大规模并行的强化学习训练。&lt;/p&gt;
&lt;p&gt;Isaac Lab 本身不是仿真器，也不是 RL 算法库，而是一个位于 Isaac Sim 之上的任务抽象层：&lt;/p&gt;
&lt;p&gt;&lt;code&gt;Isaac Sim（PhysX + Rendering）→ Isaac Lab（Task Abstraction + RL Integration）→ 训练策略&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;简单来说，Isaac Lab 解决的问题是：如何在短时间内训练出高质量的机器人策略。&lt;/p&gt;
&lt;p&gt;传统的 RL 训练（如我们在 MuJoCo 中用 DreamerV3）通常是单环境或少量并行环境。训练一个策略可能需要几百万步，花费几小时甚至几天。而 Isaac Lab 通过 GPU 并行化，可以同时运行数千个环境，将训练时间从几天缩短到几分钟。&lt;/p&gt;</description></item><item><title>域随机化（Domain Randomization）：机器人 Sim-to-Real 迁移的核心技术</title><link>https://www.worldsensetech.com/zh/articles/domain-randomization-sim-to-real/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/domain-randomization-sim-to-real/</guid><description>&lt;p&gt;上一篇我们聊了 TD-MPC 如何用世界模型做机器人控制。但不管用 Dreamer、TD-MPC 还是其他方法，训练出来的策略最终都要部署到真实机器人上。这就绕不开 Sim-to-Real 迁移——而域随机化（Domain Randomization）是这条路上最基础的技术。&lt;/p&gt;
&lt;p&gt;这篇文章系统拆解域随机化：它解决什么问题、有哪些类型、工程上怎么实现、以及最新的进展。&lt;/p&gt;
&lt;h2 id="sim-to-real-gap-的根源"&gt;Sim-to-Real Gap 的根源&lt;/h2&gt;
&lt;p&gt;先回顾一下问题。仿真环境和真实世界之间存在系统性差异，这些差异统称为 Sim-to-Real Gap。其中一部分来自未建模动态（unmodeled dynamics），例如摩擦变化、接触误差、传感器噪声等：&lt;/p&gt;
&lt;p&gt;动力学层面：摩擦系数、质量分布、关节阻尼、电机响应延迟。仿真中的物理参数往往是近似值，和真实机器人有偏差。&lt;/p&gt;
&lt;p&gt;视觉层面：光照条件、相机噪声、纹理细节、背景变化。仿真渲染和真实相机看到的图像有显著差异。&lt;/p&gt;
&lt;p&gt;传感器层面：IMU 漂移、力传感器噪声、编码器精度。仿真中的传感器是理想的，真实传感器有各种非理想特性。&lt;/p&gt;
&lt;p&gt;这些差异导致了一个核心问题：在仿真中训练的策略，直接部署到真实世界时性能下降。域随机化的思路很直接——既然真实世界无法被完全建模，就让训练环境覆盖一个合理范围的可能情况，使真实环境成为训练分布中的一个可能实例。&lt;/p&gt;
&lt;h2 id="为什么域随机化现在重新受到关注"&gt;为什么域随机化现在重新受到关注？&lt;/h2&gt;
&lt;p&gt;域随机化并不是新技术——早在 2017 年左右就有系统性的工作。但近几年它的热度明显上升，原因和整个具身智能的研究范式变化有关。&lt;/p&gt;
&lt;p&gt;过去，机器人控制主要靠手工建模和专用控制器。工程师根据具体任务设计动力学模型、调参、写控制逻辑。这种方式在结构化环境中效果不错，但扩展性差——每换一个任务就要重新来一遍。&lt;/p&gt;
&lt;p&gt;现在的范式是：大模型 + 强化学习 + 仿真训练。策略不再由人手工设计，而是在仿真中通过大量试错自动学习。这意味着对训练数据的需求急剧增加。但真实世界的机器人数据太贵、太慢、太危险——不可能让真实机器人每天跑几百万次试错。&lt;/p&gt;
&lt;p&gt;于是，仿真训练成了主流选择。但仿真训练的核心瓶颈变成了：怎么让仿真中学到的能力迁移到真实世界？Sim-to-Real 不再只是一个机器人控制问题，而成为具身智能规模化训练的核心问题。域随机化作为其中最基础、最通用的技术，自然重新受到了关注。&lt;/p&gt;
&lt;h2 id="域随机化的核心思想"&gt;域随机化的核心思想&lt;/h2&gt;
&lt;p&gt;域随机化的直觉来自一个观察：如果策略在足够多样的仿真环境中都能表现良好，那它在真实世界中应该也能工作——因为真实世界只是众多可能环境中的一个。&lt;/p&gt;
&lt;p&gt;形式化地说，域随机化把仿真参数 θ 当作随机变量，从一个分布 p(θ) 中采样。训练时，每个 episode 使用不同的 θ 值。策略学到的不是&amp;quot;在某个特定仿真中怎么做&amp;quot;，而是&amp;quot;在各种可能的环境中怎么做&amp;quot;。
关键洞察：域随机化本质上是在训练数据的分布中注入多样性，让策略学到鲁棒的、不依赖于特定仿真参数的行为。&lt;/p&gt;
&lt;h2 id="域随机化的分类"&gt;域随机化的分类&lt;/h2&gt;
&lt;p&gt;根据随机化的对象，域随机化可以分为四大类：&lt;/p&gt;
&lt;h3 id="1-动力学域随机化dynamics-dr"&gt;1. 动力学域随机化（Dynamics DR）&lt;/h3&gt;
&lt;p&gt;随机化物理参数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;质量：物体质量、机器人连杆质量。工程中通常从较小范围开始（例如围绕标称值扰动），再根据真实迁移效果逐步扩大范围。&lt;/li&gt;
&lt;li&gt;摩擦：接触摩擦系数、关节摩擦。这是影响操作任务最关键的因素之一。&lt;/li&gt;
&lt;li&gt;阻尼：关节阻尼系数。影响机器人的动态响应。&lt;/li&gt;
&lt;li&gt;惯性：转动惯量。影响旋转运动的动态。&lt;/li&gt;
&lt;li&gt;延迟：控制延迟、观测延迟。模拟真实系统的响应滞后。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;动力学 DR 是最常用的类型，对大多数任务都有显著效果。&lt;/p&gt;
&lt;h3 id="2-视觉域随机化visual-dr"&gt;2. 视觉域随机化（Visual DR）&lt;/h3&gt;
&lt;p&gt;随机化视觉渲染参数：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;光照：光源位置、强度、颜色。这是视觉 DR 中最重要的一项。&lt;/li&gt;
&lt;li&gt;纹理：物体表面纹理、颜色。可以用程序化纹理或随机贴图。&lt;/li&gt;
&lt;li&gt;背景：场景背景。可以用随机颜色、随机图像或随机3D场景。&lt;/li&gt;
&lt;li&gt;相机：相机位置、角度、焦距、噪声。&lt;/li&gt;
&lt;li&gt;材质：反射率、透明度、粗糙度。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;视觉 DR 对基于图像的策略特别重要。如果策略直接用相机图像作为输入，视觉 DR 几乎是必须的。&lt;/p&gt;</description></item></channel></rss>