<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>行业趋势 on WorldSense 技术笔记</title><link>https://www.worldsensetech.com/zh/tags/%E8%A1%8C%E4%B8%9A%E8%B6%8B%E5%8A%BF/</link><description>Recent content in 行业趋势 on WorldSense 技术笔记</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Tue, 18 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.worldsensetech.com/zh/tags/%E8%A1%8C%E4%B8%9A%E8%B6%8B%E5%8A%BF/index.xml" rel="self" type="application/rss+xml"/><item><title>世界模型风口被放大了：技术辨析与冷思考</title><link>https://www.worldsensetech.com/zh/articles/2026-08-18-world-model-ai-trend/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-18-world-model-ai-trend/</guid><description>&lt;!-- raw HTML omitted --&gt;
&lt;p&gt;说说我的看法：世界模型不是风口叙事，它是一个真实存在的技术方向，但目前市面上大量讨论关注的是生成能力，而不是世界模型真正需要解决的环境预测、因果建模和规划问题。&lt;/p&gt;
&lt;h2 id="先厘清一个概念现在大家说的世界模型其实不是一回事"&gt;先厘清一个概念：现在大家说的&amp;quot;世界模型&amp;quot;其实不是一回事&lt;/h2&gt;
&lt;p&gt;LeCun 提的世界模型（JEPA 架构）和李飞飞讲的世界空间（World Space），两者关注的问题重叠——都涉及表征学习和世界理解——但技术路线和侧重点不同。LeCun 想在抽象表征空间做预测，避开像素级生成的计算开销；李飞飞更偏 3D 场景理解和生成。而工业界现在做的，比如游戏领域的 Genie、Genie 2，更接近 action-conditioned interactive world model——你给它一个动作，它预测下一个环境状态——但其主要能力仍集中在视觉环境生成和短时动态预测上。&lt;/p&gt;
&lt;p&gt;这些东西有价值，但它们解决的问题不一样。如果把&amp;quot;能生成下一帧画面&amp;quot;等同于&amp;quot;形成了稳定的、可迁移的、可用于规划的环境状态表示&amp;quot;——这里说的&amp;quot;理解&amp;quot;不是人类语义理解，而是这个意思——那这个风口确实被放大了。&lt;/p&gt;
&lt;h2 id="真正的难点不在预测在于稳定的环境表征"&gt;真正的难点不在预测，在于稳定的环境表征&lt;/h2&gt;
&lt;p&gt;我自己跑 DreamerV3 的时候有一个很深的体会：RSSM（Recurrent State-Space Model）确实能学到一些动态规律——比如在 MuJoCo 的 cartpole 任务上，它可以在想象空间里预测杆子的摆动轨迹，训练出来的策略还能用。但如果仔细看它想象出来的状态，会发现稍微复杂一点的任务，预测就开始模糊、发散。&lt;/p&gt;
&lt;p&gt;原因不复杂：RSSM 学习的是任务相关的隐状态动力学，而不是显式的 3D 物理世界模型。它在训练分布内表现不错，但不一定形成类似物理规律的显式表示，因此面对分布外情况时，可能无法像物理模型一样进行可靠外推。&lt;/p&gt;
&lt;p&gt;这个差距，就是当前世界模型研究最核心的问题。&lt;/p&gt;
&lt;h2 id="物理先验注入是重要方向之一"&gt;物理先验注入，是重要方向之一&lt;/h2&gt;
&lt;p&gt;如果目标是提升世界模型的稳定性和泛化能力，单纯靠加大数据量、堆 transformer 层数可能不够。把物理约束——比如能量守恒、碰撞检测、刚体动力学——作为先验注入到模型结构里，是一条值得探索的路径，让模型在学动态的时候不是从零开始猜，而是沿着物理上合理的路径去学。&lt;/p&gt;
&lt;p&gt;在我的实验中，加入特定物理约束后，部分任务上的训练稳定性和长时间预测表现有所改善——比如不容易出现&amp;quot;杆子穿模&amp;quot;或者&amp;quot;物体突然消失&amp;quot;这种在纯数据驱动模型里常见的问题。当然，物理先验不是唯一路线，scaling、多模态预训练、对象级学习也各有各的空间。&lt;/p&gt;
&lt;h2 id="对象级世界模型另一个绕不开的方向"&gt;对象级世界模型，另一个绕不开的方向&lt;/h2&gt;
&lt;p&gt;前面说的 RSSM、JEPA 更多是在整体 latent space 或像素空间做预测。但&amp;quot;理解物理世界&amp;quot;还有另一条路径：让模型从像素或 latent 转向实体、关系和状态变化的建模——也就是 object-centric representation。通过 slot attention、scene graph 这类方法，把场景分解为独立的对象和它们之间的交互关系，然后对每个对象的动力学分别建模。&lt;/p&gt;
&lt;p&gt;这条路线的好处是泛化性更强——你见过桌子上的杯子被推，换到桌子上的碗被推，对象级模型更容易迁移。而整体 latent 模型可能需要重新学。&lt;/p&gt;
&lt;h2 id="世界模型和-vla-的关系需要更准确地看"&gt;世界模型和 VLA 的关系，需要更准确地看&lt;/h2&gt;
&lt;p&gt;现在行业里很火的 VLA（Vision-Language-Action）路线，比如 RT-2、π0，当前主流 VLA 主要优化视觉语言到动作的映射，而显式环境预测和长期规划能力仍然是其薄弱环节。需要注意的是，这些模型内部的 transformer 确实有 latent prediction 和 action chunking 机制，并非完全没有规划能力，只是这种规划是隐式的、短视的。&lt;/p&gt;</description></item><item><title>为什么说 2026 年，AI 在疯狂寻找物理外壳？</title><link>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/2026-08-16-ai-physical-shell/</guid><description>&lt;p&gt;从 Ray-Ban Meta、PLAUD、Amazon Bee，到 Rabbit R1、机器狗和人形机器人：AI 正在一件一件地给自己补齐&amp;quot;器官&amp;quot;。&lt;/p&gt;
&lt;p&gt;如果过去两年 AI 的主流产品是 ChatGPT、Claude、Cursor，那么 2026 年让我觉得最有意思的变化，是 AI 开始从屏幕里&amp;quot;搬家&amp;quot;。&lt;/p&gt;
&lt;p&gt;它住进了眼镜、胸针、耳机、小盒子、机器狗和人形机器人。&lt;/p&gt;
&lt;p&gt;有的给 AI 一双眼睛，有的给它一双耳朵，有的给它记忆，有的给它显示器，有的甚至开始给它手和腿。&lt;/p&gt;
&lt;p&gt;所以我越来越觉得，&amp;ldquo;AI 在寻找物理外壳&amp;quot;并不是一个比喻。&lt;/p&gt;
&lt;p&gt;但这里的&amp;quot;外壳&amp;quot;不一定意味着人形机器人。它可能是一副眼镜、一枚胸针、一条腕带、一台机器狗，也可能最终是一台真正能够在现实世界里行动的人形机器人。它们其实都在尝试解决同一个问题：AI 如何从&amp;quot;理解世界&amp;rdquo;，变成&amp;quot;存在于世界&amp;quot;。&lt;/p&gt;
&lt;p&gt;我是一个做世界模型方向的工程师，日常和 MuJoCo、DreamerV3 打交道。但最近半年越来越关注 AI 硬件——因为我做的世界模型、仿真训练和 sim-to-real，最终面对的一个重要问题，就是如何让 AI 从&amp;quot;理解世界&amp;quot;走向&amp;quot;作用于世界&amp;quot;。而这些 AI，迟早需要某种物理载体。&lt;/p&gt;
&lt;p&gt;这篇文章不是技术综述，更像是一个&amp;quot;AI 硬件逛展式观察&amp;quot;。我想按一个有意思的角度来聊：AI 正在按器官逐一获得物理形态——从感知到交互再到行动，逐步构建完整的身体。当然，&amp;ldquo;器官&amp;quot;在这里是一个比喻，更准确地说，是 AI 正在获得不同的物理接口。&lt;/p&gt;
&lt;h2 id="ai-的眼睛ray-ban-meta"&gt;AI 的眼睛：Ray-Ban Meta&lt;/h2&gt;
&lt;p&gt;&lt;img src="https://www.worldsensetech.com/images/ai-shell-rayban-meta.png" alt="Ray-Ban Meta Gen 2 智能眼镜"&gt;&lt;/p&gt;
&lt;p&gt;我第一个想聊的不是机器人，而是一副眼镜。&lt;/p&gt;
&lt;p&gt;2025 年 9 月发布的 Ray-Ban Meta Gen 2，到 2026 年，它已经成为 AI 眼镜里最成熟、也最接近大众消费电子的一种产品形态。它有意思的地方恰恰在于：它看起来不像 AI 产品。没有大屏幕，没有科幻造型。它就是一副普通眼镜，但里面塞了摄像头、麦克风、扬声器和 AI。&lt;/p&gt;
&lt;p&gt;它真正有意思的能力不是&amp;quot;可以问 ChatGPT&amp;rdquo;。而是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;AI 可以看到你正在看的东西。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&amp;ldquo;这是什么植物？&amp;ldquo;&amp;ldquo;帮我翻译这个菜单。&amp;ldquo;&amp;ldquo;这个零件叫什么？&amp;quot;——AI 获得了一个非常特殊的输入：佩戴者的第一视角。&lt;/p&gt;
&lt;p&gt;我觉得它成功的关键之一，是它首先是一副正常的眼镜，然后才是一台 AI 设备。&lt;/p&gt;</description></item><item><title>2026年，「世界模型」会是下一个AI风口么？</title><link>https://www.worldsensetech.com/zh/articles/world-model-2026-trend/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://www.worldsensetech.com/zh/articles/world-model-2026-trend/</guid><description>&lt;p&gt;先说结论：是世界模型的风口，但不是所有人的风口。&lt;/p&gt;
&lt;p&gt;2025-2026年，世界模型确实热起来了。Sora、Kling、Vidu这些视频生成模型本质上都在学&amp;quot;世界怎么变化&amp;quot;；DreamerV3在机器人控制上证明了世界模型的样本效率优势；2026年中科院的综述把四大技术范式梳理清楚，标志着这个方向从&amp;quot;散兵游勇&amp;quot;进入&amp;quot;体系化&amp;quot;阶段。&lt;/p&gt;
&lt;p&gt;但&amp;quot;风口&amp;quot;这个词需要拆开看。我分三个层面聊。&lt;/p&gt;
&lt;h2 id="技术层面确实在爆发"&gt;技术层面：确实在爆发&lt;/h2&gt;
&lt;p&gt;几个信号很明确：&lt;/p&gt;
&lt;p&gt;论文数量翻倍。2024-2025年世界模型相关的顶会论文比前两年翻了一倍多，四大范式（观测级生成、隐空间建模、强化学习驱动、对象中心表示）已经成型。&lt;/p&gt;
&lt;p&gt;大厂入场。DeepMind、OpenAI、Meta都在布局。OpenAI的Sora虽然定位是视频生成，但技术路线和世界模型高度重合。Meta的V-JEPA系列在隐空间世界模型上走得很快。&lt;/p&gt;
&lt;p&gt;应用场景拓宽。从最早的游戏仿真，扩展到机器人操控、自动驾驶决策、科学发现模拟、GUI智能体。每个场景都在催生新的技术需求。&lt;/p&gt;
&lt;p&gt;从技术成熟度曲线看，世界模型大概在&amp;quot;期望膨胀期&amp;quot;的早期阶段——技术有真实价值，但市场预期可能跑在了实际能力前面。&lt;/p&gt;
&lt;h2 id="产业层面离大规模商业化还有距离"&gt;产业层面：离大规模商业化还有距离&lt;/h2&gt;
&lt;p&gt;这是需要冷静看待的部分。&lt;/p&gt;
&lt;p&gt;Sim-to-Real还没解决。世界模型在仿真里很强，但部署到真实机器人上性能下降30-50%。这个瓶颈八年没突破，短期内也难有根本性解决方案。&lt;/p&gt;
&lt;p&gt;计算成本太高。训练一个像样的世界模型需要多张A100跑几周。对于创业公司或个人研究者，这个门槛不低。&lt;/p&gt;
&lt;p&gt;杀手级应用还没出现。大语言模型有ChatGPT，图像生成有Midjourney，世界模型的&amp;quot;ChatGPT时刻&amp;quot;还没到来。目前最接近的是机器人操控，但离消费级产品还有距离。&lt;/p&gt;
&lt;p&gt;所以从产业角度，世界模型更像是&amp;quot;2-3年后的风口&amp;quot;，不是&amp;quot;现在就能变现的风口&amp;quot;。&lt;/p&gt;
&lt;h2 id="个人层面谁适合现在入场"&gt;个人层面：谁适合现在入场&lt;/h2&gt;
&lt;p&gt;基于我自己的观察和实践，分几种情况：&lt;/p&gt;
&lt;p&gt;适合入场的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;做研究、读博、进大厂AI Lab的人——这是具身智能的核心技术，未来5-10年有持续需求&lt;/li&gt;
&lt;li&gt;有机器人/自动化背景的工程师——世界模型的应用层（任务适配、迁移工具链）离钱更近，大厂还没完全覆盖&lt;/li&gt;
&lt;li&gt;有算力资源的团队——能跑得起训练，有机会做出有影响力的工作&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;需要谨慎的：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;想快速变现的创业者——这个方向太慢，不适合追求短期回报&lt;/li&gt;
&lt;li&gt;纯软件背景、没有物理世界经验的人——世界模型的核心难点在Sim-to-Real，需要懂机器人、懂控制、懂硬件&lt;/li&gt;
&lt;li&gt;算力有限的个人研究者——可以学原理、跑开源代码，但想做出原创贡献很难&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="我的判断"&gt;我的判断&lt;/h2&gt;
&lt;p&gt;世界模型是AI从&amp;quot;理解语言&amp;quot;走向&amp;quot;理解世界&amp;quot;的关键一步。这个方向的价值是确定的，但时间线可能比大多数人预期的要长。&lt;/p&gt;
&lt;p&gt;短期（1-2年）：技术继续突破，但商业化案例有限，主要是大厂和研究机构在推进。&lt;/p&gt;
&lt;p&gt;中期（3-5年）：Sim-to-Real问题部分解决，工业场景（机器人装配、仓储物流）开始出现规模化应用。&lt;/p&gt;
&lt;p&gt;长期（5-10年）：如果&amp;quot;统计拟合→机理理解&amp;quot;这个关口能突破，世界模型可能成为通用人工智能的基石。&lt;/p&gt;
&lt;p&gt;对于个人来说，现在入场不晚，但需要耐心。不要指望半年就能看到回报，给自己至少2-3年的时间。&lt;/p&gt;</description></item></channel></rss>