WorldSense 技术笔记

为什么说 2026 年,AI 在疯狂寻找物理外壳?

2026年8月16日 · 阅读约15分钟 · 具身智能, 世界模型, AI趋势, 机器人, 行业趋势
目录

从 Ray-Ban Meta、PLAUD、Amazon Bee,到 Rabbit R1、机器狗和人形机器人:AI 正在一件一件地给自己补齐"器官"。

如果过去两年 AI 的主流产品是 ChatGPT、Claude、Cursor,那么 2026 年让我觉得最有意思的变化,是 AI 开始从屏幕里"搬家"。

它住进了眼镜、胸针、耳机、小盒子、机器狗和人形机器人。

有的给 AI 一双眼睛,有的给它一双耳朵,有的给它记忆,有的给它显示器,有的甚至开始给它手和腿。

所以我越来越觉得,“AI 在寻找物理外壳"并不是一个比喻。

但这里的"外壳"不一定意味着人形机器人。它可能是一副眼镜、一枚胸针、一条腕带、一台机器狗,也可能最终是一台真正能够在现实世界里行动的人形机器人。它们其实都在尝试解决同一个问题:AI 如何从"理解世界”,变成"存在于世界"。

我是一个做世界模型方向的工程师,日常和 MuJoCo、DreamerV3 打交道。但最近半年越来越关注 AI 硬件——因为我做的世界模型、仿真训练和 sim-to-real,最终面对的一个重要问题,就是如何让 AI 从"理解世界"走向"作用于世界"。而这些 AI,迟早需要某种物理载体。

这篇文章不是技术综述,更像是一个"AI 硬件逛展式观察"。我想按一个有意思的角度来聊:AI 正在按器官逐一获得物理形态——从感知到交互再到行动,逐步构建完整的身体。当然,“器官"在这里是一个比喻,更准确地说,是 AI 正在获得不同的物理接口。

AI 的眼睛:Ray-Ban Meta

Ray-Ban Meta Gen 2 智能眼镜

我第一个想聊的不是机器人,而是一副眼镜。

2025 年 9 月发布的 Ray-Ban Meta Gen 2,到 2026 年,它已经成为 AI 眼镜里最成熟、也最接近大众消费电子的一种产品形态。它有意思的地方恰恰在于:它看起来不像 AI 产品。没有大屏幕,没有科幻造型。它就是一副普通眼镜,但里面塞了摄像头、麦克风、扬声器和 AI。

它真正有意思的能力不是"可以问 ChatGPT”。而是:

AI 可以看到你正在看的东西。

“这是什么植物?““帮我翻译这个菜单。““这个零件叫什么?"——AI 获得了一个非常特殊的输入:佩戴者的第一视角。

我觉得它成功的关键之一,是它首先是一副正常的眼镜,然后才是一台 AI 设备。

AI 的眼睛 + 输出:Meta Ray-Ban Display

Meta Ray-Ban Display 带显示屏的智能眼镜

如果 Ray-Ban Meta 给 AI 装上了眼睛,那么 Meta Ray-Ban Display 开始给它增加一种真正的视觉输出。

这是 Ray-Ban AI 眼镜产品线首次加入显示屏的产品,售价从 $799 起。AI 的回答不再只通过耳机传给你,而是直接出现在你眼前。

它把字幕、消息、翻译以及部分 AI 信息,开始带进你的视野。以前是 AI → 耳机 → 你听。现在变成 AI → 眼镜 → 你看。

更酷的是配套的 Neural Band:一个腕带,通过腕部肌电信号捕捉手部微小动作,让你不用说话、只靠手指动作就能无声控制眼镜。这大概是 2026 年最有"未来感"的交互方式。 Meta Neural Band 肌电控制腕带

AI 的眼睛 + 显示:RayNeo X3 Pro

RayNeo X3 Pro AR 眼镜

除了 Meta,还有一家中国公司值得关注。RayNeo X3 Pro 是真正的双目全彩 MicroLED AI+AR 眼镜:640×480 MicroLED 显示、12MP 摄像头、Snapdragon AR1 芯片、集成 Gemini AI。

它代表的是另一条更激进的路线:把 AI 眼镜直接做成带视觉输出的 AR 设备。AI 不再只有视觉输入,也开始拥有面向佩戴者的视觉输出。

这类产品让我感兴趣的不是"AR 看电影”。而是:当 AI 拥有视觉输入的同时又拥有视觉输出,我觉得这时候它就不再只是一个问答工具了——它开始成为你视野中的一层"智能界面”。

AI 的耳朵:PLAUD NotePin S

PLAUD NotePin S AI 录音设备

如果让我选一个"没有那么酷,但可能比很多机器人更有用"的产品,我会选 PLAUD。

PLAUD NotePin S 做的是 AI 录音设备。听起来一点都不性感:录音 → 转文字 → 总结。

但这其实是一个非常合理的 AI 硬件形态。因为手机的问题是:你需要主动拿出来。而会议、访谈、散步、开车的时候,你根本不想一直拿手机。

PLAUD NotePin S 直接把录音设备变成了可以佩戴的东西,然后交给 AI 做转录、摘要和信息整理。

如果说 Ray-Ban Meta 给 AI 一双眼睛,那么 NotePin S 更像给 AI 增加了一双"耳朵”:

AI 不需要有手。它先有一双耳朵就够了。

AI 的记忆:Amazon Bee

Amazon Bee AI 可穿戴设备

再往前走一步,就出现了一个更有意思的产品形态:不只是录音,而是把方向推向"持续上下文”。

Amazon 在收购 Bee 之后,2026 年继续推进这个 AI wearable。Bee 可以作为夹式设备或者腕带使用,核心能力是记录、转录、总结日常对话,并进一步利用上下文提供提醒和建议。

Bee 有意思的地方,不只是"一直在听”,而是它试图把一次次对话变成长期的个人上下文。

PLAUD 更像一个"AI 录音笔",Bee 则更接近"AI 生活记忆"。

而这也是 AI wearable 最敏感的地方:当设备开始持续感知,“个人 AI"和"环境监听设备"之间的边界会变得非常模糊。隐私问题也会从"它知道我的什么数据”,进一步变成"它知道我身边其他人的什么数据"。

AI 在尝试获得"数字世界的手":Rabbit R1

Rabbit R1 AI Agent 设备

Rabbit R1 到 2026 年仍然在持续迭代,所以我更愿意把它看成一场仍在进行中的 Agent 硬件实验。

它真正值得关注的,不是它有没有成为"手机杀手",而是它提出了一个问题:

如果 AI Agent 可以替你操作数字世界,用户还需要传统 App 吗?

传统交互:人 → 打开 App → 找功能 → 点击 → 输入。Agent 交互:人 → 告诉 AI 我要什么 → AI 自己操作。

R1 更像一次产品形态实验,而不是一次已经结束的尝试。它最有价值的地方,可能不是它今天到底好不好用,而是它一直在试验:一个专门的 AI Agent 入口,到底有没有必要成为一台独立设备。

从感知到行动:真正的分水岭

前面的 AI 硬件,大多数其实还没有真正"进入物理世界"。眼镜只是看。Pendant 只是听。Display 只是显示。R1 主要操作数字世界。

真正的分水岭,是当 AI 的动作开始改变物理世界。这就是机器人出现的地方。

AI 的腿:Unitree Go2

Unitree Go2 机器狗

如果说前面的产品是在给 AI 增加眼睛、耳朵、记忆,那么机器狗开始给 AI 增加:腿。

Unitree Go2 目前官方明确把自己定位为"Embodied AI"平台,配备摄像头、IMU、4D LiDAR 等感知能力。它把感知、定位、运动控制和计算平台装进了一个真正会移动的机器人身体。

这时候 AI 就从"回答问题"变成了:我做一个动作,然后世界发生变化。

这恰恰是我做世界模型之后觉得最有意思的地方。因为强化学习真正面对的问题不是"这个东西是什么?“而是:“如果我现在这么做,下一秒会发生什么?”

AI 的手:灵巧操作

灵巧手:智元 OmniHand 2025

有了腿之后,下一步自然是给 AI 加一双手。

2026 年,灵巧操作(dexterous manipulation)是机器人领域最活跃的方向之一。CMU 的 LEAP Hand、Shadow Dexterous Hand、宇树和智元都在做的灵巧手,目标都是同一件事:让 AI 不只是移动,而是操作。

机械臂只能操作一部分东西,但灵巧手试图让 AI 像人一样抓取、旋转、组装。这恰恰是从"移动机器人"到"真正有用的机器人"之间最关键的一步。

而这也解释了为什么人形机器人突然变得重要——因为它可能是同时拥有腿和手的最佳载体。

AI 的完整身体:人形机器人

Figure 02 人形机器人

再往前走一步,就是人形机器人。Figure、宇树、智元等都在做。

人形机器人真正有意思的地方,不是"长得像人”,而是它在尝试成为一种通用身体。机械臂只能操作一部分东西,机器狗擅长移动,而人形机器人理论上可以直接进入为人类设计的工厂、仓库、家庭和工具环境。它最大的潜在优势,并不一定是运动能力,而是人类世界已经为人的身体形态建好了大量基础设施——门、楼梯、工具、工作台、货架、汽车、家庭空间。

NVIDIA 的 GR00T、Isaac、Cosmos 等基础设施,则是在尝试把模型、仿真、数据和边缘计算串成一套 Physical AI 技术栈。最终,模型的预测和策略需要通过电机与机械结构真正变成动作。整个系统进入感知 → 思考 → 行动 → 获得反馈 → 再学习的闭环。

值得研究的失败实验

AI 硬件文章如果只有成功产品会很无聊。有两个案例值得单独聊聊。

Humane AI Pin。2025 年 2 月,Humane 宣布停止消费者 AI Pin 服务;2 月 28 日服务正式关闭。其部分 AI 能力、人才和知识产权随后由 HP 以约 1.16 亿美元收购。它试图把 AI 从手机里拿出来:别再盯着屏幕了。听起来非常美。但问题是:手机已经是一个极其成熟的计算平台。你让一个只有摄像头、麦克风、投影和语音交互的小设备替代手机,实际上是在和几十年积累的生态正面竞争。它留下的教训是:AI 能不能做,不等于用户有没有必要买一台新设备。 Humane AI Pin

Limitless Pendant 则是一个很值得研究的案例。它探索过一种非常有意思的方向:AI 不再等你主动打开,而是持续存在于你的生活上下文中。2025 年 12 月,Meta 收购 Limitless,后者随后停止新硬件销售。类似的"ambient AI / continuous context"思路,也出现在 Amazon Bee 这样的产品中。 Limitless Pendant AI 可穿戴设备

一张图看全貌

如果把这篇文章讨论的产品放在一起,会发现一个很有意思的递进关系: AI 获得的能力 产品 真正增加了什么 视觉感知 Ray-Ban Meta Gen 2 第一视角摄像头 听觉感知 PLAUD NotePin S 持续音频输入 长期上下文 Amazon Bee 个人生活数据 视觉输出 Meta Ray-Ban Display / RayNeo X3 Pro AR 显示 新型输入 Meta Neural Band 肌电控制 数字行动 Rabbit R1 Agent 入口 物理移动 Unitree Go2 腿 + 环境交互 物理操作 灵巧手 / 人形机器人 手 + 腿 + 身体

“寻找物理外壳"不是突然从手机跳到人形机器人,而是一个逐渐增加感知和行动能力的过程。

小结

也许"AI 硬件"最终不会是一个品类。

眼镜、耳机、胸针、机器人甚至汽车,都可能只是 AI 与现实世界连接的不同接口。有些 AI 只需要一双眼睛,因为它的任务是理解你看到的世界。有些 AI 需要一双耳朵,因为它的任务是记住你说过什么。有些 AI 需要一双腿和一双手,因为它的任务终于变成了改变这个世界。

所以"AI 在寻找物理外壳"真正有意思的地方,不是 AI 最终会长成什么样,而是我们正在第一次看到:一个 AI 系统到底需要怎样的身体,才能真正进入现实世界。

而我做的世界模型、仿真训练和 sim-to-real,恰好处在这条路线的另一端:当 AI 真的拥有了眼睛、耳朵、手和腿之后,它还需要知道"下一步会发生什么”。

这可能才是世界模型真正有意思的地方。AI 有了身体之后,问题就不再只是"你能不能回答我",而变成:“如果我现在这么做,世界会发生什么?”

物理世界很大,AI 才刚刚走到门口。


← Isaac Lab 安装避坑指南:从零到跑通全流程 跑 DreamerV3 该租云 GPU 还是自建工作站?一个工程师的成本账 →

评论

W
侯晓琴

西北工业大学硕士,十余年自动化与 AI 工程经验。著有《Visual C++入门很容易》《C++程序设计经典300例》。目前聚焦世界模型与具身智能方向,记录从传统自动化到机器人 AI 的转型之路。