本体降价一个数量级之后,行业的全部悬念集中到一个问题上:谁先做出"够用的大脑"。这一篇讲清楚:大脑到底指什么、三条技术路线各赌什么、数据为什么是唯一的硬通货、谁在牌桌上,以及刚刚带着 61 亿募资入场的宇树胜算几何。
五条判断,和第二篇的结论首尾相接。
媒体把所有软件都叫"大脑",导致鸡同鸭讲。实际上是三层完全不同的问题,成熟度天差地别。
| 层 | 解决什么 | 主流方法 | 成熟度(2026-08) |
|---|---|---|---|
| 小脑:运动控制10ms 级 | 平衡、行走、全身协调、抗推搡 | 强化学习 + 物理仿真(sim-to-real) | ✅ 基本解决,开源方案泛滥 |
| 大脑:操作与任务100ms–秒级 | 看懂场景、理解指令、抓取操作、完成任务 | VLA(视觉-语言-动作模型)为主流 | ⚠ 竞赛主战场,未收敛 |
| 皮层:长时程规划分钟–小时级 | 任务分解、记忆、跨场景常识 | 挂接 LLM/VLM 做高层推理 | △ 蹭大模型的便车,尚浅 |
一个立刻能用的鉴别技巧:凡是展示跳舞、跑酷、翻跟头的视频,展示的是小脑——那是已经解决的问题,是运控炫技不是智能。只有"在没见过的环境里操作没见过的物体完成语言指令"才是大脑,看 demo 时先问这一句,能过滤掉九成的宣传。
主流架构因此长成"快慢双系统":以 Figure Helix 为例,慢系统(VLM,约 7–9Hz)负责理解场景和指令,快系统(约 200Hz)负责实时全身控制,两者之间用隐向量传递意图。π 系列、GR00T、国内各家的架构大同小异——分歧不在架构图,在训练数据从哪来(第 3 节)。
路线之争的本质是一个问题:智能从哪里学来——从人类演示里学,从想象出的世界里学,还是从大模型嘴里借。
LLM 有一条被反复验证的曲线:数据和算力堆上去,能力可预期地涨。具身智能至今没有等价物——没人能证明"演示数据翻十倍,成功率一定涨多少"。这意味着当前所有大脑公司烧的钱,都是在赌这条曲线存在。曲线被证实之日,就是行业从信仰驱动切换到资本碾压之时——届时钱多者胜;在那之前,路线判断力仍然值钱。
模型代码在 GitHub 上开源,论文在 arXiv 上免费,算力可以租——只有数据,必须自己一小时一小时挣。
| 数据层 | 怎么来 | 成本 | 质量/可用性 | 谁占优 |
|---|---|---|---|---|
| 互联网视频金字塔底座 | 人类视频蒸馏(无动作标签) | ≈0 | 只能学先验,不能直接学控制 | 大厂(Google/Meta 天然囤积) |
| 仿真合成中间层 | 物理引擎批量生成(Isaac/GR00T 管线) | 低、可无限复制 | 运控够用;操作类 sim-to-real 鸿沟仍大 | NVIDIA(卖铲子顺便定标准) |
| 真机遥操作塔尖 | 人穿戴设备/VR 操纵机器人干活录数据 | 每小时数十–上百元人力 | 唯一的黄金数据,直接决定 VLA 上限 | 有本体、有部署场景的人 |
| 部署回流飞轮 | 已交付机器人在真实场景的使用数据 | 边际≈0 | 多样性最高,但依赖存量部署 | 1X(家庭遥操)、Figure(工厂)、宇树(开发者机群) |
看懂这张表,就看懂了几件表面费解的事:1X 为什么敢用 $20,000 卖一台还需要远程人工兜底的家庭机器人——它卖的不是机器人,是让用户付费帮它采集家庭场景数据;智元为什么砸钱建数据采集工厂、开源百万级数据集——用开放换生态位;宇树几千台散在高校开发者手里的存量机器,为什么是它大脑竞赛的隐性资产——那是现成的数据回流网络和部署面。
按"赌什么剧本"分类,比按国别分类更接近本质。
| 玩家 | 模型/产品 | 状态(2026-08) | 赌的剧本 |
|---|---|---|---|
| Physical Intelligence独立大脑派旗手 | π0 → π0.5(开源权重)→ π-2.0 | B 轮 $600M(CapitalG 领投,估值 $5.6B);传洽谈 C 轮 $1B、估值 $11B+ 未落定 | Android:一个大脑装进所有本体 |
| Skild AI 等 | 通用操作模型 | 同赛道第二梯队 | 同上 |
| Figure垂直整合派旗手 | Helix + Figure 03 | 估值 18 个月 $2.6B→$39B;2026-01 起可自主完成整个班次 | Apple:软硬一体,数据闭环不外流 |
| Tesla | Optimus + FSD 技术栈复用 | 大脑积累雄厚,卡在本体量产(见第二篇) | Apple + 车队数据引擎复用 |
| NVIDIA | GR00T N1.6 / N1.7(3B、开源商用)+ Isaac 仿真管线 | N1.7 于 2026-04 早期开放 | 卖铲子:开源模型换算力生态 |
| Google DeepMind | Gemini Robotics(含端侧版) | 多本体合作,学术火力最强 | 模型霸权向物理世界延伸 |
| 宇树 Unitree本体先行→大脑 | UnifoLM:WMA-0 + VLA-0(双线开源)+ X1-0 工业版 | X1-0 已在自有工厂试点装配作业;DeepSeek 战略合作;上市募 61 亿 | 先有身体和现金流,再买大脑门票 |
| 智元 / 银河通用 / 千寻 / 自变量中国梯队 | GO-1 / GraspVLA / Spirit 等 | 各有场景抓手(零售/工业),数据集开源活跃 | 本体 + 大脑 + 数据全都要 |
| 华为 / 车厂智驾系 | CloudRobo 等平台 | 入场早期 | 智驾能力平移 + 云生态 |
注意一个不对称:美国的大脑公司不造本体(PI)或造得很慢(Tesla),中国的本体公司全都在补大脑。原因在第二篇讲过——中国拿走了制造权,本体现金流养得起大脑研发;美国本体又贵又少,大脑公司只能独立融资。两边其实都在向"软硬一体"收敛,只是从相反的方向。终局大概率不是 Android vs Apple 二选一,而是各自吃掉不同场景。
第二篇讲了它为什么"后做"大脑;这一节看它上市之后具体怎么做——牌已经翻开了三张。
结论:宇树的大脑牌不是"钱最多",是"死不了 + 数据便宜 + 生态在手"。它不需要第一个做出最强大脑,只需要在大脑收敛时仍在牌桌上、且自己的本体是最好的宿主。这是期权逻辑,不是决战逻辑——与它历史上每一步的风格完全一致。
这是大脑赛道最贵的一个问题——PI 的 $11B 估值全押在"成立"上,Figure 的 $39B 全押在"不成立"上。
我的判断:两个剧本会同时上演,按场景分层。头部场景(汽车工厂、头部品牌家庭机器人)走垂直整合——数据太值钱,不会外流;长尾场景(中小工厂、专用设备改造、科研)走通用大脑 + 标准本体——养不起自研,只能采购。这恰好意味着"标准本体 + 开源大脑"的宇树组合,和"垂直一体"的 Figure 组合,可以同时是对的——它们抢的不是同一块市场。真正危险的是夹在中间、两头不靠的玩家:本体没有成本优势、大脑没有数据优势。
这个行业的演示水平远超交付水平。带着清单看 demo,是观察者最重要的自我保护。
大脑侧的信号清单,与第二篇的本体清单配对使用——两张表合起来,就是对整个具身智能行业的持续追踪框架。
| # | 信号 | 看什么 | 如果发生,意味着 |
|---|---|---|---|
| B1 | π 系列 C 轮是否落定 | $11B+ 估值是否成交、领投方是谁 | 成交 → 资本仍信 Android 假设;流产 → 独立大脑模式遇冷 |
| B2 | Scaling 证据 | 任何公司公开"数据量 ↔ 成功率"的可复现曲线 | 出现即行业切换到资本碾压模式,所有小玩家估值重写 |
| B3 | UnifoLM 的外部采用 | 是否有非宇树本体跑 UnifoLM;开发者生态活跃度 | 有 → 开源生态位成立;无 → 沦为营销开源 |
| B4 | 宇树研发费率与 AI 团队 | 上市后首份年报(对照第二篇 S2 信号) | 大脑投入不放量 → "本体先行"论证失败的最早信号 |
| B5 | 1X NEO 自主率曲线 | 家庭场景遥操占比是否逐季下降 | 持续下降 → 数据飞轮真实转动,家庭场景提前 |
| B6 | 王兴兴标准的逼近度 | "陌生家庭 80% 任务"在公开评测中的最好成绩 | 2–3 年内逼近 → 本体先行窗口关闭,全行业决战大脑 |
手(第一篇)是数据的入口,本体(第二篇)是现金流和分发的入口,大脑(第三篇)是终局价值的归属。宇树路线的完整表述应该是:用本体的确定性,购买大脑的可能性,而灵巧手是两者之间最深的护城河缺口——谁先把"手 + 数据"做穿,谁的大脑就先长出身体。三篇合起来看,这个行业最稀缺的不是激情,是排序能力:知道什么先做、什么后做、什么永远不做。
大脑竞赛像 2019 年的自动驾驶:范式未定、数据为王、demo 远快于部署。宇树用上市把自己变成了"死不了的玩家",而这场竞赛的第一法则恰恰是——活得久比跑得快重要