EMBODIED BRAIN EMBODIED AI SERIES 03/03
具身智能三部曲 · 第三篇 · 2026-08

具身大脑
全景分析

本体降价一个数量级之后,行业的全部悬念集中到一个问题上:谁先做出"够用的大脑"。这一篇讲清楚:大脑到底指什么、三条技术路线各赌什么、数据为什么是唯一的硬通货、谁在牌桌上,以及刚刚带着 61 亿募资入场的宇树胜算几何。

9 节  /  约 25 分钟  /  数据截至 2026-08
00/

先说结论

五条判断,和第二篇的结论首尾相接。

JUDGMENT 1
小脑已解决,大脑未收敛运动控制(走跑跳、翻跟头、抗干扰)被强化学习 + 仿真基本解决,已成本体标配;而任务级智能——看懂环境、理解指令、操作物体——范式还在一年一换。谈"大脑"必须先分清这两层。
JUDGMENT 2
数据是唯一的硬通货LLM 的文本数据在互联网上免费躺着,机器人的动作数据必须一小时一小时人肉采集。谁的数据引擎便宜、快、多样,谁就在积累别人拿钱也买不到的复利——模型架构反而是最容易被抄的部分。
JUDGMENT 3
竞赛格局是"三国杀"独立大脑公司(Physical Intelligence 等)赌 Android 剧本;垂直整合派(Figure、Tesla)赌 Apple 剧本;平台商(NVIDIA、Google)赌卖铲子。三条路线互相成立的前提互斥,最多两条能赢。
JUDGMENT 4
时间表比多数人想的宽王兴兴给的"具身 ChatGPT 时刻"是理想 2–3 年、也可能 5–10 年。Demo 的惊艳速度远快于部署的扩散速度——这个时间差恰恰是本体先行策略(第二篇)能够成立的空间。
核心判断:大脑竞赛现在处于"范式未定、数据为王、烧钱换位"的阶段——像极了 2019 年的自动驾驶。上一轮智驾竞赛淘汰的不是技术差的,是数据引擎贵的和现金流断的。用这把尺子去量每一个大脑玩家。
01/

「大脑」到底指什么:先把黑话拆成三层

媒体把所有软件都叫"大脑",导致鸡同鸭讲。实际上是三层完全不同的问题,成熟度天差地别。

解决什么主流方法成熟度(2026-08)
小脑:运动控制10ms 级平衡、行走、全身协调、抗推搡强化学习 + 物理仿真(sim-to-real)✅ 基本解决,开源方案泛滥
大脑:操作与任务100ms–秒级看懂场景、理解指令、抓取操作、完成任务VLA(视觉-语言-动作模型)为主流⚠ 竞赛主战场,未收敛
皮层:长时程规划分钟–小时级任务分解、记忆、跨场景常识挂接 LLM/VLM 做高层推理△ 蹭大模型的便车,尚浅

一个立刻能用的鉴别技巧:凡是展示跳舞、跑酷、翻跟头的视频,展示的是小脑——那是已经解决的问题,是运控炫技不是智能。只有"在没见过的环境里操作没见过的物体完成语言指令"才是大脑,看 demo 时先问这一句,能过滤掉九成的宣传。

主流架构因此长成"快慢双系统":以 Figure Helix 为例,慢系统(VLM,约 7–9Hz)负责理解场景和指令,快系统(约 200Hz)负责实时全身控制,两者之间用隐向量传递意图。π 系列、GR00T、国内各家的架构大同小异——分歧不在架构图,在训练数据从哪来(第 3 节)。

02/

三条技术路线:VLA、世界模型、混合派

路线之争的本质是一个问题:智能从哪里学来——从人类演示里学,从想象出的世界里学,还是从大模型嘴里借。

ROUTE A
VLA:模仿学习正统视觉-语言-动作端到端:用预训练 VLM 打底,接一个动作头(扩散/流匹配),拿真机演示数据微调。π0 → π0.5 → π-2.0、GR00T N1.7、Gemini Robotics、Helix 全在此列。优点:路径清晰、见效快;死穴:性能被演示数据的量和多样性锁死。
ROUTE B
世界模型:想象派先学"世界如何运转"的视频预测模型,让机器人在想象中排练,减少对真机数据的依赖。2026 年行业报告已把世界模型列为"即将标配";宇树 UnifoLM-WMA-0 开源在此路线。优点:数据杠杆大;死穴:想象与物理的误差如何闭合,尚无定论。
ROUTE C
混合派:工程现实主义上层借现成大模型做规划,中层 VLA 做操作,下层 RL 做运控,拼装成能交付的系统。国内多数"大小脑"架构、车厂智驾团队转型者都在此列。优点:今天就能交付;死穴:缝合处永远在漏,天花板最低。
KEY INSIGHT

和 LLM 最大的不同:Scaling Law 还没被验证

LLM 有一条被反复验证的曲线:数据和算力堆上去,能力可预期地涨。具身智能至今没有等价物——没人能证明"演示数据翻十倍,成功率一定涨多少"。这意味着当前所有大脑公司烧的钱,都是在赌这条曲线存在。曲线被证实之日,就是行业从信仰驱动切换到资本碾压之时——届时钱多者胜;在那之前,路线判断力仍然值钱。

03/

数据金字塔:大脑竞赛的真实成本结构

模型代码在 GitHub 上开源,论文在 arXiv 上免费,算力可以租——只有数据,必须自己一小时一小时挣。

数据层怎么来成本质量/可用性谁占优
互联网视频金字塔底座人类视频蒸馏(无动作标签)≈0只能学先验,不能直接学控制大厂(Google/Meta 天然囤积)
仿真合成中间层物理引擎批量生成(Isaac/GR00T 管线)低、可无限复制运控够用;操作类 sim-to-real 鸿沟仍大NVIDIA(卖铲子顺便定标准)
真机遥操作塔尖人穿戴设备/VR 操纵机器人干活录数据每小时数十–上百元人力唯一的黄金数据,直接决定 VLA 上限有本体、有部署场景的人
部署回流飞轮已交付机器人在真实场景的使用数据边际≈0多样性最高,但依赖存量部署1X(家庭遥操)、Figure(工厂)、宇树(开发者机群)

看懂这张表,就看懂了几件表面费解的事:1X 为什么敢用 $20,000 卖一台还需要远程人工兜底的家庭机器人——它卖的不是机器人,是让用户付费帮它采集家庭场景数据;智元为什么砸钱建数据采集工厂、开源百万级数据集——用开放换生态位;宇树几千台散在高校开发者手里的存量机器,为什么是它大脑竞赛的隐性资产——那是现成的数据回流网络和部署面

和智驾对照(你熟悉的领域):特斯拉智驾的护城河从来不是算法,是几百万辆车每天免费回传的数据引擎。具身智能把同一逻辑重演一遍,区别是:车的数据是驾驶这一个任务,机器人要覆盖千百个任务——数据需求更大,而免费回传的车队还不存在。这就是大脑比智驾更难、时间表更长的根本原因。
04/

玩家格局:三条路线上的牌桌

按"赌什么剧本"分类,比按国别分类更接近本质。

玩家模型/产品状态(2026-08)赌的剧本
Physical Intelligence独立大脑派旗手π0 → π0.5(开源权重)→ π-2.0B 轮 $600M(CapitalG 领投,估值 $5.6B);传洽谈 C 轮 $1B、估值 $11B+ 未落定Android:一个大脑装进所有本体
Skild AI 等通用操作模型同赛道第二梯队同上
Figure垂直整合派旗手Helix + Figure 03估值 18 个月 $2.6B→$39B;2026-01 起可自主完成整个班次Apple:软硬一体,数据闭环不外流
TeslaOptimus + FSD 技术栈复用大脑积累雄厚,卡在本体量产(见第二篇)Apple + 车队数据引擎复用
NVIDIAGR00T N1.6 / N1.7(3B、开源商用)+ Isaac 仿真管线N1.7 于 2026-04 早期开放卖铲子:开源模型换算力生态
Google DeepMindGemini Robotics(含端侧版)多本体合作,学术火力最强模型霸权向物理世界延伸
宇树 Unitree本体先行→大脑UnifoLM:WMA-0 + VLA-0(双线开源)+ X1-0 工业版X1-0 已在自有工厂试点装配作业;DeepSeek 战略合作;上市募 61 亿先有身体和现金流,再买大脑门票
智元 / 银河通用 / 千寻 / 自变量中国梯队GO-1 / GraspVLA / Spirit 等各有场景抓手(零售/工业),数据集开源活跃本体 + 大脑 + 数据全都要
华为 / 车厂智驾系CloudRobo 等平台入场早期智驾能力平移 + 云生态

注意一个不对称:美国的大脑公司不造本体(PI)或造得很慢(Tesla),中国的本体公司全都在补大脑。原因在第二篇讲过——中国拿走了制造权,本体现金流养得起大脑研发;美国本体又贵又少,大脑公司只能独立融资。两边其实都在向"软硬一体"收敛,只是从相反的方向。终局大概率不是 Android vs Apple 二选一,而是各自吃掉不同场景。

05/

宇树的大脑打法:61 亿弹药怎么打

第二篇讲了它为什么"后做"大脑;这一节看它上市之后具体怎么做——牌已经翻开了三张。

1
双线开源:UnifoLM-WMA-0(世界模型)+ UnifoLM-VLA-02025-09 与 2026-01 先后开源,两条技术路线同时下注、不做路线裁判。开源是后发者的标准打法:自己模型暂时不领先,就先让生态长在自己的本体上——和它硬件低价铺量是同一个棋形。
2
工业版先落自己家:UnifoLM-X1-0 进自有工厂2026 年初在自有产线试点关节电机装配。用自己的工厂当第一个客户——既是最便宜的数据采集场,又把"机器人造机器人"变成了叙事资产。务实且聪明。
3
联盟补短板:DeepSeek 战略合作 + 梁文锋战略配售 1.41 亿王兴兴公开承认大脑是短板,解法是绑定国内最强的模型团队之一:通用 AI、机器人本体、大模型三个方向共研。大模型公司"买身体"、本体公司"借大脑",各取所缺。
4
时间表诚实得罕见"具身 ChatGPT 时刻理想 2–3 年、或者 5–10 年";标准是"带进任意陌生家庭,语音指令完成 80% 日常任务"。给出可证伪的定义而不是画饼,这在创始人里是稀缺品质——也说明他清楚自己在一场长跑的什么位置。

弹药对比:61 亿够不够

宇树(大脑预算 ≤ 61 亿募资的一部分)
VS
Physical Intelligence(专职烧大脑)
募资 61 亿人民币,还要分给产能与研发多线
资金
单轮 $600M(约 43 亿),传下一轮再 $1B,全部烧大脑
几千台存量本体 + 自有工厂 + 开发者生态,数据采集边际成本低
数据引擎
租别人的本体采数据,跨本体是特性也是成本
制造基因,AI 研究人才密度待建(研发费率 7.7% 是起点)
人才
Levine/Hausman 等顶级研究者创办,学术号召力顶配
本体利润兜底,赌错了退回硬件公司照样活
下行保护
纯研究公司,曲线不兑现就是清零

结论:宇树的大脑牌不是"钱最多",是"死不了 + 数据便宜 + 生态在手"。它不需要第一个做出最强大脑,只需要在大脑收敛时仍在牌桌上、且自己的本体是最好的宿主。这是期权逻辑,不是决战逻辑——与它历史上每一步的风格完全一致。

06/

独立大脑成立吗:Android 假设的正反面

这是大脑赛道最贵的一个问题——PI 的 $11B 估值全押在"成立"上,Figure 的 $39B 全押在"不成立"上。

Android 假设成立(独立大脑赢)
VS
Android 假设不成立(垂直整合赢)
本体同质化 → 大脑是唯一差异化 → 全行业向一个最强大脑收敛
逻辑
数据闭环需要软硬一体;本体厂绝不把灵魂外包(参考车厂拒绝华为智驾全栈的心态)
跨本体数据带来多样性红利,模型泛化更强
数据
跨本体适配成本高昂,专机专脑调得更深
手机史:Android 拿下 80% 份额
历史类比
手机史的另一半:利润的 80% 归了垂直整合的苹果
中小本体厂养不起大脑,天然是客户
客户
头部本体厂全在自研;剩下的长尾付费能力弱

我的判断:两个剧本会同时上演,按场景分层。头部场景(汽车工厂、头部品牌家庭机器人)走垂直整合——数据太值钱,不会外流;长尾场景(中小工厂、专用设备改造、科研)走通用大脑 + 标准本体——养不起自研,只能采购。这恰好意味着"标准本体 + 开源大脑"的宇树组合,和"垂直一体"的 Figure 组合,可以同时是对的——它们抢的不是同一块市场。真正危险的是夹在中间、两头不靠的玩家:本体没有成本优势、大脑没有数据优势。

07/

Demo 与产品的距离:怎么看穿一个大脑演示

这个行业的演示水平远超交付水平。带着清单看 demo,是观察者最重要的自我保护。

CHECK 1
环境是不是没见过的在自家实验室调了三个月的场景里成功,和进入陌生环境成功,是两个物种。王兴兴的标准(任意陌生家庭 80% 任务)之所以诚实,就在"任意陌生"四个字。
CHECK 2
成功率和剪辑比发布视频永远是成功的那一条。问:拍了多少条?连续成功率多少?速度是不是 2 倍速播放?Figure "自主完成 8 小时班次"有确切场景边界(单一工厂工位)——真实,但别外推。
CHECK 3
有没有人在环远程遥操兜底不丢人(1X 公开承认),但"自主"和"遥操"必须分开计数。不披露人在环比例的演示,默认按遥操理解。
CHECK 4
失败之后会怎样产品和 demo 的分水岭不是成功时多惊艳,是失败时多可控:会不会摔杯子、会不会伤人、能不能自己恢复。这一条几乎没有公司主动展示——本身就说明问题。
一句话方法论:评估大脑进展,把"发布会时间线"整体向后平移 2–4 年,得到的才是"部署时间线"。智驾行业用十年验证了这个平移量——L4 的 demo 2016 年就满街跑了,Robotaxi 的真实规模化到 2024 年后才开始。
08/

可证伪信号:把三篇的判断串起来收口

大脑侧的信号清单,与第二篇的本体清单配对使用——两张表合起来,就是对整个具身智能行业的持续追踪框架。

#信号看什么如果发生,意味着
B1π 系列 C 轮是否落定$11B+ 估值是否成交、领投方是谁成交 → 资本仍信 Android 假设;流产 → 独立大脑模式遇冷
B2Scaling 证据任何公司公开"数据量 ↔ 成功率"的可复现曲线出现即行业切换到资本碾压模式,所有小玩家估值重写
B3UnifoLM 的外部采用是否有非宇树本体跑 UnifoLM;开发者生态活跃度有 → 开源生态位成立;无 → 沦为营销开源
B4宇树研发费率与 AI 团队上市后首份年报(对照第二篇 S2 信号)大脑投入不放量 → "本体先行"论证失败的最早信号
B51X NEO 自主率曲线家庭场景遥操占比是否逐季下降持续下降 → 数据飞轮真实转动,家庭场景提前
B6王兴兴标准的逼近度"陌生家庭 80% 任务"在公开评测中的最好成绩2–3 年内逼近 → 本体先行窗口关闭,全行业决战大脑
SERIES SYNTHESIS

三部曲的总收口

手(第一篇)是数据的入口,本体(第二篇)是现金流和分发的入口,大脑(第三篇)是终局价值的归属。宇树路线的完整表述应该是:用本体的确定性,购买大脑的可能性,而灵巧手是两者之间最深的护城河缺口——谁先把"手 + 数据"做穿,谁的大脑就先长出身体。三篇合起来看,这个行业最稀缺的不是激情,是排序能力:知道什么先做、什么后做、什么永远不做。

ONE LINE SUMMARY

大脑竞赛像 2019 年的自动驾驶:范式未定、数据为王、demo 远快于部署。宇树用上市把自己变成了"死不了的玩家",而这场竞赛的第一法则恰恰是——活得久比跑得快重要

模型版本、融资与估值数据为 2026 年 8 月前后公开报道口径(PI 的 C 轮为"传闻洽谈中",未经确认),引用前请复核
宇树大脑动态(UnifoLM 系列、DeepSeek 合作、王兴兴时间表)来自上市前后公开采访与发布信息
本文为个人研究笔记,非投资建议;"三国杀"与"Android/Apple"等类比为分析框架,非预测承诺
INDEX · 目录