技术热点透视20260920:宇树给机器人装上了“统一大脑”
本文完全由 WorkBuddy 独立收集资料、调试代码并完成文章写作。
我是 Alex Xiang,前百度/微博工程师,现在专注于 AI 工程与工具产品。更多文章欢迎关注微信公众号「字与码」。
先把今天这件事的坐标放准
今天,宇树科技正式发布了 UnifoLM-WLA-1.0,官方给它的定位是”全球首个真正意义上能想、能看、能动的通用人形机器人基础模型”。
但如果你只看这句话,会误判。这不是一个从零冒出来的东西,而是一次”补齐 + 定型 + 交卷”。
把时间轴拉直看:9 月 8 日,宇树展示过两台人形机器人靠 UnifoLM-X2-1.0 全自主搏击,那个模型是 world-action 结构,没有 Language 层——它能感知、能预判、能出动作,但它不被语言显式地约束和调度。9 月 11 日,6B 参数、覆盖 64 项任务的基座模型已经先行开源。
所以今天真正新增的是三样东西:把 Language 层加回来了,正式发布并给出统一命名,放出可对比的基准成绩,并且扩大了开放范围。
这个坐标为什么重要?因为它决定了我们今天该在哪一层激动。如果以为是”宇树突然做出了通用机器人大脑”,那激动错了地方;如果看到的是”一个 6B 模型把 64 项真实物理任务装进同一套架构、还敢放出空间理解的硬指标、并且愿意开放权重”,那才是今天真正值得写的东西。
WLA:把”看—想—动”从流水线改成一条回路
WLA 这三个字母,是 World(世界)、Language(语言)、Action(动作)。
过去做机器人任务,主流做法是三段式流水线:先看,识别出”桌上有个瓶盖”;再想,规划出”手应该移到哪里、施加多大力”;最后动,把规划翻译成关节轨迹。这条链路每一段都是独立模块,每一段都有自己的误差,误差还会沿着链路累积。更要命的是延迟——三段串起来,反应时间被拉长。
WLA 的改动不是把三段做得更好,而是把具身推理、未来动态区域预测、动作生成塞进同一个框架。它的顺序变了:先理解当前环境,再预测接下来可能发生什么,然后才生成动作。
这个顺序上的差别,在具身场景里是致命的。举个具体例子:拧瓶盖。如果只做”识别瓶盖→规划→执行”,模型看到的是一张静态图。但真实的拧瓶盖,你要预判的是——手转多少度之后瓶身会不会跟着滑、桌面会不会晃、水会不会因为角度变化而溅出来。没有”预测接下来会怎样”,动作就是盲的。
所以 WLA 里那个 W(World),不是”世界模型”的时髦标签,它是动作的前置条件。先把未来几帧的动态区域预测出来,动作才有了依据。
架构上也对应得很清楚:多模态主干 + 动作专家模块。一个负责看懂、听懂,一个负责把”理解”翻译成”动作”。主干偏认知,专家偏执行,分工明确但共享同一套表示——这就是它和”三个独立模块拼起来”的本质区别。
一个 6B 模型通吃 64 活:变的是生产单位
这是我认为今天最该被反复讲的一点。
这 64 项任务分成两半:54 项精细桌面操作——端茶倒水、开关抽屉、拧瓶盖、叠毛巾、收纳餐具、摆盘、倒垃圾、把衣服放进洗衣机、整理床铺、厨房和浴室的整理;另外 10 项全身协调运动——下台阶、跨越障碍、单脚站立。
过去行业里怎么干这些活?给每个动作单独训一个策略。开抽屉一个策略,拧瓶盖一个策略,叠毛巾再一个策略。每个策略都要单独采数据、单独调、单独部署。这套做法像什么?像写代码时一个文件一个文件地手写,每个文件都要从头搭一遍脚手架。
而”一个 6B 模型覆盖 64 项任务”,等价于 coding agent 领域里从”逐文件手写”迁移到”一个 harness 调度 agent”。
请注意,这不是效率提升,这是生产单位变了。以前的生产单位是”一个动作一个策略”,现在的生产单位是”一套可迁移的表示 + 一个调度层”。前者的边际成本是线性的——多加一项任务就多训一个模型;后者的边际成本是递减的——任务越多,共享表示越厚,新任务的迁移越容易。
这也解释了为什么”6B”这个数字本身就是新闻。它不是精度指标,它是架构主张。
6B 的另一层意义:大脑得长在身体上
6B 极小。对于一个大语言模型来说小得不像话,但对于一个要在物理世界里跑闭环的机器人来说,这个尺寸意味着它可能跑在机体本地的边缘算力上,而不是依赖云端数据中心。
这一点比参数量本身重要得多。
现在绝大多数 agent 是”云端推理”的:你发一句话,请求飞到数据中心,模型算完再飞回来。这种做法在聊天场景里没问题,因为延迟是几百毫秒还是一秒,人类感知不明显。但机器人端茶倒水的场景里,一次云端往返的一百毫秒,可能就是把茶水洒在客人身上的差别。
还有三个更现实的问题:机器人是移动的,网络覆盖天然不稳定,进了电梯、地下室、工厂车间就容易断;摄像头采集的视觉数据往云端传,隐私和带宽都是负担;如果机器人要进家庭和工厂,按调用量付费的云端推理成本根本撑不住规模化。
所以”6B”是一句部署层面的判断:小到可以本地闭环,才谈得上真的进物理世界。我们今天见到的很多”具身智能”演示,背后其实是把云端的智力和本体的动作拼在一起,一旦断网就瘫。WLA 这个尺寸选择,是在往相反的方向走。
不挑手、还放权重:这是生态卡位,不是慈善
再看两个工程上很有意思的细节。
第一,不挑硬件。它兼容低成本的二指夹爪,也原生支持 Shadow Dexterous Hand、Allegro Hand 这类主流五指灵巧手。这意味着模型能力不被机械臂型号锁死——换句话说,它想成为”模型即服务”(MaaS)里那个被调用的模型,而不是绑定某一台机器的私有固件。
第二,开放策略。项目主页已经上线,部分模型权重和数据已经放开;后训练代码、UnifoLM-WLA-Base 权重、全身遥操作数据集、操作数据集,都列进了”后续开放”的计划。
把这两件事放一起看,动机就清楚了:这是生态卡位。
谁的基础模型被最多的硬件厂商和开发者采用,谁就定义了机器人”大脑”的接口标准。这是 Android 的剧本——不靠单机硬件赚钱,靠成为所有人都得兼容的那一层。而宇树的特殊之处在于,它既是本体厂又是模型厂,既有定义硬件的能力,又想做定义操作系统的那一层,差不多是把 NVIDIA 和 Android 合体。
一旦这个位置站住,后来者无论做本体还是做模型,都得先问一句”你兼容 UnifoLM 吗”。
但请诚实:64 项是挑过的,demo 不等于交付
写到这里必须泼一盆冷水,因为这是全文最不能省的部分。
这 64 项任务,是精心挑选过的,不是”通用”。“能覆盖 64 项任务”和”能覆盖任意任务”之间,隔着一整个泛化问题。这 64 项是设计者选出来展示能力边界上界的,不是从真实世界的任务分布里随机抽样的。
跨本体泛化也还没被验证。同一个模型,换一台结构不同的机器人、换一个完全没见过的厨房,还能不能干?权威媒体京报网在报道里明确提醒过:跨场景与跨本体泛化,仍需通过更多真实环境测试验证。这句话不能当客套话读,它就是当前最核心的未知数。
再看训练数据:约 2500 小时真机采集数据。这个量在今天的具身领域不算少,但放到”通用”这个目标面前,是很小的样本。具身推理底座则另用了 500 多万条具身推理样本,在开源视觉语言模型底座上训练——注意,这是”推理样本”,是认知层的养料,不能直接等同于”手能干活”的经验。
最后,呼应宇树自己提过的”80/80 安全线”:陌生场景完成 80% 的任务。这个标准听起来不高,但到今天也没有被普遍跨过,行业共识是还需要 2 到 10 年。
所以正确的读法是:发布会展示的是能力的上界,交付保障的是能力的下界。别把上界当成了已经落地的下界。
具身推理底座那个成绩,该怎么读
顺带说说今天放出的基准成绩,因为这块容易被误读。
具身推理底座叫 UnifoLM-ER-1-4B,基于 Qwen3-VL-4B 构建。在 16 项多模态感知与理解基准里,它在 RefSpatial-Bench、Where2Place、PixMo-Point、BLINK、EmbSpatial、RoboSpatial、VSR 这 7 项空间理解类榜单上拿下参评开源模型第一,部分空间理解指标甚至高于闭源旗舰——有榜单上是 82 分对 69 分,另一项是 88.9 分对 83.3 分,对标的是 Astra / Gemini-ER 2 级别的闭源模型。
怎么读这个结果?空间理解是”想”的地基。机器人要在物理世界里行动,“这个杯子在桌沿左侧 10 厘米""这个抽屉能拉出多少”这类空间判断是前提,地基分高说明技术方向是对的,选开源 VLM 底座 + 具身推理数据这条路线是走得通的。
但也要清楚:空间理解测试分高,不等于手能干活。它是必要条件,不是充分条件。今天真正难的部分,依然在从”想明白”到”做出来”那一段。
我的总体判断
今天这件事,我会放进”范式转移”那一栏,而不是”产品发布”那一栏。
它改变的是一条生产线:从”一个动作一个策略”,到”一个模型一套表示通吃 64 活”。它改变的是一个部署判断:机器人”大脑”可以放在机体本地,而不是云端。它改变的是一种商业模式:不锁本体、开放权重,去争”机器人界 Android”这个位置。
同时它也没有解决三个根本问题:跨场景泛化、跨本体泛化、以及从 demo 到交付之间那段又长又脏的路。
宇树今天把”能想、能看、能动”这三件事缝成了一条回路,这确实是一个台阶。但台阶不是山顶,发布会也不是交付。真正的验证,是这台机器人走进一个它没见过的房间,能不能把活干成。
其他动态
Artificial Analysis 给 Coding Agent 加了个”安全拒答”账本。其 Coding Agent Index v1.5 新增了对拒绝执行情况的记账,Claude Fable 5.1 在 Claude Code 环境回退率 8.8%、在 Devin Fusion 环境 7.1%,为参评最高。它的价值在于把”分数到底是来自能力,还是来自模型压根没干活”单独拎出来算——这是评测方法论上一件很实在的事。
华为云 CodeArts Agent 在马来西亚商用发布。包含 16 个专用 Agent,覆盖需求、架构、编码、测试、评审等环节,支持千万行级代码理解。中国 AI 编程工具第一次以完整产品形态成体系出海到东南亚市场。
腾讯发布”效率智能体工具集”。在 2026 腾讯云 AI 产业应用大会上线,含 WorkBuddy 企业版、ADP 4.0,覆盖 20 多个垂直场景。同日,2026 世界制造业大会在合肥开幕,近 2000㎡ 的机器人与具身智能展区中,墨甲”墨宝”首次发布。
微信公众号
欢迎关注「字与码」
如果这篇文章对你有用,也欢迎在微信里继续关注后续更新。
X / Twitter
关注 @ax2_zicode
更即时的技术观察、新文章提醒和一些短想法会发在 X 上。