当前位置: 首页 » 资讯 » 科技头条 » 正文

机器人开始打工了,可量产才是生死线|2026 WAIC

IP属地 中国·北京 编辑:李娜 光锥智能 时间:2026-07-20 08:13:15

文|罗镇昊

编|刘俊宏

WAIC场馆外的电闪雷鸣,仿佛地球生命创生一样,激发着具身智能这个新物种。

还没走进世博展览馆,周边路口上就能看见人形交通机器人在疏导车流,好像在预示:本届WAIC,具身智能绝对站C位。

从参展数量上即可证实这一点。今年具身智能赛道的参展企业从去年的80多家猛增到200多家,占全部展商近五分之一,摆出来的真机超过300台。各式各样的机器人把无数观展者“硬控”在台前。

穿行在场馆间,最大的感受是热闹。

宇树在展台中间直接搭了擂台,两台人形机器人现场打起MMA,拳拳到肉,零件撒了一地,场外喊声此起彼伏。加速进化搭了个迷你足球场,红蓝两队机器人趁着世界杯热度踢球。松延动力更直接,拉着观众上去“试踹”,机器人只是微微后退几步,平衡稳得让人有点意外。

更赛博的场景在场馆比比皆是。一群coser牵着机器狗在展馆里溜达,过道上突然撞见一只两条短腿顶着卡通大头的“豆脚”,走着走着突然劈了个叉,甚至有点魔幻。

但热闹之下,光锥智能明确感受到,今年具身智能的风向已经明显变了。

虽然今年具身智能还存在一些“表演”性质,但更大一部分企业已经把重点放在了具体的“打工场景”。

汽车线束产线、仓库、药房、零售货架、洗衣房、家庭客厅……这些真实场景,很多都被1:1搬进展馆,各类异构机器人在其中流畅地执行长程任务。机器人不仅开始被要求“干活”,而且干活的场景正在分化。

与此同时,具身智能大脑技术路线也出现了清晰的变化。

之前被反复强调端到端路线所代表的VLA与世界模型之争,在今年现场的纷争似乎少了许多。取而代之的,是通过Agent调度原子化技能、实现“一脑控多机”、精准完成规范化任务的路径模式。

但具身智能行业还是没有解决数据难题。

真机数据依旧是行业的共同困境。这次WAIC上很多展示,其实都依托于提前到现场连夜采集数据、现调试模型。这意味着,现阶段的数据量还没法达到让模型快速适应不同的场景的程度。因此,提升模型的泛化能力,仍然是当前商业兑现最直接的门槛。

2026WAIC的具身智能依然需要时间成长,但留给行业玩家的时间却不多了。

当前具身智能行业的出货,绝大部分还是教育科研和数据采集这些根本不算成功商业化的领域。过渡性需求还没结束之前,市场需要看到的,是谁能在真实场景里创造真正的价值。

2026,机器人最有希望

直接“打工”的一年

工作,是今年具身智能演示的核心主题。按场景在展馆走一圈,会发现各家机器人的“工种”已经分得相当清晰。

工业是今年密度极高的场景,分工也更细化。

针对分拣环节,极智嘉直接把一个小型产线搬进展台,人形机器人Gino 1负责从物料箱里抓取商品,无论是充气量不同的袋装薯片、透明包装的面包,还是外形不规则的毛绒玩具,都能一抓一个准。

Gino 1除了自己能抓取货物、搬物料箱外,把它和移动机器人、专用工作站放在一起,就能组成一个自动化编组,自主完成从拣选、搬运到投递全流程作业,并具备一定的抗干扰能力。从交付逻辑看,极智嘉似乎不只想证明单个机器人的能力有多强,更是试图提供一套提升整条产线OEE(设备综合效率)的系统方案。

把产线复刻进展馆的还有它石智航。在这里,A1机器人处理的是汽车线束插接的精细活。柔软的线束一碰就变形,而且容易缠绕,A1必须根据线束状态实时调整抓取策略,然后完成亚毫米级的孔位插接。一旦失误,整个流程都得中断。

这类高精操作在场馆内有不少类似的演示,还挺有意思的。

在传统VLA机器人感知框架里,视频部分的输入其实会有帧数限制。机器人“可能看到的不是最实时的画面”,导致输出可能连带着存在几毫米的误差,这是很正常的。但同时,这也导致机器人干不了“精细活”。现在机器人厂商把这个问题搞定了。

除了分拣和高精度操作,重载方向同样有人押注。智元与京东物流联合推出的安规级重载具身机器人精灵G2 Max,现场单手举起一只15公斤哑铃,未来计划部署进京东物流“智狼仓”承担重物搬运。银河通用的重载人形机器人Galbot S1,能完成拆垛、搬运和码垛,单箱最高50公斤,每小时处理80至90箱,续航约10小时。

虽然这些机器人执行的任务并不复杂,单小时效率还比不上人工。但重物搬运场景使用机器人的优势已经开始显现,机器人不再只是“花瓶”,而且还能长时间连续作业。

工业场景被普遍认为是具身智能最先实现“干活”的地方。但这次WAIC上,To C的零售和服务场景,同样释放出了“Ready”的信号。

蚂蚁灵波的展位就是一个真实药房的样子,有人在线上下单,不到一分钟,机器人就完成了接单、取货、把药放到台上一系列动作。在现实中,下一步肯定就是等骑手来取。这套方案已经在国大药房上海门店落地,并打通了外卖平台。

更有意思的是,里面的三台不同构型的机器人,分别来自乐聚、星尘智能与蚂蚁灵波,构型完全不同,但它们都共用LingBot-VLA 2.0这一个大脑。类似这种“一脑控多形”、“一脑控多手”的架构,普渡和机器科学等也都在展示,似乎已经成为今年的主流选择。

在一个酷似超市的展台,银河通用的Galbot G1机器人正在帮人烤面包片、倒咖啡。现场无论工作人员如何干扰,例如—临时把杯子挪位置、用手挡住杯口,机器人都能重新寻找目标或先暂停动作。据光锥智能了解,其自研大模型“银河星脑”已经在三类机器人上装机,能完成3到5分钟的长程任务。

能自主执行长程任务,已经成了这次WAIC上展示干活能力的标配。

智平方的AlphaBot 2,能现场调一杯鸡尾酒,制作各种饮料,优理奇的保姆机器人做手磨咖啡、烤披萨,这些都不是单一的短动作,而是由多个步骤组成的复杂任务。长任务的核心价值在于,机器人对任务的理解能力和执行能力都有了质的提升。相比短任务的“公式化”、“呆板”,执行一个长任务才算是真正“办了一件事”。这意味着,未来人可以把更多完整的任务交给机器人来做了。

种种迹象表明,今年具身智能的变化已经相当明显。

2025年,机器人在工业场景执行的任务只是“打螺丝”和分拣,在ToC场景无非就是“做咖啡”和“零售店拿个东西”。今年机器人能抓取的东西更多了,能处理的场景更杂了,一个大脑开始控制不同形态的多台机器人,长程任务也不再是个别展台的特例。打工场景正在从“能做几个动作”走向“能承担一类工种”,工业、零售、服务之间的分工也开始清晰起来。

这一切都指向一个目的,那就是让机器人深入到具体场景,变得更加实用。可以看出,具身智能行业已经到了商业兑现的门口。但从“动起来”到“用起来”,仍然存在巨大的鸿沟。

泛化是模型最重要的目标

逛展时很容易感受到,今年机器人在走、跑、抓、搬等动作上,已经变得很利索了。但真正决定它们能用起来的,是如何理解物理世界、如何自主决策。这些能力,依然被困在数据和算法的瓶颈里。

今年,光锥智能发现,过去具身智能大脑模型的端到端叙事正在逐渐让位。

前两年具身行业言必称端到端,描述得非常美妙。类比汽车自动驾驶,机器人也能一个模型从看到画面到输出动作,中间什么都不要。但在今年WAIC现场,长程任务几乎清一色变成了Agent-based的分层架构——上层用一个Agent负责调度和任务理解,下层则是一个个被拆解出来的原子能力。

所谓原子能力,就是把抓、放、插、堆、折等任务抽象成一个个标准化技能。大模型先理解指令和上下文,再由Agent根据当前任务去调取不同的技能组合。

这一模式兴起的前提在于,业内发现,端到端虽然出现Scaling Law的信号,但并不代表马上能用。一旦换到新环境,需要大量专家重新训练,验证,花几个月来调试。而原子能力是基于已有技能做适配,不用从头训练,部署周期能实现大幅压缩。更重要的是,当同一个模型换到其他本体上,这些技能也有机会复用。

在现场,光锥智能看到它石智航、普渡、原力灵机等厂商都在采用类似思路。例如原力灵机的机器人摆了个“积木长城”,过程就是让机器人不停执行一段“由几个特定工序组成,能循环”的工作——从识别每一块积木的颜色与形状,到规划抓取姿态与放置位置,再到逐层堆叠建造成型。

但光锥智能感觉,新的方案在某种程度上可能算是一种“放下执念”。

当下具身普遍认可的思路,还是“大脑小脑”的架构,大脑负责“智力上限”,小脑负责具体调度执行。Agent-based有点像是回归到规则时代的智驾,机器人看到一个物体,然后输出背后要操作的能力。从表现上看,它确实提升了场景和能力的泛化性,能够不需要场景重训,能“忽视”机器人构型层面的差异。

但同时,这条路的逻辑也比较清晰,它更像是在当前数据与模型能力约束下的选择,不太可能走到“通用具身智能”的终点。

关于具身模型训练环节,真机数据依然是行业共同的困境。

截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,不足大语言模型训练数据的两万分之一。“在数据上需要很多量,这是大家今年很强的共识。”智元合伙人、高级副总裁、具身业务总裁姚卯青强调,要达到高阶智能,真实物理世界的数据量级需达到亿小时级别。

为解决数据难题,行业的解法大致分为两条路径。

第一个是把真实数据的成本打下来。智元的方式是拓展无本体数据采集体系,也就是人通过手持、穿戴采集设备,在真实场景中操作,同时记录动作轨迹、视觉和交互,再迁移到机器人模型的训练。为此,智元推出了一款轻量化作业和数据采集平台G2Air,这是一款拥有7个自由度的机械臂,和自家的采集设备原生同构,就是为了最大程度复用无本体环境采集到的数据,也让这些数据能更好地和模型训练无缝衔接。

在很多灵巧手展台上,几乎都能看见同构的采集手套。戴上之后,灵巧手会同步做相同的动作。除了卖采集设备、卖方案,某种程度上,这也是在降低开发者的采集难度,以便建立数据回流的通道。

第二条路是仿真先行,再用真机数据微调。像苏度科技就比较偏向这个做法,用物理仿真引擎在虚拟世界批量生成数据,先把机器人的基础操作能力提起来。但仿真和真实世界之间存在迁移差距,所以模型训好之后,还要用真机在不同场景和任务中跑,用真实数据持续修正、打磨模型。

数据路线分野之后,光锥智能还发现,今年行业在单纯VLA还是世界模型上的争吵已经少了许多,现在基本都是混合路线了。

各家都在探索其他可能。例如蚂蚁灵波的LingBot 2.0模型系列,就包含具身原生世界动作模型 LingBot-VA 2.0和具身基座模型 LingBot-VLA 2.0;千寻智能采用的是VLA+世界模型的融合架构,智平方走“皮层-小脑-脊髓”的类脑路线。机器科学则推出了一个新的架构——VLOA,中间的“O”是指物体连续运动的3D点云轨迹,可以描述物体在任务中的位置、姿态、形变和接触关系等变化。

而极智嘉的双脑协同架构中,负责行动的小脑Gravity 4D具身模型,扩展出了二维视频预测能力,据称可实现在预判风险后再生成稳妥的连续动作序列。这显然也是融合了世界模型的特征。

当谁都无法确信机器人的最终形态时,把智能与硬件解耦、让同一套能力跨本体复用,正是行业不被数据卡死、进入下一阶段的通行证。

量产角逐之际

既分高下,也决生死

真实世界的门票并不好拿。

去年,具身行业的玩家们就在喊量产和商业化。但实际表现,其实挺难看的。

据新战略咨询数据,2025年国内具身智能机器人的出货中,科研教育仍是第一大需求场景,占比42%,数据采集占19%,而真正用于产生商用价值的工业及物流,只占4%。

这意味着,撑不到真实应用市场爆发的玩家,将在这一阶段被淘汰出局。

要跻身真实的应用市场,光证明能干活儿并不够,更关键的是规模化量产能力。2026年作为具身智能的“量产元年”,产能已经成为一道分水岭。

IDC数据显示,2025年全球人形机器人出货量接近1.8万台,智元、宇树以5000台量级位居第一梯队,其中智元在2026年3月底迎来第10000台机器人下线;乐聚、加速进化、松延动力处于千台级的第二梯队。其余厂商大多还在百台水平,或者干脆只有样机。

但今年,没法再这么糊弄了。

去年厂商只要拿得出Demo、让机器人动一动就算合格。今年,越来越多厂商把实现大规模量产当作最重要的目标之一。宇树的年产能规划目标已达19万台;优必选将2026年出货目标上调至5000台;刚拿下某前置仓大客户,号称3亿订单在手的零次方,一边联系外部代工厂、一边寻找可靠供应商,借WAIC为扩产搭桥。

需要承认的是,当前阶段,科研教育、数采中心这样的过渡需求依旧存在,但这毕竟不是终局场景。量产不只是把货卖出去,还要看卖到哪,是不是有价值的出货空间,能不能成功商业化。

今年WAIC上被反复提起的名字,是京东智狼仓、长飞产线、国大药房、电池厂与汽车工厂。银河通用的Galbot S1进了电池厂和汽车工厂,灵初的设备进了长飞,蚂蚁灵波的智慧药房已经在上海真实门店投入运营。从卖给实验室和展厅到抵达真正该用起来的地方,各家都在试图完成这关键一跃。

场景也在这个过程中越加分化,以物流、巡检、搬运为主的“工厂派”,与以零售、服务、家庭为主的“日常派”,各自划出了清晰的落地方向。

通过这次WAIC的展示可以看到,“量产”的含义不只有整机的出货,还包括数据的量产和模型的装机量。也有玩家从中发现机会,当起了“卖铲人”,试图用一套标准化算力平台帮行业跨过量产门槛。

例如地平线孵化的公司地瓜机器人,就推出了一套基于具身智能大脑平台的量产方案,算法上适配近10款主流VLA模型,并结合开发工具和生态伙伴,把机器人从样机到万台交付,拆解成“开发套件快速搭原型、模组真实场景调试、产业链协同规模化量产”三步路径。自己只做全行业的“卖铲人”,让整机厂专注场景落地。

机器人必须走进真实世界挣取自己的经验,行业必须走进真实市场挣取自己的收入。WAIC办了八年,前几年还在吵路线、比参数、猜时间表,今年方向感前所未有地清晰。

从百模大战式的混乱,到场景、数据、量产三条主线的收敛,具身智能在2026年的上海完成了自己的成人礼。但现阶段的机器人进厂,主要目的还是建立试点,并不是真用于工作的规模化采购。要让工厂复购,后面还要算一笔关于稳定性和ROI更精细的账。

接下来的竞争,既分高下,也决生死。

标签: 机器人 数据 智能 模型 场景 任务 量产 行业 能力 现场 药房 世界 路线 大脑 动作 汽车 智元 物理 工业 架构 光锥 蚂蚁 灵波 人形 价值 平台 本体 小时 方案 物流 线束 厂商 咖啡

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。