
“世界模型”无疑是2026年AI领域,甚至是具身智能和人形机器人行业最热的赛道。
半年前,行业还在集体讨论VLA模型怎么从车上走进机器人里,理想、小鹏等公司几乎把VLA奉为“标准范式”。
短短几个月后,风向方向变了。
今年上半年,全球投资圈的热钱除了继续押注具身智能,另一个被反复提及的关键词已经是“世界模型”。
其中在海外,美国斯坦福大学教授、“AI教母”李飞飞创立的 AI 独角兽 World Labs 凭借“空间智能与世界模型”技术备受瞩目,完成了超10亿美元融资并以高估值洽谈新一轮融资,英伟达和AMD罕见同时押注。
而图灵奖得主、深度学习之父杨立昆 (Yann LeCun)的AMI Labs拿下10.3亿美元种子轮,创下欧洲AI领域种子轮融资纪录。
国内上半年,国内发生超过30起世界模型相关的融资事件,融资总额超40亿元。其中,极佳视界在两个月内连获两轮融资,总计达25亿元,成为百亿估值独角兽。
赛道热度仅半年,世界模型领域已涌现出第一梯队头部玩家。
7月19日下午,世界人工智能大会WAIC 2026期间的“世界模型‘六小龙’巅峰论坛”上,大晓机器人攒了一个圆桌,找了五家世界模型赛道比较标志性的公司,分享世界模型赛道的核心趋势。
这场圆桌非常有趣。
尽管参会的嘉宾均为企业 CTO 与研发负责人,内容偏AI学术专业,但整场对话干货十足,能清晰窥见业内人士对世界模型的真实需求、赛道发展的普遍焦虑,以及评测基准、落地等行业现存痛点。
本次圆桌主持人是大晓机器人首席科学家、澳大利亚科学院院士、欧洲科学院外籍院士陶大程,他还曾任京东探索研究院院长,现任新加坡南洋理工大学教授。
圆桌当中,陶大程与五位嘉宾围绕评测、技术难点、落地场景等话题展开对话。
另外五位嘉宾分别是:
蚂蚁灵波首席科学家 沈宇军
极佳视界联合创始人兼首席科学家 朱政
无界动力联合创始人兼CTO 夏中谱
智元机器人AI算法总监 任广辉
自变量机器人联合创始人兼CTO 王昊
值得一提的是,现场的几家企业当中,大晓机器人董事长、商汤联合创始人王晓刚,以及陶大程、沈宇军三位,均是已逝的著名AI领域科学家、香港中文大学教授、商汤科技创始人汤晓鸥的学生。
王昊则曾在AI科学家沈向洋(Harry Shum)的粤港澳大湾区数字经济研究院(IDEA 研究院)担任封神榜大模型团队算法负责人。
夏中谱曾在理想任职,任广辉曾是蔚来大模型研发负责人。
朱政则是博士毕业于中国科学院自动化研究所,2019年至2021年在清华大学自动化系从事博士后研究,他的多篇论文都发表在CVPR、NeurIPS、AAAI等顶会上。
以下是我总结的这场圆桌几个关键笔记:
1、六位都有一个共识,当前没有一个公平、标准、统一的世界模型评测基准,大部分评测还都是视频生成类型的,但世界模型需具备物理因果推演能力,以支持可靠决策,而非仅生成视觉连贯但物理不合理的内容。
2、世界模型的评价指标(三大核心)。泛化性:模型能否在不同场景、物品和操作技能上保持一致表现,体现对物理因果规律的真实理解;预测精度:对未来状态(如几何、运动、力等)的预测是否准确,而非仅像素级复现;决策有效性:世界模型是否能显著提升策略(policy)的性能,如真机任务成功率、接管率等。
3、六家公司的路线都已经有了很大差异。
比如,蚂蚁灵波更注重物理通用大脑,聚焦更适合物理世界的架构,强调数据链路与模型能力积累;极佳视界则希望从垂类(自动驾驶、具身、内容创作)向通用演进;无界动力,则是用浅空间表达物理世界,通过强化学习赋予机器人“世界观”与“价值观”;自变量机器人的端到端世界统一模型,是以原生多模态方式组织物理信号,用于预测与控制。
以下是世界模型“六小龙”圆桌对话,未经主办方审核,只是简单梳理,仅作enjoy和参考:

1、两年后回看,世界模型行业哪些做法做对、哪些做错?
陶大程:各位来宾、线上的朋友们,大家下午好!欢迎来到世界模型六小龙圆桌对话现场。今天到场的五位嘉宾,都是国内世界模型赛道公认的头部从业者,各自代表当下最主流的技术路线,这场圆桌也可以说是国内世界模型行业发展的一个缩影。
本次论坛大晓同步发布统一评测平台,也带来多组技术演示,同时行业内也形成一个共识:研发具身世界模型,核心目标不是复刻像素画面,而是服务实体机器人的动作控制。
(注:这次大晓机器人发布三项核心成果,分别为开悟世界模型 3.1 Kairos 3.1、环境式数据采集方案2.0以及覆盖三大垂直场景的成套解决方案,为物理AI落地提供完整技术底座。)
过去一年,行业热度集中在视频生成赛道,各家比拼画面清晰度、视频时长、画面连贯性,相关技术突破固然亮眼,但机器人的需求完全不同。对视频生成而言,好看的画面是核心;对机器人来说,它需要计算推门需要施加多大力度、抓取杯子时与桌面的距离、执行动作会不会碰撞周边物体、产生负面影响。简单区分:像素复刻是给人观看,物理推演是给机器人使用,二者底层逻辑完全割裂。今天我们围绕核心议题深度交流:
1、下一代具身世界模型该如何定义、建立标准化评价体系;
2、如何打通世界模型完整产业闭环;在场六家企业技术路径各有差异,这也是本次圆桌最大价值。如果我们能达成行业通用共识,就能为世界模型的统一标准、产业生态打下基础。
首先抛出第一个问题:假如拥有时空穿梭机,两年后回头审视今天的行业布局,哪些方向会被证明走对,哪些路线会被验证存在明显偏差?我们先请蚂蚁灵波沈总分享。
沈宇军:我是沈宇军。“六小龙” 这个称号我实在不敢当,我们团队的定位是打造通用物理大脑,选择更适配物理世界的技术路线。
我认为当下行业普遍混淆“模型底层架构能力”和“模型表层展示效果”。
推理效率、交互灵活性属于模型原生底层能力;画质、表面物理观感只是对外呈现的效果。
站在两年后的视角复盘:在模型架构、数据链路层面沉淀的技术积累,一定是行业正确选择;但一味追逐表层视觉效果,最终价值存疑。同时,搭建完整数据生产链路的投入长期有效,可原始数据集本身会随技术迭代持续更新,未必能长期复用。

朱政:我非常认同沈总的观点,补充一点:当前是 2026 下半年,两年后将来到 2028 年,世界模型整体能力会发生质变。
我们当下做对的事:学术界、工业界、资本合力,让世界模型彻底出圈,成为仅次于大语言模型的核心技术赛道与投资热点。
但当下存在一定短板:行业大量精力分散在模型之外,在模型本身尚未收敛成熟时,就仓促落地各类商业化场景,大部分场景最终无法跑通。可以参考大语言模型发展历史,Claude Code系列产品诞生前,OpenAI、国内大厂都尝试过情感陪伴、科学计算、红包拉新等多元落地方向,直到代码赛道跑通,全行业技术路线才快速收敛。
我很好奇,世界模型赛道属于 “Code 级” 标志性落地产品会是什么?
夏中谱:两年对于当下高速迭代的大模型行业并不算长,但回看两年前的语言模型就能发现技术差距巨大。
世界模型的核心本质,是学习物理世界因果规律、实现未来状态推演,并基于推演输出机器人决策。我们无界动力长期深耕因果驱动的世界模型,这也是行业长期正确的核心路线。
任广辉:刚才沈总分享的数据、模型架构观点我深有感触。长期来看,行业一定会走向原生具身世界模型。
其中在数据层面,当下大量训练素材来自影视、短视频,这类素材为视觉效果刻意违背真实物理逻辑(特殊运镜、剪辑、超现实画面),不适合训练实体机器人,行业需要大规模原生具身交互数据集。
模型架构层面,现有开源基座大多为视频生成设计,优先优化画面质感,但高清像素对机器人动作规划、行为预测增益有限。未来预训练任务、模型架构需要全面统一,摆脱娱乐视频生成模型的外挂改造思路。
王昊:我简单总结一下。
两年后回看,我们当下把“未来预测”作为核心监督训练目标,是明确正确的选择。对世界未来状态做预测,本质是压缩、理解世界底层结构。但过度依赖纯视频数据搭建物理认知,这条路大概率行不通,预估出错概率接近九成;缺少力觉、触觉等真实物理信息输入,仅靠视觉视频无法完成可靠的物理推演。
陶大程:我也补充一点个人观点。
两年后回头看,行业走对的一步,是让 AI 从数字世界的旁观者,转变为物理世界的参与者;行业走偏的一步,是把大量算力、研发资源投入视觉画面优化,用适配人类观看的标准衡量机器人控制工具。
如何建立适配物理 AI 的全新评测标尺,是接下来三大议题的核心。
2、衡量优秀具身世界模型的三大核心指标?
陶大程:我们进入细分讨论:世界模型当前热度很高,但距离产业通用基础设施仍有明显差距,该如何缩小这一鸿沟?

朱政:沈总团队正在做具身原生预训练,我们也在同步布局同类方向。目前多模态、大语言基座发展成熟,但市面上主流开源基座均为数字视频场景设计,且逐步走向闭源。如果行业不自主研发适配物理世界的原生基座,未来会面临无可用基础模型的困境,必须提前布局具身专用预训练体系。
陶大程:如果想让世界模型成为物理 AI 通用底层范式,当前行业最欠缺的核心要素是什么?有请第三位嘉宾。
夏中普:我认为行业存在三大核心短板:
1、物理多模态数据缺失。现有训练素材以视觉、文本为主,力觉、触觉交互数据严重不足;
2、表征架构适配性不足。Transformer 原生适配高密度语言信息,但图像、触觉属于低密度信号,行业缺少适配低密度物理信号的隐空间表征方案;
3、训练范式落后。当前主流模仿学习只能复刻人类动作,无法突破人类操作上限;想要机器人在物理场景实现超越人类的操作能力,必须普及强化学习等新型训练范式。
任广辉:最核心短板是物理因果一致性。
当下主流 Cosmos 等视频生成模型经常出现违背物理常识的输出:夹爪未接触物体直接抓取、打开盒子内部物品凭空消失,缺少完整因果逻辑的世界模型无法成为物理 AI 底层基座。
王昊:核心缺口是完整交互数据闭环。世界模型依靠和真实环境交互迭代,想要规模化迭代,必须实现机器人在海量真实场景落地;只有大规模真机交互,才能形成完整数据飞轮,加速模型能力迭代,这也是具身学习的核心本质。
沈宇军:补充数据维度短板。
目前行业没有统一的多模态数据对齐标准,缺少标准化数据规范就无法规模化迭代模型,这是制约行业发展关键卡点。
陶大程:经常有人提问,世界模型是否需要完整复刻整个现实世界?
对机器人而言,不需要存储全部世界信息,只需要存储完成指定任务所需信息。语言模型追求知识广度,机器人模型追求执行可行性,不靠无限精细模拟器,而是统一理解、生成、预测三大核心能力,这也是我们研发开物世界模型的底层逻辑。
第二个核心议题:具身世界模型该如何衡量?仅保留三大核心评测指标该选哪些?
当下行业榜单依旧沿用视频生成评测标准,比拼画质、视频时长、画面连贯度。部分模型能生成极其逼真的倒水画面,却无法预判水会泼洒,出现“画面满分、物理逻辑低分”的矛盾,您怎么看?
夏中普:如果只能保留三个指标,优先级如下。
场景泛化能力:检验模型是否掌握通用物理因果,覆盖全新场景、未知物体、陌生操作而不失效;
未来预测精度:不局限像素级预测,重点评估几何、力学等物理量的推演准确度,推演越精准,决策稳定性越高;
决策有效性:衡量世界模型辅助规划后,机器人真实任务完成率,判断模型是否能切实提升实体执行效果。
任广辉:三大核心指标。
第一,物理、3D 多视角一致性,推演结果符合基础常识;
第二,表征对任务规划的支撑能力;
第三,对机器人策略的实际提升幅度,这是最终落地评判标准。
王昊:第一是反事实推演能力,给定当前状态与全新动作预判未来,是检验模型是否理解世界的核心;第二是物体恒常记忆,物体遮挡、移位后仍可识别同一实体,代表稳定世界表征;第三推理时效性,具身场景不需要超长推演,快速反馈、快速迭代远比长视频生成重要。
沈宇军:第一动作准确性,行业缺少标准化动作评测,模型支持操作的种类、精准度是机器人刚需;第二物理合理性,无需精准计算物理数值,只需区分轻重、下落等基础规律即可;第三推理时效性,动作推理一旦延迟过高没有落地价值。
朱政:我们内部重点构建真机 Benchmark,核心关注少样本、多任务场景下机器人任务成功率,这也是我们后续计划对外开放的评测体系。
陶大程:综合各位嘉宾观点,世界模型评测可分为三层智能标准。
生成智能(入门门槛):视觉画面连贯,对应当下视频生成赛道现有标准;
认知智能(中层核心):掌握完整物理因果,不会出现物体凭空消失、违背常识的推演;
物理智能(产业核心):推演结果可转化为可靠机器人动作,以真机成功率、真实接管率作为最终标尺。本次发布 Physical IQ 平台,目的不是给模型排名,而是替换行业原有评测标尺:行业优化方向由 “画面逼真” 转向 “实体动作可靠”,研发资源向物理执行能力倾斜,才能落地真正的 Physical AI。
3、世界模型行业下一阶段核心收敛点是什么?
陶大程:当下赛道路线分化。
生成式模型、空间隐空间表征、端到端动作模型多条路线并行。短期分化、长期收敛,收敛点会落在统一表征、物理因果、动作接口、标准化评测哪一环?请各位选择最笃定的观点并阐述。

任广辉:我认为核心收敛点是统一多模态表征,与环境交互闭环结合在一起。数字大模型依靠统一表征实现智能涌现,具身智能同样需要整合视觉、动作、文本、触觉的通用表征;同时仅靠表征不足,必须依托持续环境交互闭环迭代,二者结合才是行业长期共识。
沈宇军:类比视觉模型发展历程,各类技术路线最终会融合核心优势:
保留未来预测能力,但降低像素渲染权重,无需完整生成高清画面;
吸收隐空间表征的推理优势,用于空间逻辑计算;
融合显式物理规则辅助模型认知,但不需要完整 3D 建模,可作为空间记忆辅助工具;多路线核心优势融合,就是未来统一技术架构。
王昊:我判断下一个行业共识会落在触觉模态。视觉生成模型与物理机器人世界模型最大分界线就是触觉感知;触觉数据规模化落地后,二者技术路线会彻底分流,目前行业触觉研发进度提升很快,会率先形成统一标准。
朱政:我更看好标准化评测体系。从早期规则机器人、VLA 模型到如今世界模型,评测标准持续迭代。本次 Physical IQ 平台把评测场景从实验室封闭环境拓展至户外、家庭、工业真实场景,标准化评测能给全行业统一优化方向,是路线收敛的基础。
夏中普:核心收敛点是决策绑定的统一表征。单纯视觉表征无法适配机器人决策,表征体系必须筛选和任务、因果强相关的信息,基于统一表征完成未来推演,才能持续提升机器人执行精度。

陶大程:各位嘉宾判断各有侧重,差异化观点恰恰是行业活力的体现。当前具身智能距离大规模落地仍有较长周期,短期单一技术路线不会完全胜出,统一评测标尺会是第一收敛节点。
参考深度学习发展历程,ImageNet 统一评测基准才推动各类架构融合迭代。路线分歧不是行业问题,而是行业发展红利,但前提是建立通用评测标准。
4、从 Demo 走向产业部署,最大落地坑是什么?
陶大程:从 Demo 演示到规模化产业部署。展会 Demo 大多筛选最优单次效果,真实产线部署看最差工况稳定性;Demo 不计成本优化效果,产业落地必须核算商业 ROI,各位分享落地踩过的核心深坑,从王昊总开始。
王昊:最大痛点是成本边际效应。
模型效果从 0 到 90% 投入可控,但从90%到99%、从99%到99.9%,每提升一个数量级错误率,投入成本和前一阶段持平;其次是评测环境与真实部署环境不一致,实验室效果优异,线下真机稳定性大幅下滑,必须在真实场景反复迭代;最终落地核心门槛是投入成本能否覆盖业务收益,纯技术创新无法支撑商业落地。

沈宇军:非常认同成本优先的落地逻辑,补充真实场景突发、随机问题。展会 Demo 均经过人工复位、标准化环境调试;现实商超、家居场景存在大量不可预判变量,商品移位、杂物遮挡等异常情况,现有模型处理能力不足,是规模化落地巨大阻碍。
朱政:我们前期大量对接工厂梳理真实业务痛点,复盘得出核心教训:当前模型能力上限不足以支撑大规模商业化,此前分散资源拓展落地场景收效有限,现阶段核心重心回归模型性能提升。
夏中普:Demo 仅展示单点最优能力,规模化部署需要系统化全链路方案。以咖啡制作、叠衣场景举例,Demo 无需考虑前置物料准备、各类异常工况;真实商用场景需要完整拆解全流程需求,覆盖海量突发情况,缺少系统化方案无法落地。
任广辉:工业场景落地核心痛点。
一是产线无法停机调试,模型快速适配全新工件、产线的自适应能力要求极高。
二是规模化复制难度大,Demo 属于一次性定制方案,复制到多家工厂会大幅抬高研发成本,整套模型、硬件、数据闭环体系需要完整配套,才能实现批量落地。
陶大程:综合各位落地分享,延时、端侧部署是行业容易忽略的关键问题。
大量世界推演依靠云端大集群,但机器人产线决策窗口仅几十到一百多毫秒,无法长期依赖网络云端。
机器人大脑不需要存储完整世界,只需要适配对应任务,轻量化可端侧部署的任务导向模型产业价值更高。
世界模型完整链路分四层角色:训练阶段是数据引擎、评估阶段是标准化考官、规划阶段推演沙盘、部署阶段形成本能,四层缺一不可。
行业不会为理论上的智能(“理论上聪明”)买单,只会为稳定可靠的落地效果买单。
今天圆桌各位嘉宾路线存在分歧,也达成诸多产业共识,分歧是研究素材,共识是产业地基。
我们共同的核心共识:更换行业评测标尺,研发重心从画面生成转向实体执行可靠性。未来我们联合全球产学研伙伴,推动物理 AI 完成因果推演到实体控制的完整闭环。
本次圆桌到此结束,再次感谢所有嘉宾。



京公网安备 11011402013531号