WAIC深度|世界模型时代落幕“对标美国”:中国AI第一次走进无人竞速区
日期:2026-08-02 17:15:02 / 人气:12

在大语言模型时代,中国AI产业长期处于清晰的追赶范式:海外开路、国内跟进,创业项目、资本评审、技术路线,都绕不开一个核心问题——你的美国对标是谁?
但当AI从“语言智能”迈向世界模型+具身智能的全新周期,这套沿用多年的发展逻辑彻底失效。
在2026世界人工智能大会(WAIC)主题早餐会上,莫刻机器人联合创始人池晓威直言行业最大变局:世界模型赛道,中国公司已经没有对标。
这不是局部领先,而是范式平权的历史性节点。在算力、硬件、数据、人才的特殊国内产业土壤下,中国世界模型赛道走出了一条不同于硅谷的独立路径,正式告别“复刻海外”的跟随模式,进入全球同步创新、自主定义赛道规则的全新阶段。
重新理解世界模型:AI的“世界直觉”
很多人对世界模型的认知停留在概念层面,池晓威用通俗的类比拆解其核心本质:人类看懂漫画分镜,就能脑补出帧与帧之间的连续动态;看到球员起脚,就能预判射门方向与结果。这种无需刻意推理、与生俱来的预判能力,就是人脑的“心智模型”,也是世界模型的终极雏形。
所谓世界模型,核心就是用数据驱动的AI算法,复刻人类对物理世界的先验认知与未来预判能力。它让AI不再只会文本对话、逻辑推演,更能理解物理规律、空间关系、行为逻辑,拥有对真实世界的“直觉感知”。
这也是通往Robotics AGI(机器人通用智能)的核心钥匙:当机器人在观测、行动、决策之前,拥有了预判世界变化的全局直觉,通用具身智能的落地便有了底层支撑。
行业分水岭:2020年OpenAI转身,埋下赛道变局伏笔
当下的赛道格局,源于六年前的一次关键抉择。2020年,OpenAI收购知名仿真器MuJoCo,深耕物理AI、机器人强化学习,一度押注具身智能赛道。但2021年,OpenAI突然战略转向,彻底砍掉物理AI与仿真相关业务,All in大语言模型。
此后五年,全球AI的聚光灯完全被大模型、对话交互、文本生成占据,语言智能成为绝对主流。但在水面之下,另一条技术脉络从未停滞:从2018年施密德胡贝尔提出世界模型理论,到Meta发布SAM视觉基座、CLIP多模态模型,全球研究者始终在探索“用像素压缩真实世界”的技术路径。
这条隐秘赛道上,华人学者始终站在核心一线。从计算机视觉领域的MMLab团队、何恺明等顶尖研究者,到杨立昆AMI实验室的谢赛宁等核心骨干,华人力量持续深耕多模态、视觉生成、物理建模领域,为中国世界模型产业崛起筑牢了人才根基。
2022年后,哈佛大学学者杜伊伦用生成式模型探索机器人通用操作,2024年谷歌依托512块TPU完成UniSim大规模训练,验证了模型组合泛化能力。直到2025年,行业终于形成共识:机器人世界模型,是AI下一个可规模化的核心赛道。
2025关键变局:中美同步起跑,中国彻底告别对标
语言模型时代,中国AI是典型的“追随者”。资本评判项目、企业规划路线,都需要锚定一个美国对标公司,做“中国版复刻与本地化优化”。但2025年世界模型赛道的爆发,彻底打破了这一格局。
这一年,全球赛道进入交错竞速阶段。英伟达先后开源Cosmos 1.0、2.0、2.5系列世界模型基座,投入近万张算力卡攻坚扩散与自回归双路线。而中国团队实现了同步甚至超前起跑。
依托北京人形机器人创新中心的资源支撑,莫刻机器人早在2024年12月至2025年初,就启动了大规模世界模型预训练,依托上万小时独家数据完成首轮迭代,启动与初代模型迭代时间早于英伟达Cosmos。2025年9-10月团队开源的基于通义万相基座优化的世界模型,在数据量级与综合效果上,全面优于同期英伟达Cosmos 1.0、2.0版本。
与此同时,生数科技等国内团队同步发力,推出视频生成+逆运动学控制的机器人操作路线,形成差异化技术路径。即便后续英伟达持续加码宣传、输出行业认知,其核心工作的一作与核心研究者,仍多为华人学者。
池晓威就此判定核心变局:在AGI级别的世界模型新赛道,中国没有了对标,也无需对标。全球玩家站在同一起跑线,华人团队、中国企业、中国技术路线,开始自主定义行业规则。
中国的独特悖论:算力弱势,却拥有产业碾压优势
同步起跑的背后,是中国赛道独一无二的竞争禀赋,呈现出鲜明的“优劣对冲”格局。
客观短板十分突出:国内世界模型企业可调用算力,仅为北美同行的四分之一至五分之一;头部算力资源大多被成熟语言模型业务占据,留给具身智能、世界模型的算力资源有限,即便是头部厂商,可用卡量也仅有数千张,且多为降级算力。
但中国拥有北美无法复制的产业生态优势,构成了弯道超车的核心底气:
首先是极致低成本的数据优势。国内拥有200-500家专业数采服务商,形成了规模化、低成本、高效率的数据采集产业集群,能够持续供给高质量视频-动作配对数据,为模型迭代提供充足“食材”。
其次是极速闭环的硬件供应链。北美创业公司多采用全栈自研模式,硬件迭代、故障排查周期漫长。而国内硬件产业高度集聚,机器人硬件出现问题,合作厂商可实现十分钟上门、现场调试、即时迭代,算法、硬件、场景的迭代效率远超海外,形成独有的产业闭环速度。
算力不足、数据与硬件补位,这套独特的组合拳,让中国世界模型赛道具备了独立成长、自主领跑的核心能力。
落地三重瓶颈:算力、数据、模型效率的终极博弈
站在同步起跑的新起点,世界模型规模化落地仍面临三重核心瓶颈,也是行业未来2-3年的攻坚核心。
第一,算力分配结构性失衡。语言模型处于产品化落地红利期,持续占据行业绝大部分算力资源,导致具身智能赛道算力紧缺,模型规模化训练、迭代速度受限。
第二,数据规模化存在先天局限。当前全球可规模化训练的核心数据,只有“以人为中心采集的视频-动作配对数据”。即便是全网公开的视频数据,本质也是人类主观拍摄记录,物理规律分布不均、可控性弱,行业只能依托这类有限数据完成模型迭代。未来两年,行业数据体量有望冲击上亿小时级别,逼近互联网文本数据量级,但算力与模型效率能否匹配,仍是未知。
第三,模型结构效率竞争白热化。垂类物理、化学仿真模型,本质是传统仿真器的升级包装,无法支撑通用AGI迭代。行业唯一破局路径,是打磨高效模型结构,在有限算力、有限数据的前提下,最大化挖掘通用世界规律,实现泛化能力突破。
商业化前置:世界模型落地的三道安全关卡
相较于技术迭代,世界模型+人形机器人的安全治理,是C端落地的前置核心条件。池晓威提出行业必须跨越的三道关键关卡。
第一道,算法安全边界。团队自研SafeDojo框架,核心是训练模型建立“安全直觉”,通过海量数据迭代与算法约束,让模型自主识别危险场景、划定行为边界,实现全局轨迹的安全规划,这是通用智能安全的底层核心,无捷径可走。
第二道,硬件控制安全。依托成熟的柔顺控制技术,限定机器人动作幅度、作业范围,从底层“小脑控制”规避风险。但随着机器人进入家庭、与人机交互比例突破1:1,开放场景的新型安全问题持续涌现,需要持续场景迭代修复。
第三道,产品形态安全。当下机器人硬件形态偏工业化、刚性强,人机交互风险高。未来需要通过充气软质外壳、柔性结构设计等产品优化,增加物理缓冲,从硬件层面降低人机交互风险。
同时池晓威强调一个反向认知:机器人的安全克制,源于充分的风险认知。团队实测的“智械危机”模拟实验证明,只有让模型充分学习危险行为、掌握风险逻辑,才能精准规避风险、实现有效安全约束。
结语:无对标时代,中国AI的全新叙事
从跟随对标到同步领跑,世界模型赛道的变局,是中国AI产业范式升级的缩影。过去我们追赶成熟赛道,复刻海外产品、验证海外逻辑;如今在AGI下一代核心赛道,中国拥有独立的技术路线、完整的产业生态、极致的迭代效率。
算力短板依旧存在,落地瓶颈尚未突破,但不可否认的是:属于中国AI的、无人可对标、自主定义规则的创新时代,已经到来。未来3-5年,随着模型迭代、数据积累、安全体系完善,世界模型将走出实验室,落地为全新的具身智能产品,解锁真正的硅基智能形态。
作者:门徒娱乐
新闻资讯 News
- WAIC深度|世界模型时代落幕“...08-02
- 全球AI竞争,真正缺的不是GPU...08-02
- 当智能成为生产要素:AI智算、具...08-02
- 中国机器人,提前经历"大疆时刻"08-02

