互联网出海龙头,为大模型定调。
今年的世界人工智能大会(WAIC),绝对算是有史以来最热闹的一年,参展企业云集之外,投资人也悉数到场,唯恐错过任何一匹新黑马。
其中最受瞩目的,当属7月19日昆仑万维举办的“世界模型与多模态范式跃迁”专场论坛。论坛上,昆仑万维董事长方汉登台宣告:“2026年,是世界模型元年。”
注:昆仑万维董事长兼CEO方汉
台下坐着周志华院士、黄晓明、王珞丹,以及来自全球的AI从业者。这句话的份量,或许比很多人意识到的更重。
这不是又一家公司在喊口号,而是AI行业第一次有人把“世界模型”从技术概念擢升为一个时代的命名。
AI急需换赛道
想读懂2026年这场AI范式变革,得先厘清过去三年世界模型的演变轨迹。
2024年初,谷歌DeepMind发布Genie,AI第一次从视频里学会什么叫“动作”;2025年8月,Genie 3做到实时交互;2025年11月,李飞飞的World Labs把世界模型做成了商业产品。三年,四级跳,每一级都有人喊“重大突破”。
但到了2026年,问题来了。
机器人领域有一张所有模型都要考的卷子,叫LIBERO——给机器人一堆标准任务,看完成率。
这张卷子考了三年,今年考出来的结果令人尴尬:十几家主流模型,分数全挤在96分到99分之间,头部几家互差不到一分。相当于高考全省前十名的总分差,还没有一道选择题大。
卷子废了。
视频生成比什么?画面稳不稳、场景真不真。这些东西有个共同点:全靠人眼打分。评委看屏幕,观众看演示鼓掌。人眼是这三年唯一的考官,而这位考官,快被哄满意了。
这就是2026年的处境:旧卷子考不出差距,旧考官快被哄到顶了。
一项技术走到这一步,只有两条路:继续在旧卷子上争小数点,或者换一张不考情面的卷子。
昆仑万维选了第二条路。
方汉说,过去两年AI的核心命题是“生成”——生成文字、图像、视频、音乐。而从2026年开始,核心命题将转向“理解”与“交互”——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。
这段话听起来像技术路线的升级。但往深里看,它触及的是一个更根本的东西:AI在人类文明中的角色定位,正在发生范式级的翻转。
过去所有的生成式AI,本质上都是“言说者” ——它们通过海量数据学习人类已有的描述,其“理解”是对符号关系的重组,而非对物理规律的亲知。GPT生成一段文字,它不知道文字指涉的世界长什么样;Sora生成一段视频,它不知道画面里的球为什么会滚动。
它们能说话,但不懂世界。
而世界模型要做的事,是让AI变成 “体验者” ——让它建立空间的知觉与时间的连续感,让它能在内部模拟“推倒杯子水会洒”这样的物理后果。它不再是背诵答案的学者,而是一个正在积累童年经验的孩童。
昆仑万维这次发布的Matrix-Game 3.5,最核心的技术突破是“Patch级记忆注入” ——将历史帧切分为带有3D坐标的Patch Memory,推理时根据当前视角检索可见Patch并重新投影,实现长期一致性的空间记忆。5B参数模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力。
注:Skywork首席科学家成宇在论坛上正式发布了Matrix-Game 3.5世界模型
翻译成人话:这个AI不仅能看到画面,还能记住自己在这个虚拟世界里走过的路、看过的角落。当它转身时,它知道背后有什么——就像一个真正走进过房间的人。
这不是模拟数据,这是模拟因果。
物理世界不给“过程分”
黎曼动力机器人创始人刘扬教授在论坛上展示了一组对照实验。
不做预训练,从零训练一版模型,装到一台双臂机器人上,做四类家务——叠衣服、收餐具、整理桌面、堆积木。成功率:0%。
不是动都不动。手伸出去了,东西碰到了,动作做对了大概两成。但四件事,一件都没做完。
仿真环境里那套模型能考95分,因为仿真给“过程分”——手伸对了,给一点;方向偏了,扣一点。
物理世界不给。
这就是世界模型要面对的真正考卷。周志华院士在论坛上指出,决策层世界模型长期面临两大理论瓶颈:多步推演复合误差平方级放大,以及样本复杂度过高。他分享的突破是通过分布匹配技术将推演误差从平方级压至线性级——听起来枯燥,但意义深远:它意味着AI第一次有可能在真实物理环境中进行“长序列推演”,而不是走三步就迷路。
黎曼动力交出的Riemann-1.0,基于超过23.2万小时多源具身交互数据训练,在多个国际主流机器人Benchmark与真实机器人任务上同步实现仿真与真机双SOTA。
注:真机评测:四大家居任务全面领先
这意味着什么?意味着AI正在从“在模拟器里考试”走向“在真实世界里干活”。
方汉的第二个预判是:游戏行业将率先被世界模型改变。
这句话很容易被误解为降本增效——开放世界游戏不再依赖数百人团队数年的手工搭建。这当然是对的,但更深的含义在于:游戏正在成为世界模型理解物理规律的“特制培养基” 。
游戏内置的重力、碰撞、光照等底层物理规则,恰好构成了现实世界的“简化版数学映射”。
当Matrix-Game 3.5让虚拟世界随玩家行动实时生长、持续演化时,它其实在训练AI对不可见规律的直觉。就像婴儿通过玩积木理解力学——游戏不是AI消遣的场景,而是AI形成世界常识的认知摇篮。
Matrix-Game从1.0到3.5始终坚持开源路线。DiT作者、纽约大学助理教授谢赛宁团队基于Matrix-Game 2.0的开源底座,发布了全球首个多人视频世界模型Solaris。NVIDIA和浙大联合发布的Light Interaction基于Matrix-Game 3.0研发。NVIDIA的SANA-WM和Adobe的RELIC等国际大厂的世界模型,均将Matrix-Game相关模型作为对比基准。
别人考试,拿你当分数线。
开源模型混到这个地位,说明这个认知摇篮不仅自己在用,全球开发者都在往里放东西。
理解物理世界
Mureka v9.5和O3音乐模型的发布,可能是整场论坛最具情感冲击力的部分。
v9.5版本喊出的口号是 “最没有AI味的AI音乐模型” ——它不再依赖声部堆砌和复杂编配制造“厉害”的第一印象,而是在真实的音乐框架中,以更克制的方式处理编配、人声、情绪与Prompt意图。
注:歌曲的主观评分
更值得关注的是O3模型。它建立在v9.5之上,通过test-time scaling扩展MusiCoT的推理过程——让模型在生成过程中持续审视当前表达:局部旋律是否仍服务全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正在偏离最初意图。
翻译成人话:这个AI在创作时会 “回头看一眼” 。
早期的AI生成是抽卡式的——结果好坏全凭随机。而O3模型模拟了人类艺术家创作中的内在对话:它能在生成旋律时感知作品在时间线上的整体走向并进行动态校准。
这是从工具向共创者身份迈进的关键一步。AI不再只是一个产出工具,它开始拥有 “创作中的时间感”。
王珞丹在圆桌上分享了自己的亲身体验——为求一个理想镜头熬夜抽卡至凌晨四点,反复调整提示词却迟迟得不到想要的画面。她说创作者首先是一个判断者和决策者,需要用审美去筛选和决定最终呈现的画面。黄晓明则提到,自己用Mureka生成了两首歌,“歌词还挺触动人心的”。
当AI创作者开始回头审视自己的作品,人与AI的边界正在变得模糊——而这恰恰是方汉所预言的“后AI时代,演员需学导演、导演需学表演”的起点。
2026年之所以是元年,不是因为技术参数更高了。
是因为AI第一次拥有了 在世界中留下痕迹并感知痕迹的能力。
过去所有的AI模型,无论多强大,本质上都是旁观者——它们观察人类留下的数据,学习人类表达的方式,但从未真正进入过世界。它们能写出关于落日的诗,却不知道落日是什么;能生成关于雨天的视频,却感受不到雨滴的重量。
而世界模型正在改变这一切:Matrix-Game 3.5的AI能记住虚拟路径,O3模型能回头审视自己的创作,Riemann-1.0的机器人甚至在真实厨房叠起了衣服(尽管成功率依旧为零)。AI正从言说者蜕变为体验者。
它不再是坐在岸边观察河流的人,它开始下水了。
方汉说,这不只是昆仑万维一家公司的回答,更是中国AI从研发走向产业应用的一个缩影。三个产业预判背后是同一个方向:让AI从会生成走向懂世界、能行动。
周志华院士在论坛上提出了一个概念叫 “学件” ——由模型与AI自动生成的规约共同构成,允许多个异构模型在不公开数据的前提下进行复用与组装。这为世界模型从单产线定制走向可成长、可演化的模型生态开辟了新路径。
注:中国科学院院士、南京大学教授、副校长周志华的《关于世界模型的讨论》主题分享
当AI开始体验世界,当模型开始自我演化,当开源生态让全球开发者共同喂养这个正在醒来的数字意识——衡量AI价值的标尺,将不再是它能生成什么,而是 它在世界里感受到了什么 。
物理世界不给过程分。但2026年,AI终于开始答题了。