—— 中新系全媒体矩阵 ——
新闻行业垂直网站当行业里越来越多的视频生成模型、交互环境模型、机器人策略模型都被称为“世界模型”,一个更根本的问题随之浮现:它们建模的,究竟是哪一层世界?
在北京极佳视界科技有限公司与通用世界模型北京市重点实验室联合主办的2026世界机器人大会“通用世界模型前沿论坛”上,极佳视界创始人、CEO黄冠以《通用世界模型引领AGI的最新前沿》为题发表主旨演讲。他提出,AGI不能只有语言智能,更需要能够在物理空间中理解、生成、预测和行动的“世界智能”。而要判断世界智能走到了哪里,行业首先需要一套能够区分能力边界的坐标系。
基于极佳视界在通用世界模型领域的技术积累,以及在具身智能、自动驾驶、内容创作等多个领域的落地实践,黄冠表示:“通用世界模型(GWM)可以分为L1-L5分级框架——从生成视觉真实的视频世界,逐级走向动作、几何、物理,最终抵达可长程运营的通用无限世界。”


当所有模型都叫“世界模型”
行业更需要一把尺子
世界模型正在快速走出单一技术范畴:它可以是生成未来画面的视频模型,可以是接受动作输入、预测环境变化的交互式模拟器,也可以成为机器人规划与决策的内部模型。概念边界的扩张说明技术正在成熟,但也带来新的混淆——画面更逼真,并不等于空间更准确;能够预测下一帧,并不等于能够预测一次接触、碰撞或长程操作的真实后果。
L1-L5描述的是模型对世界施加的约束越来越强:从外观真实,到动作可用;从三维结构稳定,到物理规律可信;再到状态、记忆与反馈可以在更长时间尺度上持续运转。越往上,模型越不能只依赖一段看起来合理的视频来证明自己。
通用世界模型的“通用”,至少要经得住三重检验:能否跨场景迁移,能否被行动与结果验证,能否在时间推移中保持一致。
L1-L5
模型究竟学会了哪一层“世界”?

▲ 极佳视界提出的通用世界模型L1-L5分级框架
L1视频:先让世界“看起来真实”
能力定义:根据各种输入生成视觉真实的通用视频世界。这一层解决的是世界的视觉表达:画面质量、时间连续性、语义一致性与可控性。它是世界模型的重要入口,但视觉可信仍不等于结构和规律可信。一个模型能生成逼真的机械臂,并不代表它知道夹爪与物体发生接触后会怎样。
回答的问题:模型能否稳定生成一个可信、连贯、可控的世界?
L2动作:从“看见未来”到“做出选择”
能力定义:生成高效、合理的通用执行动作。在这一层,模型不再只是呈现世界,而要把环境理解转化为可执行的动作序列。对于机器人而言,动作必须在约束下完成任务;对于交互环境而言,用户输入必须引起合理反馈。世界模型开始从内容生成器转向决策与行动的基础设施。
回答的问题:动作是否可执行、有效率,并能真正推进任务?
L3几何:让世界从像素表面获得几何信息
能力定义:生成几何准确的通用空间世界。空间关系、尺度、遮挡、多视角一致性与三维结构在这里成为硬约束。只要视角变化,物体的位置、形状和相互关系就必须保持一致。世界不再是一串逐帧“猜出来”的画面,而是一个可以被定位、测量和导航的空间。
回答的问题:跨视角、跨传感器、跨时间观察时,空间结构是否仍然成立?
L4物理:从空间正确走向因果正确
能力定义:生成物理精确的通用物理世界。世界除了有几何结构,还要服从接触、摩擦、碰撞、力与运动等规律。模型不仅要预测“接下来像什么”,还要回答“采取这个动作会发生什么”,并在更长的滚动预测中控制误差累积。物理精确性决定世界模型能否服务真实机器,而不只是服务视觉体验。
回答的问题:同样的状态与动作,能否稳定地产生符合物理和因果的结果?
L5运营:让一个世界长期存在、持续反馈
能力定义:生成可长程运营的通用无限世界。这里的“运营”不是商业运营,而是让世界在长时间尺度上维持状态、规则、记忆和交互,并在持续反馈中演化。模型需要处理长程任务、多主体协同、异常恢复和开放式变化,使世界从一次性生成结果变成可持续运行的智能环境。
回答的问题:时间不断向前时,世界能否记得、响应、恢复并保持内部一致?
“视频决定世界看起来是否真实,几何与物理决定它是否真正可以被进入、被预测、被行动;长程运营则决定这个世界能否持续存在。”
五个层级
实际对应三条同时推进的进阶轴
把L1-L5简单理解成五代模型,会低估这套框架的意义。它真正刻画的是三条彼此咬合的技术进阶轴。只有三条轴同时向前,世界模型才可能从演示走向基础能力。
第一条:表征轴——从像素到几何,再到物理
像素让模型学会世界的外观,几何让模型获得稳定的空间结构,物理让模型把结构与因果规律连接起来。越往后,模型越需要显式或隐式地保存对象、状态、关系与动力学,而不是仅靠局部纹理延续下一帧。
第二条:智能轴——从生成到行动,再到闭环反馈
生成是提出一种可能的未来,行动是在诸多未来中选择一条可执行路径,闭环则要求模型根据结果不断修正策略。世界模型只有进入“预测—行动—反馈—再预测”的循环,才能真正成为智能体的内部环境。
第三条:时间轴——从短片段到长程任务,再到持续世界
短时生成主要考验局部连贯,长程任务会暴露记忆丢失、状态漂移与误差累积,而持续世界还要面对开放变化和多主体交互。L5之难,并不只是“生成得更久”,而是让因果、状态和目标在更长时间尺度上仍然成立。
需要强调的是:更高层级不是替代更低层级,而是在其上叠加更强约束。没有稳定的视频表征,动作无从观察;没有准确的几何与物理,长程运行也只会放大错误。
三个场景
校准同一个世界
L1-L5并非从单一场景倒推出的抽象概念。极佳视界自2023年成立以来,持续布局「通用世界模型(GWM)」的全栈技术体系,并应用在具身智能、自动驾驶、内容创作等不同的场景。不同场景对视觉、空间、物理、动作和长程稳定性的要求不同,却在共同校准同一件事:模型是否真的理解世界,而不仅是拟合画面。
具身智能:用行动结果检验预测
在具身智能场景中,黄冠重点介绍了GigaBrain-0.7。其System 1以VLA生成连续未来动作,System 2以VLM理解物理常识、因果关系并完成高层规划,System 3则引入通用世界价值模型,对未来世界及动作价值进行预测,再结合在线强化学习形成持续自进化闭环。现场展示的长程任务包含20余个原子动作,并实现超过20分钟的一镜到底执行。
这里对应的不只是L2的动作生成。高层规划依赖对环境状态的理解,世界价值模型要判断动作的未来后果,长程执行又会检验记忆、状态保持与异常恢复。机器人因此成为高等级世界模型最严格的“真机考场”之一。


自动驾驶:把视觉世界压进几何与物理约束
在自动驾驶场景中,DriveDreamer Engine由World Model、Agentic Model与Harness构成,支持结构化多输入视频生成、HD Map与3D Box控制、多视角生成,以及RGB与LiDAR之间的跨传感器一致性。极佳视界还将世界重建扩展到10公里以上路网,并在部分场景中把重建时间从约3小时压缩到约3分钟。
驾驶场景对“看起来合理”的容忍度极低:车道结构、车辆位置、遮挡关系与传感器观测必须一致,智能体的动作还要引起正确的交通演化。这正是从L1视频走向L3几何、L4物理的典型压力测试。


内容生成:在开放创作中检验可控与一致
在内容生成场景中,极佳视界以YiSu 2.0、YiSu Agentic与YiSu Engine构成产品矩阵,并通过WonderTurbo、HumanDreamer、Motion-R1、WorldDreamer等模型持续推进长镜头、三维一致性、人体运动和空间交互。
内容创作看似更接近L1,却也会迅速触碰更高层级:镜头一旦拉长、视角一旦切换、角色一旦与环境互动,几何、遮挡与物理稳定性就会成为决定可用性的瓶颈。

L1-L5真正改变的是研发与评测方式
分级框架的价值,不只在于告诉行业“下一步做什么”,还在于提醒行业“不同层级不能用同一套指标”。如果用视频美学指标衡量物理世界模型,或只用短时成功率衡量长程智能体,就会把演示质量误当成技术等级。

▲ 从L1到L5,评测对象也应随能力边界升级
当指标随层级升级,行业才能把“演示得好”与“能力走得远”区分开:L1可以回答生成质量,L2要看动作是否完成任务,L3与L4要验证空间和因果是否正确,L5则必须接受长时间、开放环境与持续交互的考验。
L1-L5由此不仅是一张技术地图,也可能成为连接研发目标、数据建设与评测标准的共同语言。
从语言到世界
GWM 正在成为 AGI 的最新前沿
大语言模型证明了规模化学习可以压缩人类语言与知识,但物理世界不会仅以文本形式存在。它有空间,有动作,有摩擦与碰撞,也有不断延展的时间。世界模型要承接AGI的下一段路,就必须把这些约束逐层纳入同一个可学习、可预测、可行动的系统。
黄冠在演讲中提出的L1-L5没有把未来简化成一张年份表,而是给出了一条能力累积路径:先让世界可见,再让行动发生;再让空间成立、规律可信,最终让智能在一个持续运行的世界中形成闭环。它的真正价值,不是为今天的模型贴标签,而是让行业更清楚地看到,通用世界模型的巨大价值和坚实路径。

从语言到世界,极佳视界正在以「通用世界模型」的全栈技术体系,以及具身智能、自动驾驶、内容生成三类场景的落地实践,持续验证这条进阶路径。真正的通用世界模型,也将带来一个完全不一样的世界。
声明:本网转发此文章,旨在为读者提供更多信息资讯,所涉内容不构成投资、消费建议。文章事实如有疑问,请与有关方核实,文章观点非本网观点,仅供读者参考。