磐霖Insight
2026/07/23
阅读量:28

世界模型(World Model):范式转移中的结构性机遇

近两年,AI产业正在从“生成内容”走向“模拟现实”。这是一场深刻的范式转移:从“预测下一个Token”走向“预测下一个物理状态”。世界模型(World Model)作为这一转移的核心载体,正接过大语言模型(LLM)的接力棒,成为全球资本与技术产业界最大的公约数。

如果说大语言模型让AI学会了“说话”和“思考”,那么世界模型则是想要解决另一个更难的问题:让AI理解现实世界,并在行动前对未来进行推演。

一时间,“世界模型”也迅速成为当下 AI 投资中最热的新叙事之一。仅2026年上半年,全球一级市场流向世界模型相关领域的资金已超百亿美元,这标志着AI正式从数据世界的“文斗”升级为物理世界的“武斗”。 黄仁勋也称2026年为 Physical AI 元年。AI 从数字世界迈入物理世界,从技术演示转向规模化落地。

磐霖资本AI主题投研团队认为,在世界模型产业发展的这场"淘金热"中,泛化数据是全赛道的刚性需求,无论哪派技术路线胜出,真实物理数据与合成数据都是不可或缺的“原油”,布局能生成泛化数据的平台正当时,即布局“卖水人”。团队也看好那些落地在工业等高价值B端“生产力工具”以及落地在人形机器人的核心底座,即物理仿真世界模型和具身动作世界模型。磐霖也青睐那些既懂AI算法,又懂物理引擎、机器人学或工业场景,具备“跨学科融合能力”的团队,他们或许能带领企业跨越“仿真到现实”的鸿沟。

以下为磐霖资本AI投研团队相关报告精华

 

一  核心定义与内涵

 

“世界模型”的本质不是生成一段“看起来真实”的视频,而是根据当前状态和动作,预测环境下一步如何变化。它相当于智能体的“脑内沙盘”:先推演行动后果,再选择动作。

世界模型与大语言模型并非替代关系。大语言更擅长语言、知识和逻辑接口;世界模型承担空间、时间、物理状态和动作后果的表征与预测。二者最终可能在物理智能系统中形成分层协作。

作为一组目标不同的技术集合,世界模型不是一个单一赛道,是涵盖从 “模拟表象” 到 “建模物理规律”,再到 “指导行动” 的完整技术光谱,从而“建模世界”。具体而言,世界模型包含:

面向人的建模

输出结果是给人看的,服务于内容创作、游戏、影视、VR/AR等领域。评价标准是主观的“视觉体验”和“沉浸感”。

  • 感知层,回答“世界是什么样?”:以Sora, Veo为代表,目标是生成符合人类视觉习惯的逼真画面,本质是像素预测。它关心“看起来像不像真实世界”,但不关心画面中的物体是否遵守物理定律。
  • 推演层,回答“世界下一步会怎样?”:生成可交互环境(比如Genie 3):模型开始理解空间关系,允许用户通过动作影响画面演变,但它生成的环境是“一次性的”,关闭即消失,不具备持续性。输出持久化3D空间(比如Marble):模型输出的不再是视频流,而是带有几何和语义信息的3D结构。这个空间是持久存在的,可以编辑、可以反复进入,已经具备了“数字孪生”的雏形。

面向机器的建模

输出结果是给算法或控制器用的,服务于自动驾驶、机器人、工业控制等领域

  • 决策层,回答“我应该怎么做?”:输出物理状态与动作(VLA):处于最内核。模型输出的是可供机器执行的物理参数(如坐标、速度、力)或动作指令,形成感知-决策闭环。它关心的是“下一秒物体真正会怎样”,而不是“画面会怎样”。

 

二  产业为何在此时持续升温

 

当前,随着大语言模型边际收益递减,大家都期待 AI 落地现实改变生活。所以AI的下一波价值在于物理世界交互(机器人、自动驾驶、工业等),而世界模型就是文本 AI 走向物理 AI 的桥梁。

需求侧

  • 机器人、自动驾驶和工业系统的瓶颈,正在从感知与单点任务转向泛化、长尾、安全验证和闭环决策。比如,具身智能进入商业化前夜,通用机器人亟需世界模型突破能力天花板,自动驾驶进入 L3-L4 攻坚期,纯实车测试边际效益递减,仿真成为核心解法,这些都是产业需求倒逼AI需要在物理世界落地。

技术侧

  • 视频生成、交互式环境、多模态表征、VLA、强化学习和仿真引擎开始融合。
  • Genie、Sora、Cosmos 的出现让视频生成质量在短时间内大幅提升,引起广泛关注的同时催生了大量跨领域研究投入, 2024 年后世界模 型开始走向生成和机器人学的融合化继续推进了技术进步,同时还有多模态传感器数据赋能。

供给侧

  • 分布式训练框架、显存优化等工程技术成熟,算力利用率大幅提升,仿真平台、传感器和数据工程趋于成熟。

资本侧

  • 世界模型被纳入“Physical AI”叙事,头部团队、大厂和芯片平台加速布局。

 

三  主要分类与技术路线

 

对于世界模型,不同学术流派和产业力量从各自的认知体系和商业逻辑出发,给出了截然不同的诠释。

最具代表性的是李飞飞(Fei-Fei Li)与World Labs团队在2026年发表的《A Functional Taxonomy of World Models》中提出的基于POMDP(部分可观测马尔可夫决策过程)智能体-环境循环的功能三分类法,分别对应智能体交互循环中的“观测”、“状态”和“动作”三个环节:

  • 渲染器(Renderer)——输出‘像素’给人看
  • 模拟器(Simulator)——输出‘状态’(几何/物理忠实)
  • 规划器(Planner)———输出‘动作’

另一种分类逻辑则是按技术学派分成四派:

  • 生成派:模型显式地把"观测本身"(像素 / 完整状态)预测或重建出来
  • 视频生成派(Sora / Veo), 目的是画面好看真实
  • 当代综合派 / 视频世界模型(Genie 3、GameNGen), 目的是构建“能进去操作的世界"
  • 非生成派:只预测一个抽象向量,而不预测观测本身。

还有则是按应用域分类,解释世界模型落地应用在哪个产业,扮演什么角色:

  • 空间智能(Spatial Intelligence):生成/理解一致、可导航的3D空间。李飞飞口号:‘From Words to Worlds’,空间智能是 AI 下一个前沿。
  • 自动驾驶世界模型:预测‘开下去会发生什么’,用于仿真/评测/决策。
  • 具身/机器人世界模型:为机器人造合成数据+做规划。

 

对于上述分类,李飞飞的分类法是我们认为最清晰或者产业界认可度最高的分类方法,磐霖也是按照这个分类去进行项目梳理的,即按应用分类:

  • 内容生成—输出画面给人看:按文本/图像输入实时生成帧,优化的是‘视觉保真度’。差异点:视觉真实,但物理可能‘穿帮’。
  • 仿真预测——输出符合物理规律的“状态”:输出在几何、物理或动力学上忠实于真实世界的‘状态表示’,可被几何检验、遵守牛顿物理。差异点:可被程序调用做仿真,是‘最难也最有价值’的一类。
  • 动作驱动——给定现状和目标,输出“动作”:给定观测和目标,直接输出‘智能体该做什么动作’,构成感知—行动闭环,用于机器人/具身学习。

 

四  技术壁垒

 

世界模型很火,但发展落地远比想象中残酷。我们梳理了当前制约行业跨越“死亡之谷”的四大核心壁垒:

数据壁垒——最底层的“原油荒”

  • 长时序、高动态的真实物理交互数据极度稀缺;闭环反馈数据决定迭代速度;而长尾场景的覆盖率,直接锁死了模型落地的能力上限。

算法壁垒——从“好看”到“正确”的鸿沟

  • 全模态融合难,物理准确性更难。生成式模型“穿帮”频出,因果推理能力薄弱,且长程时空一致性漂移问题至今无解。

算力与工程壁垒——现实世界的“重力”

  • 训练侧面临算力调度与成本压力;推理侧需满足端侧低功耗、实时性要求;更关键的是,完整的数据-训练-部署-反馈工程闭环尚未建立。

评测壁垒——没有“考卷”的考场

  • 目前世界模型,采用不同技术方法,追求不同目标(生成/模拟/决策),涉及广泛的应用(自动驾驶/机器人),因此没有统一的典型任务或指标。WorldArena 等基准刚出现,“什么算好世界模型?”尚无定论。

 

五  商业化进程

 

世界模型的商业化,可沿着一条“先工具、后终端”的路径清晰演进;从场景看,短期内容场景落地、中期工业场景爆发、长期具身场景放量。

第一阶段:技术验证期(2024-2026)

  • 未来三到五年,行业主旋律仍是技术迭代。资本与研发资源将持续投入基础架构、物理仿真精度与数据管线的打磨。

第二阶段:分场景渗透期(2026-2029)

  • 世界模型将率先以“生产力工具”的形态落地——作为数据引擎、仿真训练场和环境构造器,赋能现有产业,而非直接部署到终端实时推理。
  • 短期(1-2年):游戏影视内容生成、数字人、仿真测试工具率先商业化;
  • 中期(3-5年):自动驾驶仿真、工业数字孪生、智慧城市推演进入规模化应用。

第三阶段:通用普及期(2030+)

  • 五年之后,当技术成熟与成本下降形成共振,通用具身机器人、物理世界大模型、数字孪生与Agent任务闭环将迎来真正的爆发。
  • 可见商业模式包括 API/模型授权、行业解决方案、联合研发、按效果分成和软硬件一体化。现阶段,纯 API 收入未必能覆盖基础模型训练成本,垂直方案和数据工具更可能率先形成收入。

 

六  看好三大主线

 

我们看好三大主线:泛化数据引擎、物理仿真、具身动作世界模型。

泛化数据引擎——“卖水人”

  • 在世界模型赛道"淘金热"中,泛化数据引擎是全赛道刚性需求,无论哪派技术路线胜出,真实物理数据与合成数据都是不可或缺的“原油”。磐霖看好具备“物理正确性”的数据管线,即能生成带几何、动力学标签的3D/4D数据的平台,而非仅生成2D像素的视频模型。这个领域商业模式清晰,抗周期属性突出,盈利确定性优于纯模型研发。

物理仿真世界模型——

落地在工业等高价值B端“生产力工具”

  • 世界模型从 “内容生成” 升级为 “决策工具” 的核心壁垒,可跳过内容生成的内卷,锚定工业等高价值场景。磐霖认为,以AI+多物理场引擎构建壁垒,通过虚拟仿真替代高昂的物理测试,大幅降本增效。这个领域玩家稀缺,B端付费意愿强,护城河深厚。

具身智能世界模型——

落地在人形机器人的核心底座,是未来“金矿”

  • 通用具身智能的 “决策大脑”,是人形机器人实现通用操作能力的核心底座,赛道早期格局未定,长期成长空间最大。磐霖看好,具备核心算法能力的团队,又懂物理引擎、机器人学或工业场景,具备“跨学科融合能力”的团队,他们有望实现指数级增长。

总之,我们对世界模型保持长期乐观、短期审慎。我们认为,世界模型领域真正的投资分水岭,不是谁更会生成一个看起来真实的世界,而是谁能够让机器在真实世界中更快学习、更低成本验证,并且少犯一次昂贵的错误。