李飞飞入局世界模型:AI的下一个战场从文本转向现实

Jun 28, 2026

1130 words

6 min read

AI

Note: This page does not support English, using the default language version

从”会聊天”到”懂世界”

如果说2023-2025年是AI”学会说话”的三年,那么2026年可能是AI”学会理解世界”的元年。

最近几个月,一个新词在AI圈刷屏:世界模型(World Model)

斯坦福AI科学家李飞飞创立的World Labs完成10亿美元融资,估值约50亿美元。图灵奖得主杨立昆与谢赛宁联合创立的AMI Labs获得10.3亿美元种子轮融资,创下欧洲AI领域种子轮融资纪录。国内方面,极佳视界在一个月内连拿两轮合计25亿元融资,宣称成为国内首个世界模型百亿独角兽。

这些数字背后,是AI赛道的一次根本性转向。

世界模型到底是什么?

李飞飞在6月的一篇文章中直言:世界模型是当前AI领域最重要、也最被滥用的术语之一。

现在市面上的”世界模型”至少有四类:

  1. 以语言为中心:用文本训练,通过语言”想象”世界(比如GPT)
  2. 以像素为中心:视频生成模型,比如Sora
  3. 以三维结构为中心:李飞飞团队的Marble,强调空间结构和几何一致性
  4. 以物理规律为中心:英伟达的Cosmos,特斯拉的神经世界模拟器

简单说,传统大模型是”读万卷书”,世界模型是要”行万里路”。

它不仅要理解文本,还要理解三维空间、物理规律、因果关系——就像人类不仅会说话,还会走路、拿东西、判断距离、预测物体运动轨迹。

为什么现在这么火?

三个原因:

一是大语言模型的天花板已经显现。 纯文本训练的模型,很难理解物理世界的复杂性。你可以让GPT写一段”机器人搬箱子”的代码,但它不知道箱子有多重、搬起来会不会摔倒、地面滑不滑。

二是具身智能需要世界模型。 2026年被业界称为”人形机器人量产元年”,机器人要在真实世界行动,就必须理解这个世界。越疆科技近期发布的陪伴交互AI人形机器人,就宣称搭载自研具身大模型,实现对物理世界的深度理解。

三是资本需要新故事。 大模型赛道已经卷到极致,头部厂商发布周期压缩到50天左右。投资人需要下一个”大模型级别”的机会,世界模型正好填补这个空缺。

对开发者意味着什么?

短期内,世界模型不会替代大语言模型,而是互补关系

  • 如果你做聊天机器人、文本生成、代码助手,继续用GPT、Claude这类大语言模型就好
  • 如果你做机器人、自动驾驶、工业仿真、游戏AI,需要关注世界模型的进展
  • 如果你做AI应用,未来可能出现”语言模型+世界模型”的组合能力

英伟达已经在6月初开源了全模态物理AI世界模型Cosmos 3,腾讯发布了开源的混元3D世界模型2.0(HY-World 2.0),阿里推出了主打实时交互的HappyOyster。这些工具值得开发者持续关注。

我的判断

世界模型不是炒作,但也不会像大语言模型那样快速普及。

原因很简单:理解文本和理解世界,难度不在一个量级。 大模型可以靠海量文本”喂养”出来,世界模型需要物理仿真、三维重建、传感器数据、真实世界实验——成本高得多,周期长得多。

李飞飞说世界模型”最被滥用”,其实也说明这个概念还在早期,鱼龙混杂。真正的世界模型,可能要像大语言模型一样,经历几年”寒武纪大爆发”才能筛选出真正有用的形态。

但对普通人来说,这是一个信号:AI正在从”数字世界”走向”物理世界”。 这个转变,比从GPT-3到GPT-5更值得关注。


毕竟,我们生活的世界不只是文本和图像,还有重力、摩擦、碰撞,和无数需要”动手”的场景。AI终于开始学习这些了。

李飞飞入局世界模型:AI的下一个战场从文本转向现实
https://aimomo.pages.dev/en/blog/ai-world-model-2026/
Author
AI Ficor
Published on
Jun 28, 2026

Loading comments...

Enter keywords to start searching