
近期,人工智能领域的先驱李飞飞所创立的World Labs推出了其核心产品——World API,标志着人工智能从生成视频内容向构建可交互三维空间的一次重大飞跃。该平台通过多模态输入技术,将文字或图像转化为具备物理规则与几何结构的数字世界,为机器人训练、游戏开发以及虚拟现实提供了强大的支持。与传统的视频生成模型不同,这一工具旨在赋予机器空间智能,使其能够理解和进入一个可以自由移动和探索的真实环境。
李飞飞曾言:真正的“世界模型”,不仅仅是观看,更要能够身临其境。2026年1月21日,她所创立的World Labs上线了开放平台World API。只需输入一张图片、一段文字或一个视频,它便能生成一个3D世界。在这个世界中,AI可以自由移动和探索,同时,你也可以将其导出至游戏引擎或机器人仿真系统。
然而,在李飞飞眼中,World API远不止是一个生成工具。1月28日,她在播客《Rethink Reality》中提到:“世界可以是抽象的,也可以是物理的。它可以浩瀚如宇宙,也可以细微至一粒沙子。我们不仅仅在构建一个模型,更是在重新定义,什么才算一个世界。”
就在几天前,彭博社曝出该公司正在与投资人洽谈新一轮融资,估值或达50亿美元,是首轮融资时的五倍。
要理解World API的重要性,需先了解它与当前主流AI工具的不同之处。Sora、即梦等生成的是视频流,本质上是固定角度的连续画面。而World Labs生成的是空间结构,是完整的几何模型加上物理关系。你可以走进其中,绕到背后,甚至导出至游戏引擎或机器人仿真系统。
这种区别为何重要?因为视频模型解决的是“看什么”,而世界模型解决的是“能做什么”。游戏需要可探索的关卡、机器人需要可训练的仿真环境、VR需要可沉浸的空间——这些都不是一段视频所能提供的。
要做到这些,AI必须理解物体能做什么。一张椅子不仅是椅子,是可以坐的东西;一扇门不仅是形状,是可以推开的入口。如果AI不能理解这些,就无法真正进入世界,更无法在其中行动。
这个环境是如何构建的?1月21日上线的World API将李飞飞对世界的定义转化为可调用的产品。从这一API的设计中,可以窥见两个技术判断:
1、多模态输入:用多种信息源还原空间
World API支持文本、图片、视频、全景图作为输入。你可以给它一句话,也可以给它一段视频或几张全景照片,AI会从这些信息中拼出一个3D空间。为什么不像ChatGPT那样只用文本?因为真实世界的信息是多维度的。
2、语义可编辑:AI要懂人话,不只是懂数字
例如:“在客厅中央放一张沉重的沙发”。这里的“沉重”、“中央”不是精确坐标,但人能懂,AI也必须能懂。World API的处理方式是保留这些模糊性,直接读懂语义。
产品能力已清晰展现,但更关键的问题是:这个市场有多大?
1、三类核心场景
游戏开发最直接。传统3D建模耗时数月,而World API可以在几分钟内生成可用关卡。
机器人训练依赖仿真环境。现有的做法成本高、周期长。如果能从一段真实环境的视频直接生成可训练的3D仿真空间,机器人将更快地走向现实世界。
VR和AR需要大量3D内容。但大多数创作者不会使用Blender或Maya。World API降低了制作门槛。
2、不同的赛道
World Labs与OpenAI、Google的重点不同。OpenAI当前主攻对话和通用Agent;Google的Genie 3主要用于游戏开发和agent训练;而World Labs做的是可编程空间的基础设施。
OpenAI用对话框让AI接近语言,而李飞飞让AI进入空间。对话框生成的是内容,而World API生成的是可交互的环境。她给底层模型取名Marble(大理石),工具叫Chisel(凿子)。隐喻很清楚:世界等待被雕刻,工具已经给你,剩下的看你怎么用。
World API已经上线,代码已经开放。接下来,就看开发者用它造出什么世界。
本文由主机测评网于2026-06-16发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647829.html