当前位置:首页 > 科技资讯 > 正文

英伟达3D通才模型:AI动手构建物理世界

英伟达的AI革命:从虚拟到物理世界的桥梁

在AI技术的浪潮中,英伟达始终站在前沿。从Sora的梦幻视频到如今的3D通才模型,AI不再局限于“看和说”,而是真正开始“动手”构建3D世界,开启了机器人时代的无限可能。

黄仁勋的预言正在逐步成真。AI不仅需要理解视觉和语言,更要掌握物理世界的法则。现在,英伟达通过其3D通才模型,让AI从“生成画面”升级为“生成可行动的3D世界”,不仅能描述世界,还能一步步搭建、修改这个世界。

从Sora视频到物理AI

时间回溯到2024年2月,OpenAI发布的Sora视频震惊世界。人们高呼“现实不存在了”,但黄仁勋始终保持冷静,不断强调“Physical AI”的重要性。他预见AI必须理解并遵守物理世界的规则,而不仅仅是生成美丽的画面。

英伟达3D通才模型:AI动手构建物理世界 英伟达 3D通才模型 物理AI 具身智能 第1张

如今,英伟达的新模型3D通才正是这一理念的实践。它不仅能让AI生成逼真的3D世界,更重要的是,这些世界遵循物理法则,可以“动手”交互。

3D通才模型:从文本到3D世界的桥梁

这篇论文由英伟达和斯坦福大学合作,正式发表在今年第十三届国际三维视觉会议上。论文标题为《3D Generalist:Vision-Language-Action Models for Crafting 3D Worlds》。

英伟达3D通才模型:AI动手构建物理世界 英伟达 3D通才模型 物理AI 具身智能 第2张

该模型的核心在于“Action”,即让AI通过动作来构建和修改3D世界。过去,AI主要扮演“观察者”和“梦想家”的角色,而现在,它已经成为“全能手”。

英伟达3D通才模型:AI动手构建物理世界 英伟达 3D通才模型 物理AI 具身智能 第3张

通过这个模型,用户只需输入一句话,就能输出包含完整3D布局的房屋,包括材料、固定装置、3D资产以及照明配置。背后的理念是,构建一个既详细又与文本描述相符的3D环境,应该被视为一个过程,需要依次做出决策。

物理AI的ChatGPT时刻已开启

黄仁勋的野心远不止于游戏和视觉特效。他更致力于解决“智能”算力问题。这次发表的论文,其实是英伟达宏大的“具身智能”版图的一部分。

老黄早已押注机器人市场,认为那是一个数万亿美元的机遇。而新模型“3D通才”正是为了这个市场而生。有了这个技术,英伟达可以瞬间生成数百万个包含不同物理变量的“虚拟平行宇宙”,让机器人在虚拟世界里进行无数次的训练,从而掌握在现实世界中应用的本领。

英伟达3D通才模型:AI动手构建物理世界 英伟达 3D通才模型 物理AI 具身智能 第4张

这才是“物理AI”的终极目标:打通Sim-to-Real(从模拟到现实)的最后一公里。黄仁勋构建的不仅仅是一个生成的引擎,它是硅基生命诞生的子宫。

未来展望:所有移动之物,终将自主

当AI不仅掌握了人类的语言、视觉,现在还掌握了构建物理世界的法则时,虚拟与现实的界限将不再是泾渭分明的。我们在屏幕里创造的世界,将拥有和现实世界一样的重力、光影和因果律。

在英伟达的Omniverse生态中,研究团队使用Omniverse Replicator实现大规模合成数据生成,并支持域随机化;而Isaac Lab提供可直接使用的具身载体(例如人形机器人),可在这些生成环境中进行机器人仿真。

英伟达3D通才模型:AI动手构建物理世界 英伟达 3D通才模型 物理AI 具身智能 第5张

黄仁勋曾说:“Everything that moves will be autonomous.”(所有移动之物,终将自主。)现在看来,他说的是整个物理世界。