还记得那个身穿Lululemon紧身衣、以温柔陪伴为特色的人形机器人NEO吗?
上次提及它时,人们还在调侃其远程操控的隐私安全问题,甚至戏称每个机器人背后可能都坐着一位印度小哥。
昨天,1X公司带着它的全新大脑——1X World Model亮相了。这次,NEO似乎准备解放背后的操作员。
简而言之,现在的NEO不再只是死记硬背动作,它学会了像人类一样“想象”。通过观看来自网络的海量视频和人类的第一视角操作录像,它理解了物理世界的运作方式:物体掉落会向下,门是可以推开的。
他们把类似Sora的视频生成技术装进了NEO的头脑里。接到指令时,它会先在脑海中生成一段“自己成功完成任务”的视频,然后倒推身体该如何动,将这段想象变成现实。
然而,官方博客也提到,有时会出现“脑子学会了,手没学会”的情况:脑补出的视频很完美,但实际动作可能会落空。
那么这次究竟是“瑜伽服”下的真功夫,还是只存在于Demo里的“剪辑魔法”呢?不管技术是否落地,热度已经爆棚了。到截稿时,官方推文的浏览量已突破500万。
在经历了AI时代各种炫酷Demo的轮番轰炸后,人们还是忍不住想探究:这回,它真的长脑子了吗?
以下是1X技术团队对这颗“新大脑”的硬核拆解:
家庭机器人要真正走进现实环境,必须具备常识性的行为能力以及对物理世界的深刻理解。
当前许多机器人基础模型采用的是VLA范式:在一个预训练的VLM之上增加一个用于预测机器人动作的输出头(例如PI0.6、Helix、Groot N1.5)。VLM能从互联网规模的数据中学到丰富的知识,但其训练目标更侧重于视觉与语义理解,而非对物理动态过程的预测。
因此,即便是对人类而言非常简单的任务,模型也需要数万小时、成本高昂的机器人数据才能学会完成。此外,为了进一步强化模型对物理交互中空间关系的理解,研究者通常还需要引入各种辅助训练目标(如MolmoAct、Gemini-Robotics 1.5)。
在这篇博客中,1X介绍了基于视频预训练的世界模型——1XWM,并将其集成进NEO机器人作为其控制策略。
与VLA模型直接从静态的图像-语言输入中预测动作轨迹不同,世界模型驱动策略是通过文本条件下的视频生成来推导机器人应采取的动作。借助互联网规模视频中蕴含的真实世界动力学规律,该世界模型无需大规模机器人数据预训练,也不依赖任何相关的遥操作演示即可泛化到全新的物体、运动方式和任务场景。
如今,前沿文生视频模型如Veo和Sora已经能够生成逼真的视频内容。然而,这些模型在零样本生成场景下并未与机器人具身形态对齐,因此在控制任务所需的多个关键维度上往往存在不足。
视觉/空间层面:生成的视频是否与机器人的相机内参和自我中心视角一致?是否能准确保留操控任务所需的深度信息以及精确的空间关系?
运动学层面:生成视频中的机器人动作是否在该具身形态下可实现?是否遵循其结构特性、关节极限、速度约束以及执行器能力?
物理层面:生成过程是否避免了物理上不可能的结果(例如物体瞬移),从而保证其能够转化为现实世界中的成功执行?
原始视频能提供看起来会发生什么,但并未给出如何去做。为了将视频知识转化为真正可用于控制的世界模型,1X借助自身的端到端系统架构采用了一种两阶段对齐过程。
世界模型主干:这是一个文本条件扩散模型。先在互联网规模的视频数据上进行预训练,随后在人类第一视角视频数据上进行中期训练,并最终在NEO专属的传感器-运动日志上进行微调。该模型能高保真地预测场景随时间演化的过程。
逆动力学模型(Inverse Dynamics Model, IDM):通过训练IDM将像素空间与执行器控制连接起来,使其能够预测在生成帧之间完成状态转移所需的精确动作序列。同时利用IDM的评估指标和拒绝采样机制对生成结果施加运动学约束。
1XWM的主干模型基于一个140亿参数的生成式视频模型。为了使该模型适配NEO的具身形态,1X还采用了一种多阶段训练策略。
第一视角中期训练:使用900小时的人类第一视角视频数据进行训练。
具身微调:随后使用70小时的机器人数据进行微调。
研究团队进一步评估了1XWM在任务泛化方面的能力。在实验中,搭载1XWM的NEO被用于执行多种超出既有经验的任务。
有时生成的视频是否可能成功一目了然。例如向1XWM模型输入拉取纸巾指令时,有时会生成NEO机器人拿起纸巾盒而不是拉取纸巾的视频。执行这些错误生成的视频时成功率几乎为零。
本文由主机测评网于2026-06-11发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260646882.html