当前位置:首页 > 科技资讯 > 正文

具身智能时代:Skild AI引领物理AI通用化

AI的发展轨迹从专用化起步,逐步迈向通用化,最终在通用基础上深耕最具价值的细分领域。

相较于以往,诸如人脸识别和语音转录等任务需训练专属模型,如今全模态通用模型已能胜任各类复杂任务;进一步在特定领域如医疗、法律、客服等进行针对性后训练,性能尤为突出。

在物理AI领域,以往机器人如工业及清洁设备多局限于特定场景,难以泛化至通用环境,尤其在处理非常规任务时显得捉襟见肘。因此,家用人形机器人的实际应用尚待时日。

尽管如此,已有具身智能公司如Skild AI,正努力推动物理AI步入通用时代。Skild AI打造的“全具身(Omni-bodied)”大脑Skild Brain,旨在适配任何形态的机器人并完成各类任务,赋予其跨任务、跨硬件形态的通用泛化能力。

具身智能时代:Skild AI引领物理AI通用化 具身智能 Skild AI 物理AI 通用性 第1张

来源:Skild AI

Skild AI在2024年收获3亿美元A轮融资后,近期又完成了14亿美元的B轮融资。本轮融资由SoftBank领投,NVentures (NVIDIA)、Macquarie Capital及Jeff Bezos跟投,公司估值攀升至140亿美元以上。

包括Lightspeed、Felicis、Coatue和Sequoia Capital在内的多家顶级VC,以及LG、Schneider、CommonSpirit和Salesforce Ventures等战略投资者纷纷加入。

全具身智能:统一大脑适应任何硬件与任务

Skild AI的两位创始人Deepak Pathak(CEO)和Abhinav Gupta(总裁),在过去十年间引领了机器人领域的重大突破,两人共同拥有超过110,000次的论文引用。

Deepak Pathak现任CMU机器人研究所助理教授(AP),而Abhinav Gupta则是CMU机器人研究所的终身教授及FAIR Robotics的创始成员与研究负责人。

两人相识十年后于2023年携手离开CMU,投身具身智能创业,并组建了一支由Meta、Tesla、NVIDIA、Amazon、Google以及CMU、斯坦福大学和加州大学伯克利分校等高校机器人与AI专家组成的顶尖团队。

具身智能时代:Skild AI引领物理AI通用化 具身智能 Skild AI 物理AI 通用性 第2张

Skild AI核心团队(来源:Skild AI)

上一代机器人公司多采用定制化解决方案,这些方案虽能打造专用机器人,却难以泛化。

Skild AI致力于开发面向现实世界的通用人工智能,其机器人大脑Skild Brain需具备跨任务与跨机器人硬件的泛化能力。

无需预知机器人形态,即可控制任何形态的机器人,涵盖四足、人形、桌面机械臂及移动操作机器人。其应用范围从简单家务(如清洁、洗碗、煎蛋)到高难度挑战(如湿滑地形通过)。

这种跨形态训练不仅解锁海量数据,还显著提升模型应对硬件变更或故障的鲁棒性。

基于视觉的端到端运动控制

构建机器人基础模型的最大挑战在于缺乏大规模机器人数据。更糟的是,通过硬件采集真实世界数据既慢且昂贵。

一些公司基于现有视觉-语言模型(VLM),仅掺入不足1%的真实机器人数据来构建“机器人基础模型”。但这类模型缺乏真实物理世界验证的物理常识,难以适应真实环境。它们虽能完成侧空翻、后空翻等动作,但在攀爬楼梯或应对复杂障碍物时却显得力不从心。

楼梯攀爬需视觉感知与运动控制的精细协同。机器人需精确与楼梯物理结构交互,并动态调整以应对台阶高度与几何形状的差异。

Skild Brain采用分层架构:上层为低频操作与导航策略;下层则为高频响应的底层动作策略。

作为核心驱动力,底层单一神经网络将上层宏观指令实时转化为驱动躯体精确关节角度与电机扭矩。此设计使机器人彻底告别繁琐路径规划、建图或手动模式切换,实现如本能般的无缝流转于平地行走、爬楼梯与越障之间。

本质上,它是完全由在线视觉和本体感觉驱动的端到端运动控制。

现实世界的部署对可靠性要求苛刻。Skild在验证模型时将其带入城市公园、街道等真实环境进行验证。从防火梯攀爬至各类障碍跨越等测试均涵盖其中。

具身智能时代:Skild AI引领物理AI通用化 具身智能 Skild AI 物理AI 通用性 第3张

来源:Skild AI

Skild Brain利用摄像头感知图像对机器人周围场景做出毫秒级动态反应。根据最新观测结果本能地适应新地形。用户(或上层策略部分)仅需给出大致方向,机器人便能自行探索避障路径。面对未知环境无需预设动作即可实时调整落脚点、平衡与时机灵活应对各类障碍。

Skild的数据飞轮

Skild构建了庞大的数据基础设施。Skild Brain从四大来源学习:

  • 预训练阶段: 从大规模仿真数据与互联网视频中学习。通过人类视频学习解决具身基础模型数据规模与多样性不足问题。
  • 后训练阶段: 包括遥操作与真实世界部署两种方法。Skild机器人已广泛应用于安防、建筑等多个领域持续生成数据。

在2025年Skild AI实现规模化营收增长。仅在几个月内营收即增长至3000万美元。然而其终极目标是家庭消费级市场。

跨越通用性鸿沟:物理AI创造的价值将指数级提升

  • 大语言模型: 已跨越通用性鸿沟拥有数亿用户标杆消费级应用(如ChatGPT)并进入各行各业创造价值。
  • 具身模型: 正开始跨越通用性门槛。Skild AI已初步创建能跨机器人形态适应各种任务的具身基础模型。
  • “上下文学习”: 引入物理AI降低各类机器人学习新技能与任务成本并降低进入新应用场景成本。
  • 迭代问题: 无论是具身基础模型还是大语言模型目前仍面临无法自我迭代问题。每次升级均需重新训练模型迭代成本难以降低使得AI商业模式较难成立。
  • 未来展望: 我们期待“物理AI”智能在未来成熟追上大语言模型进度应用范围将大幅拓展创造的价值也将指数级提升。