当前位置:首页 > 科技资讯 > 正文

具身智能:从“天才儿童”到“可靠工匠”

在英特尔研究院副总裁宋继强看来,具身智能要真正走进工厂、走进家庭,必须跨越“可靠性”这一巨大障碍——而方法,则是为机器人安装三套系统。

1月20日,宋继强接受了包括凤凰网在内的媒体采访,谈及了具身智能面临的挑战和解决方案。

“当前的具身智能机器人,就像一个‘天才儿童’:在理想状态下表现出色,但遇到意外情况就可能手足无措。”宋继强如此描述当前行业面临的共同挑战。

在他身后的屏幕上,展示了一个三层架构的系统框图——这正是英特尔为应对上述挑战提出的“三重系统”方案。

随着ChatGPT掀起的大模型浪潮逐渐渗透到物理世界,具身智能(Embodied AI)已成为全球科技竞赛的焦点。从特斯拉的Optimus到小鹏汽车的Iron,机器人正被赋予前所未有的理解和决策能力。

具身智能:从“天才儿童”到“可靠工匠” 具身智能 可靠性 三重系统 挑战 第1张

然而,从演示视频走向真实场景,一道关乎“可靠性”的鸿沟横亘在眼前。宋继强指出,当前基于视觉语言模型(VLA)的机器人,其动作生成的准确率“大概在百分之六七十左右”,幻觉、环境适应性差、长任务规划能力弱等问题仍未解决。

“如果我们希望它在3年左右实现真正落地,且不出现因安全问题导致的重大事故,就需要尽早建立相关框架,凝聚行业共识。”宋继强说。

系统架构:为机器人装上“三重保险”

宋继强阐述了一套可信赖的具身智能系统应由三个层次构成:主系统(Primary System)、安全系统(Safety System)和后备系统(Fallback System)。

主系统承载了机器人的“智能”,负责决策、规划与行动生成。英特尔力推的“神经符号AI”方法是其核心,旨在结合神经网络的泛化能力与符号逻辑的可靠性与可解释性。

“它既运用了神经网络的泛化能力,避免机器人局限于单一场景和单一方案,又能将传统基于符号、规则与知识的方法融合进来。”宋继强解释,这相当于“抬高机器人的下限”,确保其不会因幻觉等问题产生灾难性后果。

然而,现实世界充满意外。执行器故障、传感器错误、未知障碍物、地面打滑……这些都在主系统的认知边界之外。为此,需要引入更底层的保障。

安全系统是一个轻量、高可靠的监控层,持续比对机器人的执行状态与预设安全规则(如“不得碰撞人类”、“持尖锐物体需保持安全距离”),一旦发现偏离即刻告警或干预。

若安全系统也无法处理,例如机器人即将摔倒,后备系统将被激活。它的目标不是让机器人“急停”,而是引导其进入一个可靠的降级状态。

“例如,机器人可以像汽车一样慢速靠边停靠;若即将摔倒,可选择无人区域,通过锁定部分关节实现缓慢摔倒。”宋继强说。

这套“PMDF”框架(分别是具身智能主控系统、监控系统、安全决策和故障处理和恢复),已被写入英特尔联合多家合作伙伴发布的《具身机器人智能安全子系统白皮书》中。宋继强透露,发布后反响良好,不少学术界和业界单位希望参与推进。

专用芯片未至,英特尔押注“传统优势”

当话题转向硬件时,凤凰网科技提出了一个问题:未来机器人领域会否出现专用芯片?面对特斯拉、小鹏等车企自研芯片的趋势,英特尔的机会何在?

宋继强的回答坦诚而务实。他明确判断,目前机器人市场规模尚小,专用芯片在经济上不可行。“核心原因在于机器人市场的规模目前还很小,对于芯片厂商而言,专门为机器人定制芯片难以实现盈利。”

当前行业普遍复用手机、汽车、PC等领域的成熟芯片,进行改造适配。更深层的原因在于,机器人的“工作负载”尚未定型。“我们无法明确,芯片是应针对VLA的工作负载进行优化,还是为后续的世界模型工作负载提供支持。”

在这种情况下,通用芯片是更稳妥的选择。宋继强预计,只有当行业形成标准化的工作负载后,专用芯片(ASIC)才会出现,其研发周期可能在10-18个月。

那么,英特尔的机会在哪里?宋继强将答案指向了英特尔在工业控制领域长期被忽略的“隐形冠军”地位。

具身智能:从“天才儿童”到“可靠工匠” 具身智能 可靠性 三重系统 挑战 第2张

“在传统工业自动化领域,英特尔的市场地位可以用‘绝对优势’来形容……在工业场景的高精度、高频率运动控制领域,大部分工控产品和工控板都基于英特尔的CPU开发。”

他总结了三大优势:一是技术迁移,将工业运动控制经验迁移至机器人的动作控制层;二是资源调度优化,确保运动控制等毫秒级任务不被其他任务干扰;三是多系统融合能力,实现隔离监控与快速安全响应。

“对于当下炙手可热的酷睿Ultra等集成AI算力的芯片,宋继强视其为‘稳定的硬件底座’。若算力不足,可额外配置AI算力卡。他预判未来的主流部署模式将是‘机器人终端+边缘服务器’,在低延迟前提下将大模型部署于边缘形成跨网络的异构计算资源池。”

现实瓶颈:数据孤岛、VLA幻觉与成本悬崖

尽管蓝图清晰但通向可靠具身智能的道路上布满荆棘。宋继强在回答多个问题时勾勒出了当前最主要的几大瓶颈。

首当其冲的是VLA(视觉语言模型)的能力天花板。宋继强直言当前VLA的准确率仅在百分之六七十存在显著幻觉问题且对视觉环境变化敏感泛化能力弱。“它并未真正理解场景的本质不具备对场景中物体三维关系因果关系的认知能力。”

这也是行业转而关注“世界模型”的原因——为其补充物理定律和因果关系认知。但世界模型自身也面临与真实场景融合的挑战。

更深层更根本的挑战来自于数据。宋继强指出数据问题是行业核心痛点。具身智能需要场景理解任务规划和机器人本体三类数据但现状是“数据孤岛”严重。

“不同行业场景不同机器人本体不同任务类型所需的数据差异极大。”他列举了四个统一数据标准建立的难点:数据完整性定义不明(是否需要触觉等);操作精度和频率无统一要求;机器人本体无公认最优方案;数据采集视角未确定。

“因此当前行业仍处于各自探索的阶段短期内会维持‘百花齐放’的状态。”

最后一个关卡是量产与成本。宋继强提醒目前展会上的机器人多是“手工制作的原型机”零部件未达到车规级或工业级标准一致性差。“机器人整体价格的下降也依赖于大厂的入局。”

未来三年:从“展示天才”到“可靠工匠”

“要将这些能力整合为一套可靠的解决方案把VLA的准确率从目前的百分之六七十提升到工业级应用要求的99%以上预计还需要两三年的时间。”宋继强给出了一个审慎的预测。