当前位置:首页 > 科技资讯 > 正文

物理AI的新篇章:Lyte打造端到端感知系统

在最近一年内,“物理AI”作为AI领域的下一个主要发展方向,已经逐渐获得了行业的广泛认可。此前,我们认为“物理AI”面临具身智能数据缺乏,以及世界模型不成熟等挑战。尽管在相对成熟的感知层面,这些挑战也远未得到解决。

过去,感知能力常被视作一个组件问题,而非一个系统性问题。硬件团队花费数年时间从零开始构建感知技术栈,包括从多家供应商采购传感器、校准系统、调试同步问题等,这些工作无异于重复造轮子。

其实,系统化的感知能力早已在消费电子领域被攻克,并被广泛应用。例如微软的Kinect和苹果的FaceID。现在,这两项技术的缔造者组成了一个团队,创立了创业公司Lyte。

他们将先进的4D传感、RGB成像和运动感知能力集成到单一平台中,仅通过一个连接即可提供统一的空间与视觉数据,使“眼睛”与“大脑”直接对话,构建行业所缺乏的感知基础设施。

近日,Lyte宣布完成了1.07亿美元的早期融资,由Avigdor Willenz、Fidelity、Atreides Management、Exor Ventures、Key1 Capital和Venture Tech Alliance等多家投资机构参与。

微软Kinect和苹果FaceID的缔造者,为AI打造端到端的感知系统

Lyte由苹果深度传感和感知技术的关键架构师Alexander Shpunt(CEO)、Arman Hajati和Yuval Gerson共同创立。

物理AI的新篇章:Lyte打造端到端感知系统 物理AI Lyte 感知系统 端到端 第1张

Alexander Shpunt曾联合创立3D传感公司PrimeSense并担任其首席技术官。从2005年开始,他就致力于研究如何教会机器感知深度,让机器像人类一样感知空间——看到的不仅是扁平的像素,还有维度、距离以及三维空间中物体间的关系。

为此,他和团队创造了“光编码技术”:红外投影仪将不可见的点阵投射在整个场景上;摄像头负责读取这些点阵在不同距离上如何扭曲,并通过三角定位法将其转换成实时深度图。五年后,这项技术催生了革命性的体感设备——微软Kinect,在六十天内售出了八百万台。

2013年,他的公司被苹果收购,他和团队成员进入苹果,将这个核心技术继续演进。2017年,苹果FaceID面世,如今已应用于数十亿台设备中。

在2021年,Alexander Shpunt预见到“物理AI”的早期趋势:AI不仅要阅读文本和识别图像,还要在仓库中导航、操作机械、与行人和车辆共享道路——AI正走向实体化,融入现实世界。

但风险也随之而来。相比在智能手机上偶尔的不稳定,当感知技术用在仓库或开放道路上时,出现错误的后果将是灾难性的。

Alexander Shpunt认为,“物理AI”能否顺利发展,一个重要的因素是能否对物理世界的可靠理解。机器人必须能够在复杂、动态的环境中安全运行,而不仅仅是在受控的环境中。

他以自己在苹果的团队为基础再次出发,这个团队横跨传感、芯片和实体AI领域。除了Alexander Shpunt外,Arman Hajati(CTO)曾主导了多代iPhone和Apple Watch的Taptic Engine架构设计;Yuval Gerson(工程副总裁)专注于复杂的机械和微机电系统(MEMS);Reza Nasiri Mahalati(硬件负责人)对于先进传感模块在硬件、软件和算法层面的集成工作有丰富经验。

补上结构光缺失的第四维度:速度

据Grand View Research预测,到2030年,AI机器人市场规模将达到1250亿美元。然而,麦肯锡的数据显示,超过60%的工业企业缺乏自主实施机器人自动化的内部能力,包括传感器集成能力。

企业的传统解决方式是从多家供应商处拼凑感知系统,然后花费数月时间校准传感器、编写融合软件并调试集成故障。

Lyte致力于解决这一结构性问题。他们以垂直整合技术栈的思路,将传感硬件、定制芯片和感知软件统一整合到单一平台中,为自主机器提供在现实世界中运行所需的清晰而可靠的感知层。

结构光(光编码更通用的名称)是一种重要的感知技术,成功应用于室内空间和人脸识别。但结构光有其局限:它只在近距离有效,且只能捕捉物体身在何处,而非去向何方。

对于在世界中移动的机器而言,这还远远不够。一台在仓库中导航的机器人不仅需要知道叉车在哪里,还需要知道叉车正以每秒四米的速度向它驶来。一个在人行道上行驶的配送机器人不仅需要看见孩子,还需要看见孩子正在奔跑。

传统传感器捕捉的是位置。为了理解运动,软件需要比较不同的帧画面:此刻的位置与前一刻的位置。这会引入延迟。在一个动态的世界里运行,延迟是风险的根源。

Lyte团队此前开发的体感设备不仅能看到人们的身体位置,还能追踪他们的运动方式。面部识别技术也不仅是绘制人们的面容,更能确认这张脸是活生生的、在场的、真实的。这两项技术都能理解动态演进的场景而非静止的瞬间。

现在,Lyte团队将同样的能力应用于更远的距离、更快的速度以及在开放空间中运行的机器。

他们开发了一个新的核心技术——“相干视觉”。这项技术在运用光时不再是投射图案并读取扭曲,而是发射连续信号并测量其返回信号。位置与速度在同一瞬间被同时捕捉无需事后计算此能力内建于测量本身。

LyteVision:让机器的“眼睛”与“大脑”直接对话

基于这个核心技术Lyte团队打造了LyteGalaxy这个统一的空间智能平台它集传感器、计算单元、软件与算法于一体为机器人构筑起一个完整统一的感知技术栈。

物理AI的新篇章:Lyte打造端到端感知系统 物理AI Lyte 感知系统 端到端 第2张

而在感知方面他们的核心硬件产品是LyteVision这是一个端到端的感知系统它在2026年CES上荣获机器人技术“最佳创新奖”。这个新产品将先进的4D传感、RGB成像和运动感知能力集成到单一平台中通过一个连接即可提供统一的空间与视觉数据。

它不仅统一了传感器还统一了从感知到智能的整条路径:传感器与芯片融合芯片为软件定制软件为AI计算而生。从光子触及传感器到决策返回至机器的完整技术栈——单一架构无缝衔接。

“物理AI”还在早期机会还有很多

随着技术进步AI进入越来越多的场景随着物理AI的崛起AI对感知的需求从静止化、单一化向通用化、实时化发展。

以往AI只需要识别出一个静态的人脸现在它要在开放而复杂的物理环境中自由行进随时都可能有训练数据之外的“意外”发生。

Lyte团队从2005年开始就涉足机器的“感知”他们沿着这个方向前进面对“物理AI”的新趋势和新需求创造出新的技术解决方案。

端到端是感知系统的下一个趋势特斯拉就是很好的例子。它没有复杂的雷达和摄像头结合的硬件系统采用了纯摄像头方案前端的摄像头收集的巨量数据与后端的深度学习模型相结合形成了数据飞轮就能在不增加硬件复杂性的前提下越来越强。

Lyte的产品也是端到端的它通过软硬件结合的垂直整合技术将感知系统的复杂性(硬件+软件)内化了提供给客户的是一个简单的产品。而且这个产品足够通用能够适应客户的各种硬件形态和应用场景。

“物理AI”目前还很早期我们在此前的文章里总结过它有赋能智能硬件的AI操作系统掣肘世界模型发展的具身智能数据以及“世界模型”不完善等缺项;但是用更细的眼光去看行业缺项其实并不止这三大项例如我们以为已经成熟的感知就有Lyte来进行革新。