对话纬钛机器人CEO李瑞:具身智能仅靠视觉容易到天花板,触觉是未来必选项
📌 概要
上触觉已经不是一个「yes or no」的问题,而是「when」的问题。 作者丨 向 欣 编辑丨 高景辉 雷峰网:瑞典科学家做过一个经典的实验:给受试者的手指尖注射麻醉剂,
⚡ 关键要点
- ▸上触觉已经不是一个「yes or no」的问题,而是「when」的问题。 作者丨 向 欣 编辑丨 高
上触觉已经不是一个「yes or no」的问题,而是「when」的问题。 作者丨向 欣
编辑丨高景辉
雷峰网:瑞典科学家做过一个经典的实验:给受试者的手指尖注射麻醉剂,让他去完成一个再简单不过的动作:从火柴盒里取出一根火柴,然后划亮它。
正常情况下,这个动作几秒钟就能完成。但在手指失去触觉后,受试者的整个动作变得像提线木偶一样笨拙,取火柴时反复调整却拿不稳,划火柴时用力不均、方向歪斜,花了很长时间才勉强完成。
「这就是现在整个具身智能的现状。」纬钛机器人 CEO 李瑞说。
所谓现状是,当下的具身智能拥有越来越聪明的「大脑」和越来越灵活的「肢体」,但唯独缺了触觉反馈,就像手指打了麻醉剂的人,能看见、能动作,却很难做好需要精细感知的操作。
要改变这种状况,关键在于让机器人拥有「接触智能」:让机器人以接近人类的方式理解「接触」的本质,不仅能感知物体的存在,更能根据接触反馈实时调整动作、控制力度并稳定执行。
在李瑞看来,具身智能仅靠视觉很容易到达天花板,下一步必须加上触觉。在人能做的 90% 以上的任务中,都需要触觉参与。上触觉已经不是一个「yes or no」的问题,而是「when」的问题。
这一点与黄仁勋的判断一致。黄仁勋今年开始多次强调,触觉是机器人进入物理世界的最后一块拼图。
而李瑞本人,正是这块拼图关键的参与者,也是视触觉这个技术路线最早的缔造者之一。2011 年,他在 MIT 读博期间与导师共同开创了机器人视触觉传感器这一领域,2014 年做出了全球第一款分辨率超越人类手指的视触觉传感器。在这个领域深耕十几年后,他于 2024 年创立纬钛机器人,聚焦视触觉传感器和灵巧操作,也成为小米的合作方。
不少从业者的共识是,触觉传感器正处在爆发前夜。李瑞判断,上半年是触觉传感器在灵巧手领域规模化落地的起步期,下半年,随着搭载触觉的灵巧手批量出货,数采设备铺开,触觉传感器就会进入实质性爆发阶段。
纬钛的定位是「触觉领域的英伟达」,不只是一颗传感器,而是涵盖传感器、数采设备、VTLA 大模型和世界模型的物理AI基础设施。「这个领域是我们开创的,也是我们在引领的。」
「最后一块拼图」正在从论文里的概念变成灵巧手上的零件。这块拼图怎么拼、拼到了哪一步?在众多触觉传感器的技术路线中,视触觉的技术壁垒究竟有多深?带着这些问题,我们和李瑞聊了聊。

01
仅靠视觉,就像手部打了麻醉剂
▎AI 科技评论:产业界对触觉的追捧是今年才开始的,而你在这个领域已经做了十几年。当时为什么会选择研究触觉?
李瑞:我从 2005 年本科时就开始做机器人和计算机视觉,在做很多操作时就发现仅仅依靠视觉远远不够。我喜欢从第一性原理去思考,人在做很多操作时需要手眼协同。要真正实现「心灵手巧」,「心灵」代表聪明的大脑,「手巧」不只关乎自由度,更核心的是触觉反馈。但在当时,市面上没有一个好的触觉传感器,有的只能提供单点信息,跟人手差太远了。所以 2011 年我在 MIT 读博时,就开始做视触觉传感器,这个领域是我和当时的导师共同开创的。
现在大家都在说 VLA、说世界模型,说的都只是视觉。但仅仅依靠视觉完全不够,必须把触觉信息结合上去。
▎AI 科技评论:在触觉传感器受到关注之前,业界也有用「力反馈」和电流方案来控制抓取,这些方案不能替代触觉传感器吗?
李瑞:之前大多数方案本质上是位置控制,夹爪盲目地到达一个预设位置,但到达之后操作有没有做好,它其实不知道,没有反馈。电流方案提供的也是非常粗糙的单向力信息,不是触觉。力反馈通常指的是手腕、胳膊这些部位的力,而手指尖上是缺失的。
▎AI 科技评论:那真正的触觉传感器能提供什么信息?
李瑞: 两大类信息。第一类是物体的物理属性,表面纹理、软硬程度、形状大小;第二类是接触的状态,法向力、切向力、滑动等。有了这些反馈,机器人才能知道有没有把物体捏牢、捏准。
▎AI 科技评论:之前特斯拉展示过灵巧手夹鸡蛋,那种程度的操作是否已经用到了触觉?
李瑞:他用了一种触觉传感器,但比较简单,没有切向力。没有切向力意味着夹了鸡蛋之后再去夹其他东西,力不太好自适应。
切向力本质上就是摩擦力。拿一瓶水时,用多大的力能拿起来而不滑动?拿鸡蛋时,多大的力不至于捏碎又拿稳?插拔 USB 时,人是靠摩擦力感知有没有插进去的。没有切向力,这些精巧操作都不好做。我们的视触觉比特斯拉前一代版本有更丰富的信息。
▎AI 科技评论:你 2011 年在 MIT 开创了视触觉这个方向。从那时到现在,这个领域在学术界经历了一个怎样的发展过程?
李瑞:第一个里程碑是 2014 年,我们把全球第一款超高分辨率视触觉传感器 GelSight 指尖传感器推向市场,分辨率超过人类手指。到 2019 年前后,视触觉引爆了整个学术圈。原因是 2012 年深度学习起来后,大家主要聚焦在视觉上,但到 2019 年发现视觉到了一个瓶颈,很多人开始转向视触觉。
那时候我们在行业里已积累多年,迄今实验室拿了非常多最佳论文奖,发表了 100 多篇论文。所以成立公司不是从零开始,前面有十几年的基础,可以快速进行产品化和迭代。
▎AI 科技评论:学术界认可视触觉后,它在产业端的渗透经历了怎样的变化?
李瑞:从 2024 年到现在经历了三个阶段。2024 年 8 月之前,大部分灵巧手公司都没有上触觉。那年 8 月的世界机器人大会上,有两家上了,强脑科技和因时机器人,当时先用的是电容方案。但经过一年,他们开始寻找其他方案。某头部灵巧手公司从去年下半年就跟我们合作,今年 4 月发布的第三代灵巧手,用的就是我们的触觉传感器,已经批量使用。另外还有多家头部灵巧手公司也在跟我们合作。
▎AI 科技评论:他们当时为什么从电容方案转向视触觉?核心差距在哪?
李瑞:传统触觉传感器分辨率不够高,每平方厘米可能只有几十个点,而我们可以达到几万个到几十万个点。压阻、电容、霍尔这些阵列式传感器,需要铺很多点,每一个都要做得很小,但物理结构决定了密度上不去。分辨率高了以后,对很多操作来说能提供非常丰富的信息。还有一点很关键,切向力对于灵巧操作非常重要,视触觉可以提供非常灵敏的切向力,而传统阵列式的传感器通常只有法向力,难以提供切向力,比如摩擦力就是一种切向力,对于抓取和插拔类的任务非常关键,可以帮助快速闭环。我现在看到的是行业正在向视触觉收敛,对很多头部灵巧手公司来说,上不上触觉已经不是「yes or no」的问题,而是「when」的问题。

02
摄像头分辨率,就是触觉分辨率
▎AI 科技评论:视触觉为什么能突破传统阵列式传感器的密度限制?
李瑞:视触觉的技术是从人的手指得到灵感的,手指接触物体时发生形变,通过神经末梢传递信号。我们用弹性体模拟皮肤,发生形变后由后面的微型摄像头捕捉形变,再通过算法算出触觉信息,包括法向力和切向力。
关键是,摄像头有多高分辨率,触觉传感器就可以有多高分辨率。我们巧妙地把触觉信息转化为图像信息,再反推触觉信息,所以叫「基于视觉的触觉传感器」,简称视触觉。
▎AI 科技评论:也就是说,触觉信息点的密度本质上取决于摄像头分辨率,而不是传感器阵列的数量?
李瑞:对。比如说 640×480 就有 30 万个像素点,每一个对应一个触觉信息点。如果这块传感器面积是 3 平方厘米,每平方厘米就是10万个信息点。
▎AI 科技评论:除了力和形变信息,视触觉传感器还能采集哪些维度的数据?
李瑞:触觉信息以图像形式呈现,包括法向力、切向力滑动信息等,分辨率非常高。识别不同材质,也是因为分辨率高,弹性体能捕捉到非常丰富的表面信息。另外还有物体在手中的位姿信息。这些信息可以用来进行精准回放,适配不同的机器人。
▎AI 科技评论:相比压阻、电容、霍尔这些传统路线,视触觉的整体技术优势体现在哪里?
李瑞:四个优势。第一,超高分辨率,视触觉的分辨率可以达到传统触觉传感器的成千上万倍。第二,多维力探