-
日期: 2026-07-20 | 来源: 智能车参考 | 有0人参与评论 | 字体: 小 中 大
其中最核心是中期训练,解决了一个根本问题:人手抓杯子的方式和机械手抓杯子的方式不一样,策略不一样,受力反馈也不一样。如果直接拿人类视频训练出来的模型去操控机器人,它不知道怎么把“看来的”转化成“做出来的”。
中期训练就是用100小时的遥操作数据,把这道鸿沟填上。它不是让模型死磕某一个具体任务,而是让模型接触207种物体和22种动作基元的组合,理解“搓”这个动作在不同物体上应该怎么执行、“捏”这个动作需要多大的力。
这就像一个人学完游泳理论后,在浅水区把蛙泳、自由泳、仰泳都练了一遍——不追求速度,只追求“会用”。
有了这个基础,最后阶段只用100条任务演示就能快速适配——因为模型已经知道“手感”是什么了,只需要知道“用在哪儿”。
T-Rex的技术路线清晰指向一个判断——视觉和触觉在灵巧操作中不是主从关系,而是并行关系。
它用一个异步架构解决了频率不匹配的底层矛盾,用一套时序编码把漂移的传感器信号变成了可解释的离散词汇,用一组基元组合的覆盖策略替代了特定任务的深度堆叠。
这三件事单看都不是“发明新数学”,但组合在一起,为灵巧手的触觉利用提供了一套可复用的系统方案。
灵巧手,存在一个“第一性原理”吗?
灵巧手赛道眼下最热闹的争论,集中在两个地方:关节运动形式和自由度数量。
腱绳还是连杆?丝杠还是齿轮?11个自由度够用还是得干到27个?不同厂商各执一词,技术路线远未收敛。
这些争论当然都有意义——传动方案决定成本、可靠性和使用寿命,自由度决定灵巧程度的上限——但学术前沿的核心关注,不在这些问题中的任何一个上面。
因为一个更深层的问题很少被讨论:有了这些硬件,算法能不能用好?
传统大模型范式几乎以视觉数据为主,没有针对触觉模态的有效利用方案。T-Rex论文里那个17%掉到6%的实验,恰好说明了这一点——不是触觉没用,是现有多模态大模型架构消化不了触觉。
T-Rex团队的探索最大价值可能在这里: 跳出硬件参数的争论,回到一个更根本的问题——灵巧手做精细操作,到底需要什么数据?
关节形式和自由度数量解决的是“能不能动”的问题,触觉数据解决的是“能不能感知和反应”的问题,由此衍生出需要什么样的触觉数据这个体系化问题,并给出了一个能泛化的方案。
当然,T-Rex这项研究得以完成,一个关键前提是Sharpa Wave提供的硬件基础——22个自由度、180Hz高频触觉信号、稳定的传感器输出。
灵巧手的硬件天花板顶高了,T-Rex才得以在算法层面去够这个上限。
反过来,T-Rex的算法探索也给硬件提出了新要求:手掌区域需要触觉感知,不同传感器的数据格式需要统一。
T-Rex的软件、SHARPA的硬件探索方向,后续可能会给这个细分领域带来更深刻的变化。
首先灵巧手可能从具身智能本体中分化出来,成为一个独立赛道——占整机成本15%到20%,经济上可行,技术上门槛也足够高。
- 新闻来源于其它媒体,内容不代表本站立场!
-
原文链接
原文链接:
目前还没有人发表评论, 大家都在期待您的高见