-
日期: 2026-07-20 | 来源: 智能车参考 | 有0人参与评论 | 字体: 小 中 大
为什么是第4步?作者团队通过实验对比发现太早切,Action Expert去噪步数太少,继承不了大规模人类视频预训练获得的先验知识;太晚切,动作分布已经定型,触觉信号进来也来不及修正了。
第4步刚好处在“该有的形状都有了,但细节还能改”的黄金位置。
这就像写文章:主编(Action Expert)定好大框架后就去忙别的了,四个编辑(Tactile Expert)在不同的节点上轮番检查细节,不需要主编每次都回来重看一遍全文。
触觉信号怎么编码是另一个关键设计。
触觉传感器有零点漂移和高频噪声,直接拿原始电压值喂给模型,模型很可能把传感器噪声当成接触特征学进去。
T-Rex用VQ-VAE把过去16帧(约0.5秒)的力历史压缩成64个离散码字。不同接触状态——按压、插入、滑动——会被自动聚类到不同的码字上。
这样一来,传感器漂移被过滤掉了,触觉信号还变得可解释——你能看到模型“理解”了什么类型的接触。
两个工程细节,第一个:让码本“活起来”。 VQ-VAE码本,理训练时经常出现“码本坍塌”——大部分抽屉空着,少数几个塞满各种杂乱状态。T-Rex的做法是定期检查哪些抽屉闲置,主动塞点数据进去“激活”它,确保所有码字都被利用起来。
第二个,给“有手感”的时刻更高权重。 避免模型化90%的精力去学好“零接触”这个最容易学的状态,而忽略真正有价值的接触瞬间。T-Rex给高力帧更高的学习权重,让模型把算力集中在关键接触点上。
论文正文不会写、但做灵巧手工程化的人一看就懂。
最后是训练策略。
T-Rex采用三阶段训练:
先在大规模人类视频上预训练(22,889小时),让模型看懂“人是怎么动的”;
再用100小时遥操作数据做中期训练,覆盖207种物体和22种动作基元——目的是把人类视频里的运动知识迁移到机器人本体上,而不是死磕某个具体任务。
最后用约100条任务演示做后训练,快速适配特定需求。
- 新闻来源于其它媒体,内容不代表本站立场!
-
原文链接
原文链接:
目前还没有人发表评论, 大家都在期待您的高见