-
_NEWSDATE: 2026-07-20 | News by: 智能车参考 | 有0人参与评论 | _FONTSIZE: _FONT_SMALL _FONT_MEDIUM _FONT_LARGE
嚯!这阵容,谁组的局?

李飞飞,ImageNet奠基人,美国三院院士;
Trevor Darrell,伯克利BAIR联合创始人,他的Caffe深度学习框架曾是计算机视觉领域最广泛使用的平台之一;
Jitendra Malik,R-CNN的核心贡献者之一,深刻影响了计算机视觉的发展轨迹,同样美国三院院士;
Pieter Abbeel,深度强化学习先驱,伯克利机器人学习实验室主任、BAIR实验室联合主任。ACM计算奖得主;
Ken Goldberg,机器人学泰斗,30年前就深耕机器人抓取和自动化,IEEE会士;
Jim Fan,英伟达GEAR实验室掌舵者,具身智能领域最受瞩目的年轻学者之一。
……..
具身智能学术圈,可能是第一次迎来如此全明星阵营。
有模型的、算力的、本体的、数据的等等…..在各自细分赛道上如雷贯耳的big name们,齐聚具身智能,但关注点嘛~一下就让人好奇起来:
不是当下大热的机器人通用大脑,而是——灵巧手。
T-Rex从何而起,要解决什么问题?
自动驾驶靠纯视觉,是有可能解决问题的,但机器人,尤其是灵巧手却很难。
这是一个直观且浅显的事实:
手指、手掌进行精密复杂操作时,很难只用摄像头记录运动数据。
360°无死角的视频数据量有多庞大暂且不说,首先机位就没法布置。不同任务类别,很难像自动驾驶那样形成标准化数据集——模型泛化性受限。
自然而然,给模型加入触觉这个数据模态,就成了一石三鸟的方法:感知精度更高、操作更精准细腻,以及可以形成较为标准的数据集。
但反常识的事情出现了:
同样的灵巧手、同样的任务,T-Rex团队把触觉力信号直接拼接到一个预训练好的VLA模型里,想给它“加点手感”——结果任务成功率从17%掉到了6%。
触觉不是想加就能加的,论文把原因拆成了三层。
第一层,数据太贵。
现有的大规模机器人数据集主要面向平行夹爪——两根手指一捏一放,遥操作门槛低。但灵巧手有22个自由度,操作员要戴数据手套,每一个手势都要精确映射到机械手上,还要保证视觉、触觉、关节状态严格对齐,目前灵巧手遥操作成本是平行夹爪的5到10倍。- 新闻来源于其它媒体,内容不代表本站立场!
-
原文链接
原文链接:
目前还没有人发表评论, 大家都在期待您的高见