-
日期: 2026-07-20 | 來源: 智能車參考 | 有0人參與評論 | 字體: 小 中 大
其中最核心是中期訓練,解決了壹個根本問題:人手抓杯子的方式和機械手抓杯子的方式不壹樣,策略不壹樣,受力反饋也不壹樣。如果直接拿人類視頻訓練出來的模型去操控機器人,它不知道怎麼把“看來的”轉化成“做出來的”。
中期訓練就是用100小時的遙操作數據,把這道鴻溝填上。它不是讓模型死磕某壹個具體任務,而是讓模型接觸207種物體和22種動作基元的組合,理解“搓”這個動作在不同物體上應該怎麼執行、“捏”這個動作需要多大的力。
這就像壹個人學完游泳理論後,在淺水區把蛙泳、自由泳、仰泳都練了壹遍——不追求速度,只追求“會用”。
有了這個基礎,最後階段只用100條任務演示就能快速適配——因為模型已經知道“手感”是什麼了,只需要知道“用在哪兒”。
T-Rex的技術路線清晰指向壹個判斷——視覺和觸覺在靈巧操作中不是主從關系,而是並行關系。
它用壹個異步架構解決了頻率不匹配的底層矛盾,用壹套時序編碼把漂移的傳感器信號變成了可解釋的離散詞匯,用壹組基元組合的覆蓋策略替代了特定任務的深度堆疊。
這叁件事單看都不是“發明新數學”,但組合在壹起,為靈巧手的觸覺利用提供了壹套可復用的系統方案。
靈巧手,存在壹個“第壹性原理”嗎?
靈巧手賽道眼下最熱鬧的爭論,集中在兩個地方:關節運動形式和自由度數量。
腱繩還是連杆?絲杠還是齒輪?11個自由度夠用還是得幹到27個?不同廠商各執壹詞,技術路線遠未收斂。
這些爭論當然都有意義——傳動方案決定成本、可靠性和使用壽命,自由度決定靈巧程度的上限——但學術前沿的核心關注,不在這些問題中的任何壹個上面。
因為壹個更深層的問題很少被討論:有了這些硬件,算法能不能用好?
傳統大模型范式幾乎以視覺數據為主,沒有針對觸覺模態的有效利用方案。T-Rex論文裡那個17%掉到6%的實驗,恰好說明了這壹點——不是觸覺沒用,是現有多模態大模型架構消化不了觸覺。
T-Rex團隊的探索最大價值可能在這裡: 跳出硬件參數的爭論,回到壹個更根本的問題——靈巧手做精細操作,到底需要什麼數據?
關節形式和自由度數量解決的是“能不能動”的問題,觸覺數據解決的是“能不能感知和反應”的問題,由此衍生出需要什麼樣的觸覺數據這個體系化問題,並給出了壹個能泛化的方案。
當然,T-Rex這項研究得以完成,壹個關鍵前提是Sharpa Wave提供的硬件基礎——22個自由度、180Hz高頻觸覺信號、穩定的傳感器輸出。
靈巧手的硬件天花板頂高了,T-Rex才得以在算法層面去夠這個上限。
反過來,T-Rex的算法探索也給硬件提出了新要求:手掌區域需要觸覺感知,不同傳感器的數據格式需要統壹。
T-Rex的軟件、SHARPA的硬件探索方向,後續可能會給這個細分領域帶來更深刻的變化。
首先靈巧手可能從具身智能本體中分化出來,成為壹個獨立賽道——占整機成本15%到20%,經濟上可行,技術上門檻也足夠高。
- 新聞來源於其它媒體,內容不代表本站立場!
-
原文鏈接
原文鏈接:
目前還沒有人發表評論, 大家都在期待您的高見