器人的手,學(xué)會(huì)“看人下菜碟“式的抓取)
你有沒有想過一只機(jī)械手抓杯子和抓一把螺絲刀動(dòng)作應(yīng)該完全不一樣抓杯子你可能會(huì)整只手包裹上去虎口貼著杯壁五指自然收攏這是一種穩(wěn)妥的抱住。但抓螺絲刀準(zhǔn)備擰螺絲你會(huì)用拇指和食指捏住手柄末端其余手指微微翹起這是一種精細(xì)的捏住。同一只手兩種截然不同的抓法背后是完全不同的任務(wù)意圖。現(xiàn)在的問題是現(xiàn)在最先進(jìn)的機(jī)器人抓取算法幾乎完全不懂這個(gè)道理。它們只關(guān)心一件事能不能抓穩(wěn)。給它一個(gè)杯子它大概率會(huì)用五個(gè)手指把杯子整個(gè)包起來因?yàn)檫@樣最穩(wěn)最不容易掉。至于你是想端起來喝水還是想把杯子倒扣過去晾干還是想用手指精確捏住杯耳它一概不管。這就好比你雇了一個(gè)搬家工人他只負(fù)責(zé)把東西從A點(diǎn)搬到B點(diǎn)不摔碎但完全不關(guān)心你搬這個(gè)東西是為了展示還是為了使用。這篇來自法國(guó)原子能委員會(huì)CEA List和巴黎薩克雷大學(xué)團(tuán)隊(duì)的論文就是想解決這個(gè)只管抓穩(wěn)不管抓對(duì)的老問題。他們提出了一個(gè)叫 CoToGrasp 的框架核心目標(biāo)是讓機(jī)械手能按照人類的抓取分類學(xué)精確生成你指定的那種抓法哪怕面對(duì)的是它從沒見過的物體。當(dāng)前抓取算法的審美偏見要理解這篇論文的價(jià)值得先弄明白現(xiàn)在的抓取規(guī)劃器到底出了什么問題。論文里做了一個(gè)挺扎心的實(shí)驗(yàn)。他們讓四種主流的無條件抓取生成方法DFC、GenDexGrasp、DRO-Grasp、GOAG在同一批物體上各生成一百次抓取然后用一套自動(dòng)分類系統(tǒng)去統(tǒng)計(jì)這些抓取到底屬于人類抓取分類學(xué)里的哪一種模式。結(jié)果是災(zāi)難性的偏向。絕大多數(shù)生成的抓取都擠在包裹式的力量抓取這一個(gè)區(qū)域里論文用一張直方圖畫出來紅框圈出的那部分幾乎是一座孤峰剩下二十種精細(xì)抓取模式只能分到零星的幾個(gè)百分點(diǎn)。這四種方法算出來的語(yǔ)義熵用來衡量抓取類型分布是否均衡的指標(biāo)數(shù)值從0到1越接近1說明分布越均勻越接近0說明高度集中在少數(shù)幾種模式上分別只有0.74、0.60、0.65、0.65而CoToGrasp達(dá)到了0.83。這個(gè)數(shù)字差距意味著什么意味著如果你想讓機(jī)器人做一個(gè)精確的兩指捏取動(dòng)作用傳統(tǒng)方法生成一百次可能大部分結(jié)果都是錯(cuò)的類型你得不斷丟棄重來這個(gè)過程極其低效。為什么會(huì)這樣因?yàn)檫@些方法在訓(xùn)練時(shí)優(yōu)化的目標(biāo)函數(shù)里壓根沒有抓取類型這個(gè)變量它們只優(yōu)化物理穩(wěn)定性和力閉合而包裹式的抓取天然最穩(wěn)。這就像你訓(xùn)練一個(gè)學(xué)生只以考試不掛科為目標(biāo)他自然會(huì)去選最容易拿分的題型去練習(xí)久而久之其他題型完全生疏哪怕你后來告訴他這次考試必須做某種特定難度的題他也做不出來。為什么加標(biāo)簽這么難數(shù)據(jù)集的死結(jié)那你可能會(huì)問既然問題這么明顯為什么不干脆給訓(xùn)練數(shù)據(jù)打上這是精細(xì)抓取這是力量抓取的標(biāo)簽讓模型學(xué)著區(qū)分呢這正是論文點(diǎn)出的第二個(gè)核心難題給抓取數(shù)據(jù)打上任務(wù)標(biāo)簽成本高到不現(xiàn)實(shí)。現(xiàn)有的一些方法比如論文中提到的 Dexonomy確實(shí)嘗試過這條路它們用海量的解析計(jì)算構(gòu)建數(shù)據(jù)集把每一種抓取類型和具體物體的網(wǎng)格嚴(yán)格綁定在一起。問題在于這種綁定太死了。如果一個(gè)新物體的局部幾何形狀和預(yù)先算好的關(guān)節(jié)模板對(duì)不上會(huì)發(fā)生什么論文里寫得很直白優(yōu)化直接失敗或者退化成一種功能上完全錯(cuò)誤的抓取類型。這就好比你按照某個(gè)特定尺寸的門把手專門設(shè)計(jì)了一套開門的手部動(dòng)作模板一旦遇到形狀稍微不同的門把手這套動(dòng)作要么根本用不上要么勉強(qiáng)用上了但姿勢(shì)別扭完全失去了原本要達(dá)成的開門效果。物體幾何形狀的多樣性是無窮的你不可能給每一種可能的形狀都算一遍專屬模板這個(gè)數(shù)據(jù)收集的坑本身就填不滿。換個(gè)思路不看物體看手CoToGrasp 的解法說出來其實(shí)挺反直覺的既然物體形狀千變?nèi)f化沒法窮舉那就干脆別在物體身上學(xué)接觸規(guī)律了轉(zhuǎn)而在手上學(xué)。論文提出了一個(gè)概念叫物體無關(guān)訓(xùn)練object-agnostic training意思是整個(gè)模型的訓(xùn)練過程完全不涉及任何具體物體的網(wǎng)格數(shù)據(jù)只用機(jī)械手自身的點(diǎn)云去訓(xùn)練。這背后有一個(gè)很巧妙的邏輯轉(zhuǎn)換。論文指出接觸這件事本質(zhì)上是對(duì)稱的手上某個(gè)點(diǎn)碰到了物體等價(jià)于物體上某個(gè)點(diǎn)碰到了手。傳統(tǒng)方法習(xí)慣站在物體的角度問物體表面哪里可以被摸,這篇論文把提問方式倒過來問這個(gè)物體會(huì)激活手上的哪些區(qū)域。這個(gè)視角反轉(zhuǎn)聽起來只是文字游戲但它帶來了實(shí)實(shí)在在的好處。物體表面是一個(gè)無窮大、無窮多樣的空間理論上世界上物體的形狀組合是無限的。而機(jī)械手的表面結(jié)構(gòu)是固定的它的關(guān)節(jié)數(shù)量、活動(dòng)范圍、幾何形狀都是已知且有限的。把學(xué)習(xí)的對(duì)象從無邊無際的物體空間換成邊界清晰、維度有限的手部空間問題一下子被簡(jiǎn)化了。這就像你要教一個(gè)新員工處理客戶投訴與其試圖窮舉世界上所有可能出現(xiàn)的投訴場(chǎng)景那是永遠(yuǎn)學(xué)不完的不如反過來專注訓(xùn)練他自己能做出的幾種標(biāo)準(zhǔn)應(yīng)對(duì)動(dòng)作模塊比如安撫、道歉、補(bǔ)償、轉(zhuǎn)接。不管客戶投訴的內(nèi)容多么千奇百怪最終都要落到這幾個(gè)動(dòng)作模塊的組合上。手的動(dòng)作能力是有限且固定的學(xué)會(huì)這個(gè)有限集合比試圖預(yù)判所有物體形狀要靠譜得多。一個(gè)統(tǒng)一的練功房特征化的規(guī)范工作空間光是在手上學(xué)這個(gè)思路還不夠因?yàn)橛?xùn)練時(shí)用的是手的點(diǎn)云推理時(shí)面對(duì)的卻是完全陌生的物體點(diǎn)云兩種數(shù)據(jù)的幾何特性天差地別直接拿訓(xùn)練好的模型去處理物體數(shù)據(jù)模型會(huì)一臉懵。為了解決這個(gè)訓(xùn)練和推理階段不認(rèn)識(shí)對(duì)方的問題論文設(shè)計(jì)了一個(gè)叫做特征化規(guī)范工作空間Feature-based Canonical Workspace的中間層。這個(gè)工作空間本質(zhì)上是一組固定分布在機(jī)械手周圍空間里的采樣點(diǎn)不管你輸入的是手還是物體都要先經(jīng)過一個(gè) DGCNN 編碼器一種專門處理點(diǎn)云數(shù)據(jù)的圖卷積神經(jīng)網(wǎng)絡(luò)能夠提取每個(gè)點(diǎn)周圍的局部幾何特征比如曲率、法向量等細(xì)節(jié)提取局部幾何特征然后通過加權(quán)的 k近鄰聚合一種將鄰近點(diǎn)的特征信息匯聚到某個(gè)固定采樣點(diǎn)上的方法距離越近的點(diǎn)權(quán)重越大把這些特征投影到這組固定的工作空間點(diǎn)上。關(guān)鍵是這個(gè)投影過程還引入了一個(gè)叫做對(duì)齊距離aligned distance一種同時(shí)考慮兩點(diǎn)之間歐氏距離和表面法向量對(duì)齊程度的度量方式用來判斷兩個(gè)表面是否可能真實(shí)接觸的度量方式來控制權(quán)重衰減確保只有法向量方向合適、真正可能發(fā)生物理接觸的點(diǎn)才會(huì)被有效聚合進(jìn)來那些法線方向不對(duì)的點(diǎn)即使距離很近權(quán)重也會(huì)被壓低。論文里做了一個(gè)量化驗(yàn)證用余弦相似度衡量手部特征和物體特征在這個(gè)工作空間投影前后的對(duì)齊程度。原始的 DGCNN 特征匹配點(diǎn)對(duì)之間的相似度只有0.35說明手和物體的原始幾何特征差異確實(shí)很大。但投影到規(guī)范工作空間之后這個(gè)相似度跳到了0.61加上后續(xù)的注意力機(jī)制處理進(jìn)一步提升到0.66。這組數(shù)字變化說明這個(gè)練功房式的中間層確實(shí)成功地把兩種截然不同的數(shù)據(jù)源拉到了同一個(gè)可比較的語(yǔ)義空間里。這就好比兩個(gè)說著完全不同方言的人要合作干活你不能指望他們直接聽懂彼此但如果給他們一套統(tǒng)一的手勢(shì)信號(hào)系統(tǒng)無論各自原本說什么方言都通過這套手勢(shì)系統(tǒng)交流合作就順暢了。工作空間起的就是這個(gè)手勢(shì)系統(tǒng)的作用它不關(guān)心你原本是手還是物體只關(guān)心投影后大家都在同一套坐標(biāo)和特征體系里說話。如果沒有這一層轉(zhuǎn)換模型在訓(xùn)練階段學(xué)到的模式和推理階段面對(duì)的數(shù)據(jù)分布之間會(huì)存在巨大鴻溝泛化能力會(huì)大打折扣。給每種抓法一個(gè)官方檔案接觸拓?fù)涞亩x前面說的都是怎么讓手和物體的特征對(duì)齊但還有一個(gè)基礎(chǔ)問題沒解決怎么定義這是哪一種抓法論文采用了 Gonzalez 分類法一套由 Gonzalez 等人在2014年提出的人類抓取分類體系嚴(yán)格根據(jù)手部實(shí)際參與接觸的表面區(qū)域來劃分抓取類型而不是根據(jù)物體形狀一共定義了21種接觸拓?fù)淠0鍙木?xì)的指尖捏取到力量型的整手包裹還有專門針對(duì)工具使用的高度約束型抓法。每一種模板本質(zhì)上是一個(gè)語(yǔ)義掩碼標(biāo)記出手上哪些區(qū)域應(yīng)該在這種抓法下參與接觸。論文還把這21種模板歸納成三大功能組精細(xì)抓取Precision、力量抓取Power以及針對(duì)特定工具使用場(chǎng)景高度定制的物體專屬抓取Object-Specific。這套分類法之所以被選中是因?yàn)樗鼑?yán)格基于手的接觸表面而不是物體形狀這意味著無論換成什么樣的機(jī)械手只要能把手部表面按照對(duì)應(yīng)的解剖區(qū)域劃分好就能直接套用同一套語(yǔ)義標(biāo)簽體系。論文里給出了兩種不同的機(jī)械手五指的 Shadow Hand 和四指的 Allegro Hand分別做了這種區(qū)域劃分的映射證明了這套分類體系的通用性。自注意力機(jī)制讓模型自己發(fā)現(xiàn)哪些接觸點(diǎn)該結(jié)伴出現(xiàn)有了統(tǒng)一的工作空間和統(tǒng)一的分類標(biāo)簽接下來要解決的是怎么讓模型學(xué)會(huì)某種抓取類型對(duì)應(yīng)的具體空間分布規(guī)律。論文用了一個(gè) Transformer 編碼器一種基于自注意力機(jī)制的神經(jīng)網(wǎng)絡(luò)架構(gòu)能夠讓序列中任意兩個(gè)位置的信息互相交互捕捉長(zhǎng)距離的依賴關(guān)系來處理工作空間里的這些采樣點(diǎn)。這里有一個(gè)設(shè)計(jì)細(xì)節(jié)挺講究他們沒有采用標(biāo)準(zhǔn)視覺 Transformer 里常見的做法即用一個(gè)單獨(dú)的全局 CLS 標(biāo)記來承載條件信息而是把代表當(dāng)前請(qǐng)求抓取類型的語(yǔ)義嵌入向量直接拼接到工作空間里每一個(gè)采樣點(diǎn)的特征上。為什么要這么麻煩論文給出的解釋是如果只用一個(gè)孤立的全局標(biāo)記來傳遞我現(xiàn)在要做精細(xì)捏取這個(gè)語(yǔ)義信號(hào)這個(gè)信號(hào)在經(jīng)過很多層深層注意力計(jì)算之后容易被稀釋掉尤其是當(dāng)你面對(duì)成千上萬個(gè)空間標(biāo)記的時(shí)候。把語(yǔ)義信號(hào)硬編碼進(jìn)每一個(gè)點(diǎn)里相當(dāng)于給每個(gè)局部特征都反復(fù)提醒一遍當(dāng)前的任務(wù)目標(biāo)確保深層網(wǎng)絡(luò)在每一層計(jì)算時(shí)都不會(huì)忘記這個(gè)約束。這就好比你交代團(tuán)隊(duì)一個(gè)復(fù)雜任務(wù)時(shí)如果只在開會(huì)最開始說一句記住這次的重點(diǎn)是速度優(yōu)先等討論到后面細(xì)節(jié)環(huán)節(jié)這句提醒可能早就被大家淡忘了。但如果你把速度優(yōu)先這四個(gè)字寫在每一份分發(fā)下去的文件上團(tuán)隊(duì)成員在處理每一個(gè)具體子任務(wù)時(shí)都能重新看到這個(gè)提醒執(zhí)行時(shí)就不容易跑偏。之后這些經(jīng)過注意力處理的特征還會(huì)經(jīng)過一個(gè) Set Transformer一種專門用于處理無序集合數(shù)據(jù)的注意力網(wǎng)絡(luò)通過多頭注意力池化和集合注意力塊兩個(gè)模塊把一堆散亂的元素壓縮成一個(gè)統(tǒng)一的描述向量壓縮成一個(gè)全局的潛在描述符最終喂給一個(gè)條件變分自編碼器CVAE一種生成模型能夠在給定條件的情況下從一個(gè)概率分布里采樣出多樣化但符合條件約束的輸出結(jié)果來生成具體的接觸概率圖。論文特別提到因?yàn)楹暧^層面的抓法多樣性已經(jīng)被嚴(yán)格的拓?fù)錀l件約束住了CVAE不需要再去建模那種同一個(gè)物體到底該捏還是該包的巨大不確定性它只需要處理同一種拓?fù)漕愋拖碌木植课⑿∽兓热缡种秆刂吘壿p微滑動(dòng)的位置差異。這個(gè)約束讓原本容易出問題的標(biāo)準(zhǔn)高斯先驗(yàn)分布在這里反而變得高效且夠用避免了很多生成模型常見的模式坍縮或者輸出模糊的問題。生成之后三道關(guān)卡把關(guān)模型預(yù)測(cè)出一個(gè)接觸模板之后并不能直接拿去執(zhí)行論文設(shè)計(jì)了一套級(jí)聯(lián)式的驗(yàn)證流程確保最終生成的抓取既符合語(yǔ)義又物理上站得住腳。第一道關(guān)卡叫標(biāo)簽一致性檢查用來判斷預(yù)測(cè)出的接觸區(qū)域和真實(shí)需要的接觸區(qū)域差異是不是在可接受范圍內(nèi)論文允許最多一個(gè)區(qū)域的偏差超過這個(gè)閾值就直接判定這次生成不合格果斷放棄。第二道關(guān)卡是力閉合驗(yàn)證這是一種簡(jiǎn)化的力學(xué)穩(wěn)定性估算方法快速判斷預(yù)測(cè)出的接觸點(diǎn)分布組合起來理論上能不能形成一個(gè)穩(wěn)定的抓取。如果這一步?jīng)]通過模型會(huì)重新從潛在空間里采樣一個(gè)新的方案最多嘗試20次。第三道關(guān)卡是關(guān)節(jié)配置優(yōu)化這一步會(huì)用一個(gè)能量函數(shù)把手的實(shí)際幾何形狀去對(duì)齊預(yù)測(cè)出的三維接觸點(diǎn)同時(shí)避免自身碰撞、避免穿透物體、遵守關(guān)節(jié)活動(dòng)范圍的限制。論文里還專門加了一個(gè)排斥力項(xiàng)用來把沒有被分配接觸任務(wù)的手指和掌心部分主動(dòng)推離物體防止這些多余部位意外貼上物體表面破壞原本要求的接觸拓?fù)浼兇庑浴_@套三重驗(yàn)證機(jī)制的意義在于它把生成一個(gè)大概能用的結(jié)果和生成一個(gè)嚴(yán)格符合語(yǔ)義要求的結(jié)果這兩件事拆分開來專門處理。如果沒有這套過濾流程模型很可能生成一堆看起來還行但細(xì)看接觸區(qū)域已經(jīng)悄悄跑偏的抓取論文的消融實(shí)驗(yàn)也證明了這一點(diǎn)去掉標(biāo)簽一致性檢查之后成功率和拓?fù)湟恢滦远汲霈F(xiàn)了明顯下滑。硬碰硬的對(duì)比實(shí)驗(yàn)結(jié)果說話方法上的設(shè)計(jì)說了這么多最終還是得看實(shí)際表現(xiàn)。在無條件基線對(duì)比實(shí)驗(yàn)里論文用 Multidex 物體集測(cè)試了 CoToGrasp 和 DFC、GenDexGrasp、DRO-Grasp、GOAG 這四種方法。| 方法 | 是否物體無關(guān)訓(xùn)練 | 成功率SR | 語(yǔ)義熵HTC | 生成速度(秒/次) ||---|---|---|---|---|| DFC | 是 | 72.15 | 0.7389 | 1800 || GenDexGrasp | 否 | 71.15 | 0.5956 | 14.65 || DRO-Grasp | 否 | 63.30 | 0.6504 | 1.72 || GOAG | 是 | 77.90 | 0.6527 | 0.20 || CoToGrasp | 是 | 36.94 | **0.83** | **0.11** |乍一看 CoToGrasp 的整體成功率反而是最低的只有36.94%比 GOAG 的77.90%差了一大截這是不是說明這個(gè)方法反而更差了論文對(duì)此的解釋是這恰恰說明了 CoToGrasp 是在認(rèn)真執(zhí)行任務(wù)而不是在偷懶走捷徑。它被強(qiáng)制要求生成各種各樣的拓?fù)漕愋桶切┪矬w幾何形狀本身并不天然適合的精細(xì)捏取因此在很多物體上即使一個(gè)精細(xì)抓取生成得再標(biāo)準(zhǔn)物理上也未必能穩(wěn)當(dāng)抓起來因?yàn)槲矬w本身可能就不太適合被那樣捏。相比之下其他方法可以自由選擇最容易穩(wěn)定的包裹式抓取成功率自然顯得高但這份高成功率的代價(jià)是完全犧牲了功能多樣性。而 CoToGrasp 的語(yǔ)義熵達(dá)到0.83是所有方法里最高的同時(shí)生成速度也是最快的每次只要0.11秒。再看和真正帶拓?fù)錀l件的方法 Dexonomy 的正面對(duì)比這個(gè)對(duì)比是在 DexGraspNet 這個(gè)包含1126個(gè)幾何多樣物體的大規(guī)模數(shù)據(jù)集上做的。| 方法 | 成功率SR(%) | 拓?fù)湟恢滦訲C(%) | 語(yǔ)義熵HTC ||---|---|---|---|| Dexonomy | 27.16 | 14.28 | 0.77 || CoToGrasp | **29.75** | **17.18** | **0.96** |這次 CoToGrasp 在成功率和拓?fù)湟恢滦陨隙颊剂藘?yōu)勢(shì)。論文進(jìn)一步拆解了力量、精細(xì)、物體專屬這三大類別的具體表現(xiàn)CoToGrasp 在精細(xì)抓取類別上的優(yōu)勢(shì)尤其明顯22.71%對(duì)Dexonomy的12.36%幾乎是翻倍的差距。更值得琢磨的是論文里挖出的一個(gè)偽異?,F(xiàn)象。在針對(duì)具體拓?fù)漕愋?M11物體專屬類和 M21力量類的單獨(dú)測(cè)試?yán)顳exonomy 報(bào)出了看起來相當(dāng)亮眼的60.5%和37.2%成功率但論文通過定性分析發(fā)現(xiàn)這背后其實(shí)是嚴(yán)重的模式坍縮當(dāng) Dexonomy 遇到幾何形狀比較刁鉆的物體時(shí)它會(huì)悄悄放棄原本要求的拓?fù)漕愋娃D(zhuǎn)而默認(rèn)生成一種未經(jīng)驗(yàn)證的力量型包裹抓取因?yàn)樗鼪]有一個(gè)嚴(yán)格的后驗(yàn)拓?fù)錂z查機(jī)制這些實(shí)際上答非所問的抓取被錯(cuò)誤地記錄成了成功案例。而 CoToGrasp 因?yàn)橛星懊嫣岬降尿?yàn)證流程能主動(dòng)識(shí)別并拒絕這類答非所問的幻覺輸出最終在 M21 這個(gè)類別上依然保持了33.5%的真實(shí)成功率。這個(gè)細(xì)節(jié)其實(shí)挺發(fā)人深省的它提醒我們一個(gè)看起來數(shù)字很漂亮的評(píng)測(cè)結(jié)果背后可能藏著某種系統(tǒng)性的偷懶行為只有配上足夠嚴(yán)格的驗(yàn)證手段這些數(shù)字才真正靠得住。論文還專門分析了物體幾何復(fù)雜度對(duì)兩種方法的影響用凸度物體體積和其凸包體積的比值數(shù)值越低說明物體形狀越不規(guī)則、凹陷越多來衡量物體難度。從凸物體過渡到非凸物體時(shí)CoToGrasp 保留了58.72%的成功率而 Dexonomy 只保留了37.42%。在凹陷特別嚴(yán)重的物體凸度小于0.4約占數(shù)據(jù)集的4%上CoToGrasp 的成功率是18.30%拓?fù)湟恢滦跃尤贿€逆勢(shì)上升到19.17%而 Dexonomy 在這類困難物體上的拓?fù)湟恢滦灾苯颖赖?.94%。這說明依賴固定關(guān)節(jié)模板的方法一旦碰上復(fù)雜形狀就容易完全放棄語(yǔ)義要求而基于接觸區(qū)域推理的方法反而能更好地利用局部復(fù)雜特征來錨定語(yǔ)義信息。從仿真走到真實(shí)世界最后論文沒有止步于仿真數(shù)據(jù)還做了真實(shí)機(jī)器人實(shí)驗(yàn)。他們用一臺(tái)6自由度的 UR10 機(jī)械臂配上 Allegro Hand一種四指仿人機(jī)械手在 YCB 數(shù)據(jù)集一套廣泛用于機(jī)器人操作研究的標(biāo)準(zhǔn)測(cè)試物體集合的物體上執(zhí)行了生成出來的抓取。因?yàn)?Allegro Hand 缺少小指某些必須五指參與的拓?fù)漕愋捅热鏜6被主動(dòng)排除掉了。論文展示了多張真實(shí)抓取的照片涵蓋了從精細(xì)到力量各個(gè)類別的拓?fù)渥C明了在仿真中生成的這些接觸拓?fù)浯_實(shí)能夠在物理硬件上被成功執(zhí)行并靜態(tài)保持住。不過論文也很坦誠(chéng)地討論了真實(shí)執(zhí)行中的困難。他們發(fā)現(xiàn)僅靠簡(jiǎn)單的線性插值讓手指閉合會(huì)導(dǎo)致手指到達(dá)物體表面的時(shí)間不同步先接觸的手指會(huì)產(chǎn)生不平衡的力矩把物體推離預(yù)定位置導(dǎo)致真實(shí)接觸點(diǎn)偏離了原本預(yù)測(cè)的最優(yōu)區(qū)域。這提示未來的工作需要往力位混合控制或者觸覺反饋這類更主動(dòng)感知接觸狀態(tài)的方向去改進(jìn)。QAQ1CoToGrasp解決的核心問題是什么A現(xiàn)在主流的機(jī)械手抓取算法只優(yōu)化物理穩(wěn)定性導(dǎo)致生成的抓取幾乎全部集中在包裹式的力量抓取上很少能按照人類的抓取分類學(xué)生成精細(xì)捏取或工具專用的特定抓法。CoToGrasp通過讓模型學(xué)習(xí)接觸拓?fù)涠俏矬w形狀本身解決了這個(gè)功能單一化的問題。Q2CoToGrasp為什么不需要給每個(gè)物體標(biāo)注抓取類型的數(shù)據(jù)A因?yàn)樗捎昧宋矬w無關(guān)訓(xùn)練方式模型完全在機(jī)械手自身的點(diǎn)云上訓(xùn)練學(xué)習(xí)的是手部的接觸能力而不是特定物體的幾何匹配關(guān)系。推理時(shí)只需要把新物體投影進(jìn)同一個(gè)規(guī)范工作空間就能實(shí)現(xiàn)對(duì)未見過物體的零樣本泛化。Q3CoToGrasp和Dexonomy相比表現(xiàn)如何A在DexGraspNet測(cè)試集上CoToGrasp的成功率是29.75%對(duì)Dexonomy的27.16%拓?fù)湟恢滦允?7.18%對(duì)14.28%。在精細(xì)抓取類別上優(yōu)勢(shì)更明顯而且在幾何形狀復(fù)雜的非凸物體上CoToGrasp性能保留得也更好。