習(xí)路徑與工程避坑指南)
最近幾年“具身智能”從一個(gè)學(xué)術(shù)黑話變成了招聘網(wǎng)站上頻繁出現(xiàn)的崗位名稱。但真正開始動(dòng)手看代碼的人會(huì)發(fā)現(xiàn)這個(gè)領(lǐng)域最麻煩的不是沒有資料而是資料更新得太快。好不容易讀完一篇 RT-1 的解讀下一周又冒出 RDT、ForceVLA 一長(zhǎng)串新名詞。我不打算再寫一篇“論文逐行解讀”而是想聊聊更實(shí)際的東西當(dāng)一套涵蓋 RT-1、RoboFlamingo、MDT、RDT、LAPA 的 20 集 VLA 教程擺在你面前時(shí)應(yīng)該怎么學(xué)才能不只是在收藏夾里吃灰以及當(dāng)你真的把模型跑起來之后哪些地方會(huì)毫無預(yù)兆地卡住你。一個(gè)比較反直覺的判斷先放在這里VLA 的核心難點(diǎn)從來不是“看懂畫面”和“聽懂指令”。視覺語言模型發(fā)展到今天理解場(chǎng)景已經(jīng)不是瓶頸。真正的瓶頸是動(dòng)作——用什么形式表示動(dòng)作用什么模型結(jié)構(gòu)生成動(dòng)作以及生成的動(dòng)作能不能讓真實(shí)機(jī)械臂平滑、穩(wěn)定、安全地執(zhí)行。能想明白這一層后面看所有論文都會(huì)順很多。1. 先理解 VLA 解決的不是“看見”而是“看見之后怎么動(dòng)”1.1 傳統(tǒng)機(jī)器人棧的斷層不在感知在行動(dòng)傳統(tǒng)機(jī)器人項(xiàng)目怎么做通常是一條流水線先用目標(biāo)檢測(cè)模型找到物體再算姿態(tài)然后交給運(yùn)動(dòng)規(guī)劃庫做路徑規(guī)劃最后底層控制器驅(qū)動(dòng)電機(jī)。聽起來很合理但每換一個(gè)場(chǎng)景這條鏈路就要重新調(diào)一遍。感知模型在一個(gè)光照下好用換個(gè)角度就不靈規(guī)劃模塊只認(rèn)固定尺寸的物體控制器參數(shù)調(diào)好了物體稍微挪兩厘米就抓空。而 VLA 的思路完全不同。它不再把“感知-規(guī)劃-控制”切成三段而是讓模型直接吃多視角圖像和語言指令輸出一條動(dòng)作序列。這個(gè)轉(zhuǎn)變帶來的好處不是“少了兩個(gè)模塊”而是整個(gè)系統(tǒng)變成了一體化的可學(xué)習(xí)系統(tǒng)。過去的問題在于模塊之間的錯(cuò)誤會(huì)一級(jí)一級(jí)放大現(xiàn)在的問題則變成了模型能不能從數(shù)據(jù)里自己學(xué)會(huì)動(dòng)作和場(chǎng)景之間的關(guān)系。1.2 動(dòng)作表示方式才是 VLA 真正的分水嶺剛開始看 VLA 論文很多人會(huì)把注意力放在網(wǎng)絡(luò)結(jié)構(gòu)上這里用了 ViT那里用了 diffusion。真正值得先看的是動(dòng)作表示。不同模型對(duì)“動(dòng)作”有完全不同的假設(shè)這決定了它們的上限和落地方式。常見動(dòng)作表示有這么幾類末端位姿加夾爪開合直接輸出機(jī)械臂末端在相機(jī)坐標(biāo)系下的 6D 位姿和夾爪指令直觀但依賴標(biāo)定精度。關(guān)節(jié)角輸出每個(gè)關(guān)節(jié)的目標(biāo)角度物理上一定可達(dá)但在不同機(jī)械臂之間遷移困難。增量動(dòng)作每次只輸出一個(gè)小幅修正適合精細(xì)任務(wù)但長(zhǎng)期執(zhí)行會(huì)有累積漂移。動(dòng)作塊一次預(yù)測(cè)未來 N 步動(dòng)作可以降低“一步錯(cuò)步步錯(cuò)”的復(fù)合誤差是很多擴(kuò)散策略采用的做法。這里的核心矛盾是動(dòng)作表示越接近電機(jī)層物理可行性越高但跨平臺(tái)遷移越難動(dòng)作表示越接近語義層跨平臺(tái)遷移越容易但離精確控制越遠(yuǎn)。你看模型時(shí)會(huì)發(fā)現(xiàn)不同算法的很多設(shè)計(jì)差異其實(shí)都是為了在這個(gè)矛盾里找平衡。2. 教程里那串算法名應(yīng)該按這條線索去消化2.1 RT-1把機(jī)械臂動(dòng)作當(dāng)成一組詞元RT-1 可以看作是 VLA 走向大眾視野的起點(diǎn)。它啟發(fā)自 Transformer 語言模型的生成方式把機(jī)械臂動(dòng)作離散成一串詞元然后用類似 next-token 的方式逐維預(yù)測(cè)。輸入的圖像經(jīng)過視覺編碼器指令經(jīng)過文本編碼器共同作為條件輸出動(dòng)作詞元序列。具體怎么做其實(shí)是次要的關(guān)鍵是你應(yīng)該從 RT-1 里理解兩件事。第一語言指令在這里不是最終輸出而是“條件”。模型不是一個(gè)會(huì)說話的大模型而是一個(gè)根據(jù)語言條件生成動(dòng)作的模型。第二離散化是有代價(jià)的。把連續(xù)動(dòng)作切成 256 個(gè)桶看起來夠細(xì)但在某些精密任務(wù)里桶的顆粒度就可能不夠。RT-1 的價(jià)值不是告訴你“離散化最優(yōu)”而是展示了一條可行的、可擴(kuò)展的技術(shù)路線——?jiǎng)幼骺梢韵裾Z言一樣被生成。2.2 RoboFlamingo給現(xiàn)成視覺語言模型補(bǔ)一個(gè)動(dòng)作出口RT-1 這類方案需要大批機(jī)器人數(shù)據(jù)從頭訓(xùn)練。對(duì)絕大多數(shù)團(tuán)隊(duì)來說這條路成本太高。RoboFlamingo 代表的思路是拿起一個(gè)現(xiàn)成的視覺語言基礎(chǔ)模型凍結(jié)大部分參數(shù)在合適的位置插入可訓(xùn)練接口再在末端接一個(gè)小動(dòng)作頭這樣就能用相對(duì)較少的機(jī)器人數(shù)據(jù)訓(xùn)練出一個(gè)能輸出動(dòng)作的模型。這個(gè)思路的現(xiàn)實(shí)意義非常直接。如果你不是大廠沒有幾十萬條遙操作數(shù)據(jù)“從頭訓(xùn) VLA”基本不現(xiàn)實(shí)。更可行的是在開源視覺語言模型的基礎(chǔ)上做適配。當(dāng)然RoboFlamingo 這類方案也有邊界基礎(chǔ)模型的知識(shí)擅長(zhǎng)“理解場(chǎng)景”并不天然擅長(zhǎng)“生成動(dòng)作”動(dòng)作頭的設(shè)計(jì)和訓(xùn)練數(shù)據(jù)的質(zhì)量會(huì)直接影響上限。2.3 RDT 與 MDT用擴(kuò)散模型重構(gòu)動(dòng)作軌跡RT-1 是把動(dòng)作當(dāng)詞元RoboFlamingo 是調(diào)接口而 RDT、MDT 這一組模型共同指向另一個(gè)方向用擴(kuò)散模型生成整段動(dòng)作軌跡。為什么要擴(kuò)散因?yàn)闄C(jī)器人示教數(shù)據(jù)天然是多峰的。同一個(gè)任務(wù)十個(gè)人演示可能就是十種不同軌跡。如果用回歸模型訓(xùn)練動(dòng)作輸出模型會(huì)把多條軌跡“平均”出一條結(jié)果經(jīng)常是抖動(dòng)、停頓。擴(kuò)散模型不是直接預(yù)測(cè)一個(gè)最優(yōu)動(dòng)作而是從一個(gè)隨機(jī)噪聲軌跡開始逐步去噪成一條符合數(shù)據(jù)分布的軌跡天然適合這種多峰輸出場(chǎng)景。RDT 這種 Robotics Diffusion Transformer 的做法是把多模態(tài)觀察信息和噪聲動(dòng)作一起丟進(jìn) Transformer 結(jié)構(gòu)做去噪。MDT 在這個(gè)框架里可以理解成同一思路的另一種骨干或變體。學(xué)習(xí)時(shí)不必糾結(jié)誰更強(qiáng)要抓住的共同點(diǎn)是擴(kuò)散加 Transformer 正在成為機(jī)器人動(dòng)作生成的主流范式之一它的厲害之處不是單步預(yù)測(cè)更準(zhǔn)而是整段動(dòng)作更平滑、更多樣。2.4 LAPA語言模型負(fù)責(zé)“拆任務(wù)”底層策略負(fù)責(zé)“干活”LAPA 代表的則是一條更工程化的路線先讓語言模型把“把杯子放到桌上”拆解成幾個(gè)步驟然后由一個(gè)底層的動(dòng)作策略逐步執(zhí)行。它不要求一個(gè)大模型從頭到尾輸出所有電機(jī)指令而是讓規(guī)劃與執(zhí)行分層協(xié)作。不同教程里 LAPA 的展開名未必一樣這里真正值得理解的是“語言模型和動(dòng)作模型如何分工”這個(gè)設(shè)計(jì)問題。選擇一一個(gè)端到端大模型吃全部信息、吐全部動(dòng)作簡(jiǎn)單直接但對(duì)數(shù)據(jù)和算力要求極高。選擇二上層大模型負(fù)責(zé)任務(wù)規(guī)劃和糾錯(cuò)下層小策略負(fù)責(zé)具體動(dòng)作工程上更容易控制風(fēng)險(xiǎn)。看到 LAPA 時(shí)先問它在哪一個(gè)選擇里再往細(xì)看思路會(huì)清楚很多。這一批算法建議按下面的順序去學(xué)避免一上來就被名詞淹沒學(xué)習(xí)順序模型/類別核心貢獻(xiàn)學(xué)完之后你應(yīng)該能說清1RT-1把動(dòng)作當(dāng)成詞元序列生成為什么離散化動(dòng)作可行代價(jià)是什么2RoboFlamingo把預(yù)訓(xùn)練視覺語言模型遷移到動(dòng)作任務(wù)凍結(jié)骨干和訓(xùn)練動(dòng)作頭之間的邊界在哪3RDT / MDT用擴(kuò)散模型生成連續(xù)動(dòng)作軌跡為什么擴(kuò)散更適合多峰動(dòng)作分布4LAPA把語言規(guī)劃和底層執(zhí)行分開規(guī)劃與執(zhí)行如何分工才更可控3. 從零基礎(chǔ)到能訓(xùn)練一個(gè) VLA不跳過這些墊腳石3.1 課程標(biāo)題里的“30k”要理性看標(biāo)題里的“30k”通常指的是月薪預(yù)期。這里需要先潑一點(diǎn)冷水看完任何教程都不可能直接得到 30k 的 offer真正值錢的是你在學(xué)習(xí)過程中建立的能力組合。具身智能崗位現(xiàn)在給得高的原因不是“會(huì)念模型名”而是“能在真實(shí)機(jī)器人上穩(wěn)定復(fù)現(xiàn)效果并解決工程問題”。所以下面的學(xué)習(xí)路徑每一步都刻意把“動(dòng)手”放進(jìn)去而不是讓你只看視頻。3.2 六塊墊腳石按順序踩按常見實(shí)踐建議把下面的基礎(chǔ)排好序前面的沒有踩穩(wěn)后面的學(xué)習(xí)效率會(huì)很低。Python 與 PyTorch不是會(huì)寫腳本而是能熟練處理數(shù)據(jù)加載、分布式訓(xùn)練、斷點(diǎn)續(xù)訓(xùn)。Transformer 與視覺語言模型基礎(chǔ)了解 ViT、CLIP、tokenizer、cross-attention 這些概念不知道細(xì)節(jié)沒關(guān)系但要能看懂模型輸入的張量形狀。機(jī)器人學(xué)基礎(chǔ)坐標(biāo)變換、正逆運(yùn)動(dòng)學(xué)、相機(jī)內(nèi)參和手眼標(biāo)定、控制頻率。這部分最容易被人忽略但動(dòng)作模型部署時(shí)繞不開。數(shù)據(jù)格式理解一條 episode 里有什么圖像、指令、動(dòng)作怎么對(duì)齊坐標(biāo)系定義在哪動(dòng)作頻率是多少。仿真環(huán)境MuJoCo 或 Isaac Lab 之類先在仿真里把推理和評(píng)測(cè)鏈路跑通成本比真機(jī)低一個(gè)數(shù)量級(jí)。訓(xùn)練調(diào)參基本功學(xué)習(xí)率、batch size、隨機(jī)種子、權(quán)重初始化、loss 波動(dòng)這些基本功決定了你能不能復(fù)現(xiàn)論文結(jié)果。還有一個(gè)很容易被忽略的點(diǎn)不要上來就打算從頭訓(xùn)一個(gè)大 VLA。單卡訓(xùn)練一個(gè)基礎(chǔ) VLA 的顯存需求和服務(wù)器數(shù)量不是個(gè)人開發(fā)者能輕松承擔(dān)的。更現(xiàn)實(shí)的路徑是在開源預(yù)訓(xùn)練權(quán)重上做微調(diào)或者直接用較小的觀測(cè)編碼器。學(xué)會(huì)“站在已有模型上做增量”在算力受限時(shí)是必須的能力。3.3 一段更穩(wěn)妥的三步走路徑第一步把教程里的模型都跑通推理先不改任何訓(xùn)練邏輯用官方權(quán)重在示例數(shù)據(jù)上看看輸入輸出長(zhǎng)什么樣。第二步選一個(gè)任務(wù)場(chǎng)景準(zhǔn)備一小批自己采集的數(shù)據(jù)幾十條 episode 就夠做一次微調(diào)把“數(shù)據(jù)-訓(xùn)練-評(píng)估”的最小閉環(huán)跑通。第三步把這個(gè)閉環(huán)搬到仿真或真機(jī)上開始記錄失敗案例再回到數(shù)據(jù)和參數(shù)上去改。這段路徑的核心是每走一步都要留下一個(gè)可以重復(fù)運(yùn)行的最小腳本。等積累到第三十次實(shí)驗(yàn)時(shí)你會(huì)發(fā)現(xiàn)自己手里不再是一堆模型文件而是一整套可以迭代的工程資產(chǎn)。4. 真正動(dòng)手時(shí)會(huì)暴露的五個(gè)工程坑4.1 數(shù)據(jù)對(duì)齊時(shí)間戳、坐標(biāo)系、頻率都可能是坑第一個(gè)容易翻車的地方在數(shù)據(jù)。很多人拿到公開數(shù)據(jù)集不檢查相機(jī)時(shí)間戳、指令語言、動(dòng)作日志之間的對(duì)齊關(guān)系就開始訓(xùn)練。結(jié)果訓(xùn)練時(shí) loss 很漂亮到真機(jī)上完全不動(dòng)。常見的問題包括圖像是 30Hz動(dòng)作日志是 10Hz回放的時(shí)候沒人做插值末端位姿用的坐標(biāo)系和模型定義的不一致夾爪指令被當(dāng)成連續(xù)量實(shí)際只有開合兩個(gè)值。建議拿到任何數(shù)據(jù)先寫一段檢查腳本# 偽代碼查看一條 episode 的字段和采樣頻率 episode load_episode(record_0001.hdf5) for key in episode.keys(): print(key, episode[key].shape, episode[key].framerate) # 通常你會(huì)看到 images, joint_positions, eef_pose, gripper, instruction # 先確認(rèn)它們的時(shí)間戳是否對(duì)齊再談?dòng)?xùn)練如果原始數(shù)據(jù)說明文檔不完整落地前要先確認(rèn)數(shù)據(jù)集的版本和字段定義。公開數(shù)據(jù)集版本更新很頻繁字段命名甚至坐標(biāo)系定義都可能變。4.2 動(dòng)作空間直接輸出關(guān)節(jié)角不一定更好第二個(gè)坑是動(dòng)作空間選擇。從直覺上看關(guān)節(jié)角是最“底層”的控制量輸出關(guān)節(jié)角不就不需要解逆運(yùn)動(dòng)學(xué)了但實(shí)際上關(guān)節(jié)角在不同機(jī)械臂上的語義完全不同一個(gè)在 Franka 上訓(xùn)練好的模型換到另一臺(tái)六軸臂上基本不可用。而末端位姿雖然依賴標(biāo)定但在同類機(jī)械臂之間遷移時(shí)更符合人的直覺。如果你做的是抓取、擺放這類桌面任務(wù)我一般建議優(yōu)先考慮末端位姿加夾爪配合動(dòng)作塊輸出。如果做插孔、裝配這類對(duì)力比較敏感的任務(wù)則要考慮加力反饋或者用 delta 動(dòng)作做局部修正。4.3 仿真跑通不等于真機(jī)可用仿真環(huán)境最大的陷阱是“看起來成功了”目標(biāo)永遠(yuǎn)不挪位置光照永遠(yuǎn)不變相機(jī)視角永遠(yuǎn)是同一個(gè)角度。模型在仿真里學(xué)到的是“記住畫面里的一個(gè)固定位置”而不是“理解抓取這個(gè)行為”。這會(huì)導(dǎo)致真機(jī)失敗一塌糊涂。減少仿真到真機(jī)差距的常見手段包括增加光照擾動(dòng)、物體位置隨機(jī)化、相機(jī)內(nèi)外參隨機(jī)化、延遲模擬以及最笨但最有效的——定期把模型放到真機(jī)上做小樣本測(cè)試用真機(jī)失敗案例反哺仿真數(shù)據(jù)。先跑通再優(yōu)化這個(gè)節(jié)奏一定要守住。4.4 只看 loss 評(píng)測(cè)不了 VLAVLA 訓(xùn)練日志里的 loss 下降只能說明模型在擬合訓(xùn)練數(shù)據(jù)不能說明它會(huì)干活。評(píng)測(cè)一個(gè) VLA至少要看三個(gè)維度任務(wù)成功率、在不同初始條件下的魯棒性、失敗之后能否恢復(fù)。最簡(jiǎn)單的做法是設(shè)計(jì)一個(gè)測(cè)試矩陣固定幾類任務(wù)每類任務(wù)在多個(gè)物體位置、多個(gè)光照角度下測(cè)試統(tǒng)計(jì)首次嘗試成功率。如果出現(xiàn)“訓(xùn)練 loss 很低、任務(wù)成功率也很低”優(yōu)先檢查的不是模型而是標(biāo)簽動(dòng)作是不是有噪聲或者評(píng)測(cè)時(shí)相機(jī)位置和訓(xùn)練數(shù)據(jù)差太多。這里給一張簡(jiǎn)易排查表現(xiàn)象優(yōu)先排查方向訓(xùn)練 loss 下降但真機(jī)亂動(dòng)動(dòng)作表示、坐標(biāo)系、數(shù)據(jù)頻率不一致仿真成功、真機(jī)失敗相機(jī)標(biāo)定、延遲、視覺域差距抓取總差一點(diǎn)夾爪中心標(biāo)定、末端基準(zhǔn)、離散化粒度輸出抖動(dòng)擴(kuò)散步數(shù)、動(dòng)作塊長(zhǎng)度、濾波4.5 推理速度和算力是隱藏門檻最后一塊短板通常是推理速度。在論文 demo 里模型處理一幀畫面可能要幾十毫秒看起來很“實(shí)時(shí)”但疊加上圖像采集、預(yù)處理、后處理、通信延遲實(shí)際控制頻率可能不到 5Hz。對(duì)抓取任務(wù)勉強(qiáng)夠用對(duì)動(dòng)態(tài)避障或高速裝配遠(yuǎn)遠(yuǎn)不夠。工程上的處理方式包括把圖像預(yù)處理放到 GPU 上、固定 batch 避免動(dòng)態(tài) shape 的額外開銷、用 TensorRT 或 ONNX 加速、把模型輸出限幅并加低通濾波。還有一點(diǎn)很容易踩真機(jī)通信協(xié)議本身會(huì)帶來不穩(wěn)定延遲建議在真機(jī)調(diào)試前先測(cè)量整條鏈路的端到端延遲而不是只看模型單步推理時(shí)間。5. 從“跑通教程”到“放進(jìn)產(chǎn)品”還差最后幾塊拼圖5.1 構(gòu)建你自己的數(shù)據(jù)采集閉環(huán)在實(shí)驗(yàn)室里可以用一個(gè)現(xiàn)成數(shù)據(jù)集做完整個(gè)實(shí)驗(yàn)。但一旦要解決自己的任務(wù)就得有自己的數(shù)據(jù)。遙操作是當(dāng)前最主流的方式通過 VR 手柄、3D 鼠標(biāo)或直接拖著機(jī)械臂做示教收集圖像、動(dòng)作和指令。數(shù)據(jù)管理同樣不能省每條 episode 要有任務(wù)描述、目標(biāo)物體、場(chǎng)景編號(hào)、采集時(shí)間否則后面做數(shù)據(jù)篩選和模型迭代會(huì)非常痛苦。一個(gè)可以反復(fù)使用的框架是固定任務(wù)先人工采集 50 條左右的 episode用預(yù)訓(xùn)練 VLA 微調(diào)再放到固定測(cè)試矩陣?yán)镌u(píng)測(cè)然后根據(jù)失敗樣本補(bǔ)采數(shù)據(jù)再重復(fù)。這個(gè)循環(huán)跑得越順你積累的“數(shù)據(jù)-模型-評(píng)測(cè)”資產(chǎn)就越值錢。5.2 給模型的輸出加一層安全護(hù)欄在大模型輸出的動(dòng)作和目標(biāo)之間必須隔一道安全校驗(yàn)。“模型生成動(dòng)作安全模塊把關(guān)”是工程常態(tài)。不管模型多聰明你都要在它輸出之后加一個(gè)校驗(yàn)層關(guān)節(jié)限位、速度限幅、工作空間邊界、力和力矩閾值、急停邏輯。# 動(dòng)作安全校驗(yàn)示意 filtered clip_to_joint_limits(raw_action, lower, upper) if joint_velocity_norm(filtered) v_max: filtered scale_to_velocity_limit(filtered, v_max) if outside_workspace(filtered): action emergency_stop()這段代碼不是解決 VLA 本身但它決定了 VLA 能不能被放心地用。很多 demo 翻車問題不在模型而在缺少這一層。5.3 長(zhǎng)期維護(hù)的不是模型是評(píng)測(cè)基線模型訓(xùn)練結(jié)束并不意味著項(xiàng)目結(jié)束。真正長(zhǎng)期維護(hù)的是評(píng)測(cè)基線每個(gè)版本模型都要在同一套測(cè)試任務(wù)上跑分記錄成功率、平均完成時(shí)間、失敗原因分布。有了這份基線你才能判斷新模型是真的變強(qiáng)了還是只是因?yàn)殡S機(jī)種子變了。我見過不少團(tuán)隊(duì)在 VLA 上反復(fù)折騰最后發(fā)現(xiàn)提升最大的一次不是換了模型結(jié)構(gòu)而是把評(píng)測(cè)基線從“主觀感覺”改成“固定測(cè)試集”。這個(gè)經(jīng)驗(yàn)放到任何具身智能項(xiàng)目里都適用數(shù)據(jù)、評(píng)測(cè)、模型三者里評(píng)測(cè)往往是最容易被低估的。6. 下一步該關(guān)注哪些方向6.1 ForceVLA 提示了一條新路把外力信息變成一等模態(tài)從近期的研究熱詞看ForceVLA 這類方向被頻繁提及核心思路是把機(jī)械臂末端的六維外力力矩當(dāng)成與畫面、語言同樣級(jí)別的輸入模態(tài)。為什么要這樣做因?yàn)楹芏嗳蝿?wù)根本無法只用視覺完成。旋擰螺絲、插拔接頭、打磨表面這些任務(wù)的關(guān)鍵判斷依據(jù)是“手上感覺到多大阻力”而不是“畫面里看到什么”。純視覺 VLA 在這些任務(wù)上很容易到達(dá)瓶頸把力覺信息接入模型正在成為下一階段的突破口。6.2 導(dǎo)航 VLA、標(biāo)準(zhǔn)體系與魯棒性會(huì)變成新熱點(diǎn)另一個(gè)明顯的變化是 VLA 正在從桌面機(jī)械臂走向移動(dòng)機(jī)器人“導(dǎo)航 VLA”這類的熱度上升很快。其本質(zhì)是把“感知-決策-執(zhí)行”的閉環(huán)從 6 自由度擴(kuò)展到更大的移動(dòng)空間這對(duì)模型的長(zhǎng)程規(guī)劃能力、記憶能力和實(shí)時(shí)性都提出了更高要求。同時(shí)行業(yè)標(biāo)準(zhǔn)和人形機(jī)器人相關(guān)規(guī)范也在密集推進(jìn)。過去這一領(lǐng)域幾乎沒有統(tǒng)一接口和評(píng)測(cè)標(biāo)準(zhǔn)各家數(shù)據(jù)格式、動(dòng)作表示都不一樣這是制約工程協(xié)作的重要原因。標(biāo)準(zhǔn)體系要解決的正是這個(gè)問題。另外隨著 VLA 進(jìn)入真實(shí)環(huán)境輸入魯棒性和對(duì)抗攻擊防御也開始被認(rèn)真討論。視覺輸入的一小點(diǎn)擾動(dòng)就可能讓動(dòng)作輸出完全偏掉所以在開放環(huán)境部署前輸入校驗(yàn)和魯棒性測(cè)試會(huì)越來越不可少。6.3 我的建議別只追大模型去攢一個(gè)完整閉環(huán)最后回到最初的問題。學(xué) VLA 的正確姿勢(shì)不是把 RT-1、RoboFlamingo、MDT、RDT、LAPA 的名字全部背熟而是親手把一條“數(shù)據(jù)-訓(xùn)練-評(píng)測(cè)-真機(jī)”的最小閉環(huán)跑通。跑通一次你對(duì)動(dòng)作表示、數(shù)據(jù)對(duì)齊、評(píng)測(cè)設(shè)計(jì)和真實(shí)機(jī)器人之間關(guān)系的理解會(huì)超過悶頭讀二十篇論文。如果你現(xiàn)在還在猶豫從哪里開始我建議先做三件事找一臺(tái)能動(dòng)的開源機(jī)器人平臺(tái)下載一個(gè)現(xiàn)成的 VLA 預(yù)訓(xùn)練權(quán)重準(zhǔn)備五條自己采集的演示數(shù)據(jù)。然后跑一次微調(diào)寫一個(gè)評(píng)測(cè)腳本記錄第一次真機(jī)失敗的原因。這個(gè)流程走完你就有了一張屬于自己的 VLA 地圖后續(xù)再看到新模型都只是在這張地圖上添加新的路線。