制的多智能體強(qiáng)化學(xué)習(xí)實(shí)現(xiàn)任意物體協(xié)同運(yùn)輸)
1. 項(xiàng)目概述從“搬不動(dòng)”到“一起搬”的智能進(jìn)化在機(jī)器人領(lǐng)域讓單個(gè)智能體完成復(fù)雜任務(wù)如抓取、移動(dòng)已經(jīng)取得了長(zhǎng)足進(jìn)展。但當(dāng)我們面對(duì)一個(gè)形狀不規(guī)則、重量超限或者體積龐大的物體時(shí)單個(gè)機(jī)器人往往就力不從心了。這時(shí)一個(gè)自然而然的思路是讓多個(gè)機(jī)器人一起上。這就是多機(jī)器人協(xié)同運(yùn)輸?shù)慕?jīng)典課題。然而問(wèn)題遠(yuǎn)沒(méi)有“人多力量大”那么簡(jiǎn)單。如何讓一群機(jī)器人像訓(xùn)練有素的螞蟻一樣自發(fā)地圍繞一個(gè)從未見(jiàn)過(guò)的物體形成穩(wěn)定的抓持或承托隊(duì)形并且能協(xié)調(diào)一致地將其運(yùn)送到目標(biāo)點(diǎn)同時(shí)還要避開(kāi)路上的障礙這背后涉及感知、決策、控制與協(xié)作的深度融合。傳統(tǒng)的解決方案通常依賴(lài)于精確的預(yù)編程和集中式控制。我們需要事先知道物體的精確三維模型然后離線計(jì)算出最優(yōu)的抓取點(diǎn)或支撐點(diǎn)再為每個(gè)機(jī)器人分配固定的位置和軌跡。這種方法在結(jié)構(gòu)化、已知的環(huán)境中很有效但缺乏靈活性和魯棒性。一旦物體形狀改變或者環(huán)境出現(xiàn)未預(yù)料的擾動(dòng)整個(gè)系統(tǒng)就可能失效。近年來(lái)多智能體強(qiáng)化學(xué)習(xí)Multi-Agent Reinforcement Learning, MARL為解決這類(lèi)問(wèn)題提供了全新的范式。它不再要求我們事先告訴機(jī)器人“怎么做”而是通過(guò)讓機(jī)器人在虛擬或真實(shí)環(huán)境中不斷試錯(cuò)學(xué)習(xí)出一套協(xié)作策略。我們的項(xiàng)目——“基于多智能體強(qiáng)化學(xué)習(xí)的任意物體協(xié)同運(yùn)輸隊(duì)形生成”正是瞄準(zhǔn)了這一前沿挑戰(zhàn)。其核心目標(biāo)是開(kāi)發(fā)一個(gè)MARL框架使得一組機(jī)器人智能體能夠僅依靠局部感知例如深度相機(jī)或激光雷達(dá)在面對(duì)一個(gè)任意形狀、未知質(zhì)量和摩擦特性的物體時(shí)自主、動(dòng)態(tài)地形成有效的運(yùn)輸隊(duì)形并完成點(diǎn)對(duì)點(diǎn)的搬運(yùn)任務(wù)。這個(gè)項(xiàng)目的價(jià)值不僅在于學(xué)術(shù)上的探索更在于其廣泛的應(yīng)用潛力。從倉(cāng)庫(kù)中搬運(yùn)大型家具或異形貨箱到災(zāi)難現(xiàn)場(chǎng)協(xié)同移開(kāi)廢墟再到太空探索中多個(gè)漫游車(chē)共同運(yùn)輸科學(xué)載荷自主協(xié)同隊(duì)形控制都是實(shí)現(xiàn)真正智能、柔性自動(dòng)化系統(tǒng)的關(guān)鍵一步。2. 核心思路與方案選型為什么是注意力機(jī)制與集中式訓(xùn)練分布式執(zhí)行當(dāng)我們決定采用MARL來(lái)解決協(xié)同運(yùn)輸問(wèn)題時(shí)首先面臨的是算法框架的選型。MARL領(lǐng)域有多種范式如完全分布式執(zhí)行每個(gè)智能體獨(dú)立學(xué)習(xí)、完全集中式控制、以及目前主流的集中式訓(xùn)練分布式執(zhí)行Centralized Training with Decentralized Execution, CTDE。對(duì)于協(xié)同運(yùn)輸這種對(duì)協(xié)作精度要求極高的任務(wù)CTDE幾乎是必然選擇。注意CTDE的核心思想是在訓(xùn)練時(shí)允許算法訪問(wèn)所有智能體的觀測(cè)信息甚至全局狀態(tài)從而學(xué)習(xí)出考慮全局協(xié)作的策略但在執(zhí)行時(shí)每個(gè)智能體只依賴(lài)自身的局部觀測(cè)做出決策。這完美契合了我們的需求訓(xùn)練時(shí)需要全局視角來(lái)理解物體形狀和隊(duì)友意圖執(zhí)行時(shí)則要求每個(gè)機(jī)器人具備自主性。然而標(biāo)準(zhǔn)的CTDE算法如MADDPG在處理我們這種“智能體數(shù)量可變、合作關(guān)系緊密”的場(chǎng)景時(shí)仍有局限。主要問(wèn)題在于“信用分配”和“可擴(kuò)展性”。當(dāng)多個(gè)機(jī)器人共同抬起一個(gè)物體時(shí)成功或失敗的結(jié)果是集體行為導(dǎo)致的很難說(shuō)清每個(gè)機(jī)器人的具體貢獻(xiàn)。此外如果使用全連接網(wǎng)絡(luò)來(lái)處理所有智能體的聯(lián)合信息當(dāng)機(jī)器人數(shù)量增加時(shí)網(wǎng)絡(luò)參數(shù)會(huì)爆炸式增長(zhǎng)并且無(wú)法處理智能體數(shù)量動(dòng)態(tài)變化的情況。這正是“Actor-Attention-Critic”這類(lèi)方法大顯身手的地方它也是當(dāng)前網(wǎng)絡(luò)上的一個(gè)熱點(diǎn)方向。其核心創(chuàng)新在于將注意力機(jī)制Attention Mechanism引入了多智能體強(qiáng)化學(xué)習(xí)的評(píng)論家Critic網(wǎng)絡(luò)中。2.1 注意力機(jī)制如何賦能協(xié)同運(yùn)輸想象一下在搬運(yùn)一個(gè)長(zhǎng)條形桌子時(shí)位于桌子兩端的兩個(gè)機(jī)器人之間的協(xié)作關(guān)系遠(yuǎn)比它們各自與位于桌子側(cè)面的機(jī)器人之間的關(guān)系更重要。注意力機(jī)制能夠讓每個(gè)智能體在Critic網(wǎng)絡(luò)中學(xué)會(huì)“關(guān)注”那些與當(dāng)前任務(wù)最相關(guān)的隊(duì)友的信息而不是平等地處理所有信息。在我們的架構(gòu)中每個(gè)智能體Actor的決策網(wǎng)絡(luò)仍然只接收自身的局部觀測(cè)如自身與物體的相對(duì)位置、自身速度、局部接觸力傳感器讀數(shù)等。而用于訓(xùn)練的那個(gè)集中式的Critic網(wǎng)絡(luò)其輸入是全局狀態(tài)所有智能體觀測(cè)的拼接加上物體狀態(tài)信息但它內(nèi)部通過(guò)一個(gè)注意力層來(lái)處理這些信息。具體來(lái)說(shuō)對(duì)于智能體iCritic網(wǎng)絡(luò)會(huì)計(jì)算一個(gè)“查詢Query”而將所有其他智能體的觀測(cè)作為“鍵Key”和“值Value”。通過(guò)注意力計(jì)算智能體i的Critic能動(dòng)態(tài)地為其他每個(gè)智能體的觀測(cè)信息分配一個(gè)權(quán)重注意力分?jǐn)?shù)。這個(gè)權(quán)重的高低直接反映了在當(dāng)下時(shí)刻該隊(duì)友的行為對(duì)智能體i完成任務(wù)價(jià)值的影響程度。例如當(dāng)一個(gè)機(jī)器人需要調(diào)整姿態(tài)以防止物體傾斜時(shí)它會(huì)更加關(guān)注那些位于物體重心另一側(cè)的隊(duì)友的狀態(tài)。這種設(shè)計(jì)帶來(lái)了三大優(yōu)勢(shì)更好的信用分配通過(guò)注意力權(quán)重我們可以事后分析或設(shè)計(jì)輔助損失函數(shù)來(lái)理解協(xié)作關(guān)系讓獎(jiǎng)勵(lì)更合理地回饋給貢獻(xiàn)更大的智能體。可擴(kuò)展性與泛化性注意力機(jī)制對(duì)輸入序列的順序不敏感且能處理可變長(zhǎng)度的輸入。這意味著我們訓(xùn)練好的策略可以泛化到不同數(shù)量的機(jī)器人團(tuán)隊(duì)上在一定范圍內(nèi)。這對(duì)于實(shí)際應(yīng)用至關(guān)重要因?yàn)闄C(jī)器人團(tuán)隊(duì)規(guī)??赡芤蛉蝿?wù)而異。提升策略性能智能體學(xué)會(huì)了聚焦于關(guān)鍵信息減少了無(wú)關(guān)信息的干擾從而能學(xué)習(xí)到更高效、更魯棒的協(xié)作策略。2.2 整體訓(xùn)練框架設(shè)計(jì)我們的訓(xùn)練在模擬環(huán)境中進(jìn)行使用NVIDIA Isaac Gym或PyBullet等物理仿真平臺(tái)。環(huán)境設(shè)置如下智能體多個(gè)移動(dòng)機(jī)器人如差速驅(qū)動(dòng)機(jī)器人或全向移動(dòng)機(jī)器人頂部配備一個(gè)可伸縮或簡(jiǎn)單旋轉(zhuǎn)的“操縱器”簡(jiǎn)化模型用于模擬抵住或抓取動(dòng)作。物體隨機(jī)生成不同形狀凸形/凹形、質(zhì)量和尺寸的物體。物體的物理屬性質(zhì)量、摩擦系數(shù)也在一定范圍內(nèi)隨機(jī)化。任務(wù)智能體群初始隨機(jī)分布在物體周?chē)?。它們需要通過(guò)局部觀測(cè)到物體表面的最近點(diǎn)距離、法向量方向、自身姿態(tài)等自主運(yùn)動(dòng)到合適的接觸點(diǎn)形成穩(wěn)定支撐然后協(xié)同將物體搬運(yùn)至一個(gè)隨機(jī)指定的目標(biāo)位置。獎(jiǎng)勵(lì)函數(shù)設(shè)計(jì)這是強(qiáng)化學(xué)習(xí)成功的關(guān)鍵。我們?cè)O(shè)計(jì)了一個(gè)包含多項(xiàng)目標(biāo)的獎(jiǎng)勵(lì)函數(shù)R_distance: 物體質(zhì)心與目標(biāo)位置距離的負(fù)獎(jiǎng)勵(lì)鼓勵(lì)靠近目標(biāo)。R_formation: 基于物體穩(wěn)定性計(jì)算的獎(jiǎng)勵(lì)。例如通過(guò)計(jì)算所有接觸點(diǎn)形成的支撐多邊形是否包含物體質(zhì)心投影以及接觸力是否均衡來(lái)獎(jiǎng)勵(lì)穩(wěn)定的隊(duì)形。R_effort: 對(duì)智能體總能耗與電機(jī)扭矩和速度相關(guān)的微小懲罰鼓勵(lì)高效運(yùn)動(dòng)。R_collision: 智能體與障礙物或其他智能體發(fā)生碰撞的懲罰。R_time: 每一步的小額時(shí)間懲罰鼓勵(lì)快速完成任務(wù)。最終的獎(jiǎng)勵(lì)是這些項(xiàng)的加權(quán)和R_total w1 * R_distance w2 * R_formation w3 * R_effort w4 * R_collision w5 * R_time。調(diào)整這些權(quán)重是調(diào)參的重點(diǎn)初期應(yīng)更注重R_formation以確保學(xué)會(huì)形成隊(duì)形。3. 核心細(xì)節(jié)解析狀態(tài)、動(dòng)作與網(wǎng)絡(luò)架構(gòu)3.1 智能體的觀測(cè)空間與動(dòng)作空間要讓智能體學(xué)會(huì)協(xié)作首先必須告訴它們“世界是什么樣子”。由于我們強(qiáng)調(diào)局部感知每個(gè)智能體的觀測(cè)空間設(shè)計(jì)如下自身狀態(tài)智能體本身的線速度、角速度、朝向。相對(duì)物體信息智能體到物體表面最近點(diǎn)的向量距離和方向、該接觸點(diǎn)處的物體表面法向量。這是判斷“哪里可以推/頂”的關(guān)鍵。相對(duì)目標(biāo)信息智能體自身到全局目標(biāo)點(diǎn)的向量。這提供了導(dǎo)航的基本方向。局部隊(duì)友信息可選為了促進(jìn)協(xié)作可以包含鄰近一定距離內(nèi)的1-2個(gè)隊(duì)友的相對(duì)位置和速度。這為注意力機(jī)制提供了更豐富的上下文。動(dòng)作空間則相對(duì)簡(jiǎn)單對(duì)于差速移動(dòng)機(jī)器人可以設(shè)計(jì)為連續(xù)動(dòng)作空間[v_left, v_right]或[線速度角速度]。對(duì)于更復(fù)雜的機(jī)器人可能還包括機(jī)械臂末端執(zhí)行器的簡(jiǎn)單動(dòng)作。3.2 基于注意力機(jī)制的Critic網(wǎng)絡(luò)實(shí)現(xiàn)這里以PyTorch框架為例簡(jiǎn)要展示核心的注意力Critic網(wǎng)絡(luò)結(jié)構(gòu)。Actor網(wǎng)絡(luò)是標(biāo)準(zhǔn)的MLP多層感知機(jī)此處不贅述。import torch import torch.nn as nn import torch.nn.functional as F class AttentionCritic(nn.Module): def __init__(self, state_dim, action_dim, num_agents, hidden_dim128, attend_heads2): super(AttentionCritic, self).__init__() self.num_agents num_agents self.state_dim state_dim # 單個(gè)智能體的狀態(tài)維度 self.action_dim action_dim # 編碼層將每個(gè)智能體的狀態(tài)動(dòng)作對(duì)編碼為特征向量 self.encoder nn.Sequential( nn.Linear(state_dim action_dim, hidden_dim), nn.ReLU(), nn.Linear(hidden_dim, hidden_dim) ) # 注意力層使用多頭注意力 self.attention nn.MultiheadAttention(embed_dimhidden_dim, num_headsattend_heads, batch_firstTrue) # 后續(xù)處理層融合注意力輸出并計(jì)算Q值 self.fc1 nn.Linear(hidden_dim, hidden_dim) self.fc2 nn.Linear(hidden_dim, 1) # 輸出單個(gè)Q值 def forward(self, states, actions): # states: [batch_size, num_agents, state_dim] # actions: [batch_size, num_agents, action_dim] batch_size states.size(0) # 拼接狀態(tài)和動(dòng)作 x torch.cat([states, actions], dim-1) # [batch, num_agents, state_dimaction_dim] # 編碼每個(gè)智能體的信息 encoded self.encoder(x) # [batch, num_agents, hidden_dim] # 注意力機(jī)制每個(gè)智能體都作為查詢關(guān)注所有智能體包括自己 # 這里使用自注意力讓智能體相互關(guān)注 attended, _ self.attention(encoded, encoded, encoded) # [batch, num_agents, hidden_dim] # 對(duì)每個(gè)智能體的注意力輸出進(jìn)行后續(xù)處理這里我們?nèi)∷兄悄荏w特征的均值作為全局狀態(tài)的表征然后計(jì)算Q值 global_feature attended.mean(dim1) # [batch, hidden_dim] q F.relu(self.fc1(global_feature)) q self.fc2(q) # [batch, 1] return q在實(shí)際應(yīng)用中我們可能會(huì)為每個(gè)智能體維護(hù)一個(gè)獨(dú)立的Critic網(wǎng)絡(luò)參數(shù)共享每個(gè)Critic接收全局信息但輸出針對(duì)該智能體的Q值。注意力機(jī)制使得每個(gè)Critic在處理全局信息時(shí)能動(dòng)態(tài)聚焦。3.3 訓(xùn)練流程與技巧訓(xùn)練采用標(biāo)準(zhǔn)的Actor-Critic框架例如基于DDPG或SAC的MARL變種。流程簡(jiǎn)述如下每個(gè)智能體根據(jù)當(dāng)前策略Actor和環(huán)境狀態(tài)選擇動(dòng)作并執(zhí)行。環(huán)境返回新的狀態(tài)和團(tuán)隊(duì)共同獎(jiǎng)勵(lì)。將轉(zhuǎn)換(s, a, r, s)存入一個(gè)共享的經(jīng)驗(yàn)回放緩沖區(qū)。從緩沖區(qū)采樣一批數(shù)據(jù)用于更新網(wǎng)絡(luò)。更新Critic最小化時(shí)序差分誤差TD-error。更新Actor使用Critic計(jì)算出的Q值梯度通過(guò)策略梯度上升來(lái)更新Actor參數(shù)使得智能體選擇能獲得更高Q值的動(dòng)作。實(shí)操心得課程學(xué)習(xí)Curriculum Learning至關(guān)重要不要一開(kāi)始就讓智能體學(xué)習(xí)搬運(yùn)復(fù)雜物體。訓(xùn)練應(yīng)從簡(jiǎn)單場(chǎng)景開(kāi)始例如階段一固定物體形狀如立方體固定機(jī)器人數(shù)量2個(gè)目標(biāo)點(diǎn)很近。讓智能體先學(xué)會(huì)最基本的“靠近并穩(wěn)定接觸”。階段二增加機(jī)器人數(shù)量或讓目標(biāo)點(diǎn)動(dòng)態(tài)變化。階段三引入簡(jiǎn)單的不規(guī)則形狀如L形。階段四隨機(jī)化物體所有屬性形狀、質(zhì)量、大小和初始位置。 這種循序漸進(jìn)的方式能極大提高訓(xùn)練成功率和最終策略的魯棒性。獎(jiǎng)勵(lì)塑形Reward Shaping是藝術(shù)R_formation隊(duì)形獎(jiǎng)勵(lì)的設(shè)計(jì)尤其關(guān)鍵。除了支撐多邊形還可以考慮接觸點(diǎn)分布的均勻性、合力方向與目標(biāo)方向的一致性等。初期可以給予更密集的引導(dǎo)性獎(jiǎng)勵(lì)后期逐漸稀疏化。模擬與現(xiàn)實(shí)的鴻溝在仿真中我們可以獲得完美的狀態(tài)信息如精確的物體表面法向量。在現(xiàn)實(shí)中這需要通過(guò)深度相機(jī)和點(diǎn)云處理來(lái)估計(jì)。在訓(xùn)練后期應(yīng)在觀測(cè)中加入模擬的傳感器噪聲以增強(qiáng)策略的魯棒性。4. 從仿真到現(xiàn)實(shí)部署與實(shí)際問(wèn)題當(dāng)在仿真中獲得一個(gè)表現(xiàn)良好的策略后下一步就是部署到真實(shí)的機(jī)器人系統(tǒng)。這面臨著著名的“仿真到現(xiàn)實(shí)Sim2Real”的挑戰(zhàn)。4.1 策略遷移與領(lǐng)域隨機(jī)化我們的策略輸入是局部觀測(cè)。在真實(shí)機(jī)器人上這些觀測(cè)需要通過(guò)傳感器獲取自身狀態(tài)通過(guò)輪式編碼器和IMU慣性測(cè)量單元獲得。相對(duì)物體信息這是最大的挑戰(zhàn)。需要利用RGB-D相機(jī)獲取點(diǎn)云通過(guò)實(shí)時(shí)點(diǎn)云處理找到距離機(jī)器人最近的物體點(diǎn)并估算該點(diǎn)的法向量。這涉及到計(jì)算機(jī)視覺(jué)和實(shí)時(shí)幾何計(jì)算。相對(duì)目標(biāo)信息通過(guò)機(jī)器人定位如SLAM和已知的目標(biāo)全局坐標(biāo)來(lái)計(jì)算。為了縮小Sim2Real的差距在訓(xùn)練階段就必須使用領(lǐng)域隨機(jī)化Domain Randomization物理參數(shù)隨機(jī)化在仿真中隨機(jī)化機(jī)器人的質(zhì)量、輪子摩擦力、電機(jī)延遲、傳感器噪聲高斯噪聲、丟幀等。視覺(jué)外觀隨機(jī)化隨機(jī)化物體、地板和墻壁的紋理、顏色、光照條件。這迫使策略學(xué)習(xí)更本質(zhì)的幾何和物理特征而非依賴(lài)仿真的視覺(jué)特征。動(dòng)力學(xué)隨機(jī)化使用非精確的物理模型或在物理參數(shù)上添加擾動(dòng)。這樣訓(xùn)練出的策略其對(duì)感知和動(dòng)力學(xué)的不確定性具有更強(qiáng)的適應(yīng)性更有可能直接遷移到現(xiàn)實(shí)世界。4.2 現(xiàn)實(shí)部署中的安全與容錯(cuò)在真實(shí)環(huán)境中安全是第一位的。部署時(shí)必須增加多層安全措施動(dòng)作濾波與限幅對(duì)神經(jīng)網(wǎng)絡(luò)輸出的原始動(dòng)作進(jìn)行低通濾波防止高頻抖動(dòng)嚴(yán)格限制最大速度和加速度。緊急停止每個(gè)機(jī)器人配備急停按鈕并且策略網(wǎng)絡(luò)可以接收一個(gè)“停止”指令覆蓋任何輸出。狀態(tài)監(jiān)控與恢復(fù)部署一個(gè)上層監(jiān)控器持續(xù)檢查隊(duì)形穩(wěn)定性如通過(guò)機(jī)器人底盤(pán)的壓力傳感器估計(jì)接觸力。如果檢測(cè)到物體嚴(yán)重傾斜或即將掉落監(jiān)控器可以觸發(fā)一個(gè)恢復(fù)子程序或者讓所有機(jī)器人緩慢降速停止。人機(jī)交互接口設(shè)計(jì)一個(gè)簡(jiǎn)單的界面允許操作人員指定目標(biāo)點(diǎn)、調(diào)整隊(duì)形偏好如“更注重速度”或“更注重穩(wěn)定”甚至在必要時(shí)進(jìn)行微調(diào)干預(yù)。5. 常見(jiàn)問(wèn)題、調(diào)試技巧與未來(lái)展望在實(shí)際開(kāi)發(fā)和實(shí)驗(yàn)過(guò)程中你會(huì)遇到各種各樣的問(wèn)題。以下是一些典型問(wèn)題及其排查思路問(wèn)題現(xiàn)象可能原因排查與解決思路智能體無(wú)法形成有效接觸獎(jiǎng)勵(lì)函數(shù)中R_formation權(quán)重太低或設(shè)計(jì)不當(dāng)初期探索不足。1. 可視化訓(xùn)練過(guò)程中接觸點(diǎn)的分布。2. 增加R_formation的權(quán)重或?qū)⑵浞纸鉃楦?xì)粒度的獎(jiǎng)勵(lì)如“距離物體近”獎(jiǎng)勵(lì)、“接觸點(diǎn)法向量對(duì)齊”獎(jiǎng)勵(lì)。3. 在課程學(xué)習(xí)的初期使用引導(dǎo)策略如人工演示或基于規(guī)則的控制器生成專(zhuān)家數(shù)據(jù)進(jìn)行模仿學(xué)習(xí)預(yù)熱。隊(duì)形不穩(wěn)定物體晃動(dòng)或掉落策略過(guò)于激進(jìn)追求速度忽略穩(wěn)定Critic網(wǎng)絡(luò)未能準(zhǔn)確評(píng)估穩(wěn)定性價(jià)值。1. 在獎(jiǎng)勵(lì)中增加對(duì)物體角速度或姿態(tài)變化率的懲罰。2. 在Critic的輸入中顯式加入物體姿態(tài)歐拉角和角速度作為全局狀態(tài)的一部分。3. 檢查注意力權(quán)重可視化看智能體是否在搬運(yùn)過(guò)程中關(guān)注了正確的隊(duì)友例如對(duì)角線位置的智能體應(yīng)相互關(guān)注以保持平衡。訓(xùn)練不收斂獎(jiǎng)勵(lì)曲線震蕩大學(xué)習(xí)率過(guò)高經(jīng)驗(yàn)回放緩沖區(qū)太小或采樣方式有問(wèn)題智能體之間存在策略非平穩(wěn)性問(wèn)題。1. 降低Actor和Critic的學(xué)習(xí)率。2. 增大回放緩沖區(qū)容量并確保采樣是隨機(jī)的。3. 嘗試使用具有較好穩(wěn)定性的MARL算法如MAPPOMulti-Agent PPO或QMIX如果動(dòng)作空間離散。4. 使用策略集成或定期同步策略參數(shù)來(lái)緩解非平穩(wěn)性。仿真策略無(wú)法在真機(jī)上工作Sim2Real差距過(guò)大真實(shí)傳感器噪聲未建模執(zhí)行器延遲不一致。1. 加強(qiáng)領(lǐng)域隨機(jī)化的強(qiáng)度。2. 在仿真中接入一個(gè)真實(shí)的傳感器模型如ROS中的相機(jī)模型來(lái)生成觀測(cè)。3. 在真機(jī)上收集少量數(shù)據(jù)進(jìn)行在線自適應(yīng)或微調(diào)。使用仿真策略作為初始化在真機(jī)安全環(huán)境下進(jìn)行短時(shí)間的在線學(xué)習(xí)。我個(gè)人在實(shí)驗(yàn)中的深刻體會(huì)是多智能體協(xié)同運(yùn)輸?shù)某晒ξ宸挚克惴ㄔO(shè)計(jì)五分靠系統(tǒng)工程和耐心調(diào)試。獎(jiǎng)勵(lì)函數(shù)的調(diào)整往往需要數(shù)十次甚至上百次的嘗試才能找到那個(gè)能讓智能體“開(kāi)竅”的平衡點(diǎn)??梢暬ぞ呷鐚?shí)時(shí)渲染智能體的注意力熱圖、接觸力矢量、內(nèi)部?jī)r(jià)值函數(shù)是必不可少的調(diào)試助手它們能讓你直觀地理解智能體“在想什么”從而有針對(duì)性地改進(jìn)。這個(gè)項(xiàng)目的魅力在于它打開(kāi)了一扇通往更智能、更柔性多機(jī)器人系統(tǒng)的大門(mén)。未來(lái)我們可以沿著多個(gè)方向拓展異構(gòu)機(jī)器人團(tuán)隊(duì)讓輪式機(jī)器人和足式機(jī)器人協(xié)作發(fā)揮各自優(yōu)勢(shì)。動(dòng)態(tài)環(huán)境與避障在訓(xùn)練中引入移動(dòng)障礙物讓策略學(xué)會(huì)在線重規(guī)劃隊(duì)形和路徑。人機(jī)協(xié)同將人也作為一個(gè)智能體納入MARL框架學(xué)習(xí)如何與人自然、安全地共同搬運(yùn)物體。從運(yùn)輸?shù)窖b配將隊(duì)形控制與精細(xì)操作結(jié)合實(shí)現(xiàn)多機(jī)器人協(xié)同裝配等更復(fù)雜的任務(wù)。從讓一群智能體學(xué)會(huì)“一起搬東西”開(kāi)始我們正在一步步地教會(huì)它們?nèi)绾蜗褚粋€(gè)真正的團(tuán)隊(duì)那樣思考和行動(dòng)。這其中的挑戰(zhàn)與樂(lè)趣正是驅(qū)動(dòng)我們不斷探索的核心所在。