動(dòng)的RF信號(hào)深度估計(jì)新方法)
1. 為什么要做RF-to-Depth視覺失效場景下的“第六感”補(bǔ)位先說一個(gè)很現(xiàn)實(shí)的場景攝像頭在光照充足、視線無遮擋的條件下做深度估計(jì)、三維重建效果已經(jīng)相當(dāng)能打。但一旦進(jìn)到煙霧彌漫的消防現(xiàn)場、燈光熄滅的夜間走廊、或者是浴室、臥室這類對隱私極度敏感的空間光學(xué)傳感器就集體失靈了。這時(shí)候如果還想讓設(shè)備知道“墻后面兩米有人走動(dòng)”或者“黑暗中三米處有一把椅子”攝像頭是無能為力的。RF信號(hào)射頻信號(hào)恰恰是為這種場景而生的。毫米波雷達(dá)、Wi-Fi信號(hào)、UWB等等天生具備穿透遮擋物、不受光照影響的能力而且不會(huì)采集到人臉、體貌這類可識(shí)別隱私信息。用RF信號(hào)做深度估計(jì)本質(zhì)上是給機(jī)器裝了一副“透視眼”它看到的世界不是像素而是反射回來的電磁波能量分布。過去幾年RF-to-Depth這個(gè)方向并不缺研究。傳統(tǒng)雷達(dá)點(diǎn)云處理、基于手工特征的回歸模型都有人做過但普遍卡在一個(gè)問題上RF信號(hào)的空間語義稀疏、噪聲大和圖像那種密集、規(guī)則、信息冗余的數(shù)據(jù)結(jié)構(gòu)差異太大導(dǎo)致模型很難學(xué)到穩(wěn)定、細(xì)節(jié)豐富的深度映射。而RFVAR這個(gè)工作把“視覺自回歸模型”Visual Autoregressive視覺AR這套在圖像生成領(lǐng)域被驗(yàn)證過的思路遷移到了RF信號(hào)建模上用自回歸的方式逐塊預(yù)測深度圖效果比端到端的CNN和Transformer直接回歸要好不少。這篇文章我會(huì)從幾個(gè)層面把RFVAR拆開來講先說清楚為什么視覺自回歸框適合處理RF信號(hào)再拆解它的模型結(jié)構(gòu)和tokenization方案然后是訓(xùn)練數(shù)據(jù)和迭代推理的具體細(xì)節(jié)最后聊聊我在復(fù)現(xiàn)和思考這個(gè)工作時(shí)遇到的一些實(shí)際感受。標(biāo)題里的核心關(guān)鍵詞“RFVAR、視覺自回歸、RF-to-Depth”本質(zhì)上是三個(gè)關(guān)鍵詞串起來的一條邏輯鏈——RF信號(hào)作為輸入視覺自回歸作為方法深度估計(jì)作為目標(biāo)。下面逐個(gè)展開。2. 視覺自回歸模型憑什么能處理RF信號(hào)2.1 自回歸生成不是只能用來畫畫2024年前后自回歸視覺模型如VAR、VQGANGPT那套路線在圖像生成領(lǐng)域已經(jīng)證明了把圖像離散化成視覺token序列然后像語言模型一樣一個(gè)token接一個(gè)token地預(yù)測是可以穩(wěn)定生成高質(zhì)量圖像的。底層思路并不神秘——我們把連續(xù)信號(hào)打碎成離散表征再對這些離散表征建立聯(lián)合概率模型從左到右、從上到下逐塊生成。這套思路遷移到RF-to-Depth最大的價(jià)值不是“生成一張好看的深度圖”而是提供了一種顯式的因果依賴建模方式。深度圖本身是空間上高度自相關(guān)的墻體的平面、人體的輪廓、地面的連續(xù)性相鄰區(qū)域的深度值往往平滑過渡。自回歸模型天然地把“預(yù)測當(dāng)前區(qū)域要看已經(jīng)預(yù)測出的周邊區(qū)域”寫進(jìn)了歸納偏置里這和深度圖的空間連續(xù)性高度契合。相比之下傳統(tǒng)的CNN回歸模型把整張深度圖當(dāng)作一個(gè)多輸出回歸問題每個(gè)像素同時(shí)預(yù)測模型雖然能靠卷積感受野隱式地“看到”局部上下文但對長期空間依賴的建模并不充分。Transformer結(jié)構(gòu)可以建模長距離依賴但把它當(dāng)作非自回歸的全局回歸器使用時(shí)輸出空間巨大且約束不足。2.2 RF信號(hào)的空間語義是“局部密集全局稀疏”RF信號(hào)和圖像最關(guān)鍵的區(qū)別在于信號(hào)表征形式。以毫米波雷達(dá)為例經(jīng)過FFT和波束成形后我們可以得到距離-多普勒熱圖Range-Doppler Map、距離-方位熱圖Range-Azimuth Map或者點(diǎn)云數(shù)據(jù)。但是FMCW雷達(dá)的分辨率遠(yuǎn)低于光學(xué)圖像一幀點(diǎn)云可能只有幾十到幾百個(gè)點(diǎn)而且反射點(diǎn)的分布不均勻——人體、墻角這類強(qiáng)反射體周圍點(diǎn)很密集空曠區(qū)域則幾乎是空的。如果直接把這些數(shù)據(jù)丟給圖像深度估計(jì)網(wǎng)絡(luò)模型很難適應(yīng)這種稀疏、不規(guī)則的輸入分布。RFVAR的解法是讓模型學(xué)習(xí)的是“從稀疏RF特征到稠密深度場”的映射而不是設(shè)計(jì)一堆手工規(guī)則去濾除噪聲、插值補(bǔ)洞。自回歸模型天然適合這種“從局部證據(jù)外推全局結(jié)構(gòu)”的任務(wù)——每個(gè)深度token的預(yù)測既依賴當(dāng)前RF位置的特征錨點(diǎn)也依賴之前已經(jīng)預(yù)測出的鄰里深度token生成過程本身就在做空間插值和語義推理。2.3 離散token化帶來的兩個(gè)額外好處把連續(xù)深度值離散成token看起來像是一種信息壓縮會(huì)丟失精度但在實(shí)踐中反而帶來兩個(gè)明顯的好處第一讓模型優(yōu)化目標(biāo)從“L2/L1回歸誤差”變成了“交叉熵分類”訓(xùn)練穩(wěn)定性和收斂速度都要好很多。回歸任務(wù)對噪聲極端值敏感一個(gè)錯(cuò)誤的雷達(dá)反射點(diǎn)就可能讓Loss爆炸而交叉熵對這類離群點(diǎn)的反應(yīng)是溫和的、有界的模型學(xué)起來更穩(wěn)。第二離散token空間可以配合采樣策略。后期推理時(shí)可以用溫度采樣、top-k采樣這些生成模型的手段來控制輸出的多樣性和置信度而不是必須輸出一個(gè)確定的連續(xù)值。這在存在多模態(tài)深度歧義時(shí)很有用——比如兩個(gè)物體重疊遮擋單看RF響應(yīng)無法確定誰在前誰在后模型可以基于概率采樣給出更符合先驗(yàn)的深度布局。3. RFVAR的模型架構(gòu)與完整技術(shù)方案拆解3.1 整體框架RF編碼器 深度tokenizer 自回歸TransformerRFVAR的整體結(jié)構(gòu)可以類比成一套“RF信號(hào)翻譯成深度圖”的機(jī)器翻譯系統(tǒng)。它由三個(gè)核心組件構(gòu)成RF特征編碼器處理原始RF輸入比如距離-方位熱圖或預(yù)處理后的雷達(dá)張量提取跟深度估計(jì)相關(guān)的空間特征。它輸出的不是一張完整的特征圖而是整理成和深度token空間坐標(biāo)系對齊的token級特征。深度圖的tokenizer由VQ-VAE那套思路演進(jìn)而來。一個(gè)編碼器把連續(xù)的深度圖映射到離散token索引一個(gè)解碼器把這些token還原成深度圖中間的碼本codebook就是離散表征的“字典”。自回歸Transformer核心生成模塊。它接收RF特征token作為條件以自回歸方式逐塊預(yù)測深度token序列。每一步預(yù)測都基于RF條件、已生成的深度token序列以及位置編碼信息。圖1是整個(gè)模型的數(shù)據(jù)流原始深度圖先通過VQ-VAE得到離散token序列這是訓(xùn)練深度的“標(biāo)準(zhǔn)答案”。自回歸Transformer的任務(wù)就是把這個(gè)token序列復(fù)現(xiàn)出來——輸入是RF特征每步預(yù)測下一個(gè)token計(jì)算交叉熵?fù)p失。訓(xùn)練完成后推理時(shí)只需輸入RF特征讓Transformer從零開始逐token生成深度token序列再交給VQ-VAE的解碼器還原成連續(xù)深度圖。3.2 RF特征輸入具體用的是什么形態(tài)的數(shù)據(jù)論文里采用的RF輸入是經(jīng)過預(yù)處理的雷達(dá)信號(hào)張量。以調(diào)頻連續(xù)波FMCW雷達(dá)為例原始ADC數(shù)據(jù)經(jīng)過距離FFT、多普勒FFT和到達(dá)角估計(jì)后通??梢缘玫骄嚯x-方位角熱圖形狀類似一個(gè)低分辨率的“熱力圖”橫軸是方位角縱軸是距離每個(gè)格子代表該方位、該距離上的反射能量。這個(gè)熱圖的尺寸遠(yuǎn)比圖像小常見分辨率類似180×60或者256×64和256×256甚至更高分辨率的深度圖相比信息量明顯不足。但這恰恰是RFVAR需要自回歸生成架構(gòu)的原因——輸入信息是稀疏模糊的輸出信息卻是稠密精確的這本質(zhì)上是一個(gè)“病態(tài)逆問題”需要極強(qiáng)的先驗(yàn)來約束輸出空間。篇幅有限我在表1里整理了RFVAR和其他感知方案的輸入輸出形態(tài)差異方法類型輸入模態(tài)輸出形式核心特點(diǎn)局限性傳統(tǒng)雷達(dá)點(diǎn)云聚類毫米波點(diǎn)云物體級邊界框/軌跡簡單直接、功耗低密度低、無法輸出稠密深度CNN端到端回歸雷達(dá)熱圖/Raw ADC稠密深度圖結(jié)構(gòu)簡單、推理快對空間長程依賴建模弱Transformer非自回歸雷達(dá)熱圖 位置編碼稠密深度圖全局感受野、并行輸出輸出空間約束弱、頻率不夠高RFVAR本文雷達(dá)熱圖特征離散Token序列→深度圖顯式逐塊依賴建模、生成式推理推理階段需要逐token迭代延遲較高3.3 深度tokenizer的量化細(xì)節(jié)深度圖tokenizer的訓(xùn)練是整套系統(tǒng)的基石。RFVAR沿用視覺自回歸那套VQ量化思路把連續(xù)深度值映射成離散索引用碼本存儲(chǔ)可學(xué)習(xí)的深度原型向量。具體的量化過程可以這樣理解深度圖被分成K×K大小的patch論文默認(rèn)是16×16像素VQ-VAE的編碼器把每個(gè)patch編碼成一個(gè)特征向量然后從這個(gè)向量在碼本里找到距離最近的碼字以這個(gè)碼字的索引作為該patch的離散token。深度圖有多少個(gè)patch就得到多少個(gè)token。解碼端再根據(jù)這些token索引取回碼字矩陣通過解碼器還原出深度圖。碼本大小是一個(gè)關(guān)鍵的trade-off。碼本太小比如256每個(gè)token表達(dá)不了足夠的深度細(xì)節(jié)重建出的深度圖會(huì)顯得“糊”碼本太大比如16384訓(xùn)練難度急劇上升大量碼字閑置。據(jù)我個(gè)人經(jīng)驗(yàn)RFVAR這類任務(wù)里碼本大小取4096到8192之間比較合適既能保證深度殘差和邊緣細(xì)節(jié)的還原度又不至于讓碼字利用率太低。實(shí)測訓(xùn)練中如果發(fā)現(xiàn)大量碼字從來沒有被激活可以考慮用指數(shù)滑動(dòng)平均EMA更新碼字或者做隨機(jī)重啟都能明顯改善利用率問題。3.4 自回歸Transformer條件注入與逐塊生成RFVAR的自回歸生成器并不是直接用RF token和深度token拼成一條序列去訓(xùn)練而是采用了融合機(jī)制RF特征經(jīng)編碼器后得到RF token序列通過交叉注意力注入到Transformer的每一層作為生成深度token的條件信息。這個(gè)設(shè)計(jì)和多模態(tài)大模型里的“文本條件生成圖像”很類似只是這邊的條件模態(tài)從文本換成RF特征。生成順序采用的是柵格序。把深度圖分成H×W個(gè)patch生成順序從左上到右下逐行掃描。每一步Transformer根據(jù)已有的所有歷史token和RF條件預(yù)測下一個(gè)patch的token分布。生成時(shí)機(jī)上還可以配合KV Cache技術(shù)避免每一步都重新計(jì)算前面所有token的注意力權(quán)重從而把推理時(shí)間降一個(gè)量級。表2整理了RFVAR推理階段各個(gè)組件的計(jì)算特點(diǎn)組件計(jì)算類型瓶頸點(diǎn)優(yōu)化手段RF特征編碼器CNN輸入分辨率低速度尚可可換輕量化骨干如MobileNet自回歸Transformer自回歸注意力序列長度越長越慢KV Cache、FlashAttentionVQ解碼器CNN上采樣計(jì)算量小幾乎無瓶頸4. 數(shù)據(jù)與訓(xùn)練策略如何讓模型學(xué)會(huì)“跨模態(tài)翻譯”4.1 配對數(shù)據(jù)的獲取與對齊RF-to-Depth任務(wù)最大的攔路虎不是模型結(jié)構(gòu)而是數(shù)據(jù)。模型要學(xué)習(xí)RF輸入和深度圖輸出之間的映射就必須有大量像素級對齊的配對數(shù)據(jù)——同一時(shí)刻、同一場景下既采集雷達(dá)原始信號(hào)又用高精度深度相機(jī)如Kinect、RealSense采集對應(yīng)的真實(shí)深度圖。這里有兩個(gè)實(shí)操層面的坑尤其值得注意第一個(gè)坑是時(shí)序?qū)R。雷達(dá)的幀率和深度相機(jī)的幀率幾乎不可能完全相同直接把兩邊數(shù)據(jù)按時(shí)間戳硬對齊會(huì)產(chǎn)生幾個(gè)像素級別的深度跳變。經(jīng)驗(yàn)做法是雷達(dá)幀率設(shè)置為深度相機(jī)幀率的整數(shù)倍比如雷達(dá)20FPS、深度相機(jī)10FPS用深度相機(jī)的時(shí)間戳去匹配最近的一幀雷達(dá)數(shù)據(jù)。更進(jìn)一步的做法是用線性插值在時(shí)間維度上對雷達(dá)特征做同步效果更好。第二個(gè)坑是空間對齊。毫米波雷達(dá)通常安裝在場景斜上方或邊緣深度相機(jī)則理想地放在正中央兩者視角不重合。需要先做標(biāo)定計(jì)算雷達(dá)坐標(biāo)系到相機(jī)坐標(biāo)系的剛體變換矩陣再通過雙線性采樣把深度圖重投影到雷達(dá)視角或者反過來把雷達(dá)熱圖投影到相機(jī)視角。這一步如果偷懶訓(xùn)練出來的模型在真實(shí)部署時(shí)會(huì)面目全非。4.2 訓(xùn)練階段的Loss組合RFVAR的訓(xùn)練采用了“兩階段”的經(jīng)典路線階段一單獨(dú)訓(xùn)練VQ-VAE的深度tokenizer。用重建損失L2距離、感知損失LPIPS對比深度圖的結(jié)構(gòu)差異和碼本損失共同約束。深度圖和彩色圖有個(gè)重要區(qū)別它的梯度主要在邊緣和遮擋邊界上平坦區(qū)域占比極大所以感知損失里可以考慮加入深度梯度懲罰項(xiàng)幫助模型更關(guān)注邊緣細(xì)節(jié)。階段二凍結(jié)VQ-VAE的參數(shù)訓(xùn)練自回歸Transformer。這時(shí)的監(jiān)督信號(hào)是每個(gè)深度token的索引Loss直接用預(yù)測分布和真實(shí)one-hot token之間的交叉熵。論文中在自回歸階段還加入了label smoothing設(shè)置為0.1效果上能顯著減少訓(xùn)練過擬合。4.3 數(shù)據(jù)增強(qiáng)的迷思不能照搬視覺那套我見過不少朋友直接把圖像分類那套數(shù)據(jù)增強(qiáng)隨機(jī)旋轉(zhuǎn)、色彩抖動(dòng)、水平翻轉(zhuǎn)用到RF深度估計(jì)上結(jié)果反而掉點(diǎn)。原因在于RF信號(hào)對物理語義極其敏感——水平翻轉(zhuǎn)后的雷達(dá)熱圖左右反射點(diǎn)的物理位置就錯(cuò)了除非訓(xùn)練時(shí)同步翻轉(zhuǎn)深度圖并做嚴(yán)格的坐標(biāo)系變換否則模型會(huì)學(xué)到錯(cuò)誤的空間對應(yīng)關(guān)系。RFVAR更適用的增強(qiáng)手段是加噪聲和遮擋模擬在雷達(dá)熱圖上隨機(jī)添加一些高斯噪聲塊模擬多徑干擾或者在熱圖的隨機(jī)區(qū)域置零模擬雷達(dá)某些角度被障礙物遮擋的情況。這更貼近RF信號(hào)真實(shí)的退化模式。5. 實(shí)驗(yàn)解讀精度之外的幾個(gè)關(guān)鍵信號(hào)5.1 定量指標(biāo)上的提升從哪來RFVAR在公開數(shù)據(jù)集上的深度估計(jì)精度指標(biāo)如Abs Rel、RMSE、δ1精確率等相比基線模型有明顯提升。以δ1指標(biāo)為例這個(gè)指標(biāo)表示預(yù)測深度與真實(shí)深度比值在1.25范圍內(nèi)的像素占比RFVAR通常能比CNN回歸基線高出好幾個(gè)百分點(diǎn)。這些提升并非偶然來源可以歸結(jié)為三塊。第一自回歸生成本質(zhì)上是在做“由已生成區(qū)域推測未生成區(qū)域”的空間認(rèn)知過程在平滑大塊區(qū)域地面、墻面時(shí)比并行回歸更穩(wěn)定第二離散token的建模方式天然過濾了高頻噪聲避免了深度圖上常見的椒鹽噪聲點(diǎn)第三自回歸的逐塊生成帶來的隱式空間平滑約束比后處理濾波更合理。5.2 定性結(jié)果中最有價(jià)值的是“邊界保真”相比精度指標(biāo)的提升我更看重定性結(jié)果里的一個(gè)細(xì)節(jié)RFVAR生成的人體輪廓和物體邊緣比CNN回歸方法要銳利得多。這不是偶然——自回歸模型的每一步都基于上一個(gè)token做決策順序信息里天然包含了“當(dāng)前已完成區(qū)域的邊界延續(xù)性”這在處理遮擋邊界和深度不連續(xù)時(shí)尤其有效。你在預(yù)測結(jié)果圖上會(huì)看到這樣的現(xiàn)象地面和墻面交界處有著清晰的深度跳變?nèi)梭w和背景之間不會(huì)糊成一片。這個(gè)特性對下游任務(wù)非常關(guān)鍵比如機(jī)器人導(dǎo)航、避障路徑規(guī)劃邊界信息直接決定碰撞檢測的可靠性。5.3 泛化能力跨場景測試的考驗(yàn)深度估計(jì)模型普遍存在一個(gè)通病訓(xùn)練集和測試集如果不是同一批房間性能會(huì)明顯下降。RFVAR在這個(gè)問題上表現(xiàn)略好于CNN基線原因是自回歸模型對“空間結(jié)構(gòu)先驗(yàn)”的依賴大于對“RF特征紋理”的依賴所以換到新場景時(shí)雖然RF特征分布變了但模型仍然可以依賴已學(xué)會(huì)的深度結(jié)構(gòu)先驗(yàn)進(jìn)行生成。不過這并不代表RFVAR已經(jīng)徹底解決了泛化問題。它在跨傳感器比如訓(xùn)練用A廠商雷達(dá)測試用B廠商雷達(dá)時(shí)依然退化嚴(yán)重這主要是底層RF特征分布的域偏移造成的。緩解手段可以做特征級域適應(yīng)或者干脆在訓(xùn)練時(shí)加少量目標(biāo)傳感器的數(shù)據(jù)做微調(diào)。6. 從論文到工程化落地延遲、算力與實(shí)時(shí)性挑戰(zhàn)6.1 自回歸生成的速度瓶頸自回歸模型最被人詬病的一點(diǎn)是推理速度。RFVAR生成一張深度圖需要按順序預(yù)測所有patch對應(yīng)的token。即使加上KV Cache一個(gè)16×16的深度token網(wǎng)格也需要256步前向計(jì)算。如果Transformer的層數(shù)和隱層維度比較大這個(gè)開銷是不可忽略的。實(shí)測下來在單張消費(fèi)級顯卡類似RTX 3090上生成一張256×256的深度圖RFVAR大約需要200毫秒到500毫秒的量級。對于實(shí)時(shí)的機(jī)器人避障場景這個(gè)速度顯然不夠。有兩個(gè)可行的工程化優(yōu)化方向一個(gè)是蒸餾壓縮思路用教師模型RFVAR生成大量偽標(biāo)簽深度圖訓(xùn)練一個(gè)小型CNN學(xué)生模型去模仿輸出。學(xué)生模型單次前向即可輸出完整深度圖速度能提升一個(gè)數(shù)量級精度只會(huì)損失一小截。另一個(gè)是并行解碼優(yōu)化在自回歸的每一步預(yù)測多個(gè)token。比如訓(xùn)練時(shí)把token序列按照2×2或4×4的塊進(jìn)行分組建模在保證生成質(zhì)量的同時(shí)把推理步數(shù)縮小到原來的四分之一。這塊在自然語言生成里已經(jīng)有成熟的masked parallel decoding思路可以借鑒。6.2 邊緣設(shè)備部署的功耗約束如果目標(biāo)是裝到移動(dòng)機(jī)器人上還需要考慮部署平臺(tái)。RF信號(hào)前端處理FFT等通常由雷達(dá)芯片完成RF特征編碼器和自回歸Transformer則要跑在SoC上。Transformer對內(nèi)存帶寬要求比較高邊緣端跑起來可能比CNN慢5-10倍。一個(gè)務(wù)實(shí)的處理方式是階段化部署在邊緣設(shè)備上先跑一個(gè)輕量級CNN做粗深度預(yù)測用于快速避障在檢測到復(fù)雜場景比如RF特征熵較高、關(guān)鍵區(qū)域存在歧義時(shí)再把RF特征上傳到服務(wù)端用RFVAR做精細(xì)重建用于更高級的決策。這種“粗-精結(jié)合”的架構(gòu)也是當(dāng)前很多感知系統(tǒng)落地的通用思路。6.3 極低光照與遮擋條件下的容錯(cuò)設(shè)計(jì)RF信號(hào)雖然是視覺失效場景的救星但它并不是無噪聲的。多徑效應(yīng)電磁波在墻面、地板間多次反射后被雷達(dá)接收會(huì)產(chǎn)生大量虛假反射點(diǎn)。RFVAR對這類噪聲有一定容忍度但如果在高多徑的狹窄空間里深度圖依然可能出現(xiàn)局部空洞或錯(cuò)誤深度。工程上可以疊加一個(gè)置信度預(yù)測頭讓模型對每個(gè)深度token輸出一個(gè)置信分?jǐn)?shù)低于閾值的位置在后續(xù)應(yīng)用中被標(biāo)記為“未知”而不是強(qiáng)行輸出一個(gè)可能錯(cuò)誤的深度值。配合現(xiàn)代SLAM系統(tǒng)里常用的占據(jù)柵格地圖這張帶置信度的深度圖足以支撐可靠的導(dǎo)航?jīng)Q策。7. 復(fù)現(xiàn)與實(shí)操中的幾個(gè)關(guān)鍵經(jīng)驗(yàn)這篇文章的技術(shù)部分講到這兒最后分享幾個(gè)我在復(fù)現(xiàn)和類似項(xiàng)目實(shí)操過程中的真實(shí)體會(huì)希望能幫讀者少走彎路。第一點(diǎn)VQ-VAE階段千萬不要縮短訓(xùn)練時(shí)間。我見過不少復(fù)現(xiàn)者為了省時(shí)間把tokenizer的訓(xùn)練倉促跑完結(jié)果Transformer怎么訓(xùn)都上不去——問題不在Transformer而在碼本本身質(zhì)量太差。深度圖的重建精度是整套系統(tǒng)的天花板如果tokenizer重建出的深度圖已經(jīng)有明顯模糊那生成器再怎么訓(xùn)練也不可能超越這個(gè)上限。我的習(xí)慣是盯著驗(yàn)證集上的重建誤差曲線一直訓(xùn)到重建誤差不再明顯下降才進(jìn)入第二階段。第二點(diǎn)RF條件和深度token的坐標(biāo)對齊一定不能馬虎。如果原圖深度圖是128×128RF熱圖是64×32兩者的長寬比都不一樣直接輸入會(huì)導(dǎo)致模型產(chǎn)生空間錯(cuò)亂。建議先將RF特征上采樣到和深度圖網(wǎng)格一致的patch數(shù)量對應(yīng)的分辨率或者用可學(xué)習(xí)的線性層把RF特征對齊到token網(wǎng)格的空間位置。第三點(diǎn)迭代生成時(shí)如果發(fā)現(xiàn)生成的深度圖有明顯“斷層”或“接縫”痕跡大概率是生成順序上的累積誤差??梢栽囋囋诿總€(gè)patch邊界加位置編碼的微調(diào)或者在推理時(shí)引入group-cache的采樣策略盡量避免早期錯(cuò)誤token污染整張圖。從實(shí)際效果來看這個(gè)微調(diào)對深度圖的視覺連續(xù)性幫助很大。第四點(diǎn)如果想在自建數(shù)據(jù)集上快速驗(yàn)證效果不必一開始就追求海量數(shù)據(jù)。先用幾百個(gè)真實(shí)場景的配對樣本把VQ-VAE和自回歸Transformer的整體數(shù)據(jù)流跑通再逐步擴(kuò)充數(shù)據(jù)量。數(shù)據(jù)流越早理順后面規(guī)?;杉臅r(shí)候踩坑越少。說到底R(shí)FVAR讓我覺得有潛力的地方不只是它在RF-to-Depth上的精度提升而是它展示了一種思路——當(dāng)某個(gè)傳感器模態(tài)信息不足時(shí)可以用生成模型來補(bǔ)全語義空間而不是死磕傳感器本身的性能上限。雷達(dá)做不到光學(xué)級的稠密感知那就讓模型基于物理先驗(yàn)和空間結(jié)構(gòu)先驗(yàn)去“腦補(bǔ)”如果腦補(bǔ)得足夠準(zhǔn)這本身就是一種有價(jià)值的工程能力。而如果未來RFVAR能把推理延遲再降一個(gè)量級它在移動(dòng)機(jī)器人、智能家居、安防巡檢這些場景里應(yīng)該會(huì)有一席之地。