時(shí)目標(biāo)跟蹤系統(tǒng)設(shè)計(jì)與實(shí)現(xiàn))
這篇文章聊聊我最近完成的一個(gè)FPGA目標(biāo)跟蹤項(xiàng)目基于SAD模板匹配算法實(shí)現(xiàn)目標(biāo)坐標(biāo)的實(shí)時(shí)輸出。SAD全稱Sum of Absolute Differences中文叫絕對(duì)差值和是模板匹配里最基礎(chǔ)、也最適合硬件實(shí)現(xiàn)的一類相似度度量。項(xiàng)目里我把一路640×48060fps的視頻流送進(jìn)Xilinx Artix-7系列FPGA模板匹配引擎全程不經(jīng)過(guò)CPU、也不依賴外部DDR圖像像素從傳感器一出來(lái)就直接進(jìn)入匹配流水線最終在輸出端拿到目標(biāo)中心坐標(biāo)。整個(gè)系統(tǒng)綜合后穩(wěn)定跑在100MHz以上單幀跟蹤延遲做到微秒級(jí)CPU全程沒(méi)有參與任何圖像計(jì)算。這個(gè)項(xiàng)目適合兩類人參考一是剛接觸FPGA圖像處理想知道“模板匹配這種算法到底怎么落到硬件上”的開(kāi)發(fā)者二是已經(jīng)在用CPU或HALCON這類工具做視覺(jué)檢測(cè)但對(duì)實(shí)時(shí)性不滿、想評(píng)估FPGA方案的工程師。下面我會(huì)把從算法復(fù)雜度估算、硬件架構(gòu)設(shè)計(jì)、流水線切分到跟蹤策略和實(shí)際踩坑的完整鏈路都展開(kāi)講盡量把每個(gè)“為什么這么做”都說(shuō)清楚。1. 從“攝像頭進(jìn)、坐標(biāo)出”說(shuō)起為什么目標(biāo)跟蹤會(huì)選擇FPGA1.1 實(shí)時(shí)視頻處理的時(shí)間預(yù)算先算一筆最常見(jiàn)的賬。假設(shè)視頻是VGA分辨率640×48060fps一幀的可用處理時(shí)間只有16.7ms。如果目標(biāo)模板是8×8像素、搜索區(qū)域是40×40像素那么候選位置有(40-81)21089個(gè)每個(gè)候選位置要算64次減法和63次加法單目標(biāo)的總計(jì)算量在二十萬(wàn)次運(yùn)算級(jí)別。聽(tīng)起來(lái)不多對(duì)吧但真用CPU做起來(lái)問(wèn)題往往不是算力不夠而是數(shù)據(jù)搬移太慢。攝像頭數(shù)據(jù)要經(jīng)過(guò)MIPI或DVP接口進(jìn)到主控主控再通過(guò)DMA搬到內(nèi)存CPU再?gòu)膬?nèi)存取回來(lái)做匹配。這一圈下來(lái)純運(yùn)算可能只要幾百微秒但幀延遲輕松到幾十毫秒。更麻煩的是一旦目標(biāo)數(shù)量增加到四五個(gè)、搜索范圍再擴(kuò)大到半搜索半徑32像素CPU端的幀率立刻斷崖式下跌。FPGA解決的是另一件事像素從傳感器出來(lái)之后根本不落地直接流進(jìn)匹配引擎。數(shù)據(jù)在哪一拍的寄存器里、參與哪一拍的運(yùn)算全部在硬件里固定好。這種“邊進(jìn)邊算”的流式處理理論上能做到每個(gè)時(shí)鐘周期處理一個(gè)像素而且延遲是確定的、可預(yù)測(cè)的。1.2 CPU和FPGA處理模板匹配的本質(zhì)差異CPU是“取指-譯碼-執(zhí)行”的馮諾依曼結(jié)構(gòu)一條指令處理一個(gè)數(shù)據(jù)雖然流水線也能疊加但本質(zhì)上還是串行思維。GPU雖然并行能力強(qiáng)但延遲高、功耗大還需要主機(jī)配合。FPGA呢本質(zhì)上是把算法直接“畫”成了硬件電路64個(gè)絕對(duì)差運(yùn)算可以同時(shí)做加法樹(shù)可以逐級(jí)展開(kāi)比較器可以每個(gè)周期刷新最優(yōu)值。平臺(tái)并行方式典型延遲開(kāi)發(fā)難度功耗CPU多核指令流水幾十毫秒級(jí)低中等DSP定點(diǎn)指令并行毫秒級(jí)中低GPU大規(guī)模SIMT十幾毫秒級(jí)中高高FPGA空間并行流水線微秒級(jí)高低在工業(yè)視覺(jué)、無(wú)人機(jī)視覺(jué)里幾十毫秒的延遲往往直接決定系統(tǒng)能不能用。舉個(gè)例子目標(biāo)在畫面里以每幀20像素的速度運(yùn)動(dòng)30fps下幀間目標(biāo)移動(dòng)了約20像素如果你的處理延遲是50ms那目標(biāo)已經(jīng)移動(dòng)了一個(gè)身位控制回路根本沒(méi)法定點(diǎn)。FPGA的微秒級(jí)延遲讓“當(dāng)前幀目標(biāo)位置”真正是當(dāng)前幀的而不是三幀之前的。1.3 系統(tǒng)整體框架我把整個(gè)系統(tǒng)分成三條數(shù)據(jù)通路視頻采集通路、模板匹配通路、結(jié)果輸出通路。視頻采集通路用OV5640攝像頭模組通過(guò)DVP接口把YUV或RGB數(shù)據(jù)送進(jìn)FPGA。模板匹配通路就是SAD引擎的核心包含行緩沖Line Buffer、滑動(dòng)窗口寄存器陣列、絕對(duì)差計(jì)算單元、加法樹(shù)、最小值比較器。結(jié)果輸出通路通過(guò)一個(gè)簡(jiǎn)單的并行總線比如STM32主控的FMC接口把目標(biāo)坐標(biāo)寄存器暴露給外部MCU讀取。這里要特別強(qiáng)調(diào)一個(gè)設(shè)計(jì)選擇我沒(méi)有用幀緩存方案。全圖匹配才需要把整幀存在DDR里局部搜索只需要行緩沖就能實(shí)現(xiàn)。省掉DDR意味著系統(tǒng)架構(gòu)簡(jiǎn)單一個(gè)數(shù)量級(jí)不用處理DDR控制器的突發(fā)、刷新、時(shí)序收斂問(wèn)題這在很多小型化項(xiàng)目里是決定性優(yōu)勢(shì)。2. SAD的硬件翻譯絕對(duì)差、加法樹(shù)和位寬計(jì)算2.1 SAD公式里的三個(gè)動(dòng)作SAD的定義很簡(jiǎn)單SAD(x, y) Σ|I(xi, yj) - T(i, j)|就是把模板T逐像素挪到圖像I的某個(gè)位置每個(gè)對(duì)應(yīng)像素做差、取絕對(duì)值、再求和。這個(gè)公式里只有三個(gè)動(dòng)作減法、取絕對(duì)值、累加。很多人覺(jué)得這太簡(jiǎn)單了不就是三個(gè)操作循環(huán)嗎但放到硬件里每個(gè)動(dòng)作都要重新想一遍。減法器在FPGA里是直接可用的數(shù)字邏輯但是兩個(gè)8bit數(shù)相減結(jié)果可能是負(fù)數(shù)而硬件里沒(méi)有“負(fù)數(shù)”的概念只有補(bǔ)碼。取絕對(duì)值也不是白送的它本質(zhì)上是根據(jù)符號(hào)位做一個(gè)“取反加一”操作。最后累加更不能串行做否則64個(gè)周期才能算完一個(gè)位置整個(gè)流水線全廢了。2.2 絕對(duì)差單元的Verilog實(shí)現(xiàn)絕對(duì)差單元是整個(gè)引擎里最基礎(chǔ)的細(xì)胞。最直觀的寫法是wire [7:0] pixel_img, pixel_tpl; wire [7:0] abs_diff (pixel_img pixel_tpl) ? (pixel_img - pixel_tpl) : (pixel_tpl - pixel_img);這段代碼綜合出來(lái)實(shí)際上是一個(gè)8bit比較器加上兩個(gè)8bit減法器再加一個(gè)二選一多路器。如果你嫌組合邏輯多也可以用補(bǔ)碼求絕對(duì)值的方式wire [8:0] diff_signed {1b0, pixel_img} - {1b0, pixel_tpl}; wire [7:0] abs_diff diff_signed[8] ? (~diff_signed[7:0] 1b1) : diff_signed[7:0];兩種寫法綜合結(jié)果差不多第一種更直觀第二種更接近底層原理。實(shí)際工程里我建議用第一種可讀性好綜合工具自己會(huì)優(yōu)化。如果模板是8×8就需要例化64個(gè)這樣的絕對(duì)差單元。這些單元在同一時(shí)刻工作輸入是滑動(dòng)窗口里的64個(gè)像素和模板寄存器里的64個(gè)像素。這里就體現(xiàn)了FPGA的“空間并行”優(yōu)勢(shì)64個(gè)減法器同時(shí)做不需要排隊(duì)。2.3 用加法樹(shù)替代串行累加拿到64個(gè)絕對(duì)差之后如果按CPU的習(xí)慣寫一個(gè)for循環(huán)串行累加在硬件里綜合出來(lái)的就是一條63級(jí)的加法鏈每個(gè)周期只能算完一個(gè)累加步驟時(shí)鐘頻率會(huì)低得可憐。正確做法是用樹(shù)形結(jié)構(gòu)第1級(jí)32個(gè)加法器第2級(jí)16個(gè)第3級(jí)8個(gè)第4級(jí)4個(gè)第5級(jí)2個(gè)第6級(jí)1個(gè)總共63個(gè)加法器但邏輯深度只有6級(jí)。// 示意64路絕對(duì)差 - 加法樹(shù) - 14bit SAD結(jié)果 // 中間各級(jí)務(wù)必插入流水寄存器這里省略寄存器寫法 reg [8:0] sum_l1 [0:31]; // 第1級(jí)輸出 reg [9:0] sum_l2 [0:15]; reg [10:0] sum_l3 [0:7]; reg [11:0] sum_l4 [0:3]; reg [12:0] sum_l5 [0:1]; reg [13:0] sad_out;每一級(jí)對(duì)應(yīng)一組加法器組合邏輯深度只有2~3個(gè)加法器加上流水寄存器后關(guān)鍵路徑非常短時(shí)序很容易收斂。這也是為什么一個(gè)8×8模板的SAD引擎在100MHz甚至200MHz下都能穩(wěn)定跑的原因。2.4 位寬怎么算才不翻車位寬計(jì)算是新手最容易忽略的地方。8bit像素值范圍0~255差的絕對(duì)值最大是255需要8bit。64個(gè)絕對(duì)差相加最大和是64×255163202^1416384所以至少需要14bit保險(xiǎn)起見(jiàn)建議用15bit。如果你把模板放大到16×16256×255652802^16剛好夠但再加幾個(gè)模板或做多幀累加16bit就會(huì)溢出。我的習(xí)慣是每級(jí)加法樹(shù)都多留1bit余量讓綜合工具自己去優(yōu)化省得后期為了一個(gè)溢出問(wèn)題返工。還要提醒一個(gè)反直覺(jué)的坑比較SAD大小時(shí)千萬(wàn)別把結(jié)果聲明成有符號(hào)數(shù)。如果最小SAD比較器的初值是0而有符號(hào)數(shù)最小值是個(gè)負(fù)數(shù)那你會(huì)發(fā)現(xiàn)目標(biāo)位置永遠(yuǎn)不更新——我后面講到實(shí)測(cè)踩坑時(shí)會(huì)詳細(xì)展開(kāi)。3. 數(shù)據(jù)流架構(gòu)行緩沖、滑動(dòng)窗口、搜索控制與流水線3.1 行緩沖讓N-1行數(shù)據(jù)陪跑SAD引擎面臨的核心問(wèn)題不是“怎么算”而是“數(shù)據(jù)怎么到對(duì)的地方去”。如果圖像數(shù)據(jù)是一行行流進(jìn)來(lái)的要構(gòu)建一個(gè)8×8的滑動(dòng)窗口就必須同時(shí)拿到當(dāng)前行的數(shù)據(jù)以及前7行的數(shù)據(jù)。把整幀存進(jìn)DDR再去讀當(dāng)然可以但對(duì)于局部搜索來(lái)說(shuō)完全沒(méi)有必要——只需要行緩沖就夠了。行緩沖的本質(zhì)上是一組同步FIFO每個(gè)FIFO緩存一行圖像數(shù)據(jù)。對(duì)于一個(gè)8×8窗口需要7行歷史數(shù)據(jù)N-1當(dāng)前行直接來(lái)自攝像頭接口。實(shí)現(xiàn)方式有兩種一種是用BRAM寫一個(gè)自定義的行緩存模塊另一種是用Xilinx的Shift Register IP。VGA寬度6408bit像素單行數(shù)據(jù)量只有640×8bit用BRAM非常寬裕。我這邊例化了7個(gè)BRAM每個(gè)深度640寬度8bit。module line_buffer #( parameter DATA_WIDTH 8, parameter LINE_WIDTH 640 )( input wire clk, input wire rst_n, input wire wr_en, input wire [DATA_WIDTH-1:0] din, output wire [DATA_WIDTH-1:0] line_out ); reg [DATA_WIDTH-1:0] mem [0:LINE_WIDTH-1]; reg [$clog2(LINE_WIDTH)-1:0] wr_ptr; // 寫入側(cè)每個(gè)有效像素使能寫入 always (posedge clk or negedge rst_n) begin if (!rst_n) begin wr_ptr 0; end else if (wr_en) begin mem[wr_ptr] din; wr_ptr (wr_ptr LINE_WIDTH-1) ? 0 : wr_ptr 1; end end assign line_out mem[wr_ptr]; endmodule這里有個(gè)細(xì)節(jié)值得注意首次寫入整行之前行緩沖里是無(wú)有效數(shù)據(jù)的需要給一個(gè)“數(shù)據(jù)有效”信號(hào)貫穿整個(gè)流水線否則前幾幀的SAD結(jié)果是垃圾數(shù)據(jù)會(huì)干擾模板匹配。3.2 滑動(dòng)窗口與坐標(biāo)對(duì)齊行緩沖輸出的7行歷史數(shù)據(jù)加上當(dāng)前行的新像素共同組成一個(gè)8×8的窗口寄存器陣列。每來(lái)一個(gè)新像素窗口整體左移一列最右邊一列填入新數(shù)據(jù)。這相當(dāng)于一個(gè)二維的移位寄存器。// 滑動(dòng)窗口寄存器img_window[row][col] always (posedge clk) begin for (int r 0; r 8; r) begin for (int c 0; c 7; c) begin img_window[r][c] img_window[r][c1]; end end // 最右側(cè)一列由行緩沖和當(dāng)前像素填充 img_window[0][7] pixel_in; // 當(dāng)前行 for (int r 1; r 8; r) begin img_window[r][7] line_buf_out[r-1]; // 歷史行 end end這里最容易出錯(cuò)的是窗口數(shù)據(jù)和當(dāng)前候選位置坐標(biāo)沒(méi)對(duì)齊。你想圖像數(shù)據(jù)從輸入到窗口需要經(jīng)過(guò)7級(jí)行緩沖延遲而x/y坐標(biāo)計(jì)數(shù)器如果直接從像素有效信號(hào)開(kāi)始計(jì)數(shù)那么計(jì)數(shù)到某個(gè)位置時(shí)窗口里裝的其實(shí)是延遲了7行之后的數(shù)據(jù)坐標(biāo)自然就偏移了。解決方案很簡(jiǎn)單坐標(biāo)計(jì)數(shù)器和窗口數(shù)據(jù)走同一條延遲鏈保證“哪個(gè)周期的窗口數(shù)據(jù)就對(duì)應(yīng)該周期的坐標(biāo)”。3.3 局部搜索的控制時(shí)序全圖搜索在這個(gè)項(xiàng)目里沒(méi)必要。目標(biāo)跟蹤的語(yǔ)義就是“上一幀在哪里這一幀大概率還在附近”所以在上一幀目標(biāo)中心周圍劃一個(gè)搜索區(qū)域即可。我的配置是模板8×8、搜索半半徑16搜索區(qū)域就是40×40??刂七壿嫷年P(guān)鍵狀態(tài)有幾個(gè)左上角起始坐標(biāo)、搜索范圍邊界、行列計(jì)數(shù)器。當(dāng)像素坐標(biāo)落在搜索區(qū)域左上角時(shí)啟動(dòng)窗口數(shù)據(jù)有效標(biāo)志允許SAD引擎開(kāi)始計(jì)算。每次窗口滑動(dòng)一個(gè)像素SAD引擎算出一個(gè)候選位置的SAD值送入最小比較器。當(dāng)坐標(biāo)到達(dá)搜索區(qū)域右下角時(shí)本輪搜索結(jié)束把當(dāng)前最優(yōu)坐標(biāo)鎖存到輸出寄存器并復(fù)位最小SAD值。這個(gè)邏輯看似簡(jiǎn)單但要特別小心“搜索區(qū)域邊界”的處理。如果搜索區(qū)域左邊界是30右邊界是70模板寬度是8那么當(dāng)窗口中心位于67時(shí)窗口的最右列已經(jīng)需要圖像x74處的像素。此時(shí)如果攝像頭數(shù)據(jù)還沒(méi)喂到74SAD結(jié)果就是無(wú)效的。我的做法是把搜索區(qū)域的SAD計(jì)算范圍限制為“窗口完全落在圖像內(nèi)”的區(qū)域也就是左右各留出模板寬度的一半作為安全區(qū)。3.4 流水線怎么切流水線切分是FPGA算法設(shè)計(jì)里最核心的步驟。SAD計(jì)算鏈路包括絕對(duì)差、加法樹(shù)6級(jí)、比較器如果全部不切流水組合邏輯延遲可能達(dá)到十幾ns甚至幾十ns100MHz時(shí)鐘直接爆掉。我的切法是這樣的第0級(jí)流水寄存器輸入口窗口寄存器輸出、模板寄存器輸出。第1級(jí)流水64個(gè)絕對(duì)差單元的輸出打入寄存器。第2、3級(jí)流水加法樹(shù)前兩級(jí)的輸出分別打拍。第4、5級(jí)流水加法樹(shù)后兩級(jí)的輸出打拍。第6級(jí)流水最終SAD值打入寄存器。第7級(jí)流水與歷史最小值比較更新最優(yōu)坐標(biāo)。這樣任何一級(jí)寄存器到下一級(jí)寄存器之間組合邏輯最多不超過(guò)兩三個(gè)加法器或一個(gè)比較器。時(shí)序收斂非常輕松。代價(jià)是SAD結(jié)果比像素輸入晚了7個(gè)周期但這7個(gè)周期在搜索范圍內(nèi)完全可接受只要在比較器里對(duì)齊好節(jié)拍就行。// 流水級(jí)示意 always (posedge clk) begin abs_diff_reg abs_diff_comb; // 第1級(jí) tree_l1_reg abs_diff_reg; // 第2級(jí)加法樹(shù)第1層 tree_l2_reg tree_l1_reg; tree_l3_reg tree_l2_reg; sad_result tree_l3_reg; // 第6級(jí) end3.5 最優(yōu)位置追蹤模塊SAD引擎計(jì)算出每個(gè)候選位置的SAD值之后還需要一個(gè)“幽靈比較器”來(lái)記住我們看到過(guò)的最小值和它的坐標(biāo)。這個(gè)模塊非常小但往往是整個(gè)工程里埋坑最多的地方。reg [13:0] min_sad; reg [9:0] best_x, best_y; // 每輪搜索開(kāi)始時(shí)復(fù)位 if (search_start) begin min_sad {14{1b1}}; // 全1表示無(wú)窮大 best_x 0; best_y 0; end else if (sad_valid (sad_result min_sad)) begin min_sad sad_result; best_x cand_x; best_y cand_y; endmini_sad的初值設(shè)成全1而不是0很多人第一次寫都會(huì)犯這個(gè)錯(cuò)。為什么因?yàn)槿绻踔凳?每一個(gè)新算出來(lái)的SAD都是正數(shù)永遠(yuǎn)不可能小于0那么best_x和best_y就永遠(yuǎn)不被更新目標(biāo)坐標(biāo)永遠(yuǎn)鎖在初始位置。這個(gè)坑我后面細(xì)說(shuō)。4. 從匹配到跟蹤模板更新、卡爾曼濾波和目標(biāo)丟失恢復(fù)4.1 模板不更新會(huì)怎樣SAD匹配本身只是一幀的“窮舉”要變成“跟蹤”得把時(shí)間維的連續(xù)性用起來(lái)。最簡(jiǎn)單也最容易犯的錯(cuò)就是模板在第一幀提取后永遠(yuǎn)不變。目標(biāo)在畫面里一旦發(fā)生旋轉(zhuǎn)、尺度變化、光照變化SAD值很快會(huì)突破閾值匹配位置開(kāi)始隨機(jī)跳最后直接丟目標(biāo)。反過(guò)來(lái)如果每幀都更新模板又會(huì)出現(xiàn)另一個(gè)問(wèn)題——誤差累積。某幀匹配位置偏了一兩個(gè)像素模板里就混入了一部分背景下一幀模板更像背景了偏得更遠(yuǎn)幾個(gè)循環(huán)之后模板徹底漂移到背景上再也回不來(lái)。所以模板更新不能走極端。我的方案是“固定模板動(dòng)態(tài)模板”混合策略。4.2 動(dòng)態(tài)模板與混合模板策略固定模板負(fù)責(zé)“拉住”目標(biāo)的原始特征動(dòng)態(tài)模板負(fù)責(zé)“跟上”目標(biāo)的外觀變化。每一幀同時(shí)用兩個(gè)模板做SAD得到兩個(gè)最小值然后用一個(gè)加權(quán)公式融合得分score α × SAD_fixed (1-α) × SAD_dynamicα取0.4到0.6之間比較穩(wěn)我最終用了0.5。融合得分的最優(yōu)位置才作為當(dāng)前幀的目標(biāo)坐標(biāo)輸出。動(dòng)態(tài)模板的更新規(guī)則是只有當(dāng)本幀融合得分小于上一幀融合得分的1.6倍時(shí)才把當(dāng)前幀的最優(yōu)匹配區(qū)域更新為新的動(dòng)態(tài)模板超過(guò)這個(gè)比例就說(shuō)明當(dāng)前匹配置信度低大概率發(fā)生了遮擋或劇烈變化本幀凍結(jié)動(dòng)態(tài)模板。這樣遮擋時(shí)不會(huì)把遮擋物學(xué)進(jìn)模板目標(biāo)重新出現(xiàn)后還能找回來(lái)。4.3 一個(gè)工程化的卡爾曼濾波實(shí)現(xiàn)SAD匹配輸出的坐標(biāo)其實(shí)是有噪聲的尤其是目標(biāo)邊緣紋理復(fù)雜時(shí)匹配位置會(huì)在幾個(gè)像素之間抖。要獲得平滑穩(wěn)定的軌跡需要給跟蹤結(jié)果加一個(gè)濾波器。完整的多維卡爾曼濾波在FPGA里實(shí)現(xiàn)起來(lái)開(kāi)銷不小矩陣求逆更是麻煩但好在目標(biāo)跟蹤這個(gè)場(chǎng)景里我們完全可以退一步用常增益卡爾曼濾波器也就是α-β濾波器它本質(zhì)上就是穩(wěn)態(tài)卡爾曼。系統(tǒng)模型很簡(jiǎn)單狀態(tài)向量是位置和速度[x, vx, y, vy]觀測(cè)是SAD給出的[x_obs, y_obs]。預(yù)測(cè)方程x_pred x_est vx_est × dt vx_pred vx_est更新方程x_est x_pred α × (x_obs - x_pred) vx_est vx_pred (β / dt) × (x_obs - x_pred)y方向同理。α和β是一組常系數(shù)α取0.6β取0.15在多數(shù)場(chǎng)景下效果都?jí)蛴?。FPGA里用16bit定點(diǎn)數(shù)實(shí)現(xiàn)不會(huì)占用太多資源。我單獨(dú)建了一個(gè)小模塊輸入是SAD匹配的坐標(biāo)輸出是平滑后的坐標(biāo)和預(yù)測(cè)的下一幀中心位置預(yù)測(cè)結(jié)果正好可以作為下一幀搜索區(qū)域的開(kāi)窗中心形成閉環(huán)。工程上有兩點(diǎn)經(jīng)驗(yàn)一是預(yù)測(cè)值要限制在圖像邊界內(nèi)否則搜索區(qū)域跑到畫面外去SAD引擎會(huì)白算好幾行二是當(dāng)目標(biāo)丟失判定觸發(fā)時(shí)卡爾曼濾波器要暫停預(yù)測(cè)或者把過(guò)程噪聲調(diào)大否則它會(huì)按慣性一直往外飛。4.4 丟失判定與重捕獲狀態(tài)機(jī)目標(biāo)有沒(méi)有丟最直接的信號(hào)就是最小SAD的大小。目標(biāo)穩(wěn)定跟蹤時(shí)我的系統(tǒng)里最小SAD通常在2000~3000之間一旦目標(biāo)被完全遮擋或者跑出搜索區(qū)域最小SAD會(huì)瞬間跳到10000以上。我把丟失閾值設(shè)在6000但這個(gè)值不是拍腦袋定的而是先跑了一段正常跟蹤把正常情況下的最小SAD記錄下來(lái)取了2到3倍作為閾值。丟目標(biāo)之后的處理我用了一個(gè)簡(jiǎn)單的狀態(tài)機(jī)TRACKING正常輸出跟蹤坐標(biāo)。PREDICT按照卡爾曼預(yù)測(cè)位置繼續(xù)開(kāi)窗搜索搜索半徑暫時(shí)擴(kuò)大1.2倍。REACQUIRE如果PREDICT狀態(tài)里連續(xù)3幀最小SAD都超閾值就切換到全圖掃描模式每隔幾幀對(duì)全圖做一次粗匹配試圖找回目標(biāo)。找回目標(biāo)后重新初始化模板和濾波器回到TRACKING。這個(gè)狀態(tài)機(jī)在FPGA里不過(guò)幾十行代碼但讓整個(gè)跟蹤器從“一次性的匹配器”變成了“有記憶的跟蹤系統(tǒng)”。5. 實(shí)測(cè)數(shù)據(jù)與四個(gè)讓我熬夜的坑5.1 平臺(tái)與參數(shù)項(xiàng)目配置FPGAXilinx Artix-7 XC7A35T視頻輸入OV5640VGA 640×480 60fps模板尺寸8×8搜索半半徑16像素搜索區(qū)域40×40工作時(shí)鐘100MHz輸出接口并行總線FMC類協(xié)議給外部MCU實(shí)測(cè)單幀從像素輸入到坐標(biāo)輸出的延遲約18μs處理能力在60fps的輸入下還剩十倍以上余量。系統(tǒng)連續(xù)跑了30分鐘室內(nèi)場(chǎng)景目標(biāo)用50像素/秒的速度移動(dòng)全程穩(wěn)定跟蹤遮擋1.5秒后能自動(dòng)重捕獲。這些指標(biāo)在CPU方案里很難做到。5.2 資源占用與關(guān)鍵路徑資源用量占比LUT412620%Flip-Flop32898%BRAM9塊18%DSP48E112個(gè)13%綜合后最高時(shí)鐘127MHz100MHz設(shè)計(jì)穩(wěn)定收斂。加法樹(shù)前兩級(jí)用了少量DSP48來(lái)做預(yù)加器主要是為了把關(guān)鍵路徑壓縮得更短實(shí)際上純LUT也能實(shí)現(xiàn)只是時(shí)序會(huì)緊張一點(diǎn)點(diǎn)。5.3 避坑一min_sad初值導(dǎo)致目標(biāo)“凍結(jié)”這個(gè)問(wèn)題困擾了我整整一個(gè)下午?,F(xiàn)象極其詭異第一幀模板匹配完全正常能從全圖里找到目標(biāo)但到了第二幀目標(biāo)坐標(biāo)就再也不動(dòng)了像被凍住一樣。排查狀態(tài)寄存器發(fā)現(xiàn)min_sad里存的值始終是第一幀算出的最小SAD。為什么因?yàn)槲以谒阉髦芷陂_(kāi)始時(shí)沒(méi)有把min_sad復(fù)位成全1而是保留了上一次的最小值。第二幀目標(biāo)雖然沒(méi)有大幅移動(dòng)但因?yàn)楣庹栈蚪嵌鹊奈⑿∽兓泻蜻x位置的SAD都略大于第一幀的最小值導(dǎo)致“sad_result min_sad”永遠(yuǎn)不成立最優(yōu)坐標(biāo)自然也就永遠(yuǎn)不更新。修復(fù)就是三行代碼的事每個(gè)搜索周期開(kāi)始時(shí)把min_sad置為全1把best_x、best_y清零。但這件事給我留下的教訓(xùn)很深凡遇到“只有第一幀正?!钡腇PGA問(wèn)題第一反應(yīng)就去找所有寄存器的初值和復(fù)位邏輯不要急著翻算法代碼。5.4 避坑二行緩沖節(jié)拍錯(cuò)位導(dǎo)致固定偏移另一個(gè)經(jīng)典問(wèn)題是跟蹤位置總是固定在目標(biāo)左上角偏移幾個(gè)像素的位置。我當(dāng)時(shí)在仿真里對(duì)比了窗口數(shù)據(jù)和坐標(biāo)計(jì)數(shù)器發(fā)現(xiàn)窗口里第0列是當(dāng)前像素窗口的“視覺(jué)中心”其實(shí)在第4列而坐標(biāo)計(jì)數(shù)器給的是窗口左上角的位置差了半個(gè)模板的偏移。更隱蔽的是行緩沖帶來(lái)的延遲。一個(gè)8×8窗口需要7行歷史數(shù)據(jù)歷史行數(shù)據(jù)輸出和當(dāng)前行數(shù)據(jù)在同一個(gè)時(shí)鐘周期對(duì)齊看起來(lái)沒(méi)問(wèn)題但一旦行緩沖的讀使能比寫使能晚一拍整個(gè)窗口內(nèi)容就會(huì)錯(cuò)位一行。這個(gè)問(wèn)題在仿真里很難發(fā)現(xiàn)因?yàn)榉抡婕?lì)數(shù)據(jù)太規(guī)則了我用ILA抓真實(shí)攝像頭數(shù)據(jù)才看到“模板區(qū)域和預(yù)期位置存在恒定偏移”。最終的解決方案就是前面說(shuō)的讓數(shù)據(jù)有效信號(hào)貫穿所有流水級(jí)坐標(biāo)計(jì)數(shù)器也跟隨同樣的延遲鏈打拍保證SAD結(jié)果對(duì)應(yīng)的窗口坐標(biāo)是真實(shí)的窗口中心坐標(biāo)。寫testbench的時(shí)候我專門加了一個(gè)打印任務(wù)逐周期比對(duì)“窗口中心坐標(biāo)”和“候選位置坐標(biāo)”確保整條鏈路對(duì)齊。5.5 避坑三動(dòng)態(tài)模板漂移到背景動(dòng)態(tài)模板方案跑了一段時(shí)間后出現(xiàn)過(guò)一個(gè)惡心的問(wèn)題目標(biāo)框慢慢滑出了目標(biāo)釘在了旁邊一塊淺色背景上。原因是目標(biāo)在某一幀被手擋了一下匹配位置偏了2個(gè)像素更新后的模板里混進(jìn)了背景邊緣下一幀基于這個(gè)“臟模板”去匹配最佳位置更偏了模板更臟如此惡性循環(huán)最后徹底漂移。修復(fù)方式就是前面提到的不要無(wú)條件更新模板當(dāng)本幀SAD明顯高于歷史正常水平時(shí)凍結(jié)模板更新。我加的那個(gè)1.6倍系數(shù)就是反復(fù)調(diào)試出來(lái)的經(jīng)驗(yàn)值太小了會(huì)在目標(biāo)正常變化時(shí)凍結(jié)模板太大了又起不到抗漂移作用。如果你做類似項(xiàng)目可以從1.5到2.0之間試起。5.6 避坑四加法樹(shù)不切流水時(shí)序直接崩第一次綜合時(shí)我把64路絕對(duì)差和一個(gè)超級(jí)長(zhǎng)的串行累加寫在了同一個(gè)always塊里結(jié)果綜合報(bào)告里關(guān)鍵路徑延遲有幾十ns100MHz時(shí)鐘根本滿足不了。后來(lái)把加法樹(shù)改成六級(jí)、每一級(jí)之間加流水寄存器之后關(guān)鍵路徑立刻縮短到約7.8ns最高時(shí)鐘跑到127MHz。這里有個(gè)判斷技巧當(dāng)關(guān)鍵路徑超過(guò)時(shí)鐘周期的60%時(shí)不要先急著改布局布線約束先回頭看看是不是組合邏輯本身太深。SAD引擎里最深的組合邏輯路徑就是“絕對(duì)差-加法樹(shù)-比較器”這段路徑必須用流水級(jí)打斷。記住一句話寧可多打幾拍不可堆邏輯。5.7 調(diào)試方法心得FPGA圖像處理項(xiàng)目最忌諱直接拿攝像頭實(shí)拍來(lái)調(diào)試因?yàn)檩斎霐?shù)據(jù)不可控出了問(wèn)題你根本分不清是攝像頭時(shí)序的問(wèn)題還是引擎邏輯的問(wèn)題。我的做法是分三步走第一步用testbench生成固定的小尺寸圖像比如16×16把SAD結(jié)果和MATLAB里用同樣數(shù)據(jù)算出的SAD結(jié)果逐點(diǎn)比對(duì)。第二步把模板數(shù)據(jù)固定為寄存器里的常量不從攝像頭提取先用任意圖像跑通整個(gè)搜索流程確認(rèn)坐標(biāo)輸出規(guī)律正確。第三步接真實(shí)攝像頭用ILA抓窗口數(shù)據(jù)、SAD值和最優(yōu)坐標(biāo)重點(diǎn)觀察邊緣區(qū)域的坐標(biāo)是否越界。這套流程下來(lái)絕大部分bug都能在仿真階段解決實(shí)拍調(diào)試的時(shí)間能省一半以上。6. 還能往上疊什么多分辨率、亞像素、多目標(biāo)與檢測(cè)級(jí)聯(lián)6.1 多分辨率金字塔搜索單尺度局部搜索的軟肋是目標(biāo)運(yùn)動(dòng)速度超過(guò)搜索半徑時(shí)會(huì)丟。更好的做法是把圖像降采樣成1/4分辨率先在低分辨率上做大范圍粗搜鎖定大致位置后再回到原分辨率做小范圍精搜。FPGA上實(shí)現(xiàn)一個(gè)2×2均值降采樣非常便宜只需加一行累加器卻能把等效搜索范圍擴(kuò)大好幾倍同時(shí)計(jì)算量增加不到20%。這個(gè)方案我強(qiáng)烈推薦給要處理高速目標(biāo)的場(chǎng)景。6.2 亞像素插值如果你需要目標(biāo)坐標(biāo)平滑到亞像素精度可以對(duì)最小SAD點(diǎn)以及它左右/上下的相鄰SAD值做拋物線擬合。x方向的細(xì)分公式是subpixel_offset_x (SAD(x-1) - SAD(x1)) / (2 × (SAD(x-1) - 2×SAD(x) SAD(x1)))在FPGA里這個(gè)公式只需要減法、一次除法和幾次移位定點(diǎn)數(shù)運(yùn)算量不大。y方向同理。插值后跟蹤位置不再是一個(gè)個(gè)整數(shù)像素在跳而是連續(xù)變化的對(duì)下游控制回路特別友好。注意除法器在FPGA里很貴最好用Newton-Raphson近似或者直接用查找表能省不少DSP。6.3 多目標(biāo)并行引擎FPGA的一大優(yōu)勢(shì)是復(fù)用。一個(gè)SAD引擎大概占不到3000個(gè)LUT在XC7A035T這顆中端芯片上放4~6個(gè)引擎綽綽有余。每個(gè)引擎共享同一套行緩沖和窗口數(shù)據(jù)只需要各自的模板寄存器、SAD比較器和坐標(biāo)追蹤邏輯。這樣就能同時(shí)跟蹤四五個(gè)目標(biāo)而CPU方案在同等資源下早就掉幀了。多目標(biāo)場(chǎng)景里的模板分配也簡(jiǎn)單每個(gè)目標(biāo)一個(gè)模板存儲(chǔ)區(qū)狀態(tài)機(jī)里加一個(gè)目標(biāo)ID字段就行。6.4 與目標(biāo)檢測(cè)算法級(jí)聯(lián)實(shí)際部署時(shí)模板匹配很少單獨(dú)用它需要知道“第一幀的目標(biāo)模板從哪來(lái)”。常見(jiàn)方案是CPU/GPU上跑檢測(cè)網(wǎng)絡(luò)YOLO、SSD之類檢測(cè)到目標(biāo)框之后把框的坐標(biāo)和圖像區(qū)域通過(guò)總線下發(fā)到FPGAFPGA截取對(duì)應(yīng)區(qū)域作為初始模板之后所有跟蹤運(yùn)算全部在FPGA上完成。這種“檢測(cè)在幀級(jí)、跟蹤在像素級(jí)”的架構(gòu)既利用了深度學(xué)習(xí)網(wǎng)絡(luò)的高準(zhǔn)確率又保住了FPGA的低延遲跟蹤優(yōu)勢(shì)是我認(rèn)為最有工程前景的落地形態(tài)。最后說(shuō)一點(diǎn)個(gè)人體會(huì)FPGA上做算法最難的不是背公式而是把每一拍數(shù)據(jù)的來(lái)龍去脈想清楚。SAD模板匹配看起來(lái)是教科書(shū)里最簡(jiǎn)單的那一類算法但真正把它跑成一條微秒級(jí)延遲的實(shí)時(shí)數(shù)據(jù)流之后你對(duì)并行架構(gòu)的理解會(huì)上一個(gè)臺(tái)階。做這個(gè)項(xiàng)目時(shí)我反復(fù)提醒自己的就是一句話硬件里沒(méi)有“循環(huán)”只有“時(shí)刻”沒(méi)有“變量”只有“寄存器”。想通了這一點(diǎn)路就好走了。