采樣:DMA+乒乓緩沖實(shí)戰(zhàn)指南)
玩 ARM 的老伙計(jì)們都知道DMA 是給外設(shè)搬數(shù)據(jù)的好工具可一放到 MicroPython 場(chǎng)景里很多人第一反應(yīng)是“單片機(jī)都能跑腳本了還要啥 DMA”。直到某天你用 MicroPython 做音頻采集、電機(jī)電流環(huán)或者振動(dòng)監(jiān)測(cè)發(fā)現(xiàn)adc.read_u16()一調(diào)用主循環(huán)就像被踩了剎車這時(shí)候才會(huì)認(rèn)真想ADC 采樣到底能不能不占 CPU答案是能而且不算復(fù)雜。核心思路就是標(biāo)題里那三個(gè)詞DMA 負(fù)責(zé)搬運(yùn)乒乓緩沖負(fù)責(zé)銜接CPU 只負(fù)責(zé)在緩沖區(qū)滿了之后拿結(jié)果。這篇文章我會(huì)從“為什么慢”開始講然后給出一套在 STM32 MicroPython 上可以直接改用的雙緩沖采樣方案再補(bǔ)上采樣率、緩沖區(qū)長(zhǎng)度、采樣時(shí)間這些參數(shù)怎么配最后把我調(diào) DMA 時(shí)踩過的坑一起列出來。適合誰看如果你正在用 MicroPython 做連續(xù) ADC 采樣轉(zhuǎn)速一高就掉幀、控制周期抖到?jīng)]法看或者你準(zhǔn)備給現(xiàn)有項(xiàng)目加音頻/振動(dòng)采集但不想換 C 開發(fā)這篇基本能幫你省兩三天時(shí)間。1. 先搞清楚MicroPython 里 ADC 為什么能拖死主循環(huán)1.1 單次 ADC 讀取的隱形開銷很多人都以為 MicroPython 里讀 ADC 就是“寄存器一下結(jié)果回來”跟 C 差不多快。實(shí)際不是。你用machine.ADC()或者pyb.ADC每次調(diào)用讀取背后至少經(jīng)過五層動(dòng)作Python 虛擬機(jī)的指令解析、函數(shù)調(diào)用棧構(gòu)建、底層外設(shè)寄存器訪問、返回整數(shù)對(duì)象的創(chuàng)建、再把這個(gè)對(duì)象塞進(jìn) Python 運(yùn)行時(shí)管理的內(nèi)存里。光“創(chuàng)建一個(gè)整數(shù)對(duì)象”這一步在 CPython 里都不算便宜MicroPython 雖然做了大量?jī)?yōu)化但對(duì)象開銷仍在。再加上 ADC 轉(zhuǎn)換等待、驅(qū)動(dòng)層的邊界檢查單次讀取往往要花幾十到幾百微秒。ESP32 上很多人實(shí)測(cè)read_u16()一次約 150us 到 300us這不是轉(zhuǎn)換慢是運(yùn)行時(shí)開銷占了大頭。你可能會(huì)說“幾百微秒而已無所謂”。但如果主循環(huán)里同時(shí)要讀 4 個(gè)通道、做濾波、刷屏幕、解析命令那每個(gè)周期累積起來很快就把時(shí)間吃光了。關(guān)鍵是這種延遲不是 CPU 主頻不夠而是“每讀一個(gè)數(shù)都要驚動(dòng)整個(gè) Python 運(yùn)行時(shí)”屬于結(jié)構(gòu)性浪費(fèi)。1.2 算一筆賬10kSPS 采樣時(shí) CPU 到底在干嘛拿一個(gè)常見場(chǎng)景算12 位 ADC采樣率 10kSPS也就是每 100us 采一個(gè)點(diǎn)。如果單次 ADC 讀取平均花費(fèi) 120us那你在這個(gè)過程中已經(jīng)超時(shí)了更別提處理數(shù)據(jù)。有人會(huì)說“我不用 10k我只要 1k”。1kSPS 意味著每 1ms 讀一次單次 120us 的話占用率也有 12%。聽起來還好可這只是純讀取不算均值濾波、不算波形分析、不算網(wǎng)絡(luò)上報(bào)。等整套邏輯寫完主循環(huán)可用時(shí)間可能只剩 60% 不到。如果你還要做 PID 控制控制周期抖動(dòng)這種額外開銷很容易把系統(tǒng)搞崩。反過來看用 DMA配置好之后外設(shè)自動(dòng)觸發(fā)采樣采樣值自動(dòng)搬進(jìn)內(nèi)存CPU 完全不需要碰每個(gè)樣本。只有當(dāng)一整塊緩沖區(qū)填滿時(shí)DMA 完成事件才會(huì)通知你一次。這樣 10kSPS 的采樣占用的 CPU 時(shí)間可以降到 1% 到 3%剩下的都是“處理數(shù)據(jù)”的成本而不是“搬運(yùn)數(shù)據(jù)”的稅。1.3 這問題沒法靠“調(diào)快 ADC”解決有人第一反應(yīng)是調(diào) ADC 采樣周期把轉(zhuǎn)換時(shí)間從 71.5 周期壓到 1.5 周期。這只能讓 ADC 硬件轉(zhuǎn)化稍微快一點(diǎn)Python 側(cè)的單次調(diào)用開銷還是不變。ADC 轉(zhuǎn)換不是瓶頸虛擬機(jī)調(diào)用才是。也有人想用定時(shí)器中斷里讀 ADC。在 MicroPython 里定時(shí)器中斷回調(diào)依然是 Python 函數(shù)進(jìn)中斷、出中斷的固定成本甚至比在主循環(huán)里讀還高。如果你在中斷回調(diào)里再調(diào)用read_u16()中斷執(zhí)行時(shí)間很容易超過采樣周期產(chǎn)生抖動(dòng)甚至卡死。所以結(jié)論很直接要解決連續(xù)采樣的 CPU 占用問題必須把“每個(gè)樣本都要軟件參與”的模式徹底換掉。DMA 就是為此設(shè)計(jì)的。2. 破局思路DMA 和乒乓緩沖各管什么事2.1 DMA 的定位就是“負(fù)責(zé)搬磚的協(xié)管”DMADirect Memory Access的工作方式可以理解成一個(gè)專門的“搬磚協(xié)管”外設(shè)轉(zhuǎn)換完一個(gè)數(shù)據(jù)它自動(dòng)把這個(gè)數(shù)據(jù)從數(shù)據(jù)寄存器搬到內(nèi)存CPU 不需要參與。你只需要提前告訴它“要把數(shù)據(jù)搬到哪個(gè)地址、搬多少個(gè)、每來一次觸發(fā)搬一個(gè)”它就能一直干下去。在 ADC 采樣這個(gè)場(chǎng)景里DMA 解決了兩個(gè)問題。第一它消除了逐點(diǎn)讀取的 CPU 開銷第二它的搬運(yùn)時(shí)機(jī)跟硬件轉(zhuǎn)換完成事件嚴(yán)格同步不會(huì)被 Python 解釋器或者任務(wù)調(diào)度打亂節(jié)奏。注意DMA 并不是“比中斷快”而是“比中斷干凈”。中斷處理程序不管怎么寫總會(huì)打斷當(dāng)前任務(wù)、保存現(xiàn)場(chǎng)、跳轉(zhuǎn)執(zhí)行然后再恢復(fù)。對(duì)采樣來說中斷還有一個(gè)致命問題如果代碼正在處理一個(gè)耗時(shí)操作中斷可能被延遲導(dǎo)致采樣點(diǎn)丟失。DMA 則是在硬件層面完成的只要配置正確它就會(huì)像流水線一樣穩(wěn)定工作。2.2 單緩沖為什么不夠乒乓緩沖解決了什么只用一個(gè)緩沖區(qū)DMA 連續(xù)往里面寫寫完就觸發(fā)完成事件。但問題來了如果你想在緩沖區(qū)寫滿后處理數(shù)據(jù)處理期間 DMA 怎么辦要么停掉等處理完再開那采樣就斷了要么繼續(xù)往同一個(gè)緩沖區(qū)寫那你處理的數(shù)據(jù)會(huì)被新數(shù)據(jù)覆蓋拿到手的全是半新半舊的混合體。乒乓緩沖就是為了解決這個(gè)沖突。準(zhǔn)備兩塊緩沖區(qū) A 和 BDMA 先寫 A寫滿后觸發(fā)完成事件同時(shí) DMA 立刻開始寫 B你的主循環(huán)趁著 DMA 寫 B 的時(shí)間去處理 A 里的數(shù)據(jù)。等 B 寫滿了DMA 又切回 A主循環(huán)則處理 B。兩塊緩沖交替使用像打乒乓球一樣一來一回所以叫乒乓緩沖也叫雙緩沖。這樣做的好處是數(shù)據(jù)采集過程不中斷同時(shí)你拿到的每一個(gè)緩沖區(qū)都是完整、獨(dú)立的一段歷史不會(huì)有新數(shù)據(jù)和舊數(shù)據(jù)混在一起的問題。代價(jià)就是你需要保證處理一塊緩沖區(qū)的時(shí)間小于另一塊緩沖區(qū)被填滿的時(shí)間否則 DMA 會(huì)跑得比消費(fèi)速度快最終還是會(huì)覆蓋未處理完的數(shù)據(jù)。2.3 乒乓緩沖在 MicroPython 里要改寫成什么很多講 DMA 乒乓緩沖的文章都是基于 C 語言和硬件中斷的到了 MicroPython 里會(huì)有點(diǎn)差別。MicroPython 默認(rèn)固件并不直接開放 DMA 通道的底層控制不同開發(fā)板暴露的能力也不同。STM32 移植版本有一個(gè)很好用的現(xiàn)成接口adc.read_timed(buffer, timer)。它會(huì)配置 ADC 和 DMA按定時(shí)器觸發(fā)頻率連續(xù)采樣把結(jié)果填進(jìn) buffer填滿后才返回。這個(gè)接口本質(zhì)上是“ADC DMA 單緩沖”的封裝。真正做乒乓緩沖的時(shí)候我會(huì)在后臺(tái)開一個(gè)線程讓它交替調(diào)用read_timed(buf_a)和read_timed(buf_b)主循環(huán)里只檢查當(dāng)前哪塊緩沖剛被填完然后去處理另一塊。這樣你不需要直接碰 DMA 寄存器也能達(dá)到“采樣過程不占主 CPU、處理過程不擋采樣”的效果。3. 實(shí)操落地STM32 MicroPython 的軟件乒乓方案3.1 硬件和固件準(zhǔn)備我這里以 STM32F411 開發(fā)板為例配 MicroPython 官方固件。F4 系列有足夠的 DMA 通道和定時(shí)器資源而且pyb.ADC.read_timed()支持得很完整。你需要的硬件很簡(jiǎn)單一塊板子、一個(gè)可調(diào)電位器或者信號(hào)源、兩三根杜邦線。接線上電位器三個(gè)腳分別接 3.3V、GND 和 PA0也就是 ADC 輸入引腳。如果測(cè)外部信號(hào)要注意信號(hào)電壓不要超過 ADC 參考電壓否則會(huì)損壞引腳。F411 的參考電壓默認(rèn)是 VDDA通常等于板子供電電壓。固件建議升級(jí)到 1.23 以上老版本對(duì)array的類型兼容有點(diǎn)問題尤其是array(H)和 DMA 緩沖區(qū)的長(zhǎng)度匹配。燒錄固件用esptool還是 DFU 都行這一步不贅述網(wǎng)上教程很多。3.2 read_timed 雙緩沖的完整示例下面是一段可以抄的代碼作用是后臺(tái)持續(xù)以 20kSPS 采樣每次填滿 2048 個(gè)采樣點(diǎn)后自動(dòng)切換到另一塊緩沖主循環(huán)只負(fù)責(zé)拿“上一塊已填滿”的數(shù)據(jù)。import pyb import array import _thread BUF_LEN 2048 SAMPLE_FREQ 20000 # 兩塊緩沖區(qū)用無符號(hào)半字?jǐn)?shù)組每個(gè)元素一個(gè) 12 位采樣值 buf_a array.array(H, [0]) * BUF_LEN buf_b array.array(H, [0]) * BUF_LEN adc pyb.ADC(pyb.Pin.board.PA0) tim pyb.Timer(2, freqSAMPLE_FREQ) # 這兩個(gè)變量會(huì)被后臺(tái)線程和主線程同時(shí)訪問 current_buf -1 # -1 表示還沒有任何緩沖填完0 表示 A 剛填完1 表示 B 剛填完 block_index 0 # 每次完成一整塊加一 def dma_loop(): global current_buf, block_index while True: # 第一輪填 A完成后 current_buf 置 0 adc.read_timed(buf_a, tim) current_buf 0 block_index 1 # 填 A 期間/之后主線程會(huì)處理 B這里緊接著填 B adc.read_timed(buf_b, tim) current_buf 1 block_index 1 # 啟動(dòng)后臺(tái)采樣線程 _thread.start_new_thread(dma_loop, ()) # 主循環(huán)只處理“剛被填滿但還沒開始被覆蓋”的緩沖 last_block 0 while True: if block_index ! last_block: if current_buf 1: process(buf_a) # B 剛填完A 是上一塊完整數(shù)據(jù) else: process(buf_b) # A 剛填完B 是上一塊完整數(shù)據(jù) last_block block_indexprocess()是你自己的數(shù)據(jù)處理函數(shù)里面可以做濾波、FFT、保存到文件等操作。我這里刻意不寫具體內(nèi)容因?yàn)閷?shí)際項(xiàng)目差異太大。3.3 主循環(huán)怎么消費(fèi)“另一塊”緩沖上面代碼里最關(guān)鍵的是“上一塊”其他類似方案里也叫“舊緩沖”的判斷。我踩過一次坑第一版寫的是process(current_buf)結(jié)果處理的是剛剛被 DMA 寫完的緩沖但下一輪它馬上又要被 DMA 寫入處理到一半數(shù)據(jù)就被覆蓋了。所以判斷邏輯必須反向current_buf 1時(shí)剛填完的是 B安全的是 Acurrent_buf 0時(shí)剛填完的是 A安全的是 B。換句話說你永遠(yuǎn)處理“拍子落下去之前”的那塊。還有一點(diǎn)要強(qiáng)調(diào)process(buf_a)的時(shí)間必須小于整塊承載的采樣時(shí)間。以 2048 點(diǎn)和 20kSPS 為例一塊對(duì)應(yīng)大約 102.4ms。如果你的濾波算法在這塊數(shù)據(jù)上要跑 120ms那就來不及了。這時(shí)候要么減小緩沖區(qū)長(zhǎng)度比如 1024要么優(yōu)化處理函數(shù)要么多加一塊緩沖組成三緩沖。三緩沖就能容忍更長(zhǎng)處理時(shí)間但調(diào)度邏輯會(huì)復(fù)雜一點(diǎn)。3.4 ESP32 用戶該往哪繞ESP32 的 MicroPython 固件目前沒有類似read_timed()的通用 DMA 采樣接口。如果你用的是 ESP32-S3、ESP32-C3 這類芯片想走同樣的路線通常有三條路第一條路用machine.I2S配合模擬麥克風(fēng)模塊I2S 底層本身是 DMA 驅(qū)動(dòng)在 MicroPython 里可以直接配置和讀取適合音頻場(chǎng)景。但 I2S 是數(shù)字音頻接口不是把 ADC 引腳的模擬電壓直接采進(jìn)來因此不適合做普通電壓采集。第二條路自己編譯 MicroPython 固件把 ESP-IDF 里的 ADC DMA 功能封裝成自定義模塊。這條路門檻不低但收獲也大因?yàn)?ESP32-S3 的 ADC 連續(xù)采樣模式確實(shí)支持 DMA封裝后才算真正解決題目的需求。第三條路如果你只是臨時(shí)做個(gè)信號(hào)采集可以把采樣任務(wù)放到 RMT 或者純輪詢里跑博文里說的乒乓邏輯照樣能實(shí)現(xiàn)只是 CPU 占用會(huì)高一些適合采樣率不高的場(chǎng)景。我還是建議手里有 STM32 板子的話先在 STM32 上進(jìn)這套流程跑通了再去折騰 ESP32 的固件封裝。這樣能把“乒乓緩沖”的調(diào)度思路先磨熟再處理底層封裝心理壓力小很多。4. 關(guān)鍵參數(shù)怎么定采樣率、緩沖區(qū)長(zhǎng)度和采樣時(shí)間4.1 緩沖區(qū)長(zhǎng)度下限一個(gè)采樣周期內(nèi)必須處理完很多人拿到代碼第一件事就是調(diào)大緩沖區(qū)覺得越長(zhǎng)越不容易丟數(shù)據(jù)。這個(gè)思路只對(duì)了一半。緩沖區(qū)長(zhǎng)每一塊承載的數(shù)據(jù)多主循環(huán)處理的時(shí)間裕度確實(shí)變大但緩沖區(qū)長(zhǎng)也意味著數(shù)據(jù)的實(shí)時(shí)性變差。比如你用 2048 緩沖20kSPS那每一塊代表 102.4ms主循環(huán)最早也要 102.4ms 才能拿到一次結(jié)果。對(duì)電機(jī)電流環(huán)來說102ms 早炸了對(duì)離線波形存儲(chǔ)來說倒是無所謂。緩沖區(qū)長(zhǎng)度下限是要保證“從 DMA 切走緩沖到主循環(huán)真正處理完這一塊”所需的最短時(shí)間不超過一塊的采樣時(shí)間。我一般先按 512、1024、2048 三檔試然后看處理循環(huán)的最壞耗時(shí)是否低于該塊對(duì)應(yīng)的可容忍時(shí)間。如果壓不住就縮短緩沖或者把 CPU 頻率調(diào)高。F411 默認(rèn) 96MHz實(shí)際跑 MicroPython 時(shí)也可以嘗試把 CPU 頻率調(diào)到 120MHz 或 168MHz能壓縮不少處理時(shí)間。4.2 采樣率和定時(shí)器分頻的計(jì)算pyb.Timer(2, freqSAMPLE_FREQ)里面填的是目標(biāo)采樣率但底層并不是直接把定時(shí)器頻率設(shè)為 20kHz。定時(shí)器會(huì)從主時(shí)鐘分頻得到實(shí)際頻率MicroPython 幫你計(jì)算分頻比。問題是不是所有頻率都能被整除所以實(shí)際采樣率會(huì)有點(diǎn)誤差。如果你要精確的 20kSPS建議查一下所用定時(shí)器的時(shí)鐘源手動(dòng)指定分頻和周期tim pyb.Timer(2, prescaler83, period47)F411 的 APB1 定時(shí)器時(shí)鐘一般是 84MHz84MHz 除以831再除以471剛好得到 21875Hz 左右。不同型號(hào)時(shí)鐘樹不同這個(gè)需要對(duì)著數(shù)據(jù)手冊(cè)算。我的經(jīng)驗(yàn)是波形分析或音頻采樣微小偏差問題不大但如果你要拿采樣數(shù)據(jù)做頻譜Fs 不準(zhǔn)會(huì)導(dǎo)致頻率軸整體偏移。這時(shí)候最好用邏輯分析儀抓一下定時(shí)器輸出或者干脆在代碼里用time.ticks_us()實(shí)測(cè)一塊緩沖的填充時(shí)間反推實(shí)際采樣率。4.3 采樣時(shí)間、輸入阻抗和參考電壓三個(gè)隱藏坑第一個(gè)坑是 ADC 采樣周期。如果你把采樣周期調(diào)得太短輸入源阻抗又高采樣電容還沒來得及充到輸入電壓讀出來的值就會(huì)偏小。手冊(cè)里的原則是輸入阻抗越大需要的采樣時(shí)間越長(zhǎng)。我一般給信號(hào)源串一個(gè)小于 1kΩ 的電阻再并一個(gè) 10nF 到 100nF 的電容做濾波這樣采樣結(jié)果會(huì)穩(wěn)定很多。第二個(gè)坑是參考電壓。machine.ADC返回的是相對(duì) ADC 參考電壓的比例值不是絕對(duì)電壓。如果你參考電壓不是干凈的 3.3V而是直接從 LDO 出來噪聲會(huì)直接反映在采樣值上。做高精度測(cè)量時(shí)參考電壓腳最好單獨(dú)濾波或者使用外部基準(zhǔn)芯片。第三個(gè)坑最容易被忽略如果兩塊緩沖都定義成 16 位無符號(hào)數(shù)組DMA 寫的是 12 位數(shù)據(jù)高位量程是 0 到 4095看起來沒問題。但某些 STM32 型號(hào)支持 16 位 ADC或者你把 ADC 配成了右對(duì)齊/左對(duì)齊數(shù)據(jù)可能整體左移了 4 位。處理這些數(shù)據(jù)之前最好先打印一段原始值看看最大值是否接近你的預(yù)期。5. 踩坑實(shí)錄這些問題我調(diào) DMA 時(shí)都遇到過5.1 采回來的數(shù)據(jù)全是同一個(gè)數(shù)最經(jīng)典的問題。一開頭我以為是 DMA 沒配好后來發(fā)現(xiàn)是接線問題電位器中間抽頭沒接對(duì)或者 GND 沒共地。MicroPython 這邊read_timed()長(zhǎng)時(shí)間不返回其實(shí)不代表卡死而是采樣率太慢比如定時(shí)器設(shè)了 1Hz填滿 2048 個(gè)點(diǎn)要 2048 秒看著像死機(jī)了。另外還要檢查是不是板子上同一個(gè) ADC 引腳被復(fù)用了。STM32 很多引腳是多功能的如果你代碼里不小心初始化了別的外設(shè)占用了同一個(gè)引腳它就不再是模擬輸入了。遇到“全是一個(gè)數(shù)”的時(shí)候先別查底層寄存器先用萬用表量引腳電壓再打印adc.read()看有沒有變化。軟件和硬件分開排查效率最高。5.2 換緩沖時(shí)整個(gè)波形斷了一截用read_timed做軟件乒乓有個(gè)天然缺點(diǎn)兩次read_timed()調(diào)用之間DMA 其實(shí)是停了一下的。雖然 Python 線程切換時(shí)間不算特別長(zhǎng)但在高速采樣下足以丟掉幾個(gè)點(diǎn)。如果你看波形會(huì)發(fā)現(xiàn)每一次切換緩沖時(shí)都有一段小缺口。嚴(yán)格要解決這個(gè)問題需要走硬件乒乓也就是直接使用 STM32 的 DMA 循環(huán)模式和雙緩沖模式。但 MicroPython 默認(rèn)不開放這個(gè)接口只能通過自定義固件模塊來做。如果你只是為了做數(shù)據(jù)處理而采樣軟件乒乓的缺口是可以接受的如果連續(xù)波形絕對(duì)不能斷那還是老老實(shí)實(shí)寫 C 模塊或者干脆裸機(jī)開發(fā)。5.3 線程調(diào)度抖到?jīng)]法看后臺(tái)線程和主線程同時(shí)在跑MicroPython 的線程模型和 CPython 的 GIL 神似同一時(shí)間只能有一個(gè)線程執(zhí)行 Python 字節(jié)碼。所以后臺(tái)線程每次read_timed()結(jié)束后并不會(huì)“立刻”切回主線程主線程可能要等到當(dāng)前一段代碼執(zhí)行完。這樣“數(shù)據(jù)塊就緒”和“主線程看到就緒”之間就有了不確定延遲。解決辦法很簡(jiǎn)單主循環(huán)里不要塞太多耗時(shí)操作盡量保持每輪循環(huán)時(shí)間穩(wěn)定。如果要做 FFT 這類重活可以先把它算出來的結(jié)果存到列表里下一次循環(huán)再刷新到屏幕不要在數(shù)據(jù)塊就緒的同一輪里做所有事情。實(shí)測(cè)下來把“數(shù)據(jù)消費(fèi)”和“結(jié)果展示”拆到兩輪循環(huán)以后抖動(dòng)會(huì)明顯下降。5.4 數(shù)組類型和長(zhǎng)度不一致導(dǎo)致神秘報(bào)錯(cuò)read_timed()對(duì)緩沖區(qū)有要求必須是array(H)、array(I)這類連續(xù)內(nèi)存數(shù)組普通 Python list 不行。列表內(nèi)部是指針數(shù)組元素不是連續(xù)存放的DMA 沒法直接往里面寫。還有個(gè)坑是array.array(H, [0]) * BUF_LEN和array.array(H, [0] * BUF_LEN)看著一樣效果也接近但后者會(huì)先創(chuàng)建一個(gè)包含 2048 個(gè)元素的 Python list內(nèi)存占用更大。我在資源緊張的板子上吃過虧后來統(tǒng)一用前者。5.5 MicroPython 里到底能不能正確處理 DMA 中斷能但默認(rèn)不暴露。read_timed()把 DMA 完成中斷封裝在內(nèi)部了我們只是調(diào)用方看不到中斷回調(diào)。如果你需要“DMA 填完一塊就立即通知主循環(huán)”這種效果光靠線程輪詢不夠?qū)崟r(shí)。這時(shí)候需要自己寫一個(gè)小擴(kuò)展模塊在 C 層面注冊(cè) DMA 中斷回調(diào)然后調(diào)用mp_sched_schedule()把 Python 函數(shù)掛到調(diào)度器上等主循環(huán)空閑后執(zhí)行。這種方式比線程切換穩(wěn)定也比不停輪詢省 CPU但涉及編譯固件工作量不小。對(duì)多數(shù)項(xiàng)目來說軟件乒乓 線程輪詢已經(jīng)夠用了。6. 這套方案我實(shí)際用在哪值不值6.1 一個(gè)三相電流同步采樣的真實(shí)案例我最早試這套方案是想在 MicroPython 里做一個(gè)小型電機(jī)驅(qū)動(dòng)原型。三相電流要同時(shí)采樣每相一個(gè) ADC 通道采樣率 50kSPS 在這顆芯片上壓力不小。后來改成“三個(gè)通道輪流進(jìn)同一個(gè) DMA 緩沖后臺(tái)線程負(fù)責(zé)搬運(yùn)主循環(huán)做 Clarke 變換”的方式總算把控制周期壓到了 200us 左右。注意50kSPS 下每個(gè)樣本間隔 20us純 Python 輪詢是不可能完成的只有 DMA 能頂住。當(dāng)然最后的原型還是遷移到了 C 固件因?yàn)榭刂骗h(huán)路的實(shí)時(shí)性要求太高。但 MicroPython 的 DMA 乒乓方案幫我把算法先跑通省去了前期大量調(diào)試時(shí)間這在做可行性驗(yàn)證時(shí)價(jià)值很大。6.2 數(shù)據(jù)對(duì)比輪詢 vs 乒乓 DMA下表是我在 F411 96MHz 下實(shí)測(cè)的一組近似值采樣率 10kSPS處理任務(wù)是對(duì) 1000 個(gè)點(diǎn)做一次簡(jiǎn)單均值濾波方案每 1000 點(diǎn)所需 CPU 開銷最大主循環(huán)周期抖動(dòng)是否適合連續(xù)采樣主循環(huán)逐點(diǎn)調(diào)用 read_u16約 20% ~ 35%明顯不穩(wěn)定否定時(shí)器中斷里讀 ADC約 15% 中斷風(fēng)險(xiǎn)抖動(dòng)很高否DMA 單緩沖約 3% ~ 5%低但處理期間會(huì)斷流勉強(qiáng)DMA 乒乓緩沖約 1% ~ 3%低穩(wěn)定是數(shù)據(jù)不追求嚴(yán)謹(jǐn)?shù)厔?shì)很清晰。乒乓緩沖并不是為了“跑得更快”而是為了讓采樣和數(shù)據(jù)消費(fèi)同時(shí)進(jìn)行互不拖累。6.3 寫在最后的經(jīng)驗(yàn)如果你只是想臨時(shí)抓一段波形那用read_timed()單緩沖就夠不需要乒乓。一旦你發(fā)現(xiàn)“抓完一段再去處理”會(huì)導(dǎo)致采樣空窗或者主循環(huán)因?yàn)榈却龜?shù)據(jù)而卡頓那時(shí)候再上雙緩沖你的收益會(huì)非常明顯。我個(gè)人實(shí)際使用中的體會(huì)是MicroPython 適合快速驗(yàn)證系統(tǒng)但硬件級(jí)雙緩沖、無縫切換這種事兒最終還是要理解底層驅(qū)動(dòng)甚至自己封裝 C 模塊。乒乓緩沖的思路學(xué)會(huì)了無論是在 MicroPython、C 還是 Rust 固件開發(fā)里都同樣適用。最后再分享一個(gè)小技巧調(diào)試這類采樣鏈路時(shí)別急著上 FFT 或控制算法先用一個(gè)可變占空比的 LED 或者串口打印當(dāng)前block_index確認(rèn)后臺(tái)線程是不是真的在一輪一輪推進(jìn)。只要block_index穩(wěn)定增長(zhǎng)你的乒乓骨架基本就算立住了剩下的都是優(yōu)化問題。