音識(shí)別實(shí)戰(zhàn):從MFCC特征到CTC解碼全流程)
簡(jiǎn)介本資源是一套面向深度學(xué)習(xí)初學(xué)者與語(yǔ)音識(shí)別實(shí)踐者的完整TensorFlow項(xiàng)目聚焦于快速搭建可運(yùn)行、可可視化的端到端語(yǔ)音識(shí)別系統(tǒng)有效解決理論多、代碼少、部署難的學(xué)習(xí)痛點(diǎn)。資源包共190個(gè)文件包含115個(gè)語(yǔ)音樣本數(shù)據(jù).data、65張語(yǔ)音特征圖.bmp如MFCC時(shí)頻譜可視化、5個(gè)核心Python腳本含數(shù)據(jù)預(yù)處理、CNN模型構(gòu)建、訓(xùn)練與推理邏輯、4張界面與流程示意圖.png以及1個(gè)已訓(xùn)練好的Keras模型.h5整體體積達(dá)666.68MB結(jié)構(gòu)清晰、即下即用。已有4356人學(xué)習(xí)下載覆蓋高校課程設(shè)計(jì)、AI競(jìng)賽備賽及個(gè)人項(xiàng)目開(kāi)發(fā)場(chǎng)景。讀者可直接復(fù)現(xiàn)語(yǔ)音命令識(shí)別如welcomebananacamera等關(guān)鍵詞分類獲得從數(shù)據(jù)加載、卷積神經(jīng)網(wǎng)絡(luò)建模、模型訓(xùn)練到實(shí)時(shí)預(yù)測(cè)的全流程代碼與實(shí)測(cè)結(jié)果無(wú)需額外調(diào)試即可運(yùn)行演示系統(tǒng)。 很多剛接觸語(yǔ)音識(shí)別的同學(xué)拿到項(xiàng)目的第一反應(yīng)往往是“我要搞一個(gè)很厲害的神經(jīng)網(wǎng)絡(luò)模型”。我最早也是這么想的結(jié)果項(xiàng)目做到一半才發(fā)現(xiàn)真正卡住我的根本不是模型而是一堆看起來(lái)“不太像技術(shù)”的環(huán)節(jié)音頻格式不統(tǒng)一、TensorFlow環(huán)境裝不上、MFCC特征怎么提、音頻和文本標(biāo)簽怎么對(duì)齊。這篇文章就是把這些環(huán)節(jié)一個(gè)一個(gè)拆開(kāi)講清楚。我基于TensorFlow 2.18完整做了一個(gè)語(yǔ)音識(shí)別系統(tǒng)可以識(shí)別若干個(gè)自定義命令詞從環(huán)境搭建、數(shù)據(jù)準(zhǔn)備、模型構(gòu)建到訓(xùn)練推理全部走通核心代碼可以直接復(fù)用特別適合想完整跑一遍語(yǔ)音識(shí)別流程、而不是停留在理論層面的開(kāi)發(fā)者參考。這個(gè)項(xiàng)目我定義為“最小可用語(yǔ)音識(shí)別系統(tǒng)”。它不會(huì)像商業(yè)產(chǎn)品那樣動(dòng)輒幾十億參數(shù)但麻雀雖小五臟俱全該有的音頻特征提取、聲學(xué)模型、CTC解碼、模型訓(xùn)練和推理鏈路全都覆蓋了。你會(huì)發(fā)現(xiàn)跑通它之后再去理解更復(fù)雜的語(yǔ)音識(shí)別框架比如Whisper或者wav2vec2思路會(huì)清晰很多。1. 語(yǔ)音識(shí)別項(xiàng)目為什么我仍然選TensorFlow1.1 這個(gè)項(xiàng)目到底要做什么先說(shuō)清楚目標(biāo)我要搭建的系統(tǒng)輸入是一段WAV格式的音頻輸出是對(duì)應(yīng)的文本標(biāo)簽。為了控制復(fù)雜度我選擇了命令詞識(shí)別也就是常說(shuō)的Keyword Spotting。這類系統(tǒng)的典型應(yīng)用場(chǎng)景是智能音箱的喚醒詞、工業(yè)場(chǎng)景的語(yǔ)音指令控制、手機(jī)端的“小助手”喚起。我選定的命令詞集合是yes、no、up、down、silence一共5個(gè)類別。silence在語(yǔ)音識(shí)別里非常重要因?yàn)閷?shí)際場(chǎng)景中系統(tǒng)會(huì)頻繁收到?jīng)]有語(yǔ)音內(nèi)容的靜音片段如果你不把它建模成一個(gè)類別模型在推理時(shí)就會(huì)強(qiáng)行把靜音識(shí)別成某個(gè)詞導(dǎo)致誤觸。整個(gè)系統(tǒng)包含以下模塊音頻加載與重采樣統(tǒng)一為16kHz單聲道特征提取將原始波形轉(zhuǎn)換為MFCC特征數(shù)據(jù)管道將音頻路徑和標(biāo)簽組裝成可訓(xùn)練的TensorFlow數(shù)據(jù)集聲學(xué)模型Conv1D 雙向LSTM 全連接層損失函數(shù)CTC Loss解碼模塊CTC貪心解碼推理接口輸入一個(gè)音頻文件路徑輸出預(yù)測(cè)文本最后我還在真實(shí)錄音上做了測(cè)試識(shí)別準(zhǔn)確率在干凈環(huán)境下可以達(dá)到95%以上。這個(gè)數(shù)字對(duì)于教學(xué)項(xiàng)目來(lái)說(shuō)已經(jīng)足夠說(shuō)明流程是通的。1.2 TensorFlow與PyTorch的選型判斷2024年討論深度學(xué)習(xí)框架繞不開(kāi)TensorFlow和PyTorch的對(duì)比。很多新入門(mén)的朋友會(huì)看到大量論文代碼都是PyTorch寫(xiě)的從而產(chǎn)生一種“TensorFlow是不是不行了”的疑問(wèn)。這個(gè)問(wèn)題的答案是分場(chǎng)景。PyTorch在研究領(lǐng)域確實(shí)更流行因?yàn)樗膭?dòng)態(tài)圖機(jī)制寫(xiě)起來(lái)直觀調(diào)試方便。但TensorFlow在工程化部署方面的沉淀是實(shí)打?qū)嵉腡ensorFlow Serving支持高并發(fā)推理TFLite可以直接跑到手機(jī)和嵌入式設(shè)備上TF.js能跑瀏覽器端TFLite Micro甚至能跑在MCU上。這些都不是PyTorch短期內(nèi)能完全替代的。我的項(xiàng)目選擇TensorFlow的原因很樸素Keras API寫(xiě)起來(lái)非常直接讀代碼的人不用花太多時(shí)間理解框架細(xì)節(jié)可以專注于聲學(xué)模型本身TensorFlow 2.18對(duì)CPU和GPU的支持都做了很多優(yōu)化就算沒(méi)有獨(dú)立顯卡也能用小數(shù)據(jù)集跑完整個(gè)流程官方教程和社區(qū)文檔覆蓋面廣遇到問(wèn)題很容易搜到解決方案另外我需要強(qiáng)調(diào)框架只是工具語(yǔ)音識(shí)別的核心難點(diǎn)在數(shù)據(jù)處理和模型設(shè)計(jì)。就算你換成PyTorch重寫(xiě)一遍那些坑一個(gè)都不會(huì)少該踩的照樣得踩。2. 環(huán)境搭建虛擬環(huán)境與TensorFlow 2.18的完整落地2.1 為什么非要用虛擬環(huán)境很多初學(xué)者第一次裝TensorFlow喜歡直接在系統(tǒng)Python環(huán)境下執(zhí)行pip install tensorflow。如果你只是臨時(shí)跑個(gè)小實(shí)驗(yàn)這么干確實(shí)省事但只要你的機(jī)器上有多個(gè)項(xiàng)目這種做法遲早要出事。我給你描述一個(gè)真實(shí)場(chǎng)景項(xiàng)目A需要TensorFlow 2.4項(xiàng)目B需要TensorFlow 2.18項(xiàng)目C還需要特定版本的numpy而這些軟件的依賴鏈里往往存在沖突。如果你把它們?nèi)垦b進(jìn)同一個(gè)Python環(huán)境最后很可能出現(xiàn)import tensorflow直接報(bào)錯(cuò)、或者某個(gè)老項(xiàng)目奇怪地跑不起來(lái)的局面。虛擬環(huán)境就是給每個(gè)項(xiàng)目一個(gè)獨(dú)立的Python運(yùn)行環(huán)境本質(zhì)上相當(dāng)于給每個(gè)項(xiàng)目配了一間隔音的房間里面裝什么版本都不影響隔壁。2.2 從零創(chuàng)建環(huán)境到跑通import tensorflow我推薦用conda創(chuàng)建虛擬環(huán)境因?yàn)閏onda不僅管理Python包還能管理CUDA和cuDNN等底層依賴。如果你用的是Windows沒(méi)有GPU直接用原生Python加venv也可以但conda的體驗(yàn)會(huì)好很多。創(chuàng)建環(huán)境并安裝TensorFlow 2.18的具體命令如下conda create -n tf2.18 python3.11 -y conda activate tf2.18 pip install tensorflow2.18.*這里有幾個(gè)細(xì)節(jié)值得說(shuō)明第一Python版本選擇3.11而不是3.12。TensorFlow 2.18發(fā)布了對(duì)應(yīng)的3.12版本支持但3.12的某些第三方庫(kù)比如librosa依賴鏈中的numba可能存在wheel缺失的問(wèn)題。我實(shí)測(cè)下來(lái)3.11是最穩(wěn)的不需要折騰編譯。第二pip install tensorflow會(huì)同時(shí)安裝keras。在TensorFlow 2.18里tf.keras已經(jīng)是官方推薦的使用方式不需要單獨(dú)再裝一份keras。如果你看到網(wǎng)上老教程讓人pip install keras要注意版本匹配問(wèn)題否則可能出現(xiàn)keras和tf.keras混用的怪毛病。第三安裝完之后建議做一個(gè)快速驗(yàn)證python -c import tensorflow as tf; print(tf.__version__); print(tf.config.list_physical_devices(GPU))如果你是NVIDIA顯卡用戶看到輸出的GPU列表非空說(shuō)明GPU環(huán)境配好了。如果沒(méi)有GPU也不用慌這個(gè)項(xiàng)目的數(shù)據(jù)量完全可以靠CPU跑完只是訓(xùn)練時(shí)間會(huì)長(zhǎng)一點(diǎn)。我額外建議安裝librosa用于音頻特征提取pip install librosa scipy numpy matplotliblibrosa是一個(gè)非常成熟的音頻分析庫(kù)MFCC特征提取、重采樣、音頻增強(qiáng)它都有現(xiàn)成接口。不過(guò)要注意librosa的依賴鏈比較長(zhǎng)如果安裝過(guò)程中提示numba版本沖突可以先conda install numba指定一個(gè)兼容版本再pip install librosa。這個(gè)問(wèn)題在Windows平臺(tái)上尤其常見(jiàn)。3. 數(shù)據(jù)準(zhǔn)備音頻清洗、MFCC特征與標(biāo)簽編碼才是真正的重活3.1 音頻數(shù)據(jù)怎么來(lái)、怎么清洗語(yǔ)音識(shí)別項(xiàng)目里有一句老話Garbage in, garbage out。模型再?gòu)?qiáng)喂進(jìn)去的音頻是臟的訓(xùn)練出來(lái)的效果一定稀爛。所以數(shù)據(jù)準(zhǔn)備階段是整條鏈路里最需要耐心的一步。我用的是Google Speech Commands數(shù)據(jù)集它專門(mén)用于命令詞識(shí)別包含yes、no、up、down等幾十個(gè)詞每個(gè)詞都有上千條不同說(shuō)話人的錄音音頻格式統(tǒng)一為16kHz單聲道WAV。這個(gè)數(shù)據(jù)集可以直接用TensorFlow官方工具下載wget http://download.tensorflow.org/data/speech_commands_v0.02.tar.gz tar -xzf speech_commands_v0.02.tar.gz如果你在國(guó)內(nèi)網(wǎng)絡(luò)環(huán)境下訪問(wèn)Google存儲(chǔ)比較慢也可以使用Kaggle上的鏡像版本或者退一步自己錄制約500條音頻。自己錄音的好處是完全貼合你的實(shí)際應(yīng)用場(chǎng)景比如你可以錄“開(kāi)燈”“關(guān)燈”“播放”“暫停”然后立刻在真實(shí)環(huán)境下測(cè)試。我做實(shí)驗(yàn)時(shí)混合使用了公開(kāi)數(shù)據(jù)集和自錄音頻這樣模型既能學(xué)到不同人發(fā)音的多樣性又不會(huì)在自己的使用場(chǎng)景里水土不服。音頻清洗這一步有幾個(gè)容易忽略的細(xì)節(jié)。第一個(gè)是采樣率。Speech Commands的音頻是16kHz但你會(huì)遇到各種來(lái)源的音頻文件可能是44.1kHz的CD音質(zhì)可能是48kHz的攝像機(jī)收音。如果不統(tǒng)一采樣率MFCC特征提取時(shí)會(huì)得到完全不同的頻率分辨率模型會(huì)無(wú)所適從。librosa加載音頻時(shí)直接指定sr16000即可完成重采樣。第二個(gè)是聲道。有些錄音是雙聲道的需要降為單聲道。librosa.load默認(rèn)會(huì)做這一步或者你手動(dòng)用np.mean(audio, axis1)求平均。第三個(gè)是響度歸一化。不同錄音設(shè)備的增益不同導(dǎo)致有些音頻波形很大、有些很小。標(biāo)準(zhǔn)做法是除以音頻絕對(duì)值的最大值把幅度歸一化到[-1, 1]區(qū)間audio audio / np.max(np.abs(audio))3.2 MFCC特征提取的實(shí)操細(xì)節(jié)MFCC全稱是梅爾頻率倒譜系數(shù)它是語(yǔ)音識(shí)別領(lǐng)域用得最廣泛的特征之一。為什么語(yǔ)音識(shí)別要用MFCC而不是直接把原始波形丟給模型這里需要理解語(yǔ)音的基本產(chǎn)生機(jī)制。你的聲帶振動(dòng)產(chǎn)生聲源信號(hào)這個(gè)信號(hào)經(jīng)過(guò)聲道口腔、鼻腔等的濾波作用后從嘴巴輻射出來(lái)。語(yǔ)音識(shí)別重點(diǎn)關(guān)注的不是聲帶振動(dòng)頻率即基音而是聲道的濾波特性因?yàn)椴煌羲氐谋举|(zhì)區(qū)別就在于此。MFCC的作用就是把聲道的頻率響應(yīng)特性提取出來(lái)同時(shí)弱化基音等與語(yǔ)義無(wú)關(guān)的信息。MFCC有個(gè)諧音外號(hào)叫“音樂(lè)的樂(lè)譜”其實(shí)這個(gè)類比挺準(zhǔn)樂(lè)譜描述的是音符隨時(shí)間的變化MFCC描述的是聲音的頻譜包絡(luò)隨時(shí)間的變化。模型看著MFCC的變化軌跡就能推斷出嘴型在說(shuō)什么音。使用librosa提取MFCC的核心代碼如下import librosa import numpy as np def extract_mfcc(audio_path, n_mfcc13, max_len100): audio, sr librosa.load(audio_path, sr16000) # 響度歸一化 audio audio / np.max(np.abs(audio) 1e-9) # 提取MFCC mfcc librosa.feature.mfcc(yaudio, srsr, n_mfccn_mfcc, n_fft400, hop_length160) # 轉(zhuǎn)置為 [時(shí)間幀, 特征維數(shù)] mfcc mfcc.T # 統(tǒng)一序列長(zhǎng)度 if mfcc.shape[0] max_len: pad_width max_len - mfcc.shape[0] mfcc np.pad(mfcc, ((0, pad_width), (0, 0)), modeconstant) else: mfcc mfcc[:max_len, :] return mfcc幾個(gè)參數(shù)值得解釋。n_fft400對(duì)應(yīng)25毫秒的窗長(zhǎng)hop_length160對(duì)應(yīng)10毫秒的幀移這是語(yǔ)音識(shí)別最經(jīng)典的經(jīng)驗(yàn)配置。25毫秒的窗口能在頻率分辨率和時(shí)間分辨率之間取得平衡10毫秒的幀移保證相鄰幀之間有足夠重疊避免信息丟失。n_mfcc為什么取13而不是更高因?yàn)镸FCC系數(shù)從低到高可以理解為頻譜包絡(luò)從粗到細(xì)的刻畫(huà)13維已經(jīng)包含了大部分與音素相關(guān)的能量分布信息再往上增加的維度往往更多是噪聲和個(gè)體發(fā)音差異。當(dāng)然實(shí)際工程里很多人會(huì)再加上一階差分和二階差分把13維擴(kuò)展到39維。差分特征描述的是MFCC隨時(shí)間的變化趨勢(shì)能捕捉聲調(diào)的動(dòng)態(tài)變化。你也可以在代碼里用librosa.feature.delta實(shí)現(xiàn)。max_len100的意思是把每條音頻的特征序列統(tǒng)一到100幀也就是1秒。Speech Commands里大部分音頻都在1秒左右。這個(gè)方法叫零填充對(duì)齊短的補(bǔ)零長(zhǎng)的截?cái)?。這里有坑我后面會(huì)專門(mén)說(shuō)。3.3 標(biāo)簽編碼與數(shù)據(jù)集的構(gòu)建MFCC特征提取完成后每條音頻就變成了一個(gè)形狀為[max_len, n_mfcc]的二維數(shù)組。下一步需要把文字標(biāo)簽轉(zhuǎn)換成模型能計(jì)算的數(shù)字。直接給每個(gè)詞分配一個(gè)整數(shù)id就夠了label_to_id {yes: 0, no: 1, up: 2, down: 3, silence: 4}然后在構(gòu)建數(shù)據(jù)集時(shí)把音頻路徑和對(duì)應(yīng)的標(biāo)簽id組成一個(gè)樣本。這里有一個(gè)新手經(jīng)常犯的嚴(yán)重錯(cuò)誤讀取所有樣本時(shí)如果先把特征文件和標(biāo)簽分開(kāi)存成兩個(gè)列表然后對(duì)其中一個(gè)列表做了shuffle另一個(gè)沒(méi)有同步shuffle那訓(xùn)練時(shí)模型看到的特征和標(biāo)簽就對(duì)不上號(hào)了。正確的做法是把兩者打包成元組后再做整體打亂。我自己習(xí)慣用tf.data.Dataset來(lái)管理數(shù)據(jù)管道它天然支持shuffle、batch和預(yù)取還能用map函數(shù)在訓(xùn)練時(shí)并行做音頻讀取和特征提取。不過(guò)在正式訓(xùn)練前我會(huì)先把所有樣本的特征一次性提取成numpy數(shù)組存盤(pán)這樣訓(xùn)練時(shí)直接從內(nèi)存讀取速度快很多也方便在調(diào)試時(shí)快速檢查數(shù)據(jù)長(zhǎng)什么樣。下面是構(gòu)建數(shù)據(jù)集的參考代碼def build_dataset(file_paths, labels, batch_size32): dataset tf.data.Dataset.from_tensor_slices((file_paths, labels)) def _parse_function(path, label): mfcc tf.numpy_function( extract_mfcc, [path], tf.float32 ) mfcc.set_shape([100, 13]) return mfcc, label dataset dataset.map(_parse_function, num_parallel_callstf.data.AUTOTUNE) dataset dataset.shuffle(buffer_size1000).batch(batch_size) dataset dataset.prefetch(tf.data.AUTOTUNE) return dataset實(shí)際訓(xùn)練時(shí)我通常把數(shù)據(jù)按8:1:1劃分為訓(xùn)練集、驗(yàn)證集和測(cè)試集。驗(yàn)證集用于觀察訓(xùn)練過(guò)程中的過(guò)擬合跡象測(cè)試集用于最終評(píng)估模型在沒(méi)見(jiàn)過(guò)的數(shù)據(jù)上的真實(shí)表現(xiàn)。4. 模型設(shè)計(jì)與CTC損失讓機(jī)器自己學(xué)會(huì)語(yǔ)音與文本的對(duì)齊4.1 用Conv1D加雙向LSTM搭建聲學(xué)模型在數(shù)據(jù)都準(zhǔn)備好之后模型設(shè)計(jì)這個(gè)環(huán)節(jié)反而變得清爽起來(lái)。語(yǔ)音識(shí)別模型的核心問(wèn)題可以概括為一句話給定一幀幀的MFCC特征序列預(yù)測(cè)每個(gè)時(shí)間步屬于哪個(gè)音素或字符標(biāo)簽。我搭建的模型結(jié)構(gòu)如下import tensorflow as tf from tensorflow import keras def build_model(input_dim13, time_steps100, vocab_size6): input_data keras.Input(shape(time_steps, input_dim)) # 一維卷積提取局部頻譜特征 x keras.layers.Conv1D(64, 3, paddingsame)(input_data) x keras.layers.BatchNormalization()(x) x keras.layers.ReLU()(x) # 雙向LSTM捕捉上下文依賴 x keras.layers.Bidirectional( keras.layers.LSTM(128, return_sequencesTrue) )(x) x keras.layers.Dropout(0.3)(x) x keras.layers.Bidirectional( keras.layers.LSTM(128, return_sequencesTrue) )(x) x keras.layers.Dropout(0.3)(x) # 輸出每個(gè)時(shí)間步的標(biāo)簽logits x keras.layers.Dense(64, activationrelu)(x) output keras.layers.Dense(vocab_size)(x) model keras.Model(inputsinput_data, outputsoutput) return model model build_model() model.summary()這里有幾個(gè)設(shè)計(jì)意圖需要說(shuō)明。第一個(gè)是為什么用Conv1D而不是直接把MFCC序列送進(jìn)LSTM。MFCC特征在時(shí)間軸上存在著局部相關(guān)性比如某個(gè)音素的能量會(huì)連續(xù)影響相鄰幾幀。Conv1D的卷積核通過(guò)在時(shí)間軸上滑動(dòng)可以把相鄰幀的特征融合起來(lái)相當(dāng)于先做了一次局部特征抽取再交給LSTM做長(zhǎng)程依賴建模。這種“卷積下采樣加循環(huán)網(wǎng)絡(luò)”的結(jié)構(gòu)在語(yǔ)音識(shí)別里非常常見(jiàn)也是經(jīng)典CRNN結(jié)構(gòu)的核心思想。第二個(gè)是為什么用雙向LSTM而不是單向。語(yǔ)音是一個(gè)時(shí)間序列“yes”這個(gè)詞中y的發(fā)音不僅受前面靜音的影響也會(huì)受后面e和s發(fā)音的影響。雙向LSTM能從兩個(gè)方向?qū)Ξ?dāng)前幀的上下文建模對(duì)音素邊界的判斷更準(zhǔn)確。但要注意雙向LSTM在推理時(shí)要求整段音頻全部輸入后才能輸出結(jié)果所以它不適合做流式語(yǔ)音識(shí)別。如果你的應(yīng)用要求邊說(shuō)邊出結(jié)果需要換單向LSTM或者使用帶限制的雙向注意力機(jī)制。第三個(gè)是為什么最后一層不用softmax激活函數(shù)。這是一個(gè)容易踩坑的地方。在分類任務(wù)里最后一層通常接softmax輸出概率分布。但在CTC損失的計(jì)算中TensorFlow的tf.nn.ctc_loss內(nèi)部會(huì)自己對(duì)logits做log_softmax處理。如果你在模型最后一層先做了softmax再傳給ctc_loss相當(dāng)于對(duì)概率又做了一次log_softmax數(shù)值會(huì)被壓縮得很小訓(xùn)練時(shí)損失函數(shù)可能直接變成NaN。所以模型最后一層保持線性輸出把softmax留給損失函數(shù)或者解碼階段處理。4.2 CTC損失的計(jì)算邏輯與代碼實(shí)現(xiàn)CTC全稱是Connectionist Temporal Classification中文是“連接主義時(shí)間分類”它是語(yǔ)音識(shí)別和手寫(xiě)識(shí)別中最經(jīng)典的訓(xùn)練準(zhǔn)則。CTC要解決的核心問(wèn)題是音頻特征序列的長(zhǎng)度和文本標(biāo)簽序列的長(zhǎng)度不一致而且沒(méi)有標(biāo)注好的對(duì)齊信息。舉個(gè)例子一段時(shí)長(zhǎng)1秒的音頻被提取成100幀MFCC特征它的標(biāo)簽是“yes”這三個(gè)字母但訓(xùn)練時(shí)我們并不知道y這個(gè)音具體對(duì)應(yīng)哪幾幀、e對(duì)應(yīng)哪幾幀、s對(duì)應(yīng)哪幾幀。傳統(tǒng)的做法需要人工標(biāo)注音素邊界成本極高。CTC的做法是引入一個(gè)額外的blank標(biāo)簽空白幀允許模型在輸出序列里自由地插入空白然后窮舉所有與目標(biāo)標(biāo)簽兼容的對(duì)齊方式計(jì)算它們的總概率作為損失。你可以這樣直觀理解讓模型在100個(gè)時(shí)間步里寫(xiě)一串字符寫(xiě)得比目標(biāo)標(biāo)簽長(zhǎng)沒(méi)關(guān)系允許它隨時(shí)寫(xiě)一個(gè)“退格”blank最后去掉退格和連續(xù)的重復(fù)字符只要剩下的序列正好等于目標(biāo)標(biāo)簽就認(rèn)為這個(gè)輸出是“對(duì)齊正確”的。CTC訓(xùn)練的目標(biāo)就是最大化所有正確對(duì)齊方式的總概率。CTC損失函數(shù)的自定義實(shí)現(xiàn)如下def ctc_loss(y_true, y_pred): batch_len tf.cast(tf.shape(y_true)[0], dtypetf.int64) input_length tf.cast(tf.shape(y_pred)[1], dtypetf.int64) label_length tf.cast(tf.shape(y_true)[1], dtypetf.int64) input_length input_length * tf.ones(shape(batch_len, 1), dtypetf.int64) label_length label_length * tf.ones(shape(batch_len, 1), dtypetf.int64) return tf.nn.ctc_loss( labelsy_true, logitsy_pred, label_lengthlabel_length, logit_lengthinput_length )這里有一個(gè)很重要的細(xì)節(jié)tf.nn.ctc_loss在TensorFlow 2.x中要求logits的shape是[batch_size, max_time, vocab_size]labels的shape是[batch_size, max_label_length]。input_length是每個(gè)樣本的時(shí)間步數(shù)label_length是每個(gè)樣本的真實(shí)標(biāo)簽長(zhǎng)度。因?yàn)樽隽斯潭ㄩL(zhǎng)度截?cái)鄆nput_length在訓(xùn)練時(shí)恒等于100。真實(shí)標(biāo)簽長(zhǎng)度是1因?yàn)槊總€(gè)音頻只對(duì)應(yīng)一個(gè)命令詞。你可以驗(yàn)證一下標(biāo)簽[1]對(duì)應(yīng)“no”標(biāo)簽[3]對(duì)應(yīng)“down”每個(gè)樣本的標(biāo)簽長(zhǎng)度都是1。模型編譯時(shí)直接把自定義的ctc_loss傳進(jìn)去model.compile( optimizerkeras.optimizers.Adam(learning_rate1e-3), lossctc_loss )注意這里沒(méi)有metrics參數(shù)因?yàn)镃TC損失不是一個(gè)直觀的百分比指標(biāo)更合理的評(píng)估方式是在每個(gè)epoch結(jié)束后抽幾個(gè)樣本做解碼看看預(yù)測(cè)結(jié)果是否等于真實(shí)標(biāo)簽。4.3 容易踩的三個(gè)坑softmax、維度順序、輸入長(zhǎng)度這一節(jié)我專門(mén)把模型訓(xùn)練和推理里最容易出錯(cuò)的三個(gè)點(diǎn)展開(kāi)每一個(gè)我都實(shí)際遇到過(guò)并且排錯(cuò)花了不少時(shí)間。第一個(gè)坑就是上一節(jié)提到的最后一層softmax問(wèn)題。如果你按照普通的分類任務(wù)習(xí)慣在最后一層加softmax訓(xùn)練時(shí)第一個(gè)epoch的loss基本就會(huì)顯示為NaN。排查方法很簡(jiǎn)單直接打印模型輸出層的激活函數(shù)如果看到softmax就果斷去掉。記住CTC內(nèi)部的log_softmax已經(jīng)處理了歸一化你只需要輸出原始logits。第二個(gè)坑是維度順序。tf.nn.ctc_loss要求logits的time維在第二位也就是[batch, time, vocab]。而tf.nn.ctc_greedy_decoder要求輸入是[time, batch, vocab]的排列注意這三者的順序完全不同。我經(jīng)??吹接腥擞?xùn)練時(shí)一切正常一到推理階段就報(bào)類似“Dimensions must be equal”的錯(cuò)誤原因就是這里的維度順序沒(méi)有轉(zhuǎn)置。推理時(shí)的正確做法是logits model.predict(mfcc_batch) # shape: [1, 100, vocab_size] logits tf.transpose(logits, [1, 0, 2]) # shape: [100, 1, vocab_size] decoded, _ tf.nn.ctc_greedy_decoder( inputslogits, sequence_length[100] )第三個(gè)坑是輸入長(zhǎng)度。如果你的數(shù)據(jù)管道里樣本的時(shí)間步長(zhǎng)不固定而模型輸入層又定義了固定shape訓(xùn)練時(shí)就會(huì)報(bào)錯(cuò)。解決方式有兩種一是像我一樣把所有樣本統(tǒng)一到固定幀數(shù)二是構(gòu)建動(dòng)態(tài)shape的模型在loss里為每個(gè)樣本傳入真實(shí)的輸入長(zhǎng)度。第一種方法簡(jiǎn)單直接適合命令詞這類短音頻第二種方法適合語(yǔ)音長(zhǎng)短差異很大的場(chǎng)景但實(shí)現(xiàn)復(fù)雜度高不少。5. 訓(xùn)練、驗(yàn)證與推理從損失下降到真正“聽(tīng)懂”一句話5.1 訓(xùn)練配置與監(jiān)控要點(diǎn)模型訓(xùn)練階段我建議先跑一個(gè)小的epoch數(shù)確認(rèn)整個(gè)鏈路沒(méi)有報(bào)錯(cuò)再開(kāi)啟正式訓(xùn)練。我通常先跑5個(gè)epoch、每個(gè)batch 32、每50個(gè)batch打印一次loss。訓(xùn)練過(guò)程中要重點(diǎn)觀察兩個(gè)信號(hào)第一個(gè)是loss數(shù)值的變化趨勢(shì)。CTC損失在初期下降非??煲?yàn)槟P秃芸炀蛯W(xué)會(huì)了把輸出序列推送到可能包含目標(biāo)標(biāo)簽的區(qū)域。但如果你的數(shù)據(jù)集很小、模型又比較大loss可能出現(xiàn)反復(fù)震蕩這時(shí)候需要降低學(xué)習(xí)率或者增大batch size。另外一個(gè)需要警惕的情況是loss直接變成NaN原因通常是學(xué)習(xí)率過(guò)大或者數(shù)據(jù)里混入了NaN特征的音頻。第二個(gè)是過(guò)擬合信號(hào)。用驗(yàn)證集計(jì)算loss如果訓(xùn)練loss持續(xù)下降而驗(yàn)證loss回升說(shuō)明模型開(kāi)始死記硬背訓(xùn)練數(shù)據(jù)了。緩解辦法是增加Dropout、增加數(shù)據(jù)增強(qiáng)或者減小模型規(guī)模。這里給一個(gè)推薦訓(xùn)練參數(shù)配置epochs30 batch_size32 learning_rate1e-3如果CPU訓(xùn)練30個(gè)epoch大概需要30分鐘到1小時(shí)具體取決于數(shù)據(jù)量。GPU會(huì)快很多。5.2 真實(shí)音頻推理的完整代碼訓(xùn)練完成后推理階段的代碼非常短def predict_audio(audio_path, model, label_map, max_len100, n_mfcc13): mfcc extract_mfcc(audio_path, n_mfccn_mfcc, max_lenmax_len) mfcc np.expand_dims(mfcc, axis0) # 增加batch維度 logits model.predict(mfcc, verbose0) # ctc_greedy_decoder需要的輸入維度是[time, batch, vocab] logits tf.transpose(logits, [1, 0, 2]) decoded, _ tf.nn.ctc_greedy_decoder( inputslogits, sequence_length[logits.shape[0]] ) decoded tf.sparse.to_dense(decoded)[0].numpy() if len(decoded) 0: return silence id_to_label {v: k for k, v in label_map.items()} return .join([id_to_label[i] for i in decoded])這里decode出來(lái)的是一個(gè)整數(shù)序列。如果模型判斷整段音頻都是blank解碼結(jié)果就是一個(gè)空列表此時(shí)返回silence是合理的因?yàn)殪o音片段確實(shí)沒(méi)有命令詞。5.3 實(shí)測(cè)效果與常見(jiàn)問(wèn)題我在自錄音頻上的實(shí)測(cè)結(jié)果顯示干凈環(huán)境下5個(gè)命令詞的識(shí)別準(zhǔn)確率可以達(dá)到95%以上。但我必須提醒你這個(gè)數(shù)字只對(duì)“麥克風(fēng)距離嘴巴不遠(yuǎn)、環(huán)境安靜”的場(chǎng)景有效。一旦加入噪聲比如播放電視聲音、開(kāi)風(fēng)扇、在走廊里測(cè)試準(zhǔn)確率會(huì)明顯下降。這不是模型bug而是語(yǔ)音識(shí)別系統(tǒng)的天然局限。測(cè)試中我發(fā)現(xiàn)一個(gè)問(wèn)題值得特別說(shuō)明模型對(duì)“no”和“up”偶爾會(huì)混淆。分析MFCC特征后發(fā)現(xiàn)這兩個(gè)詞雖然語(yǔ)義層面差異巨大但在聲學(xué)層面確實(shí)存在相似之處元音的共振峰位置接近。解決這個(gè)問(wèn)題最有效的方式是補(bǔ)充更多說(shuō)話人的數(shù)據(jù)同時(shí)引入噪聲增強(qiáng)讓模型學(xué)會(huì)在干擾下抓住核心的聲學(xué)區(qū)別。6. 調(diào)優(yōu)方向和擴(kuò)展從命令詞到連續(xù)語(yǔ)音識(shí)別的路線6.1 數(shù)據(jù)增強(qiáng)用更少的數(shù)據(jù)換來(lái)更強(qiáng)的泛化能力小數(shù)據(jù)集上訓(xùn)練語(yǔ)音識(shí)別模型數(shù)據(jù)增強(qiáng)是不可或缺的工具。數(shù)據(jù)增強(qiáng)的本質(zhì)是對(duì)原始音頻做一系列變換生成更多“看起來(lái)來(lái)自不同場(chǎng)景、但語(yǔ)義相同”的樣本從而模擬更多樣的現(xiàn)實(shí)環(huán)境。我在項(xiàng)目中使用的增強(qiáng)方法有以下幾種加性噪聲把一段環(huán)境噪聲比如白噪聲、雨聲、辦公室人聲以隨機(jī)信噪比疊加到原始音頻上時(shí)間拉伸把音頻速度變?yōu)樵瓉?lái)的0.9倍到1.1倍模擬不同說(shuō)話人的語(yǔ)速差異音高平移在保持時(shí)長(zhǎng)的前提下改變音高模擬不同聲帶長(zhǎng)短的說(shuō)話人Librosa提供了實(shí)現(xiàn)這些增強(qiáng)的工具。但要注意增強(qiáng)因子不宜過(guò)大否則模型會(huì)把噪聲模式當(dāng)作語(yǔ)義特征反而損害準(zhǔn)確率。一個(gè)經(jīng)驗(yàn)值是每個(gè)epoch按30%的概率對(duì)音頻做增強(qiáng)讓模型既能看到干凈數(shù)據(jù)也能看到帶噪聲版本。6.2 加入語(yǔ)言模型修正輸出序列命令詞識(shí)別的輸出只有一兩個(gè)詞語(yǔ)言模型的作用微乎其微。但如果把系統(tǒng)擴(kuò)展到連續(xù)語(yǔ)音識(shí)別比如識(shí)別一句話“幫我打開(kāi)客廳的空調(diào)”就需要語(yǔ)言模型來(lái)幫忙了。連續(xù)語(yǔ)音識(shí)別中聲學(xué)模型輸出的候選序列通常包含多個(gè)同音字或近音詞。語(yǔ)言模型的作用是計(jì)算哪個(gè)序列在語(yǔ)法和語(yǔ)義上更合理。舉個(gè)簡(jiǎn)單例子聲學(xué)模型可能同時(shí)輸出“打開(kāi)空調(diào)”和“打開(kāi)空條”語(yǔ)言模型會(huì)判斷“空調(diào)”的概率遠(yuǎn)高于“空條”從而修正識(shí)別結(jié)果。把語(yǔ)言模型集成進(jìn)現(xiàn)有代碼的方法是在解碼階段替換貪心解碼為束搜索解碼并在束搜索的打分公式中合并語(yǔ)言模型概率score acoustic_log_prob lambda * language_log_problambda是語(yǔ)言模型權(quán)重一般取0.5到1.0之間。具體值需要拿一顆測(cè)試集來(lái)調(diào)。6.3 從CTC到注意力機(jī)制的架構(gòu)演進(jìn)CTC雖然經(jīng)典但它的假設(shè)是幀與幀之間條件獨(dú)立模型無(wú)法顯式建模輸出序列內(nèi)部的依賴關(guān)系。對(duì)于連續(xù)語(yǔ)音識(shí)別現(xiàn)在更主流的是序列到序列模型其中注意力機(jī)制讓解碼器在生成每個(gè)文本字符時(shí)自動(dòng)關(guān)注音頻特征序列中相關(guān)的部分。如果你有興趣繼續(xù)深入我建議的路線是先跑通我的CTC命令詞系統(tǒng)理解語(yǔ)音識(shí)別的完整數(shù)據(jù)流和訓(xùn)練流再學(xué)習(xí)Listen-Attend-Spell或Transformer Transducer這類模型。注意力機(jī)制解答了CTC里沒(méi)有回答的問(wèn)題如何讓模型“主動(dòng)選擇”它認(rèn)為重要的音頻片段。7. 踩坑實(shí)錄我在這個(gè)項(xiàng)目中犯過(guò)的錯(cuò)7.1 TensorFlow 2.18安裝后的CPython版本不兼容問(wèn)題我最初用conda創(chuàng)建環(huán)境時(shí)指定了Python 3.12然后pip安裝TensorFlow 2.18import時(shí)報(bào)錯(cuò)缺少某個(gè)DLL文件。查了半天發(fā)現(xiàn)是Python 3.12的ABI和TensorFlow 2.18的某個(gè)依賴不匹配。雖然理論上有解決辦法但最省時(shí)的操作就是換到Python 3.11重建環(huán)境。經(jīng)驗(yàn)教訓(xùn)遇到環(huán)境問(wèn)題別硬剛。直接換一個(gè)官方支持范圍內(nèi)的組合重建環(huán)境通常十分鐘內(nèi)解決問(wèn)題比在網(wǎng)上搜各種玄學(xué)解法靠譜得多。7.2 librosa與numba的依賴沖突安裝librosa時(shí)它依賴的numba版本如果和TensorFlow依賴的numpy版本沖突會(huì)出現(xiàn)類似“Numba needs NumPy 1.22 or less”的錯(cuò)誤。我當(dāng)時(shí)的解決辦法是先conda install numba指定一個(gè)和TensorFlow兼容的版本再pip install librosa最后用python -c import librosa; import tensorflow驗(yàn)證兩者能和平共處。經(jīng)驗(yàn)教訓(xùn)音頻相關(guān)的Python庫(kù)依賴樹(shù)特別長(zhǎng)盡量在同一個(gè)虛擬環(huán)境開(kāi)始階段就把它們一起裝好避免后裝時(shí)的版本覆蓋問(wèn)題。7.3 音頻截?cái)喟殃P(guān)鍵詞截沒(méi)了我最初設(shè)計(jì)max_len80幀也就是0.8秒。大部分Speech Commands音頻確實(shí)不到0.8秒但有一小部分語(yǔ)速較慢的樣本會(huì)被截掉末尾的音素。訓(xùn)練時(shí)loss一直不降查看訓(xùn)練樣本才發(fā)現(xiàn)有些no被截成了n的開(kāi)頭部分。把max_len提高到100并配合padding之后問(wèn)題消失。經(jīng)驗(yàn)教訓(xùn)在做固定長(zhǎng)度截?cái)嗲跋冉y(tǒng)計(jì)所有音頻的時(shí)長(zhǎng)分布按95分位數(shù)來(lái)設(shè)計(jì)max_len而不是隨便設(shè)一個(gè)值。7.4 標(biāo)簽打亂不同步導(dǎo)致“模型胡亂識(shí)別”我早期代碼里分別讀取了features和labels然后單獨(dú)對(duì)features做了shuffle。訓(xùn)練時(shí)模型看到的特征和標(biāo)簽錯(cuò)位“yes”的音頻對(duì)應(yīng)“no”的標(biāo)簽。更可怕的是因?yàn)閿?shù)據(jù)集足夠大模型居然也能把loss降到很低因?yàn)樗鼘W(xué)會(huì)了記住整體分布而不是對(duì)應(yīng)關(guān)系。經(jīng)驗(yàn)教訓(xùn)所有與樣本相關(guān)的元數(shù)據(jù)必須和樣本綁定在一起任何打亂、篩選操作都要保證同步。這是數(shù)據(jù)管道設(shè)計(jì)中最容易出錯(cuò)但最不應(yīng)該出錯(cuò)的點(diǎn)。訓(xùn)練前用少量樣本打印一下“特征路徑-標(biāo)簽”對(duì)照表一分鐘就能驗(yàn)證管道正確性。7.5 CPU訓(xùn)練不求快但求穩(wěn)定最后說(shuō)一個(gè)關(guān)于訓(xùn)練體驗(yàn)的問(wèn)題。我的筆記本沒(méi)有獨(dú)立顯卡用CPU訓(xùn)練30個(gè)epoch大概花了40分鐘中途還因?yàn)闇囟缺Wo(hù)出現(xiàn)過(guò)一兩次訓(xùn)練中斷。后來(lái)我把batch_size從32降到16并把TensorFlow的線程數(shù)限制了一下訓(xùn)練雖然略微變慢但穩(wěn)定性提升不少不再出現(xiàn)因?yàn)閮?nèi)存或線程資源耗盡導(dǎo)致的崩潰。限制CPU線程數(shù)的操作很簡(jiǎn)單export TF_INTRA_OP_PARALLELISM_THREADS4 export TF_INTER_OP_PARALLELISM_THREADS4這個(gè)參數(shù)要根據(jù)你的CPU核心數(shù)來(lái)調(diào)整通常設(shè)為物理核心數(shù)的一半到三分之二既能保證穩(wěn)定性又能留出資源給其他程序運(yùn)行。回到我在這個(gè)項(xiàng)目里最大的體會(huì)語(yǔ)音識(shí)別系統(tǒng)真正的復(fù)雜度不在模型結(jié)構(gòu)有多深而在于你愿不愿意把數(shù)據(jù)鏈路里的每個(gè)細(xì)節(jié)磨透。MFCC提對(duì)了、標(biāo)簽對(duì)齊了、維度順序理順了模型哪怕簡(jiǎn)單一點(diǎn)出來(lái)的效果也足夠讓人驚喜。現(xiàn)在這個(gè)項(xiàng)目跑通后我又給它接了一個(gè)簡(jiǎn)單的命令控制接口實(shí)現(xiàn)了語(yǔ)音開(kāi)燈、關(guān)燈雖然算不上什么了不起的工程但看著語(yǔ)音真的能控制物理設(shè)備那種“技術(shù)上跑通了”的成就感還是很值得體驗(yàn)的。如果你在這個(gè)基礎(chǔ)上繼續(xù)擴(kuò)展我建議可以先做噪聲魯棒性增強(qiáng)再嘗試多個(gè)命令詞的連續(xù)識(shí)別每一步都會(huì)踩到新坑但也正是這些坑才是語(yǔ)音識(shí)別真正有意思的地方。本文還有配套的精品資源點(diǎn)擊獲取