實(shí)戰(zhàn):基于TensorFlow的生成對(duì)抗網(wǎng)絡(luò)完整實(shí)現(xiàn)與調(diào)優(yōu))
簡介基于生成對(duì)抗網(wǎng)絡(luò)的缺失數(shù)據(jù)填補(bǔ)方法完整實(shí)現(xiàn)面向機(jī)器學(xué)習(xí)、數(shù)據(jù)挖掘等方向的開發(fā)者與研究者適用金融、醫(yī)療、傳感等多領(lǐng)域數(shù)據(jù)預(yù)處理場(chǎng)景。以TensorFlow作為后端深度學(xué)習(xí)框架實(shí)現(xiàn)了GAIN、SGAIN、WSGAIN-CP、WSGAIN-GP四種主流對(duì)抗填補(bǔ)模型完整代碼與十個(gè)標(biāo)準(zhǔn)評(píng)估數(shù)據(jù)集一同打包在6.72MB的zip壓縮包內(nèi)。壓縮包共28個(gè)文件除7個(gè)Python源碼文件分別承擔(dān)模型構(gòu)建、訓(xùn)練流程與數(shù)據(jù)裝載外還包含10個(gè)CSV格式的數(shù)據(jù)集、XML工程配置文件、說明文檔以及緩存文件目錄劃分清晰便于直接運(yùn)行、修改與二次開發(fā)。目前已有1778人學(xué)習(xí)下載特別適合需要對(duì)比不同對(duì)抗填補(bǔ)機(jī)制、完成論文復(fù)現(xiàn)或課程設(shè)計(jì)的研究者使用。從說明文檔、主程序到模型定義用戶可快速定位入口基于自帶數(shù)據(jù)進(jìn)行實(shí)驗(yàn)也可替換自有數(shù)據(jù)集開展驗(yàn)證。 做數(shù)據(jù)分析和機(jī)器學(xué)習(xí)建模的人大概率都躲不過數(shù)據(jù)處理這個(gè)坎。尤其是拿到一批數(shù)據(jù)發(fā)現(xiàn)里面不是這里空一塊、就是那里缺一截這時(shí)候最簡單的辦法是刪行或者用均值填一下但稍微有點(diǎn)追求的人都會(huì)猶豫刪掉太浪費(fèi)均值填補(bǔ)又太粗暴萬一把變量之間的關(guān)系搞壞了后面的模型效果直接崩。這幾年我一直在折騰各種缺失數(shù)據(jù)填補(bǔ)方案從統(tǒng)計(jì)插補(bǔ)到多重插補(bǔ)都用過直到接觸到基于生成對(duì)抗網(wǎng)絡(luò)的缺失數(shù)據(jù)填補(bǔ)方法GAIN才發(fā)現(xiàn)原來這個(gè)老問題還能用生成模型來解而且效果確實(shí)能打。GAIN全稱是Generative Adversarial Imputation Nets最早由Jinsung Yoon等人提出本質(zhì)上是把生成對(duì)抗網(wǎng)絡(luò)的思想遷移到缺失值補(bǔ)全場(chǎng)景中。我用TensorFlow復(fù)現(xiàn)了一遍完整版本跑通了訓(xùn)練、評(píng)估到落地應(yīng)用的整套流程過程中踩了不少坑也積累了一些經(jīng)驗(yàn)。這篇文章就把整個(gè)實(shí)現(xiàn)思路、關(guān)鍵代碼、訓(xùn)練細(xì)節(jié)和排查技巧完整記錄下來想折騰缺失數(shù)據(jù)填補(bǔ)的朋友可以直接參考這版實(shí)現(xiàn)去改。1. 內(nèi)容整體設(shè)計(jì)與思路拆解1.1 為什么普通填補(bǔ)方法不夠用偏偏要上生成對(duì)抗網(wǎng)絡(luò)先聊一個(gè)最基礎(chǔ)的問題為什么均值填補(bǔ)、中位數(shù)填補(bǔ)、前向填充這些方法不夠用不是說它們完全不行而是它們有一個(gè)共同的致命弱點(diǎn)——沒有充分挖掘特征之間的關(guān)聯(lián)關(guān)系。比如一個(gè)用戶表里年齡和收入有相關(guān)性如果只拿全局均值去填缺失的年齡等于把這種相關(guān)性抹掉了模型后續(xù)學(xué)到的模式就會(huì)變形。多重插補(bǔ)MICE好一些能利用其他特征去預(yù)測(cè)缺失值但它本質(zhì)是回歸思路對(duì)特征間復(fù)雜的高維非線性關(guān)系捕捉能力有限。而生成對(duì)抗網(wǎng)絡(luò)的思路完全不一樣。它不直接預(yù)測(cè)缺失值而是讓一個(gè)生成器去學(xué)著造假數(shù)據(jù)另一個(gè)判別器去分辨哪些是觀測(cè)數(shù)據(jù)、哪些是填補(bǔ)數(shù)據(jù)兩邊互相博弈、互相進(jìn)步。放到缺失數(shù)據(jù)填補(bǔ)這個(gè)場(chǎng)景里生成器拿到的任務(wù)是針對(duì)缺失的位置生成盡可能真實(shí)的數(shù)值騙過判別器。判別器不僅要判斷整個(gè)樣本是否真實(shí)更關(guān)鍵的是要學(xué)會(huì)判斷哪個(gè)位置的值是被填出來的。兩邊的博弈結(jié)果就是生成器被迫學(xué)習(xí)到了整個(gè)數(shù)據(jù)集的分布規(guī)律填出來的值自然比簡單插補(bǔ)更符合特征間的關(guān)系。1.2 GAIN的核心結(jié)構(gòu)拆解生成器、判別器和提示機(jī)制GAIN和普通GAN最大的區(qū)別在于它的數(shù)據(jù)形態(tài)和博弈方式都有調(diào)整。標(biāo)準(zhǔn)GAN處理的是圖像那種完整數(shù)據(jù)而GAIN面對(duì)的是帶缺失的表格數(shù)據(jù)。它的整體結(jié)構(gòu)包含三個(gè)關(guān)鍵組成部分生成器Generator、判別器Discriminator還有一個(gè)很多人第一次看容易忽略的提示機(jī)制Hint Mechanism。生成器接收兩部分輸入一部分是帶有缺失值的數(shù)據(jù)缺失位置先用0或者其他占位值填充另一部分是隨機(jī)噪聲向量用于給生成過程引入隨機(jī)性。生成器的輸出是一個(gè)完整的填補(bǔ)后數(shù)據(jù)但只對(duì)缺失位置的數(shù)值生效。判別器接收的是生成器補(bǔ)全后的完整數(shù)據(jù)以及提示向量輸出的是一個(gè)掩碼預(yù)測(cè)結(jié)果——也就是說它要判斷數(shù)據(jù)中每個(gè)位置的值到底是真實(shí)觀測(cè)值還是被生成的填補(bǔ)值。提示機(jī)制是GAIN的精髓所在。它按一定概率把真實(shí)的掩碼信息泄露給判別器這樣判別器才能在訓(xùn)練初期有足夠的信息去區(qū)分真假。如果沒有提示機(jī)制判別器幾乎無法判斷哪些值是真實(shí)觀測(cè)值訓(xùn)練過程容易失控。實(shí)現(xiàn)中提示向量的生成邏輯是每個(gè)缺失位置按概率保留真實(shí)掩碼值1表示缺失0表示觀測(cè)其余位置用0.5填充作為模糊信號(hào)。這個(gè)設(shè)計(jì)初看不復(fù)雜實(shí)際訓(xùn)練中卻直接影響收斂速度和最終填補(bǔ)質(zhì)量后面我會(huì)詳細(xì)說參數(shù)怎么調(diào)。1.3 為什么瞄準(zhǔn)TensorFlow版本做完整實(shí)現(xiàn)現(xiàn)在說起深度學(xué)習(xí)框架PyTorch和TensorFlow的討論度都很高各有各的生態(tài)。我這次選擇TensorFlow版本首要原因是GAIN原版論文就是基于TensorFlow實(shí)現(xiàn)的官方代碼也是TF架構(gòu)直接還原TensorFlow版本更容易和原論文的參數(shù)設(shè)置對(duì)齊。另一個(gè)原因是TensorFlow在部署環(huán)節(jié)確實(shí)方便訓(xùn)練好之后導(dǎo)成SavedModel或者用TensorFlow Serving提供服務(wù)都不用額外做框架轉(zhuǎn)換。我在網(wǎng)上搜了一圈發(fā)現(xiàn)GAIN的TensorFlow實(shí)現(xiàn)雖然能搜到但很多是搬運(yùn)的論文附帶的壓縮包注釋少、結(jié)構(gòu)亂版本還停留在TF 1.x。用的時(shí)候一堆兼容性問題光是tf.contrib這塊就勸退不少人。我當(dāng)時(shí)想索性自己按TF 2.x的習(xí)慣寫一版完整的動(dòng)態(tài)圖模式下調(diào)試直觀得多控制流也不用繞來繞去。keras API配合自定義訓(xùn)練循環(huán)既能看清每一步的梯度流向也方便調(diào)整網(wǎng)絡(luò)結(jié)構(gòu)和損失函數(shù)。這版實(shí)現(xiàn)我后面用幾個(gè)UCI標(biāo)準(zhǔn)數(shù)據(jù)集和一份業(yè)務(wù)部門的真實(shí)脫敏數(shù)據(jù)做了驗(yàn)證填補(bǔ)效果和穩(wěn)定性都達(dá)到了可用的水平。2. 環(huán)境準(zhǔn)備與工具選型解析2.1 Anaconda安裝與TensorFlow環(huán)境配置要點(diǎn)真正動(dòng)手寫代碼前環(huán)境是最容易消耗熱情的環(huán)節(jié)。我見過很多人在這一步被各種版本兼容問題勸退尤其是TensorFlow這貨版本之間的API變動(dòng)非常大。第三個(gè)版本之前的代碼遷移到2.x常有大量報(bào)錯(cuò)更別說那些年tf.contrib說沒就沒的情況了。關(guān)于Anaconda安裝TensorFlow的實(shí)操我的建議是創(chuàng)建一個(gè)干凈的獨(dú)立環(huán)境不要直接裝在base環(huán)境里。用conda管理環(huán)境的好處是可以鎖定Python版本和依賴的版本范圍不同項(xiàng)目互不干擾。我常用的創(chuàng)建命令是conda create -n tf_gain python3.8 conda activate tf_gain pip install tensorflow2.10這里要特別說一句版本選擇的門道TensorFlow 2.10是最后一個(gè)原生支持Windows GPU的版本之后的版本在Windows下裝GPU版得靠WSL2很多人第一次裝不知道這個(gè)兼容坑。如果是Linux環(huán)境可以放心裝更高版本2.10以上對(duì)Windows用戶就不太順了。CPU版本訓(xùn)練小數(shù)據(jù)集問題不大但如果數(shù)據(jù)量上去、隱藏層節(jié)點(diǎn)加多建議還是整個(gè)GPU版本。再補(bǔ)一個(gè)Anaconda安裝時(shí)的經(jīng)驗(yàn)conda默認(rèn)的軟件源在國內(nèi)環(huán)境下往往下載速度感人建議先把conda源和pip源換成清華的鏡像不然下載一個(gè)幾百兆的包要等半天。這個(gè)操作屬于老生常談但確實(shí)能幫后面省出大量時(shí)間。2.2 版本兼容矩陣TensorFlow 2.x的API差異盤點(diǎn)這次實(shí)現(xiàn)里我主要用到了TensorFlow 2.x的幾個(gè)核心API和網(wǎng)上流傳的非官方1.x版本實(shí)現(xiàn)有不小的差別。具體包括用tf.keras.Sequential或者函數(shù)式API堆疊網(wǎng)絡(luò)結(jié)構(gòu)替代了1.x里繁瑣的tf.variable_scope加手工初始化參數(shù)的操作用tf.GradientTape記錄梯度并完成反向傳播替代了tf.Session.run配合feed_dict的方式tf.compat.v1作為兼容層用來處理個(gè)別1.x風(fēng)格的既有代碼。寫的時(shí)候要特別小心幾個(gè)版本的坑tf.contrib在2.x里已經(jīng)被徹底移除很多老代碼里的tf.contrib.layers相關(guān)調(diào)用必須改寫成tf.keras.layerstf.placeholder在動(dòng)態(tài)圖模式下也不需要了直接定義好輸入張量就能前向傳播tf.losses系列函數(shù)的位置也變了用tf.keras.losses更穩(wěn)。我建議安裝時(shí)直接定下版本不要裝最新版因?yàn)樽钚掳嫱殡S新特性但也會(huì)引入潛在的不穩(wěn)定因素。生產(chǎn)環(huán)境里穩(wěn)定壓倒一切選一個(gè)經(jīng)過廣泛驗(yàn)證的版本比追新更重要。TensorFlow 2.10配Python 3.8這組搭配我跑下來非常穩(wěn)定整個(gè)訓(xùn)練過程沒有遇到莫名其妙的底層報(bào)錯(cuò)。3. 核心細(xì)節(jié)解析與實(shí)操要點(diǎn)3.1 數(shù)據(jù)預(yù)處理標(biāo)準(zhǔn)化和掩碼矩陣的構(gòu)造邏輯GAIN對(duì)輸入數(shù)據(jù)有一個(gè)硬性要求所有特征需要預(yù)先做歸一化處理我習(xí)慣用最小最大歸一化把數(shù)值壓到0到1之間。這樣做有多個(gè)好處生成器的激活函數(shù)通常選tanh或者sigmoid輸出范圍天然匹配判別器對(duì)輸入尺度敏感范圍一致可以避免某些特征值過大導(dǎo)致梯度震蕩歸一化后缺失位置用0填充也不會(huì)引入極端值干擾。數(shù)據(jù)預(yù)處理的第二個(gè)關(guān)鍵是構(gòu)造掩碼矩陣Mask Matrix。這個(gè)矩陣和原始數(shù)據(jù)形狀一致觀測(cè)位置值為1缺失位置值為0。這里有個(gè)容易搞反的點(diǎn)要先理清楚原論文掩碼矩陣是1表示觀測(cè)0表示缺失而后面提示機(jī)制生成的向量又是另一套邏輯。代碼里這兩處我特別加了注釋防止自己和看代碼的人繞暈。構(gòu)造掩碼矩陣的代碼如下def create_mask(data): mask np.ones_like(data) mask[np.isnan(data)] 0 data[np.isnan(data)] 0 return data, mask實(shí)際操作時(shí)一定要在標(biāo)準(zhǔn)化之前把NaN標(biāo)記單獨(dú)提取出來不能先標(biāo)準(zhǔn)化再判斷缺失。因?yàn)闃?biāo)準(zhǔn)化過程用到的均值和方差本身就會(huì)受到缺失值影響處理順序錯(cuò)了結(jié)果會(huì)有偏差。3.2 生成器與判別器結(jié)構(gòu)設(shè)計(jì)的經(jīng)驗(yàn)之談網(wǎng)絡(luò)結(jié)構(gòu)這塊我看過很多GAIN口徑的實(shí)現(xiàn)隱藏層設(shè)置五花八門。有的把生成器和判別器都設(shè)計(jì)得特別龐大隱藏層節(jié)點(diǎn)數(shù)上千實(shí)際效果反而不如小而精的結(jié)構(gòu)。原論文里使用的隱藏層節(jié)點(diǎn)數(shù)建議是數(shù)據(jù)維度的一到兩倍左右我驗(yàn)證下來這個(gè)經(jīng)驗(yàn)值比較靠譜。比如數(shù)據(jù)維度是22隱藏層設(shè)置為128節(jié)點(diǎn)表現(xiàn)就已經(jīng)不錯(cuò)加到256收益有限但訓(xùn)練開銷漲了一截。激活函數(shù)方面生成器中間隱藏層我用ReLU輸出層用Sigmoid配合數(shù)據(jù)范圍0-1判別器中間層同樣用ReLU最后輸出用Sigmoid因?yàn)槊總€(gè)位置輸出的都是一類概率值。有個(gè)經(jīng)驗(yàn)值得單獨(dú)拿出來說生成器的輸入除了帶缺失的數(shù)據(jù)和隨機(jī)噪聲我建議再加上一個(gè)拼接的輔助特征比如逐樣本的缺失比例或者缺失模式編號(hào)。這樣生成器能感知到不同樣本缺失嚴(yán)重程度的差異對(duì)重度缺失樣本的填補(bǔ)效果有肉眼可見的提升。這個(gè)小改動(dòng)原論文里沒有直接提到但我在實(shí)際訓(xùn)練中對(duì)比過加上之后判別器的loss收斂更平穩(wěn)。網(wǎng)絡(luò)搭建的代碼核心結(jié)構(gòu)如下def build_generator(dim, hidden_units128): inputs tf.keras.Input(shape(dim * 2,)) x tf.keras.layers.Dense(hidden_units, activationrelu)(inputs) x tf.keras.layers.Dense(hidden_units, activationrelu)(x) x tf.keras.layers.Dense(dim, activationsigmoid)(x) return tf.keras.Model(inputs, x) def build_discriminator(dim, hidden_units128): inputs tf.keras.Input(shape(dim * 2,)) x tf.keras.layers.Dense(hidden_units, activationrelu)(inputs) x tf.keras.layers.Dense(hidden_units, activationrelu)(x) x tf.keras.layers.Dense(dim, activationsigmoid)(x) return tf.keras.Model(inputs, x)這里生成器輸入維度是dim * 2分別是拼接后的帶缺失數(shù)據(jù)和隨機(jī)噪聲。判別器輸入維度同樣是dim * 2是拼接后的填充數(shù)據(jù)和提示向量。網(wǎng)絡(luò)結(jié)構(gòu)不算復(fù)雜真正的技術(shù)含量在損失函數(shù)設(shè)計(jì)和訓(xùn)練循環(huán)的編寫上。3.3 損失函數(shù)詳解Hinge Loss和提示機(jī)制的配合GAIN的訓(xùn)練過程看似是兩個(gè)網(wǎng)絡(luò)在對(duì)抗實(shí)際損失函數(shù)的設(shè)計(jì)非常講究。判別器輸出的不是單個(gè)真假概率而是一個(gè)和特征維度相同的向量每個(gè)元素表示對(duì)應(yīng)特征位置的值是不是被填補(bǔ)過的概率。這樣設(shè)計(jì)的原因很明顯GAIN的目標(biāo)不只是判斷樣本整體真?zhèn)味且?xì)到判斷哪些位置是偽造的。損失函數(shù)這塊我用的是Hinge Loss的變體形式。生成器的目標(biāo)是最小化判別器對(duì)填補(bǔ)位置的預(yù)測(cè)概率等價(jià)于讓判別器盡可能認(rèn)為所有位置都是真實(shí)觀測(cè)值。判別器的目標(biāo)則是最小化它對(duì)真實(shí)觀測(cè)位置和填補(bǔ)位置的分類誤差即正確地區(qū)分哪些位置被生成器動(dòng)了手腳。具體的損失計(jì)算邏輯如下def compute_loss(D_pred, G_pred, mask, hint_rate): # D_pred是判別器輸出形狀(B, dim) # G_pred是生成器輸出形狀(B, dim) # mask是掩碼矩陣1表示觀測(cè)0表示缺失 # 缺失位置權(quán)重設(shè)置為1觀測(cè)位置權(quán)重降低 missing_w 1.0 observed_w 1.0 / hint_rate # 判別器對(duì)缺失位置的預(yù)測(cè)越接近0越好真實(shí)位置的可能性低 D_loss -tf.reduce_mean( missing_w * mask * tf.math.log(D_pred 1e-8) observed_w * (1 - mask) * tf.math.log(1 - D_pred 1e-8) ) # 生成器要讓判別器對(duì)缺失位置也認(rèn)為是真實(shí)位置 G_loss -tf.reduce_mean( (1 - mask) * tf.math.log(D_pred 1e-8) ) return D_loss, G_loss注意到這里的權(quán)重設(shè)置沒有observed_w設(shè)成了1.0 / hint_rate目的就是調(diào)節(jié)判別器對(duì)真實(shí)觀測(cè)位置和填補(bǔ)位置的關(guān)注度。hint_rate接近1時(shí)判別器看到的大多是真實(shí)的掩碼信息它就可以非常明確地判斷缺失的位置訓(xùn)練啟動(dòng)快hint_rate較小時(shí)判別器拿到的提示信息少任務(wù)難度增加生成器的壓力反而小了。這樣一個(gè)對(duì)抗過程的結(jié)果是生成器隨著訓(xùn)練進(jìn)行逐漸學(xué)會(huì)生成與真實(shí)觀測(cè)值統(tǒng)計(jì)特征一致的填補(bǔ)值不僅單個(gè)特征分布接近特征間的聯(lián)合分布也能在博弈中保留下來。3.4 提示機(jī)制的參數(shù)選擇原則關(guān)于hint_rate這個(gè)參數(shù)我在實(shí)驗(yàn)里試過從0.5到1.0的多個(gè)值發(fā)現(xiàn)它對(duì)訓(xùn)練結(jié)果的影響不是線性的。hint_rate太高比如0.95以上判別器太容易判斷出哪些是填的梯度對(duì)生成器的指導(dǎo)價(jià)值反而減弱生成器學(xué)到的只是表面規(guī)律hint_rate太低比如0.5以下判別器長期難以收斂生成器也得不到有效反饋整個(gè)對(duì)抗過程處于僵持狀態(tài)。原論文里的默認(rèn)值是0.9這是一個(gè)比較安全的起點(diǎn)但我實(shí)際用下來發(fā)現(xiàn)具體數(shù)據(jù)集的缺失模式也會(huì)影響最優(yōu)值。如果數(shù)據(jù)缺失完全是隨機(jī)缺失MCAR0.9效果很好如果缺失跟特征本身有關(guān)MNAR建議降到0.8左右給判別器一點(diǎn)模糊空間反而能讓生成器探索到更深層的分布規(guī)律。實(shí)現(xiàn)提示向量生成的代碼如下def generate_hint(mask, hint_rate): hint mask.copy() prob np.random.rand(*mask.shape) hint[prob hint_rate] 0.5 return hint4. 實(shí)操過程與核心環(huán)節(jié)實(shí)現(xiàn)4.1 完整訓(xùn)練循環(huán)的搭建與說明GAIN的訓(xùn)練流程可以用一句話概括交替更新生成器和判別器讓兩個(gè)網(wǎng)絡(luò)在對(duì)抗中共同進(jìn)步。但落實(shí)到代碼要處理的細(xì)節(jié)其實(shí)挺多包括數(shù)據(jù)分批、梯度累積、loss記錄等。我這份實(shí)現(xiàn)采用批量訓(xùn)練的方式每輪迭代從訓(xùn)練集中采樣一個(gè)小批量樣本依次完成正向傳播、計(jì)算損失、反向傳播、更新參數(shù)。生成器和判別器的更新頻率可以1比1也可以2比1論文里沒明確說我測(cè)試后覺得1比1最穩(wěn)不然容易出現(xiàn)一方壓倒另一方的情況。訓(xùn)練循環(huán)的核心代碼如下# 訓(xùn)練參數(shù) batch_size 128 epochs 2000 learning_rate 1e-3 # 初始化優(yōu)化器 G_optimizer tf.keras.optimizers.Adam(learning_rate) D_optimizer tf.keras.optimizers.Adam(learning_rate) for epoch in range(epochs): for batch_start in range(0, len(data_normalized), batch_size): batch_end min(batch_start batch_size, len(data_normalized)) x_batch data_normalized[batch_start:batch_end] m_batch mask_matrix[batch_start:batch_end] # 生成提示向量 h_batch generate_hint(m_batch, hint_rate0.9) with tf.GradientTape() as tape_G, tf.GradientTape() as tape_D: # 拼接數(shù)據(jù)和噪聲 z_batch np.random.uniform(0, 1, sizex_batch.shape) G_input np.concatenate([x_batch, z_batch], axis1) # 生成器前向傳播 G_output generator(G_input, trainingTrue) # 只取缺失位置的生成值 filled_data x_batch * m_batch G_output * (1 - m_batch) # 判別器輸入 D_input np.concatenate([filled_data, h_batch], axis1) D_output discriminator(D_input, trainingTrue) # 計(jì)算損失 D_loss, G_loss compute_loss(D_output, G_output, m_batch, hint_rate0.9) # 分別更新梯度 G_grads tape_G.gradient(G_loss, generator.trainable_variables) D_grads tape_D.gradient(D_loss, discriminator.trainable_variables) G_optimizer.apply_gradients(zip(G_grads, generator.trainable_variables)) D_optimizer.apply_gradients(zip(D_grads, discriminator.trainable_variables))一個(gè)容易被忽視的細(xì)節(jié)是填補(bǔ)值的還原操作訓(xùn)練時(shí)生成器輸出的是整個(gè)樣本的補(bǔ)全結(jié)果但實(shí)際填補(bǔ)只需要替換缺失位置。所以代碼里專門用filled_data x_batch * m_batch G_output * (1 - m_batch)做了掩碼合并確保觀測(cè)位置的原始值不被覆蓋。這一行看起來簡單卻是GAIN能保持?jǐn)?shù)據(jù)原有信息的關(guān)鍵。4.2 觀測(cè)值保留策略和收斂判斷除了掩碼合并我還在損失計(jì)算里做了一個(gè)小改進(jìn)判別器更新時(shí)真實(shí)觀測(cè)位置參與計(jì)算的權(quán)重只有缺失位置的1/hint_rate。這意味著訓(xùn)練初期判別器更關(guān)注缺失位置的判斷而不會(huì)被大量真實(shí)觀測(cè)樣本帶偏。這個(gè)細(xì)節(jié)原論文里的實(shí)現(xiàn)只是簡單加權(quán)沒解釋為什么這么設(shè)計(jì)我在復(fù)現(xiàn)時(shí)分析下來認(rèn)為這是為了平衡兩類樣本的數(shù)量差異。關(guān)于收斂判斷GAIN有一個(gè)天然的優(yōu)勢(shì)判別器的loss可以當(dāng)作訓(xùn)練進(jìn)度的參考。訓(xùn)練初期判別器能輕松區(qū)分真實(shí)和生成的數(shù)據(jù)loss下降很快隨著生成器能力的增強(qiáng)判別器的loss會(huì)緩慢上升這時(shí)說明生成器已經(jīng)開始騙過判別器了。我一般觀察生成器和判別器loss曲線的交叉點(diǎn)交叉之后再訓(xùn)練100到200個(gè)epoch效果基本就穩(wěn)定了。如果兩個(gè)loss都不動(dòng)了但數(shù)值偏高很可能是學(xué)習(xí)率太大造成震蕩建議調(diào)低一個(gè)數(shù)量級(jí)再訓(xùn)。4.3 填補(bǔ)效果評(píng)估不只是看RMSE訓(xùn)練完模型后怎么判斷填補(bǔ)效果好不好很多人第一反應(yīng)是算RMSE或者M(jìn)AE。這確實(shí)是最常用的指標(biāo)做法是把一批完整的數(shù)據(jù)手動(dòng)挖掉一些值跑完填補(bǔ)后和真實(shí)值做對(duì)比??偨Y(jié)一下我自己實(shí)踐中的做法# 手動(dòng)制造缺失評(píng)估填補(bǔ)效果 def evaluate_imputation(model, data_complete, missing_rate0.2): data_missing data_complete.copy() mask np.ones_like(data_complete) for i in range(data_complete.shape[0]): n_missing int(data_complete.shape[1] * missing_rate) missing_idx np.random.choice(data_complete.shape[1], n_missing, replaceFalse) data_missing[i, missing_idx] 0 mask[i, missing_idx] 0 # 執(zhí)行填補(bǔ) filled model.impute(data_missing) # 計(jì)算RMSE只統(tǒng)計(jì)缺失位置 diff filled - data_complete mse np.sum(diff**2 * (1 - mask)) / np.sum(1 - mask) rmse np.sqrt(mse) return rmse但單純看RMSE有盲區(qū)。我遇到過一種情況RMSE數(shù)值不算高但把所有樣本的填補(bǔ)值拉出來看分布發(fā)現(xiàn)某些特征的填補(bǔ)值方差特別小幾乎都在均值附近擺動(dòng)。這說明生成器學(xué)會(huì)了預(yù)測(cè)均值但沒有真正學(xué)會(huì)特征的波動(dòng)范圍。所以我還建議額外做一些分布檢驗(yàn)比如對(duì)比填補(bǔ)后數(shù)據(jù)和原始數(shù)據(jù)在關(guān)鍵特征上的直方圖、相關(guān)系數(shù)矩陣差異。判斷標(biāo)準(zhǔn)很簡單好的填補(bǔ)應(yīng)該讓缺失位置的數(shù)據(jù)分布和觀測(cè)位置盡量一致特征間相關(guān)性也基本保持。原論文代碼里實(shí)驗(yàn)場(chǎng)景主要是數(shù)據(jù)缺失率在20%到30%之間的情況這個(gè)范圍內(nèi)GAIN的填補(bǔ)效果非常明顯。我額外測(cè)了40%和50%的高缺失率場(chǎng)景效果有下降但還是優(yōu)于均值填補(bǔ)和MICE說明模型的穩(wěn)健性還不錯(cuò)。5. 常見問題與排查技巧實(shí)錄5.1 維度不匹配問題最頻繁踩的坑GAIN實(shí)現(xiàn)過程碰到最多的報(bào)錯(cuò)就是維度不匹配。因?yàn)檎麄€(gè)流程里要拼接帶缺失數(shù)據(jù)、噪聲、提示向量、掩碼矩陣好幾個(gè)參與方任何一個(gè)維度對(duì)不上都會(huì)炸。典型報(bào)錯(cuò)是ValueError: Dimensions must be equal類型。這類問題大部分情況出在數(shù)據(jù)經(jīng)過標(biāo)準(zhǔn)化后形狀發(fā)生變化或者掩碼矩陣與數(shù)據(jù)矩陣的行列順序不對(duì)。我的排查習(xí)慣是在網(wǎng)絡(luò)輸入構(gòu)建之前用print(x_batch.shape, m_batch.shape, h_batch.shape, z_batch.shape)全部打出來逐一核對(duì)。四個(gè)張量的第一維batch size必須完全一致第二維通常是特征維度或者特征維度的兩倍拼接后。把所有參與拼接的變量維度列出來對(duì)照檢查比看報(bào)錯(cuò)信息省事得多。5.2 訓(xùn)練不收斂或損失函數(shù)震蕩的排查方向訓(xùn)練不收斂是另一個(gè)高頻問題?,F(xiàn)象是loss值一直跳動(dòng)沒有規(guī)律地下降訓(xùn)練幾百輪后生成器填出來的值還是一團(tuán)糟。這種問題我遇到過太多次排查順序可以按如下步驟來第一步是檢查學(xué)習(xí)率是不是設(shè)置得過大GAIN的對(duì)抗訓(xùn)練本身就比較敏感學(xué)習(xí)率高很容易震蕩。我在實(shí)踐中發(fā)現(xiàn)學(xué)習(xí)率設(shè)置在1e-3到1e-4之間比較安全如果loss跳動(dòng)明顯優(yōu)先調(diào)到1e-4。第二步是看hint_rate是否合適這個(gè)參數(shù)直接影響判別器的任務(wù)難度參數(shù)設(shè)置和缺失模式不匹配容易造成生成器和判別器loss收斂速度差距過大一個(gè)收斂了另一個(gè)還在原地打轉(zhuǎn)。第三步是檢查數(shù)據(jù)標(biāo)準(zhǔn)化操作。如果原始數(shù)據(jù)里有極端異常值還沒處理掉即使做了歸一化模型也會(huì)被個(gè)別樣本牽著走。所以我在預(yù)處理階段會(huì)先做異常值裁剪用3倍標(biāo)準(zhǔn)差截?cái)鄷?huì)讓訓(xùn)練過程踏實(shí)不少。5.3 填補(bǔ)結(jié)果全部趨同的處理經(jīng)驗(yàn)還有一個(gè)比較隱蔽的問題訓(xùn)練成功了loss看起來正常但生成器對(duì)不同的缺失樣本給出的填補(bǔ)值幾乎一樣。這說明生成器沒有學(xué)會(huì)區(qū)分不同樣本的特征模式退化成了類似均值填補(bǔ)的效果。我遇到這個(gè)問題的原因最初是隨機(jī)噪聲的維度設(shè)得太低。生成器輸入里的噪聲向量如果維度太小或者全部是常數(shù)生成器就沒有隨機(jī)性來源學(xué)來學(xué)去只會(huì)輸出一個(gè)固定模式。我把噪聲從標(biāo)量擴(kuò)展到和特征維度相同的向量并確保它每一輪訓(xùn)練都重新采樣問題就解決了。另外生成器的能力如果太弱比如隱藏層節(jié)點(diǎn)太少它也學(xué)不到足夠的樣本差異。適當(dāng)增加隱藏層寬度或者增加一層都可以緩解模式坍縮問題。5.4 不同缺失率下的表現(xiàn)和參數(shù)調(diào)整建議實(shí)測(cè)下來缺失率在10%到20%之間時(shí)GAIN填補(bǔ)效果顯著優(yōu)于均值填補(bǔ)和MICERMSE能降低20%到30%。缺失率超過40%時(shí)效果下降比較明顯因?yàn)橛行畔⑻偃魏畏椒ǘ己茈y精確恢復(fù)原始分布。這時(shí)建議先把缺失率高的特征標(biāo)記出來看看有沒有其他特征可以提供輔助信息。參數(shù)調(diào)節(jié)方面總結(jié)一下我常用的調(diào)參順序先固定hint_rate為0.9把學(xué)習(xí)率調(diào)到穩(wěn)定收斂的程度然后再動(dòng)hint_rate觀察生成器loss變化如果發(fā)現(xiàn)填補(bǔ)值的分布與實(shí)際不符再調(diào)整生成器和判別器的隱藏層寬度。不用一上來就瘋狂調(diào)網(wǎng)絡(luò)結(jié)構(gòu)很多時(shí)候?qū)W習(xí)率和hint_rate的組合才是決定成敗的關(guān)鍵。6. 經(jīng)驗(yàn)總結(jié)與拓展思考GAIN這套方法我用到現(xiàn)在最深的感受是它把缺失值填補(bǔ)從插值思維提升到了分布擬合思維。傳統(tǒng)方法試圖用一個(gè)簡單的函數(shù)去逼近缺失值而GAIN試圖理解整個(gè)數(shù)據(jù)集背后的生成機(jī)制。當(dāng)然這不意味著GAIN在所有場(chǎng)景都能碾壓傳統(tǒng)方法。小數(shù)據(jù)集、特征維度很低、數(shù)據(jù)模式簡單的情況下多重插補(bǔ)可能已經(jīng)夠用堆一個(gè)對(duì)抗網(wǎng)絡(luò)性價(jià)比不高。但數(shù)據(jù)維度高、特征關(guān)系復(fù)雜的場(chǎng)景GAIN真的很能打。目前GAIN還有一個(gè)可以改進(jìn)的方向是結(jié)合自注意力機(jī)制。表格數(shù)據(jù)其實(shí)也存在特征的全局依賴關(guān)系比如某些特征之間隔了好幾列但關(guān)系非常密切。自注意力可以捕捉這種跨特征依賴如果應(yīng)用到GAIN的生成器里理論上效果會(huì)更好。另外一個(gè)方向是把時(shí)間序列的時(shí)序依賴引入生成器用LSTM或者Transformer結(jié)構(gòu)替代普通全連接網(wǎng)絡(luò)這條路我還沒跑完但初步思路已經(jīng)有了。如果你準(zhǔn)備動(dòng)手復(fù)現(xiàn)建議不要直接抄代碼就跑先把數(shù)據(jù)預(yù)處理、掩碼矩陣、提示機(jī)制這幾塊原理理解了再跑訓(xùn)練循環(huán)。否則遇到問題都不知道從哪里排查。有朋友問我要不要直接用官方GitHub的代碼我的意見是可以先看但一定自己按2.x語法重寫一遍——因?yàn)榕f代碼改動(dòng)起來往往比自己從零寫還費(fèi)時(shí)間。最后再分享一個(gè)小技巧訓(xùn)練結(jié)束后保存好生成器模型對(duì)同類型的新數(shù)據(jù)做填補(bǔ)時(shí)直接加載模型推理即可不需要重新訓(xùn)練。只要新數(shù)據(jù)和訓(xùn)練數(shù)據(jù)分布相似填補(bǔ)質(zhì)量基本不會(huì)差太多。這個(gè)特性在生產(chǎn)環(huán)境中特別實(shí)用相當(dāng)于一次訓(xùn)練、多次使用省下的時(shí)間可不是一星半點(diǎn)。本文還有配套的精品資源點(diǎn)擊獲取