音跑通RVC:Retrieval-based-Voice-Conversion-WebUI變聲模型從零訓(xùn)練實(shí)戰(zhàn))
10分鐘語(yǔ)音跑通RVCRetrieval-based-Voice-Conversion-WebUI變聲模型從零訓(xùn)練實(shí)戰(zhàn)【免費(fèi)下載鏈接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!項(xiàng)目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下稱 RVC是一個(gè)基于 VITS 的變聲框架你只需要準(zhǔn)備 10 分鐘以上的低底噪語(yǔ)音就能訓(xùn)練出一個(gè) RVC 變聲模型訓(xùn)練完成后用自己的聲音文件即可推理出目標(biāo)音色。本教程帶你從零走到模型能出聲并順手排掉新手最常踩的幾個(gè)坑。動(dòng)手前你需要什么先說(shuō)適用人群和最終效果你有一臺(tái)帶顯卡的電腦N 卡、A 卡、I 卡均可倉(cāng)庫(kù)提供了對(duì)應(yīng)依賴或者一臺(tái)租用來(lái)的 GPU 服務(wù)器。你有一段 10 分鐘左右、音質(zhì)較高、底噪較低的說(shuō)話錄音人聲不用帶伴奏。跑通后你會(huì)得到兩樣?xùn)|西weights文件夾下約 60MB 以上的.pth模型文件和logs/實(shí)驗(yàn)名下added_開頭的.index索引文件。前者負(fù)責(zé)音色后者負(fù)責(zé)檢索時(shí)防止音色泄漏——RVC 用 top1 檢索把輸入源特征替換成訓(xùn)練集特征就是靠它實(shí)現(xiàn)的。準(zhǔn)備清單Python 版本大于 3.8README 環(huán)境配置的第一條要求一份 10~50 分鐘的訓(xùn)練集錄音推薦時(shí)長(zhǎng) 10 分鐘起步文件放在路徑不含空格、不含括號(hào)、不含中文的目錄里顯卡顯存FAQ 里提到 4GB 顯存還有救2~3GB 的顯卡建議直接放棄訓(xùn)練只做推理已安裝 ffmpeg 和 ffprobe或準(zhǔn)備安裝見下文約 1 小時(shí)的整塊時(shí)間其中訓(xùn)練本身通常只用幾分鐘到幾十分鐘大頭在環(huán)境安裝。最短路徑先跑起來(lái)如果你用的是 Windows最短路徑是下載官方整合包RVC-beta.7z解壓后雙擊go-web.bat瀏覽器里 WebUI 會(huì)直接打開。如果你是 Linux / macOS 用戶或者想自己裝環(huán)境本教程后續(xù)都基于這條路按下面 4 步走5 分鐘內(nèi)應(yīng)該能看到 WebUI 頁(yè)面獲取代碼git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI安裝依賴以 N 卡為例pip install torch torchvision torchaudio pip install -r requirements.txt下載預(yù)訓(xùn)練資產(chǎn)hubert、rmvpe、pretrained、uvr5 等腳本會(huì)自動(dòng)放到assets/對(duì)應(yīng)目錄python tools/download_models.py啟動(dòng) WebUIpython infer-web.py啟動(dòng)成功后瀏覽器會(huì)自動(dòng)打開 Gradio 頁(yè)面。你能看到「模型推理」「伴奏人聲分離去混響去回聲」「訓(xùn)練」「ckpt處理」幾個(gè)選項(xiàng)卡就算跑起來(lái)了。此時(shí)還沒有自己的模型先用倉(cāng)庫(kù)自帶示例音頻走一遍「單次推理」確認(rèn)推理鏈路正常再進(jìn)入訓(xùn)練。逐步配置詳解安裝步驟基礎(chǔ)環(huán)境按顯卡分流所有平臺(tái)通用的第一步是裝 PyTorchpip install torch torchvision torchaudioWindows 系統(tǒng) Nvidia Ampere 架構(gòu)RTX 30 系的機(jī)器經(jīng)驗(yàn)上需要指定 CUDA 版本pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117然后按顯卡選依賴文件四個(gè)文件倉(cāng)庫(kù)里都有裝錯(cuò)一般表現(xiàn)為推理時(shí)報(bào)設(shè)備相關(guān)錯(cuò)誤pip install -r requirements.txt # N卡 pip install -r requirements-dml.txt # A卡/I卡A 卡 Linux ROCm 用requirements-amd.txtI 卡 Linux IPEX 用requirements-ipex.txtROCm 驅(qū)動(dòng)和環(huán)境變量如HSA_OVERRIDE_GFX_VERSION的配置細(xì)節(jié)見 README 的 AMD 章節(jié)這里不展開。macOS 用戶可以直接執(zhí)行sh ./run.sh裝依賴。不習(xí)慣 pip 的話也可以用 Poetry 裝注意 Python 建議 3.7~3.10其他版本在llvmlite0.39.0上會(huì)沖突。資產(chǎn)與模型文件ffmpeg 和 assetsffmpeg 是繞不開的依賴RVC 靠它讀音頻和寫 filelist。Ubuntu/Debian 執(zhí)行sudo apt install ffmpegmacOS 執(zhí)行brew install ffmpegWindows 用戶把ffmpeg.exe和ffprobe.exe放到項(xiàng)目根目錄即可。模型資產(chǎn)部分核心是運(yùn)行python tools/download_models.py上一步已執(zhí)行過(guò)它會(huì)下載assets/hubert/hubert_base.pt——特征提取用assets/rmvpe/rmvpe.pt——RMVPE 音高提取模型參數(shù)用于解決啞音問(wèn)題assets/pretrained下的 G/D 系列底模32k/40k/48kassets/uvr5_weights下的 UVR5 人聲分離權(quán)重。想訓(xùn) v2 模型還需要額外下載assets/pretrained_v2目錄。另外可以順手確認(rèn)一下assets/里有沒有Synthesizer_inputs.pth這類文件缺失會(huì)導(dǎo)致啟動(dòng)或推理階段報(bào)錯(cuò)。啟動(dòng)驗(yàn)證WebUI 打開了算不算成功算但只算一半。真正的驗(yàn)證標(biāo)準(zhǔn)是瀏覽器能打開 WebUI五個(gè)選項(xiàng)卡含「Onnx導(dǎo)出」「FAQ」都渲染正常沒有紅色報(bào)錯(cuò)控制臺(tái)沒有 Traceback 滾過(guò)去在「模型推理」→「單次推理」里選一個(gè)自帶示例 pth、一條示例音頻點(diǎn)開始推理后幾秒內(nèi)能在待推理音頻位置看到合成波形。三者都滿足說(shuō)明設(shè)備、ffmpeg、預(yù)訓(xùn)練資產(chǎn)全部就位可以放心進(jìn)「訓(xùn)練」選項(xiàng)卡。跑起來(lái)之后驗(yàn)證效果與常見坑訓(xùn)練流程一句話版在「訓(xùn)練」選項(xiàng)卡里填訓(xùn)練集目錄、實(shí)驗(yàn)名點(diǎn)一鍵訓(xùn)練等它完成數(shù)據(jù)集處理、F0 提取、特征提取、訓(xùn)練、訓(xùn)練索引。成功后weights/實(shí)驗(yàn)名.pth和logs/實(shí)驗(yàn)名/added_*.index會(huì)出現(xiàn)回到「模型推理」刷新音色選這兩個(gè)文件推理你自己的音頻。訓(xùn)練集時(shí)長(zhǎng)怎么定官方 FAQ 推薦 10~50 分鐘音質(zhì)高、底噪低、音色有個(gè)人特色時(shí)5~10 分鐘也能出效果低于 1 分鐘不建議嘗試。total_epoch方面音質(zhì)差的訓(xùn)練集 20~30 輪足夠高音質(zhì)長(zhǎng)數(shù)據(jù)可以調(diào)到 200。新手最常遇到的 5 個(gè)問(wèn)題統(tǒng)一按現(xiàn)象 → 原因 → 解法整理完整版可對(duì)照 docs/cn/faq.md現(xiàn)象原因解法ffmpeg error / utf8 error大概率不是 ffmpeg 本身的問(wèn)題而是音頻路徑帶空格、() 等符號(hào)或中文路徑在寫 filelist.txt 時(shí)編碼出錯(cuò)訓(xùn)練集目錄改成純英文、無(wú)空格路徑訓(xùn)練結(jié)束沒有added_索引文件訓(xùn)練集太大內(nèi)存版 add 索引卡住用批處理 add 索引或臨時(shí)再點(diǎn)一次訓(xùn)練索引按鈕一鍵訓(xùn)練后緊跟著的報(bào)錯(cuò)顯示 Training is done. The program is closed. 即模型已訓(xùn)成后面的報(bào)錯(cuò)是假的忽略即可別誤刪產(chǎn)物分享/推理模型報(bào) f0、tgt_sr 等 key 不存在把logs下幾百 MB 的實(shí)驗(yàn)狀態(tài) pth 直接拿去推理了分享用weights下 60MB 的 pth added_*.index必要時(shí)在「ckpt處理」做小模型提取Cuda error / out of memory顯存不夠4GB 以下顯存基本放棄訓(xùn)練訓(xùn)練縮小 batch size推理縮小configs/config.py末尾的x_pad、x_query、x_center、x_max另外兩個(gè)小坑瀏覽器顯示 Connection Error 通常是控制臺(tái)窗口被你關(guān)了Expecting value: line 1 column 1 (char 0) 一般是系統(tǒng)代理干擾關(guān)掉全局代理包括服務(wù)端的 http_proxy再試。結(jié)尾下一步做什么跑通單次推理后建議先做兩件事挑一段 30 秒左右的干凈人聲做測(cè)試音頻在「模型推理」里把index_rate和音高偏移都調(diào)到中間值聽一遍效果建立基線滿意后試試「批量推理」處理一整首歌或者進(jìn)「ckpt處理」用 ckpt-merge 把兩個(gè)模型融合出新音色這是 RVC 玩法里成本最低的一條進(jìn)階路徑。數(shù)據(jù)量夠、模型穩(wěn)定之后再去折騰實(shí)時(shí)變聲go-realtime-gui.bat也不遲。【免費(fèi)下載鏈接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!項(xiàng)目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考