音數(shù)據(jù)訓(xùn)一個(gè) AI 變聲模型:RVC 變聲框架快速上手指南)
10 分鐘語(yǔ)音數(shù)據(jù)訓(xùn)一個(gè) AI 變聲模型RVC 變聲框架快速上手指南【免費(fèi)下載鏈接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!項(xiàng)目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一個(gè)基于 VITS 的開(kāi)源 AI 變聲框架你只需要10 分鐘語(yǔ)音數(shù)據(jù)就能在普通顯卡上訓(xùn)練出一個(gè)可用的變聲模型再把它套到自己的歌聲或語(yǔ)音上。核心能力速覽先看你拿得到什么數(shù)據(jù)需求低→ 1050 分鐘人聲即可完成一次語(yǔ)音數(shù)據(jù)訓(xùn)練510 分鐘的高質(zhì)量、音色統(tǒng)一數(shù)據(jù)也足夠出效果。低配顯卡可訓(xùn)練→ 4G 顯存級(jí)別顯卡仍可跑訓(xùn)練遇到顯存不足時(shí)調(diào)小 batch size 即可不必先升級(jí)硬件。top1 檢索機(jī)制壓制音色泄漏→ 推理時(shí)用訓(xùn)練集特征替換輸入源特征index rate 拉到 1 時(shí)理論上不再有源音色混入代價(jià)是音質(zhì)向訓(xùn)練集靠攏。網(wǎng)頁(yè)界面 實(shí)時(shí)鏈路→ 從切片、提取音高、訓(xùn)練到推理都在瀏覽器里完成實(shí)時(shí)變聲界面端到端延遲 170ms用 ASIO 設(shè)備可壓到 90ms。上手前準(zhǔn)備清單按你的系統(tǒng)對(duì)號(hào)入座通用項(xiàng)所有系統(tǒng)步驟操作1. 安裝依賴Python 3.8按顯卡執(zhí)行pip install -r requirements.txtN 卡/requirements-dml.txtA 卡、I 卡/requirements-amd.txtA 卡 ROCm/requirements-ipex.txtI 卡 IPEX2. 預(yù)模型資源下載 assets 下的hubert/hubert_base.pt、pretrained、uvr5_weights想用 v2 底模再補(bǔ)一個(gè)pretrained_v23. ffmpeg確認(rèn)ffmpeg/ffprobe可用這是音頻切片的底層工具4. 音高提取模型把rmvpe.pt放到項(xiàng)目根目錄RMVPE 算法解決啞音問(wèn)題比 crepe_full 更快、占用更小A 卡/I 卡可選rmvpe.onnx按系統(tǒng)補(bǔ)充系統(tǒng)額外操作WindowsRTX 30 系A(chǔ)mpere裝 PyTorch 時(shí)指定 cu117 源ffmpeg.exe / ffprobe.exe 放根目錄MacOS直接執(zhí)行sh ./run.sh安裝依賴ffmpeg 用 brew 安裝LinuxAMD ROCm裝 rocm 驅(qū)動(dòng)個(gè)別顯卡如 RX 6700XT需設(shè)HSA_OVERRIDE_GFX_VERSION10.3.0并把用戶加入render、video組啟動(dòng)與三種使用姿勢(shì)姿勢(shì)一直接啟動(dòng)最通用python infer-web.py姿勢(shì)二整合包不想配環(huán)境下載并解壓RVC-beta.7zWindows 雙擊go-web.batMacOS 執(zhí)行sh ./run.sh。姿勢(shì)三IPEX 加速I 卡僅 Linux啟動(dòng)前先執(zhí)行source /opt/intel/oneapi/setvars.sh再用姿勢(shì)一的命令啟動(dòng)。從數(shù)據(jù)到音色訓(xùn)練實(shí)操四步備數(shù)據(jù)準(zhǔn)備 1050 分鐘人聲底噪越低越好文件路徑里不要有空格、括號(hào)和中文能避開(kāi)后面 90% 的報(bào)錯(cuò)。切片與預(yù)處理在 WebUI 里做一鍵切片、UVR5 人聲伴奏分離、特征提取、音高提取訓(xùn)練與推理的核心邏輯分別見(jiàn) infer/lib/rtrvc.py 與 訓(xùn)練腳本。訓(xùn)練填實(shí)驗(yàn)名設(shè) total_epoch——音質(zhì)差底噪大取 2030音質(zhì)高時(shí)長(zhǎng)多可拉到 200看到 Training is done 即訓(xùn)練成功其后緊鄰的報(bào)錯(cuò)可忽略。建索引 推理訓(xùn)練完執(zhí)行訓(xùn)練索引生成added_開(kāi)頭的 index 文件這是壓制音色泄漏的檢索源推理時(shí) index rate 越高源音色混入越少、結(jié)果越貼近訓(xùn)練集。模型分享時(shí)打包weights/下 60MB 的 pth 與 index 文件即可logs/里幾百 MB 的 pth 是訓(xùn)練狀態(tài)存檔不能直接拿去推理相關(guān)規(guī)則見(jiàn) docs/cn/faq.md。高頻問(wèn)題快速定位癥狀處理ffmpeg error / utf8 error多半是路徑問(wèn)題去掉空格、括號(hào)、中文路徑訓(xùn)練結(jié)束沒(méi)有 added 索引訓(xùn)練集太大卡住建索引重按一次訓(xùn)練索引按鈕推理音色列表里沒(méi)有新模型先點(diǎn)刷新音色仍沒(méi)有則查控制臺(tái)區(qū)和logs/實(shí)驗(yàn)名下的報(bào)錯(cuò)日志Cuda out of memory訓(xùn)練調(diào)小 batch size推理調(diào)小 config.py 尾部的 x_pad/x_query 參數(shù)4G 以下顯存建議換卡Connection Error / 頁(yè)面空白檢查是否誤關(guān)了控制臺(tái)窗口或關(guān)閉系統(tǒng)代理后重試文件/內(nèi)存 error訓(xùn)練時(shí)CPU 進(jìn)程數(shù)調(diào)低訓(xùn)練集音頻手工切短不同基礎(chǔ)各做一件事零基礎(chǔ)下載整合包雙擊go-web.bat按頁(yè)面按鈕順序走一遍。有 Python 基礎(chǔ)按準(zhǔn)備清單裝好依賴python infer-web.py起步。想深入對(duì)照 docs/en/training_tips_en.md 與 docs/en/faq_en.md 調(diào) epoch、index rate 等參數(shù)。【免費(fèi)下載鏈接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!項(xiàng)目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考