指南:用1分鐘音頻克隆出專屬TTS聲音)
GPT-SoVITS實戰(zhàn)指南用1分鐘音頻克隆出專屬TTS聲音【免費下載鏈接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)項目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一個開源的少樣本語音克隆項目喂給它 5 秒?yún)⒖家纛l即可零樣本合成語音提供約 1 分鐘的目標(biāo)人聲數(shù)據(jù)則能微調(diào)出一個音色貼合的專屬 TTS 模型。適合想快速搭建語音合成能力、又不想折騰完整 TTS 訓(xùn)練流水線的開發(fā)者。 能力與適用場景速覽維度說明零樣本合成提供 5 秒人聲樣本 參考文本直接生成目標(biāo)音色語音少樣本微調(diào)約 1 分鐘訓(xùn)練數(shù)據(jù)即可微調(diào) GPT/SoVITS 雙模型提升音色相似度語言覆蓋中文、英語、日語、韓語、粵語支持跨語言推理與句內(nèi)混讀配套工具鏈UVR5 人聲分離、自動音頻切片、多語言 ASR 轉(zhuǎn)寫與可視化校對聲碼器集成 BigVGANv3 原生輸出 24kv4 原生輸出 48k 音頻官方說明見 docs/cn/README.md模型架構(gòu)實現(xiàn)集中在GPT_SoVITS/AR/models/與GPT_SoVITS/module/models.py。 四步跑通首次安裝已驗證的環(huán)境組合Python 3.10/3.11 PyTorch 2.5.1CUDA 12.4或 PyTorch 2.7.0CUDA 12.8。1. 獲取代碼git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS2. 創(chuàng)建虛擬環(huán)境conda create -n GPTSoVits python3.10 conda activate GPTSoVits3. 運行安裝腳本自動安裝 ffmpeg、PyTorch、依賴包并下載預(yù)訓(xùn)練模型到GPT_SoVITS/pretrained_models、G2PW 中文音素模型到GPT_SoVITS/textbash install.sh --device CU128 --source HF --download-uvr5--device可選CU126 | CU128 | ROCM | MPS | CPU--source可選HF | HF-Mirror | ModelScope。Windows 用戶也可以直接下載官方整合包雙擊go-webui.bat啟動。macOS 上官方建議選CPU因為 Mac GPU 訓(xùn)練出的模型質(zhì)量明顯偏低。4. 啟動 WebUIpython webui.py瀏覽器訪問http://localhost:9874即進入主界面ASR 校對 9871、推理 9872、UVR5 9873端口定義在 config.py。首次使用某類 ASR 模型時會自動聯(lián)網(wǎng)下載離線環(huán)境可提前把模型放進tools/asr/models。? 從原始音頻到第一條合成語音整個流程在 WebUI 的訓(xùn)練數(shù)據(jù)準(zhǔn)備與模型訓(xùn)練兩個標(biāo)簽頁內(nèi)完成按序執(zhí)行即可導(dǎo)入與切片填入原始音頻路徑用內(nèi)置 slicer 切成適合訓(xùn)練的小片段長音頻自動按靜音分割。去噪可選底噪較大的樣本先過一遍降噪工具。ASR 轉(zhuǎn)寫自動識別生成文本標(biāo)注。中文/粵語走 FunASR 后端多語言默認(rèn) Fun-ASR-Nano也可換 Faster Whisper見tools/asr/funasr_asr.py、tools/asr/fasterwhisper_asr.py。人工校對在可視化校對界面逐條修正錯字、補標(biāo)點這一步直接決定訓(xùn)練上限。導(dǎo)出標(biāo)注文件格式為四段式語言碼支持zh / en / ja / ko / yuevocal_path|speaker_name|language|text D:\GPT-SoVITS\xxx\clip001.wav|xxx|zh|你好這是第一段訓(xùn)練文本。微調(diào)訓(xùn)練切到訓(xùn)練標(biāo)簽頁先訓(xùn) GPT 語義模型s1再訓(xùn) SoVITS 聲學(xué)生成模型s2對應(yīng)倉庫中的GPT_SoVITS/s1_train.py與GPT_SoVITS/s2_train.py。訓(xùn)練權(quán)重按版本分目錄存放如GPT_weights_v2Pro、SoVITS_weights_v2Pro配置文件參考GPT_SoVITS/configs/train.yaml如precision: 16-mixed、gradient_clip: 1.0。推理試聽進入1-GPT-SoVITS-TTS / 1C-inference頁簽選擇剛訓(xùn)好的權(quán)重、上傳 5–10 秒?yún)⒖家纛l并填參考文本輸入目標(biāo)文本生成 WAV。?? 選版本與調(diào)合成參數(shù)版本怎么挑均為 config.py 中實際注冊的版本版本定位適用數(shù)據(jù)輸出規(guī)格v2經(jīng)典款預(yù)訓(xùn)練擴到 5k 小時弱參考音頻更穩(wěn)平均音質(zhì)即可32kv2Pro / v2ProPlus性能超過 v4顯存占用略高于 v2速度接近 v2平均音質(zhì)即可32kv3音色相似度更高GPT 更穩(wěn)少復(fù)讀、少漏字情感更豐富需要較高質(zhì)量訓(xùn)練集原生 24kv4修復(fù) v3 的金屬感偽影原生 48k 輸出官方視為 v3 直接替代需要較高質(zhì)量訓(xùn)練集原生 48k官方結(jié)論訓(xùn)練集音質(zhì)一般時 v1/v2/v2Pro 出效果更穩(wěn)v3/v4 的合成音色更貼合參考音頻而非整個訓(xùn)練集。推理側(cè)旋鈕WebUI 與 API 共用參考音頻長度 5–15 秒越貼近目標(biāo)文本的語域語氣越自然top_k默認(rèn) 15、top_p默認(rèn) 1.0、temperature默認(rèn) 1.0控制隨機性復(fù)讀或跑題時調(diào)低 top_kspeed默認(rèn) 1.0調(diào)語速sample_steps默認(rèn) 32影響生成步數(shù)is_half控制 fp16 半精度NVIDIA 顯卡默認(rèn)開啟以省顯存由環(huán)境變量is_half控制。推理速度參考官方 v2 ProPlus 實測 RTFRTX 4090 約 0.0141400 字約 3.36 秒出 4 分鐘音頻RTX 4060 Ti 約 0.028M4 純 CPU 約 0.526。 常見坑位與排查WebUI 打開后連不上頁面現(xiàn)象終端正常打印但瀏覽器打不開 9874 端口。 可能原因端口被占用或防火墻攔截。 解決換一個空閑端口后重啟或用瀏覽器直接訪問終端輸出的完整 URLDocker 場景下確認(rèn)--service-ports已生效。中文合成讀音錯亂、出現(xiàn)拼音或英文現(xiàn)象中文文本被按英文規(guī)則讀。 可能原因GPT_SoVITS/text下缺少G2PWModel目錄中文音素模型沒裝。 解決重新執(zhí)行install.sh --device ... --source ...或手動把 G2PWModel 壓縮包解壓重命名后放入該目錄。CUDA 版本對不上安裝失敗或回退 CPU現(xiàn)象腳本提示找不到驅(qū)動回退 CPU或運行時出現(xiàn) CUDA 報錯。 可能原因驅(qū)動只支持 CUDA 12.6 卻選了 CU128。 解決用nvidia-smi查看 CUDA Version據(jù)此在--device中指定CU126或CU128。ASR 一直轉(zhuǎn)寫失敗或卡住現(xiàn)象切片后的音頻沒有生成文本標(biāo)注。 可能原因首次使用需聯(lián)網(wǎng)下載 ASR 模型網(wǎng)絡(luò)不通時靜默失敗。 解決換--source HF-Mirror環(huán)境或手動下載模型放入tools/asr/models后再跑。v3/v4 合成有明顯金屬感或發(fā)悶現(xiàn)象高語速段出現(xiàn)金屬味整體偏悶。 可能原因v3 的非整數(shù)倍上采樣偽影或 v3 原生 24k 輸出被放大后渾濁。 解決換 v4 權(quán)重原生 48kv4 用戶還可用tools/AP_BWE_main/的 24k→48k 超分模型處理舊產(chǎn)物。音色不像目標(biāo)說話人現(xiàn)象合成語氣平穩(wěn)但音色偏離參考人。 可能原因訓(xùn)練數(shù)據(jù)過少、參考音頻含伴奏或底噪或參考音頻與訓(xùn)練集音色差異過大。 解決擴充到 3–5 分鐘干凈人聲參考音頻選目標(biāo)說話人的典型片段重跑微調(diào)平均音質(zhì)數(shù)據(jù)優(yōu)先選 v2Pro 系版本。 API 集成與容器化部署HTTP APIapi.py默認(rèn)監(jiān)聽 9880 端口GPT_SoVITS/inference_webui.py也可獨立起推理端。核心端點有POST /set_model切換權(quán)重、POST /change_refer換參考音頻、POST /合成。合成請求體示例{ refer_wav_path: GPT_weights_v2Pro/prompt.wav, prompt_text: 參考音頻的文本內(nèi)容, prompt_language: zh, text: 你好這是一段 API 合成測試, text_language: zh, top_k: 15, temperature: 1.0, speed: 1.0 }Docker 部署docker-compose.yaml提供GPT-SoVITS-CU126、GPT-SoVITS-CU128及對應(yīng)-Lite不含 ASR 與 UVR5 模型四個服務(wù)在倉庫根目錄執(zhí)行docker compose run --service-ports GPT-SoVITS-CU128Windows Docker Desktop 默認(rèn)共享內(nèi)存偏小按需調(diào)大shm_size想用 fp16 設(shè)環(huán)境變量is_halftrue。需要最新代碼時可bash docker_build.sh --cuda 12.8本地構(gòu)建。批量處理切片、ASR、推理都有 CLI 入口例如python tools/slice_audio.py、python tools/asr/funasr_asr.py -i 輸入目錄 -o 輸出文件 -l zh適合放進腳本做批量任務(wù)。下一步先跑通install.shwebui.py用 1 分鐘音頻走完切片 → 校對 → 微調(diào) → 推理全流程拿到第一條合成語音后再考慮換版本或上 API。深入細(xì)節(jié)按 docs/cn/README.md 和GPT_SoVITS/AR/models/源碼逐層看即可。【免費下載鏈接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)項目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考