
5分鐘上手 VoxCPM從快速安裝到生成第一條多語言語音的完整指南【免費下載鏈接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning項目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPMVoxCPM 是一款無離散令牌器的文本轉(zhuǎn)語音TTS系統(tǒng)輸入文字直接產(chǎn)出連續(xù)的自然語音還支持用一句描述捏音色、用一段音頻克隆音色。它適合做配音、有聲內(nèi)容和多語言語音應用的開發(fā)者與內(nèi)容創(chuàng)作者。這篇上手教程帶你走完安裝、出第一條語音、再到玩克隆的全流程。全程只需一條安裝命令和十幾行代碼最后你會拿到一個能直接播放的demo.wav48kHz 采樣率以及一套音色設計、語音克隆、參數(shù)調(diào)優(yōu)的實用手感。 為什么選 VoxCPM無令牌器 TTS 的三個不同點不做離散 token 化多數(shù) TTS 先把音頻切成離散 token 再重建VoxCPM 走擴散自回歸路線全程在連續(xù)空間里建模音色和韻律的細小變化不會在量化環(huán)節(jié)丟30 種語言 9 種中文方言不用加語言標簽輸入什么語言就合成什么語言三種拿音色的方式文字描述設計音色、參考音頻做可控克隆、音頻加文本做續(xù)寫式極致克隆。下面這張架構(gòu)圖里文本先進 Text-Semantic LM 出語義再由 Residual Acoustic LM 逐段生成連續(xù)聲學表征最后交給 LocDiT 和 AudioVAE 解碼成 48kHz 波形? 30 秒環(huán)境核對Python 版本與顯存要求動手前花半分鐘對一下清單能避開九成安裝報錯系統(tǒng)Linux 或 Windows有 NVIDIA GPU 體驗最好Apple Silicon Mac 也能跑Python3.10 ~ 3.123.13 及以上暫不支持依賴PyTorch ≥ 2.5.0、CUDA ≥ 12.0pip install時會一并裝好顯存VoxCPM2 約需 8GB沒有 GPU 也能用 CPU只是速度慢網(wǎng)絡首次運行要聯(lián)網(wǎng)拉模型權(quán)重國內(nèi)網(wǎng)絡可以稍后走 ModelScope 鏡像 PyPI 一行安裝 VoxCPM附源碼備選推薦方式只有一行裝完命令行里會多出一個voxcpm工具跑一下voxcpm --help能看到子命令就說明裝好了pip install voxcpm需要最新開發(fā)版時從源碼裝即可效果等同git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM pip install . 第一次運行10 行代碼生成第一條語音把下面腳本存成first_run.py運行。首次執(zhí)行會自動下載 VoxCPM2 權(quán)重國內(nèi)下載慢可先pip install modelscope用snapshot_download拉到本地再from_pretrained指向本地目錄from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) # 首次自動下載權(quán)重 wav model.generate( text你好這是我用 VoxCPM 生成的第一條語音。, cfg_value2.0, # 提示遵循強度默認 2.0 inference_timesteps10, # 擴散步數(shù)越大越精細也越慢 ) sf.write(demo.wav, wav, model.tts_model.sample_rate)運行結(jié)束工作目錄里會多出demo.wav用任意播放器打開即可聽到一句自然的中文——這就是你的第一個結(jié)果。 核心功能演示音色設計與零樣本克隆VoxCPM2 最出效果的玩法有兩個各配一段最小代碼。用一句描述設計全新音色不上傳任何音頻只把音色描述用括號寫在text開頭模型就會照描述生成一個新演員wav model.generate( text(年輕女性聲音溫柔甜美)歡迎來到 VoxCPM 的世界, seed42, # 固定隨機種子方便復現(xiàn) ) sf.write(voice_design.wav, wav, model.tts_model.sample_rate)參考音頻克隆 風格指令微調(diào)傳一段參考音頻音色來自它括號里的指令再疊加情緒和語速原音色不變wav model.generate( text(語速稍快語氣歡快)這是克隆音色配上風格指令的效果。, reference_wav_pathexamples/reference_speaker.wav, # 換成你的參考音頻 seed42, ) sf.write(clone.wav, wav, model.tts_model.sample_rate)想逐細節(jié)還原就用極致克隆同一段音頻同時傳給prompt_wav_path和reference_wav_path并補上prompt_text音頻對應的文本要邊生成邊播放則改用model.generate_streaming。? 參數(shù)調(diào)優(yōu)cfg_value 與推理步數(shù)怎么取generate里真正值得動的參數(shù)就三個按下面的感覺調(diào)即可參數(shù)默認值什么時候調(diào)cfg_value2.0讀起來僵硬、不聽提示 → 調(diào)高聽起來緊張不自然 → 調(diào)低。推薦 1.0~3.0允許范圍 0.1~10inference_timesteps10出成品要細節(jié) → 提到 15~30快速試草稿 → 降到 4~8seed隨機想復現(xiàn)同一條結(jié)果就固定它比如 42音色設計和克隆類功能每次生成的表現(xiàn)力會略有差異這是正常的——多跑 1~2 條挑最順耳的那條即可。? 進階入口Web 界面、CLI 與 LoRA 微調(diào)不想寫代碼時倉庫自帶 Gradio 網(wǎng)頁運行python app.py --port 8808后瀏覽器打開http://localhost:8808就能點選生成--device auto會自動挑 CPU/GPU。純命令行黨可以直接用子命令音色設計voxcpm design --text Hello --control warm female voice --output out.wav克隆voxcpm clone --text 文本 --reference-audio ref.wav --output out.wav還有voxcpm batch按行批量出音頻。如果你有 5~10 分鐘錄音可以用 LoRA 微調(diào)出自己的專屬音色入口是 scripts/train_voxcpm_finetune.py對應配置在 conf/voxcpm_v2/倉庫還附帶了 lora_ft_webui.py 圖形化訓練界面。 繼續(xù)深入文檔、樣例與源碼README_zh.md中文完整文檔含支持語言列表、版本對比和評測數(shù)據(jù)examples/參考音頻、示例文本和訓練數(shù)據(jù)格式樣例src/voxcpm/核心源碼模型、AudioVAE、LoRA 層都在這里關(guān)掉這篇文章打開終端把pip install voxcpm跑起來——一分鐘后你就能聽到自己的第一條 VoxCPM 語音?!久赓M下載鏈接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning項目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考