完整教程(支持克隆自己的聲音))
3分鐘把電子書變成有聲書ebook2audiobook免費(fèi)完整教程支持克隆自己的聲音【免費(fèi)下載鏈接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!項(xiàng)目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook書架上是不是堆著一堆買了卻沒(méi)讀完的電子書ebook2audiobook簡(jiǎn)稱 E2A是一款免費(fèi)的開(kāi)源轉(zhuǎn)換工具它用 AI 語(yǔ)音合成把電子書讀成帶章節(jié)標(biāo)記的有聲書——支持 1158 種語(yǔ)言、9 個(gè) TTS 引擎文本轉(zhuǎn)語(yǔ)音引擎還能用你自己錄的聲音來(lái)讀。下面按裝好 → 用會(huì) → 玩出花樣的順序帶你從第一本有聲書走到批量生產(chǎn)線。先聽(tīng)為快這本書會(huì)說(shuō)話之后是什么樣一句話概括 E2A 能做什么你丟進(jìn)一本電子書它吐出一整個(gè)有聲書架。1158 種語(yǔ)言從中文、英語(yǔ)到斯瓦希里語(yǔ)語(yǔ)言代碼用 ISO-639 格式如eng、zho兩字母代碼如en也認(rèn)得23 種輸入格式.epub、.mobi、.azw3、.pdf、.txt、.docx、.html甚至掃描圖片.png、.jpg都能轉(zhuǎn)9 個(gè) TTS 引擎XTTSv2、Bark、VITS、Tacotron2、YourTTS、GlowTTS、Tortoise、Fairseq、Piper可自由切換語(yǔ)音克隆上傳一段自己的錄音之后的有聲書全部用你的嗓子讀10 種輸出格式M4B、MP3、WAV、FLAC 等單聲道或立體聲任選完全本地運(yùn)行轉(zhuǎn)換過(guò)程不上傳任何文件讀什么書只有你自己知道典型的使用場(chǎng)景通勤路上聽(tīng)完一本周報(bào)和小說(shuō)、給娃做睡前故事、幫視力不好的家人讀報(bào)紙、把英文原版書變成外語(yǔ)聽(tīng)力材料。?? 一個(gè)前提只處理無(wú) DRM 保護(hù)、合法獲取的電子書作者不對(duì)濫用負(fù)責(zé)。低門檻啟動(dòng)2GB 內(nèi)存的電腦就夠跑先說(shuō)實(shí)話E2A 對(duì)硬件的要求比你想的低得多但低和快是兩回事。硬件門檻來(lái)自官方 README項(xiàng)目最低要求推薦配置內(nèi)存2GB8GB顯存1GB4GBPython3.10 – 3.12啟動(dòng)腳本自動(dòng)裝好不用你操心—處理器純 CPU 即可NVIDIA 顯卡CUDA、Apple SiliconMPS、AMDROCm都能加速有 GPU 體驗(yàn)接近實(shí)時(shí)沒(méi)有獨(dú)立顯卡也沒(méi)關(guān)系只是速度會(huì)從幾乎實(shí)時(shí)降到慢慢磨后面排坑章節(jié)有對(duì)應(yīng)解法。兩步安裝裝完就能用# 第一步克隆倉(cāng)庫(kù) git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook# 第二步啟動(dòng)首次運(yùn)行會(huì)自動(dòng)安裝 Python 依賴稍等片刻 ./ebook2audiobook.command # Linux / macOS # Windows 用戶直接雙擊 ebook2audiobook.cmd看到終端里蹦出http://localhost:7860/的地址后瀏覽器打開(kāi)它圖形界面就來(lái)了。圖形界面四步走從上傳到拿到音頻界面是 Gradio網(wǎng)頁(yè)版交互界面風(fēng)格分標(biāo)簽頁(yè)操作零基礎(chǔ)也能跟著走完。第 1 步上傳電子書預(yù)覽章節(jié)在 Input Options 區(qū)域把文件拖進(jìn)上傳框。.epub和.mobi是自動(dòng)識(shí)別章節(jié)效果最好的兩種格式如果你的書里有目錄頁(yè)、版權(quán)頁(yè)這類不想被讀出來(lái)的內(nèi)容建議先在閱讀器里手動(dòng)刪掉再轉(zhuǎn)換EPUB 格式?jīng)]有統(tǒng)一的章節(jié)結(jié)構(gòu)標(biāo)準(zhǔn)這是官方明確提醒的。另外這里還有個(gè)文本框入口最多 1024 個(gè)字符適合直接把一段短文轉(zhuǎn)成語(yǔ)音試試聲。第 2 步調(diào)音——溫度、語(yǔ)速、引擎怎么填切到 Audio Generation Preferences 標(biāo)簽頁(yè)幾個(gè)關(guān)鍵旋鈕的推薦取值溫度Temperature控制語(yǔ)音的發(fā)揮空間越高越有變化、越不重復(fù)。求穩(wěn)讀小說(shuō)建議從 0.6–0.8 之間起步Top-pTop-p 采樣限制模型只從最可能的前 p 比例候選詞里選調(diào)低如 0.8語(yǔ)音更自然、生成還更快語(yǔ)速Speed默認(rèn) 1x通勤想趕進(jìn)度可以拉高給孩子講睡前故事就放慢引擎默認(rèn) XTTSv2質(zhì)量最好、支持語(yǔ)音克隆純 CPU 機(jī)器可換 YourTTS 或 Tacotron2 提速輸出格式默認(rèn) M4B 單聲道一般不用動(dòng)第 3 步點(diǎn) Convert然后去喝杯水長(zhǎng)書轉(zhuǎn)換需要時(shí)間進(jìn)度條會(huì)在頁(yè)面上實(shí)時(shí)滾動(dòng)。中途反悔了點(diǎn)電子書上傳組件上的 [X] 即可取消。第 4 步試聽(tīng) 下載轉(zhuǎn)換完成后在結(jié)果頁(yè)直接在線試聽(tīng)滿意后點(diǎn)下載按鈕文件同時(shí)保存在本地的audiobooks目錄下。命令行與語(yǔ)音克隆進(jìn)階用戶的批處理路線圖形界面適合單本精修命令行headless 模式即不開(kāi)界面直接跑轉(zhuǎn)換才是批量黨的主場(chǎng)。一個(gè)整文件夾批量轉(zhuǎn)把一堆書放進(jìn)一個(gè)目錄一條命令全部讀出來(lái)# 批量轉(zhuǎn)換 books 目錄下所有電子書輸出到 audiobooks指定英語(yǔ) ./ebook2audiobook.command --headless --ebooks_dir books --output_dir audiobooks --language eng所有參數(shù)一覽可用--help查看完整清單也能在 lib/conf.py 的cli_options里查到。常用的還有--output_format指定輸出格式mp3、m4b、wav……--device指定 CPU/CUDA/MPS 等計(jì)算設(shè)備--session轉(zhuǎn)換中斷或崩潰后憑會(huì)話 ID 斷點(diǎn)續(xù)轉(zhuǎn)不用從頭再來(lái)三步克隆自己的聲音朗讀手機(jī)隨便錄一段1–5 分鐘的人聲wav 或 mp3 都行環(huán)境不用安靜——README 明確說(shuō)背景有噪聲甚至音樂(lè)都沒(méi)事E2A 會(huì)先把你的聲音去噪清洗轉(zhuǎn)換時(shí)加上--voice指向這段錄音# 用你自己的聲音讀這本書 ./ebook2audiobook.command --headless --ebook books/moby_dick.epub --voice voices/my_voice.wav --language eng批量轉(zhuǎn)換時(shí)還能用--voice_map傳入一個(gè) JSON 映射文件給不同書配不同講述人比如給詩(shī)集配你的聲音、給歷史讀物配家人的聲音。更細(xì)的控制SML 標(biāo)簽文本里可以埋入 SMLSpecial Markup Language標(biāo)簽做精細(xì)編排[break]插入 0.3–0.6 秒短停頓、[pause]插入 1.0–1.6 秒長(zhǎng)停頓、[pause:3]精確暫停 3 秒、[voice:路徑]...[/voice]在句子中間切換講述者。做多人對(duì)話的劇本式有聲書這組標(biāo)簽就是全部家當(dāng)。想要自動(dòng)打標(biāo)簽可以看倉(cāng)庫(kù)內(nèi)置的 components/E2A-SML/ 組件。兩個(gè)能直接抄的作業(yè)方案方案 A通勤族地鐵聽(tīng)書流水線適合每天通勤 30 分鐘以上、想聽(tīng)完技術(shù)文檔或長(zhǎng)篇小說(shuō)的人。周日下午花 10 分鐘把下周想讀的書放進(jìn)一個(gè)文件夾用--ebooks_dir批量轉(zhuǎn)--speed 1.2提 20% 語(yǔ)速輸出選 MP3 格式手機(jī)、車機(jī)、藍(lán)牙音箱全兼容如果聽(tīng)書 App 支持章節(jié)跳轉(zhuǎn)就選默認(rèn)的 M4B音頻同步到手機(jī)地鐵上從上次章節(jié)繼續(xù)常用輸出格式怎么選看這張表--output_format對(duì)應(yīng)關(guān)系格式優(yōu)點(diǎn)缺點(diǎn)什么時(shí)候選它M4B默認(rèn)帶章節(jié)標(biāo)記有聲書 App 直接認(rèn)個(gè)別車機(jī)不支持長(zhǎng)篇有聲書、搭配 AudiobookshelfMP3兼容性最好到處能放無(wú)章節(jié)信息手機(jī) / 車機(jī) / 音箱WAV無(wú)損音質(zhì)文件體積最大要后期剪輯、二次加工FLAC無(wú)損且比 WAV 小體積仍大于 MP3自己存檔方案 B家長(zhǎng)睡前故事 雙語(yǔ)啟蒙組合從公共領(lǐng)域書庫(kù)找一本英文版童書.epub最佳自動(dòng)分章最準(zhǔn)語(yǔ)速設(shè) 0.9x[pause:2]在每章之間多留兩秒節(jié)奏更舒緩想讓孩子順便學(xué)中文或反過(guò)來(lái)加一個(gè)--translate zho參數(shù)E2A 會(huì)先離線翻譯整本再合成翻譯版文件名自動(dòng)加語(yǔ)言后綴和原版互不干擾進(jìn)階玩法用你自己的聲音克隆讀給孩子聽(tīng)——爸爸親自講的睡前故事比任何 AI 聲線都親切 一位做程序員的用戶在討論區(qū)留言每周日批量轉(zhuǎn)好下周 3 章技術(shù)書通勤兩小時(shí)聽(tīng)完半年聽(tīng)完了 5 本比啃文字快多了。另一位英語(yǔ)老師則拿它給學(xué)生批量生成課文音頻孩子追著問(wèn)我能不能再把故事?lián)Q個(gè)人聲讀一遍。排坑與調(diào)音轉(zhuǎn)換慢、聲音不自然怎么辦問(wèn)題一轉(zhuǎn)得太慢慢的根源通常是引擎跑在 CPU 上。按優(yōu)先級(jí)排查先確認(rèn) GPU 被識(shí)別了——終端啟動(dòng)日志會(huì)打印檢測(cè)到的設(shè)備有卡卻沒(méi)用上可用--device CUDA手動(dòng)指定有 GPU 就保持默認(rèn) XTTSv2接近實(shí)時(shí)輸出純 CPU 機(jī)器換輕量引擎引擎音質(zhì)CPU 速度適合誰(shuí)XTTSv2默認(rèn)高接近真人慢建議 GPU追求質(zhì)量、要語(yǔ)音克隆Bark高表現(xiàn)力強(qiáng)慢需要情緒、語(yǔ)氣變化YourTTS中等官方形容為Siri 水平快純 CPU 機(jī)器注意不支持零樣本克隆Tacotron2中等快純 CPU 機(jī)器只求能聽(tīng)依賴裝不上、環(huán)境沖突直接用 Docker 鏡像官方說(shuō)明它是完全自包含的一條docker run命令就能跑 GUI 或 headless 模式docker-compose.yml 已備好問(wèn)題二聲音不自然、聽(tīng)著像機(jī)器人念稿溫度先試 0.6–0.8 區(qū)間微調(diào)太高會(huì)開(kāi)始編詞太低會(huì)機(jī)械Top-p 收到 0.8 左右Top-k 適當(dāng)調(diào)小輸出更可預(yù)測(cè)、生成還更快換個(gè)預(yù)調(diào)好的預(yù)設(shè)模型試試--fine_tuned指向官方預(yù)設(shè)如不同口音/風(fēng)格的 XTTSv2 微調(diào)模型倉(cāng)庫(kù)里的 lib/conf_models.py 能看到引擎與默認(rèn)參數(shù)對(duì)照音頻被截?cái)喙俜浇ㄗh直接提 Issue 反饋——團(tuán)隊(duì)需要各語(yǔ)言的句子切分樣本來(lái)修這個(gè)邏輯其他高頻疑問(wèn)想邊轉(zhuǎn)邊推流加--abs_url等參數(shù)可直接寫入 Audiobookshelf 服務(wù)器掃描版 PDF、純圖片的 JPG 也能轉(zhuǎn)內(nèi)置 OCR光學(xué)字符識(shí)別會(huì)先把圖里的字認(rèn)出來(lái)想自己訓(xùn)練一個(gè)專屬聲音模型倉(cāng)庫(kù)內(nèi)置了 components/Universal_TTS_Finetune/ 訓(xùn)練組件和 Notebooks/finetune/xtts/colab_xtts_finetune_webui.ipynb 在線訓(xùn)練筆記本錄 1–5 分鐘素材就能起步去哪找免費(fèi)書以及進(jìn)階方向素材從哪來(lái)首選公共領(lǐng)域書庫(kù)——古登堡計(jì)劃Project Gutenberg上的經(jīng)典作品沒(méi)有版權(quán)限制放心轉(zhuǎn)。倉(cāng)庫(kù)自帶的 ebooks/tests/ 目錄里還有 80 多個(gè)語(yǔ)言版本的測(cè)試電子書.azw3 對(duì)應(yīng).txt想先試試某個(gè)語(yǔ)言的合成效果從這兒拿一本最方便。進(jìn)階三條路想要自動(dòng)化的停頓與換聲研究 components/E2A-SML/它負(fù)責(zé)把 SML 標(biāo)簽自動(dòng)加進(jìn)書里想擁有只屬于你的聲音模型用 Notebooks/colab_ebook2audiobook.ipynb 在無(wú)卡環(huán)境免費(fèi)跑轉(zhuǎn)換用 Universal_TTS_Finetune 訓(xùn)練專屬模型后再通過(guò)--custom_model上傳zip 包需含 config.json、model.pth、vocab.json、ref.wav想改默認(rèn)行為lib/conf.py 里所有默認(rèn)值輸出格式、聲道、目錄都集中在那一段注釋為CAN BE MODIFIED的區(qū)域官方建議改前先備份原文件現(xiàn)在就可以動(dòng)手了把倉(cāng)庫(kù)拉下來(lái)從 ebooks/tests/ 挑一本測(cè)試書用默認(rèn)設(shè)置轉(zhuǎn)一首有聲書出來(lái)聽(tīng)聽(tīng)——從第一聲開(kāi)口到批量生產(chǎn)線中間只隔著一個(gè)下午?!久赓M(fèi)下載鏈接】ebook2audiobookGenerate audiobooks from e-books, voice cloning 1158 languages!項(xiàng)目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考