轉(zhuǎn)寫 13 分鐘音頻)
faster-whisper 語音識別教程如何在 1 分鐘內(nèi)轉(zhuǎn)寫 13 分鐘音頻【免費下載鏈接】faster-whisperFaster Whisper transcription with CTranslate2項目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 把長音頻轉(zhuǎn)成文字比原版 Whisper 更快、更省內(nèi)存。它是基于 CTranslate2 重寫的語音識別引擎最高可達原版 4 倍速度。如果你還在跑原版 Whisper 做批量轉(zhuǎn)寫這篇教程適合你。用原版 Whisper 轉(zhuǎn)寫時你會撞上這 3 個問題跑原版 large-v2 模型13 分鐘音頻要 2 分 23 秒顯存占用 4708MBCPU 上 small 模型更慢要 6 分 58 秒。原版還要求系統(tǒng)單獨安裝 FFmpeg容器環(huán)境經(jīng)??ㄔ谝蕾嚿?。faster-whisper 換用 CTranslate2 推理引擎并內(nèi)置 PyAV 解碼音頻不需要在系統(tǒng)裝 FFmpeg。? 3 分鐘安裝并完成第一次轉(zhuǎn)錄要求 Python 3.9一條命令安裝pip install faster-whisper按模型名加載時對應(yīng)的 CTranslate2 權(quán)重會自動從 Hugging Face Hub 下載。最小可運行示例from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) for segment in segments: print(f[{segment.start:.2f}s - {segment.end:.2f}s] {segment.text})注意segments是生成器進入循環(huán)后轉(zhuǎn)寫才真正開始。3 個值得深挖的核心能力VAD 語音活動檢測先跳過靜音再轉(zhuǎn)寫傳vad_filterTrue轉(zhuǎn)寫前用內(nèi)置 Silero VAD 切掉靜音段。默認策略保守只移除超過 2 秒的靜音想切得更碎可用vad_parameters把min_silence_duration_ms調(diào)低到 500。參數(shù)定義見 faster_whisper/vad.py。批量轉(zhuǎn)寫默認開啟 VAD。詞級時間戳精確到每個單詞word_timestampsTrue會把每個片段拆成單詞每個單詞帶起止時間適合做字幕對齊、關(guān)鍵詞定位。批量推理GPU 吞吐明顯提升BatchedInferencePipeline可直接替換WhisperModel.transcribe。以 distil-large-v3 在 GPU 上batch_size16為例耗時從 46 分 12 秒降到 25 分 50 秒transformers 實現(xiàn)跑同一任務(wù)WER 為 13.527 對 14.801。更多參數(shù)可在 faster_whisper/transcribe.py 中查閱。 基準對比耗時與內(nèi)存差多少GPU 端large-v2RTX 3070 Ti 8GBCUDA 12.4均為 13 分鐘音頻實現(xiàn)精度耗時顯存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperint859s2926MBfaster-whisperbatch_size8int816s4500MBCPU 端small 模型i7-12700K8 線程原版 6 分 58 秒faster-whisper fp32 為 2 分 37 秒int8 為 1 分 42 秒內(nèi)存從 2335MB 降到 1477MB。 5 條部署建議compute 類型、CUDA 版本與批大小GPU 場景優(yōu)先compute_typefloat16顯存吃緊時換int8_float16。僅用 CPU建議compute_typeint8small 模型下耗時減半內(nèi)存省 780MB1477MB 對 2257MB。CUDA 版本不匹配最新版 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 用戶降級到 ctranslate23.24.0。倉庫提供基于 nvidia/cuda 鏡像的部署參考見 docker/Dockerfile。長音頻批處理批量會推高內(nèi)存int8 從 2926MB 升到 4500MB按空閑顯存定 batch_size。做橫向?qū)Ρ却_保 beam size 一致faster-whisper 默認 beam_size5原版默認是 1否則數(shù)據(jù)不可比。3 個常見落地場景會議錄音轉(zhuǎn)寫VAD 自動跳過靜音段算力不浪費在無聲音上視頻字幕生成詞級時間戳讓字幕對齊精確到單詞多語言語料本地化自動檢測語言并返回置信度單條音頻還是批量任務(wù)faster-whisper 都用更少的時間和內(nèi)存給出同樣的文字結(jié)果把現(xiàn)有轉(zhuǎn)寫流水線里的引擎換掉即可?!久赓M下載鏈接】faster-whisperFaster Whisper transcription with CTranslate2項目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考