錄指南:免費(fèi)把錄音變成文字和字幕)
Buzz 完整本地離線音頻轉(zhuǎn)錄指南免費(fèi)把錄音變成文字和字幕【免費(fèi)下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 Whisper 的本地離線音頻轉(zhuǎn)錄工具跑在你自己的電腦上把錄音、視頻、YouTube 鏈接里的語音免費(fèi)轉(zhuǎn)成文字和帶時(shí)間軸的字幕全程不上傳、不聯(lián)網(wǎng)也能用。被錄音堆成山的日子該結(jié)束了你大概遇到過這樣的局面三個(gè)月的播客訪談原聲堆在文件夾里加起來二十個(gè)小時(shí)。自己敲字一分鐘音頻至少敲三分鐘算下來一周時(shí)間搭進(jìn)去丟給在線轉(zhuǎn)寫服務(wù)一小時(shí)十幾塊先不說文件得傳到別人服務(wù)器——而受訪對象明明交代過內(nèi)容不能上云。偏偏公司內(nèi)網(wǎng)還不穩(wěn)定排到一半任務(wù)斷了前功盡棄。Buzz 就是沖著貴、泄密、斷網(wǎng)就癱這三件事來的轉(zhuǎn)錄在你本機(jī)完成一分錢不花斷網(wǎng)照常跑。下面帶你從安裝到出字幕完整走一遍。它和在線轉(zhuǎn)寫服務(wù)的差別在哪先看一張表幾個(gè)關(guān)鍵維度一目了然維度在線轉(zhuǎn)寫服務(wù)Buzz數(shù)據(jù)去向上傳到第三方服務(wù)器始終留在本機(jī)費(fèi)用按時(shí)長計(jì)費(fèi)或訂閱開源免費(fèi)斷網(wǎng)時(shí)直接不可用完整可用硬件利用取決于對方服務(wù)器本機(jī) GPU/CPU 直接干活輸出形態(tài)平臺內(nèi)查看為主TXT / SRT / VTT 文件自由導(dǎo)出支撐這些差別的是三個(gè)可以單獨(dú)拎出來的底氣隱私是默認(rèn)狀態(tài)不是付費(fèi)選項(xiàng)。音頻從導(dǎo)入到出結(jié)果每一步都在你自己的磁盤上發(fā)生。商業(yè)會議、用戶訪談這類敏感素材不存在先傳上去再回來的環(huán)節(jié)。開源意味著免費(fèi)是長期的。代碼完全開放社區(qū)迭代活躍你踩到的坑大概率在下個(gè)版本就被修掉而不是一封工單等一周。后端選項(xiàng)給得很足。NVIDIA 顯卡走 CUDA 加速M(fèi)ac 走 Apple Silicon 優(yōu)化還有 Whisper.cpp 后端兼容 Vulkan、吃集成顯卡甚至純 CPU。沒有獨(dú)顯只是快慢問題不是能不能用的問題。五步跑通你的第一個(gè)轉(zhuǎn)錄任務(wù)第一步安裝。去下載對應(yīng)系統(tǒng)的安裝包Windows 雙擊安裝程序未簽名出現(xiàn)警告時(shí)選仍要運(yùn)行macOS 裝.dmgLinux 用 Flatpak 或 Snap 一條命令裝好。第二步把音頻丟進(jìn)來。Buzz 認(rèn) MP3、WAV、FLAC、MP4、AVI 這些主流格式導(dǎo)入入口有四個(gè)挑順手的工具欄上的按鈕、快捷鍵CtrlOmacOS 為 CmdO、直接把文件拖進(jìn)窗口或者粘貼一個(gè)YouTube 鏈接——它會自動拉取音頻進(jìn)流程做字幕不用再手動下載一遍。第三步配置任務(wù)。導(dǎo)入后面板里會展開任務(wù)類型、語言、模型、導(dǎo)出格式幾個(gè)選項(xiàng)后面一節(jié)細(xì)講第一次全用默認(rèn)也能跑。第四步點(diǎn)運(yùn)行。任務(wù)進(jìn)隊(duì)列開始處理進(jìn)度條在任務(wù)列表里實(shí)時(shí)更新多個(gè)文件排隊(duì)并發(fā)不用干等。第五步拿結(jié)果。狀態(tài)變成Completed后雙擊那一行打開轉(zhuǎn)錄查看器逐句文本帶時(shí)間戳可以搜索、可以跟著音頻播放對照、可以直接導(dǎo)出成文件。四個(gè)參數(shù)決定轉(zhuǎn)錄結(jié)果好壞任務(wù)類型轉(zhuǎn)錄還是翻譯。選轉(zhuǎn)錄輸出和原聲同語言選翻譯Buzz 會把非英語內(nèi)容直接轉(zhuǎn)成英文文本。做中英對照稿、給外文訪談出英文底稿就靠切換到翻譯。語言設(shè)置能手動就別自動。自動檢測大部分時(shí)候靠譜但混著口音、夾雜外語的音頻容易判錯(cuò)語言一錯(cuò)全錯(cuò)。事先知道錄音是什么語言就手動指定準(zhǔn)確率會穩(wěn)很多。模型大小速度和精度的天平。從 Tiny 到 Large 分好幾檔檔位在偏好設(shè)置的模型頁里已下載的顯示在列沒下載的可以一鍵補(bǔ)。日常材料 Small/Medium 是甜點(diǎn)區(qū)間Tiny/Base 快適合實(shí)時(shí)場景和低精度要求Large 準(zhǔn)重要內(nèi)容和專業(yè)術(shù)語多的材料值得等它。輸出格式TXT、SRT、VTT 可以多選。要純文字稿勾 TXT給視頻配字幕勾 SRT 或 VTT。勾選是獨(dú)立的一次處理可以同時(shí)產(chǎn)出三份文件省得重復(fù)跑。拉開差距的幾個(gè)進(jìn)階功能 字幕整形把一屏放不下的字幕救回來長錄音轉(zhuǎn)出的字幕常有兩個(gè)毛病一行太長觀眾讀不完或者一句被切成三行頻繁跳。打開轉(zhuǎn)錄查看器里的Resize設(shè)一個(gè)目標(biāo)最大長度它會按標(biāo)點(diǎn)和語義重新斷句把每行裁得整齊。開過詞級時(shí)間戳的轉(zhuǎn)錄還能更進(jìn)一步按停頓間隙合并碎字幕、按標(biāo)點(diǎn)拆長句、按最大長度強(qiáng)制分塊甚至統(tǒng)一延長每條字幕的停留時(shí)間。適配不同視頻平臺的字幕規(guī)范基本就是改這幾個(gè)數(shù)字的事。實(shí)時(shí)轉(zhuǎn)錄邊說話邊出字Buzz 能直接吃麥克風(fēng)輸入人還在說屏幕上文字已經(jīng)蹦出來了還能投到一個(gè)獨(dú)立的演示窗口里放大展示。線上會議邊開邊出紀(jì)要、課堂實(shí)時(shí)記筆記、直播加字幕都是它的典型主場。說話人識別多人對話各歸各位多人錄音最煩的是通篇分不清誰在說話。在轉(zhuǎn)錄查看器里點(diǎn)Identify speakersBuzz 會自動給不同發(fā)言者的句子打上標(biāo)簽還能試聽某位說話人的十秒片段確認(rèn)身份然后把Speaker 0改成對方的真名。勾選合并選項(xiàng)后同一人的連續(xù)句子會并成一段訪談?wù)碇苯邮〉粢话牍r(shí)。語音提取與降噪嘈雜環(huán)境的保險(xiǎn)絲環(huán)境雜、背景音樂重的時(shí)候轉(zhuǎn)錄前先勾提取語音Extract speech把人聲分離到獨(dú)立音軌再識別準(zhǔn)確率提升明顯。另外還有個(gè) DeepFilterNet 降噪插件轉(zhuǎn)錄前用模型把背景噪聲濾掉吵錄音也能救一救。讓 Buzz 替你值班監(jiān)控、插件和命令行文件夾監(jiān)控在偏好設(shè)置里指定一個(gè)監(jiān)控目錄之后新音頻文件一落進(jìn)去Buzz 自動開跑全程無人值守。每周固定更新的播客、攢了一堆待處理的課程錄音最適合交給它。插件系統(tǒng)Help → Plugins 里管理開關(guān)、排序、配參數(shù)都行。內(nèi)置插件包括AI 摘要轉(zhuǎn)錄完自動提煉要點(diǎn)走 OpenAI 兼容接口、字幕自動整形轉(zhuǎn)完直接按字幕規(guī)格重組、跳過已轉(zhuǎn)錄文件批量重跑時(shí)自動識別已完成項(xiàng)避免重復(fù)勞動、增強(qiáng)語言檢測用本地 Whisper 先判語言再轉(zhuǎn)錄、導(dǎo)出 DOCX結(jié)果直接變 Word 文檔、DeepFilterNet 降噪。要哪個(gè)開哪個(gè)。想看插件實(shí)現(xiàn)可以直接翻 buzz/plugins/。命令行給腳本黨留的后門批量任務(wù)和定時(shí)腳本都好用。完整參數(shù)見 docs/docs/cli.md。# 轉(zhuǎn)錄單個(gè)文件指定中文同時(shí)導(dǎo)出 SRT 字幕、VTT 和 TXT 三種格式 buzz add --task transcribe --language zh --srt --vtt --txt interview.mp3 # 用 Whisper.cpp 后端把法語訪談翻譯成英文 buzz add --task translate --model-type whispercpp --language fr interview-fr.mp3四類人四種用法照抄就行學(xué)生課程錄音導(dǎo)入 → 轉(zhuǎn)錄 時(shí)間戳 → 文字筆記復(fù)習(xí)時(shí)點(diǎn)哪句跳哪句多語言課程也能直接出字幕。視頻創(chuàng)作者成片視頻導(dǎo)入 → 轉(zhuǎn)錄 Resize 統(tǒng)一行寬 → 導(dǎo)出 SRT 進(jìn)剪輯軟件字幕環(huán)節(jié)從半小時(shí)手工活變幾分鐘自動活。職場人會議實(shí)時(shí)轉(zhuǎn)錄 說話人識別 → 結(jié)構(gòu)清晰的紀(jì)要當(dāng)場生成敏感內(nèi)容全程不出本機(jī)。研究者一文件夾訪談錄音 文件夾監(jiān)控 → 批量轉(zhuǎn)寫出說話人標(biāo)簽 → 文本直接進(jìn)內(nèi)容分析流程。把準(zhǔn)確率再提五點(diǎn)的實(shí)戰(zhàn)技巧先定模型再調(diào)別的。重要材料上 Large 檔日常材料 Small 起步同一份音頻先跑一遍小模型摸底確認(rèn)值得再換大模型重跑別一上來就全用大模型干等。讓硬件配得上模型。有 NVIDIA 顯卡就確認(rèn) CUDA 后端生效速度能快數(shù)倍Mac 直接走 Apple Silicon 優(yōu)化路徑純 CPU 環(huán)境模型降一檔體驗(yàn)更順。輸入先做減法。錄音時(shí)盡量安靜、音量適中事后補(bǔ)救就勾提取語音或開降噪插件噪聲少一分錯(cuò)字少一片。把專有名詞塞進(jìn)初始提示詞。高級設(shè)置里的 Initial prompt 框填入人名、地名、專業(yè)術(shù)語這些詞的識別率肉眼可見地漲技術(shù)講座和醫(yī)學(xué)訪談尤其受益。批量任務(wù)組合拳。文件夾監(jiān)控負(fù)責(zé)進(jìn)料跳過已轉(zhuǎn)錄插件負(fù)責(zé)去重小模型先過一遍、大模型挑重點(diǎn)重跑——三招疊上去批量處理的等待時(shí)間能砍掉大半。常見疑問速答B(yǎng)uzz 必須聯(lián)網(wǎng)嗎不用。所有處理都在本機(jī)只有你主動選 OpenAI API 后端時(shí)才需要網(wǎng)絡(luò)。支持多少種語言99 種以上中、英、日、法、德等主流語言全覆蓋識別和翻譯都支持。處理速度如何取決于音頻長度、模型大小和硬件。有 GPU 的機(jī)器通常能做到接近實(shí)時(shí)甚至更快慢就換 Whisper.cpp 后端或降一檔模型。音頻有長度限制嗎沒有硬性限制幾秒鐘的語音到幾小時(shí)的長錄音都能處理。離線電腦怎么裝在聯(lián)網(wǎng)電腦上把模型下好整份拷到離線機(jī)器的相同緩存目錄偏好設(shè)置里可一鍵打開該目錄之后斷網(wǎng)照常轉(zhuǎn)錄。收尾Buzz 做的其實(shí)不只是轉(zhuǎn)文字這件事它把轉(zhuǎn)錄從一項(xiàng)要花錢、要上傳、看網(wǎng)絡(luò)臉色的外包活變成了你電腦里一項(xiàng)隨時(shí)可用、完全可控的能力。錄音不再只是躺在硬盤里、再也不會被第二遍翻出的文件而是可搜索、可剪輯、可進(jìn)工作流的文字資產(chǎn)?,F(xiàn)在就把 Buzz 裝上丟進(jìn)你第一段落灰的錄音——進(jìn)度條走完的那一刻你會明白這一下午值了?!久赓M(fèi)下載鏈接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/buz/buzz創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考