
小智 xiaozhi-esp32把一塊 ESP32 做成能聽會說的 AI 語音助手【免費下載鏈接】xiaozhi-esp32An MCP-based chatbot | 一個基于MCP的聊天機器人項目地址: https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32對著桌上的小音箱喊一聲“你好小智”它聽完、想清楚再用自己的聲音把答案讀給你聽——中間不需要你搭建服務(wù)也不需要會多少代碼。開源項目小智xiaozhi-esp32做的就是這件事讓一塊帶麥克風(fēng)的 ESP32 開發(fā)板變成一個能聽懂指令、能接大模型、還能把回答朗讀出來的語音 AI 助手。它是如何工作的整個過程可以拆成三段。第一段發(fā)生在板子本地麥克風(fēng)負責(zé)拾音喚醒模型也在本地跑只有當(dāng)你喊出喚醒詞時設(shè)備才真正“醒來”平時它只是安靜待命不占用網(wǎng)絡(luò)。第二段把活交給了云端。設(shè)備醒來后把 Opus 編碼的語音流通過 WebSocket 或 MQTT UDP 發(fā)到服務(wù)器由流式 ASR 把聲音轉(zhuǎn)成文字、大模型Qwen、DeepSeek 這類生成回答、再經(jīng) TTS 合成語音如果走 Realtime 端到端語音模型則跳過文字環(huán)節(jié)直接語音對語音。第三段是回話。合成好的語音流傳回板子由揚聲器播出來。帶回聲消除AEC的硬件還能做到邊聽邊說不需要你像打電話那樣等對方說完。先選一塊板子先搞清楚三個部件各管什么麥克風(fēng)管“聽”沒有它設(shè)備收不到你的聲音揚聲器管“說”決定你聽到的回答清不清晰屏幕OLED 或 LCD管“看”顯示狀態(tài)、表情和電量不是必須但能提升體驗。項目目前已覆蓋 138 個板卡目錄、171 個固件發(fā)布變體從 ESP32、C3、C5、C6 到 S3、P4 芯片平臺都有對應(yīng)支持。常見選擇可以按用途和預(yù)算來定開發(fā)板特點適合場景立創(chuàng)·實戰(zhàn)派 ESP32-S3集成度高的成品板性價比突出第一次上手想少折騰樂鑫 ESP32-S3-BOX3官方參考板屏幕、麥克風(fēng)、按鍵齊全想體驗完整交互M5Stack CoreS3工業(yè)級品質(zhì)生態(tài)成熟已經(jīng)熟悉 M5 生態(tài)AtomS3R Echo Base體積小、擴展靈活想做成桌面小音箱面包板 DIY自己連線組裝想動手、預(yù)算最省如果你只是先跑通一次對話優(yōu)先選帶現(xiàn)成麥克風(fēng)與揚聲器的成品板省去接線的坑想自己焊線、控制成本再考慮面包板方案。5 分鐘跑起來第一條路是直接用預(yù)編譯固件不搭開發(fā)環(huán)境。步驟是下載對應(yīng)板卡的固件二進制 → 用燒錄工具寫入 → 首次開機完成配網(wǎng) → 注冊一個官方服務(wù)器賬號。固件默認接入 xiaozhi.me個人用戶注冊后即可免費使用 Qwen 實時模型因此配網(wǎng)時只需準備兩項信息Wi-Fi 名稱SSIDHome_5G Wi-Fi 密碼********設(shè)備支持熱點和 BluFi 兩種配網(wǎng)方式開機后按提示連接熱點、把上面兩行填進去即可憑據(jù)會被存進板子的 NVS下次開機自動連接。如果你之后想自己改代碼編譯再搭環(huán)境不遲用 Cursor 或 VSCode 裝 ESP-IDF 插件首選 v6.0 及以上的穩(wěn)定版推薦 v6.0.2Linux 比 Windows 編譯更快也更省心。需要自己編譯時先拉源碼git clone https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32然后在 IDE 里選擇對應(yīng)板卡的目錄選擇目標(biāo)芯片執(zhí)行配置與編譯即可。第一次對話與常見故障先按這個順序驗證一步步排除上電指示燈、屏幕有無反應(yīng)→ 聯(lián)網(wǎng)是否連上 Wi-Fi、是否獲取到地址→ 喚醒喊喚醒詞設(shè)備是否亮起→ 對話說一句話看是否朗讀回答。哪一步卡住問題大概率就在那一步?,F(xiàn)象可能原因修復(fù)辦法連不上 Wi-FiSSID/密碼輸錯或 5G 信號弱、超出范圍核對憑據(jù)改用 2.4G 網(wǎng)絡(luò)靠近路由器后重連喚醒詞不應(yīng)答環(huán)境噪聲大或麥克風(fēng)接線/增益不對換安靜位置再說檢查板卡麥克風(fēng)與喚醒模型配置燒錄失敗USB 線只供電、串口驅(qū)動缺失、板子沒進下載模式換數(shù)據(jù)線裝對應(yīng) USB 驅(qū)動按住 BOOT 再按 RST 進下載態(tài)說話有回聲、自己聽自己麥克風(fēng)離揚聲器太近、缺少 AEC拉開麥克風(fēng)與喇叭距離選用帶回聲消除的硬件進階玩法用 MCP 擴展設(shè)備與云端能力MCPModel Context Protocol是小智用來“多端控制”的協(xié)議它把設(shè)備能力包裝成一個個可被大模型調(diào)用的工具。設(shè)備端可以注冊本地工具比如音量調(diào)節(jié)、燈光、電機、GPIO讓大模型直接指揮你的硬件云端則能反過來擴展模型本身的能力例如智能家居控制、桌面操作、知識搜索、郵件收發(fā)。想了解交互流程可以看 MCP 用法說明設(shè)備端工具的實現(xiàn)方式在 MCP 協(xié)議文檔。換喚醒詞、字體和界面喚醒詞、聊天背景、表情和字體都支持自定義并可通過網(wǎng)頁端在線修改。界面本身提供 38 種語言語音提示優(yōu)先用本地化資源缺失時自動回退到英文。配合 v2 分區(qū)引入的 assets 分區(qū)這些資源可以隨固件之外的方式從網(wǎng)絡(luò)更新不必每次重新燒錄。網(wǎng)絡(luò)、電源與固件的日常建議網(wǎng)絡(luò)穩(wěn)定比追求高速更重要5G 頻段信號覆蓋不足時優(yōu)先切回 2.4G。帶電池的設(shè)備注意電量顯示與電源管理長時間閑置會進入省電狀態(tài)。固件方面建議定期更新但更新前先讀下面的分區(qū)說明避免白忙一場。寫在最后遇到卡點時先從項目文檔入手WebSocket 協(xié)議、MQTT UDP、自定義開發(fā)板指南 覆蓋了我們這里沒展開的細節(jié)更細的問題可以在倉庫的 Issues 或官方社群里提問。最后提醒一句v2 與 v1 的分區(qū)表不兼容無法通過 OTA 直接升級持有 v1 硬件的用戶需要用 v2 分區(qū)表手動重新燒錄一次固件才能完成遷移?!久赓M下載鏈接】xiaozhi-esp32An MCP-based chatbot | 一個基于MCP的聊天機器人項目地址: https://gitcode.com/GitHub_Trending/xia/xiaozhi-esp32創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考