
Qwen-Agent 流式輸出接入 vLLM 本地教程【免費下載鏈接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.項目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent在 Qwen-Agent 的代碼解釋器里輸入一個任務(wù)屏幕上 Thought、代碼和餅圖逐行長出來——這是框架接入本地 vLLM 模型服務(wù)并打開流式輸出通道后的效果。 先看效果服務(wù)跑起來后你看到的第一眼不是轉(zhuǎn)圈等待。提交任務(wù)后Chatbot 的回答、Thought 與 Action 代碼在瀏覽器里實時渲染寫作工作臺默認(rèn)端口 7864里的長文也是一段一段長出來。這個效果不依賴任何云 API背后是 OpenAI 協(xié)議的 stream 開關(guān)模型每生成一個 token服務(wù)端就立刻推一條增量消息。代碼解釋器與網(wǎng)頁問答共用同一套增量返回機(jī)制整個接入只有三步。圖1代碼解釋器中 Thought、Action、Observation 實時呈現(xiàn)代碼執(zhí)行后圖表隨即出現(xiàn)它解決了什么問題為什么請求-等待-全量返回會很慢傳統(tǒng)批量模式只有一條路請求、等待、拿到完整結(jié)果。當(dāng)一次回答包含數(shù)百行代碼時用戶在整段生成時間里看不到任何進(jìn)度回答越長等待感越重前端請求甚至可能先超時。streamTrue 的增量推送機(jī)制OpenAI 協(xié)議自帶 stream 開關(guān)。Qwen-Agent 的 oai 模型類型調(diào)用服務(wù)端時打開這個開關(guān)拿到的響應(yīng)是一個迭代器——模型每生成一個 token前端就收到一個增量塊。同一個循環(huán)里有兩種發(fā)法delta_streamTrue只發(fā)新增片段False則每次發(fā)送累積至今的完整內(nèi)容適合要求上下文完整的場景。具體實現(xiàn)見流式輸出核心實現(xiàn)。 動手接入第一步啟動 vLLM 服務(wù)pip install vllm python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen2.5-7B-Instruct \ --host 0.0.0.0 --port 8000這條命令在本地 8000 端口起一個 OpenAI 兼容端點對外地址即http://localhost:8000/v1。第二步把 Qwen-Agent 指到這個服務(wù)python run_server.py \ -m http://127.0.0.1:8000/v1 \ -k EMPTY \ -l Qwen/Qwen2.5-7B-Instruct-m是服務(wù)地址-k是密鑰本地服務(wù)無需真實密鑰填EMPTY即可-l是模型名。執(zhí)行后這些值會寫回服務(wù)端配置文件也可以直接改其中的model_server、api_key、llm三個字段。第三步打開瀏覽器驗證流式效果訪問http://127.0.0.1:7864的寫作工作臺提交一個任務(wù)??吹介L文在編輯器里一段一段長出來說明流式輸出已生效。圖2寫作工作臺的長文逐段在編輯器中生長思考過程與正文并排展示在代碼里效果一致對bot.run(messages)的返回值做增量迭代就能拿到一條條增量消息examples 目錄下的示例腳本演示了同樣的寫法。實測表現(xiàn)與取舍場景傳統(tǒng)模式優(yōu)化后差異首條文字出現(xiàn)時機(jī)模型生成完全部內(nèi)容后第一個 token 生成后立即感知等待從整段生成時間縮到首 token 時間單次響應(yīng)形態(tài)一次性完整消息按 token 分塊的增量消息前端隨到隨渲染工具調(diào)用過程中間過程要等全量返回推理過程增量推送工具參數(shù)逐塊拼接ReAct 風(fēng)格智能體可逐行展示思考鏈流式的收益主要體現(xiàn)在感知側(cè)token 生成的總時長不變出字速度仍由推理引擎和 GPU 決定。圖3代碼解釋器生成并執(zhí)行 Python 代碼工具調(diào)用的中間過程可實時看到需要付出的代價兩種發(fā)送模式不能隨意互換。完整模式delta_streamFalse每次累積整段文本消息體積隨回答長度增長前端渲染要整體替換超長輸出時默認(rèn)的增量模式更穩(wěn)。vLLM 是面向 GPU 的推理引擎本地部署需要兼容的 CUDA 環(huán)境純 CPU 機(jī)器可換 Ollama 等 OpenAI 兼容服務(wù)走同一個 oai 模型類型即可。多輪對話的流式消息中還包含推理過程reasoning_content前端若不區(qū)分字段思考文本和最終回答會混在同一框里。避坑 FAQQwen3 的工具調(diào)用參數(shù)要不要加用 vLLM 部署 Qwen3 或 QwQ 時不要加--enable-auto-tool-choice和--tool-call-parser hermes兩個參數(shù)因為 Qwen-Agent 會自行解析工具輸出加了反而重復(fù)解析Qwen3-Coder 則相反建議開啟內(nèi)建解析并搭配use_raw_api參數(shù)。詳見README_CN 的模型服務(wù)說明。連接被拒或 401 怎么排查model_server要填到/v1結(jié)尾的完整端點啟動腳本會把0.0.0.0自動改寫成127.0.0.1。本地服務(wù)不需要真實密鑰-k填EMPTY即可端口連不上時先確認(rèn) vLLM 進(jìn)程是否成功拉起。接入本地 vLLM 后流式輸出不再是云服務(wù)的專屬能力Qwen-Agent 指向任意 OpenAI 兼容端點即可復(fù)用整套增量渲染鏈路。延伸路徑流式實現(xiàn)源碼、服務(wù)端默認(rèn)配置?!久赓M下載鏈接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.項目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考