與實時交互:語音 Agent 與 Computer Use 的架構分析)
多模態(tài)與實時交互語音 Agent 與 Computer Use 的架構分析前幾章構建的 Agent 與世界的交互是輪流的用戶說完一句Agent 想一段、調用幾個工具再回一句在它思考的這段時間里世界被默認為靜止的。這個前提如此自然以至于很少被當成一個假設寫出來。然而真實環(huán)境不會等模型作出反應郵件在思考時到達用戶在說話途中插話頁面在兩次截圖之間已經變了樣。本文圍繞模態(tài)和觸發(fā)時機兩個維度對 Agent 交互架構的擴展進行技術分析涵蓋異步事件驅動、語音交互范式、Computer Use 以及機器人操作。兩個擴展維度把觀察空間和動作空間攤開會發(fā)現(xiàn)它們各有兩個可以擴展的方向模態(tài)決定觀察和動作的形式Agent 是只讀文本還是也能聽見聲音、看見屏幕、感知力矩是只能輸出 token還是也能發(fā)聲、點擊、驅動關節(jié)。觸發(fā)時機決定觀察和動作的節(jié)奏觀察是 Agent 主動去取還是世界主動推來動作是必須在一個回合內做完還是可以跨越回合、中途被打斷、被更緊急的事?lián)屨?。尺度場景觀察側的變化動作側的變化秒-天異步與事件驅動會被外部事件主動喚醒的 Agent動作跨回合先發(fā)起后續(xù)靠事件收尾10 毫秒-1 秒語音邊說邊聽不等一句說完邊想邊說可被打斷亞秒-秒Computer Use屏幕在兩幀之間持續(xù)變化動作后必須重新確認現(xiàn)實是否仍符合計劃毫秒機器人傳感器連續(xù)回流動作分塊一次規(guī)劃一小段可被搶占異步與事件驅動當世界主動找上門核心矛盾訓練同步部署異步LLM 的訓練范式假設同步——發(fā)出工具調用后下一條消息必須是工具結果。而真實部署要求異步——用戶隨時可能打斷多個任務可能并發(fā)推進外部事件可能在工具尚未返回時就抵達。這一訓練同步/部署異步的矛盾貫穿了異步 Agent 架構的所有工程取舍。事件驅動的異步 Agent 架構不再主動反復檢查有沒有新消息輪詢效率低而是在新消息到達時自動觸發(fā)處理邏輯。所有的輸入、輸出、思考過程和外部交互都被統(tǒng)一建模為事件流。基于緊急度的三種處理策略一個 Agent 實例可能同時面對多個事件用戶的新消息、工具返回的結果、定時器到期、另一個 Agent 的協(xié)作請求。三種處理策略的區(qū)別在于對待安全點的方式取消式處理用于緊急事件主動中斷當前步驟把這一刻變成可以消費新事件的邊界。系統(tǒng)停止當前操作清空待處理隊列將所有事件一次性追加到軌跡末尾立即重新調用 LLM。這對應于用戶在 Agent 執(zhí)行可能錯誤的操作時輸入停我說錯了的場景。隊列式處理用于常規(guī)事件不打斷當前操作等待當前操作完成后將所有事件一次性追加。例如 Agent 調用搜索工具后用戶補充只看最近一個月的結果搜索結果返回時兩個事件一起呈現(xiàn)給 LLM避免不必要的往返。并行處理用于獨立的輕量級查詢如今天天氣怎么樣。既不打斷主任務也不讓用戶等太久在并行推理會話中獨立執(zhí)行。工程權宜模擬同步的異步實現(xiàn)核心思想是在沒有打斷發(fā)生的常態(tài)下讓 LLM 看到標準的同步軌跡只在打斷時才插入占位符來修復格式。有五條關鍵規(guī)則LLM 輸出后立即記錄 assistant message工具調用完成時才記錄 tool result工具執(zhí)行中的打斷需要占位符LLM 思考中的打斷直接丟棄當前思考非打斷事件進入隊列等待批處理。這套方案的核心優(yōu)勢是常態(tài)下 LLM 看到的是完美的同步軌跡最大程度保證了思考質量。但仍存在加劇幻覺的風險盡管占位符明確說明工具尚未完成系統(tǒng)仍可能在后續(xù)思考中編造一個工具結果基于虛構的結果做出不恰當?shù)臎Q策。語音從級聯(lián)到全雙工的范式演進語音的價值不只是把文字換成聲音。正常說話的速度約為打字的四倍而且不占用雙手與視線因此它天然適合把 Agent 放進持續(xù)工作、隨時可能被打斷的輸入輸出回路。三種交互范式的主線是如何擺脫輪流說話和 VAD語音活動檢測對發(fā)言權的猜測。范式核心結構主要優(yōu)勢主要限制級聯(lián)VAD - ASR - LLM - TTS模塊清晰、易替換、易調試延遲累積副語言信息在接口處丟失端到端 Omni原生音頻輸入輸出按輪次交互延遲較低能保留語氣、情緒和環(huán)境聲仍依賴輪次訓練和調試成本較高全雙工原生音頻輸入輸出持續(xù)聽、說和決策支持重疊說話、自然打斷和連續(xù)流模型訓練、控制和評估都更復雜級聯(lián)流水線及其優(yōu)化絕大多數(shù)商業(yè)語音助手基于串行流水線VAD 判斷用戶何時說完ASR 把音頻轉成文字LLM 理解并生成回復TTS 再把文字念出來。模塊化讓每個組件可以獨立優(yōu)化但每一級都可能增加等待時間。級聯(lián)方案有三個問題延遲累積必須等待一段靜音才能確認說完、信息丟失有聲/無聲二值信號無法表達猶豫、情緒和環(huán)境聲、上下文被切斷專有名詞可能被分片識別而出錯。流式感知是一種保留模塊化分工前提下的優(yōu)化方案ASR 邊聽邊轉LLM 推測執(zhí)行TTS 增量合成讓各階段盡早產出增量結果。全雙工交互模型Omni 仍然把對話分成用戶說和模型說兩個時段但同聲傳譯等任務要求兩者重疊進行。全雙工模型不再預設輪次而是持續(xù)聽、持續(xù)說并不斷決定繼續(xù)、停頓、打斷或調用工具。Thinking Machines Lab 將這類路線稱為交互模型交互性不再依靠 VAD 等外部 harness 拼裝實現(xiàn)而是內建在模型中。OpenAI 的 GPT-Live 則把全雙工路線帶到生產規(guī)模??炻伎挤蛛x與端到端統(tǒng)一的取舍交互表現(xiàn)和智能上限是兩個維度前臺模型要在用戶仍然在線時回應后臺模型可以花更多時間思考。三種方案是設計取舍快思考回應慢思考回答、快思考交互慢思考提醒、端到端思考與表達統(tǒng)一??炻蛛x有一個重要的工程優(yōu)勢它能直接承接慢模型的迭代紅利。前臺快模型只負責低延遲地傾聽、應答和維持對話后臺慢模型負責推理、規(guī)劃和工具調用更強的思考模型發(fā)布后只需替換后臺模型不必重新訓練整套實時語音系統(tǒng)。統(tǒng)一路線則把推理與交互綁定在同一個訓練周期中每次升級都要重新兼顧智能水平、響應延遲和表達自然度。Computer UseGUI 自動化 Agent語音把時機軸推到了毫秒級但它的觀察仍是一維的聲音流。Computer Use 把同一個問題搬上二維的屏幕觀察變成持續(xù)變化的像素動作變成坐標上的點擊與輸入。感知-思考-行動循環(huán)Computer Use 的核心是一個感知-思考-行動循環(huán)Agent 截取當前屏幕畫面多模態(tài)模型接收截圖和任務指令輸出一個具體動作執(zhí)行層在真實環(huán)境中執(zhí)行該動作等待界面響應后再次截圖進入下一輪循環(huán)。這里要區(qū)分看懂界面和完成任務。前者更接近多模態(tài)理解能力可以用一次截圖問答來測量后者則要求模型把理解和生成動作放進閉環(huán)處理頁面加載、狀態(tài)變化、誤操作和不可逆后果。Computer Use 的難點不只是讓模型在截圖上答對而是讓它在每一步之后重新確認現(xiàn)實是否仍符合計劃。動作空間設計Anthropic 的參考實現(xiàn)把完整交互能力分成三類工具GUI 操作工具鼠標移動/點擊/拖拽、鍵盤輸入、截圖等、命令執(zhí)行工具持久 bash 終端會話、文件編輯工具基于字符串匹配的安全編輯。這是一個清晰的動作空間設計但不是必須遵守的私有協(xié)議只要 Harness 能把同樣的截圖、動作約束和執(zhí)行結果轉換成目標模型支持的消息與結構化輸出不同模型都可以驅動同一個循環(huán)。視覺定位的三條路線在循環(huán)的每一輪中模型需要在截圖中準確定位目標元素。當前主要有兩條思路把定位變成選擇題先把界面元素標注好編號模型只需從中選一個。有兩種實現(xiàn)方式——純視覺標注Set-of-Mark用分割模型在像素上切出候選區(qū)域和結構化元素索引DOM/Accessibility Tree直接讀取界面自帶的結構。后者的優(yōu)勢是把開放式的在截圖中找到按鈕并預測坐標轉化為封閉式的從已標注好的元素中選一個就像考試中選擇題比填空題更容易答對。純坐標預測不做任何標注直接讓模型輸出坐標。以 SeeClick 和 Claude 的 computer use 為代表在海量 GUI 截圖和元素位置的配對數(shù)據上訓練視覺模型讓它學會將自然語言描述直接映射到截圖中的精確坐標。模型對坐標的理解高度依賴訓練時使用的分辨率因此需要在工具層實現(xiàn)雙向坐標縮放機制。三條路線的選擇邏輯結構化信息可得時優(yōu)先用 DOM/Accessibility Tree 索引定位最精確穩(wěn)定不可得時原生桌面軟件、Canvas/WebGL 渲染的界面、游戲可以用視覺標注或坐標預測。Computer Use 的世界模型傳統(tǒng) Computer Use 假設屏幕是靜止的——截一張圖、想一步、點一下再截下一張圖??涩F(xiàn)實里的屏幕會放視頻、會彈出轉瞬即逝的通知、會播放會議里的人聲。觀察接口AOI通過屏幕關鍵幀截圖、音量門控的語音轉寫和文字描述畫面等技術把連續(xù)的環(huán)境觀察轉換成模型便于處理的離散事件。更進一步世界模型讓 Agent 能夠在行動前預測桌面接下來可能變成什么從而實現(xiàn)類似于人類的推測執(zhí)行機制如果實際變化與預期一致就沿著原定計劃繼續(xù)執(zhí)行只有發(fā)現(xiàn)頁面狀態(tài)偏離預期才停下來重新觀察和規(guī)劃。2026 年 Induction Labs 公布的 Photon-1 展示了這條路線的一種實現(xiàn)把每幀壓縮為離散的潛在 token自回歸預測動作之后的下一狀態(tài)表示。移動端的生態(tài)壁壘Computer Use 在移動端面臨的主要挑戰(zhàn)往往不是技術差異而是生態(tài)壁壘。傳統(tǒng)互聯(lián)網應用的核心變現(xiàn)邏輯是流量與注意力用戶刷信息流時看到廣告瀏覽頁面時產生沖動消費。當 Agent 代替用戶操作時這條變現(xiàn)鏈路被徹底繞過AI 不會關注廣告也不會沖動消費直奔目標完成任務就走。這意味著 Computer Use 面對的不僅是 CAPTCHA 等技術對抗更是一個結構性的利益沖突。機器人操作從仿真到真機機器人操作比看圖回答問題難得多。模型不但要看懂畫面還要在真實世界里連續(xù)做出動作而且每個動作都會改變下一刻的情況。機器人系統(tǒng)通常把不同時間尺度的工作分開任務目標分鐘級、長程規(guī)劃秒到分鐘、基本技能約 1-3 秒、VLA/技能策略約 1-10 Hz 推理、底層控制與安全層約 50-1000 Hz。這種分工的關鍵是把任務順序和眼前動作分開否則高層模型的推理延遲會拖慢底層控制。VLAVision-Language-Action模型接收當前畫面和技能指令輸出機器人接下來要執(zhí)行的動作。但 VLA 有幾個局限訓練數(shù)據有限機器人演示遠少于互聯(lián)網文本和圖像數(shù)據、只學會模仿不一定懂后果、機器人各不相同、觀察可能過時。因此需要世界模型幫助判斷做了之后可能發(fā)生什么。從仿真環(huán)境到真實機器人并不是再換一種控制器而是要處理兩個環(huán)境之間的差異訓練時使用遙操作數(shù)據、視頻數(shù)據或仿真交互數(shù)據部署時同一個物體出現(xiàn)在不同的背景、光照、相機位置和遮擋關系中機械臂還會遇到不同的摩擦、傳感器噪聲和執(zhí)行器延遲。小結順著模態(tài)和執(zhí)行時機兩根軸看異步與事件驅動把觀察從Agent 主動去取擴展為世界主動推來模態(tài)沒變變的只有時機。語音把尺度壓到毫秒三種范式的演進主線就是從輪流說話逐步走向持續(xù)聽說。Computer Use 把同一個閉環(huán)搬到屏幕上瓶頸已從能否完成任務擴展到操作效率、連續(xù)視覺理解和動作后的狀態(tài)確認。機器人則把它推到物理世界動作分塊在平滑性與反應速度之間取舍而最終是否完成仍必須由新的觀察來判定。四節(jié)共享同一條控制骨架持續(xù)感知、判斷當前狀態(tài)與時機、選擇回復或動作、讓輸出進入環(huán)境、觀察反饋、繼續(xù)或修正或重試或停止或重新規(guī)劃。也共享同一組原語——喚醒、安全點、取消、搶占、快慢分離。這些原語在不同時間尺度上的實現(xiàn)差異主要由環(huán)境變化的速度、動作的可逆性和觀察的獲取成本決定。本文內容整理自開源技術書《深入理解 AI Agent》(bojieli/ai-agent-book)采用 Apache 2.0 許可證