色五月色开心色婷婷色丁香,五月婷婷丁香花综合网,婷婷丁香五月激情综合在线,五月婷婷六月丁香动漫,婷婷丁香五月激情综合在线,丁香花中文字幕在线观看,播五月色五月开心五月网,开心激情综合网,狠狠色丁香婷婷综合最新地址,丁香视频在线观看,狠狠做六月爱婷婷综合av,久久激情五月丁香伊人

ARTICLE DETAIL

資訊詳情

深耕商務(wù)建站與企業(yè)官網(wǎng)運營的一線實戰(zhàn)洞察。

MCP-Bench評測實踐:從零搭建工具調(diào)用型Agent評測環(huán)境

MCP-Bench評測實踐:從零搭建工具調(diào)用型Agent評測環(huán)境 在實際 LLM 項目中Agent 的能力邊界往往不由模型參數(shù)單獨決定而是取決于它能不能在一連串不確定環(huán)境里穩(wěn)定地把外部工具用起來。MCP-Bench 這類以“復(fù)雜真實世界任務(wù)”為對象的工具調(diào)用型 Agent 基準(zhǔn)正是為了回答這個問題而出現(xiàn)的任務(wù)不是簡單問答而是讀取日志、查詢數(shù)據(jù)庫、調(diào)用 API、根據(jù)中間結(jié)果糾正動作的多步流程。協(xié)議層面用 MCP 統(tǒng)一工具接入評估層面用一組可打分、可復(fù)現(xiàn)、可歸因的任務(wù)去測量不同模型和 Agent 框架的實際表現(xiàn)這正是 MCP-Bench 的核心思路。這篇文章以 MCP-Bench 的評測主線展開。先解釋為什么工具調(diào)用型 Agent 需要獨立基準(zhǔn)再拆解 MCP 協(xié)議的工具調(diào)用鏈路與評測任務(wù)設(shè)計要點隨后從零搭建最小可運行評測環(huán)境實現(xiàn)任務(wù)定義、工具執(zhí)行、結(jié)果評分和日志采集最后討論指標(biāo)讀取、高頻故障定位以及把本地 Demo 擴展成生產(chǎn)級評測時該補哪些能力。適合正在做 Agent 評測、準(zhǔn)備接入 MCP 工具或者想在自己項目中量化 LLM 工具調(diào)用質(zhì)量的開發(fā)者閱讀。1. 工具調(diào)用型 Agent 為什么需要獨立的評測基準(zhǔn)1.1 QA 正確率衡量不了“會不會用工具”傳統(tǒng)大模型評測通常把模型當(dāng)作知識問答器給輸入比輸出算正確率。這種模式對事實記憶、推理能力、文本生成質(zhì)量有效但對 Agent 場景不夠。Agent 的產(chǎn)出不是一個靜態(tài)答案而是一串動作序列判斷當(dāng)前缺什么信息決定調(diào)用哪個工具解析返回結(jié)果再決定下一步。同一個任務(wù)兩個模型可能都完成了目標(biāo)但一個用了 3 次工具調(diào)用另一個用了 20 次一個能處理工具返回的異常格式另一個直接卡死。這種差異無法用選擇題正確率體現(xiàn)。所以工具調(diào)用型 Agent 需要獨立基準(zhǔn)。它要測量的是模型在“決策-行動-觀察”循環(huán)中的綜合能力而不是單次生成能力。MCP-Bench 這類基準(zhǔn)把這種循環(huán)固化成標(biāo)準(zhǔn)任務(wù)讓不同模型和框架在同樣條件下跑同樣的流程結(jié)果才有可比性。1.2 復(fù)雜真實世界任務(wù)給 Agent 出的三道難題進(jìn)入真實場景后工具調(diào)用型 Agent 面對的問題通常比教科書示例復(fù)雜得多主要體現(xiàn)為三點。第一上下文碎片化。任務(wù)需要的信息分散在不同文件、數(shù)據(jù)庫、接口里Agent 必須主動拉取不能指望用戶一次性給全。第二工具協(xié)議不統(tǒng)一。團隊里可能有 REST API、數(shù)據(jù)庫連接、命令行腳本、內(nèi)部 SDK如果每個工具都自己定義調(diào)用格式Agent 適配成本非常高。第三失敗難復(fù)現(xiàn)。工具會超時、返回空值、報權(quán)限錯誤Agent 必須能感知并調(diào)整否則同樣的任務(wù)換個環(huán)境就失敗。這些難題意味著評測任務(wù)必須設(shè)計成“真實世界的復(fù)雜度”而不是把多個簡單問答拼在一起。一個合格的工具調(diào)用型 Agent 評測任務(wù)應(yīng)該要求 Agent 自己決定調(diào)用順序、自己判斷結(jié)果正確性、自己處理異常分支。1.3 MCP 和 MCP-Bench 的關(guān)系MCPModel Context Protocol是一個開放協(xié)議用來標(biāo)準(zhǔn)化 LLM 應(yīng)用與外部數(shù)據(jù)源、工具之間的連接方式。在 MCP 生態(tài)里工具提供方只需要按協(xié)議實現(xiàn)一套服務(wù)模型應(yīng)用就能通過統(tǒng)一方式發(fā)現(xiàn)工具、描述參數(shù)、發(fā)起調(diào)用、接收結(jié)果。這解決了 1.2 節(jié)提到的協(xié)議碎片化問題。MCP-Bench 則可以理解成圍繞這種工具調(diào)用模式設(shè)計的評估框架用 MCP 服務(wù)承載待測工具用復(fù)雜的真實任務(wù)驅(qū)動模型行動再用統(tǒng)一評分邏輯判斷模型是否完成了目標(biāo)。需要說明的是不同團隊對 MCP-Bench 的落地方式并不完全一致有的基于公開評測集有的基于內(nèi)部業(yè)務(wù)任務(wù)集但共同點是“MCP 協(xié)議 工具調(diào)用型 Agent 復(fù)雜任務(wù)評分”這個組合。1.4 評測時應(yīng)該關(guān)注的對象跑一個 MCP-Bench 風(fēng)格評測關(guān)注的不是某一次工具調(diào)用有沒有成功而是整條 Agent 鏈路的表現(xiàn)至少包含四層模型層是否理解任務(wù)語義能否把用戶請求拆成工具調(diào)用計劃。協(xié)議層MCP Server 是否正常工具參數(shù)是否符合 Schema返回結(jié)果能否被解析。Agent 框架層是否維護(hù)多輪上下文是否限制最大調(diào)用次數(shù)是否對工具異常有兜底。評測任務(wù)層任務(wù)答案是否明確評分規(guī)則是否覆蓋部分完成的情況任務(wù)是否具備區(qū)分度。如果只盯著“工具有沒有返回結(jié)果”很容易被一次偶發(fā)成功誤導(dǎo)。MCP-Bench 的價值在于把上述每一層都變成可觀測、可評分的對象。2. MCP 工具調(diào)用鏈路與評測任務(wù)的關(guān)鍵設(shè)計點2.1 MCP 的三段式架構(gòu)理解 MCP-Bench 前要先理解 MCP 工具調(diào)用鏈路。MCP 采用三段式結(jié)構(gòu)MCP Host運行 LLM 的應(yīng)用負(fù)責(zé)組織對話流程把模型決策轉(zhuǎn)發(fā)給工具。MCP ClientHost 內(nèi)部連接 Server 的客戶端組件負(fù)責(zé)協(xié)議通信。MCP Server實際執(zhí)行工具的服務(wù)進(jìn)程暴露工具清單并接收調(diào)用請求。調(diào)用鏈路可以概括為用戶在 Host 中發(fā)起任務(wù) - 模型分析后決定調(diào)用某個工具 - Host 通過 Client 向 Server 請求工具執(zhí)行 - Server 返回結(jié)構(gòu)化結(jié)果 - 模型根據(jù)結(jié)果繼續(xù)決策。整個過程是循環(huán)的直到模型認(rèn)為任務(wù)完成或達(dá)到最大輪數(shù)限制。這種結(jié)構(gòu)天然適合評測Server 負(fù)責(zé)提供可復(fù)現(xiàn)的工具環(huán)境Runner 負(fù)責(zé)記錄每一輪決策和結(jié)果任務(wù)集負(fù)責(zé)定義預(yù)期目標(biāo)。評測框架可以把它抽象成“輸入任務(wù) - 循環(huán)工具調(diào)用 - 輸出最終答案 - 對照評分”。2.2 三個核心原語Resources、Prompts、ToolsMCP 給模型應(yīng)用提供了三類能力評測任務(wù)設(shè)計時經(jīng)常涉及原語作用評測中的典型用法Resources向模型提供讀取型數(shù)據(jù)比如文件內(nèi)容、數(shù)據(jù)庫記錄提供任務(wù)背景資料避免把信息全部塞進(jìn) promptPrompts可復(fù)用的提示模板規(guī)范模型如何完成某類操作定義工具調(diào)用說明和輸出格式模板Tools模型可以主動調(diào)用的執(zhí)行型函數(shù)需要參數(shù) Schema作為評測中的被調(diào)用對象記錄調(diào)用軌跡對工具調(diào)用型 Agent 評測來說Tools 是核心。一個 Tool 包含名稱、描述、輸入 Schema 和執(zhí)行邏輯。描述寫得好不好直接影響模型能否正確選擇工具Schema 設(shè)計得清不清楚直接影響參數(shù)填充是否正確。這兩點也是評測中差異最大的變量。2.3 一個多步任務(wù)在 MCP 鏈路中如何執(zhí)行用一個例子說明多步任務(wù)在 MCP 鏈路里的執(zhí)行過程。假設(shè)評測任務(wù)要求 Agent“統(tǒng)計某個服務(wù)日志中出現(xiàn) ERROR 的次數(shù)并判斷錯誤最集中的時間段”。模型會把任務(wù)拆成兩步先調(diào)用read_log工具讀取日志文件再調(diào)用extract_stats工具或自己分析文本。如果設(shè)計成鏈?zhǔn)饺蝿?wù)第二步可能依賴第一步的返回值。實際的協(xié)議消息可以簡化成下面這樣先列出 Server 支持的工具{ jsonrpc: 2.0, id: 1, method: tools/list, params: {} }Server 返回工具描述{ jsonrpc: 2.0, id: 1, result: { tools: [ { name: read_log, description: 讀取指定日志文件返回全部行, inputSchema: { type: object, properties: { path: { type: string } }, required: [path] } } ] } }模型決定調(diào)用工具后發(fā)送tools/call請求{ jsonrpc: 2.0, id: 2, method: tools/call, params: { name: read_log, arguments: { path: logs/app.log } } }Server 返回執(zhí)行結(jié)果{ jsonrpc: 2.0, id: 2, result: { content: [ { type: text, text: ERROR count: 17\n[2025-01-01 00:01:02] ERROR ... } ] } }評測腳本要記錄的就是這些請求和響應(yīng)模型在什么輪次調(diào)用什么工具、傳了什么參數(shù)、拿到什么結(jié)果、最后得出什么結(jié)論。有了這種完整軌跡評分和排錯才有依據(jù)。2.4 評測框架必須采集的四類數(shù)據(jù)一個合格的工具調(diào)用型 Agent 評測框架最少要采集四類數(shù)據(jù)任務(wù)輸入與預(yù)期任務(wù)原始描述、預(yù)期結(jié)果表達(dá)式、允許的最大調(diào)用輪數(shù)。動作序列模型每一步的決策類型、工具名、參數(shù)、對應(yīng)輪次。工具執(zhí)行結(jié)果每個工具的成功狀態(tài)、返回內(nèi)容、耗時、異常信息。最終輸出與評分模型給出的最終答案、任務(wù)得分、扣分項說明。采集這些數(shù)據(jù)不只為給一個分?jǐn)?shù)而是為了讓失敗可以歸因。一個 Agent 任務(wù)失敗可能是模型規(guī)劃錯誤也可能是工具參數(shù) Schema 寫錯還可能是 Server 崩潰。沒有動作序列和工具執(zhí)行日志這幾個原因很難區(qū)分。3. 搭建最小可復(fù)現(xiàn)的評測環(huán)境3.1 依賴與目錄結(jié)構(gòu)推薦使用 Python 3.10 以上版本配合 MCP 官方 SDK 搭建本地評測環(huán)境。依賴安裝命令如下mkdir -p mcp-bench-demo/{tasks,logs,server,runner} cd mcp-bench-demo python -m venv .venv source .venv/bin/activate pip install mcp不同版本的 MCP SDK 在 FastMCP API 上略有差異落地前可以用pip show mcp查看版本再對照官方文檔確認(rèn)接口寫法。下面的例子基于 mcp SDK 1.x 的常見寫法。推薦的目錄結(jié)構(gòu)mcp-bench-demo/ ├── server/ │ └── bench_server.py ├── runner/ │ └── bench_runner.py ├── tasks/ │ └── tasks.json └── logs/ └── app.loglogs 目錄放模擬業(yè)務(wù)日志server 目錄放 MCP Serverrunner 目錄放評測腳本tasks 目錄放任務(wù)集。目錄職責(zé)分開后續(xù)擴展任務(wù)和排查問題都會方便很多。3.2 用 FastMCP 編寫一個帶兩個工具的 Server下面這個 Server 暴露兩個工具一個統(tǒng)計日志關(guān)鍵字次數(shù)一個讀取用戶信息。前者是單步工具后者用于演示鏈?zhǔn)讲樵儭? server/bench_server.py from mcp.server.fastmcp import FastMCP mcp FastMCP(bench-tools) mcp.tool() def count_keyword(log_path: str, keyword: str) - str: 統(tǒng)計指定日志文件中關(guān)鍵字出現(xiàn)的次數(shù)。 Args: log_path: 日志文件路徑例如 logs/app.log keyword: 要統(tǒng)計的關(guān)鍵字例如 ERROR count 0 with open(log_path, r, encodingutf-8) as f: for line in f: if keyword in line: count 1 return str(count) mcp.tool() def get_user_region(user_id: str) - str: 根據(jù)用戶 ID 返回用戶所在地區(qū)。 Args: user_id: 用戶唯一標(biāo)識例如 u-1001 mock_users { u-1001: shenzhen, u-1002: beijing, u-1003: chengdu, } region mock_users.get(user_id, unknown) return region mcp.tool() def get_weather(city: str) - str: 返回指定城市的天氣情況。 Args: city: 城市英文名例如 shenzhen mock_weather { shenzhen: sunny, 28c, beijing: cloudy, 18c, chengdu: rainy, 22c, } return mock_weather.get(city, unknown weather) if __name__ __main__: mcp.run()這個示例中用字典模擬用戶數(shù)據(jù)和天氣數(shù)據(jù)實際項目里可以替換成數(shù)據(jù)庫查詢或外部 API 調(diào)用。三個工具中count_keyword是獨立工具get_user_region和get_weather可以組合成鏈?zhǔn)饺蝿?wù)先查用戶地區(qū)再根據(jù)地區(qū)查天氣。3.3 通過 JSON-RPC 驗證 Server 是否正常啟動 Server 前先用 Python 自帶方式檢查能否加載模塊cd mcp-bench-demo python -c import server.bench_server; print(import ok)如果輸出import ok說明依賴和模塊路徑正常。接著啟動服務(wù)python server/bench_server.py本地 MCP Server 一般通過 stdio 或 HTTP 與客戶端通信。FastMCP 的mcp.run()在不同版本中默認(rèn)傳輸方式不同有的是 stdio有的是 HTTP。為了方便評測腳本調(diào)用可以顯式配置成 HTTP 模式也可以直接讓 Runner 以子進(jìn)程方式啟動 Server。學(xué)習(xí)階段建議先用 HTTP 模式便于用 curl 驗證。如果 Server 以 HTTP 方式運行可以用下面這條命令驗證tools/listcurl -s -X POST http://127.0.0.1:8000/mcp \ -H Content-Type: application/json \ -d {jsonrpc:2.0,id:1,method:tools/list,params:{}}響應(yīng)里能列出三個工具說明 Server 工作正常。這一步很重要因為后面的 Runner 會對 Server 通信結(jié)果做依賴如果 Server 沒起來所有評測都會失敗。3.4 任務(wù)集 JSON 的設(shè)計與示例任務(wù)集是評測的核心資產(chǎn)。設(shè)計任務(wù)時要把任務(wù)描述、最大步數(shù)、預(yù)期結(jié)果校驗方式都定義清楚。下面是一個合適的示例{ tasks: [ { id: task-001, name: 統(tǒng)計 ERROR 日志數(shù)量, prompt: 請統(tǒng)計 logs/app.log 中 ERROR 出現(xiàn)的總次數(shù)直接返回數(shù)字。, max_steps: 3, expected: 17 }, { id: task-002, name: 查詢用戶所在城市天氣, prompt: 用戶 u-1001 想了解自己所在城市的天氣請查詢該用戶的地區(qū)并返回當(dāng)?shù)靥鞖狻? max_steps: 4, expected: sunny, 28c } ] }任務(wù)一測試單工具調(diào)用。任務(wù)二測試鏈?zhǔn)秸{(diào)用模型必須先調(diào)用get_user_region再調(diào)用get_weather。如果模型直接猜測天氣即使答案碰巧正確評測腳本也能根據(jù)動作軌跡判斷它的行為不正確這就是動作序列采集的作用。4. 實現(xiàn)最小 MCP-Bench 評測 Runner4.1 Runner 的整體流程評測 Runner 是整篇文章的核心部分。它讀取任務(wù)集為每個任務(wù)建立一次 Agent 會話循環(huán)執(zhí)行“模型決策 - 工具調(diào)用 - 結(jié)果收集”最后輸出評分和軌跡。流程如下加載 tasks.json。啟動或連接 MCP Server。獲取工具列表緩存到本地。對每個任務(wù)構(gòu)造初始 prompt 并進(jìn)入循環(huán)。每一輪讓規(guī)劃器決定動作類型tool_call或finish。如果是tool_call調(diào)用 MCP Server 并記錄結(jié)果。如果是finish把最終答案交給評分函數(shù)。匯總所有任務(wù)的分?jǐn)?shù)、工具調(diào)用次數(shù)、異常日志。4.2 模型規(guī)劃器抽象本地用固定策略線上替換成真實 LLM為了不依賴具體模型 API Key也為了讓評測框架本身可以先跑通這里定義一個AgentPlanner抽象它只負(fù)責(zé)“根據(jù)當(dāng)前消息歷史生成下一個動作”。本地驗證時用MockPlanner它從任務(wù)配置里讀取預(yù)設(shè)的動作序列模擬一個聽話的 Agent真實評測時把它替換成真實 LLM 調(diào)用即可。# runner/agent_planner.py from abc import ABC, abstractmethod from dataclasses import dataclass, field from typing import Any dataclass class Action: type: str # tool_call or finish tool_name: str arguments: dict field(default_factorydict) answer: str class AgentPlanner(ABC): abstractmethod def next_action(self, messages: list[dict]) - Action: ... class MockPlanner(AgentPlanner): 本地驗證用按 task 中配置的固定動作序列執(zhí)行。 def __init__(self, plan: list[dict]): self.plan plan self.index 0 def next_action(self, messages: list[dict]) - Action: if self.index len(self.plan): return Action(typefinish, answerNO_ANSWER) step self.plan[self.index] self.index 1 if step[type] tool_call: return Action( typetool_call, tool_namestep[tool_name], argumentsstep[arguments], ) return Action(typefinish, answerstep[answer])真實項目里替換next_action時只需要把messages發(fā)給大模型解析模型返回的 tool_calls 和最終文本轉(zhuǎn)成Action。這個替換對 Runner 的其他部分完全透明。4.3 客戶端封裝連接 Server、列出工具、調(diào)用工具下面封裝一個 MCPClient負(fù)責(zé)與 Server 通信。如果使用官方 SDK可以直接用客戶端類這里為了展示原理寫一個基于 requests 的簡潔版本方便閱讀和調(diào)試。# runner/mcp_client.py import requests class MCPClient: def __init__(self, endpoint: str): self.endpoint endpoint self.tools: dict {} def list_tools(self) - dict: payload { jsonrpc: 2.0, id: 1, method: tools/list, params: {}, } resp requests.post(self.endpoint, jsonpayload, timeout10) resp.raise_for_status() data resp.json() tools data[result][tools] self.tools {t[name]: t for t in tools} return self.tools def call_tool(self, name: str, arguments: dict) - dict: payload { jsonrpc: 2.0, id: 2, method: tools/call, params: { name: name, arguments: arguments, }, } resp requests.post(self.endpoint, jsonpayload, timeout15) resp.raise_for_status() data resp.json() if error in data: return {ok: False, error: data[error]} content data[result][content] text for item in content: if item.get(type) text: text item.get(text, ) return {ok: True, text: text}代碼里把tools/list的結(jié)果緩存到self.tools后續(xù)評分統(tǒng)計可以知道模型調(diào)用的工具是否真實存在。call_tool返回統(tǒng)一結(jié)構(gòu)無論成功失敗都包含可觀測的結(jié)果字段。4.4 任務(wù)執(zhí)行循環(huán)與結(jié)果收集主執(zhí)行循環(huán)記錄每一步動作、工具返回值和異常信息最后把完整軌跡交給評分函數(shù)。# runner/bench_runner.py import json from agent_planner import MockPlanner from mcp_client import MCPClient def run_single_task(client: MCPClient, task: dict, planner: AgentPlanner): max_steps task.get(max_steps, 5) messages [{role: user, content: task[prompt]}] trace { task_id: task[id], steps: [], final_answer: , tool_calls: 0, errors: [], } for step_index in range(max_steps): try: action planner.next_action(messages) except Exception as exc: trace[errors].append(fplanner_error: {exc}) break if action.type finish: trace[final_answer] action.answer return trace if action.type tool_call: trace[tool_calls] 1 result client.call_tool(action.tool_name, action.arguments) step_record { step: step_index 1, action: tool_call, tool_name: action.tool_name, arguments: action.arguments, result: result, } trace[steps].append(step_record) if not result.get(ok): trace[errors].append( ftool_error: {action.tool_name} - {result.get(error)} ) messages.append({ role: tool, content: json.dumps(result, ensure_asciiFalse), }) trace[errors].append(max_steps_exceeded) return trace注意這里把每一步的工具結(jié)果放進(jìn)了messages目的和真實 MCP 鏈路一致模型需要看到工具返回結(jié)果才能決定下一步。評測框架也應(yīng)該保留這些消息便于后續(xù)分析模型決策邏輯。4.5 評分函數(shù)與運行輸出評分函數(shù)需要平衡“完成正確性”和“過程效率”。下面是一個簡單但可擴展的版本def score_trace(task: dict, trace: dict) - float: score 0.0 expected task.get(expected) actual trace.get(final_answer, ).strip() if actual expected: score 1.0 elif expected in actual: score 0.6 else: score 0.0 tool_calls trace.get(tool_calls, 0) max_steps task.get(max_steps, 5) efficiency_penalty min(tool_calls / (max_steps * 2), 0.3) score - efficiency_penalty if trace.get(errors): score - 0.2 return round(max(score, 0.0), 2) def run_all(tasks_path: str, endpoint: str): with open(tasks_path, r, encodingutf-8) as f: tasks json.load(f)[tasks] client MCPClient(endpoint) client.list_tools() report [] for task in tasks: plan [ {type: tool_call, tool_name: count_keyword, arguments: {log_path: logs/app.log, keyword: ERROR}}, {type: finish, answer: 17}, ] if task[id] task-002: plan [ {type: tool_call, tool_name: get_user_region, arguments: {user_id: u-1001}}, {type: tool_call, tool_name: get_weather, arguments: {city: shenzhen}}, {type: finish, answer: sunny, 28c}, ] planner MockPlanner(plan) trace run_single_task(client, task, planner) score score_trace(task, trace) report.append({task_id: task[id], score: score, trace: trace}) for item in report: print(json.dumps({ task_id: item[task_id], score: item[score], tool_calls: item[trace][tool_calls], final_answer: item[trace][final_answer], }, ensure_asciiFalse)) if __name__ __main__: run_all(tasks/tasks.json, http://127.0.0.1:8000/mcp)運行后預(yù)期輸出{task_id: task-001, score: 1.0, tool_calls: 1, final_answer: 17} {task_id: task-002, score: 1.0, tool_calls: 2, final_answer: sunny, 28c}當(dāng)模型規(guī)劃正確、工具實現(xiàn)正確時兩個任務(wù)都能拿滿分。真實評測中MockPlanner 會被替換成 LLM分?jǐn)?shù)就會出現(xiàn)差異這時候就需要看 trace 里的每一步判斷是規(guī)劃錯誤還是工具錯誤。5. 評測指標(biāo)、參數(shù)與任務(wù)梯度結(jié)果不是跑出分?jǐn)?shù)就結(jié)束5.1 核心指標(biāo)怎么算、怎么用MCP-Bench 類評測不能只看一個總分建議把指標(biāo)拆開每個指標(biāo)對應(yīng)一類能力問題指標(biāo)計算方式反映的問題任務(wù)成功率完全正確任務(wù)數(shù) / 總?cè)蝿?wù)數(shù)基礎(chǔ)完成能力任務(wù)完成度各任務(wù)得分加權(quán)平均部分完成能力平均工具調(diào)用數(shù)工具調(diào)用總次數(shù) / 任務(wù)數(shù)規(guī)劃效率無效調(diào)用率返回錯誤或空結(jié)果的調(diào)用次數(shù) / 總調(diào)用次數(shù)工具描述和模型理解質(zhì)量異?;謴?fù)率出錯后仍完成任務(wù)數(shù) / 出錯任務(wù)數(shù)魯棒性最終答案命中率最終答案包含預(yù)期關(guān)鍵內(nèi)容的任務(wù)占比結(jié)果可靠性單一成功率會掩蓋過程問題。比如一個 Agent 靠亂猜答案碰巧命中成功率很高但工具基本沒用這就不是合格的工具調(diào)用 Agent。所以評測一定要結(jié)合動作軌跡查看不能只看最終分?jǐn)?shù)。5.2 任務(wù)梯度決定評測區(qū)分度評測任務(wù)不能全是“讀一個文件返回數(shù)字”這種簡單任務(wù)也不建議一上來就是十幾個工具的長鏈路任務(wù)。建議劃分難度梯度基礎(chǔ)層單工具調(diào)用直接返回結(jié)果例如統(tǒng)計關(guān)鍵字。鏈?zhǔn)綄觾蓚€或以上工具串聯(lián)后一個工具依賴前一個結(jié)果。條件層根據(jù)工具返回內(nèi)容決定調(diào)用哪個分支工具。異常層工具會返回空值、錯誤碼或超時考察模型恢復(fù)能力。并行層多個獨立工具需要分批調(diào)用再把結(jié)果匯總。配置任務(wù)時每層至少 3 到 5 個任務(wù)。如果某個模型在基礎(chǔ)層滿分、鏈?zhǔn)綄拥梅值驼f明它工具理解能力沒問題但多步規(guī)劃能力弱如果在鏈?zhǔn)綄右部梢?、異常層下降明顯說明它對錯誤處理缺少兜底策略。這種梯度化分析比一個總分?jǐn)?shù)更有診斷價值。5.3 影響評測結(jié)果的四個關(guān)鍵參數(shù)評測時容易忽略參數(shù)對結(jié)果的干擾。下面四個參數(shù)對結(jié)果影響最大建議統(tǒng)一記錄參數(shù)默認(rèn)值參考調(diào)大影響調(diào)小影響溫度 temperature0 到 0.2動作更多樣但更容易出現(xiàn)無效調(diào)用結(jié)果更穩(wěn)定但可能缺少探索最大步數(shù) max_steps5 到 10給長鏈路任務(wù)更多機會但掩蓋低效問題對長任務(wù)不友好容易截斷工具描述長度一到三句模型更好理解但會占用上下文描述過短時模型容易選錯工具上下文窗口模型按模型實際支持配置能容納更多中間結(jié)果但成本上升長鏈路任務(wù)容易截斷歷史評測報告里應(yīng)該記錄這些參數(shù)否則兩個團隊跑同一個任務(wù)集因為溫度或最大步數(shù)不同分?jǐn)?shù)完全不同結(jié)果無法對比。MCP-Bench 風(fēng)格評測對可復(fù)現(xiàn)性要求很高參數(shù)和模型版本都要寫進(jìn)報告。5.4 讓評測結(jié)果可復(fù)現(xiàn)的隔離策略為了讓結(jié)果可復(fù)現(xiàn)建議從四個方面做隔離。一是數(shù)據(jù)隔離。任務(wù)里的日志、用戶表、天氣數(shù)據(jù)都要用固定測試數(shù)據(jù)不用生產(chǎn)實時數(shù)據(jù)避免外部變化導(dǎo)致結(jié)果不穩(wěn)定。二是環(huán)境隔離。MCP Server 和 Runner 跑在固定容器或虛擬環(huán)境中依賴版本鎖定。至少把requirements.txt和 Python 版本寫入報告。三是隨機性隔離。LLM 采樣有隨機性建議同一任務(wù)跑多次取平均或取最低分并記錄每次結(jié)果。四是緩存隔離。如果工具內(nèi)部訪問數(shù)據(jù)庫或 API要在測試環(huán)境把這些依賴 Mock 掉保證每次調(diào)用返回相同結(jié)果。上面的天氣和用戶數(shù)據(jù)用字典模擬就是這個目的。6. 評測過程中的常見故障定位6.1 排查順序從環(huán)境到代碼再到模型策略評測跑出低分或直接報錯時不要第一時間懷疑模型能力按下面的順序排查MCP Server 是否啟動端口是否正確。tools/list是否能返回工具列表。工具描述和 Schema 是否合理。tools/call是否能正常返回。Runner 是否正確解析返回值。MockPlanner 或真實 LLM 是否輸出預(yù)期動作。評分規(guī)則是否符合任務(wù)語義。這里面有 60% 以上問題出在前四步屬于環(huán)境或工具實現(xiàn)問題而不是模型問題。直接懷疑模型只會讓排查變慢。6.2 高頻問題速查表問題現(xiàn)象常見原因檢查方式處理建議Server 啟動后端口連不上啟動模式不是 HTTP或配置了 stdio看啟動日志確認(rèn)監(jiān)聽地址顯式配置 HTTP endpointtools/list 返回空列表工具裝飾器未注冊或文件沒加載打印 server 日志調(diào)用方法名確認(rèn) import 路徑正確tools/call 返回 -32603工具函數(shù)內(nèi)部拋異常查看 Server stderr 堆棧修復(fù)工具函數(shù)增加異常兜底模型不調(diào)用工具直接給答案工具描述不清晰或 prompt 未說明可用工具查看模型消息歷史補全工具描述在 prompt 中強調(diào)必須調(diào)用工具同一任務(wù)多次跑分?jǐn)?shù)不同模型采樣隨機或數(shù)據(jù)不是固定測試集固定 temperature核對測試數(shù)據(jù)設(shè)置 temperature0固定 seed評分結(jié)果與預(yù)期不符expected 字段寫法不規(guī)范手動跑一次工具返回結(jié)果統(tǒng)一 expected 的類型和格式6.3 一個典型案例tools/list 正常但 tools/call 報錯現(xiàn)象是tools/list能列出get_user_region但調(diào)用時報內(nèi)部錯誤錯誤碼類似-32603。常見原因是工具函數(shù)里讀取的數(shù)據(jù)不存在比如mcp.tool() def get_user_region(user_id: str) - str: user mock_users[user_id] # 直接下標(biāo)訪問key 不存在會拋 KeyError return user[region]當(dāng)模型傳入一個不在 mock 數(shù)據(jù)里的用戶 ID 時函數(shù)直接拋異常錯誤被 MCP 包裝成-32603返回。解決方式是改成mock_users.get(user_id, unknown)并在函數(shù)說明里寫清楚支持的取值范圍。這個案例說明工具函數(shù)本身要有健壯性。評測工具不等于生產(chǎn)工具但它的容錯程度直接影響評測結(jié)果一個不夠健壯的工具會讓模型即使規(guī)劃正確也會失敗。6.4 分?jǐn)?shù)偏低時怎么從日志歸因分?jǐn)?shù)偏低時先看 trace按以下路徑歸因如果動作序列正確但最終答案錯誤檢查工具返回格式和評分邏輯。如果動作序列從一開始就跑偏檢查工具描述、prompt 和模型規(guī)劃能力。如果模型在第 N 步出現(xiàn)重復(fù)調(diào)用同一個工具檢查上下文是否展示了工具結(jié)果。如果出現(xiàn)大量max_steps_exceeded檢查任務(wù)最大步數(shù)設(shè)置是否合理。評測框架最好把 trace 導(dǎo)出成 JSON 文件包含 prompt、每一步模型輸出、工具結(jié)果、最終答案。這樣排查時可以直接回放整個過程而不是憑記憶猜。7. 從本地 Demo 到生產(chǎn)級 Agent 評測最佳實踐與擴展方向7.1 一套可直接使用的評測準(zhǔn)備清單在正式跑一組評測前建議逐項確認(rèn)下面這些內(nèi)容任務(wù)集是否覆蓋不同難度梯度每層至少 3 個任務(wù)。每個任務(wù)的 expected 字段是否唯一、可比較、可自動判斷。MCP Server 是否能穩(wěn)定啟動工具是否都有異常兜底。工具描述是否包含輸入含義、取值范圍、返回值格式。Runner 是否正確記錄動作序列、工具結(jié)果、最終答案和錯誤信息。是否固定模型版本、temperature、max_steps 和隨機種子。是否使用固定測試數(shù)據(jù)避免外部依賴波動。評分規(guī)則是否區(qū)分完全正確、部分正確和錯誤恢復(fù)。是否導(dǎo)出 JSON 軌跡方便失敗歸因。這份清單在發(fā)布評測報告前過一遍能避免大部分“分?jǐn)?shù)不可信”的問題。7.2 生產(chǎn)級評測與本地評測的差異本地 Demo 跑通后進(jìn)入生產(chǎn)環(huán)境差異主要在五個方面一是并發(fā)。真實評測通常同時跑幾十個模型實例MCP Server 要能支持并發(fā)請求不能只用本地單進(jìn)程。二是資源隔離。每個評測任務(wù)使用獨立沙箱數(shù)據(jù)避免任務(wù)間相互污染。三是回歸閾值。模型或 Agent 框架升級后要設(shè)定分?jǐn)?shù)下降閾值比如整體分?jǐn)?shù)下降超過 2% 就阻止發(fā)布。四是版本追蹤。模型版本、工具代碼版本、任務(wù)集版本都要記錄否則無法定位是模型變了還是工具變了。五是安全與審計。工具可能訪問敏感數(shù)據(jù)評測環(huán)境要用完全模擬數(shù)據(jù)并對工具調(diào)用做權(quán)限控制。7.3 可以繼續(xù)深入的方向MCP-Bench 風(fēng)格的評測框架本身還有不少擴展空間。后續(xù)可以加入多輪對話評測讓 Agent 在澄清需求后再行動可以加入多 Agent 協(xié)作場景評測多個 Agent 通過 MCP 工具分工完成復(fù)雜任務(wù)可以在評分中加入語義相似度允許模型用不同表達(dá)給出正確結(jié)果還可以引入人類偏好評估對 Agent 的步驟順序和解釋質(zhì)量做主觀打分。對正在做 Agent 應(yīng)用的團隊來說最值得投入的方向是先把“任務(wù)集 指標(biāo) 軌跡回放”三件套建立起來。任務(wù)集保證有標(biāo)準(zhǔn)可測指標(biāo)保證有量化結(jié)果軌跡回放保證失敗可排查。只要這三件事落地?zé)o論后續(xù)更換模型、增加工具還是調(diào)整 Agent 框架都能用一套穩(wěn)定的評測體系保障質(zhì)量?;氐?MCP-Bench 的核心判斷工具調(diào)用型 Agent 的能力不能靠感覺衡量必須放在復(fù)雜真實任務(wù)里用統(tǒng)一協(xié)議、標(biāo)準(zhǔn)任務(wù)、可復(fù)用指標(biāo)去約束。先跑通最小閉環(huán)再把任務(wù)集做厚、把指標(biāo)做細(xì)這比一開始追求上百個工具的大規(guī)模評測更實際。對剛接觸這個方向的開發(fā)者建議從本文的最小 Runner 開始替換成真實 LLM錄入自己的業(yè)務(wù)任務(wù)再用 trace 分析第一次失敗原因這會比閱讀大量評測論文更快建立手感。
返回列表
PREV
查看更多資訊
NEXT
返回資訊列表
国产精品乱码久久久| 7月婷婷综合| 亚洲操操操| 亚洲在钱| 狠狠色婷婷777| 久久99国产精品| 亚洲老熟妇xxx| 热思思免费视频| 精品亚洲国产成人精品| 亚洲 欧美 综合 91| 日韩乱插| 久久精品一区二区一8| 久久久久国产亚洲一区欧美色图日韩| 夜夜草天天| 91熟女丨老女人| 发朗少妇买婬全视频中文| 丰满人妻一区二区三区四区| 久久久久96| 综合久草| 人人爱夜夜爱| 免费一级视频特黄色大片| 美女网站91| 很黄很污的免费网站| 国产又爽又黄| 色狠狠综合| 园内精品自拍视频在线播放| 人妻精品一区二区三区| 蜜臀99久久精品久久久久久| 99re3这里只有精品| 亚洲综合中文字幕有码| 国产精品盗摄 偷窥盗摄| 自拍第一页| 麻豆精品天美| 久久综合日韩亚洲欧美| 天天综合站| 人人做,人人操,人人摸| 深爱伊人影院| 2024年最新色情网站在线观看 | q2午夜理论片夜色av| 久久男女激情视频网站| 国产在线强奸视频| 操b在线观看| 亚洲无码com| 中欧人妻丝袜中文字幕| 91精品国产综合久久久蜜臀酒店| 97bbn| 97天天摸天天碰| 岛国1区2区3区在线观看| 中文字幕视频在线观看| 欧美男人天堂| 国产精品乱码久久久久久久久| 欧美色图片91| 麻豆60秒| 日韩精彩免费| 男人的天堂2000| 99999这里都精品| 久久精品99| 中文字幕福利视频一区二区三区在线观看| 九九九影院| 青青草无码视频| 伊人青青一区成人视频在线观看区| 人人色97| 97一区二区三区视频| 九九玖玖精品| 色悠久久久av| 五十路熟女人妻一区二区在线观看| 神马久久午夜| 亚洲日韩美女中文字幕乱| 呦呦影院| 亚洲欧洲日本精品中文a∨| 乱伦一区二区三区‘| 成年无码动漫av片无尽在线 | 伦伦成年午夜免费视频| 久久五月份| 国产AV人人 夜夜人人澡| AV天堂电影网| 智利AV在线网| 中文字幕99999| 日韩一级二级三级在线不卡观看完整| 秋霞一级鲁丝片A片| 97人妻免费中文字幕| 欧美日本中字另类在线| 大香樵伊人网| 东京热,男人的天堂| 老熟女搡BBBB搡BBBB视频| 国产精品免费视频人成| 97伪v| 欧美丝袜中文字幕07在线| 校园春色 亚洲| 日本韩国国产精品一区| 亚洲日韩肥臀视频在线观看| 亚洲,欧美,综合网| 在线视频资源| 国产高清精品福利| 国产玖玖| 色拍偷亚洲| 人妻人久久精品中文字幕| 国产蜜臀在线| 操逼免费视频无码国产| 99国产精品人妻人伦| 亚州大图综合色图| 国产一区二区欧美日本| 九九九久久久久| 97精品97久久| 东亚亚洲无码高清| 中文字幕十五区| 国产九九九九九九| 免费簧片在线观看| 国产成人精品午夜福利| 欧美性爱中文字幕无线码| 啊啊啊啊啊操我视频| 91亚洲人| 好吊色一区| 美女天天干| 99re国产精品视频| 91爽啪| 97K超碰在线| 三级日韩一区二区三区| 久久熟女嫩草成人片免费| 精品一二三区女同| 欧美男女午夜啪啪| 黄页av| 婷婷综合网| 91neishe| 一级免费精品| 青青操狠狠撩| 青青草在线视频播放器| 激情五月天色播| 久久久久网站-538在线视频-欧美永久乱码| 蜜臀网 一区| 91热爆在线| 欧美激情 一区| 99热这里只有精品地址| 久久精品无码专区| 在现视频女上位好爽| 久欲AV| 小情侣高清国产在线视频| 日韩钢筋无码高清啾啾啾| 久久午夜鲁丝片| 少妇69中文| 精品无码秘 人妻一区二区| 中文伊人大香蕉视频| 国产无码成人无码| 日韩人人精品| 最新AVzaixian| 超碰色老头| a男人的天堂| 人人贴人人摸| 国内毛片四区| 亚洲熟妇乱女区二区三区| 18禁在线视频| 加勒比久久av| 免费看污网站| 婷婷五月成人| 性影在线视频| 久久性爱视频免费看| 蜜桃精品视频一区| 嗯啊不要在线| av绯色| 夜夜高潮夜夜爽夜夜爱爱一区 | 中文字幕av丝袜| 中文字幕成人| 三级特黄60分钟播放| 热久久无毒不卡| 97在线国产精品| 国产 日韩 欧美 中文 另类,国产 欧美 另类 制服 变态,高清 日韩 欧美 中文,高 | 97超碰jingpin| 嫩草美女久久| 青青草国产盗摄一二三区| 一级啊性爱在线视频| av网站免费看| 走光一区92下载| 天天爽天天干| 亚洲欧美自拍偷拍| 91丨豆花丨熟女| 精品无码少妇| 国产精品一区二区后入| 欧美亚洲影视| 黑人精品XXX一区一二区| 台湾佬中文娱乐网久久久久久久久久com | 国内偷自视频区视频综合| 超碰97综合网| 欧美亚洲综合色| 天天日天天搞天天干| 麻豆天天躁天天揉揉AV| 亚洲色图欧美另类在线| 高清不卡视频| 亚洲欧美激情另类色图| 青草青青久久久久久国产| 把腿张开老子CAO烂你| 在线综合网| 九九九九一区| 日韩中文字幕视频在线观看| 91精品久久久久五月天精品| 色哟哟综合| 私人尤物在线精品不卡| 欧美综合网| 九九九一二三| 久久久精精精| 超碰97亚洲| 天天夜夜rb| 96超碰网| 少妇久久久| 大色综合| 免费岛国一级片| 性色高清在线| 婷婷伊人网| 欧美天天干| 国产精品亚洲无码| 双插性欧美一二三区| 91大神精品长腿在线观看网站| 久久超碰com| 日本韩国五十路六十路七十路老熟女作爱视频网站| 欧美日韩色| 欧色网址| 国内外内射高清视频| 高精欧美色| 精品熟女呻吟久久91| 亚洲精品电影| 超碰成人人人爽人人爽| 亚洲综合另类小说色区亚洲成av人片在www | 欧洲精品二区| 色噜噜婷婷| 亚洲另类色综合网站| 超碰 另类 欧美 | 加勒比综合在线| 日本亚欧爱爱| 日本媚薬中文字幕在线| 无码精品久久久久久亚洲| 日韩性爱长视频免费| 国产精品人妻无码久久久互動交流| 欧美激情区| PMv在线观看| 天天干人人干天天日97| 婷婷在线精品| 综合久欧洲| 亚洲熟女一区| 97久久网| 日本污ww视频网站| 欧美性爱97超碰| 四虎永久在线精品免费网址| 伊人午夜福利视频| 夜夜欢天天干| 天天色黄色影院天天操| 亚洲AV成人无码一区二区三区在线观看| 亚洲少妇喷视频看| 精品十三区| 亚洲国产中文字幕| 黄色av网站在线播放| 欧美精品久久久久久久久88| 香一区二区三区| 色综合超碰超| 久久丁香久草综合网| 国产精品无码av| 丁香激情网| 欧美久久婷婷| 综合久久9| 久久精品中文字幕观看| 欧美午夜色妇色鬼| 欧美亚洲手机在线| 欧美日韩国产在线| 嫩草 我啊~嗯~在线| 我要色综合网| a在线观看| 成人在线视频一区| 日本一级真人黄色性爱视频| 91人妻尻屄视频| 96AV久久久| 懂色Av一区二区三区| 欧美不卡二区| 美女91av| 亚洲第一黄色av网站| 亚洲骚女一区二区三区| 噜噜噜噜久久久精品免费| 欧美日产国产在线成人第一区| 天天干,夜夜爽| 91视频综合在线| 国产精品露脸在线观看| 在线观看十八禁| 无人区高清电影免费观看一区二区三 www.qmcai2.com | www.91视频网| 亚洲超碰AV| 天天综合网1| 99精品国产户外露出| 欧美99| 国产精品97超碰| 波多野结衣被操50分钟免费视频| 另类亚洲图色| 免费αV在线视频| 亚洲色图激情小说| 亚洲激情在线观看一区| 亚州色站 日韩电影| 欧美色图亚洲激情| 厕所偷拍在线| a片 xxxx受爽视频| 日本淫色网| 国内一区二区免费| 免费的av网| 视频不卡中文字幕| 中文字幕人妻色偷偷久久皮| 日本黄色大片一级视频免费麻豆| 欧美激情久| 狠狠中文字幕| 国产超碰97| 韩国黄色片精品久久久| 国产后入| 亚州色图片在线色| 日本欧美国内在线| a片 xxxx受爽视频| av在线浏览| 成人无码在线超碰网| 美女淫穴| 午夜理论片在线观看免费| 欧美性Fer办公室秘书| 日本五十路熟女一区二区| 欧美精品欧美精品系列| 亚洲精品一区中文字幕乱码| 日韩三级伦理中文字幕| 色天天野狼综合社区| 九久9精品| 激情小说亚洲| 美女黑人91神马| 亚欧高清在线| 欧美激情久操网| 久久九精品| 日本色婷婷| 91视频精品| 亚洲性综合| 色色色热| 淫荡少妇免费| 欧美黑人极品高潮喷吹熟女黑人性暴力日韩在线欧美极品一区二区 | 蜜桃久久一区二区三区| 欧美A片中文字幕| 久久精品视频一区三区小泽玛利亚| JULIA一区二区三区在线播放| 久久精品国产亚洲粉嫩| 国产精品久久久九九九| 97干com| 精品国产乱码久久久久久口爆网站| 9 1果冻精品视频| 色诱中文字幕| 亚洲人妻av| 欧美区亚洲区偷拍区| 亚洲精品国产熟女久久久| 色性欧美| 亚洲精品美女久久久久久久久| 一区二区高清视频| 99热这里都是精品| 99re在线视频国产| 爱啪精品一区| 亚洲第一页欧美| 九九aV| 八人操人人摸人人看| 97aiaiai| 97人人爱人人乐| 99热99re6国产在线播放| 射丝袜高跟鞋99| 丁香五月影院| 亚洲1区| 自慰白浆在线观看| 1769精品一区二区三区| 成人三级片无码| 国产乱伦亚洲色图高清无码| 青春草莓视频在线观看网址| 国产熟女无套内射| 在线视频资源| 国产sv美女内射| 色五月AV在线| 久久宗合亚洲| 亚洲高清少妇| 国产乱人妻精品入口| 厕所偷拍在线| 91大神电影天堂| 男人的天堂在线有码| 丁香五月av| 激情小说五月天| 蜜臀99久| 后入国产| 狠狠婷婷亚洲中文综合久久| 精品无码久久久久久久久果冻糖心| 97色操| 久久精品日韩专区免费观看| 欧美一区二区三区成人性生活| 日本99一区二区| 干b在线性社区| 殴美综合色88| 99精品伊人| 久久久中文版| 国产丸一视频| 老熟女阿 国产91| 亚洲黄色电影| 日韩欧美亚欧在线视频| 久久中文字幕不卡人妻| 九九视频黄色片| 另类小说综合网| 污污汅18禁网站在线永久免费观看| 370p日韩欧美亚洲精品| 国产精品制服丝袜清纯唯美 | 免费成人在线熟妇网| 精国久久一区二区三区98| 国产成人天堂| 91蜜臀人妻中文字幕在线| 蜜臀99久久国产| 欧美一二三| 被窝影院午夜看片无码| 人人操人人叉人人插人人| 曰韩无码777| 色性欧美| 91爱欧美| 91亚洲人| 日韩午夜精品一区二区三区电影| 久99久视频精选| 日产中文字幕2020| 天天天操天天天爱| 超碰免费人妻在线| 萌白酱自拍视频| 天天肏夜夜肏| 欲色影视综合吧| 四虎精品一区| 91天天综合| 老熟妇一区二区三区…| 久久超碰久| 午夜毛片高清免费不卡| 激情小说亚洲| 人人看人人摸人人色| 日本精品人妻少妇一区二区| 中文字幕午夜精品久久久| 在线不欧美| 欧美亚洲尤物久久| 激情图片伦理国产一区二区日韩| 爱丝福利| 国产一区二区免费福利片| 强奸a片网| 欧美色图片91| 这里只有精品97| 中文字幕国产| 久久久久久久久久久久久9999| WWW美腿丝袜香蕉中文| 十八禁啪啪视频| ?亚洲伊人伊成久久人综合网| 老女人日韩美91| 大香蕉草草| 乳欲人妻办公室奶水| 国产精品肉丝自拍| 大香蕉淫人| 久久久精品视频免费观看| 99自拍B亚洲 | 日本乱人伦片中文三区| 99色视频| 人人妻人人爽人人精品| 日本www操操操| 丁香婷婷激情五月天无毒不卡 | 国产 码在线成人网站| 加勒比AV天堂| 波多野结衣一级视频| 殴美牲| 亚洲 欧美综合| 国产一区二区啪啪视频| 九九九九九九九九九九九蜜桃| 久久精品人人做人人看| 午夜欧美J进J出白浆流出久久久| 久久青青草在线视频| 国产99 中文字幕日韩小视频| 裸体1区| 亚洲av综合色区无码一| 91美女看B| 在线a v| 小骚逼被操的爽不爽| 精品久久久久久无码| 国产怡红院| 天天看天天日| 久久中出在线| 日本免费一级AAA大片器| 国产又大又粗又长视频在线| 亚州一区二区成人片免费| 大香蕉伊人在线成人AV在线观看 | 欧美天堂超碰97| 国产精品日韩在线一区| 亚洲少妇在线影音| 国产精品无码久久久久2028| 麻豆天美在线喷水AV| 白嫩国模丰满一二三区| 国内毛片四区| 亚洲情色1区| 亚洲国产精品无码AV久久久| 97超碰超欧美。| 91强热人妻| 欧洲色综合| 黑丝少妇在线观看| 亚洲欧美国产va在线播放频| 精品96久久| 日本在线不卡v二区| 久草电影网| 欧美综合骚| 98人妻精品一区二区色欲| 日韩9999| 色噜噜综合网| ,成人免费啪啪视频| 亚洲天天影视色综合| 99久久婷婷国产综合| 97超碰欧美| 久啪| 大奶啊啊好爽| 亚洲毛片一级带毛片基地| 色噜噜人妻av中文字幕| 91在线视频免费中出| 乱伦1色页| 亚洲熟女诱惑| 九九九精品一区二区无码| 综合色播| 欧美精品日韩久久久九| 亚洲欧美伦综合| 久久久久久九九九九-美女久久久久久久-成人AV | 久久亚州精品成人Av无| 色噜噜日韩精品| 99爱久久视频频| 无码国产精品久久久久| 曰韩人妻中文字幕在线| 久草成人影片| 亚洲视频二区| 嗯~啊~快点 死我视频| 久久久久国产精品片区无码直播| 亚洲中文字幕精品一区| 欧美久久人体| 91强在线播放| 中文字幕片| 91中文在线| 免费伦费视频在线观看| 美国日韩黄片| 日韩猛交| 91无码人妻精品一区二区三区蜜桃| 麻豆精品A片免费观看| 国产67194| 91午夜无码| 又粗又长又大国产不卡| 人妻熟女一区二区在线视频| 1.igao73.com 加入收藏 免费专区 国产精品 中文字幕 日韩精品 欧美精品 精彩 | 啊啊啊骚| 久久久熟女一区| 精品一区二区麻豆| 超碰97资源大奶| 欧美色图天堂在线| 99热欧美| 久久激情视频| 日韩人妻无码专区| 久久精品性| 亚洲图片欧洲图片aⅴ| 久久久久久亚洲Av无码| 一级做受视频免费是看美女| 性综合网| 翔田千里A片一区二区| 射久久| 啊啊啊啊啊啊在线| 老熟女综合| 九九九国产| 欧美日韩小说| 999久久久国产精品| 91欧美www| 中文字幕人妻丝袜乱一区三区| 骚妻少妇精品性色无码四色A V| 东京热大香焦| 国产人妻精品一区二区三区秋霞| 欧美最大综合网| 福利大香蕉| 中日韩久久久免费看| 热热色青青草| 男人的天堂1024| 老熟妇91| 日本国产亚洲一区在线观看| 岛国在线免费视频| 色欲蜜臀AV| 人妻精品一区二区在线| 国产日比| 免费视频在线观看啊啊啊啊啊| 手机不卡视频不卡在线一二三区| 五十路熟女工口| 亚洲熟女一区| 美女91网| 国产福利一区二| 久久精品欧美一区二区三区不卡| 青娱乐国产精品| 爱我干综合| 精品人妻二区三区| 色女免费在线观看视频网址| 老熟女阿 国产91| 91久久| 四虎影视永久在线免费| 操美女高潮抽搐白浆| 中文无码一二三区| 国产熟女二区| 久久加勒比| 日韩综合成人免费视频| 久久久成人国产精品无码| 丁香五月色| 欧美精品丝袜久久久中文字幕| 天综合网欧美| 97综合国产| 淫荡熟女乱伦网| 六月婷婷综合| 天天色怡春院| 亚洲色综合| 日韩性爱电影一区| 爱干爱射网啊啊啊| 国产乱码久久久| 澳门黄片一香蕉视频| 日本精品高清一二区一本到| www.操| 欧美后入式| 强奸乱伦免费网站| 天天舔天天 | 日韩无码三级影院| 精品精品精品| 国产AB视频| 黄色操人| 97精品国产97久久久| 风月影院男女十八禁| 久久久久久久强迫| 91美女中出| 国产外初女出血视频| 91大神精品长腿在线观看网站| 色色色色综合网| 91超碰碰在线| 成人性爱AV在线免费观看| 五月婷婷五月天| 国产欧美日产一区二区三区 - 国产欧美日| 2021国产成人精品久久| 综合网色| 国内外激情在线| 狠狠色噜噜狠狠狠狠狠色综合久久 | 亚洲蜜臀视频精品久久| 亚洲视频1区| 四虎AV无码| 男人天堂欧美| 六月婷婷激情| 亚洲天堂资源在线| 大香蕉黄色一区| 四虎在线免费视频| 这里只有精品视频在线观看麻豆 | 操一操摸一摸| 亚洲精品97在线| 亚州综合在线| 97超级久久强资源| 亚洲情色欧美| 91丝袜美腿网站| 91色图| 中文字幕精品丝袜| 人妻9117c| 91色爽欧美| 自拍偷拍国产欧美日韩韩| 一二三啪啪专区| 黄片免费日韩| 久久中日麻豆| 台湾成人无码AV| 色网1| 欧美疯狂做爰xxxx| 欧美精品系列| 欧美 亚洲 综合 制服| 久久专区| 青春草A| 亚洲一级特黄大片在线播放91| 狠狠2050在线观看| 天天躁日日躁XXXXYY| 97精品一区| 日日夜夜天天| 国产操逼网站亚洲一级黄色| 天天享受天天看| 精品一区二区在线针对华人免费观看这里只有精品免费观看 | 久久久精品电影| 亚洲精品 欧美精品| 激情开心五月天| CCYY草草影院地址入口| 欧美 综合| 8050无码八戒| 久热99| 岛国小电影| 曰本91情色| 97免费视频在线| 欧美日韩插逼视频| 一区二区偷拍拍视频| 欧美色日| 九九热久久99精品re| 中文字幕片| 日韩性爱一级片| 看大黄色大片原件| 人妻人人操| 综合欧美日韩在线观看| 伊人久久亚洲中文字幕不卡| 激情小说日韩无码| 久久久9品一区二区三区| 91熟女少妇| 成人一道本免费视频| 色色婷婷丁香| 国产精品久久久久999| 亚洲精品久| 人妻 欧美 中文| 欧美性爱精品一区二区| 国产一级内射高清视频| 足交视频老司机| 青草视频在线看看看看看看看看看| 91色人妻| 97se亚洲综合自| 18禁久极品美女久久哦哟呀!| 五月婷色| 日本Xx性爱| PMv在线观看| 久区视频| 天天拍天| 91爰爱欧美| 超碰日本97美女人妻人人玩人人爱| 日韩操逼HD| 国产精品白领在线观看| 免费视频观看60秒| 亚州日韩97| 亚洲熟女综合| 久妇网| 九九RE视频在线精品| 福利操逼| 欧美大香蕉久| 思思热国产高清| 欧美色另类| 美女十八禁| 污电影在线观看| 蜜桃视频一区二区三区| 国内黄色精品| 91男女啊啊啊| 免费看毛片操穴| 色色色综合网| 午夜男人一级A片7777| 亚洲成a人片在线观看中文!!!| 一级人妻性爱视频| 家庭乱伦麻豆| 操逼操逼操| 射久久| 美女啊啊啊啊啊啊| 久久粉色| 啪啪自拍九九综合| 天天干18禁| 999热这里只有精品| 国产精品日日摸天天碰| 丝袜美腿91| 国产尤物在线三区| 亚洲天天自拍| 三及片网站| 中文字幕制服诱惑| 色综合91好| 欧美在线91| 亚洲伊人久久综合97| 13小男生GAY自慰脱裤子| 亚洲视频中文一区| 无码高清少妇久久| www.伪伪| 欧美亚洲日本视频久久久| 人人操人人摸人 | 五月天激情网图片| 黄色网址久久精品欧美喷水| 91人妻人人妻| 超碰 av 女人天堂| A男人的天堂| 色综合1991| 精品国产99999| 久久久一区二区三区四区五区| 少妇久久久| 亚洲日本激情| 无码 有码 国产18p| 九九RE视频在线精品| 涩涩五月天| 超碰在线人妻不卡| 婷婷九月国产| 日韩15p| 无码区蜜乳| 婷婷中文网| 殴美性色a级欧美| 丁香婷婷激情五月天无毒不卡 | 天天做天天爱| 国产在线视频二区| www久久99| 日韩精品人妻中文字幕有码午| 亚州色国| 久久精品国产亚洲粉嫩| 国产午夜福利专区综合| 国产在线视视频有精品| 77777亚洲蜜臀精品久久综合蜜臀| 闷骚老熟女15P| 东京热AV男人的天堂| 秋霞色色影院| 日韩人妻一区二区精品| 啊嗯好大视频在线观看| 天天搞欧美| 色吧5亚洲| 免费啪啪啪网站18岁| 精品国产污一区二区三区| 久久久熟女一区| 欧美不卡五十路| 欧美性爱另类综合| 在线观看视频91| 九九九九精| 国产小视频91| 久久久中文版| 成人久久久| 日本精品成人无码| 久久一二三四不卡 | 亚洲无码99| 人妻激情在线视频| www.亚洲成人一区| 国产久久一区二区午夜| 欧美色图小说综合| 国产黄片精品在线| 蜜臀AV一区二区三区激情综合| 亚洲精品97p| 久久精品国产亚洲AV无码做| 超碰 另类 欧美| 91麻豆天美传媒在线| 亚洲av淫乱| 青娱乐手机日韩在线视频| 欧美欧美啪啪视频| 天天流夜夜操| 国产午夜精品一区二区三区牛牛| 日韩人妻播放| 欧美91网站| 色欲三区| 超碰97玖玖爱| 深夜福利黄片| 亚洲丝袜色| 精品国产乱码久久久| 偷窥自拍A片| 久久精品高清无码一区| 亚洲一级性爱视频免费看| 天天做天天爱天天爽AV| 国产一级舔足在线观看| 国产精品白虎| 国产v亚洲v日韩v欧美v片另类| 99在线精品观看99| 欧美在线亚洲| 大香蕉人妻| 日本三级精品| 99视频内射三四| 色欲天香天天综合网-成年人三级片网站-欧美乱妇狂野-日韩国产专区-久久久久久 | av东京热男人的天堂| 国产精品原创巨作?v网站| 殴美综合色88| 国产日韩色综合| 91精品国久久久久久无码| 粉嫩av久久一区二区三区| 东北女人| 近亲乱伦一区二区| 久久久久深夜无码| 色吧五月| 日韩欧美加勒比| 亚洲另类色图片| 国产久久免费精品视频| 色欲色香天天天综合网www-亚洲综合国| 第四色奇米影视777| 欧洲自拍色图gif在线| 欧美三级中文字幕hd| 久久久精品,3| 色穴精品| 激情抓乳插进去啪啪啪日韩| 嗯嗯啊啊啊啊轻点视频| 日本岛国黄色网址| 九九九免费视频| 欧美情色男人的天堂| 色狠狠 - 百度| a啊啊啊啊啊啊啊啊一区二区| 天堂蜜桃无码视频一区二区| 精品无码一区二区三区| 欧美亚洲国产日本在线,久久精品国产| 日本性爱网址| 成人怡红院| 麻豆国产第一| 久久久九九网站| 色色毛片| 97超碰色中文字幕| 一道本久久棕合爱| 欧美综合娱乐久久| 青青青青青手机视频| 久久AV无码1区2区3区| 美女一区二区国产精品| 97国产超碰| 加勒比伊人影院| 日日夜夜天天| 国产 日韩 欧美高清| 亚洲 欧美综合| 精品无码一二三四区| 99婷婷| 天天草夜夜草高潮片| 国产区在线| 欧美少妇性乱| 校园春色综合| 免费操逼视频下载| 久久 国产 无码| 久久9精品| 欧美国产操逼| 欧美熟妇精品黑人巨大一二三区| 在线观看黄色电话| 青青免费在线视频一区 | 精品久久久av| 激情看片网站| 熟女五十路一区二区三| 性猛交| 玖色av| 青青青艹在线视频| 日韩专区数据列表-第3230页-精品国产一区二区三区香蕉 久久99熟女人妻中文字 | 精品一区二区在线针对华人免费观看这里只有精品免费观看 | 久久久久国产精品喷潮免费观看臀| 91成人18| 亚洲综合嫩| 亚洲自拍青操视频| 天美传媒AV国产在线| 国产精品久久久视频| 亚洲天堂99| 日本精品高清一二区一本到| 国产精品一区av在线| 蜜臀久久99精品久久久电影| 亚州欧美在线| 91中文字幕在线观看| 日日骚精品视频| 97超碰亚洲| wwe 天天干.com| 久操B网| 精品国产乱码久久久久A| 久久性爱免费送| 人人摸人人干人人拍97| 人妻 中文 日韩| 人人操人人插人人摸人人干| 男女猛烈无遮掩视频免费软件| 九九九九精品九九九九| 欧美色乱| 国语少妇精| 亚洲美女精品九九视频| 人妻熟女一区二区在线视频| 快播久久人人aV| 天天日骚逼熟女| 亚洲色棕合| 久久精品成人| 国产激情在线| 久久内射| 天天综合欧美| 69天堂| 国产v亚洲v日韩v欧美v片另类| 久久久久久久九九九九| 91制服丝袜中文字幕| 亚洲熟女综合网| 91丝袜在线播放| 天天射夜夜操| 日韩簧片免费看| 天天艹天天日| 无码人妻丰满热妇又大又粗| 强奸乱伦动态污图免费| 综合欧美日本三级| 国产99热| 啊啊啊好爽快点啊啊啊嗯嗯| 青青草九九九九九| oumeisetupian| 久久久久久9999| 中文一区二区| 校园激情狠狠四射| 国产一国产一级毛片古装| 富女玩鸭子一级毛片| 日韩欧美大力操| 亚洲导航深夜福利| 久久久久9| 欧美精品另类人妖xxxx| 884t在线| 偷拍亚洲情色| 无码78| 亚洲欧洲综合成人av一区| 国产亚洲精品玖玖玖在线观看| 色牛牛AV| 97爱爱爱综合| 97精品久久久久中文字幕| 久久久久幕乱码| 97超碰中文在线| 日韩精品在线观看观看| 丁香婷婷大香蕉| 久久伊人在线五区| 蜜桃臀一区二区aV| 97免费在线观看| 日本性爰一道本| 这里只有精品视频| 欧美视频激情久久久久久| 亚洲丝袜二区在线| 强奸乱伦 亚洲一区| 国产无码一二三区| 亚洲宗合电影| 97 国产精品| 另类亚洲一区二区三区| 91粉嫩萝控精品福利网站_精品影音先锋国 | 五月丁香激情综合| 一区麻豆 高清中文字幕| 少妇精品久久久八区九区| 97超碰站| 亚洲图片欧美在线视频| 欧美 日韩 国产传媒| 亚洲第二页| 国产特级毛片AAAAAA高潮流水| 婷婷久久网| 亚州熟妇精品| 国产高清亚洲日韩一区| 日本精品不卡一二三区| 熟女中出视频| 97欧美在线| 欧美精品1区2区3区| 99啪啪| 爱逼综合| 亚洲黄色影视| AV色图| 久久精品国产AV一区二区三区| 长长久久免费视频| 久久久久久裸体| 午夜福利激情在线视频| 91xingse| 亚洲高清色综合| 国产男女无套视频免费观看| 亚洲第91页| 国产精品一区二区手机看片| 69人妻精品一区二区绯色| 自拍第一页| 美女操逼福利视频| 99蜜桃臀亚洲成人在线观看| 啊啊啊好想要| 韩日精品四区| 麻豆熟妇乱妇熟色A片在线看| 国产精品久久久久中文字幕| 欧美中文狠| 看免费的黄片| 亚洲五区熟女| 成全动漫视频观看免费下载| 熟女丰满人妻一区| 高清无码人妻久久久一区二区三区aⅴ| 小情侣高清国产在线视频| 色妇91| 综合免费无码中文| 久久一本大香蕉 | 色综九九九一区| 亚洲最大AV网| 亚欧美色图| 欧美麻豆成人同性GⅤ在线| 豆1无夜无码| 久久亚洲AV成人精品无码| 九七毛片九九毛片| 夜嗨影院| 人妻喷水| 久99| 亚洲加勒比| 天天操天天射青青草| 中文字幕在线免费观看2| 观看视频图片一区二区三区| 精品国产av一区二区三区四区入口| 天堂av2019| 18禁在线视频| 欧美78| 日本国产欧美高清在线| 国产97综合| av大香蕉| 中文字幕精品探花视频| 日少妇亚洲版| 日韩无码a片| 伊人在线大香蕉二。| 一区二区三区机械有限公司| 2017天天插| 熟妇熟女一区二三区| 亚洲精品一区二区精品| 激情小说亚洲图片| 婷婷久月| 欧美亚洲自拍另类人妻| 91AV天堂| 99久久99九九99九九九| 91丝袜美女视频| 欧美 亚洲 大香| 艹比视频国产精品| 天天天肏屄肏屄肏屄欧美欧美| 麻豆60秒| 亚洲欧美自拍偷拍| 91色欧美| 大香蕉欧美伊| 中文字幕性感少妇av| 97超碰超碰| 九一综合网| 天天爽爽爽爽| 变态乱伦伪娘灌肠一区二区| 午夜视频久久久| 啊嗯好大视频在线观看| 可以在线观看AV的网站| 亚洲无码一区成人免费午夜 | 国产美女销魂在线观看不卡| 一区超碰一区| 久久久噜噜噜久久久| 黄色网址在线免费观看| 97色色色| 日韩 女同 综合| 久操99| 啊视频在线| 亚洲AV秘无码一区..| 99999久久精| 中文字幕第23区| 天天淫人人妻日日色| 日韩激情啪啪| 亚洲啪啪视频免费| 久久线上视频免费看| 亚洲人妖网| 日韩天美| 成人av动漫在线观看| 免费福利视频中文字幕| www欧美91| 丰满丝袜少妇AV| 亚洲欧洲精品成人| 中文字幕精品一区二区精品| 精品亚洲国产成人av网站| WWW.操逼.COM| 三四中文字幕| 国产超碰97| 夜夜 中文视频rt| 蜜桃在线观看一区二区三区 | 欧美美女视频| 日韩干B| 国产精品久久久久久久免牛肉蒲团| 最新AVzaixian| 激情久久久| 国产欧美亚洲精品a第2页| 国产女人高潮嗷嗷嗷叫小说| w w w.久久精品| 麻豆成人AV| 青青草原香蕉日本Ap| 蜜臀th| 久久久久元码视频| 国产美女精品| 久久亚州高清| 欧美亚洲国产自久久| A V少妇特黄三级| 国产97色在线| 亚洲最大无码中文字幕网站| 国产无马视频| 国产亚洲精品农村妇女| 欧美日产国产在线成人第一区| 一区二区三区美女超清| 黑人娇小av在线播放| 91精片| 久久夜夜| av三级电影在线播放| 中文字幕99999| 蜜桃狠狠色伊人亚洲综合网站| 男人天堂资源| 凹凸精品熟女在线观看| 欧美夜夜| 成·人免费午夜在线观看| 日本一级真人黄色性爱视频| 啊啊啊啊啊啊在线观看| 超碰97亚洲| 一级黄色性爱裸体视频| 综合伊人网12色| 精品美女久久久久| 欧美亚洲一级在线观看| 色综合久久av| 91社操逼| 欧美日韩国产色图在线| 国产成人精品亚洲日本| 激情视频网址| 97久久精品亚洲| 97内射偷拍| 91丝袜美腿片|