論AI有沒有用:用任務(wù)分類與實(shí)測(cè)指標(biāo)驗(yàn)證大模型真實(shí)價(jià)值)
Ed Zitron 對(duì) AI 的整體判斷是近兩年科技圈最容易被轉(zhuǎn)發(fā)的觀點(diǎn)之一。他批評(píng)AI營(yíng)銷話術(shù)、企業(yè)為概念買單、估值和真實(shí)收益嚴(yán)重脫節(jié)這些批評(píng)放在很多發(fā)布會(huì)場(chǎng)景里確實(shí)成立。但我做完一批AI編程、AI Agent、AI應(yīng)用開發(fā)的落地測(cè)試之后越來越覺得至少在“AI沒有真實(shí)價(jià)值”這個(gè)方向性結(jié)論上Ed Zitron 的判斷是錯(cuò)的。把AI當(dāng)成一個(gè)懸浮在PPT里的概念確實(shí)看不到價(jià)值把AI當(dāng)成一組有明確邊界、可驗(yàn)證、可迭代的工具價(jià)值會(huì)變得非常具體。這篇不是要全面否定一位評(píng)論者而是要把“AI到底有沒有用”從一個(gè)情緒問題改造成一個(gè)工程問題。1. 為什么“AI是泡沫”很流行卻解釋不了大量真實(shí)工具在跑1.1 批評(píng)者的素材來源大多停留在發(fā)布會(huì)和財(cái)報(bào)Ed Zitron 式的批評(píng)能引發(fā)共鳴是因?yàn)樗峁┝撕芏嗫雌饋硖貏e真實(shí)的素材一家公司改個(gè)名字股價(jià)就漲、一個(gè)產(chǎn)品發(fā)布會(huì)講了一堆愿景但沒有具體性能、一個(gè)平臺(tái)投入巨大卻看不到用戶留存。這些話術(shù)在資本市場(chǎng)上確實(shí)大量存在很多企業(yè)高管也確實(shí)說不清楚自己為什么要上AI項(xiàng)目。但這里有一個(gè)容易被混淆的地方資本市場(chǎng)的現(xiàn)象不能直接等同于技術(shù)能力。估值漲跌反映的是參與者的預(yù)期和情緒不是模型在代碼補(bǔ)全、文本抽取、工單分類、知識(shí)庫(kù)問答這些具體任務(wù)上的實(shí)際輸出質(zhì)量。如果想要判斷AI是不是泡沫應(yīng)該看生產(chǎn)環(huán)境里的調(diào)用日志、錯(cuò)誤率、人工修正量、用戶實(shí)際使用時(shí)長(zhǎng)而不是只看新聞標(biāo)題。我最早也容易被這類批評(píng)帶偏。后來連續(xù)參與幾個(gè)內(nèi)部AI項(xiàng)目才發(fā)現(xiàn)那些在輿論上沒有影響力的工具可能正在每天處理幾萬條工單。它們沒有開發(fā)布會(huì)不叫“大模型產(chǎn)品”只是一個(gè)很小的AI服務(wù)嵌在審批流里輔助分類但價(jià)值是能算出來的。1.2 “估值貴”和“能力假”是兩件完全不同的事很多人把“AI創(chuàng)業(yè)公司估值過高”直接理解成“AI技術(shù)上做不到”。這是兩回事。一個(gè)領(lǐng)域可以同時(shí)具備兩個(gè)特征資本層面有泡沫技術(shù)層面有真實(shí)進(jìn)展。20世紀(jì)90年代互聯(lián)網(wǎng)也有大量泡沫但網(wǎng)絡(luò)基礎(chǔ)設(shè)施、在線交易、信息檢索這些能力后來都被證明是真實(shí)價(jià)值。批評(píng)者如果只看到泡沫就會(huì)錯(cuò)過一個(gè)更重要的問題泡沫破掉之后哪些能力會(huì)留下來?,F(xiàn)在可以觀察到的一個(gè)趨勢(shì)是AI基礎(chǔ)設(shè)施、AI編程、AI Agent、私有化部署、AI數(shù)據(jù)分析這些方向不是靠發(fā)布會(huì)撐起來的而是靠開發(fā)者一遍遍調(diào)用跑出來的。一個(gè)工具如果連續(xù)幾個(gè)月都有穩(wěn)定的調(diào)用量那它一定解決了某些人的某些問題。1.3 被大量評(píng)論忽略的中間層AI不只有對(duì)話機(jī)器人公開報(bào)道里AI總是被塑造成一個(gè)全知全能的通用助手。但在真實(shí)生產(chǎn)環(huán)境里AI最常見的形態(tài)是小任務(wù)、窄場(chǎng)景、低姿態(tài)。比如用戶反饋?zhàn)詣?dòng)分類客服對(duì)話摘要合同條款信息抽取代碼注釋和單測(cè)生成商品標(biāo)題改寫會(huì)議紀(jì)要素材整理這些場(chǎng)景不會(huì)出現(xiàn)在科技媒體的頭條里因?yàn)樗鼈儾粔蛐愿幸膊痪邆洹邦嵏惨磺小钡膽騽_突。但恰恰是這些任務(wù)讓AI在很低的容錯(cuò)成本下產(chǎn)生了明確收益。這里的關(guān)鍵不是模型能不能像人一樣思考而是流程設(shè)計(jì)者能不能找到那些“輸入輸出穩(wěn)定、重復(fù)度高、錯(cuò)誤可修正”的任務(wù)。注意判斷AI有沒有用不能只看一個(gè)演示視頻也不能只聽一篇評(píng)論文章。正確做法是選一兩個(gè)具體任務(wù)跑完幾十條真實(shí)樣本再下結(jié)論。2. 批評(píng)者最常犯的錯(cuò)把一次糟糕的演示當(dāng)成全部結(jié)論2.1 用錯(cuò)誤的任務(wù)去測(cè)試文本生成模型很多針對(duì)AI的批評(píng)測(cè)試方式本身就存在問題。有人拿一個(gè)沒有聯(lián)網(wǎng)能力、沒有內(nèi)置實(shí)時(shí)數(shù)據(jù)接口的模型去問“今天北京的天氣怎么樣”得到錯(cuò)誤答案后就宣布“AI是弱智”。這其實(shí)是把信息檢索任務(wù)和語言理解任務(wù)混在了一起。大語言模型本質(zhì)上是概率性的文本生成器它既不是一個(gè)完整知識(shí)庫(kù)也不是搜索引擎。如果你需要實(shí)時(shí)天氣應(yīng)該給它查詢天氣的API如果你問的是私有知識(shí)庫(kù)內(nèi)容應(yīng)該先接RAG如果你要算精確財(cái)務(wù)數(shù)據(jù)應(yīng)該用代碼執(zhí)行引擎而不是讓模型直接心算。這就像一個(gè)測(cè)試者要求一把錘子去擰螺絲失敗后得出結(jié)論“所有工具都沒用”。問題不在模型而在需求定義。2.2 單次主觀體驗(yàn)好或壞不能替代統(tǒng)計(jì)驗(yàn)證AI輸出存在隨機(jī)性。同一個(gè)問題兩次問可能得到不同的表述甚至有個(gè)別錯(cuò)誤。批評(píng)者很容易抓住一次離譜的回答支持者也很容易展示一次驚艷的回答。這兩種方式都是典型的采樣偏差。我在做評(píng)測(cè)時(shí)一般會(huì)這樣做把temperature調(diào)到一個(gè)合適水平固定模型版本用同一條輸入反復(fù)跑20到50次再統(tǒng)計(jì)錯(cuò)誤類型。很多看似“智力不夠”的問題拆開來看其實(shí)是兩類第一類答案內(nèi)容是對(duì)的但格式不滿足要求。第二類關(guān)鍵字段出現(xiàn)幻覺屬于事實(shí)錯(cuò)誤。第一類通過約束輸出格式、增加解析校驗(yàn)就能解決。第二類需要加檢索、工具、人工兜底或者調(diào)整任務(wù)邊界。如果批評(píng)者把所有錯(cuò)誤都?xì)w結(jié)為“AI不行”就錯(cuò)過了非常具體、可修的工程問題。2.3 拿“不能替代人”去否定“不能輔助人”另一個(gè)常見的邏輯跳躍是拿“AI不能自動(dòng)完成整個(gè)崗位的工作”來否定AI的價(jià)值。這個(gè)標(biāo)準(zhǔn)定得太高了。現(xiàn)實(shí)中幾乎沒有任何軟件能直接替代一個(gè)完整崗位但幾乎每個(gè)軟件都可以提升某個(gè)環(huán)節(jié)的效率。拿客服場(chǎng)景來說AI客服單獨(dú)回答用戶問題確實(shí)可能只有70%的準(zhǔn)確率如果讓AI直接面對(duì)所有用戶會(huì)產(chǎn)生災(zāi)難性體驗(yàn)。但如果換一種用法讓AI先處理重復(fù)度高、規(guī)則明確的前置問題再把復(fù)雜問題轉(zhuǎn)給人工效果就完全不同。它沒有替代客服但減少了客服的重復(fù)勞動(dòng)讓有經(jīng)驗(yàn)的客服能把時(shí)間花在真正需要判斷的溝通上。AI編程也一樣。它不能自己理解一套亂糟糟的業(yè)務(wù)需求并完成系統(tǒng)重構(gòu)但它可以幫你生成樣板代碼、補(bǔ)一個(gè)單元測(cè)試、解釋一個(gè)陌生報(bào)錯(cuò)、把一段長(zhǎng)函數(shù)拆成更小的模塊。這些收益不需要AI達(dá)到“全自動(dòng)程序員”水準(zhǔn)只需要比“從零開始寫代碼”少花十分鐘就已經(jīng)是正向收益。3. 正確判斷AI有沒有用先給任務(wù)分類再定驗(yàn)收指標(biāo)3.1 不是所有任務(wù)都適合用大模型最容易翻車的AI項(xiàng)目往往是從“這事看起來很適合”開始而不是從“這事在工程上可以被校驗(yàn)”開始。判斷任務(wù)適不適合用大模型可以先看幾個(gè)條件任務(wù)描述是不是清晰輸入輸出是否可以被結(jié)構(gòu)化記錄錯(cuò)誤是否容易被發(fā)現(xiàn)和修正數(shù)據(jù)量是否足夠支撐效果評(píng)估業(yè)務(wù)能否容忍一定比例的錯(cuò)誤或者是否有兜底機(jī)制如果這些條件大部分成立項(xiàng)目就值得小規(guī)模嘗試。如果任務(wù)本身模糊、沒有固定輸入格式、結(jié)果也無法評(píng)判那無論用多少層語義推理都會(huì)變成黑箱。3.2 任務(wù)分類是選型的第一步在實(shí)際落地時(shí)可以把任務(wù)粗略分成三類A類任務(wù)信息抽取、格式轉(zhuǎn)換、標(biāo)題生成、摘要、關(guān)鍵內(nèi)容歸類、代碼片段輔助。這類任務(wù)通常只需要模型在給定文本上做轉(zhuǎn)換輸出容易驗(yàn)證錯(cuò)誤成本低適合直接使用大模型。B類任務(wù)專業(yè)問答、數(shù)據(jù)分析、企業(yè)知識(shí)庫(kù)服務(wù)。這類任務(wù)需要接入外部知識(shí)庫(kù)、數(shù)據(jù)庫(kù)或工具不能單靠模型記憶。它同樣可行但工程復(fù)雜度明顯上升。C類任務(wù)關(guān)鍵業(yè)務(wù)決策、高精度計(jì)算、實(shí)時(shí)狀態(tài)判斷、需要嚴(yán)格審計(jì)的流程。盡量避免讓純模型直接完成最終判斷應(yīng)該把模型結(jié)果當(dāng)作草稿由規(guī)則、程序或人來復(fù)核。3.3 最小驗(yàn)證實(shí)驗(yàn)怎么設(shè)計(jì)如果條件允許我更建議做一個(gè)最小可行實(shí)驗(yàn)而不是先爭(zhēng)論“AI有沒有用”。實(shí)驗(yàn)流程大概是選擇一條真實(shí)業(yè)務(wù)流程中的具體任務(wù)。收集20到100條歷史輸入最好覆蓋不同寫法、不同長(zhǎng)度、不同風(fēng)格的樣本。由業(yè)務(wù)方先給出參考輸出作為質(zhì)量基準(zhǔn)。先用規(guī)則、模板或人工方式記錄基線耗時(shí)和正確率。再用大模型對(duì)同樣樣本生成結(jié)果。讓人對(duì)輸出做盲評(píng)判斷結(jié)果是否可用、需要改多少、單條能節(jié)省多少時(shí)間。為什么要用20條以上因?yàn)?條樣本只能給你一個(gè)方向性感覺覆蓋不了輸入多樣性。為什么一開始不用1000條因?yàn)闃?biāo)注成本太高而且還不確定方案是否值得投入。先用小樣本把方向走通再擴(kuò)大樣本量是比較穩(wěn)妥的路徑。3.4 驗(yàn)收指標(biāo)要提前定好很多AI項(xiàng)目失敗不是模型調(diào)用失敗而是沒有在開始前定義“什么叫做成功”。建議至少記錄以下幾個(gè)維度指標(biāo)含義判斷口徑可用率輸出不需要修改或僅輕微修改就能使用的比例由業(yè)務(wù)方按自己標(biāo)準(zhǔn)打分人工修正量每個(gè)輸出平均需要改多少字或多少字段修正量越小自動(dòng)化價(jià)值越高單條耗時(shí)從調(diào)用到返回結(jié)果需要多少秒要和業(yè)務(wù)流程可接受時(shí)延對(duì)比失敗率輸出空、超時(shí)、解析失敗的占比生產(chǎn)環(huán)境必須記錄單條成本包括模型調(diào)用、人工審核、重試費(fèi)用的總成本不計(jì)失敗和審核的成本沒有意義這些指標(biāo)不能拍腦袋。如果某個(gè)任務(wù)人工處理一共需要兩分鐘AI處理后還需要業(yè)務(wù)人員改三分鐘那這個(gè)項(xiàng)目就不該繼續(xù)。好與不好要看數(shù)據(jù)說話。注意設(shè)置temperature、max tokens、重試次數(shù)等參數(shù)時(shí)一定要先確認(rèn)線上使用的模型版本和評(píng)測(cè)時(shí)一致。否則你辛苦調(diào)好的效果可能換一個(gè)模型版本就完全變了。4. AI Agent、AI編程和模型部署從 Demo 到生產(chǎn)的細(xì)節(jié)4.1 Demo能跑通不代表任務(wù)能閉環(huán)很多AI項(xiàng)目在Demo階段表現(xiàn)非常好。給一段輸入模型輸出一段像模像樣的結(jié)果所有人都很高興。但放到生產(chǎn)環(huán)境后問題才會(huì)逐漸暴露輸入文檔可能帶掃描噪聲用戶可能傳了一個(gè)十幾頁的PDF某個(gè)字段可能為空網(wǎng)絡(luò)請(qǐng)求可能超時(shí)返回結(jié)果可能被截?cái)唷R訟I編程工具為例單個(gè)函數(shù)的自動(dòng)補(bǔ)全可能讓人驚喜但放到真實(shí)項(xiàng)目里還要面對(duì)依賴版本沖突、編譯錯(cuò)誤、測(cè)試失敗、代碼風(fēng)格不一致等問題。工具能幫你補(bǔ)全一段函數(shù)但它不能保證這段函數(shù)能融入現(xiàn)有架構(gòu)。所以我一般建議任何AI能力在上線前都要拆成兩層看第一層單次能力是否可用。第二層連續(xù)跑20次甚至100次后錯(cuò)誤率、穩(wěn)定性、異常處理是否可接受。單次能力像一道閃光連續(xù)跑完一批真實(shí)輸入才像一盞穩(wěn)定的臺(tái)燈。你要的是燈不是閃光。4.2 生產(chǎn)環(huán)境需要盯住的核心參數(shù)模型部署和API調(diào)用不是把請(qǐng)求發(fā)出去就完事了。以下是幾個(gè)最容易被忽略、但對(duì)結(jié)果影響很大的參數(shù)參數(shù)影響常見處理思路模型版本不同版本能力差異很大測(cè)試、灰度、生產(chǎn)必須鎖定同一個(gè)版本temperature影響隨機(jī)性抽取、分類任務(wù)調(diào)低創(chuàng)意寫作可稍高max tokens輸出太長(zhǎng)會(huì)截?cái)嗵滩粔蛴酶鶕?jù)任務(wù)最大輸出預(yù)留余量超時(shí)時(shí)間請(qǐng)求阻塞會(huì)拖垮流程按任務(wù)耗時(shí)給合理超時(shí)避免無限等待重試次數(shù)網(wǎng)絡(luò)抖動(dòng)可能造成偶發(fā)失敗設(shè)置重試但要防止雪崩并發(fā)數(shù)同時(shí)請(qǐng)求太多會(huì)被限流小樣本測(cè)試時(shí)不要一上來就開高并發(fā)prompt 版本每次修改都會(huì)改變輸出建議對(duì)prompt做版本管理輸出格式模型可能不按格式來用JSON Schema或正則校驗(yàn)失敗重試這些參數(shù)不存在統(tǒng)一的“最佳配置”。每類任務(wù)的合理值不同。比如代碼生成任務(wù)適合稍微高一點(diǎn)的temperature因?yàn)樗枰鄻有院贤畔⒊槿∪蝿?wù)則應(yīng)該盡量讓輸出固定所以temperature要低。4.3 AI Agent的評(píng)價(jià)不能只看最終結(jié)果AI Agent 比單純的大模型調(diào)用更復(fù)雜。它可能會(huì)拆解任務(wù)、調(diào)用工具、讀取結(jié)果、再次決策形成多輪操作。這時(shí)如果只看它最終返回的結(jié)果你很難判斷問題出在哪一步。建議對(duì)Agent的每次運(yùn)行都記錄以下信息任務(wù)輸入和預(yù)期結(jié)果Agent拆解出的步驟列表每一步調(diào)用了什么工具工具返回了什么內(nèi)容每一步耗時(shí)和token消耗最終結(jié)果是否滿足預(yù)設(shè)格式連續(xù)多次運(yùn)行的成功率如果Agent經(jīng)常失敗先不要急著換更大的模型先看日志里哪一步出錯(cuò)。很多失敗來自工具參數(shù)不對(duì)、搜索返回內(nèi)容不相關(guān)、輸入文本太長(zhǎng)、Agent在步驟中陷入循環(huán)。這些問題通過增加最大步數(shù)上限、優(yōu)化工具描述、補(bǔ)充錯(cuò)誤提示就能解決。5. 什么時(shí)候批評(píng)是對(duì)的什么時(shí)候批評(píng)會(huì)誤導(dǎo)選型5.1 Ed Zitron式批評(píng)在哪些場(chǎng)景成立Ed Zitron 的批評(píng)并不是完全沒有道理。如果一個(gè)企業(yè)的立項(xiàng)理由是“別人都在做AI”那么它大概率會(huì)失敗。如果一個(gè)項(xiàng)目不定義業(yè)務(wù)指標(biāo)只看模型演示效果那么它也確實(shí)可能成為成本黑洞。如果管理者相信AI可以完全替代有經(jīng)驗(yàn)的專業(yè)人員而不考慮錯(cuò)誤兜底這類項(xiàng)目翻車只是時(shí)間問題。在這些場(chǎng)景里批評(píng)者不是無聊而是在給過熱的市場(chǎng)降溫。AI行業(yè)確實(shí)有太多只是為了故事而存在的產(chǎn)品??吹竭@些項(xiàng)目翻車并提醒大家謹(jǐn)慎是有價(jià)值的。5.2 但“AI公司有泡沫”推導(dǎo)不出“AI工具沒有價(jià)值”Ed Zitron 那類觀點(diǎn)最值得商榷的地方在于把資本市場(chǎng)上的泡沫等同于技術(shù)能力上的虛妄。很多AI公司估值高是因?yàn)橘Y本集中在頭部玩家手里不是因?yàn)槊恳患掖竽P凸径寄軆冬F(xiàn)所有承諾。同樣很多AI項(xiàng)目失敗是因?yàn)檫x錯(cuò)了任務(wù)、定義不清指標(biāo)、沒有工程兜底不是因?yàn)榈讓幽P屯耆珱]用。我在使用AI編程工具時(shí)大量樣板代碼、重復(fù)性測(cè)試、格式轉(zhuǎn)換工作確實(shí)被明顯壓縮了。這個(gè)收益不需要依賴某一家公司的股價(jià)上漲。只要模型能穩(wěn)定完成一個(gè)具體任務(wù)哪怕它有明顯邊界它的價(jià)值就是可以被測(cè)量的。評(píng)論者可以嘲笑PPT里的宏大敘事但不應(yīng)該忽略代碼編輯器里實(shí)實(shí)在在的補(bǔ)全建議。5.3 更準(zhǔn)確的說法是什么如果讓我把“Ed Zitron Was Wrong About AI”翻譯成一個(gè)更精確的觀點(diǎn)我會(huì)這樣說他把“很多AI公司在浪費(fèi)錢”和“AI沒有創(chuàng)造真實(shí)價(jià)值”混成了一個(gè)判斷。前一句話在不少公司身上成立后一句話在大量實(shí)測(cè)任務(wù)里不成立。一篇好的技術(shù)批評(píng)應(yīng)該指出技術(shù)被夸大的地方也承認(rèn)技術(shù)已經(jīng)改變的部分。如果批評(píng)最后變成一個(gè)全稱否定它就會(huì)誤導(dǎo)一批本來能從AI輔助中獲益的普通用戶和中小企業(yè)。他們可能因?yàn)橐黄恼戮芙^嘗試一個(gè)實(shí)際能提升效率的小工具。5.4 別被輿論鐘擺帶著跑技術(shù)輿論經(jīng)常在兩個(gè)極端之間擺動(dòng)。今天說AI萬能明天說AI是騙局。對(duì)于長(zhǎng)期做實(shí)操的人來說這兩種姿態(tài)都是噪聲。正確的做法是回到自己的任務(wù)里用一組真實(shí)的輸入、明確的指標(biāo)、可接受的人機(jī)協(xié)作方式去驗(yàn)證它到底適不適合自己。資本市場(chǎng)的情緒會(huì)波動(dòng)模型版本會(huì)迭代但一個(gè)穩(wěn)定跑通的任務(wù)閉環(huán)不會(huì)因?yàn)橐黄u(píng)論消失。6. 與其爭(zhēng)論AI有沒有用不如跑一輪樣本測(cè)試6.1 一個(gè)團(tuán)隊(duì)可以快速執(zhí)行的驗(yàn)證思路如果現(xiàn)在你的團(tuán)隊(duì)還在因?yàn)椤癆I到底有沒有用”爭(zhēng)論不休我建議花三到五天做一輪最小的驗(yàn)證。不要一開始就規(guī)劃一個(gè)大型AI平臺(tái)先選一條具體的、重復(fù)度高的業(yè)務(wù)動(dòng)作。比如把客服對(duì)話整理成結(jié)構(gòu)化摘要把銷售線索描述歸類到對(duì)應(yīng)行業(yè)把代碼補(bǔ)全工具接入編輯器試用把產(chǎn)品評(píng)論自動(dòng)生成簡(jiǎn)短標(biāo)簽然后按下面這個(gè)節(jié)奏推進(jìn)第一天收集20到100條真實(shí)歷史數(shù)據(jù)。第二天讓業(yè)務(wù)人員給出參考輸出建立基礎(chǔ)答案。第三天用規(guī)則或人工跑一遍基線記錄耗時(shí)和成本。第四天調(diào)用大模型接口或部署一個(gè)開源模型嘗試生成同樣輸出。第五天讓業(yè)務(wù)人員盲評(píng)同時(shí)記錄成本和修正量。這一輪結(jié)束后你不需要看任何人的觀點(diǎn)文章也能知道AI在這個(gè)任務(wù)上是否值得投入。6.2 成本不能只算API費(fèi)用很多人在評(píng)估AI成本時(shí)只算顯式費(fèi)用比如每次調(diào)API花多少錢或者買顯卡花多少錢。但真正落地時(shí)還有隱性成本讓業(yè)務(wù)方寫參考輸出要時(shí)間產(chǎn)品經(jīng)理調(diào)prompt要時(shí)間開發(fā)人員接接口和寫校驗(yàn)邏輯要時(shí)間線上出現(xiàn)異常時(shí)人工排查也要時(shí)間。所以成本測(cè)算至少應(yīng)該包含以下幾塊模型調(diào)用費(fèi)用或本地部署資源數(shù)據(jù)準(zhǔn)備和輸入清洗成本Prompt開發(fā)和版本維護(hù)成本輸出格式校驗(yàn)、錯(cuò)誤重試處理成本人工審核或修正成本線上日志、監(jiān)控和問題修復(fù)成本把這幾項(xiàng)全部攤到單條任務(wù)上再對(duì)比原有人工處理的單位成本結(jié)論才有說服力。6.3 什么情況下可以說“這條任務(wù)真的有效”當(dāng)滿足以下幾個(gè)信號(hào)時(shí)基本可以認(rèn)為AI在任務(wù)中產(chǎn)生了實(shí)際價(jià)值連續(xù)跑完一批真實(shí)樣本后可使用率達(dá)到業(yè)務(wù)方接受的范圍。人工修正每條結(jié)果所花的時(shí)間明顯少于從零處理同樣任務(wù)的時(shí)間。單條總成本低于原有處理成本或者雖然略高但處理速度換來了更大價(jià)值。錯(cuò)誤類型可以追溯并且能通過規(guī)則校驗(yàn)、更清晰的prompt或檢索增強(qiáng)來降低。流程在連續(xù)運(yùn)行一段時(shí)間后仍然穩(wěn)定不會(huì)因?yàn)閭€(gè)別異常輸入直接崩潰。如果這些信號(hào)一條都不滿足那批評(píng)者的觀點(diǎn)在這個(gè)具體項(xiàng)目里就是成立的。你就不該繼續(xù)投入更不要強(qiáng)行包裝概念。這時(shí)果斷停下來反而是明智的決策。6.4 最終判斷要落到樣本和指標(biāo)上我看過太多討論AI價(jià)值的場(chǎng)合最后都變成立場(chǎng)之爭(zhēng)支持的人反復(fù)強(qiáng)調(diào)某個(gè)驚艷案例反對(duì)的人不斷引用某個(gè)翻車現(xiàn)場(chǎng)。這兩種討論都不能幫一個(gè)具體業(yè)務(wù)負(fù)責(zé)人做出決定。真正能決定“要不要用”的只有你自己的場(chǎng)景、樣本和指標(biāo)。評(píng)論文章可以提醒風(fēng)險(xiǎn)發(fā)現(xiàn)容易踩坑的地方但它替代不了你對(duì)真實(shí)輸入的處理。Ed Zitron 那些批評(píng)給我最大的提醒是不要為了一個(gè)宏大概念去投入資源。反過來他對(duì)AI價(jià)值全盤否定的趨勢(shì)也會(huì)讓一部分人在可能有效的任務(wù)前浪費(fèi)一次低成本驗(yàn)證機(jī)會(huì)。與其說服別人不如花兩天時(shí)間收集100條真實(shí)樣本跑一輪評(píng)測(cè)。數(shù)據(jù)和結(jié)果是爭(zhēng)論里最有說服力的東西。