
這次我們來看一個比“新模型上線”更值得討論的命題DeepMind 創(chuàng)始人 Demis Hassabis 在公開場合多次提出AI 正在從“記住數據”走向“理解世界”。這句話在國內 AI 社區(qū)和 CSDN 的討論熱度一直很高因為它不只是一條新聞更是一個技術路線判斷大模型是不是真的產生了對世界的內部表征我們離 AGI 究竟還有多少關鍵環(huán)節(jié)沒有打通這篇文章不打算做逐字訪談轉寫而是把“AI 開始理解世界”這個判斷拆成可討論的技術問題當前大模型具備哪些能力和 AGI 還差在哪里哪些能力已經有可驗證的評測方法哪些仍然屬于研究假設。內容會保持工程視角盡量把虛的討論變成可以落地的評估思路和觀察清單。如果你平時做 AI 應用開發(fā)、模型部署、AI Agent 相關工作或者只是關心大模型和 AGI 進展這篇文章可以直接收藏。1. AGI 議題速覽先把討論范圍列成一張表方便讀者判斷這篇文章是否值得繼續(xù)讀。議題說明討論對象“AI 開始理解世界”這一判斷背后的技術依據以及 AGI 距離的公開分歧技術關注點大模型推理能力、世界模型、多模態(tài)對齊、AI Agent 長程任務、評測體系涉及模型類型大語言模型、多模態(tài)大模型、強化學習智能體、AI 編程與圖像視頻生成模型當前可觀察現象模型能完成復雜推理、跨任務遷移、多模態(tài)理解和 Agent 工具調用主要瓶頸訓練數據墻、算力與能耗、評測體系不完善、模型可解釋性不足可落地驗證方法基準測試、能力涌現評測、隱空間表征分析、長程任務日志回放適合讀者算法工程師、AI 應用開發(fā)者、技術決策者、關注 AGI 進展的從業(yè)者需要先說明一個邊界本文不涉及具體未被確認的內部信息只使用公開訪談、公開論文和通用技術經驗。很多結論屬于行業(yè)共識或研究推測在正文中會用“從公開討論看”“按當前技術趨勢判斷”這類表達區(qū)分事實與判斷。2. “理解世界”在技術層面到底指什么Hassabis 所說的“理解世界”在深度學習領域有一個對應的技術問題模型在訓練完成后內部是否形成了對數據背后客觀規(guī)律的表征而不只是記住了輸入輸出的統(tǒng)計關聯。大語言模型的原理本身是“下一個 token 預測”本質上是在海量文本上學習條件概率。但近幾年的研究發(fā)現模型雖然以統(tǒng)計方式訓練內部卻會出現一些類似“線性表征”的結構。例如模型可以學會把詞義映射到隱空間中的方向向量某些方向對應性別、時態(tài)、情感等概念。更進一步的實驗表明模型在處理空間關系、物理常識、游戲環(huán)境時能夠在隱空間建立與真實環(huán)境較為一致的坐標映射。這就是“理解世界”這一說法的重要技術基礎模型內部可能不是為了死記硬背而是為了更高效地建模數據生成過程才發(fā)展出了世界模型式的表征。這也是為什么 2024 年以來很多實驗室開始關注“模型隱藏表征”的研究而不是只看最終任務得分。如果你在一個分類任務里只觀察到模型輸出正確你無法判斷它是記住了訓練樣本還是學到了規(guī)律但如果你能進入模型的隱空間觀察它對不同測試樣本的內部激活模式就能更接近真相。從這個角度看“AI 開始理解世界”和“AI 具備意識”是兩回事。前者是可檢驗的內部表征問題后者涉及主觀體驗目前還沒有可靠的技術實驗方法。我們在討論 AGI 時應該先把這兩件事分開。3. 當前大模型離 AGI 還有多遠從能力維度看3.1 語言與邏輯推理大語言模型在語言任務上已經非常接近人類水平。法律文本改寫、代碼生成、技術文檔寫作、數學競賽題解答這些能力在真實工作中已經具備實用價值。AI 編程工具甚至已經成為許多工程師的標準工作流AI 智能體也開始承擔自動寫代碼、自動跑測試、自動提 PR 的任務。但語言能力接近人類不等于推理能力接近人類。模型在復雜多步推理、反事實推理、需要嚴格因果邏輯的任務上仍然會出現系統(tǒng)性錯誤。尤其在信息不完整、需要主動澄清條件、需要區(qū)分相關性與因果性的場景下模型很難穩(wěn)定保持正確。推理能力的差距是 AGI 距離討論中最難量化、也最影響實際應用的部分。3.2 規(guī)劃與長程任務執(zhí)行AGI 非常重要的一環(huán)是規(guī)劃能力面對一個需要多步驟執(zhí)行、跨長時段、可能遇到環(huán)境反饋的任務模型能否自己把目標拆解成子任務并根據中途反饋調整計劃。當前基于大模型的 Agent 已經能完成簡單的多步任務例如讓 AI Agent 訪問網頁、調用搜索、讀取文檔、生成回復。但在任務步數超過幾十步、環(huán)境反饋稀疏、子任務之間需要嚴格依賴時錯誤會累積模型通常缺少“我走到哪一步了、哪些步驟已經失效、是否需要回退”的自我監(jiān)控能力。長程任務能力是當前從“大模型”走向“AGI”最明顯的短板之一。很多團隊發(fā)現推理能力很強的模型放到真實 Agent 工作流里表現并不穩(wěn)定核心原因正是規(guī)劃與錯誤恢復不足。3.3 多模態(tài)感知與世界感知多模態(tài) AGI 是最近討論非常密集的方向?,F在的模型已經能同時處理文本、圖像、音頻、視頻用戶可以直接上傳一張截圖讓模型分析 UI 結構上傳一段語音讓模型轉寫并總結。多模態(tài)對齊技術讓模型在不同信息形式之間建立統(tǒng)一語義空間這是“理解世界”的一個重要基礎。但需要區(qū)分的是多模態(tài)輸入不等于物理世界感知。模型能識別圖片里的杯子不等于它理解杯子在真實物理環(huán)境中的重量、材質、運動狀態(tài)。業(yè)界對此有過不少實驗模型對靜態(tài)圖片描述表現很好但在涉及物體數量、空間位置、連續(xù)動態(tài)變化的測試中會出現明顯錯誤。所以更穩(wěn)妥的判斷是模型建立了“跨越模態(tài)的符號理解”但還缺少“與真實物理世界持續(xù)交互”的能力。3.4 自主目標與數據獲取最后是數據和目標的問題。人類學習依靠與真實世界持續(xù)互動可以用低樣本快速學會新技能當前大模型主要靠靜態(tài)數據訓練無法在訓練完成后主動向環(huán)境提問、設計實驗、收集新數據來彌補知識盲區(qū)。即使加入強化學習模型的學習范圍也限制在獎勵函數設計的框架內。比如下棋 AI 可以在明確規(guī)則的空間里超越人類但在開放、模糊、需要自己定義目標的真實任務中模型并沒有表現出很強的自主性。數據獲取能力不足會直接限制模型向 AGI 靠近的速度。4. 驗證一個模型是否具備“世界理解”的評估方法與其爭論“AI 是否理解世界”不如直接設計一套可操作的驗證流程。下面是適合開發(fā)者和算法工程師落地的評估思路。4.1 任務設計思路評估“世界理解”不能只看單一任務的準確率至少應該覆蓋四個維度泛化測試模型在一個分布下訓練在另一個分布下測試觀察是否真的學到規(guī)律。反事實測試修改任務條件為不會出現在訓練集中的情況看模型能否正確推斷。長程穩(wěn)定性讓模型執(zhí)行多步任務觀察錯誤率是否隨步數增長。表征分析提取模型內部激活判斷是否存在與任務結構一致的線性表征。以一個二維房間導航任務為例可以這樣設計先讓模型閱讀房間描述再問它“從 A 點走到 B 點會不會經過 C 區(qū)域”。如果模型只背過訓練語料它會在新房間布局上表現明顯下降如果模型學到空間結構則能泛化到從未見過的房間數據。4.2 最小評估流程的代碼示例下面給出一段 Python 偽代碼用于搭建一個最小評估流程。實際使用時需要替換成目標模型的 API 或本地部署接口。# 最小能力評估示例泛化與反事實測試 import json tasks [ { type: in_distribution, context: 房間 A、B、C 按一字排列A 在最左C 在最右。, question: 從 A 走到 C會經過 B 嗎, answer: 會 }, { type: counterfactual, context: 房間 A、B、C 按環(huán)形排列A 與 C 直接相鄰。, question: 從 A 走到 C最短路徑必須經過 B 嗎, answer: 不必 } ] def evaluate_model(model_predict): results [] for task in tasks: response model_predict(task[context], task[question]) results.append({ type: task[type], correct: response.strip() task[answer], response: response.strip() }) return results # 使用方式將 model_predict 替換為真實模型調用函數 # results evaluate_model(my_model_predict)這段代碼的核心思想是把“理解”測試拆成分布內、反事實、長程三類樣本按類別統(tǒng)計準確率而不是給一個籠統(tǒng)的分數。如果反事實樣本準確率明顯低于分布內樣本說明模型更多依賴統(tǒng)計捷徑而非穩(wěn)定規(guī)則。4.3 隱空間表征的可視化分析如果需要更接近研究層面的驗證可以分析模型內部激活。常見方法是用 PCA 或探針分類器檢查模型隱向量中是否包含任務相關信息。# 提取模型隱向量并做線性探針分析示意 import numpy as np from sklearn.decomposition import PCA from sklearn.linear_model import LogisticRegression # hidden_states: 列表每個元素是模型對一條樣本的隱層輸出 # labels: 對應該樣本的目標標簽 hidden_matrix np.array(hidden_states) pca PCA(n_components2) projected pca.fit_transform(hidden_matrix) probe LogisticRegression() probe.fit(projected, labels) print(Probe Accuracy:, probe.score(projected, labels))如果探針準確率較高說明模型隱空間里已經包含可分離的任務信息如果探針準確率低但任務輸出正確說明模型可能用了其他路徑解決任務這種情況同樣值得關注。4.4 長程 Agent 任務的日志設計對 AI Agent 類系統(tǒng)建議在評估時記錄完整軌跡回放數據。{ task_id: task_001, task: 在測試環(huán)境部署服務并返回健康檢查地址, steps: [ {step: 1, action: read_docs, duration_ms: 200}, {step: 2, action: run_command, output: pytest passed}, {step: 3, action: deploy_service, output: http://127.0.0.1:8080/health} ], error_recovery: 1, final_status: success }通過日志可以清楚看到模型在哪里出錯、在哪里恢復、哪類任務需要人工干預。這樣可以把“Agent 是否智能”的抽象問題轉成具體的工程指標。5. 算力與工程約束AGI 不只是算法問題即使算法路徑正確AGI 的實現還面臨非?,F實的算力和數據約束。大模型的訓練需要大規(guī)模 GPU 集群訓練一次前沿模型需要數萬個加速卡級別的計算資源推理側的成本同樣不低支持長上下文、高并發(fā)、多模態(tài)推理的在線服務需要持續(xù)投入硬件。對絕大多數團隊來說真正的問題不是“模型能不能做到”而是“在成本可控的前提下能不能穩(wěn)定做到”。數據也是關鍵瓶頸。高質量公開文本數據正接近耗盡業(yè)界開始用合成數據、多模態(tài)數據和用戶反饋數據來補充。但合成數據可能導致模型偏差累積多模態(tài)數據來自真實世界采集又涉及隱私和版權。2024 年以來很多模型廠商的主要投入都集中在數據治理和版權合規(guī)上這說明數據問題已經從研究問題變成了商業(yè)問題。工程側還需要關注模型部署的高可用性分布式推理、容錯調度、顯存優(yōu)化、批量任務隊列、API 負載均衡。除非模型能直接在個人單卡上實時運行否則任何 AGI 能力都依賴底層系統(tǒng)工程。這也是為什么“AI 模型部署”“AI 工程實踐”成為當前行業(yè)熱門崗位方向。6. 不同觀點的分歧為什么有人說幾年有人說幾十年關于 AGI 距離的公開判斷存在很大分歧這些分歧本質上來自對不同能力的權重不同。樂觀派認為當前模型已經在語言、圖像、代碼、推理等多個維度接近人類基線只要繼續(xù)擴大模型規(guī)模、增加交互數據和強化學習AGI 可能在數年內出現。Hassabis 在多個公開訪談中給過“可能在一個十年內”這一量級的估計DeepMind 團隊的工作也一直在推進世界模型、多智能體、規(guī)劃能力等方向。中間派認為當前模型只是“非常優(yōu)秀的聯想引擎”在真實世界持續(xù)交互、自主目標設定、長期記憶、低樣本適應等方面仍遠未達到通用智能標準。即使某些單項能力超過人類也不代表整體系統(tǒng)具備通用性。他們傾向認為 AGI 需要新的架構突破而不是現有范式的簡單放大。懷疑派則認為大語言模型本質上是在擬合文本分布無法產生真正的世界理解如果不變更底層建模方式AGI 可能幾十年內都無法實現。這種分歧不是誰對誰錯的問題而是對“什么才算 AGI”的定義不同。工程團隊更應該關注的是可測量的能力項而不是時間點預測。7. 開發(fā)者應該怎么跟進 AGI 進展對普通開發(fā)者和技術團隊而言與其爭論 AGI 何時到來不如建立一套可長期使用的跟進機制。第一持續(xù)跟蹤權威評測基準。語言推理、多模態(tài)理解、Agent 任務、編程能力等方向都有公開榜單。不要只看模型宣傳稿里的演示要關注模型在第三方基準上的表現尤其是長文本、多步推理、抗幻覺類任務。第二建立自己的業(yè)務能力基線。選擇幾個和業(yè)務最相關的任務用固定測試集長期評測模型版本變化。模型升級時先跑回歸測試再決定是否切換避免個別能力上升但整體穩(wěn)定性下降。第三把 AI Agent 當成主線方向。AGI 的落地形態(tài)大概率不是“一個超大模型”而是多個模型 工具調用 工作流編排的組合系統(tǒng)。多關注 AI 智能體框架、工具調用協議、任務規(guī)劃與錯誤恢復機制這些能力在未來比模型參數量更重要。第四關注 AI 應用開發(fā)的合規(guī)邊界。生成模型可能復現版權內容、歪曲事實或泄露隱私。在真實項目中使用 AI 生成內容必須建立人工審核機制尤其是面向公開用戶的文字、圖像、音視頻內容。8. 常見誤區(qū)與認知偏差下面列出討論 AGI 時最容易出現的誤區(qū)建議收藏備用。誤區(qū)更接近事實的判斷模型考試分數高 已經理解世界分數高只能說明完成任務表現好內部機制是否造成真實理解需要額外實驗驗證模型會答反事實問題 具備邏輯推理部分模型可能通過訓練語料中的相似表述繞過真實推理模型輸出自然 有意識語言流暢度和主觀意識沒有已知的必然聯系AGI 是單一時間點事件AGI 更可能是能力逐步補齊的過程不同能力會有不同落地時間算力無限增加就能實現 AGI數據、算法、評測、工程共同決定上限算力只是其中一環(huán)只要本地部署大模型就是安全可控模型內部仍然可能產生不穩(wěn)定輸出需要評測和審核兜底9. 合規(guī)與使用邊界提醒討論 AGI 的能力時也需要同步討論使用邊界。無論模型能力多強在真實系統(tǒng)中使用 AI 都必須考慮以下問題訓練和輸入數據是否獲得合法授權是否包含個人隱私或商業(yè)機密。生成內容是否可能造成誤導例如偽造事實、生成虛假圖片或音視頻。面向用戶輸出時是否加入標識讓用戶知道內容來自 AI。模型是否會被用于自動化騷擾、深度偽造、繞過安全機制等惡意用途。在發(fā)布或商用前是否完成效果復核和風險測試。這些邊界不是“限制創(chuàng)新”而是讓技術可以持續(xù)被信任的前提。AGI 如果真要進入真實社會除了算法突破還必須配套完善的負責任使用框架。10. 總結與后續(xù)觀察點回到最初的問題DeepMind 創(chuàng)始人說“AI 開始理解世界”這個判斷是否成立從現有論文和實驗結果看模型內部確實出現了和真實世界結構對應對齊的表征這比早期純粹統(tǒng)計學習的判斷更有說服力。但距離 AGI仍然隔著長程規(guī)劃、實時交互、自主數據獲取和穩(wěn)定評測這幾道硬門檻。最值得驗證的能力不是模型寫詩或畫圖的能力而是它在長程任務中能否穩(wěn)定規(guī)劃、自我糾錯并遷移到新環(huán)境。最容易踩的坑則是把基準分數當成智能水平忽略模型在開放場景中的失效模式。建議有條件的技術團隊搭建自己的小規(guī)模評測集持續(xù)跟蹤模型演進而不是被階段性演示沖昏頭腦。下一步可以重點觀察幾個方向多模態(tài)模型的物理常識能力是否提升、AI Agent 長程任務成功率是否改善、推理模型是否會全面取代普通模型成為主流默認選項以及世界模型是否從研究走向實際產品。這些點每有一個突破AGI 距離就會被真實地拉近一步。