
會刷題不算什么能干活才真有用文魏琳華編劉俊宏多年以后人類或許會想起AGI時代的到來是在一個平平無奇的夜晚。9月3日整個AI圈可能都沒睡好。先是晚間全球AI大宕機就當(dāng)所有人準(zhǔn)備洗洗睡的時候9月4日凌晨三點半GPT-6 Astra亮相了。雖然發(fā)布會上OpenAI宣布還只對部分企業(yè)用戶開放不過好在它沒讓我們等太久。9月5日OpenAI全量推送了GPT-6 Astra讓付費用戶們及時體驗上了新模型?!皻g迎來到AGI時代。”在介紹GPT-6 Astra時OpenAI總裁Greg Brockman說。和前幾代大模型相比OpenAI交出的新模型成績上確實相當(dāng)耀眼正如模型的名字“星辰”它在多個關(guān)鍵基準(zhǔn)上跑出了“飽和”的成績把編程、長程任務(wù)的能力往上拔了一截。但“會刷題”算不得什么能干活才真有用。實際干活時GPT-6 Astra能做到“又快又省”——交付質(zhì)量更高的同時它單次任務(wù)的Token消耗和任務(wù)耗時都明顯低于上一代。Perplexity在自家AI研究智能體評估框架中甚至測出Astra的單次任務(wù)花銷低于Fable 5.1。發(fā)布不到一周Anthropic的新模型Fable 5.1就被GPT-6 Astra搶去了風(fēng)頭?,F(xiàn)場演示和網(wǎng)友實測里各種復(fù)雜的活兒都被丟給了它操作電腦、填表單、建網(wǎng)站甚至把電子原理圖排成可投產(chǎn)的PCB、在Blender里建好房間模型再轉(zhuǎn)進虛幻引擎讓用戶可以在建模場景中走動查看房屋細節(jié)。支撐這一躍遷的是又一次“大力出奇跡”據(jù)外媒報道GPT-6 Astra的訓(xùn)練動用了10萬 GPU 的集群是OpenAI迄今最大規(guī)模的一次訓(xùn)練。那么這一代模型到底變了什么所謂AGI時刻到底是真的還是只是又一次宣言性能“飽和”的GPT-6 Astra成色幾何這次GPT-6 Astra沒有“見光死”實際體驗和演示效果差距不大。昨天GPT-6 Astra已經(jīng)正式全量向所有訂閱用戶開放使用。早上曬出的一眾測評案例中有人驚嘆它干活的交付質(zhì)量有人提到它跑任務(wù)更省Token、成本低。具體到能力表現(xiàn)層面GPT-6 Astra在一些特定領(lǐng)域跑出了接近滿分的極限分數(shù)。人類的考卷已經(jīng)快“考不下”了。比如它在研究級數(shù)學(xué)基準(zhǔn)FrontierMath Tier 4跑到98官方形容為“飽和”也就是它的分數(shù)已經(jīng)達到了測試的上限在強調(diào)陌生環(huán)境中學(xué)習(xí)與抽象推理的ARC-AGI-3上GPT-6 Astra從上一代GPT-5.6 Sol的7.8%直接跳到99.9%??梢哉f是直接實現(xiàn)了“從0到100”的突破漏洞利用測試ExploitBench則直接滿分100%GPT-5.6 Sol為78.5%。最夸張的是ARC-AGI-3它相當(dāng)于把大模型扔進一個陌生環(huán)境不給規(guī)則說明看它能不能自己摸索規(guī)則并做出正確決策。這個測試對人類來說并不難100分輕輕松松但AI之前一直搞不定徘徊在不及格的區(qū)間。然后GPT-6 Astra就滿分了。三個月時間AI就進化成人類了用ARC Prize Foundation的Greg Kamradt的話來說“在96%的測試層級上Astra超越了我們的人類行為效率基線實際上達到了人類水平。”O(jiān)penAI是怎么做到的還是用了一點“手段”的——將模型和Harness打配合。這個99.9%的高分的前提是它跑在OpenAI為自家模型適配的Harness上所以效果會更突出。但這并不意味著去掉Harness就立刻“拉胯”。根據(jù)X上ARC Prize發(fā)布的測評結(jié)果是62.7%這已經(jīng)是第二名Claude Opus 5的兩倍。但這種成績還是容易令人質(zhì)疑。自家模型自家特調(diào)測出來的分這不是忽悠人么廠商自報分數(shù)用自家框架確實是常規(guī)操作DeepSeek上月底發(fā)布的DeepSeek V4 Flash官方在注釋里寫明基于自家DeepSeek Harness測得它還同步把Harness作為獨立產(chǎn)品推向市場。所以這并不是問題。不過GPT-6 Astra的提升也有些許“偏科”。從OpenAI給出的成績來看它在部分任務(wù)上出現(xiàn)了“倒退”的情況。以測評模型Agent能力的指標(biāo)之一——人類終極測試Humanity’s Last Exam上GPT-6 Astra的成績?yōu)?7.2%反而低于GPT-5.6 Sol與Fable 5.1。這樣的偏科成績也讓測評機構(gòu)給出了不一樣的評估分數(shù)。比如按照Artificial Analysis的通用智能指數(shù)Astra 為61.2與Sol的60.9基本持平導(dǎo)致新模型也被不少網(wǎng)友戲稱是“更貴版本的Sol”。但實際上AA測評的指標(biāo)更多集中在知識、推理等能力上GPT-6 Astra的強項多數(shù)不在它的測評范圍內(nèi)。說完上面這些“虛的”測試我們來看看GPT-6 Astra在商業(yè)化已經(jīng)被驗證領(lǐng)域的表現(xiàn)。在Coding場景上GPT-6 Astra顯然是沖著最強目標(biāo)沖擊的。它在Terminal-Bench 4.0測評智能體在復(fù)雜終端任務(wù)上的表現(xiàn)為57.9%超過了Fable 5.1的55.8%而GPT-5.6 Sol在這個基準(zhǔn)上只有37.3%。得益于編程能力的提升現(xiàn)在人們拿GPT-6 Astra已經(jīng)能做出媲美真實游戲的作品。不少網(wǎng)友已經(jīng)曬出了他們拿新模型做出的射擊游戲、開放世界冒險游戲等等。從建模和實際體驗來看已經(jīng)可以算得上成品級別。智能體維度相較于上一代GPT-6 Astra在長程任務(wù)的處理能力上了一個臺階。單看智能體維度的跑分其中GPT-6 Astra在Agents Last Exam真實軟件中完成金融建模、工程設(shè)計、媒體制作等專業(yè)任務(wù)拿到59.3%略高于上代Sol的53.6%OSWorld 2.0真實桌面環(huán)境里看屏幕、點鼠標(biāo)、敲鍵盤完成操作72.6%在跨系統(tǒng)業(yè)務(wù)流程的AutomationBench一項上GPT-6 Astra的得分從GPT-5.6 Sol的18.1%大幅提升至41.4%。那么強大能力的代價是什么訓(xùn)練出這樣的模型OpenAI靠的是又一次“大力出奇跡”。據(jù)外媒報道GPT-6 Astra的訓(xùn)練動用了10萬GPU的集群這是OpenAI迄今為止最大的訓(xùn)練規(guī)模。不得不感慨Scaling Law的強度還是立竿見影。但AI圈還有一個共識高分不一定就“高能”模型到底好不好用還得干活層面見真章。響應(yīng)更快、Token消耗更少 GPT-6更擅長“干活”比起跑分本次大家討論的一個共識是GPT-6 Astra充分展示了它“干活能力”的躍升——操作電腦、長任務(wù)、端到端交付等能力它的演示效果都讓打工人心動不已。X上展示的測評也高度一致地落在干活測評上。多數(shù)測評圖中GPT-6 Astra在“干的快、干的好”這兩項上遙遙領(lǐng)先Perplexity在自家面向AI研究智能體的評估框架中測試GPT-6 Astra不僅分數(shù)最高它花的錢也比Fable 5.1更便宜。是什么讓用戶紛紛“爽歪歪”主要是兩個關(guān)鍵體驗一是降低成本二是壓縮任務(wù)的處理時長。GPT-6 Astra討人喜歡就在于這兩點。通過有效降低任務(wù)輸出TokenGPT-6 Astra實現(xiàn)了降低成本的效果。不僅輸出冗余大幅精簡比如在考察復(fù)雜專業(yè)任務(wù)的Agents Last Exam最高分設(shè)置下相比Claude Opus 5少用了約65%的輸出Token面向終端任務(wù)的Terminal-Bench 4.0中Astra 的預(yù)估API成本比自家上一代Sol縮減約9%對比Fable 5.1的降幅更是高達63%。作為OpenAI的客戶Higgsfield AI CEO Alex Mashrabov表示Astra比他們測過的其他模型少用了高達20%的Token。時間消耗上和上一代模型相比GPT-6 Astra將部分任務(wù)的時間壓縮掉近一半。OSWorld 2.0上Astra完成一個計算機使用任務(wù)的平均耗時約40分鐘比上一代Sol的75分鐘少了 47%Mind2Web基準(zhǔn)上Codex任務(wù)完成速度做到上一代的1.9倍。這些改變不僅和模型各項能力提升相關(guān)可能和OpenAI采用的模型新架構(gòu)有關(guān)。據(jù)The Information報道OpenAI在GPT-6 Astra采用了一種叫“循環(huán)深度”recurrent depth的架構(gòu)技術(shù)它通過復(fù)用同一組網(wǎng)絡(luò)層進行多次內(nèi)部循環(huán)計算中間推理在隱藏狀態(tài)中完成不會全部轉(zhuǎn)化為輸出文本。簡單來說就是原來OpenAI o系列的思考模型基本上會把中間推理步驟以自然語言寫出來變成一條人類可讀的思維鏈。這種“想什么都寫出來”的方式好處是透明壞處是啰嗦一個復(fù)雜任務(wù)可能輸出幾千個Token的推理過程。新的架構(gòu)讓模型內(nèi)部思考更多但它輸出的Token卻減少了這讓它能在辦事時做到“又快又省”。從OpenAI的分享中另一個可以確認的事實是通過對Harness能力優(yōu)化是它辦事能力提升的關(guān)鍵。先從Computer Use計算機使用說起也就是讓大模型自主操作電腦瀏覽、干活的種種能力。對此OpenAI直接稱它“世界上最好的Computer Use模型”GPT-6 Astra把軟件當(dāng)作“人的工具”來用——讓AI填網(wǎng)頁表單、更新CRM記錄、整理日程分析數(shù)據(jù)出圖、搭好網(wǎng)站再自己跑一遍前端QA。OpenAI現(xiàn)場還展示了在KiCad里把電子原理圖排成可投產(chǎn)的PCB、在Blender建模后轉(zhuǎn)進虛幻引擎5讓設(shè)計師和客戶在3D場景中“看”到實際效果。根據(jù)平面圖GPT-6 Astra能從零搭建出完整的房屋3D模型包括墻體、門窗、樓層結(jié)構(gòu)等建筑元素。X上有用戶分享的實測效果對比中也能看到GPT-6 Astra的細節(jié)做得已經(jīng)相當(dāng)完善。第二處升級在Codex的“記憶”機制新增的跨上下文管理機制起到了作用。Astra可以跨上下文窗口保存“工作筆記”同時讓更早的完整上下文保持可搜索之前的消息和工具輸出都能找回。重點內(nèi)容主動記下來漏記的細節(jié)還能回頭翻避免因上下文壓縮導(dǎo)致細節(jié)丟失。此外Codex同步推出的“異步提問”機制做了一個產(chǎn)品細節(jié)上的優(yōu)化有開發(fā)者在X上貼出自己讓Codex連跑數(shù)小時的記錄模型在中途遇到歧義時不再卡死等人工確認而是先把能獨立推進的部分做完同時攢好問題等用戶回答。這層優(yōu)化簡直救了程序員的命。之前還得守在電腦前一步步確認需求現(xiàn)在AI終于能清凈一會可以多“摸會魚”了??偠灾瓽PT-6 Astra確實是一次重磅升級無論是能力還是實際應(yīng)用層面。但AGI時代有沒有到來很顯然現(xiàn)在還不該回答這個問題。參考電力時代的經(jīng)驗AI遲早會走到那一天——當(dāng)大模型解決復(fù)雜工作變得更快速、更便宜時AI本身的討論會逐漸退居幕后取而代之的是各種AI原生的產(chǎn)品。到那時候“用不用AI”的討論就該翻篇了就像現(xiàn)在早已沒人會討論“要不要用電”。