練紀錄:改結(jié)構(gòu)正在比堆算力更值錢)
據(jù)中新網(wǎng)等媒體報道中國 AI 企業(yè)彩云科技的基礎(chǔ)模型算法團隊在全球開源 AI 競速項目 NanoGPT Speedrun 中兩次刷新世界紀錄把 1.24 億參數(shù) GPT-2 的達標訓(xùn)練時間壓縮到了約 1 分 16 秒。相關(guān)代碼已并入官方開源倉庫。這不是又一個大廠刷榜的新聞而是一個小團隊在改模型結(jié)構(gòu)這條路上被公開驗證了一次。NanoGPT Speedrun 到底比什么先說清楚這個項目為什么值得看。NanoGPT Speedrun 是一個面向全球開發(fā)者開放的開源競速項目規(guī)則很純粹固定 8 張 H100、固定數(shù)據(jù)集、固定目標 loss。換句話說賽道一樣、燃料一樣唯一能拉開差距的就是訓(xùn)練技術(shù)本身——優(yōu)化器、并行策略、網(wǎng)絡(luò)結(jié)構(gòu)、數(shù)值精度。據(jù)公開信息彩云團隊的兩項成績對應(yīng)官方紀錄榜的第 81 和第 85 位把達標訓(xùn)練時間從約 84 秒壓到 76.3 秒。當(dāng)榜單已經(jīng)被擠到接近于硬件理論極限時再想省下幾秒靠調(diào)參已經(jīng)不夠了必須動模型的底層結(jié)構(gòu)。兩項架構(gòu)創(chuàng)新是什么兩項工作分別是 DCMHA 和 MUDD據(jù)公開報道均已發(fā)表于 ICML代碼已被官方倉庫合并全球開發(fā)者可以自由復(fù)現(xiàn)和迭代。DCMHA可動態(tài)組合多頭注意力注意力機制里不同的注意力頭負責(zé)關(guān)注不同的信息。傳統(tǒng)做法是每個頭固定分工而 DCMHA 讓頭的組合方式隨輸入動態(tài)變化相當(dāng)于讓模型自己決定這一句該重點看哪里。MUDD多路動態(tài)稠密連接殘差連接residual是 Transformer 里信息跨層流動的通道。MUDD 的思路是提供多條可動態(tài)選擇的稠密通路讓信息按需要流轉(zhuǎn)而不是只走一條固定的加法支路。據(jù)團隊論文口徑MUDD 只增加了約 0.23% 的參數(shù)和約 0.4% 的算力就能達到普通 Transformer 用 1.8–2.4 倍訓(xùn)練算力時的效果。這個交換比才是重點不是用更多資源換更好效果而是用更聰明的結(jié)構(gòu)換同等效果。變的是什么沒變的是什么變的是競爭的主軸。近半年里不只是彩云多個團隊都往同一個方向使勁Kimi 的 AttnRes、字節(jié) Seed 的 Hyper-Connections、DeepSeek 的 Engram以及催生 Kimi K2 的 Muon 優(yōu)化器指向的都是改造 Transformer 內(nèi)部的信息流轉(zhuǎn)機制而不是繼續(xù)單純地堆算力、擴參數(shù)。當(dāng)誰卡多的邊際收益開始下降誰讓每次計算更值錢就變成了新的比較維度。沒變的是競賽紀錄不等于商用能力。NanoGPT Speedrun 是固定硬件、固定數(shù)據(jù)的極限測試3% 左右的提速不能直接外推到千億級參數(shù)的真實訓(xùn)練里。從進了公共代碼庫到跑通工業(yè)級訓(xùn)練中間還有大量工程適配要做。把榜單成績直接當(dāng)成商用模型的能力躍遷是很容易踩的認知坑。對做模型/訓(xùn)練的開發(fā)者意味著什么如果你在做模型訓(xùn)練、微調(diào)或者只是關(guān)注底層技術(shù)這件事有幾個實際啟示。第一動態(tài)連接類機制可以抄作業(yè)了。代碼已經(jīng)開源并進官方倉庫這給了中小團隊一個低成本的實驗起點。想驗證方向先把競速倉庫拉下來跑通gitclone https://github.com/KellerJordan/modded-nanogptcdmodded-nanogpt這個倉庫就是 NanoGPT Speedrun 的官方代碼庫紀錄榜和提交記錄都在里面可以對照著看別人是怎么把時間一秒一秒摳下來的。第二算力預(yù)算有限的團隊架構(gòu)收益是實打?qū)嵉摹Ω咝Un題組、中小 AI 公司和獨立研究者來說架構(gòu)層面?zhèn)€位數(shù)的效率提升可能就決定了一個實驗做不做得起。同一塊 H100結(jié)構(gòu)改對了能跑更多輪實驗。第三盯緊單位 token 訓(xùn)練成本這條曲線。如果動態(tài)殘差、動態(tài)注意力這類機制被越來越多的模型默認采用訓(xùn)練成本曲線會進一步下探。這比追單個版本號更值得長期關(guān)注。幾個要留意的點別把論文紅利當(dāng)工業(yè)級成果。競速項目里的收益到了真實的大規(guī)模分布式訓(xùn)練可能被通信開銷、穩(wěn)定性問題吃掉一部分需要重新驗證。別迷信小團隊逆襲的敘事。真正值得記住的不是爽文情節(jié)而是動態(tài)信息通路這個方向被公開驗證、并且可被繼續(xù)迭代——這才是它留給行業(yè)最實在的東西。復(fù)現(xiàn)時注意環(huán)境一致性。這類極限成績高度依賴具體硬件、驅(qū)動和精度設(shè)置換機器跑出來的數(shù)字和榜單不一致是正常的。結(jié)尾這場競速最值得琢磨的地方是它把大模型競爭的另一面擺到了臺面上在幾十萬張 GPU 的軍備競賽之外模型結(jié)構(gòu)本身仍然有可挖的空間。對普通開發(fā)者來說把這套開源代碼拉下來跑一遍比看十條新聞都實在。你覺得下一步改結(jié)構(gòu)和堆算力哪個對行業(yè)影響更大評論區(qū)聊聊。