Attention VS deepseek MLA)
普通 AttentionMHA/GQA與 MLAMulti-head Latent Attention的核心差異在于KV Cache 的存儲(chǔ)與表達(dá)形態(tài)。標(biāo)準(zhǔn) Attention 選擇按頭顯式平鋪存儲(chǔ)K/VK/VK/V向量而 MLA 通過(guò)“低秩聯(lián)合壓縮 RoPE 解耦”將 KV Cache 壓縮為無(wú)關(guān)頭數(shù)的隱變量大幅破除了長(zhǎng)上下文推理的顯存帶寬瓶頸。對(duì)比維度普通 Attention (MHA / GQA)MLA (Multi-head Latent Attention)KV 存儲(chǔ)結(jié)構(gòu)按頭 (HkvH_{kv}Hkv?) 獨(dú)立保存KKK與VVV向量聯(lián)合壓縮為無(wú)頭的低秩隱變量ctKVc_t^{KV}ctKV? 專用 RoPE 向量ktRk_t^RktR?KV Cache 公式B×L×T×Hkv×(DqkDv)B \times L \times T \times \mathbf{H_{kv}} \times (D_{qk} D_v)B×L×T×Hkv?×(Dqk?Dv?)B×L×T×(RkvDrope)B \times L \times T \times (R_{kv} D_{rope})B×L×T×(Rkv?Drope?)顯存乘數(shù)依賴強(qiáng)依賴KV 頭數(shù) (HkvH_{kv}Hkv?)完全剔除HkvH_{kv}Hkv?乘數(shù)KV Cache 占用降低 70%~80%RoPE 位置編碼直接融合在多頭KKK向量中解耦獨(dú)立存儲(chǔ)因?yàn)樾D(zhuǎn)矩陣無(wú)法被低秩投影吸收推理計(jì)算開(kāi)銷(xiāo)標(biāo)準(zhǔn)矩陣乘法依靠矩陣吸收Matrix AbsorptionDecode 時(shí)不增加額外計(jì)算核心適用場(chǎng)景適合短文本、小 Batch 推理專為超長(zhǎng)上下文、大并發(fā) Batch 推理設(shè)計(jì)如 DeepSeek-V3/R1核心技術(shù)點(diǎn)解析剔除頭數(shù)乘積 (HkvH_{kv}Hkv?)傳統(tǒng) GQA 雖減少了 KV 頭數(shù)但仍有HkvH_{kv}Hkv?乘法項(xiàng)。MLA 直接將所有頭的K/VK/VK/V壓縮為一個(gè)統(tǒng)一的潛隱向量RkvR_{kv}Rkv?使單個(gè) Token 占據(jù)的顯存與模型設(shè)定的注意力頭數(shù)量徹底解耦。矩陣吸收 (Matrix Absorption)MLA 表面上看起來(lái)每次計(jì)算都要將低秩隱向量重新“還原”成多頭但在 Decode 階段生成K/VK/VK/V的升維矩陣可以提前在數(shù)學(xué)上融進(jìn) Query 的投影矩陣WQW_QWQ?和 Output 矩陣WOW_OWO?中因此解碼時(shí)完全無(wú)需顯式展開(kāi)多頭完全不增加額外計(jì)算量。RoPE 的解耦設(shè)計(jì)旋轉(zhuǎn)位置編碼RoPE打破了線性變換的吸附特性無(wú)法直接被投影矩陣吸收。MLA 專門(mén)解耦出一條獨(dú)立的DropeD_{rope}Drope?維度來(lái)專門(mén)存儲(chǔ)帶位置信息的 Key既保留了長(zhǎng)上下文位置感知又確保了低秩壓縮算子的代數(shù)優(yōu)雅。