模型全解析:統(tǒng)一視覺(jué)與語(yǔ)言的革命性突破)
前言近年來(lái)多模態(tài)模型的研究取得了巨大進(jìn)展。CLIP、BLIP 等視覺(jué)語(yǔ)言對(duì)比學(xué)習(xí)方法展現(xiàn)出強(qiáng)大的 zero-shot 分類能力而 GPT-3 類的大語(yǔ)言模型則通過(guò)大規(guī)模預(yù)訓(xùn)練展現(xiàn)出令人驚嘆的 few-shot 推理能力。然而將“視覺(jué)理解能力”與“語(yǔ)言生成能力”統(tǒng)一到一個(gè)通用模型中依然是多模態(tài)模型的重大挑戰(zhàn)。DeepMind提出的Flamingo首次將視覺(jué)編碼器、Perceiver Resampler 架構(gòu)與大語(yǔ)言模型融合構(gòu)建出一種可對(duì)圖像/視頻 文本混合輸入進(jìn)行推理的通用視覺(jué)語(yǔ)言模型實(shí)現(xiàn)了極強(qiáng)的 few-shot、多任務(wù)泛化能力并在多項(xiàng)基準(zhǔn)上刷新SOTA。FlamingoFlamingo是一款視覺(jué)語(yǔ)言模型它能夠處理多種多模態(tài)任務(wù)包括為圖像生成描述、進(jìn)行基于圖像的對(duì)話、完成分類以及視覺(jué)問(wèn)答要達(dá)成這一目標(biāo)需要解決以下關(guān)鍵挑戰(zhàn)如何以極低成本復(fù)用已有的大語(yǔ)言模型如何將視覺(jué)輸入圖像/視頻融入語(yǔ)言模型的推理過(guò)程如何統(tǒng)一處理不同長(zhǎng)度、不同分辨率的視頻與圖像如何構(gòu)建足夠大規(guī)模且通用的多模態(tài)訓(xùn)練數(shù)據(jù)一、Flamingo 的整體架構(gòu)簡(jiǎn)單易懂的圖從輸入中提取圖片經(jīng)過(guò)視覺(jué)編碼器得到視覺(jué)特征然后通過(guò)感知重采樣器Perceiver resampler將視覺(jué)特征轉(zhuǎn)換為64個(gè)視覺(jué)Token與此同時(shí)原始圖文輸入中的圖像部分被替換為特殊標(biāo)記 從而將多模態(tài)輸入序列轉(zhuǎn)化為純文本形式該序列與大語(yǔ)言模型嵌入層產(chǎn)生的文本表示進(jìn)行拼接構(gòu)成模型的輸入。在進(jìn)入語(yǔ)言模型后模型中新增的Cross-Attention模塊會(huì)讀取這64個(gè)視覺(jué) Token然后通過(guò)一個(gè)可學(xué)習(xí)的門(mén)控系數(shù)進(jìn)行加權(quán)再與原始隱藏狀態(tài)相加實(shí)現(xiàn)視覺(jué)與語(yǔ)言信息的可控融合。二、視覺(jué)編碼器Vision EncoderFlamingo 選用 NFNet-F6 作為其視覺(jué)編碼器骨干網(wǎng)絡(luò)。該編碼器遵循 CLIP 的雙編碼器架構(gòu)通過(guò)對(duì)比學(xué)習(xí)進(jìn)行預(yù)訓(xùn)練文本編碼器部分在預(yù)訓(xùn)練完成后被舍棄。與 CLIP 的一個(gè)細(xì)微區(qū)別在于它采用全局平均池化來(lái)產(chǎn)生視覺(jué)嵌入而非注意力池化。編碼器最終輸出一個(gè)二維的空間特征網(wǎng)格該網(wǎng)格會(huì)被展平為后續(xù)模塊所需的一維序列。對(duì)于視頻輸入模型以 1 FPS 的速率采樣幀并將各幀提取出的視覺(jué)特征進(jìn)行拼接以作為視頻的總體表示。三、感知重采樣器Perceiver resampler為處理視頻輸入Flamingo 設(shè)計(jì)了一套可變長(zhǎng)度幀序列的視覺(jué)特征提取流程。具體而言模型首先對(duì)數(shù)量不定的輸入視頻幀進(jìn)行逐幀編碼從而生成相應(yīng)數(shù)量的視覺(jué)特征。為將可變特征統(tǒng)一為固定維度的表示模型引入感知重采樣器將其輸出約束為 64 個(gè)視覺(jué)標(biāo)記以控制計(jì)算復(fù)雜度。在特征處理階段系統(tǒng)會(huì)向每幀視覺(jué)特征中添加時(shí)序編碼以保留幀間時(shí)間順序信息。隨后所有視覺(jué)特征被展平為一條一維序列并與一組預(yù)先學(xué)得的、數(shù)量同為 64 的查詢向量進(jìn)行組合。二者共同經(jīng)由交叉注意力機(jī)制與前饋網(wǎng)絡(luò)層進(jìn)行交互與融合。需要特別指出的是Flamingo 在注意力機(jī)制中做了一項(xiàng)關(guān)鍵調(diào)整其key/value是由query與視覺(jué)token拼接而成的。四、門(mén)控交叉注意力Gated X-AttentionFlamingo 采用預(yù)訓(xùn)練的 Chinchilla 模型作為其核心語(yǔ)言模型并在整個(gè)多模態(tài)訓(xùn)練過(guò)程中保持其參數(shù)凍結(jié)以完整保留其在大規(guī)模純文本語(yǔ)料上獲得的世界知識(shí)與語(yǔ)言生成能力。為實(shí)現(xiàn)視覺(jué)信息與語(yǔ)言模型的深度融合Famingo 在凍結(jié)的 Chinchilla 模型的層與層之間插入了新設(shè)計(jì)的“門(mén)控交叉注意力模塊”。這些模塊負(fù)責(zé)處理視覺(jué)信息其參數(shù)是從頭開(kāi)始訓(xùn)練的。在模型結(jié)構(gòu)細(xì)節(jié)上它遵循了 GPT-2 的架構(gòu)風(fēng)格對(duì)所有注意力模塊的輸入以及前饋神經(jīng)網(wǎng)絡(luò)層都應(yīng)用了層歸一化。尤為關(guān)鍵的是其門(mén)控機(jī)制每個(gè)新插入的交叉注意力模塊的輸出都會(huì)通過(guò)一個(gè) tanh 門(mén)控單元。該門(mén)控由一個(gè)層特定的、可學(xué)習(xí)的標(biāo)量參數(shù) 控制并且在模型初始化時(shí)這些 被刻意設(shè)置為零。這一設(shè)計(jì)確保了在訓(xùn)練開(kāi)始時(shí)門(mén)控輸出為零整個(gè)模型退化為原始的語(yǔ)言模型行為從而保證了訓(xùn)練的穩(wěn)定性讓模型能夠平滑地從單模態(tài)向多模態(tài)任務(wù)過(guò)渡。五、訓(xùn)練數(shù)據(jù)構(gòu)建大規(guī)模多模態(tài)語(yǔ)料庫(kù)圖文混排數(shù)據(jù)采用M3W數(shù)據(jù)集涵蓋4300萬(wàn)個(gè)網(wǎng)頁(yè)每個(gè)訓(xùn)練序列限制在256個(gè)token以內(nèi)并支持單序列最多5張圖像的交錯(cuò)排列。圖像文本對(duì)ALIGN數(shù)據(jù)集提供18億網(wǎng)絡(luò)級(jí)圖文對(duì)平均文本長(zhǎng)度12.4個(gè)tokenLTIP數(shù)據(jù)集則包含3.12億個(gè)長(zhǎng)文本圖文對(duì)平均文本長(zhǎng)度20.5個(gè)token。視頻文本對(duì)VTP數(shù)據(jù)集包含2700萬(wàn)個(gè)短視頻和文本對(duì)。挑戰(zhàn)在于網(wǎng)頁(yè)數(shù)據(jù)中的圖文關(guān)系往往很弱為此作者采用多源數(shù)據(jù)混合加權(quán)負(fù)對(duì)數(shù)似然損失Accumulation strategy穩(wěn)定訓(xùn)練總體損失函數(shù)為不同數(shù)據(jù)源權(quán)重 λm 是性能表現(xiàn)的關(guān)鍵。實(shí)驗(yàn)結(jié)果表明對(duì)訓(xùn)練數(shù)據(jù)進(jìn)行加權(quán)配比其效果優(yōu)于直接混合數(shù)據(jù)或輪流從各數(shù)據(jù)集中采樣的方法。普通人如何抓住AI大模型的風(fēng)口為什么要學(xué)AI大模型當(dāng)下??智能市場(chǎng)迎來(lái)了爆發(fā)期并逐漸進(jìn)?以??通?智能AGI為主導(dǎo)的新時(shí)代。企業(yè)紛紛官宣“ AI ”戰(zhàn)略為新興技術(shù)?才創(chuàng)造豐富的就業(yè)機(jī)會(huì)?才缺?將達(dá) 400 萬(wàn)DeepSeek問(wèn)世以來(lái)生成式AI和大模型技術(shù)爆發(fā)式增長(zhǎng)讓很多崗位重新成了炙手可熱的新星崗位薪資遠(yuǎn)超很多后端崗位在程序員中穩(wěn)居前列。與此同時(shí)AI與各行各業(yè)深度融合飛速發(fā)展成為炙手可熱的新風(fēng)口企業(yè)非常需要了解AI、懂AI、會(huì)用AI的員工紛紛開(kāi)出高薪招聘AI大模型相關(guān)崗位。AI大模型開(kāi)發(fā)工程師對(duì)AI大模型需要了解到什么程度呢我們先看一下招聘需求知道人家要什么能力一切就好辦了我整理了AI大模型開(kāi)發(fā)工程師需要掌握的知識(shí)如下大模型基礎(chǔ)知識(shí)你得知道市面上的大模型產(chǎn)品生態(tài)和產(chǎn)品線還要了解Llama、Qwen等開(kāi)源大模型與OpenAI等閉源模型的能力差異以及了解開(kāi)源模型的二次開(kāi)發(fā)優(yōu)勢(shì)以及閉源模型的商業(yè)化限制等等。了解這些技術(shù)的目的在于建立與算法工程師的共通語(yǔ)言確保能夠溝通項(xiàng)目需求同時(shí)具備管理AI項(xiàng)目進(jìn)展、合理分配項(xiàng)目資源、把握和控制項(xiàng)目成本的能力。產(chǎn)品經(jīng)理還需要有業(yè)務(wù)sense這其實(shí)就又回到了產(chǎn)品人的看家本領(lǐng)上。我們知道先階段AI的局限性還非常大模型生成的內(nèi)容不理想甚至錯(cuò)誤的情況屢見(jiàn)不鮮。因此AI產(chǎn)品經(jīng)理看技術(shù)更多的是從技術(shù)邊界、成本等角度出發(fā)選擇合適的技術(shù)方案來(lái)實(shí)現(xiàn)需求甚至用業(yè)務(wù)來(lái)補(bǔ)足技術(shù)的短板。AI Agent現(xiàn)階段AI Agent的發(fā)展可謂是百花齊放甚至有人說(shuō)Agent就是未來(lái)應(yīng)用該有的樣子所以這個(gè)LLM的重要分支必須要掌握。Agent中文名為“智能體”由控制端Brain、感知端Perception和行動(dòng)端Action組成是一種能夠在特定環(huán)境中自主行動(dòng)、感知環(huán)境、做出決策并與其他Agent或人類進(jìn)行交互的計(jì)算機(jī)程序或?qū)嶓w。簡(jiǎn)單來(lái)說(shuō)就是給大模型這個(gè)大腦裝上“記憶”、裝上“手”和“腳”讓它自動(dòng)完成工作。Agent的核心特性自主性能夠獨(dú)立做出決策不依賴人類的直接控制。適應(yīng)性能夠根據(jù)環(huán)境的變化調(diào)整其行為。交互性能夠與人類或其他系統(tǒng)進(jìn)行有效溝通和交互。對(duì)于大模型開(kāi)發(fā)工程師來(lái)說(shuō)學(xué)習(xí)Agent更多的是理解它的設(shè)計(jì)理念和工作方式。零代碼的大模型應(yīng)用開(kāi)發(fā)平臺(tái)也有很多比如dify、coze拿來(lái)做一個(gè)小項(xiàng)目你就會(huì)發(fā)現(xiàn)其實(shí)并不難。AI 應(yīng)用項(xiàng)目開(kāi)發(fā)流程如果產(chǎn)品形態(tài)和開(kāi)發(fā)模式都和過(guò)去不一樣了那還畫(huà)啥原型怎么排項(xiàng)目周期這將深刻影響產(chǎn)品經(jīng)理這個(gè)崗位本身的價(jià)值構(gòu)成所以每個(gè)AI產(chǎn)品經(jīng)理都必須要了解它??粗际切略~其實(shí)接觸起來(lái)也不難。從0到1的大模型系統(tǒng)學(xué)習(xí)籽料最近很多程序員朋友都已經(jīng)學(xué)習(xí)或者準(zhǔn)備學(xué)習(xí) AI 大模型后臺(tái)也經(jīng)常會(huì)有小伙伴咨詢學(xué)習(xí)路線和學(xué)習(xí)資料我特別拜托北京清華大學(xué)學(xué)士和美國(guó)加州理工學(xué)院博士學(xué)位的魯為民老師吳文俊獎(jiǎng)得主給大家準(zhǔn)備了一份涵蓋了AI大模型入門(mén)學(xué)習(xí)思維導(dǎo)圖、精品AI大模型學(xué)習(xí)書(shū)籍手冊(cè)、視頻教程、實(shí)戰(zhàn)學(xué)習(xí)等錄播視頻全系列的學(xué)習(xí)資料這些學(xué)習(xí)資料不僅深入淺出而且非常實(shí)用讓大家系統(tǒng)而高效地掌握AI大模型的各個(gè)知識(shí)點(diǎn)。這份完整版的大模型 AI 學(xué)習(xí)資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認(rèn)證二維碼免費(fèi)領(lǐng)取【保證100%免費(fèi)】適學(xué)人群應(yīng)屆畢業(yè)生?無(wú)工作經(jīng)驗(yàn)但想要系統(tǒng)學(xué)習(xí)AI大模型技術(shù)期待通過(guò)實(shí)戰(zhàn)項(xiàng)目掌握核心技術(shù)。零基礎(chǔ)轉(zhuǎn)型?非技術(shù)背景但關(guān)注AI應(yīng)用場(chǎng)景計(jì)劃通過(guò)低代碼工具實(shí)現(xiàn)“AI行業(yè)”跨界?。業(yè)務(wù)賦能突破瓶頸傳統(tǒng)開(kāi)發(fā)者Java/前端等學(xué)習(xí)Transformer架構(gòu)與LangChain框架向AI全棧工程師轉(zhuǎn)型?。AI大模型系統(tǒng)學(xué)習(xí)路線在面對(duì)AI大模型開(kāi)發(fā)領(lǐng)域的復(fù)雜與深入精準(zhǔn)學(xué)習(xí)顯得尤為重要。一份系統(tǒng)的技術(shù)路線圖不僅能夠幫助開(kāi)發(fā)者清晰地了解從入門(mén)到精通所需掌握的知識(shí)點(diǎn)還能提供一條高效、有序的學(xué)習(xí)路徑?;A(chǔ)篇包括了大模型的基本情況核心原理帶你認(rèn)識(shí)了解大模型提示詞Transformer架構(gòu)預(yù)訓(xùn)練、SFT、RLHF等一些基礎(chǔ)概念用最易懂的方式帶你入門(mén)AI大模型進(jìn)階篇你將掌握RAGLangchain、Agent的核心原理和應(yīng)用學(xué)習(xí)如何微調(diào)大模型讓大模型更適合自己的行業(yè)需求私有化部署大模型讓自己的數(shù)據(jù)更加安全項(xiàng)目實(shí)戰(zhàn)篇會(huì)手把手一步步帶著大家練習(xí)企業(yè)級(jí)落地項(xiàng)目比如電商行業(yè)的智能客服、智能銷(xiāo)售項(xiàng)目教育行業(yè)的智慧校園、智能輔導(dǎo)項(xiàng)目等等但知道是一回事做又是另一回事初學(xué)者最常遇到的問(wèn)題主要是理論知識(shí)缺乏、資源和工具的限制、模型理解和調(diào)試的復(fù)雜性在這基礎(chǔ)上找到高質(zhì)量的學(xué)習(xí)資源不浪費(fèi)時(shí)間、不走彎路又是重中之重。AI大模型入門(mén)到實(shí)戰(zhàn)的視頻教程項(xiàng)目包看視頻學(xué)習(xí)是一種高效、直觀、靈活且富有吸引力的學(xué)習(xí)方式可以更直觀地展示過(guò)程能有效提升學(xué)習(xí)興趣和理解力是現(xiàn)在獲取知識(shí)的重要途徑光學(xué)理論是沒(méi)用的要學(xué)會(huì)跟著一起敲要?jiǎng)邮謱?shí)操才能將自己的所學(xué)運(yùn)用到實(shí)際當(dāng)中去這時(shí)候可以搞點(diǎn)實(shí)戰(zhàn)案例來(lái)學(xué)習(xí)。海量AI大模型必讀的經(jīng)典書(shū)籍PDF閱讀AI大模型經(jīng)典書(shū)籍可以幫助讀者提高技術(shù)水平開(kāi)拓視野掌握核心技術(shù)提高解決問(wèn)題的能力同時(shí)也可以借鑒他人的經(jīng)驗(yàn)。對(duì)于想要深入學(xué)習(xí)AI大模型開(kāi)發(fā)的讀者來(lái)說(shuō)閱讀經(jīng)典書(shū)籍是非常有必要的。600AI大模型報(bào)告實(shí)時(shí)更新這套包含640份報(bào)告的合集涵蓋了AI大模型的理論研究、技術(shù)實(shí)現(xiàn)、行業(yè)應(yīng)用等多個(gè)方面。無(wú)論您是科研人員、工程師還是對(duì)AI大模型感興趣的愛(ài)好者這套報(bào)告合集都將為您提供寶貴的信息和啟示。AI大模型面試真題答案解析我們學(xué)習(xí)AI大模型必然是想找到高薪的工作下面這些面試題都是總結(jié)當(dāng)前最新、最熱、最高頻的面試題并且每道題都有詳細(xì)的答案面試前刷完這套面試題資料小小offer不在話下AI時(shí)代企業(yè)最需要的是既懂技術(shù)、又有實(shí)戰(zhàn)經(jīng)驗(yàn)的復(fù)合型人才**當(dāng)前人工智能崗位需求多薪資高前景好。**在職場(chǎng)里選對(duì)賽道就能贏在起跑線。抓住AI這個(gè)風(fēng)口相信下一個(gè)人生贏家就是你機(jī)會(huì)永遠(yuǎn)留給有準(zhǔn)備的人。如何獲取這份完整版的大模型 AI 學(xué)習(xí)資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認(rèn)證二維碼免費(fèi)領(lǐng)取【保證100%免費(fèi)】