模型全解析:統(tǒng)一視覺與語言的革命性突破)
前言近年來多模態(tài)模型的研究取得了巨大進(jìn)展。CLIP、BLIP 等視覺語言對比學(xué)習(xí)方法展現(xiàn)出強(qiáng)大的 zero-shot 分類能力而 GPT-3 類的大語言模型則通過大規(guī)模預(yù)訓(xùn)練展現(xiàn)出令人驚嘆的 few-shot 推理能力。然而將“視覺理解能力”與“語言生成能力”統(tǒng)一到一個通用模型中依然是多模態(tài)模型的重大挑戰(zhàn)。DeepMind提出的Flamingo首次將視覺編碼器、Perceiver Resampler 架構(gòu)與大語言模型融合構(gòu)建出一種可對圖像/視頻 文本混合輸入進(jìn)行推理的通用視覺語言模型實(shí)現(xiàn)了極強(qiáng)的 few-shot、多任務(wù)泛化能力并在多項(xiàng)基準(zhǔn)上刷新SOTA。FlamingoFlamingo是一款視覺語言模型它能夠處理多種多模態(tài)任務(wù)包括為圖像生成描述、進(jìn)行基于圖像的對話、完成分類以及視覺問答要達(dá)成這一目標(biāo)需要解決以下關(guān)鍵挑戰(zhàn)如何以極低成本復(fù)用已有的大語言模型如何將視覺輸入圖像/視頻融入語言模型的推理過程如何統(tǒng)一處理不同長度、不同分辨率的視頻與圖像如何構(gòu)建足夠大規(guī)模且通用的多模態(tài)訓(xùn)練數(shù)據(jù)一、Flamingo 的整體架構(gòu)簡單易懂的圖從輸入中提取圖片經(jīng)過視覺編碼器得到視覺特征然后通過感知重采樣器Perceiver resampler將視覺特征轉(zhuǎn)換為64個視覺Token與此同時原始圖文輸入中的圖像部分被替換為特殊標(biāo)記 從而將多模態(tài)輸入序列轉(zhuǎn)化為純文本形式該序列與大語言模型嵌入層產(chǎn)生的文本表示進(jìn)行拼接構(gòu)成模型的輸入。在進(jìn)入語言模型后模型中新增的Cross-Attention模塊會讀取這64個視覺 Token然后通過一個可學(xué)習(xí)的門控系數(shù)進(jìn)行加權(quán)再與原始隱藏狀態(tài)相加實(shí)現(xiàn)視覺與語言信息的可控融合。二、視覺編碼器Vision EncoderFlamingo 選用 NFNet-F6 作為其視覺編碼器骨干網(wǎng)絡(luò)。該編碼器遵循 CLIP 的雙編碼器架構(gòu)通過對比學(xué)習(xí)進(jìn)行預(yù)訓(xùn)練文本編碼器部分在預(yù)訓(xùn)練完成后被舍棄。與 CLIP 的一個細(xì)微區(qū)別在于它采用全局平均池化來產(chǎn)生視覺嵌入而非注意力池化。編碼器最終輸出一個二維的空間特征網(wǎng)格該網(wǎng)格會被展平為后續(xù)模塊所需的一維序列。對于視頻輸入模型以 1 FPS 的速率采樣幀并將各幀提取出的視覺特征進(jìn)行拼接以作為視頻的總體表示。三、感知重采樣器Perceiver resampler為處理視頻輸入Flamingo 設(shè)計了一套可變長度幀序列的視覺特征提取流程。具體而言模型首先對數(shù)量不定的輸入視頻幀進(jìn)行逐幀編碼從而生成相應(yīng)數(shù)量的視覺特征。為將可變特征統(tǒng)一為固定維度的表示模型引入感知重采樣器將其輸出約束為 64 個視覺標(biāo)記以控制計算復(fù)雜度。在特征處理階段系統(tǒng)會向每幀視覺特征中添加時序編碼以保留幀間時間順序信息。隨后所有視覺特征被展平為一條一維序列并與一組預(yù)先學(xué)得的、數(shù)量同為 64 的查詢向量進(jìn)行組合。二者共同經(jīng)由交叉注意力機(jī)制與前饋網(wǎng)絡(luò)層進(jìn)行交互與融合。需要特別指出的是Flamingo 在注意力機(jī)制中做了一項(xiàng)關(guān)鍵調(diào)整其key/value是由query與視覺token拼接而成的。四、門控交叉注意力Gated X-AttentionFlamingo 采用預(yù)訓(xùn)練的 Chinchilla 模型作為其核心語言模型并在整個多模態(tài)訓(xùn)練過程中保持其參數(shù)凍結(jié)以完整保留其在大規(guī)模純文本語料上獲得的世界知識與語言生成能力。為實(shí)現(xiàn)視覺信息與語言模型的深度融合Famingo 在凍結(jié)的 Chinchilla 模型的層與層之間插入了新設(shè)計的“門控交叉注意力模塊”。這些模塊負(fù)責(zé)處理視覺信息其參數(shù)是從頭開始訓(xùn)練的。在模型結(jié)構(gòu)細(xì)節(jié)上它遵循了 GPT-2 的架構(gòu)風(fēng)格對所有注意力模塊的輸入以及前饋神經(jīng)網(wǎng)絡(luò)層都應(yīng)用了層歸一化。尤為關(guān)鍵的是其門控機(jī)制每個新插入的交叉注意力模塊的輸出都會通過一個 tanh 門控單元。該門控由一個層特定的、可學(xué)習(xí)的標(biāo)量參數(shù) 控制并且在模型初始化時這些 被刻意設(shè)置為零。這一設(shè)計確保了在訓(xùn)練開始時門控輸出為零整個模型退化為原始的語言模型行為從而保證了訓(xùn)練的穩(wěn)定性讓模型能夠平滑地從單模態(tài)向多模態(tài)任務(wù)過渡。五、訓(xùn)練數(shù)據(jù)構(gòu)建大規(guī)模多模態(tài)語料庫圖文混排數(shù)據(jù)采用M3W數(shù)據(jù)集涵蓋4300萬個網(wǎng)頁每個訓(xùn)練序列限制在256個token以內(nèi)并支持單序列最多5張圖像的交錯排列。圖像文本對ALIGN數(shù)據(jù)集提供18億網(wǎng)絡(luò)級圖文對平均文本長度12.4個tokenLTIP數(shù)據(jù)集則包含3.12億個長文本圖文對平均文本長度20.5個token。視頻文本對VTP數(shù)據(jù)集包含2700萬個短視頻和文本對。挑戰(zhàn)在于網(wǎng)頁數(shù)據(jù)中的圖文關(guān)系往往很弱為此作者采用多源數(shù)據(jù)混合加權(quán)負(fù)對數(shù)似然損失Accumulation strategy穩(wěn)定訓(xùn)練總體損失函數(shù)為不同數(shù)據(jù)源權(quán)重 λm 是性能表現(xiàn)的關(guān)鍵。實(shí)驗(yàn)結(jié)果表明對訓(xùn)練數(shù)據(jù)進(jìn)行加權(quán)配比其效果優(yōu)于直接混合數(shù)據(jù)或輪流從各數(shù)據(jù)集中采樣的方法。普通人如何抓住AI大模型的風(fēng)口為什么要學(xué)AI大模型當(dāng)下??智能市場迎來了爆發(fā)期并逐漸進(jìn)?以??通?智能AGI為主導(dǎo)的新時代。企業(yè)紛紛官宣“ AI ”戰(zhàn)略為新興技術(shù)?才創(chuàng)造豐富的就業(yè)機(jī)會?才缺?將達(dá) 400 萬DeepSeek問世以來生成式AI和大模型技術(shù)爆發(fā)式增長讓很多崗位重新成了炙手可熱的新星崗位薪資遠(yuǎn)超很多后端崗位在程序員中穩(wěn)居前列。與此同時AI與各行各業(yè)深度融合飛速發(fā)展成為炙手可熱的新風(fēng)口企業(yè)非常需要了解AI、懂AI、會用AI的員工紛紛開出高薪招聘AI大模型相關(guān)崗位。AI大模型開發(fā)工程師對AI大模型需要了解到什么程度呢我們先看一下招聘需求知道人家要什么能力一切就好辦了我整理了AI大模型開發(fā)工程師需要掌握的知識如下大模型基礎(chǔ)知識你得知道市面上的大模型產(chǎn)品生態(tài)和產(chǎn)品線還要了解Llama、Qwen等開源大模型與OpenAI等閉源模型的能力差異以及了解開源模型的二次開發(fā)優(yōu)勢以及閉源模型的商業(yè)化限制等等。了解這些技術(shù)的目的在于建立與算法工程師的共通語言確保能夠溝通項(xiàng)目需求同時具備管理AI項(xiàng)目進(jìn)展、合理分配項(xiàng)目資源、把握和控制項(xiàng)目成本的能力。產(chǎn)品經(jīng)理還需要有業(yè)務(wù)sense這其實(shí)就又回到了產(chǎn)品人的看家本領(lǐng)上。我們知道先階段AI的局限性還非常大模型生成的內(nèi)容不理想甚至錯誤的情況屢見不鮮。因此AI產(chǎn)品經(jīng)理看技術(shù)更多的是從技術(shù)邊界、成本等角度出發(fā)選擇合適的技術(shù)方案來實(shí)現(xiàn)需求甚至用業(yè)務(wù)來補(bǔ)足技術(shù)的短板。AI Agent現(xiàn)階段AI Agent的發(fā)展可謂是百花齊放甚至有人說Agent就是未來應(yīng)用該有的樣子所以這個LLM的重要分支必須要掌握。Agent中文名為“智能體”由控制端Brain、感知端Perception和行動端Action組成是一種能夠在特定環(huán)境中自主行動、感知環(huán)境、做出決策并與其他Agent或人類進(jìn)行交互的計算機(jī)程序或?qū)嶓w。簡單來說就是給大模型這個大腦裝上“記憶”、裝上“手”和“腳”讓它自動完成工作。Agent的核心特性自主性能夠獨(dú)立做出決策不依賴人類的直接控制。適應(yīng)性能夠根據(jù)環(huán)境的變化調(diào)整其行為。交互性能夠與人類或其他系統(tǒng)進(jìn)行有效溝通和交互。對于大模型開發(fā)工程師來說學(xué)習(xí)Agent更多的是理解它的設(shè)計理念和工作方式。零代碼的大模型應(yīng)用開發(fā)平臺也有很多比如dify、coze拿來做一個小項(xiàng)目你就會發(fā)現(xiàn)其實(shí)并不難。AI 應(yīng)用項(xiàng)目開發(fā)流程如果產(chǎn)品形態(tài)和開發(fā)模式都和過去不一樣了那還畫啥原型怎么排項(xiàng)目周期這將深刻影響產(chǎn)品經(jīng)理這個崗位本身的價值構(gòu)成所以每個AI產(chǎn)品經(jīng)理都必須要了解它??粗际切略~其實(shí)接觸起來也不難。從0到1的大模型系統(tǒng)學(xué)習(xí)籽料最近很多程序員朋友都已經(jīng)學(xué)習(xí)或者準(zhǔn)備學(xué)習(xí) AI 大模型后臺也經(jīng)常會有小伙伴咨詢學(xué)習(xí)路線和學(xué)習(xí)資料我特別拜托北京清華大學(xué)學(xué)士和美國加州理工學(xué)院博士學(xué)位的魯為民老師吳文俊獎得主給大家準(zhǔn)備了一份涵蓋了AI大模型入門學(xué)習(xí)思維導(dǎo)圖、精品AI大模型學(xué)習(xí)書籍手冊、視頻教程、實(shí)戰(zhàn)學(xué)習(xí)等錄播視頻全系列的學(xué)習(xí)資料這些學(xué)習(xí)資料不僅深入淺出而且非常實(shí)用讓大家系統(tǒng)而高效地掌握AI大模型的各個知識點(diǎn)。這份完整版的大模型 AI 學(xué)習(xí)資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認(rèn)證二維碼免費(fèi)領(lǐng)取【保證100%免費(fèi)】適學(xué)人群應(yīng)屆畢業(yè)生?無工作經(jīng)驗(yàn)但想要系統(tǒng)學(xué)習(xí)AI大模型技術(shù)期待通過實(shí)戰(zhàn)項(xiàng)目掌握核心技術(shù)。零基礎(chǔ)轉(zhuǎn)型?非技術(shù)背景但關(guān)注AI應(yīng)用場景計劃通過低代碼工具實(shí)現(xiàn)“AI行業(yè)”跨界?。業(yè)務(wù)賦能突破瓶頸傳統(tǒng)開發(fā)者Java/前端等學(xué)習(xí)Transformer架構(gòu)與LangChain框架向AI全棧工程師轉(zhuǎn)型?。AI大模型系統(tǒng)學(xué)習(xí)路線在面對AI大模型開發(fā)領(lǐng)域的復(fù)雜與深入精準(zhǔn)學(xué)習(xí)顯得尤為重要。一份系統(tǒng)的技術(shù)路線圖不僅能夠幫助開發(fā)者清晰地了解從入門到精通所需掌握的知識點(diǎn)還能提供一條高效、有序的學(xué)習(xí)路徑。基礎(chǔ)篇包括了大模型的基本情況核心原理帶你認(rèn)識了解大模型提示詞Transformer架構(gòu)預(yù)訓(xùn)練、SFT、RLHF等一些基礎(chǔ)概念用最易懂的方式帶你入門AI大模型進(jìn)階篇你將掌握RAGLangchain、Agent的核心原理和應(yīng)用學(xué)習(xí)如何微調(diào)大模型讓大模型更適合自己的行業(yè)需求私有化部署大模型讓自己的數(shù)據(jù)更加安全項(xiàng)目實(shí)戰(zhàn)篇會手把手一步步帶著大家練習(xí)企業(yè)級落地項(xiàng)目比如電商行業(yè)的智能客服、智能銷售項(xiàng)目教育行業(yè)的智慧校園、智能輔導(dǎo)項(xiàng)目等等但知道是一回事做又是另一回事初學(xué)者最常遇到的問題主要是理論知識缺乏、資源和工具的限制、模型理解和調(diào)試的復(fù)雜性在這基礎(chǔ)上找到高質(zhì)量的學(xué)習(xí)資源不浪費(fèi)時間、不走彎路又是重中之重。AI大模型入門到實(shí)戰(zhàn)的視頻教程項(xiàng)目包看視頻學(xué)習(xí)是一種高效、直觀、靈活且富有吸引力的學(xué)習(xí)方式可以更直觀地展示過程能有效提升學(xué)習(xí)興趣和理解力是現(xiàn)在獲取知識的重要途徑光學(xué)理論是沒用的要學(xué)會跟著一起敲要動手實(shí)操才能將自己的所學(xué)運(yùn)用到實(shí)際當(dāng)中去這時候可以搞點(diǎn)實(shí)戰(zhàn)案例來學(xué)習(xí)。海量AI大模型必讀的經(jīng)典書籍PDF閱讀AI大模型經(jīng)典書籍可以幫助讀者提高技術(shù)水平開拓視野掌握核心技術(shù)提高解決問題的能力同時也可以借鑒他人的經(jīng)驗(yàn)。對于想要深入學(xué)習(xí)AI大模型開發(fā)的讀者來說閱讀經(jīng)典書籍是非常有必要的。600AI大模型報告實(shí)時更新這套包含640份報告的合集涵蓋了AI大模型的理論研究、技術(shù)實(shí)現(xiàn)、行業(yè)應(yīng)用等多個方面。無論您是科研人員、工程師還是對AI大模型感興趣的愛好者這套報告合集都將為您提供寶貴的信息和啟示。AI大模型面試真題答案解析我們學(xué)習(xí)AI大模型必然是想找到高薪的工作下面這些面試題都是總結(jié)當(dāng)前最新、最熱、最高頻的面試題并且每道題都有詳細(xì)的答案面試前刷完這套面試題資料小小offer不在話下AI時代企業(yè)最需要的是既懂技術(shù)、又有實(shí)戰(zhàn)經(jīng)驗(yàn)的復(fù)合型人才**當(dāng)前人工智能崗位需求多薪資高前景好。**在職場里選對賽道就能贏在起跑線。抓住AI這個風(fēng)口相信下一個人生贏家就是你機(jī)會永遠(yuǎn)留給有準(zhǔn)備的人。如何獲取這份完整版的大模型 AI 學(xué)習(xí)資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認(rèn)證二維碼免費(fèi)領(lǐng)取【保證100%免費(fèi)】