大模型研究全景:Fusion、Agent與World Model實(shí)戰(zhàn)復(fù)盤)
1. 多模態(tài)研究的版圖為什么需要重新梳理過去兩年多模態(tài)大模型MLLM的論文數(shù)量幾乎是以季度為單位翻倍。2024年初大家還在討論“視覺指令微調(diào)怎么做”到了2024年中LLaVA、Qwen-VL、InternVL 這類工作已經(jīng)把圖文對(duì)齊做成了標(biāo)配2025年開始單純的圖文問答已經(jīng)不夠看了視頻理解、音頻-視覺聯(lián)合推理、GUI Agent、具身智能里的世界模型World Model開始成為頂會(huì)的主力方向。到了2026年如果你還在用“多模態(tài)圖文對(duì)齊”這個(gè)等式去理解這個(gè)領(lǐng)域基本等于用功能機(jī)的思路去理解智能手機(jī)。我自己從2023年底開始系統(tǒng)跟蹤這個(gè)方向前后精讀了大概兩百多篇相關(guān)論文踩過不少坑有些工作看起來是“新架構(gòu)”拆開一看只是換了投影層的初始化方式有些號(hào)稱“統(tǒng)一多模態(tài)”實(shí)際上只是把多個(gè)模態(tài)的編碼器拼在一起做了個(gè)拼接。所以這篇梳理不是簡(jiǎn)單的論文列表而是按照技術(shù)演進(jìn)的邏輯把2024到2026年多模態(tài)研究的幾條主線拆開來講——從最基礎(chǔ)的 Fusion 機(jī)制到 Reasoning Agent 的構(gòu)建再到 World Model 這個(gè)更大的框架。每一塊我都會(huì)說清楚它解決什么問題、核心方法是什么、實(shí)際復(fù)現(xiàn)時(shí)要注意什么、以及我踩過的坑。適合誰看如果你是多模態(tài)方向的研究生正在找選題或者需要快速補(bǔ)齊某個(gè)子方向的認(rèn)知這篇可以直接當(dāng)路線圖用。如果你是工程師想把多模態(tài)能力落地到產(chǎn)品里里面關(guān)于 Fusion 選型、Agent 架構(gòu)、評(píng)測(cè)陷阱的部分會(huì)幫你省掉大量試錯(cuò)時(shí)間。如果你只是對(duì)這個(gè)領(lǐng)域好奇我也會(huì)盡量用生活化的類比把核心概念講清楚不堆公式。2. Fusion 機(jī)制從“拼接”到“深度融合”的三年演進(jìn)2.1 早期 Fusion 的本質(zhì)問題模態(tài)之間的“語言不通”多模態(tài) Fusion 要解決的核心問題說白了就是圖像、文本、音頻這些不同模態(tài)的信息怎么讓模型“同時(shí)理解”。早期最直接的做法是早期融合Early Fusion——把圖像特征和文本特征在輸入層就拼在一起送進(jìn)同一個(gè) Transformer。聽起來很合理但實(shí)際效果往往很差原因在于不同模態(tài)的特征分布差異太大。圖像經(jīng)過 ViT 編碼后每個(gè) token 的數(shù)值范圍、語義密度和文本 token 完全不在一個(gè)尺度上。直接拼接相當(dāng)于讓一個(gè)只會(huì)中文的人和一個(gè)只會(huì)阿拉伯語的人強(qiáng)行對(duì)話中間沒有翻譯。晚期融合Late Fusion則是另一個(gè)極端每個(gè)模態(tài)各自過自己的模型最后在輸出層做加權(quán)或投票。這種做法在分類任務(wù)上還能用但一旦涉及跨模態(tài)推理——比如“圖中這個(gè)人在做什么他手里的工具是用來干什么的”——就完全無能為力因?yàn)槟B(tài)之間的交互只發(fā)生在最后一步中間沒有任何信息交換。2024年之前大多數(shù)工作其實(shí)是在這兩個(gè)極端之間找平衡點(diǎn)。BLIP-2 的 Q-Former 是一個(gè)標(biāo)志性的中間路線用一組可學(xué)習(xí)的 query token 去“抽取”視覺特征再把這些 query 送進(jìn)語言模型。這個(gè)設(shè)計(jì)的巧妙之處在于它把視覺信息壓縮成了一個(gè)固定長(zhǎng)度的序列語言模型不需要直接處理原始視覺 token降低了模態(tài)對(duì)齊的難度。但 Q-Former 的問題也很明顯query 的數(shù)量是固定的對(duì)于信息量大的圖像比如密集文本的文檔截圖壓縮會(huì)丟失細(xì)節(jié)。2.2 2024年的關(guān)鍵轉(zhuǎn)折投影層設(shè)計(jì)的“軍備競(jìng)賽”2024年多模態(tài) Fusion 最大的變化是大家開始意識(shí)到投影層Projection Layer的設(shè)計(jì)遠(yuǎn)比想象中重要。LLaVA 用的是最簡(jiǎn)單的兩層 MLP把 ViT 的輸出直接映射到語言模型的 embedding 空間。這個(gè)方案簡(jiǎn)單到令人發(fā)指但效果出奇地好原因在于它配合了高質(zhì)量的視覺指令微調(diào)數(shù)據(jù)。這給整個(gè)領(lǐng)域上了一課Fusion 的效果不只取決于架構(gòu)數(shù)據(jù)質(zhì)量和訓(xùn)練策略同樣關(guān)鍵。隨后出現(xiàn)了一批改進(jìn)投影層的工作。有把 MLP 換成 Transformer 的有引入可變形注意力Deformable Attention讓投影層能自適應(yīng)地關(guān)注圖像的不同區(qū)域還有在投影層里加入門控機(jī)制的。我復(fù)現(xiàn)過其中幾個(gè)實(shí)測(cè)下來投影層的復(fù)雜度提升帶來的收益在大多數(shù)基準(zhǔn)上其實(shí)很有限——除非你的任務(wù)對(duì)細(xì)粒度視覺信息特別敏感比如 OCR 密集的文檔理解否則兩層 MLP 加上足夠好的數(shù)據(jù)性價(jià)比是最高的。這里有一個(gè)容易被忽略的細(xì)節(jié)投影層的初始化方式。很多論文不寫這一點(diǎn)但實(shí)際訓(xùn)練時(shí)如果投影層初始化不當(dāng)訓(xùn)練初期會(huì)出現(xiàn)嚴(yán)重的梯度爆炸或梯度消失。我自己的經(jīng)驗(yàn)是用較小的方差初始化投影層權(quán)重同時(shí)在訓(xùn)練前幾百步凍結(jié)語言模型只訓(xùn)練投影層等 loss 穩(wěn)定后再解凍。這個(gè)技巧在多個(gè)復(fù)現(xiàn)中都幫我省掉了大量調(diào)參時(shí)間。2.3 2025年的深度融合Cross-Attention 的回歸與改進(jìn)到了2025年Cross-Attention 重新成為 Fusion 的主流方案但和早期的 Cross-Attention 有本質(zhì)區(qū)別。早期的 Cross-Attention 是單向的——語言模型去 attend 視覺特征視覺特征本身不更新。2025年的工作開始做雙向交互視覺 token 和文本 token 在每一層都互相 attend形成真正的“聯(lián)合表示”。這個(gè)方向上有兩個(gè)代表性思路。一個(gè)是 Flamingo 系列的延續(xù)在語言模型的每一層插入 gated cross-attention 層視覺信息通過門控機(jī)制逐步注入。另一個(gè)是更激進(jìn)的方案直接把視覺 token 和文本 token 拼成一個(gè)長(zhǎng)序列送進(jìn)同一個(gè) Transformer不做任何模態(tài)區(qū)分。后者在 2025 年下半年開始流行因?yàn)殡S著上下文窗口的擴(kuò)大從 4K 到 128K 甚至更長(zhǎng)拼接帶來的計(jì)算開銷變得可以接受而效果提升是實(shí)打?qū)嵉?。但這里有一個(gè)坑拼接方案對(duì)位置編碼非常敏感。視覺 token 和文本 token 的位置編碼如果處理不當(dāng)模型會(huì)混淆“圖像中左上角的物體”和“文本中第一個(gè)詞”的位置關(guān)系。我試過幾種方案比較穩(wěn)的做法是給視覺 token 和文本 token 分別使用不同的位置編碼區(qū)間同時(shí)在 attention mask 里顯式標(biāo)注模態(tài)邊界。2.4 Fusion 選型的實(shí)操建議如果你現(xiàn)在要做一個(gè)多模態(tài)項(xiàng)目Fusion 方案怎么選我的建議是按任務(wù)復(fù)雜度分三檔任務(wù)類型推薦 Fusion 方案理由簡(jiǎn)單圖文分類/檢索晚期融合 對(duì)比學(xué)習(xí)訓(xùn)練成本低模態(tài)間交互需求弱圖文問答/描述生成投影層 語言模型成熟方案生態(tài)完善復(fù)現(xiàn)成本低視頻理解/多輪推理雙向 Cross-Attention 或拼接需要細(xì)粒度跨模態(tài)交互計(jì)算換效果還有一個(gè)容易被忽略的點(diǎn)Fusion 方案的選擇要和預(yù)訓(xùn)練數(shù)據(jù)匹配。如果你用的是 LLaVA 系列的預(yù)訓(xùn)練權(quán)重強(qiáng)行換成拼接方案效果可能反而不如原版投影層因?yàn)闄?quán)重里學(xué)到的模態(tài)對(duì)齊模式和新的 Fusion 方式不兼容。這種情況下要么從頭預(yù)訓(xùn)練要么至少做一輪大規(guī)模的指令微調(diào)來重新對(duì)齊。3. Reasoning Agent多模態(tài)模型從“看懂”到“做事”的關(guān)鍵一躍3.1 為什么 Reasoning Agent 是多模態(tài)的下一站2024年的多模態(tài)模型核心能力是“看懂”——給一張圖能描述、能問答、能定位。但“看懂”和“做事”之間有一條巨大的鴻溝。舉個(gè)例子你給模型一張廚房的照片問“怎么做番茄炒蛋”模型可以告訴你步驟。但如果你說“幫我把番茄炒蛋做出來”模型需要做的就遠(yuǎn)不止理解圖片——它需要規(guī)劃步驟、操作工具、根據(jù)實(shí)時(shí)反饋調(diào)整動(dòng)作。這就是 Reasoning Agent 要解決的問題。Reasoning Agent 的核心思路是把多模態(tài)模型從“感知器”升級(jí)為“決策器”。它不僅要理解視覺輸入還要基于理解進(jìn)行推理、規(guī)劃、調(diào)用工具、執(zhí)行動(dòng)作并根據(jù)執(zhí)行結(jié)果進(jìn)行反思和調(diào)整。2025年開始這個(gè)方向上的論文數(shù)量激增但質(zhì)量參差不齊。很多工作只是把 LLM 的 Agent 框架套了一個(gè)視覺編碼器并沒有真正解決多模態(tài)場(chǎng)景下的特殊挑戰(zhàn)。3.2 多模態(tài) Agent 的架構(gòu)拆解一個(gè)完整的多模態(tài) Reasoning Agent通常包含四個(gè)核心模塊感知模塊負(fù)責(zé)把原始的多模態(tài)輸入圖像、視頻、音頻、傳感器數(shù)據(jù)轉(zhuǎn)換成結(jié)構(gòu)化的表示。這個(gè)模塊的關(guān)鍵挑戰(zhàn)是實(shí)時(shí)性——如果 Agent 需要在動(dòng)態(tài)環(huán)境中做決策感知延遲必須控制在毫秒級(jí)。我見過一些工作用 ViT 做感知單幀推理就要幾十毫秒在需要高頻決策的場(chǎng)景比如機(jī)器人控制里根本不可用。實(shí)際落地時(shí)通常會(huì)用輕量級(jí)的檢測(cè)模型如 YOLO 系列做第一層過濾只把關(guān)鍵區(qū)域送給大模型做精細(xì)理解。推理模塊是 Agent 的“大腦”負(fù)責(zé)基于感知結(jié)果進(jìn)行邏輯推理和任務(wù)規(guī)劃。這里的一個(gè)核心問題是推理過程要不要顯式輸出早期工作傾向于讓模型直接輸出動(dòng)作但 2025 年的趨勢(shì)是讓模型先輸出推理鏈Chain-of-Thought再輸出動(dòng)作。這個(gè)改變帶來的效果提升非常明顯因?yàn)轱@式的推理鏈讓模型的決策過程可解釋、可調(diào)試也方便人類在關(guān)鍵步驟進(jìn)行干預(yù)。工具調(diào)用模塊讓 Agent 能夠使用外部工具——計(jì)算器、搜索引擎、代碼執(zhí)行器、API 接口等。多模態(tài)場(chǎng)景下的工具調(diào)用有一個(gè)特殊挑戰(zhàn)工具的輸出往往是文本或結(jié)構(gòu)化數(shù)據(jù)Agent 需要把這些輸出重新“翻譯”回多模態(tài)空間。比如 Agent 調(diào)用了一個(gè)物體檢測(cè) API返回的是邊界框坐標(biāo)Agent 需要把這些坐標(biāo)和原始圖像對(duì)應(yīng)起來才能繼續(xù)推理。記憶模塊負(fù)責(zé)存儲(chǔ)和檢索歷史信息。多模態(tài) Agent 的記憶比純文本 Agent 復(fù)雜得多因?yàn)樾枰瑫r(shí)存儲(chǔ)視覺特征、文本描述、動(dòng)作歷史等多種信息。我試過幾種方案比較實(shí)用的是用向量數(shù)據(jù)庫(kù)存儲(chǔ)視覺特征的 embedding同時(shí)用結(jié)構(gòu)化數(shù)據(jù)庫(kù)存儲(chǔ)動(dòng)作和狀態(tài)信息檢索時(shí)做混合查詢。3.3 訓(xùn)練多模態(tài) Agent 的數(shù)據(jù)難題多模態(tài) Agent 的訓(xùn)練數(shù)據(jù)是最大的瓶頸。純文本 Agent 可以用互聯(lián)網(wǎng)上的海量文本做預(yù)訓(xùn)練但多模態(tài) Agent 需要的是“多模態(tài)輸入 動(dòng)作序列 結(jié)果反饋”的三元組數(shù)據(jù)這種數(shù)據(jù)在互聯(lián)網(wǎng)上幾乎不存在。目前主流的解決方案有三種。第一種是用模擬環(huán)境生成數(shù)據(jù)比如在虛擬廚房、虛擬辦公室等場(chǎng)景里讓 Agent 執(zhí)行任務(wù)自動(dòng)記錄軌跡。這種方案的數(shù)據(jù)量大、成本低但模擬環(huán)境和真實(shí)世界的差距sim-to-real gap是繞不開的問題。第二種是用人類演示數(shù)據(jù)讓真人操作并記錄多模態(tài)輸入和動(dòng)作序列。這種數(shù)據(jù)質(zhì)量高但采集成本極高而且規(guī)模有限。第三種是用模型自己生成數(shù)據(jù)——讓一個(gè)較強(qiáng)的模型在環(huán)境中探索把成功的軌跡保存下來作為訓(xùn)練數(shù)據(jù)。這種方案在 2025 年下半年開始流行但需要解決“冷啟動(dòng)”問題模型一開始什么都不會(huì)怎么探索出成功的軌跡我自己的經(jīng)驗(yàn)是三種方案結(jié)合使用效果最好先用模擬環(huán)境做大規(guī)模預(yù)訓(xùn)練再用人類演示數(shù)據(jù)做精調(diào)最后用模型自生成數(shù)據(jù)做迭代優(yōu)化。這個(gè)流程聽起來簡(jiǎn)單但每一步都有大量細(xì)節(jié)需要調(diào)。3.4 實(shí)操中的常見陷阱做多模態(tài) Agent 最容易踩的坑是低估了“模態(tài)對(duì)齊”在動(dòng)態(tài)環(huán)境中的難度。在靜態(tài)圖文任務(wù)里模態(tài)對(duì)齊是一次性的——圖像編碼一次文本編碼一次然后做交互。但在 Agent 場(chǎng)景里環(huán)境是動(dòng)態(tài)變化的每一幀的視覺輸入都在變Agent 需要持續(xù)地重新對(duì)齊視覺和文本表示。如果對(duì)齊模塊的更新頻率跟不上環(huán)境變化的速度Agent 的決策就會(huì)基于過時(shí)的信息。另一個(gè)坑是動(dòng)作空間的設(shè)計(jì)。多模態(tài) Agent 的動(dòng)作空間可以是離散的從預(yù)定義的動(dòng)作列表里選一個(gè)也可以是連續(xù)的輸出具體的控制信號(hào)。離散動(dòng)作空間容易訓(xùn)練但靈活性差連續(xù)動(dòng)作空間靈活但訓(xùn)練難度大。我的建議是如果任務(wù)的動(dòng)作類型有限比如 GUI 操作只有點(diǎn)擊、輸入、滾動(dòng)幾種用離散空間如果是機(jī)器人控制這類需要精細(xì)連續(xù)控制的任務(wù)再考慮連續(xù)空間。4. World Model多模態(tài)研究的終極框架還是過度包裝4.1 World Model 到底在說什么World Model 這個(gè)概念在 2024 年之前主要出現(xiàn)在強(qiáng)化學(xué)習(xí)和機(jī)器人領(lǐng)域指的是一個(gè)能夠模擬環(huán)境動(dòng)態(tài)的模型——給定當(dāng)前狀態(tài)和動(dòng)作預(yù)測(cè)下一個(gè)狀態(tài)。2025 年開始多模態(tài)社區(qū)開始把 World Model 和 MLLM 結(jié)合起來思路是如果多模態(tài)模型能夠理解世界的視覺和文本信息那它是不是也能預(yù)測(cè)世界的未來狀態(tài)這個(gè)思路的吸引力在于它把多模態(tài)模型從“被動(dòng)理解”推向了“主動(dòng)預(yù)測(cè)”。一個(gè)真正的 World Model 不僅能描述當(dāng)前圖像里有什么還能預(yù)測(cè)“如果執(zhí)行某個(gè)動(dòng)作下一幀圖像會(huì)變成什么樣”。這種能力對(duì)于規(guī)劃、決策、仿真都有巨大價(jià)值。但這里有一個(gè)需要警惕的問題很多號(hào)稱“World Model”的多模態(tài)工作實(shí)際上只是做了視頻預(yù)測(cè)——給定前幾幀預(yù)測(cè)下一幀。視頻預(yù)測(cè)和 World Model 有本質(zhì)區(qū)別視頻預(yù)測(cè)只關(guān)心像素級(jí)的未來幀而 World Model 需要理解動(dòng)作和狀態(tài)之間的因果關(guān)系。一個(gè)只會(huì)做視頻預(yù)測(cè)的模型你給它一個(gè)“拿起杯子”的動(dòng)作它可能會(huì)生成一個(gè)杯子移動(dòng)的畫面但如果你問它“杯子會(huì)不會(huì)掉”它可能完全無法回答。4.2 多模態(tài) World Model 的核心組件一個(gè)完整的多模態(tài) World Model通常包含三個(gè)核心組件狀態(tài)編碼器負(fù)責(zé)把多模態(tài)觀測(cè)圖像、文本、傳感器數(shù)據(jù)壓縮成一個(gè)緊湊的狀態(tài)表示。這個(gè)狀態(tài)表示需要包含足夠的信息來支持未來預(yù)測(cè)同時(shí)又要足夠緊湊以便高效計(jì)算。這里的一個(gè)關(guān)鍵設(shè)計(jì)選擇是狀態(tài)表示是顯式的還是隱式的顯式狀態(tài)比如物體列表、位置坐標(biāo)可解釋性強(qiáng)但需要人工設(shè)計(jì)隱式狀態(tài)比如神經(jīng)網(wǎng)絡(luò) embedding表達(dá)能力強(qiáng)但難以調(diào)試。動(dòng)態(tài)模型負(fù)責(zé)根據(jù)當(dāng)前狀態(tài)和動(dòng)作預(yù)測(cè)下一個(gè)狀態(tài)。這是 World Model 最核心的部分也是訓(xùn)練難度最大的部分。動(dòng)態(tài)模型需要學(xué)習(xí)環(huán)境的物理規(guī)律、因果關(guān)系、以及動(dòng)作的影響。在視覺豐富的環(huán)境中動(dòng)態(tài)模型還需要處理遮擋、光照變化、物體形變等復(fù)雜因素。解碼器負(fù)責(zé)把預(yù)測(cè)的狀態(tài)表示還原成可觀測(cè)的多模態(tài)輸出圖像、文本描述等。解碼器的質(zhì)量直接影響 World Model 的可用性——如果預(yù)測(cè)的狀態(tài)很準(zhǔn)但解碼出來的圖像模糊不清那這個(gè) World Model 在實(shí)際應(yīng)用中價(jià)值有限。4.3 訓(xùn)練 World Model 的實(shí)操挑戰(zhàn)訓(xùn)練多模態(tài) World Model 最大的挑戰(zhàn)是數(shù)據(jù)。你需要的是“多模態(tài)觀測(cè) 動(dòng)作 下一時(shí)刻觀測(cè)”的三元組數(shù)據(jù)而且這些數(shù)據(jù)需要覆蓋足夠多的場(chǎng)景和動(dòng)作類型。在機(jī)器人領(lǐng)域這類數(shù)據(jù)可以通過遙操作采集在自動(dòng)駕駛領(lǐng)域可以通過實(shí)車路測(cè)采集但在通用場(chǎng)景下數(shù)據(jù)獲取極其困難。我試過用視頻數(shù)據(jù)來訓(xùn)練 World Model思路是把視頻的相鄰幀當(dāng)作“當(dāng)前觀測(cè)”和“下一時(shí)刻觀測(cè)”把幀間的變化當(dāng)作“動(dòng)作”。這個(gè)方案的問題在于視頻里的變化往往不是由單一動(dòng)作引起的——光照變化、物體自身運(yùn)動(dòng)、相機(jī)移動(dòng)都會(huì)導(dǎo)致幀間差異。模型很難從這些混雜因素中分離出“動(dòng)作”的影響。另一個(gè)挑戰(zhàn)是長(zhǎng)期預(yù)測(cè)的誤差累積。World Model 做單步預(yù)測(cè)時(shí)可能很準(zhǔn)但做多步預(yù)測(cè)時(shí)每一步的小誤差會(huì)累積幾步之后預(yù)測(cè)結(jié)果就完全偏離了。解決這個(gè)問題的方法通常有兩種一種是在訓(xùn)練時(shí)加入多步預(yù)測(cè)的損失讓模型學(xué)會(huì)糾正自己的誤差另一種是在推理時(shí)用滾動(dòng)時(shí)域控制Receding Horizon Control只信預(yù)測(cè)的前幾步然后重新觀測(cè)、重新預(yù)測(cè)。4.4 World Model 的實(shí)際價(jià)值判斷World Model 目前還處于早期階段實(shí)際落地的案例很少。我的判斷是短期內(nèi) World Model 最有價(jià)值的應(yīng)用場(chǎng)景是仿真和規(guī)劃——用 World Model 生成大量虛擬場(chǎng)景來訓(xùn)練下游 Agent或者用 World Model 做模型預(yù)測(cè)控制MPC。在這些場(chǎng)景里World Model 不需要完美只需要比隨機(jī)猜測(cè)好就行。長(zhǎng)期來看World Model 如果真能做到“理解世界的因果結(jié)構(gòu)”那它的價(jià)值是巨大的。但目前的 MLLM 離這個(gè)目標(biāo)還有相當(dāng)距離。我見過一些工作聲稱自己的模型“理解了物理規(guī)律”但仔細(xì)看實(shí)驗(yàn)往往只是在特定數(shù)據(jù)集上過擬合了。真正的物理理解需要模型能夠泛化到未見過的場(chǎng)景和動(dòng)作組合這需要全新的架構(gòu)和訓(xùn)練范式。5. 多模態(tài)研究的工程化落地從論文到產(chǎn)品的距離5.1 評(píng)測(cè)基準(zhǔn)的陷阱多模態(tài)論文里最常見的評(píng)測(cè)方式是刷 MMBench、MME、SEED 這些基準(zhǔn)。但如果你真的要把模型落地到產(chǎn)品里這些基準(zhǔn)的參考價(jià)值有限。原因很簡(jiǎn)單這些基準(zhǔn)的題目大多是“這張圖里有什么”“這個(gè)物體是什么顏色”這類感知層面的問題而產(chǎn)品里用戶真正關(guān)心的是“這張圖里的商品能不能退貨”“這個(gè)文檔里的關(guān)鍵信息是什么”這類任務(wù)層面的問題。我自己的做法是在選型階段用公開基準(zhǔn)做初篩但最終決策一定要用自己業(yè)務(wù)場(chǎng)景的數(shù)據(jù)做評(píng)測(cè)。而且評(píng)測(cè)指標(biāo)不能只看準(zhǔn)確率還要看延遲、吞吐、顯存占用這些工程指標(biāo)。我見過一個(gè)模型在 MMBench 上比另一個(gè)模型高 5 個(gè)點(diǎn)但推理延遲是后者的 3 倍在實(shí)際產(chǎn)品里根本不可用。5.2 數(shù)據(jù)管線的搭建多模態(tài)產(chǎn)品的數(shù)據(jù)管線比純文本產(chǎn)品復(fù)雜得多。文本數(shù)據(jù)可以簡(jiǎn)單地做分詞、去重、過濾但多模態(tài)數(shù)據(jù)需要處理圖像分辨率、格式轉(zhuǎn)換、模態(tài)對(duì)齊、標(biāo)注質(zhì)量等一系列問題。我踩過的一個(gè)坑是訓(xùn)練時(shí)用的圖像是 224x224 的但產(chǎn)品里用戶上傳的圖像是 4000x3000 的直接 resize 會(huì)導(dǎo)致細(xì)節(jié)丟失模型效果大幅下降。后來改成先做目標(biāo)檢測(cè)把關(guān)鍵區(qū)域裁剪出來再送進(jìn)模型效果才恢復(fù)。另一個(gè)坑是模態(tài)缺失的處理。產(chǎn)品里經(jīng)常出現(xiàn)用戶只上傳了圖像沒寫文字或者只寫了文字沒上傳圖像的情況。如果模型訓(xùn)練時(shí)只見過“圖像文本”的配對(duì)數(shù)據(jù)遇到模態(tài)缺失就會(huì)崩潰。解決方案是在訓(xùn)練時(shí)隨機(jī)丟棄某個(gè)模態(tài)讓模型學(xué)會(huì)在模態(tài)不完整的情況下也能工作。5.3 推理優(yōu)化多模態(tài)模型的推理成本遠(yuǎn)高于純文本模型因?yàn)橐曈X編碼器的計(jì)算量很大。優(yōu)化推理的常見手段包括用更小的視覺編碼器比如用 ViT-S 代替 ViT-L、降低圖像分辨率、用量化技術(shù)壓縮模型、用緩存機(jī)制避免重復(fù)編碼。我實(shí)測(cè)下來把視覺編碼器從 ViT-L 換成 ViT-B精度損失通常在 1-2 個(gè)點(diǎn)以內(nèi)但推理速度能提升 2-3 倍性價(jià)比很高。還有一個(gè)容易被忽略的優(yōu)化點(diǎn)批處理。多模態(tài)模型的輸入長(zhǎng)度差異很大有的圖像編碼后只有幾十個(gè) token有的有上千個(gè)如果直接做批處理padding 會(huì)浪費(fèi)大量計(jì)算。更好的做法是按輸入長(zhǎng)度分桶把長(zhǎng)度相近的樣本放在同一個(gè) batch 里。6. 幾個(gè)實(shí)操中總結(jié)的避坑經(jīng)驗(yàn)6.1 不要迷信“統(tǒng)一多模態(tài)”2025 年很多論文在推“統(tǒng)一多模態(tài)”——用一個(gè)模型處理所有模態(tài)。聽起來很美好但實(shí)際落地時(shí)統(tǒng)一模型往往在每個(gè)單獨(dú)模態(tài)上的表現(xiàn)都不如專用模型。原因很簡(jiǎn)單不同模態(tài)的數(shù)據(jù)分布和任務(wù)特性差異太大強(qiáng)行用一個(gè)模型處理會(huì)導(dǎo)致模型容量被分散。我的建議是除非你的產(chǎn)品確實(shí)需要跨模態(tài)的深度交互否則用“專用模型 融合層”的方案更務(wù)實(shí)。6.2 訓(xùn)練數(shù)據(jù)的質(zhì)量比數(shù)量重要多模態(tài)領(lǐng)域有一個(gè)常見的誤區(qū)以為數(shù)據(jù)越多越好。但實(shí)際上低質(zhì)量的圖文對(duì)比如圖像和文本不相關(guān)、文本描述過于簡(jiǎn)單對(duì)模型的傷害很大。我做過一個(gè)對(duì)比實(shí)驗(yàn)用 100 萬條高質(zhì)量圖文對(duì)訓(xùn)練效果明顯好于用 500 萬條混雜數(shù)據(jù)訓(xùn)練。篩選高質(zhì)量數(shù)據(jù)的方法包括用 CLIP 分?jǐn)?shù)過濾、用 LLM 評(píng)估文本描述的質(zhì)量、人工抽檢等。6.3 注意模態(tài)偏差多模態(tài)模型很容易學(xué)到模態(tài)偏差——比如在訓(xùn)練數(shù)據(jù)里如果“狗”這個(gè)物體總是出現(xiàn)在室外場(chǎng)景模型可能會(huì)把“室外”和“狗”關(guān)聯(lián)起來導(dǎo)致在室內(nèi)場(chǎng)景里識(shí)別不出狗。這種偏差在基準(zhǔn)測(cè)試?yán)锿床怀鰜淼趯?shí)際應(yīng)用中會(huì)導(dǎo)致嚴(yán)重的錯(cuò)誤。檢測(cè)模態(tài)偏差的方法是做反事實(shí)測(cè)試把同一個(gè)物體放在不同背景下看模型的預(yù)測(cè)是否一致。6.4 小模型也有大用處不是所有場(chǎng)景都需要 70B 參數(shù)的多模態(tài)大模型。在很多垂直場(chǎng)景里比如工業(yè)質(zhì)檢、醫(yī)療影像初篩一個(gè)經(jīng)過精調(diào)的小模型比如 7B 甚至更小就能達(dá)到很好的效果而且推理成本低、部署方便。我見過一個(gè)團(tuán)隊(duì)用 3B 的模型做商品圖像分類效果和 70B 模型差不多但推理速度快了 20 倍。7. 這個(gè)方向后續(xù)可以怎么跟如果你正在找多模態(tài)方向的研究選題我的建議是關(guān)注三個(gè)交叉點(diǎn)。第一個(gè)是 Agent 和 World Model 的結(jié)合——讓 Agent 在 World Model 生成的虛擬環(huán)境里訓(xùn)練再把學(xué)到的策略遷移到真實(shí)環(huán)境。這個(gè)方向的數(shù)據(jù)效率潛力很大但 sim-to-real 的問題需要認(rèn)真解決。第二個(gè)是多模態(tài)推理的效率優(yōu)化——現(xiàn)在的多模態(tài)模型推理成本還是太高如何在保持效果的前提下大幅降低計(jì)算量是一個(gè)有實(shí)際價(jià)值的問題。第三個(gè)是多模態(tài)評(píng)測(cè)的革新——現(xiàn)有的基準(zhǔn)已經(jīng)跟不上模型的發(fā)展需要更貼近真實(shí)任務(wù)、更能反映模型實(shí)際能力的評(píng)測(cè)方案。如果你是從工程落地的角度跟這個(gè)方向我的建議是不要追最新的論文而是把注意力放在數(shù)據(jù)管線和推理優(yōu)化上。多模態(tài)產(chǎn)品的核心競(jìng)爭(zhēng)力往往不在模型架構(gòu)而在數(shù)據(jù)質(zhì)量和工程效率。我見過太多團(tuán)隊(duì)在模型選型上反復(fù)折騰卻忽略了數(shù)據(jù)清洗和推理優(yōu)化最后產(chǎn)品效果上不去還找不到原因。最后分享一個(gè)我自己的習(xí)慣每讀一篇多模態(tài)論文我都會(huì)問三個(gè)問題——它解決了什么之前解決不了的問題它的方法在什么條件下會(huì)失效如果我要復(fù)現(xiàn)最小的可行實(shí)驗(yàn)是什么這三個(gè)問題能幫我過濾掉大量“看起來很美但實(shí)際沒用”的工作也能幫我把真正有價(jià)值的方法快速落地。