驗(yàn)都適合存入模型權(quán)重:面向自改進(jìn)GUI智能體的組件路由框架)
不是所有經(jīng)驗(yàn)都適合存入模型權(quán)重面向自改進(jìn)GUI智能體的組件路由框架arXiv:2610.01787v12026?10?01摘要自改進(jìn)GUI智能體會(huì)將自身運(yùn)行產(chǎn)生的軌跡經(jīng)驗(yàn)復(fù)用主要存在兩種方案一是對(duì)軌跡做微調(diào)將經(jīng)驗(yàn)寫入模型權(quán)重二是把軌跡檢索后放入上下文提示?,F(xiàn)有研究對(duì)比這兩種方案得出互相矛盾的結(jié)論本文指出矛盾根源來自經(jīng)驗(yàn)的粒度問題一條軌跡是多種不同屬性經(jīng)驗(yàn)單元的混合包絡(luò)整體評(píng)估結(jié)論會(huì)受內(nèi)部組分占比影響。本文提出組件路由Component Routing將智能體經(jīng)驗(yàn)拆解為四類組件定位器locators、過程序列procedures、狀態(tài)事實(shí)state facts、經(jīng)驗(yàn)教訓(xùn)lessons依據(jù)訓(xùn)練前即可統(tǒng)計(jì)得到的兩個(gè)屬性——重復(fù)出現(xiàn)度recurrence、狀態(tài)條件依賴性state?conditionality把每一類組件分配到「上下文提示」或者「模型權(quán)重」。在三套主干模型、兩個(gè)GUI仿真環(huán)境、3個(gè)隨機(jī)種子下開展對(duì)照實(shí)驗(yàn)。實(shí)驗(yàn)發(fā)現(xiàn)最優(yōu)分配策略定位器、經(jīng)驗(yàn)教訓(xùn)適合存入權(quán)重過程序列、狀態(tài)事實(shí)適合放在上下文?;趦深悓傩詳M合得到路由判定規(guī)則在留出的主干模型家族測(cè)試集上24組測(cè)試樣例全部預(yù)測(cè)正確。兩組干預(yù)實(shí)驗(yàn)可以人為改變組件的最優(yōu)歸屬提升訓(xùn)練樣本劑量可以讓過程序列向權(quán)重一側(cè)偏移剝離狀態(tài)條件會(huì)降低上下文方案收益。采用該路由規(guī)則的效果平均比每一套主干模型的單一最優(yōu)方案高出**3.5個(gè)百分點(diǎn)**相比反向分配策略高出7.8個(gè)百分點(diǎn)。進(jìn)一步揭示訓(xùn)練、生產(chǎn)者?消費(fèi)者模型差異如何改變兩種復(fù)用路徑收益當(dāng)相同經(jīng)驗(yàn)寫入權(quán)重后高重復(fù)度經(jīng)驗(yàn)在上下文里被讀取觸發(fā)的概率大幅下降上下文路徑收益會(huì)隨信息缺口增大而提升權(quán)重微調(diào)路徑收益會(huì)隨策略缺口增大而衰減。1 引言GUI智能體手機(jī)/桌面端大模型代理會(huì)把自己執(zhí)行任務(wù)得到的軌跡經(jīng)驗(yàn)用于自我迭代。行業(yè)存在兩條主流路線微調(diào)路線拿成功軌跡做SFT/偏好微調(diào)把經(jīng)驗(yàn)固化進(jìn)模型權(quán)重檢索上下文路線維護(hù)軌跡庫運(yùn)行時(shí)檢索相關(guān)樣本放到prompt上下文。但是現(xiàn)有文獻(xiàn)對(duì)比兩種路線得到相互沖突結(jié)論部分場(chǎng)景微調(diào)更好部分場(chǎng)景檢索上下文更好。本文發(fā)現(xiàn)問題根源現(xiàn)有方法把整條軌跡當(dāng)作不可拆分的最小經(jīng)驗(yàn)單元一條軌跡混雜多種屬性完全不同的經(jīng)驗(yàn)片段實(shí)驗(yàn)結(jié)論取決于軌跡內(nèi)部組分占比。舉一個(gè)天氣APP直觀示例任務(wù)為「將羅馬添加到已保存城市列表」。完整軌跡包含兩類信息①搜索框控件的頁面位置定位器跨任務(wù)反復(fù)出現(xiàn)②在預(yù)覽頁面點(diǎn)擊Add按鈕的操作過程序列高度依賴當(dāng)前頁面狀態(tài)。如果直接拿整條軌跡做微調(diào)SFT模型學(xué)會(huì)了控件位置但是會(huì)遺忘“需要點(diǎn)擊Add”這個(gè)狀態(tài)依賴的關(guān)鍵步驟。而組件路由方案定位器存入權(quán)重過程序列保留在上下文二者各司其職。核心研究問題智能體產(chǎn)生的經(jīng)驗(yàn)?zāi)男┻m合放到上下文哪些適合寫入權(quán)重該結(jié)論是否在不同主干模型、訓(xùn)練條件下依然成立本文主要貢獻(xiàn)經(jīng)驗(yàn)單元拆解評(píng)測(cè)把軌跡拆分為4類組件定義訓(xùn)練前可計(jì)算的兩個(gè)統(tǒng)計(jì)屬性在3套主干模型、2個(gè)環(huán)境做嚴(yán)格配對(duì)對(duì)照同一批經(jīng)驗(yàn)分別送入權(quán)重/上下文?;谥貜?fù)出現(xiàn)度、狀態(tài)條件依賴性擬合路由判定規(guī)則在留出模型家族全部24個(gè)樣例預(yù)測(cè)正確兩組干預(yù)實(shí)驗(yàn)驗(yàn)證規(guī)則有效性組件路由相比單一方案平均提升3.5pts。揭示生產(chǎn)者?消費(fèi)者、信息缺口、策略缺口對(duì)兩種經(jīng)驗(yàn)復(fù)用路徑的影響高重復(fù)度經(jīng)驗(yàn)寫入權(quán)重后上下文筆記觸發(fā)率顯著下降上下文收益隨信息缺口上升權(quán)重微調(diào)收益隨策略沖突缺口下降。2 相關(guān)工作2.1 經(jīng)驗(yàn)復(fù)用兩大路線權(quán)重微調(diào) vs 上下文檢索權(quán)重微調(diào)對(duì)智能體自身軌跡做SFT、DPO偏好優(yōu)化提取技能做蒸餾把經(jīng)驗(yàn)固化進(jìn)參數(shù)。上下文檢索維護(hù)軌跡/技能庫運(yùn)行時(shí)檢索把樣本直接放入prompt不修改權(quán)重?,F(xiàn)有研究經(jīng)常直接對(duì)比兩套完整流水線但是輸入經(jīng)驗(yàn)集本身存在差異很少做到保持經(jīng)驗(yàn)內(nèi)容完全不變僅僅改變存放目的地做對(duì)照。本文組件路由固定經(jīng)驗(yàn)素材只改變存儲(chǔ)目的地。2.2 GUI智能體與軌跡經(jīng)驗(yàn)GUI智能體訓(xùn)練來源包括人類演示、智能體自生成軌跡。已有工作會(huì)提取技能卡片、事后重標(biāo)記經(jīng)驗(yàn)觀測(cè)到微調(diào)會(huì)學(xué)習(xí)界面捷徑而不是語義邏輯同一套表征在一類任務(wù)有效另一類任務(wù)產(chǎn)生負(fù)面影響。大部分現(xiàn)有系統(tǒng)固定經(jīng)驗(yàn)存儲(chǔ)目的地本文將經(jīng)驗(yàn)拆分成組件由數(shù)據(jù)統(tǒng)計(jì)屬性自動(dòng)選擇存儲(chǔ)位置。2.3 生產(chǎn)者?消費(fèi)者與自改進(jìn)智能體脆弱性自改進(jìn)智能體性能高度依賴經(jīng)驗(yàn)生成方producer和使用方consumer模型之間的匹配度記憶收益受隨機(jī)種子、任務(wù)順序影響重復(fù)內(nèi)化經(jīng)驗(yàn)性能不升反降。本文區(qū)分信息缺口、策略缺口兩個(gè)指標(biāo)量化解釋生產(chǎn)者消費(fèi)者之間的性能變化。3 實(shí)驗(yàn)設(shè)置組件路由框架組件路由不再把整條軌跡作為單元而是將原始經(jīng)驗(yàn)池EEE提取為4類組件集合DcD_cDc?c∈{G,P,F,L}c \in \{G,P,F,L\}c∈{G,P,F,L}。GGGLocators定位器描述界面元素在屏幕的位置鍵值應(yīng)用角色元素名PPPProcedures過程序列任務(wù)家族內(nèi)部連續(xù)動(dòng)作子目標(biāo)序列鍵值為連續(xù)3個(gè)動(dòng)作目標(biāo)FFFState facts狀態(tài)事實(shí)動(dòng)作成功執(zhí)行必須滿足的前置條件來自同一目標(biāo)的成功、失敗成對(duì)樣本LLLLessons經(jīng)驗(yàn)教訓(xùn)同一個(gè)狀態(tài)下失敗動(dòng)作與對(duì)應(yīng)成功動(dòng)作的偏好配對(duì)每一條經(jīng)驗(yàn)項(xiàng)ddd包含唯一標(biāo)識(shí)key、上下文使用的文本筆記note、用于微調(diào)的訓(xùn)練樣本sample。兩種存儲(chǔ)目的地上下文路線CcC_cCc?運(yùn)行時(shí)根據(jù)當(dāng)前界面狀態(tài)簽名做Jaccard相似度檢索將匹配項(xiàng)作為筆記追加到prompt不修改模型權(quán)重。權(quán)重路線WcW_cWc?使用LoRA低秩適配微調(diào)定位器、過程序列、狀態(tài)事實(shí)使用監(jiān)督微調(diào)SFT經(jīng)驗(yàn)教訓(xùn)使用DPO直接偏好優(yōu)化。共存CcWcC_cW_cCc?Wc?既做微調(diào)運(yùn)行時(shí)同時(shí)追加筆記。定義路由增益Δ(c)\Delta(c)Δ(c)同一套經(jīng)驗(yàn)權(quán)重路線減去上下文路線的留任任務(wù)成功率。Δ(c)U(Wc)?U(Cc) \Delta(c)U(W_c)-U(C_c)Δ(c)U(Wc?)?U(Cc?)Δ(c)0\Delta(c)0Δ(c)0該組件更適合存入權(quán)重Δ(c)0\Delta(c)0Δ(c)0更適合放在上下文。兩個(gè)核心統(tǒng)計(jì)屬性訓(xùn)練前僅從經(jīng)驗(yàn)池計(jì)算無需運(yùn)行模型重復(fù)出現(xiàn)度KaTeX parse error: Cant use function \( in math mode at position 1: \?(?r(d)\)該經(jīng)驗(yàn)key在其他無關(guān)任務(wù)中出現(xiàn)的占比越高代表跨任務(wù)頻繁復(fù)用。狀態(tài)條件依賴性κ0(d)\kappa_0(d)κ0?(d)經(jīng)驗(yàn)的可用性多大程度依賴當(dāng)前界面和生成該經(jīng)驗(yàn)的原始界面嚴(yán)格匹配數(shù)值越高越強(qiáng)依賴特定界面狀態(tài)。組件統(tǒng)計(jì)特性原始實(shí)驗(yàn)統(tǒng)計(jì)均值|組件|符號(hào)|平均重復(fù)度r|中位狀態(tài)條件依賴性κ0\kappa_0κ0?|最優(yōu)目的地||—|—|—|—|—||定位器|G|0.39|0.10|權(quán)重weights||過程序列|P|0.05|0.66|上下文context||狀態(tài)事實(shí)|F|0.32|0.56|上下文context||經(jīng)驗(yàn)教訓(xùn)|L|0.45|0.53|權(quán)重weights|實(shí)驗(yàn)環(huán)境MobileGym手機(jī)仿真GUI環(huán)境20款A(yù)PP416任務(wù)模板可以直接讀取完整應(yīng)用內(nèi)部狀態(tài)AndroidWorld真實(shí)安卓應(yīng)用通過可訪問性樹獲取界面信息共116個(gè)任務(wù)。主干模型BackboneGUI?Owl?8BScaleCUA?7BQwen3?VL?8B附加Qwen3?VL 4B /32B做生產(chǎn)者?消費(fèi)者對(duì)照。評(píng)估協(xié)議全部采用確定性環(huán)境評(píng)判器不使用LLM?as?judge打分配對(duì)bootstrap重采樣10000次計(jì)算95%置信區(qū)間每一組配置3個(gè)不同隨機(jī)種子測(cè)試集分為見過應(yīng)用模板、未見過應(yīng)用模板?;€對(duì)照組Base原始模型不使用任何經(jīng)驗(yàn)Whole?trajectory SFT整條軌跡做微調(diào)軌跡檢索檢索1條完整軌跡、檢索10條步驟記錄Context?then?distill先上下文再蒸餾到權(quán)重All?to?context全部組件送入上下文All?to?weights全部組件送入權(quán)重Reverse routing組件路由分配完全顛倒反向分配Self?retry最多重試3次任務(wù)4 觀測(cè)實(shí)驗(yàn)結(jié)果4.1 組件存在明確最優(yōu)存儲(chǔ)目的地匯總兩套環(huán)境、三套模型?定位器G路由增益Δ4.9\Delta4.9Δ4.9適合存入權(quán)重?經(jīng)驗(yàn)教訓(xùn)L路由增益Δ1.5\Delta1.5Δ1.5傾向權(quán)重?過程序列P路由增益Δ?4.2\Delta-4.2Δ?4.2適合上下文?狀態(tài)事實(shí)F路由增益Δ?4.1\Delta-4.1Δ?4.1適合上下文。共存模式權(quán)重筆記定位器收益幾乎不再提升但是過程序列、狀態(tài)事實(shí)即使已經(jīng)微調(diào)過權(quán)重上下文筆記仍然帶來可觀收益。關(guān)鍵現(xiàn)象不是權(quán)重一定更好也不是上下文一定更好取決于組件本身統(tǒng)計(jì)屬性。4.2 生產(chǎn)者?消費(fèi)者效應(yīng)上下文筆記路線收益不強(qiáng)烈依賴經(jīng)驗(yàn)生成方是誰更強(qiáng)生產(chǎn)者產(chǎn)出經(jīng)驗(yàn)消費(fèi)者拿到收益更高跨家族模型產(chǎn)出經(jīng)驗(yàn)放到上下文依然有效。權(quán)重微調(diào)路線只有消費(fèi)者自身產(chǎn)生的經(jīng)驗(yàn)微調(diào)才有正向收益使用其他模型尤其是其他家族生成樣本微調(diào)性能反而下降。權(quán)重微調(diào)學(xué)到很大一部分收益來自于對(duì)自身行為的練習(xí)practice而不是跨模型遷移知識(shí)。4.3 寫入權(quán)重后上下文筆記的讀取觸發(fā)率下降讀取觸發(fā)率添加筆記前后模型動(dòng)作是否發(fā)生改變的步驟占比。現(xiàn)象組件寫入權(quán)重之后筆記的讀取觸發(fā)率顯著下降下降幅度和該組件的重復(fù)出現(xiàn)度r強(qiáng)負(fù)相關(guān)Spearman ?0.92。高重復(fù)度的定位器、經(jīng)驗(yàn)教訓(xùn)寫入權(quán)重后筆記幾乎不再改變模型輸出而高度狀態(tài)依賴的過程序列筆記依舊有很高價(jià)值。解釋高重復(fù)度的知識(shí)被模型權(quán)重吸收強(qiáng)狀態(tài)依賴的知識(shí)很難被權(quán)重完全吸收筆記仍然不可替代。5 路由判定規(guī)則5.1 基于r,κ0r,\kappa_0r,κ0?的線性打分規(guī)則s(c)α?r(c)?β?κ0(c)?γ s(c)\alpha\cdot r(c)-\beta\cdot \kappa_0(c)-\gammas(c)α?r(c)?β?κ0?(c)?γKaTeX parse error: Cant use function \( in math mode at position 1: \?(?s(c)0\)→ 送入權(quán)重weightss(c)≤0s(c)\le0s(c)≤0→ 送入上下文context采用留一法每次留出一個(gè)主干模型家族做測(cè)試在另外兩個(gè)家族上擬合參數(shù)24個(gè)留出測(cè)試單元格全部符號(hào)預(yù)測(cè)正確24/24。邊界把平面劃分為兩個(gè)區(qū)域高重復(fù)度、低狀態(tài)依賴 → 權(quán)重低重復(fù)度、高狀態(tài)依賴 → 上下文。經(jīng)驗(yàn)教訓(xùn)L、狀態(tài)事實(shí)F落在邊界附近同一個(gè)組件內(nèi)部高r子項(xiàng)走權(quán)重、低r子項(xiàng)走上下文性能差異顯著。5.2 干預(yù)驗(yàn)證實(shí)驗(yàn)人為修改屬性觀測(cè)路由收益變化提升訓(xùn)練劑量樣本復(fù)制×8過程序列P的路由增益從?4.2提升至?0.8向權(quán)重一側(cè)大幅偏移。剝離狀態(tài)條件僅用任務(wù)文本檢索不再匹配界面狀態(tài)過程序列P上下文收益下降?3.9pts狀態(tài)事實(shí)F上下文收益下降?3.4pts。證明過程序列、狀態(tài)事實(shí)從上下文獲得的收益絕大部分來自狀態(tài)匹配檢索能力。5.3 沖突場(chǎng)景權(quán)重陳舊筆記是新版本當(dāng)APP界面發(fā)生版本變更權(quán)重是舊版本知識(shí)上下文筆記攜帶新版本知識(shí)。高重復(fù)度組件模型更傾向遵循已經(jīng)固化在權(quán)重的陳舊知識(shí)忽略筆記低重復(fù)度組件更容易采納上下文筆記給出的新動(dòng)作。風(fēng)險(xiǎn)高重復(fù)度知識(shí)一旦過時(shí)模型很難被上下文筆記糾正。5.4 整體性能對(duì)比實(shí)驗(yàn)組MobileGym平均得分相比單一最優(yōu)方案增益相比反向分配增益組件路由ours32.84.48.9全部送上下文28.6??全部送權(quán)重27.9??反向分配23.9??自重試基線22.6??整條軌跡SFT21.1??AndroidWorld上同樣取得一致結(jié)論。組件路由顯著優(yōu)于所有whole?trajectory整條軌跡基線。6 生產(chǎn)者?消費(fèi)者之間的收益遷移信息缺口與策略缺口定義兩個(gè)關(guān)鍵缺口指標(biāo)信息缺口gIg_IgI?生產(chǎn)者會(huì)、消費(fèi)者不會(huì)處理的任務(wù)占比信息缺口越大上下文筆記收益越高。策略缺口gPg_PgP?同一狀態(tài)下生產(chǎn)者與消費(fèi)者輸出不同動(dòng)作的比例策略缺口越大權(quán)重微調(diào)收益越低甚至負(fù)收益。核心觀測(cè)上下文路線收益隨信息缺口上升筆記提供消費(fèi)者缺失的信息不在乎是誰生成權(quán)重微調(diào)路線收益隨策略缺口衰減如果生產(chǎn)者和消費(fèi)者策略行為不一致微調(diào)會(huì)破壞原有模型能力當(dāng)升級(jí)更換消費(fèi)者模型舊模型產(chǎn)出的筆記庫仍然可以復(fù)用但是權(quán)重LoRA適配器需要基于新消費(fèi)者軌跡重新訓(xùn)練。7 結(jié)論本文提出組件路由Component Routing不要直接把整條軌跡全部丟給權(quán)重或者全部丟給上下文將GUI智能體經(jīng)驗(yàn)拆分為定位器、過程序列、狀態(tài)事實(shí)、經(jīng)驗(yàn)教訓(xùn)。利用訓(xùn)練前可統(tǒng)計(jì)的兩個(gè)屬性重復(fù)出現(xiàn)度r、狀態(tài)條件依賴性κ0\kappa_0κ0?自動(dòng)判定組件存儲(chǔ)目的地。?最優(yōu)分配定位器、經(jīng)驗(yàn)教訓(xùn) → 模型權(quán)重LoRA微調(diào)高重復(fù)弱狀態(tài)依賴過程序列、狀態(tài)事實(shí) → 運(yùn)行時(shí)上下文檢索筆記低重復(fù)強(qiáng)狀態(tài)條件依賴關(guān)鍵發(fā)現(xiàn)高重復(fù)度知識(shí)寫入權(quán)重后上下文筆記的影響力會(huì)被顯著削弱強(qiáng)狀態(tài)依賴知識(shí)即便做過微調(diào)上下文筆記依然不可替代。上下文筆記可以跨模型家族遷移權(quán)重微調(diào)高度依賴生產(chǎn)者?消費(fèi)者策略對(duì)齊不同模型生成經(jīng)驗(yàn)直接微調(diào)往往帶來負(fù)面效果。當(dāng)發(fā)生軟件界面版本迭代已經(jīng)內(nèi)化進(jìn)權(quán)重的高頻知識(shí)容易變成陳舊知識(shí)上下文筆記很難覆蓋糾正。組件路由在兩套測(cè)試環(huán)境對(duì)比全部組件單一目的地基線平均提升3.5個(gè)百分點(diǎn)。工程啟示GUI智能體自改進(jìn)不應(yīng)該一刀切選擇微調(diào)或者檢索上下文優(yōu)先對(duì)經(jīng)驗(yàn)做組件拆分根據(jù)統(tǒng)計(jì)屬性分配存儲(chǔ)位置強(qiáng)狀態(tài)依賴的操作流程盡量保留在檢索上下文不要全部壓入權(quán)重。附錄要點(diǎn)摘要附錄A四類組件完整定義、提取規(guī)則每個(gè)組件包含key標(biāo)識(shí)、payload有效載荷、狀態(tài)條件提供樣例給出MobileGym、AndroidWorld兩套環(huán)境的組件數(shù)量統(tǒng)計(jì)、r與κ0\kappa_0κ0?分布。附錄B實(shí)驗(yàn)協(xié)議、環(huán)境劃分、各個(gè)實(shí)驗(yàn)組配置、干預(yù)實(shí)驗(yàn)組數(shù)據(jù)集劃分held?out任務(wù)實(shí)例數(shù)量各類ablation干預(yù)臂復(fù)制樣本、移除狀態(tài)匹配、打亂key對(duì)照實(shí)驗(yàn)隨機(jī)筆記對(duì)照組。附錄C訓(xùn)練超參LoRA rank16α32\alpha32α32epoch3學(xué)習(xí)率10?510^{-5}10?5vision塔凍結(jié)SFT用于G/P/FDPO用于L經(jīng)驗(yàn)教訓(xùn)。附錄D路由規(guī)則擬合數(shù)學(xué)推導(dǎo)、留一法測(cè)試完整表格附錄E全部完整實(shí)驗(yàn)數(shù)值結(jié)果干預(yù)實(shí)驗(yàn)、生產(chǎn)者?消費(fèi)者對(duì)照數(shù)據(jù)附錄F敏感性測(cè)試Jaccard閾值、筆記條數(shù)、LoRA秩、經(jīng)驗(yàn)池大小等參數(shù)掃描。附錄G兩個(gè)完整任務(wù)案例復(fù)現(xiàn)案例1天氣APP添加城市展示路由分配與全部送入權(quán)重兩種方案的執(zhí)行軌跡對(duì)比。案例2日歷APP版本沖突權(quán)重陳舊上下文筆記給出正確動(dòng)作。附錄H算力統(tǒng)計(jì)每個(gè)實(shí)驗(yàn)組GPU小時(shí)消耗、prompt token開銷附錄I所有主干模型完整系統(tǒng)提示詞、筆記塊模板