練三階段全景:預(yù)訓(xùn)練、SFT(監(jiān)督微調(diào))與RL(強(qiáng)化學(xué)習(xí))的本質(zhì)區(qū)別)
15-模型后訓(xùn)練三階段全景預(yù)訓(xùn)練、SFT監(jiān)督微調(diào)與RL強(qiáng)化學(xué)習(xí)的本質(zhì)區(qū)別系列導(dǎo)讀前兩篇聊的是怎么評(píng)估這一篇進(jìn)入怎么變強(qiáng)?;诶畈┙堋渡钊肜斫釧I Agent設(shè)計(jì)原理與工程實(shí)踐》的后訓(xùn)練章節(jié)結(jié)合我做售貨柜Agent模型調(diào)優(yōu)的實(shí)踐把預(yù)訓(xùn)練、SFT、RL這三件事一次講透。一、三階段全景一條流水線三種完全不同的學(xué)習(xí)方式一個(gè)能干活的模型誕生大致經(jīng)過(guò)三個(gè)階段預(yù)訓(xùn)練Pre-training → SFTSupervised Fine-Tuning監(jiān)督微調(diào) → RLReinforcement Learning強(qiáng)化學(xué)習(xí) 海量文本學(xué)語(yǔ)言 示范數(shù)據(jù)學(xué)格式與流程 試錯(cuò)反饋學(xué)決策與泛化一句話概括三者分工預(yù)訓(xùn)練學(xué)會(huì)語(yǔ)言與世界知識(shí)——壓縮了互聯(lián)網(wǎng)SFT學(xué)會(huì)按指令干活的樣子——模仿人類示范RL學(xué)會(huì)把活干成——以結(jié)果為目標(biāo)自我進(jìn)化。新手最常犯的混淆是認(rèn)為SFT和RL都是微調(diào)差不多。差很多。下面逐個(gè)拆。二、預(yù)訓(xùn)練在做什么預(yù)測(cè)下一個(gè)詞預(yù)訓(xùn)練的目標(biāo)函數(shù)樸素到令人發(fā)指給定前文預(yù)測(cè)下一個(gè)詞next token prediction。輸入今天天氣真 模型很(0.6) 好(0.3) 差(0.05) ...就這么一個(gè)簡(jiǎn)單目標(biāo)配上萬(wàn)億級(jí)token和千億級(jí)參數(shù)涌現(xiàn)出了語(yǔ)法、事實(shí)知識(shí)、推理能力甚至代碼能力。為什么因?yàn)橐严乱粋€(gè)詞預(yù)測(cè)準(zhǔn)模型不得不內(nèi)化世界的統(tǒng)計(jì)結(jié)構(gòu)——預(yù)測(cè)水燒到100度會(huì)___你必須懂物理常識(shí)。預(yù)訓(xùn)練的產(chǎn)出是一個(gè)基座模型Base Model。它像個(gè)博覽群書但不會(huì)聊天的學(xué)者你問(wèn)它如何申請(qǐng)退款它可能接著寫如何申請(qǐng)退貨如何投訴商家“——它只是在進(jìn)行文本續(xù)寫根本沒(méi)意識(shí)到你在提問(wèn)”。這也是為什么基座模型不能直接當(dāng)Agent用。對(duì)我們做業(yè)務(wù)的人來(lái)說(shuō)預(yù)訓(xùn)練基本是巨頭的事幾萬(wàn)張GPU的軍備競(jìng)賽我們的戰(zhàn)場(chǎng)在后面兩個(gè)階段。三、SFT的本質(zhì)換了數(shù)據(jù)的預(yù)測(cè)下一個(gè)詞SFT的關(guān)鍵洞察是它和預(yù)訓(xùn)練用的是同一個(gè)目標(biāo)函數(shù)——預(yù)測(cè)下一個(gè)詞只是換了數(shù)據(jù)。預(yù)訓(xùn)練的數(shù)據(jù)是互聯(lián)網(wǎng)上的原始文本SFT的數(shù)據(jù)是高質(zhì)量的指令-回答示范對(duì)。比如輸入指令對(duì)話歷史工具結(jié)果 用戶我掃了碼沒(méi)出貨錢扣了 [工具結(jié)果] 訂單A123實(shí)付12元柜機(jī)日志出貨電機(jī)超時(shí) 目標(biāo)輸出 {action: refund, order_id: A123, amount: 12.0}模型在這些示范數(shù)據(jù)上繼續(xù)做預(yù)測(cè)下一個(gè)詞就學(xué)會(huì)了見(jiàn)到這種情境應(yīng)該輸出這種格式、走這個(gè)流程。所以SFT的本質(zhì)是行為模仿示范數(shù)據(jù)里怎么寫模型就怎么學(xué)。它的特點(diǎn)是見(jiàn)效快幾百到幾萬(wàn)條高質(zhì)量數(shù)據(jù)就能顯著改變行為風(fēng)格和格式遵循上限受示范限制示范里沒(méi)有的行為模型很難無(wú)中生有。示范質(zhì)量就是天花板容易記住而不是理解分布內(nèi)的任務(wù)表現(xiàn)好分布外容易露餡。SFT數(shù)據(jù)合成從示范到可訓(xùn)練軌跡寫一萬(wàn)條示范數(shù)據(jù)靠人力是不現(xiàn)實(shí)的實(shí)踐中大量采用數(shù)據(jù)合成強(qiáng)模型蒸餾讓更強(qiáng)的模型如旗艦?zāi)P蜕筛哔|(zhì)量回答清洗后作為SFT數(shù)據(jù)——小模型學(xué)大模型軌跡重構(gòu)把人類專家的實(shí)際操作日志查了哪些系統(tǒng)、做了什么決定重構(gòu)成Agent格式的軌跡拒絕采樣同一個(gè)問(wèn)題讓教師模型生成N個(gè)回答用判分器規(guī)則或LLM-as-a-Judge呼應(yīng)第14篇只保留正確的進(jìn)數(shù)據(jù)集。我們給售貨柜退款A(yù)gent做SFT時(shí)最有效的數(shù)據(jù)就是從歷史人工客服的處理記錄里合成軌跡——幾千條真實(shí)案例合成的數(shù)據(jù)效果遠(yuǎn)好于憑空編的幾萬(wàn)條。四、SFT與RL的本質(zhì)區(qū)別模仿 vs 試錯(cuò)這是本篇的核心。兩者對(duì)比維度SFTRL學(xué)習(xí)信號(hào)每個(gè)token都有標(biāo)準(zhǔn)答案只有序列結(jié)束后的獎(jiǎng)勵(lì)稀疏學(xué)習(xí)方式模仿示范探索試錯(cuò)好的行為被強(qiáng)化傾向記憶示范分布泛化到示范沒(méi)覆蓋的情況數(shù)據(jù)要求需要高質(zhì)量示范需要可判分的任務(wù)環(huán)境風(fēng)險(xiǎn)模仿上限受限容易過(guò)擬合訓(xùn)練不穩(wěn)定可能鉆獎(jiǎng)勵(lì)空子用一個(gè)比喻SFT是抄學(xué)霸筆記RL是自己刷題對(duì)答案。抄筆記能快速及格但遇到筆記上沒(méi)有的題型就懵刷題對(duì)答案雖然慢卻能建立真正的解題能力應(yīng)對(duì)沒(méi)見(jiàn)過(guò)的題。什么時(shí)候需要先SFT后RL當(dāng)基座模型連任務(wù)的基本格式都不會(huì)時(shí)RL無(wú)從下手——它隨機(jī)探索出來(lái)的行為大概率全是零分沒(méi)有梯度信號(hào)即獎(jiǎng)勵(lì)過(guò)于稀疏。標(biāo)準(zhǔn)路徑是先SFT讓模型學(xué)會(huì)基本的行為格式達(dá)到能及格的水平再RL從及格線出發(fā)通過(guò)試錯(cuò)把成功率往上磨。這就是SFT提供先驗(yàn)RL突破上限。何時(shí)選SFT何時(shí)選RL兩個(gè)判斷維度任務(wù)復(fù)雜度和數(shù)據(jù)可得性。任務(wù)結(jié)果容易自動(dòng)判分代碼能跑過(guò)測(cè)試、數(shù)學(xué)答案能對(duì)答案 有仿真環(huán)境 →RL優(yōu)先天花板高任務(wù)很難自動(dòng)判分寫文案、語(yǔ)氣得體 有大量?jī)?yōu)秀示范 →SFT優(yōu)先簡(jiǎn)單直接兩者都有 → SFT打底 RL沖刺這是當(dāng)前Agent能力訓(xùn)練的主流配方。單輪強(qiáng)化學(xué)習(xí)記憶與泛化的對(duì)照有個(gè)經(jīng)典實(shí)驗(yàn)值得知道讓模型在單輪任務(wù)上做RL任務(wù)帶隨機(jī)性如隨機(jī)生成的密碼/隨機(jī)數(shù)運(yùn)算。模型無(wú)法記住答案每次都不同只能學(xué)會(huì)真正的算法。結(jié)果模型在訓(xùn)練分布內(nèi)正確率飆升同時(shí)展現(xiàn)出對(duì)任務(wù)參數(shù)的泛化。這個(gè)對(duì)照實(shí)驗(yàn)說(shuō)明了RL學(xué)到的是策略而不是記憶——這正是它區(qū)別于SFT的本質(zhì)證據(jù)。五、RL算法直覺(jué)從16次rollout到一次參數(shù)更新RL訓(xùn)練的具體循環(huán)以GRPO類算法的直覺(jué)為例采樣一批任務(wù)prompt對(duì)每個(gè)任務(wù)模型獨(dú)立生成k條完整軌跡rollout比如k16——這就是Agent的考試作答一題交16份卷對(duì)每條軌跡判分得到獎(jiǎng)勵(lì)比如16份卷子里5份滿分、11份零分GRPO的核心直覺(jué)同題軌跡組內(nèi)互相比較——滿分軌跡的行為被強(qiáng)化增大概率零分軌跡的行為被抑制減小概率不需要單獨(dú)訓(xùn)一個(gè)價(jià)值網(wǎng)絡(luò)來(lái)估計(jì)基線組內(nèi)平均就是基線用這批強(qiáng)化/抑制信號(hào)做一次梯度更新更新模型參數(shù)回到第1步用更新后的模型繼續(xù)采樣。注意第6步RL的數(shù)據(jù)分布隨模型進(jìn)化而變化on-policy模型越練越強(qiáng)采到的高分軌跡越來(lái)越多形成飛輪。這也解釋了RL為什么貴——16條rollout的推理成本全要自己掏。六、RL環(huán)境從評(píng)估到仿真第14篇講的評(píng)估環(huán)境在RL里換了個(gè)身份訓(xùn)練環(huán)境。區(qū)別在于用途評(píng)估環(huán)境跑固定數(shù)據(jù)集算分?jǐn)?shù)RL環(huán)境動(dòng)態(tài)出題、即時(shí)判分、給獎(jiǎng)勵(lì)要求大規(guī)模、低成本、可并行。一條鐵律是環(huán)境任務(wù)分布與評(píng)估隔離訓(xùn)練出的題目和評(píng)估考的題目必須分開(kāi)否則模型把答案背下來(lái)了評(píng)估分?jǐn)?shù)虛高實(shí)際能力為零——等價(jià)于考試泄題。我們做退款A(yù)gent的RL訓(xùn)練時(shí)訓(xùn)練環(huán)境的訂單、日志、故障碼全部程序化隨機(jī)生成金額隨機(jī)、券隨機(jī)、故障類型按真實(shí)分布采樣評(píng)估集則單獨(dú)保留一批真實(shí)脫敏案例兩邊絕不混用。結(jié)合Agent工具調(diào)用能力訓(xùn)練Agent場(chǎng)景的RL環(huán)境里要有工具模型生成調(diào)用工具的動(dòng)作 → 環(huán)境執(zhí)行并返回真實(shí)結(jié)果 → 模型繼續(xù)決策 → 直到任務(wù)完成 → 按最終結(jié)果給獎(jiǎng)勵(lì)。這就是把環(huán)境帶進(jìn)訓(xùn)練。實(shí)踐證明經(jīng)過(guò)工具調(diào)用RL訓(xùn)練的模型在工具選擇準(zhǔn)確率、參數(shù)正確率、多步任務(wù)的Pass^k上都有肉眼可見(jiàn)的提升——這比在Prompt里寫一百句請(qǐng)正確選擇工具管用得多。小結(jié)三階段流水線預(yù)訓(xùn)練學(xué)語(yǔ)言與世界知識(shí)SFT學(xué)行為示范RL學(xué)決策泛化SFT和預(yù)訓(xùn)練目標(biāo)函數(shù)相同預(yù)測(cè)下一個(gè)詞本質(zhì)是換了數(shù)據(jù)RL目標(biāo)函數(shù)不同最大化獎(jiǎng)勵(lì)本質(zhì)從模仿變?yōu)樵囧e(cuò)SFT記憶、RL泛化SFT是抄筆記RL是刷題對(duì)答案先SFT打底再RL突破適用于獎(jiǎng)勵(lì)稀疏、基座起點(diǎn)的場(chǎng)景GRPO直覺(jué)同題多rollout組內(nèi)比較好的強(qiáng)化、差的抑制RL環(huán)境要可仿真、可判分、可并行且訓(xùn)練分布與評(píng)估集嚴(yán)格隔離。RL訓(xùn)練里最靈魂的問(wèn)題其實(shí)只有一個(gè)獎(jiǎng)勵(lì)從哪來(lái)、怎么給——獎(jiǎng)勵(lì)設(shè)計(jì)錯(cuò)了模型會(huì)以你意想不到的方式聰明地跑偏。