
Nested-ReFT論文總結(jié)與關(guān)鍵部分翻譯一、文章主要內(nèi)容總結(jié)本文聚焦于大語言模型(LLMs)在數(shù)學(xué)推理等復(fù)雜任務(wù)中基于強(qiáng)化學(xué)習(xí)的微調(diào)(ReFT)技術(shù),針對(duì)傳統(tǒng)ReFT計(jì)算成本高的問題,提出了名為“Nested-ReFT”的新型框架,核心內(nèi)容如下:1. 研究背景與問題ReFT的優(yōu)勢(shì)與局限:ReFT通過行為模型生成多個(gè)思維鏈(CoT)完成結(jié)果,結(jié)合可驗(yàn)證獎(jiǎng)勵(lì)函數(shù)優(yōu)化模型,在數(shù)學(xué)推理等領(lǐng)域提升顯著,但生成多個(gè)完成結(jié)果需大量推理步驟,導(dǎo)致訓(xùn)練計(jì)算成本高昂?,F(xiàn)有方案痛點(diǎn):傳統(tǒng)ReFT中,行為模型與目標(biāo)模型架構(gòu)一致(如使用前一梯度步的目標(biāo)模型),生成樣本的計(jì)算資源與目標(biāo)模型相當(dāng),且增加CoT完成結(jié)果數(shù)量雖能降低更新偏差,卻進(jìn)一步加劇計(jì)算開銷。2. 核心框架:Nested-ReFT核心思路:借鑒離線強(qiáng)化學(xué)習(xí)(Off-Policy RL)和推測(cè)解碼(Speculative Decoding),將目標(biāo)模型的部分層作為行為模型,通過“動(dòng)態(tài)層跳過”機(jī)制生成離線完成結(jié)果,降低推理成本。層跳過機(jī)制:定義“有效層集合”:排除模型最內(nèi)層和最外層(距離邊界b層內(nèi))的層,僅從中間層中隨機(jī)跳過一定比例(x%)的層,確保模型生成的結(jié)構(gòu)一致性(內(nèi)層和外層對(duì)生成質(zhì)量至關(guān)