
Weak-to-Strong Generalization via Direct On-Policy Distillation 全文總結+指定章節(jié)中英對照翻譯一、文章整體核心內容總結1. 研究背景當前基于可驗證獎勵的強化學習(RLVR)是提升大模型數學推理能力的主流后訓練方案,但存在極高算力成本:模型規(guī)模越大,生成采樣軌跡、迭代RL的開銷呈指數上漲,每一款新的強推理模型都要從頭跑完整RL,后訓練成為性能擴展瓶頸。傳統(tǒng)在策略蒸餾(OPD)直接模仿小RL模型的最終策略,存在致命缺陷:小模型的最終策略混合了RL帶來的推理增益與小模型本身的容量短板;若學生模型本身性能已經超過小教師,單純模仿會直接拉低學生效果。2. 核心方案:Direct-OPD(直接在策略蒸餾)不蒸餾小RL模型的絕對輸出分布,而是提取RL帶來的策略偏移量作為可遷移隱式獎勵:取同一小模型RL前后兩個權重:RL前參考模型πTref\pi_{T_{ref}}