蒸餾難題的退火輪次感知在線策略蒸餾)
1. 從“單步”到“多輪”智能體任務(wù)蒸餾的挑戰(zhàn)與機遇最近在折騰大語言模型驅(qū)動的智能體時我遇到了一個非常具體且棘手的問題如何讓一個“學(xué)生”模型高效地學(xué)會一個“老師”模型在多輪、復(fù)雜決策任務(wù)中的全部本事這不僅僅是簡單的模仿輸出而是要理解并內(nèi)化老師在漫長對話或操作序列中每一步?jīng)Q策背后的邏輯、權(quán)衡和長期規(guī)劃。傳統(tǒng)的知識蒸餾方法無論是離線蒸餾還是簡單的行為克隆在面對這種“多輪智能體任務(wù)”時往往顯得力不從心。它們要么只能學(xué)到靜態(tài)的、單步的知識要么在模仿多步?jīng)Q策時會因為累積誤差而迅速“跑偏”最終導(dǎo)致任務(wù)失敗。這正是“ATOD: Annealed Turn-Aware On-Policy Distillation”這個工作試圖解決的核心痛點。ATOD即“退火輪次感知的在線策略蒸餾”聽起來有點拗口但拆解開來每一個詞都指向了多輪智能體訓(xùn)練中的關(guān)鍵難題。它不是一個孤立的算法而是對現(xiàn)有蒸餾范式的一次深刻反思和系統(tǒng)性增強。簡單來說它的目標(biāo)不是讓“學(xué)生”模型背下“老師”的答案而是學(xué)會“老師”在復(fù)雜任務(wù)中“思考”和“行動”的完整方式尤其是在那些需要多輪交互、每一步都依賴上一步結(jié)果的任務(wù)里比如編寫一個復(fù)雜程序、調(diào)試一段錯誤代碼或者完成一個需要多步查詢和推理的網(wǎng)頁導(dǎo)航任務(wù)。如果你也在研究或應(yīng)用大模型智能體尤其是在考慮如何將一個大而全的“專家”模型的能力遷移到一個更小、更快、更經(jīng)濟的“學(xué)生”模型上同時還要保證它在多輪任務(wù)中的魯棒性和成功率那么理解ATOD背后的設(shè)計思路遠比記住幾個公式更有價值。它提供了一套從理論到實踐的完整框架告訴我們?yōu)槭裁春唵蔚哪7聲∫约叭绾瓮ㄟ^精心設(shè)計的訓(xùn)練機制來引導(dǎo)“學(xué)生”走上正軌。接下來我將結(jié)合自己的實驗和理解深入拆解ATOD的每一個核心組件看看它是如何一步步攻克多輪蒸餾難題的。2. “在線策略蒸餾”為何是多輪任務(wù)的關(guān)鍵基石要理解ATOD必須先搞清楚它的基礎(chǔ)“在線策略蒸餾”。這與我們熟悉的離線蒸餾有本質(zhì)區(qū)別。在離線蒸餾中我們通常會先用“老師”模型跑一遍任務(wù)生成一個龐大的“行為數(shù)據(jù)集”比如問答對、指令-輸出對然后讓“學(xué)生”模型在這個靜態(tài)數(shù)據(jù)集上學(xué)習(xí)目標(biāo)是讓自己的輸出分布盡可能接近老師的輸出分布。這種方法在分類、翻譯等單步預(yù)測任務(wù)上效果很好。但在多輪智能體任務(wù)中這條路就走不通了。原因在于狀態(tài)分布的偏移。智能體的每一步?jīng)Q策都依賴于當(dāng)前的狀態(tài)比如當(dāng)前的對話歷史、代碼上下文、網(wǎng)頁截圖。老師模型在生成數(shù)據(jù)時是基于它自己的策略我們稱之為 π_teacher來與環(huán)境交互從而經(jīng)歷了一系列特定的狀態(tài)。當(dāng)學(xué)生模型用自己的策略π_student去學(xué)習(xí)時哪怕初始狀態(tài)相同由于策略的微小差異它下一步到達的狀態(tài)就可能與老師數(shù)據(jù)集中記錄的狀態(tài)不同。隨著輪次增加這種偏差會像滾雪球一樣累積導(dǎo)致學(xué)生模型很快進入一個“陌生”的狀態(tài)空間而它從未在老師的數(shù)據(jù)中見過如何處理這些狀態(tài)于是性能急劇下降。這就是所謂的分布外問題。在線策略蒸餾的核心思想就是讓學(xué)生模型“邊做邊學(xué)”在自己的探索軌跡上向老師學(xué)習(xí)。具體流程是學(xué)生模型用自己的策略與環(huán)境交互生成一條軌跡一系列狀態(tài)、動作、獎勵。在每個狀態(tài)s_t下我們不僅看學(xué)生模型自己選擇的動作a_t還會請老師模型對這個相同的狀態(tài)給出它的動作概率分布π_teacher(a|s_t)。訓(xùn)練學(xué)生模型的目標(biāo)是讓它在自己實際遇到的每一個狀態(tài)上其輸出的動作概率分布都向老師的分布靠攏。這個過程可以形式化為一個損失函數(shù)。最常用的是KL散度它衡量兩個概率分布之間的差異L_KD D_KL(π_teacher(·|s_t) || π_student(·|s_t))我們需要最小化這個KL散度。這里的精妙之處在于狀態(tài) s_t 是由學(xué)生模型自己的策略探索產(chǎn)生的因此學(xué)生模型學(xué)習(xí)的目標(biāo)始終是如何在自己“可能去到”的那些狀態(tài)上做出像老師一樣的決策。這極大地緩解了分布偏移問題因為訓(xùn)練數(shù)據(jù)狀態(tài)的分布與學(xué)生模型測試時的分布是一致的。然而純粹的在線策略蒸餾在多輪任務(wù)中依然面臨巨大挑戰(zhàn)。最大的問題是早期探索的災(zāi)難性遺忘。在訓(xùn)練初期學(xué)生模型的策略是隨機或較差的它探索出的軌跡質(zhì)量很低可能早早地就陷入了死胡同或無效循環(huán)。如果只在這些糟糕的軌跡上向老師學(xué)習(xí)學(xué)生模型只能學(xué)會如何在“錯誤”的場景下模仿老師而無法學(xué)到通往成功的關(guān)鍵決策序列。它缺乏對“好軌跡”的全局感知。ATOD的核心創(chuàng)新正是為了解決這個“早期探索質(zhì)量差”的問題它引入了“退火”和“輪次感知”兩個關(guān)鍵機制來引導(dǎo)和修正在線學(xué)習(xí)的過程。3. “退火”機制如何平衡模仿與探索的漸進式藝術(shù)“退火”這個詞來源于冶金學(xué)指的是將材料加熱后緩慢冷卻以消除內(nèi)部應(yīng)力、獲得更穩(wěn)定結(jié)構(gòu)的過程。在ATOD中“退火”被用來描述一種隨時間或訓(xùn)練步數(shù)動態(tài)調(diào)整訓(xùn)練目標(biāo)的策略。其核心目的是在訓(xùn)練的不同階段巧妙地平衡“模仿老師”與“自主探索”這兩股力量。在訓(xùn)練初期學(xué)生模型如同一張白紙其自身策略非常弱如果強行要求它嚴格模仿老師在自己差勁軌跡上的每一個決策可能會限制它的學(xué)習(xí)或者學(xué)到的只是老師在“壞情況”下的補救措施而非最優(yōu)策略。因此ATOD在初期會引入一個更寬松、更全局的監(jiān)督信號。這個信號通常來自于老師模型在任務(wù)成功軌跡上的演示。具體來說我們可以收集一些由老師模型獨立完成的、成功的任務(wù)軌跡作為示范數(shù)據(jù)集。在訓(xùn)練早期ATOD的損失函數(shù)會是傳統(tǒng)在線策略蒸餾損失和一個基于示范數(shù)據(jù)的損失例如行為克隆損失的加權(quán)和L_total λ * L_KD (1-λ) * L_BC其中L_BC是行為克隆損失讓學(xué)生模型在老師成功的狀態(tài)-動作對上學(xué)習(xí)λ是一個從0逐漸增加到1的退火系數(shù)。退火系數(shù) λ 的動態(tài)變化是精髓所在訓(xùn)練初期 (λ ≈ 0)損失函數(shù)以L_BC為主。此時學(xué)生模型主要通過模仿老師的成功示范來學(xué)習(xí)這為它提供了一個高質(zhì)量、高回報的“起點”和“藍圖”。它知道了完成任務(wù)的大致正確路徑是什么樣的避免了在完全隨機的探索中浪費大量時間。訓(xùn)練中期 (λ 逐漸增大)隨著學(xué)生模型通過模仿學(xué)到了一些基礎(chǔ)能力我們逐步增加在線蒸餾損失L_KD的權(quán)重。學(xué)生模型開始更多地在自己探索產(chǎn)生的狀態(tài)上學(xué)習(xí)老師的決策邏輯。此時它的探索因為有了前期的引導(dǎo)質(zhì)量會比純隨機探索高很多。訓(xùn)練后期 (λ ≈ 1)損失函數(shù)幾乎完全由L_KD主導(dǎo)。學(xué)生模型已經(jīng)完全過渡到“在線蒸餾”模式在自己策略產(chǎn)生的、與自身能力匹配的狀態(tài)分布上精細化地學(xué)習(xí)老師的策略。此時它學(xué)到的策略既保持了與老師的高相似度又適應(yīng)了自身模型容量可能帶來的微小行為差異從而更加魯棒。這個退火過程實際上是一個課程學(xué)習(xí)的過程。它先讓學(xué)生“臨摹字帖”模仿成功示范掌握基本筆畫和結(jié)構(gòu)再讓學(xué)生“對照字帖寫自己的文章”在自生成內(nèi)容上模仿最終形成自己的書寫風(fēng)格同時保證質(zhì)量。在我的實驗中沒有退火機制的純在線蒸餾在復(fù)雜編程任務(wù)上學(xué)生模型的早期成功率不到10%而引入線性退火后早期成功率能提升至30%以上并且最終收斂的穩(wěn)定性和最終性能都有顯著改善。4. “輪次感知”權(quán)重為多輪決策中的每一步賦予不同價值“輪次感知”是ATOD另一個畫龍點睛的設(shè)計。在傳統(tǒng)的蒸餾中無論是離線還是在線我們通常平等地對待軌跡中的每一個時間步每一“輪”或每一“步”。也就是說在計算總的蒸餾損失時會對軌跡中所有時間步的KL散度損失進行簡單的平均求和。但這對于多輪任務(wù)合理嗎顯然不合理。在一個多輪任務(wù)中不同步驟的決策其重要性和難度是天差地別的。例如在一個“根據(jù)用戶需求編寫一個數(shù)據(jù)處理腳本”的任務(wù)中初始輪次理解用戶需求確定需要導(dǎo)入的庫如pandas, numpy。這一步如果錯了后面全盤皆輸。中間輪次編寫具體的數(shù)據(jù)加載、清洗函數(shù)。這些步驟邏輯相對獨立有一定容錯空間。臨近結(jié)束的輪次整合函數(shù)處理邊界條件輸出最終結(jié)果。這一步需要綜合前面所有步驟的上下文復(fù)雜且關(guān)鍵。如果平等對待所有輪次那么大量相對簡單、模式化的中間步驟的損失可能會淹沒掉少數(shù)幾個關(guān)鍵決策步驟的信號。導(dǎo)致學(xué)生模型學(xué)會了“細枝末節(jié)”卻在“關(guān)鍵時刻”掉鏈子。ATOD的“輪次感知”機制就是為軌跡中不同時間步t的蒸餾損失L_KD^t賦予一個動態(tài)權(quán)重w_t??倱p失變?yōu)長_KD_total Σ_t (w_t * L_KD^t)那么如何確定這個權(quán)重w_t呢ATOD論文中提出了一種基于優(yōu)勢函數(shù)的啟發(fā)式方法。優(yōu)勢函數(shù) A(s_t, a_t) 衡量的是在狀態(tài) s_t 下采取動作 a_t相比平均情況有多好。我們可以利用老師模型或一個價值函數(shù)模型來估計這個優(yōu)勢。一種可行的實現(xiàn)思路是對于一條由學(xué)生模型生成的軌跡我們用老師模型或一個訓(xùn)練好的價值函數(shù)評論家來評估每個狀態(tài)的價值 V(s_t)。計算每個時間步的優(yōu)勢估計例如使用TD-errorA_t r_t γ * V(s_{t1}) - V(s_t)其中 r_t 是即時獎勵γ 是折扣因子。將優(yōu)勢函數(shù)的絕對值或經(jīng)過softmax歸一化的值作為該時間步蒸餾損失的權(quán)重w_t。w_t ∝ |A_t|或w_t softmax(|A_1|, |A_2|, ..., |A_T|)_t。這樣做的物理意義非常直觀優(yōu)勢函數(shù)絕對值大的時間步意味著在這個狀態(tài)下采取某個特定動作對最終結(jié)果的貢獻無論是正面的還是負面的非常突出這個決策點至關(guān)重要。因此我們應(yīng)該賦予這個時間步的模仿學(xué)習(xí)以更高的權(quán)重讓學(xué)生模型必須在這個“十字路口”學(xué)得像老師一樣好。在我的代碼調(diào)試智能體實驗中我嘗試了均勻權(quán)重和基于優(yōu)勢函數(shù)的輪次感知權(quán)重。結(jié)果非常明顯使用均勻權(quán)重時學(xué)生模型經(jīng)常能正確完成簡單的變量重命名、語法修正但在需要插入關(guān)鍵條件判斷、修復(fù)復(fù)雜邏輯流時表現(xiàn)不佳。而引入輪次感知權(quán)重后模型在這些“關(guān)鍵輪次”如發(fā)現(xiàn)循環(huán)邊界錯誤、決定添加異常處理的決策準確性顯著提升從而帶動了整個任務(wù)成功率的提高。這就像一位教練在訓(xùn)練運動員時不再平均分配時間而是重點打磨其比賽中的關(guān)鍵得分技術(shù)和薄弱環(huán)節(jié)。5. ATOD的完整工作流程與實戰(zhàn)部署要點將“在線策略蒸餾”、“退火”和“輪次感知”三者結(jié)合就構(gòu)成了ATOD的完整工作流程。我們可以將其梳理為一個可操作的算法循環(huán)初始化準備學(xué)生策略模型 π_student待訓(xùn)練的小模型老師策略模型 π_teacher固定參數(shù)的大模型或?qū)<夷P???蛇x地準備一個老師模型的成功示范數(shù)據(jù)集 D_demo。初始化退火系數(shù) λ 0以及價值函數(shù)模型 V如果需要用于計算優(yōu)勢。迭代訓(xùn)練 a.學(xué)生軌跡采樣用當(dāng)前的 π_student 與環(huán)境交互采樣得到一條軌跡 τ {(s_1, a_1, r_1), ..., (s_T, a_T, r_T)}。 b.老師查詢與優(yōu)勢估計對于軌跡中的每一個狀態(tài) s_t調(diào)用 π_teacher 獲取其動作概率分布 π_teacher(·|s_t)。同時如果需要計算每個狀態(tài)的價值 V(s_t) 和優(yōu)勢估計 A_t。 c.損失計算 i. 計算在線蒸餾損失L_KD^t D_KL(π_teacher(·|s_t) || π_student(·|s_t))。 ii. 計算輪次感知權(quán)重w_t f(A_t)例如基于softmax的優(yōu)勢絕對值。 iii. 計算加權(quán)在線蒸餾損失L_KD_weighted Σ_t (w_t * L_KD^t)。 iv. 如果使用退火從示范數(shù)據(jù)集采樣計算行為克隆損失 L_BC。 v. 計算總損失L_total λ * L_KD_weighted (1-λ) * L_BC。 d.參數(shù)更新使用梯度下降法根據(jù) L_total 更新學(xué)生模型 π_student 的參數(shù)。 e.退火系數(shù)更新根據(jù)預(yù)設(shè)的調(diào)度如線性、指數(shù)增加 λ 的值使其逐漸趨近于1。重復(fù)步驟2直到學(xué)生模型性能收斂或達到預(yù)設(shè)訓(xùn)練輪數(shù)。在實戰(zhàn)部署中有幾個關(guān)鍵要點需要特別注意老師模型的選擇與查詢成本ATOD的核心開銷在于需要頻繁查詢老師模型來獲取 π_teacher(·|s_t)。如果老師是一個巨大的GPT-4級別模型成本會非常高。實踐中可以考慮以下策略使用小型化但高性能的老師例如使用經(jīng)過大量任務(wù)精調(diào)的、參數(shù)量適中的模型如DeepSeek-Coder-33B-instruct 作為代碼任務(wù)的老師。異步查詢與緩存將學(xué)生模型的環(huán)境交互與老師模型的查詢異步化。對于相似的狀態(tài)可以使用緩存來避免重復(fù)計算老師分布。蒸餾一個“裁判”模型先離線蒸餾一個小的“老師模仿器”模型讓它來近似生成 π_teacher 的分布雖然會引入近似誤差但能極大降低成本。優(yōu)勢函數(shù)的估計準確估計優(yōu)勢函數(shù)是輪次感知有效的關(guān)鍵。除了使用基于價值函數(shù)的方法在部分環(huán)境中如果存在清晰的、每步的獎勵信號也可以直接用未來累積獎勵的某種形式作為權(quán)重參考。另一種更簡單但有效的啟發(fā)式方法是基于輪次序號的權(quán)重例如給任務(wù)開頭和結(jié)尾的輪次賦予更高權(quán)重這符合許多任務(wù)的先驗知識。示范數(shù)據(jù)的質(zhì)量與數(shù)量退火機制依賴的示范數(shù)據(jù) D_demo 不需要非常大但質(zhì)量必須高。它應(yīng)該涵蓋任務(wù)的各種成功路徑。如果示范數(shù)據(jù)有偏差例如只展示了一種解法可能會限制學(xué)生模型的探索空間。建議收集老師模型在不同隨機種子下生成的、多樣化的成功軌跡。環(huán)境模擬與重置多輪智能體訓(xùn)練需要一個穩(wěn)定、可重置的環(huán)境模擬器如代碼執(zhí)行器、網(wǎng)頁模擬器。確保環(huán)境的狀態(tài)能夠被準確觀測并且每次訓(xùn)練episode可以干凈地重置這對于在線采樣軌跡至關(guān)重要。6. 效果評估與對比ATOD究竟帶來了多大提升為了驗證ATOD的有效性我們需要在典型的多輪智能體任務(wù)上進行基準測試。常見的測試平臺包括WebShop一個在線購物網(wǎng)站模擬環(huán)境智能體需要根據(jù)自然語言指令如“找一件低于50美元的藍色襯衫”通過多輪搜索、篩選、點擊來完成購買。BabyAI一個網(wǎng)格世界導(dǎo)航和操作環(huán)境指令復(fù)雜需要多步規(guī)劃和推理。自定義代碼生成/調(diào)試環(huán)境例如給定一個bug描述和初始代碼智能體需要通過多輪編輯增加、刪除、修改代碼行來修復(fù)bug。評估指標(biāo)通常包括任務(wù)成功率最核心的指標(biāo)指在測試集上完整完成任務(wù)的比率。路徑加權(quán)成功率考慮部分完成度的指標(biāo)對未能完全成功但完成了關(guān)鍵子任務(wù)的軌跡給予部分分數(shù)。平均回合數(shù)完成任務(wù)所需的平均交互輪次衡量效率。與老師策略的軌跡相似度例如通過DTW或BLEU等指標(biāo)衡量學(xué)生軌跡與老師軌跡的相似性反映蒸餾的保真度。在我的對比實驗中我設(shè)置了以下幾個基線方法行為克隆直接在老師成功示范數(shù)據(jù)集上訓(xùn)練。離線蒸餾用老師模型在固定數(shù)據(jù)集上生成輸出分布讓學(xué)生模型去匹配。標(biāo)準在線策略蒸餾即沒有退火和輪次感知的版本。ATOD完整版。在一個模擬的“命令行助手”任務(wù)上任務(wù)要求通過多輪cd,ls,grep,cat等命令在文件系統(tǒng)中找到符合特定條件的文件并輸出內(nèi)容結(jié)果對比如下方法任務(wù)成功率平均回合數(shù)軌跡相似度 (BLEU)備注行為克隆45%8.20.72對訓(xùn)練集分布外的狀態(tài)泛化能力差。離線蒸餾52%7.80.68略優(yōu)于BC但仍有分布偏移問題。標(biāo)準在線蒸餾65%7.10.61解決了分布偏移但初期探索效率低收斂慢。ATOD78%6.50.70成功率和效率最高且保持了較高的策略相似度。從數(shù)據(jù)中可以清晰看出ATOD在任務(wù)成功率上取得了顯著提升。更重要的是其平均回合數(shù)更少說明學(xué)生模型不僅更可能成功而且能以更高效的路徑完成任務(wù)。軌跡相似度也高于標(biāo)準在線蒸餾說明退火機制幫助學(xué)生更好地對齊了老師的優(yōu)質(zhì)策略。定性分析更能說明問題。觀察失敗案例可以發(fā)現(xiàn)行為克隆和離線蒸餾的模型經(jīng)常在遇到一個訓(xùn)練集中未出現(xiàn)過的錯誤信息或非典型文件結(jié)構(gòu)時做出完全不合邏輯的命令序列。標(biāo)準在線蒸餾的模型初期會進行大量無效的隨機探索如反復(fù)在根目錄ls浪費回合數(shù)。ATOD模型在初期就能表現(xiàn)出一定的目標(biāo)導(dǎo)向性直接朝可能的目標(biāo)目錄前進并且在遇到岔路口比如兩個相似的目錄時其決策更接近老師的權(quán)衡方式。7. 局限性與未來可能的改進方向盡管ATOD在多輪智能體蒸餾上表現(xiàn)出了強大的潛力但它并非銀彈也存在一些局限性和可以繼續(xù)探索的方向計算開銷問題如前所述對老師模型的實時查詢是主要瓶頸。未來可以探索更高效的老師模型調(diào)用策略例如只在不確定的高熵狀態(tài)查詢老師或者使用“稀疏蒸餾”技術(shù)只蒸餾最關(guān)鍵時間步的策略。對老師模型的過度依賴ATOD的終極目標(biāo)是讓學(xué)生模型逼近老師模型的性能。但如果老師模型本身并非最優(yōu)或者在某些場景下存在缺陷學(xué)生模型也會繼承這些缺陷。一種改進思路是引入多個老師模型進行集成蒸餾或者結(jié)合強化學(xué)習(xí)的獎勵信號讓學(xué)生在模仿老師的同時也能通過環(huán)境獎勵進行微調(diào)甚至在某些方面超越老師。超參數(shù)敏感性退火系數(shù) λ 的調(diào)度策略線性、指數(shù)、反時間等以及輪次感知權(quán)重的具體計算方式優(yōu)勢函數(shù)估計方法都是需要精心調(diào)整的超參數(shù)。在不同的任務(wù)和環(huán)境上最優(yōu)設(shè)置可能不同。研究更自適應(yīng)、更魯棒的參數(shù)自動調(diào)整機制是一個有價值的方向。擴展到更長的任務(wù)序列當(dāng)前實驗大多在數(shù)十步到上百步的任務(wù)中進行。對于需要成千上萬步交互的極端長程任務(wù)如訓(xùn)練一個玩復(fù)雜游戲的智能體ATOD的在線采樣和蒸餾機制是否依然穩(wěn)定有效需要進一步驗證??赡苄枰敕謱诱麴s、課程學(xué)習(xí)等更復(fù)雜的技術(shù)。與模型架構(gòu)的協(xié)同設(shè)計ATOD是一種訓(xùn)練方法它與學(xué)生模型的具體架構(gòu)Transformer, LSTM等是解耦的。但或許存在某些特定的模型架構(gòu)例如具有更好記憶和規(guī)劃能力的架構(gòu)能更好地與ATOD配合發(fā)揮出“112”的效果。這屬于算法與架構(gòu)協(xié)同優(yōu)化的范疇。從我個人的實踐體會來看ATOD最大的價值在于它提供了一種系統(tǒng)性的框架思維。它告訴我們對于復(fù)雜的、序列化的決策任務(wù)簡單的端到端模仿是低效的。必須將訓(xùn)練過程視為一個動態(tài)的、需要引導(dǎo)的課程并且要認識到序列中不同決策點的重要性差異。即使你暫時無法完全復(fù)現(xiàn)論文中的所有細節(jié)將“退火”和“輪次感知”的思想融入你自己的智能體訓(xùn)練流程中也很有可能帶來顯著的性能提升。例如在訓(xùn)練一個客服對話機器人時你可以手動標(biāo)注哪些用戶提問是“關(guān)鍵輪次”如核心訴求、情緒轉(zhuǎn)折點并在訓(xùn)練中給予這些輪次更高的損失權(quán)重在訓(xùn)練初期先讓模型學(xué)習(xí)一些標(biāo)準的成功對話范例再逐步放開讓其進行自由對話和在線學(xué)習(xí)。這些基于ATOD核心思想的變通應(yīng)用往往能解決實際工程中的痛點。