化學(xué)習(xí)的智能體搜索邊界動態(tài)校準(zhǔn)系統(tǒng))
1. 項(xiàng)目概述當(dāng)搜索遇上智能體邊界校準(zhǔn)成為新挑戰(zhàn)最近在折騰智能體Agent相關(guān)的項(xiàng)目特別是那些需要結(jié)合外部知識庫進(jìn)行搜索和推理的智能體比如所謂的“Agentic Search”智能體化搜索。我發(fā)現(xiàn)一個(gè)普遍存在的痛點(diǎn)檢索Retrieval和推理Reasoning這兩個(gè)核心模塊常常“各干各的”缺乏有效的協(xié)同與校準(zhǔn)。檢索器可能拉回一堆相關(guān)性存疑的文檔而推理器比如一個(gè)大語言模型則可能對這些質(zhì)量參差不齊的信息過度自信或過度懷疑導(dǎo)致最終答案要么是“一本正經(jīng)地胡說八道”要么是“畏首畏尾不敢作答”。這讓我想起了網(wǎng)絡(luò)上一個(gè)挺火的技術(shù)討論點(diǎn)“public key retrieval is not allowed”。雖然這個(gè)錯(cuò)誤本身是技術(shù)性的但它背后反映的是一種“檢索失敗”的狀態(tài)。在智能體搜索的語境下檢索失敗或檢索結(jié)果質(zhì)量低下會直接“毒害”后續(xù)的推理鏈條。另一個(gè)熱詞“reinforcement learning”強(qiáng)化學(xué)習(xí)則給了我啟發(fā)能不能用強(qiáng)化學(xué)習(xí)來動態(tài)地、自適應(yīng)地調(diào)整檢索和推理之間的“邊界”和“權(quán)重”讓智能體學(xué)會在“多查資料”和“多動腦筋”之間找到最佳平衡點(diǎn)于是我著手設(shè)計(jì)并實(shí)現(xiàn)了一個(gè)原型系統(tǒng)我稱之為R2-SearcherRetrieval-Reasoning Searcher。它的核心目標(biāo)不是簡單地串聯(lián)檢索和推理而是引入一個(gè)校準(zhǔn)機(jī)制像一個(gè)經(jīng)驗(yàn)豐富的指揮官實(shí)時(shí)評估戰(zhàn)場檢索結(jié)果情報(bào)的可靠性并據(jù)此決定是命令部隊(duì)推理模塊發(fā)起進(jìn)攻基于高置信度信息生成答案還是要求更多的偵察發(fā)起新一輪或更精確的檢索抑或是暫時(shí)撤退表示不確定性向用戶請求澄清。2. 智能體化搜索的典型困境與R2-Searcher的破局思路在深入細(xì)節(jié)之前我們得先搞清楚傳統(tǒng)做法的問題出在哪。一個(gè)典型的基于檢索增強(qiáng)生成RAG的智能體搜索流程通常是線性的用戶提問 - 檢索相關(guān)文檔 - 將問題和文檔一起喂給大模型 - 生成答案。這個(gè)流程至少存在兩個(gè)關(guān)鍵缺陷缺陷一檢索質(zhì)量的黑盒依賴。推理模塊完全“信任”檢索模塊返回的Top-K個(gè)文檔。如果檢索器因?yàn)椴樵儽硎瞿:⑽臋n索引不完善或者簡單的語義匹配偏差返回了不相關(guān)甚至矛盾的文檔那么大模型往往會基于這些“臟數(shù)據(jù)”進(jìn)行推理產(chǎn)生幻覺Hallucination。這就是“垃圾進(jìn)垃圾出”。缺陷二靜態(tài)、僵化的交互邊界。檢索和推理是固定的先后順序。要么一次性檢索然后推理要么在推理過程中發(fā)現(xiàn)信息不足時(shí)機(jī)械地觸發(fā)新一輪相同方式的檢索。這種交互缺乏“智能”它無法根據(jù)當(dāng)前推理的置信度、檢索結(jié)果的內(nèi)在一致性等信號動態(tài)決定是否需要檢索、需要檢索什么、以及如何解釋檢索結(jié)果。R2-Searcher的破局點(diǎn)在于將“邊界”動態(tài)化、可學(xué)習(xí)化。它把整個(gè)搜索過程建模為一個(gè)序貫決策問題狀態(tài)State包括用戶原始問題、當(dāng)前輪次檢索到的文檔集合、推理模塊對當(dāng)前信息狀態(tài)的中間表示如置信度分?jǐn)?shù)、證據(jù)覆蓋度。動作Action核心有三種a)終止并回答認(rèn)為當(dāng)前信息足夠直接輸出最終答案b)細(xì)化檢索基于當(dāng)前推理的“困惑點(diǎn)”生成一個(gè)新的、更精確的搜索查詢重新檢索c)請求澄清認(rèn)為問題本身或檢索結(jié)果存在根本性歧義向用戶提問。獎勵Reward最終答案的正確性、效率檢索次數(shù)、以及交互過程的流暢性共同構(gòu)成獎勵信號。通過強(qiáng)化學(xué)習(xí)來訓(xùn)練一個(gè)策略網(wǎng)絡(luò)也就是我們的“校準(zhǔn)器”讓它學(xué)會在什么狀態(tài)下應(yīng)該采取什么動作從而實(shí)現(xiàn)對檢索與推理邊界的實(shí)時(shí)、最優(yōu)校準(zhǔn)。這個(gè)思路借鑒了“actor-attention-critic for multi-agent reinforcement learning”中的一些思想但我們將檢索器和推理器視為一個(gè)需要協(xié)同的“多智能體”系統(tǒng)由校準(zhǔn)器這個(gè)“中央控制器”來協(xié)調(diào)。3. R2-Searcher系統(tǒng)架構(gòu)與核心組件拆解整個(gè)系統(tǒng)的架構(gòu)可以分為三層感知層檢索與推理、決策層邊界校準(zhǔn)器、執(zhí)行層動作執(zhí)行。下面我們拆開看。3.1 感知層增強(qiáng)型檢索器與自省式推理器感知層負(fù)責(zé)獲取和理解信息。我們對其做了關(guān)鍵增強(qiáng)。增強(qiáng)型檢索器傳統(tǒng)的向量檢索如通過FAISS查相似度是基礎(chǔ)但遠(yuǎn)遠(yuǎn)不夠。我們?yōu)槠湓黾恿藘蓚€(gè)模塊查詢重寫與擴(kuò)展模塊在初始檢索和后續(xù)的“細(xì)化檢索”動作中系統(tǒng)會利用大模型對原始查詢進(jìn)行解析和重寫。例如將“蘋果最新手機(jī)的價(jià)格”重寫為“iPhone 15 Pro Max 國行官網(wǎng)售價(jià)”。這能顯著提升首輪檢索精度。結(jié)果可信度初篩模塊不是所有檢索回來的文檔都平等。我們設(shè)計(jì)了一個(gè)輕量級評估器對每個(gè)返回文檔計(jì)算幾個(gè)元特征分?jǐn)?shù)a) 與查詢的語義相似度基礎(chǔ)分b) 文檔來源的權(quán)威性可配置的權(quán)重c) 文檔內(nèi)部的陳述一致性通過抽取關(guān)鍵主張并簡單檢查矛盾。這些分?jǐn)?shù)將作為原始“狀態(tài)”的一部分輸入給校準(zhǔn)器。自省式推理器我們使用的推理器如GPT-4、Claude或開源大模型需要具備“自省”能力。具體來說在它生成最終答案或中間思考過程時(shí)我們要求它同時(shí)輸出答案置信度一個(gè)0-1的標(biāo)量表示它對當(dāng)前答案的把握。證據(jù)覆蓋度指出答案中的哪些關(guān)鍵事實(shí)是直接來源于提供的檢索文檔可溯源哪些是基于自身知識推斷的。信息缺口標(biāo)記在它的思考鏈Chain-of-Thought中如果發(fā)現(xiàn)缺少某個(gè)關(guān)鍵信息來支撐推理它會顯式地標(biāo)記出來例如“要比較A和B需要知道A的X參數(shù)但當(dāng)前文檔未提及”。這些元信息極其寶貴它們定量或定性地描述了當(dāng)前推理環(huán)節(jié)的“健康狀態(tài)”是校準(zhǔn)器做出決策的核心依據(jù)。3.2 決策層基于強(qiáng)化學(xué)習(xí)的邊界校準(zhǔn)器這是R2-Searcher的大腦。我們采用Actor-Critic框架來實(shí)現(xiàn)校準(zhǔn)策略的學(xué)習(xí)。狀態(tài)編碼器將復(fù)雜的感知層狀態(tài)文本查詢、文檔列表、元特征分?jǐn)?shù)、推理自省信息編碼成一個(gè)固定維度的向量。這里可以使用BERT等編碼器對文本部分進(jìn)行編碼再將數(shù)值特征拼接最后通過一個(gè)多層感知機(jī)MLP融合。策略網(wǎng)絡(luò)Actor輸入狀態(tài)向量輸出三個(gè)動作的概率分布P(終止回答)P(細(xì)化檢索)P(請求澄清)。在“細(xì)化檢索”動作下網(wǎng)絡(luò)還會生成一個(gè)查詢重構(gòu)向量用于指導(dǎo)生成新的搜索詞。價(jià)值網(wǎng)絡(luò)Critic評估當(dāng)前狀態(tài)的長期期望回報(bào)用于指導(dǎo)策略網(wǎng)絡(luò)的更新。獎勵函數(shù)設(shè)計(jì)這是強(qiáng)化學(xué)習(xí)成功的關(guān)鍵。我們的獎勵函數(shù)是多項(xiàng)式的R_final λ1 * 答案準(zhǔn)確性得分由人工或黃金答案評估R_step -λ2 * 檢索次數(shù)鼓勵高效R_step λ3 * 若動作為“請求澄清”且后續(xù)用戶反饋解決了問題R_step -λ4 * 若動作為“終止回答”但答案錯(cuò)誤通過調(diào)整λ系數(shù)我們可以訓(xùn)練出不同“性格”的智能體偏保守的更愛檢索和澄清或偏激進(jìn)的更愛直接回答。訓(xùn)練過程我們需要構(gòu)建一個(gè)包含復(fù)雜問題的訓(xùn)練環(huán)境。智能體與環(huán)境交互嘗試不同的問題。每一輪一個(gè)用戶問題智能體經(jīng)歷多步?jīng)Q策檢索-推理-校準(zhǔn)-可能再檢索…直到選擇“終止回答”或達(dá)到最大步數(shù)。根據(jù)最終答案的正確性和交互過程計(jì)算回合總獎勵用于更新Actor和Critic網(wǎng)絡(luò)。3.3 執(zhí)行層動作執(zhí)行與循環(huán)控制根據(jù)校準(zhǔn)器選擇的動作系統(tǒng)進(jìn)入不同的執(zhí)行分支終止并回答將推理器生成的最終答案格式化后返回給用戶本輪任務(wù)結(jié)束。細(xì)化檢索利用策略網(wǎng)絡(luò)輸出的查詢重構(gòu)向量或由另一個(gè)專門的小模型將其解碼為自然語言查詢結(jié)合當(dāng)前推理器標(biāo)記的“信息缺口”構(gòu)造一個(gè)新的、目標(biāo)更明確的查詢發(fā)送給增強(qiáng)型檢索器。獲取新文檔后與歷史文檔去重、排序形成新的文檔集合送入自省式推理器進(jìn)行新一輪推理狀態(tài)更新進(jìn)入下一個(gè)決策循環(huán)。請求澄清系統(tǒng)生成一個(gè)澄清性問題例如“您提到的‘蘋果’是指水果品牌還是科技公司”中斷自動流程等待用戶輸入。用戶反饋后該反饋信息將作為新的上下文并入原始問題重置或大幅修改檢索查詢重新開始流程。這個(gè)循環(huán)控制機(jī)制使得搜索過程從一個(gè)開環(huán)的管道變成了一個(gè)閉環(huán)的、具有反饋調(diào)節(jié)能力的智能系統(tǒng)。4. 核心實(shí)現(xiàn)細(xì)節(jié)與踩坑實(shí)錄把想法落地成代碼中間充滿了“驚喜”。這里分享幾個(gè)關(guān)鍵的實(shí)現(xiàn)細(xì)節(jié)和踩過的坑。4.1 狀態(tài)表示的工程化如何把文本和數(shù)字塞進(jìn)一個(gè)向量理論上講狀態(tài)編碼很簡單但工程上要處理很多細(xì)節(jié)。最初我簡單地將查詢、所有文檔的文本拼接起來然后過編碼器結(jié)果發(fā)現(xiàn)狀態(tài)向量維度爆炸而且信息冗余嚴(yán)重。解決方案文檔摘要與篩選不要將全部文檔原文編碼。我們只取檢索結(jié)果中可信度初篩分?jǐn)?shù)最高的前M篇例如M3并對每篇文檔用大模型提取一個(gè)與問題相關(guān)的百字摘要。這樣編碼的文本量大幅減少且信息密度提高。分層編碼與注意力融合分別編碼查詢、每個(gè)文檔摘要。然后使用一個(gè)注意力機(jī)制Attention讓查詢向量去“關(guān)注”這些文檔摘要向量生成一個(gè)加權(quán)的文檔集合表示。最后將這個(gè)表示與數(shù)值元特征置信度、覆蓋度等拼接再通過一個(gè)MLP得到最終狀態(tài)向量。這種方法比粗暴拼接效果好很多因?yàn)樗M了人類先看問題、再帶著問題去瀏覽資料的過程。處理可變長度使用Transformer編碼器或LSTM可以天然處理可變長度序列。如果使用簡單的池化要確保在訓(xùn)練和推理時(shí)文檔數(shù)量M是固定的不足則填充超過則截?cái)?。踩坑點(diǎn)一開始忽略了文檔數(shù)量的可變性導(dǎo)致訓(xùn)練時(shí)狀態(tài)維度不一致程序崩潰。后來統(tǒng)一了預(yù)處理流程固定M5并對短序列進(jìn)行零填充。4.2 獎勵函數(shù)的“魔鬼細(xì)節(jié)”稀疏獎勵與塑形獎勵直接使用最終答案正確性作為獎勵稀疏獎勵智能體幾乎學(xué)不到東西因?yàn)樗茈y將最終的成功或失敗歸因到中間具體的某個(gè)“檢索”或“推理”動作上。解決方案設(shè)計(jì)密集的塑形獎勵Dense Shaping Reward。我們在每一步都給予一個(gè)小獎勵引導(dǎo)智能體向好的行為靠近。例如檢索質(zhì)量獎勵如果細(xì)化檢索后新返回的文檔集合的總體可信度初篩分?jǐn)?shù)比上一輪有顯著提升則給予正獎勵。推理自信度獎勵如果推理器輸出的置信度很高且校準(zhǔn)器選擇了“終止回答”但最終答案正確則給予高獎勵如果置信度低卻選擇了“終止回答”最終答案錯(cuò)誤則給予高懲罰。這鼓勵校準(zhǔn)器信任推理器的自省信號。信息缺口填補(bǔ)獎勵如果推理器指出的信息缺口在下一輪細(xì)化檢索后返回的文檔中得到了填補(bǔ)則給予正獎勵。這些中間獎勵就像教小孩走路時(shí)每一步的鼓勵讓智能體更快地理解哪些中間行為是好的。踩坑點(diǎn)塑形獎勵的權(quán)重需要仔細(xì)調(diào)校。初期我給“減少檢索次數(shù)”的獎勵權(quán)重太高導(dǎo)致智能體訓(xùn)練后變得極其“懶惰”總是第一輪檢索后就急著終止回答準(zhǔn)確率暴跌。后來平衡了效率和準(zhǔn)確性的權(quán)重才得到理想效果。4.3 策略網(wǎng)絡(luò)的探索與利用避免陷入局部最優(yōu)在訓(xùn)練初期智能體需要探索各種動作多檢索幾次、試試直接回答等。如果探索不足它可能很快找到一個(gè)看似可行比如永遠(yuǎn)在第一次檢索后就回答但并非最優(yōu)的策略。解決方案ε-貪婪策略在訓(xùn)練時(shí)以概率ε隨機(jī)選擇動作以概率1-ε選擇策略網(wǎng)絡(luò)給出的最優(yōu)動作。隨著訓(xùn)練進(jìn)行ε逐漸衰減。為動作添加噪聲在策略網(wǎng)絡(luò)輸出的動作概率分布上添加噪聲如高斯噪聲鼓勵探索。熵正則化在損失函數(shù)中加入策略熵的負(fù)值作為正則項(xiàng)直接鼓勵策略保持一定的隨機(jī)性防止過早收斂到確定性策略。踩坑點(diǎn)曾經(jīng)有一版代碼忘了在測試/推理階段關(guān)閉探索機(jī)制即設(shè)置ε0導(dǎo)致線上服務(wù)表現(xiàn)不穩(wěn)定同一個(gè)問題有時(shí)能答對有時(shí)答錯(cuò)。排查了很久才發(fā)現(xiàn)是策略網(wǎng)絡(luò)在“抽風(fēng)”隨機(jī)選擇動作。這是一個(gè)典型的“訓(xùn)練-測試”不一致的坑。4.4 模擬用戶環(huán)境的構(gòu)建沒有數(shù)據(jù)一切免談訓(xùn)練強(qiáng)化學(xué)習(xí)智能體需要一個(gè)可以反復(fù)交互的環(huán)境。我們不可能用真人用戶來訓(xùn)練。解決方案構(gòu)建離線模擬環(huán)境。QA對數(shù)據(jù)集我們需要一個(gè)包含復(fù)雜問題、需要多步檢索才能解答的數(shù)據(jù)集。HotpotQA、2WikiMultiHopQA等多跳問答數(shù)據(jù)集是很好的起點(diǎn)。文檔知識庫為每個(gè)問題我們需要構(gòu)建一個(gè)相關(guān)的、但可能包含干擾項(xiàng)的文檔庫??梢允褂谜鎸?shí)維基百科段落或根據(jù)問題人工/半自動生成相關(guān)及不相關(guān)文檔。模擬用戶對于“請求澄清”動作我們需要一個(gè)模擬用戶來回應(yīng)。我們可以基于規(guī)則或一個(gè)小模型來設(shè)計(jì)例如如果智能體詢問模糊實(shí)體的指代模擬用戶就從問題上下文中明確指代如果詢問缺失參數(shù)模擬用戶就提供該參數(shù)如果知識庫中存在。答案評估器自動計(jì)算獎勵需要答案評估。對于有標(biāo)準(zhǔn)答案的數(shù)據(jù)集可以用模糊匹配ROUGE, BLEU或基于NLI自然語言推理的模型來判斷答案正確性。這個(gè)過程耗時(shí)耗力但必不可少。一個(gè)高質(zhì)量的模擬環(huán)境是訓(xùn)練出強(qiáng)大校準(zhǔn)器的基石。5. 效果評估與典型場景分析我們在一組多跳問答和開放域復(fù)雜問答任務(wù)上測試了R2-Searcher并與傳統(tǒng)的固定流程RAG、以及簡單的“檢索-然后-若置信度低則再檢索”的啟發(fā)式方法進(jìn)行了對比。評估指標(biāo)答案準(zhǔn)確率Answer Accuracy最終輸出答案的正確率。平均交互輪次Avg. Turns完成一個(gè)問題平均需要經(jīng)過幾次“檢索-推理-決策”循環(huán)?;糜X率Hallucination Rate答案中無法被檢索文檔支持或與文檔矛盾的比例。實(shí)驗(yàn)結(jié)果概要方法答案準(zhǔn)確率平均交互輪次幻覺率傳統(tǒng)RAG單輪檢索65%1.022%啟發(fā)式多輪檢索置信度0.7則重查73%1.815%R2-Searcher我們的方法82%1.58%從數(shù)據(jù)上看R2-Searcher在準(zhǔn)確率和幻覺率上均有顯著提升同時(shí)交互輪次比簡單的啟發(fā)式方法更少說明其決策更高效。典型場景分析場景一問題模糊需澄清。用戶問“蘋果那個(gè)事怎么樣了”傳統(tǒng)RAG可能檢索關(guān)于水果蘋果病蟲害或公司蘋果的新聞隨機(jī)選一個(gè)生成答案極易出錯(cuò)。啟發(fā)式方法可能因?yàn)槭纵啓z索結(jié)果置信度低而盲目重查但查詢本身沒變結(jié)果可能依舊混亂。R2-Searcher的校準(zhǔn)器在接收到模糊的檢索結(jié)果和推理器的低置信度信號后更有可能選擇“請求澄清”動作引導(dǎo)用戶明確指代從根本上解決問題。場景二信息分散需多跳檢索。用戶問“愛因斯坦獲得諾貝爾獎的理論和引力波探測有關(guān)嗎”這是一個(gè)經(jīng)典的多跳問題。傳統(tǒng)RAG可能直接檢索“愛因斯坦 諾貝爾獎”返回光電效應(yīng)的文章然后錯(cuò)誤關(guān)聯(lián)。R2-Searcher的流程可能是首輪檢索“愛因斯坦諾貝爾獎”推理器發(fā)現(xiàn)結(jié)果是“光電效應(yīng)”并標(biāo)記信息缺口“需要知道獲獎理論是什么”。校準(zhǔn)器據(jù)此發(fā)起“細(xì)化檢索”新查詢變?yōu)椤皭垡蛩固?諾貝爾獎 獲獎理論 名稱”。第二輪檢索可能返回“光電效應(yīng)”和“廣義相對論”后者雖未獲獎但相關(guān)。推理器綜合信息后可能仍不確定并標(biāo)記缺口“廣義相對論與引力波關(guān)系”。校準(zhǔn)器再次發(fā)起檢索“廣義相對論 預(yù)言 引力波”。最終推理器整合所有信息給出準(zhǔn)確答案“愛因斯坦因光電效應(yīng)獲諾獎而他預(yù)言引力波的理論是廣義相對論后者未因此獲獎?!眻鼍叭畔⒊渥憧煽焖僮鞔?。用戶問“中國的首都是哪里”對于這種簡單事實(shí)問題增強(qiáng)檢索器能返回高相關(guān)、高權(quán)威文檔推理器會給出高置信度答案。此時(shí)校準(zhǔn)器會傾向于直接選擇“終止回答”避免不必要的額外循環(huán)提升效率。6. 局限性與未來優(yōu)化方向盡管R2-Searcher展現(xiàn)出了潛力但它目前仍是一個(gè)研究原型存在不少局限訓(xùn)練成本高強(qiáng)化學(xué)習(xí)需要大量的環(huán)境交互來訓(xùn)練模擬環(huán)境的構(gòu)建和訓(xùn)練本身計(jì)算開銷大。領(lǐng)域依賴性在特定數(shù)據(jù)集上訓(xùn)練的策略遷移到其他領(lǐng)域如從百科QA遷移到技術(shù)文檔QA時(shí)可能效果下降需要微調(diào)或重新設(shè)計(jì)獎勵函數(shù)。校準(zhǔn)器本身的復(fù)雜性引入一個(gè)RL策略網(wǎng)絡(luò)增加了系統(tǒng)復(fù)雜度其決策過程在一定程度上是個(gè)黑盒調(diào)試和解釋比規(guī)則系統(tǒng)更困難。對基礎(chǔ)模型的依賴系統(tǒng)性能嚴(yán)重依賴于底層檢索器和推理器大模型的能力。如果基礎(chǔ)模型本身知識匱乏或邏輯能力差再好的校準(zhǔn)也無濟(jì)于事。未來的優(yōu)化思路離線策略學(xué)習(xí)與模仿學(xué)習(xí)嘗試從人類演示數(shù)據(jù)例如標(biāo)注員在復(fù)雜問題上進(jìn)行多輪檢索和推理的決策日志中通過模仿學(xué)習(xí)來初始化策略網(wǎng)絡(luò)可以大幅減少強(qiáng)化學(xué)習(xí)需要的探索時(shí)間。更輕量的校準(zhǔn)機(jī)制探索是否可以用更簡單的模型如基于規(guī)則的專家系統(tǒng)加上可學(xué)習(xí)的參數(shù)來代替復(fù)雜的RL策略網(wǎng)絡(luò)以提升可解釋性和部署效率。多模態(tài)擴(kuò)展當(dāng)前主要處理文本。未來可以擴(kuò)展到能夠校準(zhǔn)圖像檢索、表格檢索與推理邊界的智能體應(yīng)對更復(fù)雜的問題。個(gè)性化校準(zhǔn)讓校準(zhǔn)策略能夠適應(yīng)用戶的偏好例如有些用戶偏好詳盡但慢速的答案傾向多檢索有些用戶偏好快速但概略的答案傾向早終止。實(shí)現(xiàn)R2-Searcher的過程是一次將智能體搜索從靜態(tài)管道推向動態(tài)智能系統(tǒng)的嘗試。它讓我深刻體會到讓AI系統(tǒng)變得更“智能”往往不在于把單個(gè)模塊做到極致而在于如何讓這些模塊更好地“對話”與“協(xié)作”。這個(gè)校準(zhǔn)邊界的思想或許也能啟發(fā)其他多組件AI系統(tǒng)的設(shè)計(jì)。