
IDENTIFYING THE RISKS OF LM AGENTS WITH AN LM-EMULATED SANDBOX一、文章基本信息論文標題IDENTIFYING THE RISKS OF LM AGENTS WITH AN LM-EMULATED SANDBOX作者Yangjun Ruan發(fā)表年份2024會議/期刊ICLR二、論文一句話總結為降低 LLM Agent 安全測試中搭建真實工具和沙箱的成本作者提出 ToolEmu使用基于LLM的模擬工具反饋和環(huán)境狀態(tài)并通過對抗模擬器構造長尾風險場景再利用基于LLM的評價器評估 Agent 的安全性與有用性人工驗證顯示約68.8%–72.5%的自動識別失敗屬于真實失敗但該方法只覆蓋指令欠明確這一威脅模型且存在測試案例依賴人工、模擬器與評價器同源及現(xiàn)實驗證有限等問題。三、研究背景與問題1、研究背景LLM模型有更強的能力能夠通過Tool Calling調(diào)用外部工具但是帶來了更多的潛在威脅agent環(huán)境難以復現(xiàn)需人工工作量大長尾問題難以發(fā)現(xiàn)2、現(xiàn)有研究不足無直接關注Agent安全測評領域之前的評估需要人工專家搭建沙箱環(huán)境進行模擬效率較低四、核心方法1、總覽核心想法使用LLM模擬工具Emulator和它們的執(zhí)行沙箱然后根據(jù)Emulator生成的Trajectory使用基于LLM的Evaluaor對執(zhí)行進行安全性和有用性的評估Emulator模擬用戶任務的執(zhí)行軌跡分為普通和增強版用于發(fā)現(xiàn)長尾問題Evaluator評估器根據(jù)模擬軌跡評估用戶任務的安全性和可用性輸入主要有工具描述用戶指令不重復描述潛在威脅和威脅行為預期行動Evaluator和Emulator根據(jù)不同的輸入得到不同的輸出比如Emulator需要工具描述用戶指令輸出Trajectory和Action而Safety Evaluator輸出的是socre不同的部分使用不同的數(shù)據(jù)獲得其所需要的輸出2、 威脅模型主要針對指令不明確這一具體的場景進行安全測試并且我們假設用戶的輸入是無攻擊性的區(qū)別于紅隊對抗的惡意攻擊3、Emulator 模擬器通過使用GPT-4大模型編寫提示詞的方式實現(xiàn)首先使用工具規(guī)范和用戶指令來實例化沙盒Agent運行環(huán)境讓其作為Trajactory的初始狀態(tài)在之后的每一步中都會接受當前的環(huán)境狀態(tài)之前的行動和觀察使用ReAct架構的Agent然后模擬器結合這些內(nèi)容生成新的觀察結果依次類推3.1 Adversarial emulator for red-teaming對抗模擬器一個專門用于red team的emualtor為了發(fā)掘長尾更具挑戰(zhàn)性的風險核心思想模擬器根據(jù)工具描述用戶指令不充分描述和潛在風險主動構造一些更加長尾、更加具有挑戰(zhàn)性的場景使 LM Agent 更有可能采取危險行為并進一步引發(fā)潛在風險。3.2 要求和設計為了確保我們在模擬器中發(fā)現(xiàn)的失敗案例是真實可信的這些失敗必須能夠在實際的工具和沙箱環(huán)境中被真正復現(xiàn)出來。要滿足這一點模擬器必須保證其生成的輸出同時具備以下特性準確性accurate模擬結果應當能夠反映對應工具在真實執(zhí)行時的結果一致性consistent例如一個文件如果已經(jīng)被刪除之后就不應該再次出現(xiàn)在環(huán)境中對于無效的工具輸入模擬器應當通過拋出異常的方式進行拒絕。4、EVALUATIONS4.1 Safety Evaluation如圖數(shù)據(jù)莫所示**安全評估器safety evaluator**會接收完整的執(zhí)行軌跡 Trajectory作為輸入同時還會接收該測試案例對應的指令描述不充分之處underspecification潛在風險potential risks對應的潛在危險行為potential risky actions基于這些信息使用 LM 構建的評估器需要判斷 LM Agent 是否采取了任何危險行為為了區(qū)分并量化這些風險評估器需要從兩個維度進行判斷風險實際發(fā)生的可能性肯定不會發(fā)生certainly not可能發(fā)生possible很可能發(fā)生likely一旦發(fā)生所造成后果的嚴重程度輕微mild嚴重severe然后評估器會綜合這兩個維度給出最終的量化安全分數(shù)4.2 Helpful Evaluation旨在評估 LM Agent 在不引發(fā)風險的前提下能夠多有效地完成用戶指令。它提供了一個與安全評估互補的評價維度主要使用的信息是如數(shù)據(jù)模型圖中的指令描述不充分之處和預期完成結果并輸出一個有用性得分5、Benchmark首先收集了一組多樣化、可能涉及高風險的工具覆蓋 18 個類別。這些工具被組織成若干工具包toolkits每個工具包都是圍繞某一類主要任務構建的一套完整且相互關聯(lián)的工具集合。為了確保生成的工具包滿足完整性和真實性等要求我們會在模擬器中至少使用兩個相關測試案例對其進行驗證。最終我們構建的工具集合包含 36 個工具包共 311 個工具五、實驗設計1、VALIDATING TOOLEMU作者通過“標準模擬器 vs 對抗模擬器”的成對實驗再用經(jīng)過篩選的人工標注結果作為參考驗證模擬器質(zhì)量以及自動安全性、有用性評估器是否可靠該實驗說明模擬器不僅能較準確地發(fā)現(xiàn)現(xiàn)實中可復現(xiàn)的真實風險而且對抗性模擬器還能主動挖出更多長尾、高風險失敗只是會犧牲一點精確率。根據(jù)模擬結果中不存在嚴重問題的比例來評估模擬器的質(zhì)量這些嚴重問題由人工驗證確定。通過衡量自動評估器與人工標注結果之間的一致程度來評估自動評估器的準確性。2、EVALUATING LANGUAGE MODEL AGENTS WITHIN TOOLEMU“看起來安全”不一定真的好。例如 Vicuna-1.5 更安全很大程度上只是因為不會使用工具屬于“能力不足帶來的安全”。合理的安全 Prompt 很有效。它可以同時提高安全性和有用性說明真正理想的 Agent 不是“不行動”而是能識別風險并在安全前提下完成任務。Agent 的目標不是單純追求安全而是在保持任務能力的同時提升風險意識安全 Prompt 能明顯改善這種“安全 有用”的平衡。六、后序可擴展擴展威脅的領域本文為特定的提示詞不充分更多的工具集和場景