先給出可以用於決策的結論
企業Agent通常同時處理使用者輸入、網頁、郵件、文件和工具輸出,這些內容都可能攜帶惡意或衝突指令。如果許可權只依賴“不要讀取其他客戶資料”這樣的文字約束,模型一旦誤判就可能呼叫高風險工具。正確設計是將使用者身份、Agent身份、角色、資源範圍、動作額度和審批規則放在確定性系統中驗證;模型只提出候選動作,服務端決定是否允許。對於付款、刪除、釋出和客戶承諾等不可逆操作,還應增加人工確認。
判斷前需要確認哪些條件
同一個問題在不同企業、資料和專案階段下可能有不同答案。建議先核對以下條件,再把網上的通用結論代入自己的專案。
建議按什麼順序推進
先明確目標與邊界
列出所有工具和資料操作並進行風險分級。
驗證關鍵依賴
為使用者和Agent建立獨立身份及最小許可權。
形成可評審成果
在工具層驗證資源、引數、額度和業務狀態。
用真實結果決定下一步
對高風險動作增加人工審批、審計和緊急停用。
放到實際業務中如何理解
郵件助手讀取了一封包含惡意指令的郵件,模型嘗試呼叫客戶匯出工具。如果工具服務只相信模型,可能造成資料洩露;如果服務端根據當前員工身份、客戶歸屬和匯出審批執行校驗,該請求會被拒絕並記錄安全事件。 示例不代表特定客戶業績,實際結論需要結合企業自己的業務量、樣本、系統和責任邊界驗證。
最容易踩的坑
認為更長的系統提示等於更強的許可權控制
多個Agent共用一個超級管理員賬號
只記錄模型回答,不記錄工具引數和執行結果
最終應該怎樣驗收或確認
安全測試應覆蓋提示注入、越權讀取、引數篡改、工具返回汙染、重複執行和審批繞過。即使模型輸出錯誤指令,外部授權層也必須阻止動作,並留下使用者、Agent、工具和結果的完整審計鏈。
準備與供應商或內部團隊溝通時,建議帶上當前流程、代表性樣本、現有系統、計劃時間和預算等級。先把未知項明確標註,再決定採用診斷、PoC、固定範圍專案或持續研發,通常比直接索要一個缺少邊界的價格和工期更可靠。