研究分析 發布於 AIA: 2026年8月5日

MCFA 記憶控制流程攻擊:Agent 長期記憶竟成為延後發動的控制流指令

記憶控制流程攻擊 (Memory Control Flow Attacks, MCFA) 無需直接存取 Agent 的記憶資料庫或系統提示詞 (System Prompt)。研究指出,攻擊者僅需透過常規對話互動,即可將具備動作偏好的誘導指令植入長期記憶;當後續無害的合法任務擷取該記憶時,Agent 便可能遭綁架而改變工具選擇或呼叫順序。在 LangChain 與 LlamaIndex 的受控實驗中,工具替換攻擊 (Override) 成功率極高,順序篡改攻擊 (Order) 亦達顯著比例。此研究證實:長期記憶絕非被動可信的對話紀錄,必須作為持續影響控制流的機敏輸入進行嚴格治理。

Prompt InjectionTool AuthorizationAgentic AI
6 項對應的 AIDEFEND 防禦手法
來源: From Storage to Steering: Memory Control Flow Attacks on LLM Agents 
作者: Zhenlin Xu, Xiaogang Zhu, Yu Yao, Minhui Xue & Yiliao Song
原文發布: 2026年6月5日

威脅分析

  • 攻擊者無需具備記憶資料庫的直接寫入權限。 僅需透過一次或少數幾次常規對話互動,誘使 Agent 將隱含動作偏好的內容寫入長期記憶。當日後執行無害任務並檢索出該筆記憶時,即可改變工具選擇與呼叫順序,而過程中系統提示詞與已信任工具皆未遭修改。
  • 研究團隊實驗量測了兩類不同影響範疇的攻擊手法。 工具替換攻擊 (Override) 能誘導 Agent 改用高風險工具,成功率高達 97.2% 至 100%;順序篡改攻擊 (Order) 則能破壞必要的執行順序,成功率達 52.8% 至 69.4%。跨任務及超過 30 輪互動的測試顯示此效應具持久性,而良性記憶對照組的誤觸率為 0%。
  • 直覺式的簡易防禦措施無法徹底消除危害。 混入 100 筆良性記憶仍無法掩蓋惡意偏好;摘要處理 (Summarization) 雖降低了寫入成功率,但只要惡意指令在摘要中倖存,後續任務仍會遭控制;角色式記憶隔離 (RBMS) 雖微幅降低 Override 成功率,但殘餘成功率仍介於 2.8% 至 100%。
  • 此為學術控管環境下的研究成果。 實驗採用合成的安全與高風險工具版本,未引入真實生產使用者或發起外部有害動作。論文量測指標為工具呼叫軌跡 (trace) 的偏離程度而非實體損害。目前尚無公開證據顯示 MCFA 被用於實際惡意攻擊。

適用的 6 項 AIDEFEND 防禦手法

AID-I-004.004
Transactional Promotion Gates (Quarantine -> Trusted)
極高
強制將所有源自低信任管道或缺乏充分佐證的新記憶寫入隔離區 (Quarantine);僅在取得具備證據的原子狀態轉移後,特定精確版本方可晉升為具備檢索資格 (Retrieval-Eligible) 的可信記憶。此舉能從根源中斷 MCFA 第一階段,防止常規低信任對話內容在未審核狀態下悄悄演變為可信控制輸入。
AID-H-018.003
High-Impact Independent Validation & Approval Gate
極高
在執行器 (Executor) 邊界,針對高風險操作獨立校驗標準化動作、呼叫者身分、政策依據與精確授權憑證。即便惡意記憶成功改寫了執行計畫或工具順序,被檢索出的文字本身絕不可單獨作為轉帳、資料刪除、憑證變更或側寫動作的授權依據。
AID-I-004.002
Persistent Memory Partitioning (Trust & Tenant Isolation)
依租戶 (Tenant) 與信任等級將長期記憶實施實體與邏輯隔離;檢索時需先通過集中化的權限政策過濾,方可將記憶載入模型上下文。此舉能有效限縮跨使用者與低信任記憶的回想;惟 RBMS 實驗顯示,若最終仍依賴模型遵從提示詞階層,單靠隔離尚不足以構成完整防線。
AID-D-001.005
Recalled Memory Pre-Rehydration Scanning
在載入特定版本記憶且尚未拼入 Prompt 前,執行重新水化 (Rehydration) 掃描,排查是否包含角色越權聲明、觸發標記 (Triggers)、編碼片段、已知隔離指紋與政策風險,並產出綁定內容的日誌供下游政策執行阻擋或忽略。此防線建置於 MCFA 第二階段,惟自然語意指令仍可能規避掃描,且掃描本身不等於自動強制執行。
AID-D-003.004
Tool-Call Sequence Anomaly Detection
基於已知合規流程建立工具呼叫的狀態轉換規則,精準偵測未授權、低機率或跳過必要階段的異常序列 (如未經審核即呼叫轉帳工具)。此機制對發現 MCFA 順序篡改攻擊 (Order) 尤為有效,能於計畫偏離時即時發出警示通知,惟其屬於規劃變更後的執行期偵測,無法阻止記憶寫入。
AID-M-002.004
Trust-Tiered Memory/KB Provenance & Write Eligibility Contract
為每筆候選記憶紀錄提案者、佐證資料、校驗結果、命名空間 (Namespace)、信任等級與建議檢索資格,並與權威事實執行衝突檢查。此機制能為記憶晉升關卡提供必要的決策依據,完成來源履歷追溯,但其職責為分類與合約定義,需搭配實體關卡方能執行進入與權限控制。

身為資安防禦者,我們應該這麼做

  • 全面梳理所有具備長期記憶寫入權限的路徑,包含直接對話、工具輸出、系統摘要、委派任務與匯入紀錄,明確標記哪些寫入可能在未來影響具備工具能力 (Tool-Capable) 的 Agent。
  • 對源自低信任管道或證據不足的新記憶預設套用隔離 (Quarantine) 狀態。必須取得版本綁定的佐證資料與明確的晉升決策後,方允許其進入可信檢索範圍。
  • 依租戶、資料源與信任等級嚴格隔離記憶,並於模型 Prompt 外部強制實施檢索資格審核。切勿將「系統層記憶優先於使用者記憶」等文字 Prompt 規則視為唯一防線。
  • 於記憶重新水化 (Rehydration) 拼入 Prompt 前進行內容掃描,並將掃描結果與版本妥善保存。於執行階段,無論記憶如何推薦,高風險動作皆需獨立進行二次授權驗證。
  • 建立包含 Override 替換、工具順序偏離、跨任務觸發、超過 30 輪長程持久化、良性記憶混淆與模型升級的回歸測試矩陣,同時量測惡意寫入通過率與下游未授權動作發生率。

結論

MCFA 將 AI 資安焦點從「誰能直接存取記憶資料庫」轉移至「哪些內容能演變為未來的決策控制權」。團隊可參考 AIDEFEND  對應的防禦手法,分別落實來源履歷追溯、隔離區至可信區的晉升關卡、租戶與信任隔離、檢索前水化掃描、工具序列異常監控,以及最終的動作強制授權。最關鍵的防禦邊界必須堅守於模型外部:記憶偏好僅能作為規劃參考,絕不可直接授予實體執行的授權。