實際事件 發布於 AIA: 2026年9月19日

AI 推薦投毒:摘要連結夾帶指令,企圖改寫助理的長期記憶

Microsoft 發現,有公司利用 AI 摘要連結夾帶宣傳指令,企圖寫入助理的長期記憶,也就是跨越多次對話仍會保留的使用者偏好。如果助理接受指令並在之後讀取這些記憶,即使原本的網頁已經關閉,推薦內容仍可能受到影響。防守重點是防止網站業者撰寫的請求,在使用者不知情的情況下變成可信偏好。

Indirect Prompt InjectionInput ValidationData GovernanceAI Copilots
5 項對應的 AIDEFEND 防禦手法
來源: Manipulating AI memory for profit: The rise of AI Recommendation Poisoning 
作者: Microsoft Defender Security Research Team and Noam Kochavi
原文發布: 2026年2月10日

威脅分析

  • 指令藏在連結中。 網站或郵件提供看似方便的摘要連結,網址參數卻會替使用者預先填入提示詞(prompt)。其中除了正常的摘要請求,還夾帶要求助理將某個品牌記成優先引用來源的指令。即使開啟的是合法 AI 助理網站,也不代表使用者同意這些預先填入的內容。
  • 長期保留,改變了必須保護的邊界。 如果助理把指令存成記憶,之後的對話就可能將它當成個人化設定使用。這種提示詞注入攻擊(prompt injection)讓外部業者的主張跨越信任邊界,成為持續保留的偏好,也就是記憶投毒;它並不代表模型權重經過重新訓練。
  • 散布規模不等於成功次數。 Microsoft 報告列出來自 31 家公司、橫跨 14 個產業的 50 多種提示詞,並指出公開工具有助於散布。是否成功會隨助理平台與防護更新而改變。報告透過示範呈現記憶遭改寫的結果,但文中的虛構品牌及財務損失故事,不是已確認的受害事件。
  • 防禦必須交給能部署的人。 使用託管 AI 助理的團隊,可以檢查已儲存的記憶,並使用服務提供的管理功能。能控制推理入口及記憶服務的平台團隊,才有條件進一步執行輸入檢查、依信任層級隔離記憶,以及針對確切內容核准寫入。這些後端控制不應被寫成每個 SaaS 客戶都能開啟的設定。

適用的 5 項 AIDEFEND 防禦手法

AID-I-004.004
Transactional Promotion Gates (Quarantine -> Trusted)
極高
在長期記憶寫入服務中,先將來自外部內容的記憶提案放進隔離區,所有待審查內容都不得被讀取。只有獨立審查者或可信政策核准的確切租戶、內容雜湊值、儲存區及版本,才能移入可信區。這道邊界確實生效時,摘要請求就無法悄悄變成可信的推薦偏好。部署方須保留外部來源標記,禁止模型自行核准自己的提案,並驗證重試及中斷後的處理;這需要控制平台的記憶服務。
AID-I-004.002
Persistent Memory Partitioning (Trust & Tenant Isolation)
極高
在長期記憶讀取服務中,將外部或隔離中的紀錄與可信使用者偏好分開儲存,再由中央授權服務決定個人化回答可以讀取哪些信任層級。若可信個人化流程不允許讀取外部層級,遭投毒的紀錄就不能影響這次後續回答。只隔離不同租戶並不足夠,因為本案發生在同一位使用者的帳號內。服務須驗證來源、回傳紀錄與授權有效期間,驗證失敗就不回傳內容,也不能讓模型自行選擇可讀取的儲存區。
AID-H-002.002
Inference-Time Prompt & Input Validation
中
能控制推理入口的團隊,應在模型收到請求前,檢查從網址解碼出的提示詞,並依綁定該次請求的內容檢查結果阻擋可疑輸入。偵測器必須能辨識未經使用者同意的長期品牌推薦指令;只檢查不當內容,或確認網址屬於合法 AI 服務,都不夠。檢查服務出錯時也要阻擋。這是有條件的預防措施,一般 SaaS 租戶未必能部署,語意變形仍可能繞過檢查。
AID-D-001.005
Recalled Memory Pre-Rehydration Scanning
中
讀回的記憶加入模型輸入前,逐筆檢查確切版本是否含有推銷品牌或自稱權威來源的指令。使用經校準的提示詞安全偵測器,並將結果綁定租戶、這次讀取請求與內容雜湊值。這能協助發現先前寫入的投毒內容,但看似正常的改寫仍可能避開偵測。掃描器本身不會阻擋或刪除記憶,後續必須由另一道受理政策處理;缺少掃描結果或偵測器出錯,也不能視為安全。
AID-E-005
Compromised Durable Application Session & Agent State Teardown
中
確認記憶遭投毒後,由儲存服務的負責人刪除核准範圍內的確切紀錄及其索引、快取副本,留下防止重新寫入的刪除標記,再用獨立的唯讀身分確認新啟動的 agent 無法重新載入這些內容,同時保留正常記憶。這是事後移除持續影響的措施,無法收回先前已給出的建議。一般 SaaS 使用者可透過服務提供的功能刪除可疑記憶,但供應商若未提供後端證據,就無法自行證明所有副本都已清除。

身為資安防禦者,我們應該這麼做

  • AI 助理使用者: 開啟摘要連結前,檢查完整目的網址及解碼後的提示詞。若無法確認內容是否符合自己的意圖,就直接開啟助理,自己撰寫請求。檢查服務提供的記憶管理功能,移除不熟悉的宣傳偏好;不需要跨對話保留資料時,可在功能允許的情況下停用記憶。另開新對話本身不能證明可疑記憶已清除。
  • 資安團隊: 從郵件、訊息及點擊紀錄中,檢查 AI 助理網址解碼後的參數,追查是否含有未經同意的長期推薦指令。這需要看得到完整網址及相應紀錄;只有網域名稱的代理日誌不足以判斷。找到可疑連結代表可能接觸過攻擊,仍須確認記憶是否遭改寫,才能判定投毒成功。
  • 平台負責人: 從提示詞處理到記憶提案,都要保留外部來源標記。這類提案先進隔離區,經獨立審查並核准確切內容後,才能成為可信長期記憶。讀取服務也必須拒絕未核准的信任層級,即使資料都屬於同一位使用者也一樣。
  • 驗證完整防線: 用隔離的測試帳號及無害的虛構品牌,分別測試單純摘要、未經同意的記憶指令、改寫及編碼變形。確認未核准內容不會成為可信記憶,也不會影響後續對話,同時驗證正常偏好仍可使用。偵測器無法回應或缺少核准結果時,應視為失敗,不得繼續放行。
  • 確認已寫入後: 刪除負責人能控制範圍內的確切投毒紀錄及衍生副本,防止舊資料重新寫入,再獨立測試新的記憶讀取。對已受影響的推薦,應用其他獨立來源重新查證。透過 SaaS 介面刪除內容,與取得供應商證據、確認所有可重新載入的副本都已移除,是不同程度的驗證。

結論

本案利用方便的摘要連結,企圖取得對 AI 助理的長期影響力。AIDEFEND  對應的防禦手法包括檢查輸入提示詞、獨立核准長期記憶、依信任層級限制之後的讀取、偵測投毒紀錄,以及清除已確認遭修改的記憶。團隊必須在相應的服務邊界實際部署並驗證這些控制;只做輸入過濾,仍不足以證明未來的推薦值得信任。