MITRE ATLAS
mitre-atlas-cs0072
AI 推薦投毒:摘要連結夾帶指令,企圖改寫 AI 助理的長期記憶
- 自主式 agent
- 模型投毒與完整性破壞
Microsoft 發現,有業者在看似方便的 AI 摘要連結中夾帶宣傳指令,企圖操縱 AI 助理之後的推薦內容。這些指令放在網址的提示詞參數中;如果助理接受指令並將其存成長期記憶,後續回答就可能偏向業者的品牌或網站。報告列出來自 31 家公司、橫跨 14 個產業的 50 多種提示詞,但這是觀察到的投毒嘗試,並非成功入侵次數。成效會隨平台與防護更新而改變,文中的虛構品牌及財務損失情境則用來說明可能後果。此流程依 ATLAS 的六個步驟呈現;最後兩步須以記憶寫入成功、之後又被讀取為前提。