MITRE ATLAS
mitre-atlas-cs0040
以提示詞注入竄改 ChatGPT 的記憶
- AI 基礎設施
- 模型投毒與完整性破壞
Embrace the Red(https://embracethered.com/blog/)示範了 ChatGPT 的記憶功能可以透過提示詞注入被操弄。攻擊做法是:研究人員把一段提示詞注入藏在一份共用的 Google 文件裡。當使用者提到這份文件時,它的內容會透過 Connected App 功能進入 ChatGPT 的脈絡,於是這段提示詞就被執行,把錯誤的事實寫進記憶中。研究人員示範了這些被植入的記憶會跨對話持續存在。此外,由於這段提示詞注入是透過共用資源帶進來的,其他人也會暴露在同樣的攻擊之下,惡意內容也因此得以在系統中長期留存。