實證研究 發布於 AIA: 2026年8月25日

Copilot for Word 把隱藏提示詞變成可隨文件傳播的 AI 蠕蟲

研究人員把白底白字的提示詞(prompt)藏進 Word 文件後,Microsoft Copilot for Word(內建在 Word 裡、可依使用者要求撰寫或編輯文件的 AI 助理)在移除格式時仍保留這段文字,接著依指令暗中修改財務數字,並把同一段隱藏提示詞複製到新文件。這份新文件之後若再被附加、上傳,或被檢索功能選進 Copilot 的撰寫或編輯流程,隱藏指令就可能再次執行。不過,它不會像傳統網路蠕蟲一樣自行尋找目標;每一輪傳播都仍需要使用者或檢索流程,把帶有提示詞的文件重新納入撰寫或編輯工作。

Indirect Prompt InjectionInput ValidationHuman-in-the-LoopAI CopilotsEnterprise AI
5 項對應的 AIDEFEND 防禦手法
來源: Context Collapse, Part 3 - AI Worming through Word 
作者: Håkon Måløy
原文發布: 2026年7月28日

威脅分析

  • 載體看起來只是一份普通的 Word 文件。研究人員把 JSON 格式的指令設成白底白字與小字體,一般讀者查看頁面時通常不會察覺。
  • Copilot 移除了顯示格式,卻保留文字內容。文件進入 Copilot for Word 的撰寫或編輯流程後,系統會先移除格式,再把文字交給模型處理。原本肉眼看不到的內容因此成為模型可讀取的輸入,並與使用者明確提出的要求爭奪指令權限。
  • 概念驗證(PoC)實際竄改了文件數值。Copilot 依照注入指令,暗中把財務數字減半。這裡的資安影響是文件完整性遭破壞,不只是聊天機器人回了一段不合預期的文字。
  • 同一段隱藏提示詞也被複製到新文件。如果這份輸出之後被附加、上傳,或被選為另一項 Copilot 工作的相關內容,指令就可能再次執行。這種傳播依賴文件在日常工作中被重複使用,不會自行搜尋檔案或受害者。
  • 原文所述的緩解措施尚未消除整類問題。研究人員於 3 月 6 日向 MSRC(Microsoft 安全回應中心)通報。Microsoft 在 4 月與 7 月陸續加入緩解措施及模型更新,但 Måløy 表示,他在 7 月 15 日仍能在 GPT-5.5 與 GPT-5.6 部署環境中重現。
  • 證據仍屬受控研究。原始資料呈現了載體設計、內容遭竄改與提示詞被複製的結果,但沒有指出實際攻擊活動,也沒有公開完整的攻擊提示詞。

適用的 5 項 AIDEFEND 防禦手法

AID-H-006.002
Text, Markup & Structured Output Sanitization and Release Gate
極高
完整的 Word 檔案必須先暫存,通過檢查後才能儲存或分享。文件專用的發布檢查要比對使用者可見內容與底層文字,拒絕肉眼看不到或被複製的指令,也要攔下無法由使用者要求解釋的欄位變更。這項控制會直接中斷內容竄改與新載體產生兩個步驟。
AID-H-016.001
System Prompt Structure & Instruction/Data Separation
極高
把來源文件的文字放進明確標示為資料、不具指令權限的獨立欄位。即使 Word 格式已被移除,使用者的撰寫要求與可信的工作流程欄位,仍必須在結構上和文件內容分開。如此可降低隱藏文字沿用指令權限的機會。
AID-H-018.003
High-Impact Independent Validation & Approval Gate
高
在套用會實質改變財務或其他受控內容的編輯前,先由獨立檢查比對確切差異與使用者可見要求。若數值變更無法由原要求解釋,就必須重新取得針對該次變更的核准,不能沿用一開始同意編輯文件的動作。
AID-H-002.002
Inference-Time Prompt & Input Validation
高
在組合提示詞前,先檢查從文件擷取的文字與檢索來源,保留其不受信任的來源標記,並隔離模仿指令或要求暗中複製自己的內容。這是阻擋載體進入模型的第一道檢查;由於提示詞注入偵測不可能完全準確,仍需搭配前述結構化隔離與輸出檢查。
AID-D-001.001
Per-Prompt Content, Intent & Obfuscation Analysis
中
固定版本並完成校準的偵測器,可找出文件中自稱具有指令權限的內容、指令切換、隱藏文字特徵與自我複製意圖。偵測結果必須綁定確切內容版本,並交由輸入或發布政策決定是否阻擋;警示本身不會停止文件異動。

身為資安防禦者,我們應該這麼做

  • 盤點所有會附加、上傳、檢索、摘要、編輯或產生 Office 文件的 Copilot 工作流程,確認格式在哪個步驟被移除,以及哪些文字最後會進入模型。
  • 建立包含白底白字、極小字體、頁面外物件、隱藏文字區段及可自我複製 JSON 指令的回歸測試文件。驗證時要同時檢查模型回應與底層輸出檔案,不能只看畫面上的預覽。
  • 把來源文件文字放進獨立結構欄位,並明確標示為不受信任資料。文件內容不得建立系統指令、政策、工具指令或工作流程指令。
  • 對財務與其他受控文件產生語意差異報告;如果數值變更無法由使用者可見要求解釋,就必須重新核准。
  • 儲存或分享文件前,檢查完整檔案中是否存在肉眼看不到的文字與從來源複製而來的指令。如果審閱畫面與實際儲存內容不一致,就應阻擋發布。
  • 在回歸測試紀錄中保留模型與政策版本。原始研究在數次緩解措施後仍能重現,因此只完成一次模型升級,不能當成整類問題已經關閉的證據。

結論

本案真正特殊之處,不只是文件裡藏了白底白字。Copilot 讓隱藏內容取得指令權限,不但竄改使用者要求的文件,還把攻擊者指令保留在新的載體中。

AIDEFEND  把最關鍵的控制放在三個不同邊界:AID-H-016.001 在推論前分開文件資料與指令,AID-H-018.003 在變更生效前驗證實質編輯,AID-H-006.002 則在發布前檢查完整輸出檔案。三者一起部署,才能同時中斷第一次執行與依賴後續工作流程重複使用文件的傳播迴圈。