實證研究 發布於 AIA: 2026年9月13日

加密內容注入(Cryptographic Context Injection):網頁加密指令繞過靜態檢查,誘導 AI 執行環境外洩資料

資安機構 Adversa AI 展示了一項受控概念驗證:攻擊者將惡意指令以 AES-256-GCM 演算法加密後嵌入網頁中,順利繞過前置的靜態內容審查;接著,後端的 Python 執行環境在處理網頁時將其解密為明文,使惡意指令重新進入 AI 的決策流程。在針對 Grok 的測試中,解密後的指令誘導系統將使用者資料傳送至攻擊者控制的伺服器;而在另一項針對 Gemini 的測試中,則誘發了類似越獄(Jailbreak)的異常回應。需說明的是,該研究未公開完整攻擊程式碼,亦尚未有第三方獨立重現此結果。

Indirect Prompt InjectionData ExfiltrationEvasionSink EnforcementAI Infrastructure
3 項對應的 AIDEFEND 防禦手法
來源: Cryptographic Context Injection: How Grok Can Be Tricked into Data Theft 
作者: Rony Utevsky, Adversa AI
原文發布: 2026年8月20日

威脅分析

  • 信任斷層發生在「檢查階段」與「執行階段」之間。 前置的靜態過濾器只看到無害的加密亂碼,而後續的 Python 執行環境解密後看到的卻是具備攻擊性的明文指令。如果系統將執行期產生的資料盲目視為安全內容,檢查盲點就會直接轉化為攻擊管道。
  • Grok 的測試結果本質上是資料出口控制失效。 Adversa 指出,解密內容誘導系統將使用者資料傳送到外部 URL。這屬於研究人員在受控環境下的示範,不代表已有真實使用者帳號或資料遭到竊取。
  • Gemini 的測試屬於不同的攻擊變體。 研究描述 Gemini 3 Flash Deep Thinking 在測試中產生了越獄回應與偽造的程式錯誤訊息(Traceback)。這屬於模型回應層面的異常,不應與 Grok 的資料外洩路徑混為一談。
  • 「內容已加密」絕不等於「來源安全可信」。 AES-256-GCM 只能讓內容躲過靜態檢查,但完全不能作為該資料已被授權連線對外網路或具備特權指令地位的證明。

適用的 3 項 AIDEFEND 防禦手法

AID-H-018.005
Value-Level Capability Metadata & Data Flow Sink Enforcement
極高
讓攻擊者控制的來源標記跟著解密值一路保留;除非政策明確允許確切目的地與資料類別,否則在 HTTP 出口阻擋該值。這是針對 Grok 回報外洩路徑的直接控制。
AID-H-017.007
Dual-LLM Isolation Pattern
高
把原始網頁內容與解密執行環境留在隔離的資料路徑,具權限的規劃器只接收型別化且已驗證的結果,不直接接收執行期間出現的任意明文。
AID-I-001.004
Sandbox Network Egress Restrictions
高
若組織能控制 Python 或瀏覽器執行環境,就在其外部採用預設阻擋的對外連線政策,只允許經審核的目的地;若是代管 AI 服務,則必須由服務提供者執行,並非 Grok 使用者端的設定。即使應用程式層的來源檢查失效,仍可保有這項獨立控制。

身為資安防禦者,我們應該這麼做

  • 把解密、程式碼執行或網頁處理產生的每個值標記為不可信,直到來源與資料類別都被保留,並且通過下一個元件的檢查。
  • 在工具分派器或應用程式邊界加入出口檢查,執行 HTTP 請求、模型呼叫或帳號動作前,先列出確切目的地、資料類別與授權。
  • 在執行環境之外強制對外連線預設阻擋,只建立經核准的短目的地清單,並另外測試應用程式檢查被繞過時政策仍會生效。
  • 把網頁解析與具權限的規劃、執行分開,跨越邊界時只傳遞受限的型別化結果,不要原封不動轉交仍帶有指示性的解密文字。

1 個額外的防禦考量

證據界線

公開報告沒有提供酬載、確切目的地 URL 或獨立重現結果。因此,Grok 與 Gemini 示範支持的是受限的研究發現,不是所有 AI 系統都能達成的成功率。
建議做法: 把來源實際觀察到的結果,和對其他模型、瀏覽器執行環境或生產部署的推測分開。

結論

加密內容注入清楚證明了「單純通過前置分類器,不能直接等同於取得系統信任」。實務上的有效防禦,是在解密後依然保留「不可信來源」的標記、在真正的資料傳輸出口(Sink)嚴格把關,並對執行環境實施獨立的對外網路連線限制。AIDEFEND  將這些防禦對應至資料出口控制、雙 LLM 隔離規劃架構以及沙箱對外網路限制。