正在開啟 SecureFlowStolen Thoughts:從不透明推理區塊還原機敏內容
案例摘要與來源

AIDEFEND SecureFlow / SecureFlow 案例索引

Authors of the Stolen Thoughts study aidefend-sf0027

Stolen Thoughts:從不透明推理區塊還原機敏內容

  • AI 基礎設施
  • 資料外洩
  • 憑證與身分竊取

本研究的作者們在 2026 年 7 月初測試 Anthropic、OpenAI 與 Google API 時發現,供應商回傳的不透明或加密推理區塊,曾可跨工作階段、跨使用者,或交給同一家供應商的相容模型繼續使用。第三方攻擊者必須先取得他人的區塊,例如公開的 agent 執行記錄裡保留的區塊,再把它送給能力較弱的相容模型,並透過越獄誘使模型轉錄隱藏推理。本研究的作者們從 6,708 筆公開執行記錄重建 315,320 個區塊,並在 328 個工作階段找到真實機敏資料。論文明確區分真實工作階段資料與合成基準測試角色,也沒有宣稱攻擊者能在未持有區塊時任意跨租戶擷取資料。作者表示,供應商採取緩解措施後,已無法重現所展示的攻擊。

對應的威脅技術

來源