AID-H-037.001
極高
Reasoning-Trace Confidentiality & Storage Controls
把完整推理區塊留在供應商或其他受保護伺服器的狀態儲存區,列為機敏資料,禁止顯示、回傳用戶端、匯出至分析系統或寫入公開日誌。對外只提供範圍受限的摘要或不可逆參照。這會移除第三方攻擊首先必須取得的可攜區塊。
本研究的作者們在 2026 年 7 月初測試 Anthropic、OpenAI 與 Google API 時發現,供應商回傳的不透明推理區塊,曾可跨工作階段、跨使用者,或交給同一家供應商的相容模型繼續使用。攻擊者必須先取得他人的區塊,再把它送給能力較弱的相容模型,並透過越獄誘使模型轉錄隱藏推理。本研究的作者們從 6,708 筆公開的 agent 執行記錄重建 315,320 個區塊,並在 328 個工作階段找到真實機敏資料。作者表示,供應商採取緩解措施後,已無法重現所展示的攻擊。
Stolen Thoughts 說明,不透明不等於安全;只要推理區塊離開原始情境後仍會被接受,它就是可被轉交並重用的隱藏狀態。AIDEFEND 把最直接的防禦手法放在這條攻擊真正依賴的前提:完整推理只留在伺服器端、原封不動地保留供應商區塊並拒絕用戶端自行提交、避免原始機密進入模型,也把已揭露的繞過手法納入發布前迴歸測試。機敏內容偵測與無法完成就拒絕發布的檢查,可以阻止可辨識的明文送出;若已確認憑證暴露,則要分開撤銷長效憑證與已簽發的 token 或工作階段。供應商端仍需要補上跨帳戶的密碼學綁定、區塊重用偵測、舊格式失效處理,以及解碼模型的拒絕行為訓練。