實證研究 發布於 AIA: 2026年8月12日

Stolen Thoughts: 不透明推理區塊可被跨情境重用,進而還原機敏內容

本研究的作者們在 2026 年 7 月初測試 Anthropic、OpenAI 與 Google API 時發現,供應商回傳的不透明推理區塊,曾可跨工作階段、跨使用者,或交給同一家供應商的相容模型繼續使用。攻擊者必須先取得他人的區塊,再把它送給能力較弱的相容模型,並透過越獄誘使模型轉錄隱藏推理。本研究的作者們從 6,708 筆公開的 agent 執行記錄重建 315,320 個區塊,並在 328 個工作階段找到真實機敏資料。作者表示,供應商採取緩解措施後,已無法重現所展示的攻擊。

Privacy LeakageCredential ExposureData GovernanceSession IsolationAI Infrastructure
8 項對應的 AIDEFEND 防禦手法
來源: Stolen Thoughts: Stealing Reasoning from Proprietary Language Models 
作者: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko
原文發布: 2026年8月10日

威脅分析

  • 攻擊者必須先持有推理區塊。 這項研究沒有證明攻擊者能任意讀取其他租戶的隱藏狀態。第三方資料擷取路徑的起點,是開發者公開含有區塊的 agent 執行記錄或工作階段日誌,或讓攻擊者能以其他方式取得該區塊。
  • 問題在於區塊可以跨情境使用,並非加密遭破解。 2026 年 7 月初的測試顯示,供應商會跨工作階段、跨使用者,或在同一家供應商的相容模型之間接受不透明或加密區塊。能力較弱的模型處理有效區塊後,攻擊者可再透過越獄誘使它轉錄隱藏推理。
  • 公開的執行記錄確實含有真實機密,但研究結果仍有明確限制。 團隊分析 6,708 筆記錄,共重建 315,320 個區塊,並在 328 個工作階段辨識出 API key、密碼、存取 token、私鑰、個人 Email、姓名與地址等真實機敏資料。704 筆來自真實工作階段的機敏項目中,有 64 筆未出現在可見對話紀錄。其他部分統計來自合成基準測試角色;由於供應商不提供原始明文,也無法保證每次轉錄都逐字正確。
  • 供應商採取緩解措施後,研究團隊已無法重現攻擊。 Anthropic、OpenAI 與 Google 均確認收到通報;研究團隊表示,供應商調整後已無法重現論文圖 1 的攻擊。這起案例仍揭示一個可重複出現的架構問題:隱藏狀態能否跨情境使用,以及 agent 執行記錄是否會被公開。

適用的 8 項 AIDEFEND 防禦手法

AID-H-037.001
Reasoning-Trace Confidentiality & Storage Controls
極高
把完整推理區塊留在供應商或其他受保護伺服器的狀態儲存區,列為機敏資料,禁止顯示、回傳用戶端、匯出至分析系統或寫入公開日誌。對外只提供範圍受限的摘要或不可逆參照。這會移除第三方攻擊首先必須取得的可攜區塊。
AID-H-037.003
Provider Reasoning-Block Round-Trip Integrity
極高
供應商產生的推理區塊,要逐位元組原封不動地保留在伺服器端封裝中,只能送回同一個供應商路由與對話;供應商支援綁定驗證時也要確實驗證。用戶端自行提供或曾被修改的區塊,在延續推論前就要拒絕。只要企業整合層確實執行這道檢查,就能擋下取得區塊後再次送入模型的路徑;但供應商 API 若仍允許從整合層以外直接提交同一區塊,還是需要由供應商修正。
AID-I-004.007
Task-Bounded Context Segmentation & Secret Demotion
不要把憑證與其他高度機敏值放進對話或模型可讀取的內容。agent 只取得短效、限於單一任務的參照,再由通過授權的代理元件在核准工具或網路端點解析。只要原始值沒有進入模型,就不會被寫進推理區塊;不過,這項控制無法保護原本就必須留在區塊裡的專有推理內容。
AID-M-008
Automated Agentic Security Benchmarking
把論文中的區塊擷取、相容模型提交與轉錄越獄案例,整理成經過簽章、已移除機敏資料的迴歸測試集。每次模型或 API 要發布新版本前,都必須確認系統會拒絕這條重用路徑,也不會輸出機敏明文;未通過就不能發布。這能持續測試已揭露的繞過手法,但不能證明模型能抵抗所有越獄方法。
AID-D-003.002
Sensitive Information & Data Leakage Detection
解碼模型的完整回應在送給使用者前,先以固定規則偵測常見憑證格式,再使用命名實體辨識(NER,用來從文字中找出姓名、地址等實體)與 Presidio,找出不固定格式的個人資料,並把結果交給發布前檢查。偵測只能指出可辨識的機敏內容,本身不會阻止資料送出。
AID-H-006.002
Text, Markup & Structured Output Sanitization and Release Gate
完整回應或範圍受限的輸出片段,要先暫存,等機敏內容偵測結果完成後才能送出。系統應依明確規則遮罩或拒絕相符內容;檢查無法完成時,也不能發布。這能阻擋還原明文中可辨識的憑證與個人資料,但無法證明所有專有推理內容都已移除。
AID-E-001.001
Root & Long-Lived Credential Object Eviction
若證據確認密碼、API key、用戶端 secret、私鑰或其他根憑證與長效憑證曾出現在外洩的推理明文中,就要盤點這起事件確切涉及的物件,並在每一個權威簽發端與驗證端撤銷、停用、重設或輪替。這是資料暴露後的圍堵措施,無法預防推理內容遭還原。
AID-E-001.002
Issued Token, Authentication Session & Lease Revocation
若外洩內容包含存取 token、更新 token、工作階段 cookie、授權伺服器工作階段、閘道驗證工作階段或 agent 租約,就要在所有簽發端、驗證端、快取與政策執行位置撤銷完整的受影響範圍。輪替長效憑證不會讓這些已簽發物件自動失效,因此必須分開處理。

身為資安防禦者,我們應該這麼做

  • 停止把供應商的原始推理區塊放進 agent 日誌、AI 工作流程執行記錄、錯誤報告、範例或資料集。從已發布內容移除歷史副本,同時保留調查所需且受存取控制的證據。
  • 供應商產生的區塊要逐位元組原封不動地留在伺服器端;延續推論前,拒絕用戶端自行提供或曾被修改的區塊。供應商還要把接受條件綁定到已驗證的身分、工作階段、對話、路由、模型系列、順序與有效期限,並讓不具備新綁定資訊的舊區塊失效。
  • 把憑證與其他高度機敏值移出提示詞與模型可讀取的內容。agent 只取得限於任務的短效參照,原始值只能在核准的工具或網路端點解析。
  • 把論文中的區塊重用與轉錄案例納入經過簽章的發布前迴歸測試。解碼模型的任何輸出在顯示或匯出前,都要先偵測憑證與個人資料、暫存完整回應,再遮罩或拒絕相符內容。
  • 清查公開與內部記錄中是否留有外洩區塊與已確認的機密。只有確認密碼、金鑰或其他長效憑證已暴露時,才撤銷或輪替;存取 token、更新 token、工作階段與 agent 租約則要另外撤銷,完成後還要在每一個依賴服務驗證結果。

2 個額外的防禦考量

跨帳戶重用偵測與舊格式失效處理

前述控制可以避免區塊被公開、讓企業整合層拒絕用戶端自行提交的區塊、在發布前測試已知攻擊,並阻擋機敏輸出。供應商還需要在不記錄明文的前提下,比對同一區塊是否出現在不同帳戶或模型路由,並在加強綁定後讓舊區塊格式或舊金鑰失效。
建議做法: 若同一區塊指紋出現在不同身分、工作階段或模型路由,就觸發警示;相容性允許時,拒絕所有早於新綁定政策的舊區塊。

解碼模型的拒絕行為訓練

迴歸測試可以確認已知的轉錄提示詞是否仍然有效,但供應商還要訓練模型拒絕揭露或轉換外部區塊內的隱藏推理。
建議做法: 把論文中要求模型轉錄隱藏內容的提示詞,以及自動產生的變形版本,用於安全訓練與紅隊測試,並將相同案例保留在發布前迴歸測試集中。

結論

Stolen Thoughts 說明,不透明不等於安全;只要推理區塊離開原始情境後仍會被接受,它就是可被轉交並重用的隱藏狀態。AIDEFEND  把最直接的防禦手法放在這條攻擊真正依賴的前提:完整推理只留在伺服器端、原封不動地保留供應商區塊並拒絕用戶端自行提交、避免原始機密進入模型,也把已揭露的繞過手法納入發布前迴歸測試。機敏內容偵測與無法完成就拒絕發布的檢查,可以阻止可辨識的明文送出;若已確認憑證暴露,則要分開撤銷長效憑證與已簽發的 token 或工作階段。供應商端仍需要補上跨帳戶的密碼學綁定、區塊重用偵測、舊格式失效處理,以及解碼模型的拒絕行為訓練。