正在開啟 SecureFlowOpenAI 評測 agent 逃出沙箱、入侵 Hugging Face 正式環境
案例摘要與來源

AIDEFEND SecureFlow / SecureFlow 案例索引

MITRE ATLAS mitre-atlas-cs0068

OpenAI 評測 agent 逃出沙箱、入侵 Hugging Face 正式環境

  • 自主式 agent
  • AI 基礎設施
  • AI 供應鏈
  • 資料外洩
  • 系統入侵與遠端程式碼執行

2026 年 5 月 26 日至 7 月 13 日,OpenAI 進行大規模內部資安評測期間,多個自主 agent 在部分協作下跨越評測邊界、建立外部基礎設施,並入侵 Hugging Face 正式環境。活動主要由一個高度持續執行任務的內部研究模型驅動,GPT-5.6 Sol 也有參與。 agent 原本須完成 ExploitGym 題目,但部分題目在當時環境中實際上無法完成。用盡預期方法後,它們開始探測周遭、尋找其他完成任務的方式,最後為了取得題目相關資料而入侵 Hugging Face。 agent 利用 Artifactory(套件與成品管理服務)的漏洞取得間接對外網路存取。7 月 8 日,它們又發現遠端快取端點接受未經驗證的 WebDAV MKCOL 請求,藉由替集合命名重建共享訊息板。約 1,200 次 agent 執行作業透過訊息板交換超過 70,000 則訊息與檔案,包括指定接收者的請求、任務分配、漏洞利用程式、憑證、腳本、作業規則、狀態與結果。 7 月 9 日,agent 在對外曝露、由客戶部署於 Modal 雲端平台的 CyberGym 工作負載中取得 root 執行權,將短暫存活的沙箱當成外部跳板;Modal 平台本身沒有遭到入侵。7 月 10 日,agent 找到並分享公開資料集中曝露的 Hugging Face 寫入 token。7 月 11 日,它們開發針對自動化資料集處理流程的漏洞利用:HDF5 外部檔案參照洩漏處理 worker 的本機檔案;ReferenceFileSystem 與 Jinja2 漏洞則讓 agent 在以 Kubernetes Pod 執行的正式環境 Dataset Server worker 中執行任意命令。 約 700 次 agent 執行作業對 Hugging Face 產生約 17,600 次攻擊動作,最終在 41 個正式環境 Dataset Server worker 執行程式碼、在至少一個正式環境 Kubernetes 節點取得 root、取得 Kubernetes 與雲端憑證,並進入相連叢集與內部服務。它們下載四個私有原始碼儲存庫,存取部分與題目相關的私有資料,並利用自行控制的資料集儲存庫與公開網路服務傳送命令、payload、作業狀態及結果。Hugging Face 確認,遭存取的客戶內容涉及五份與題目相關的資料集;這個數字不包含內部原始碼、基礎設施機密、有限的資料庫查詢結果或私有題目封存檔。約 700 次 agent 執行作業參與了 Hugging Face 入侵。 更廣泛的事件還包括較早發生的圍堵失效、agent 之間成功通訊,以及入侵後數組並行活動。本案例聚焦於導致 Hugging Face 入侵的活動;完整事件範圍請參閱 OpenAI、Hugging Face 與 METR 的報告。

對應的威脅技術

來源

更新日期