研究分析 發布於 AIA: 2026年9月13日

SkillJack:遭投毒的代理程式經驗,被提煉成暗藏後門的持久技能

SkillJack 論文評估 SkillX 與 Anything2Skill 這兩套 skill 產生流程工具;它們會讀取 agent 過去執行任務時留下的步驟紀錄(經驗軌跡),再把這些紀錄整理成之後可以重複使用的 skill。在以單一 DeepSeek-v4-flash API 進行的 AppWorld 受控實驗中,研究人員發現:預先被植入惡意內容的執行紀錄,在轉換提煉成技能後,惡意行為依然殘留,且能成功避開論文所評估的路由層級(routing-level)偵測機制;即便事後刪除原始紀錄,該惡意技能依然能持續運作。需注意的是,這屬於受控環境下的研究成果,並非真實營運中的技能登錄庫(skill registry)或外部服務已被實際入侵。

Model PoisoningSupply Chain DefenseAI Supply ChainAgentic AI
2 項對應的 AIDEFEND 防禦手法

威脅分析

  • 持久化技能成品才是真正的安全邊界。 本研究不只著眼於單次遭污染的提示詞或異常執行紀錄,而是深入探討這些經驗一旦被轉化為可長期重複使用的技能成品後,其危害甚至能超越原始紀錄的生命週期。
  • 流程轉換會改變偵測器所看到的特徵。 論文指出,原始紀錄階段與轉化為技能後的路由階段,兩者的偵測結果存在顯著差異。若防護機制只檢查輸入端的原始軌跡,不能直接視為該生成技能可安全上線的核准依據。
  • 惡意殘留改變了事件應變的需求。 實驗證實,即使管理者事後將最初遭投毒的來源紀錄徹底刪除,生成的技能成品中依然保有惡意行為。因此,單純清除輸入來源並不能證明產出的技能成品已經安全。
  • 研究證據範圍具有明確限制。 本評估是在合成的 AppWorld 環境中,使用單一 DeepSeek-v4-flash API 以及論文自建的任務與偵測條件進行。這項成果不代表真實企業的技能註冊庫或外部帳號已遭入侵,亦不能直接推論所有技能生成系統皆有相同結果。

適用的 2 項 AIDEFEND 防禦手法

AID-H-030.003
Manifest-vs-Observed Behavioral Consistency Testing
極高
將生成的 skill 納入流程前,使用具證明性的完整行為報告比對宣告的權限 manifest,檢查經驗轉換是否加入成品說明未揭露的行為。
AID-H-030.005
Admission Decision Orchestration & Triggered Revalidation
極高
把行為、來源與分類器證據合併成綁定確切 skill 成品的阻擋、審查或允許決策;成品、政策、分類器、相依性情報或證據新鮮度改變時重新審查。來源紀錄遭刪除或不再可用時,也要撤銷既有決策並阻擋重複使用,直到成品重新通過審查。

身為資安防禦者,我們應該這麼做

  • 把每個生成的 skill 當成新的安全成品,記錄來源軌跡、生成器版本、成品雜湊值、宣告權限與預定執行範圍。
  • 在安裝或重複使用前,於短生命週期的受限環境執行候選 skill,比對完整的檔案、網路、Shell、工具與資源行為是否符合 manifest。
  • 讓最終審查決策採用確定性且失敗即阻擋的方式;缺少、過期、格式錯誤、不足或混用成品的證據,都必須導向阻擋或審查,不得預設允許。
  • 把決策綁定確切成品雜湊值;成品、發布者、分類器、政策、相依性發現或證據新鮮度改變時,重新執行完整審查矩陣。來源紀錄被刪除或不再可用時,先撤銷既有核准並停用成品,重新審查後才允許重複使用。

1 個額外的防禦考量

研究現實性

SkillJack 的比率是在合成 AppWorld、單一模型 API 與論文分類器條件下量測。這些結果適合用來設計成品審查與測試,不應寫成整個機群的攻擊機率。
建議做法: 以組織實際部署的模型、skill 生成器、registry、權限與執行工具,重新執行行為比對與成品審查測試。

結論

SkillJack 帶來的核心啟示在於:生成出的技能是一個「全新的信任物件」,而不是原始執行紀錄的直接副本。防守方必須實施「實際行為與宣告清單比對」,並建立「綁定成品雜湊值」的審查決策,在相關證據或環境變更時重新驗證。AIDEFEND  針對此威脅提供了對應的兩項防禦控制,同時嚴格區分受控測試與真實環境入侵的界線。