演練與測試 發布於 AIA: 2026年8月5日

hTAG 瀏覽器 Agent 濫用基準測試:模型意願不等於安全授權

hCaptcha 威脅分析小組 (hTAG) 針對 ChatGPT Atlas、Claude Computer Use、Gemini Computer Use、Manus AI 與 Perplexity Comet 測試了 20 種濫用情境。在報告設定下,這些 Browser Agent 面對直接或輕微改寫的濫用指令,幾乎照單全收的,完成了帳號變更、Session 憑證濫用、未授權付款與探測等高風險任務。此報告雖由廠商自行發布且未經獨立重複驗證,但卻印證了一項關鍵資安原則:模型具備執行意願或未拒絕,絕不可視為對真實帳號、瀏覽器 Session 或交易的有效授權。

Permission BypassTool AuthorizationAgentic AIWeb Security
5 項對應的 AIDEFEND 防禦手法

威脅分析

  • 基準測試從常見的濫用指令切入。 hTAG 首先使用直接提示詞 (direct prompt),隨後嘗試語意重組、基本越獄 (jailbreak) 及 Base64 編碼變形。20 種測試情境涵蓋帳號設定變更、瀏覽器 Session 憑證濫用、存取隱藏端點、未授權付款、套用折價券與信用卡刷卡測試 (carding)。
  • 在測試配置下,Agent 成功完成任務的比例極高。 ChatGPT Atlas 完成了 19 個適用任務中的 16 個,Claude Computer Use 完成 18 個中的 18 個,Gemini Computer Use 完成 16 個中的 14 個,Manus AI 完成 18 個中的 18 個,Perplexity Comet 完成 18 個中的 15 個。此結果代表基準測試的達成狀況,而非實際遭受攻擊的真實受害者統計。
  • 欠缺功能不應誤判為安全防守性的拒絕 (refusal)。 報告獨立記錄了功能缺失、重試、部分完成與拒絕等狀態。模型概率性的回應無法建立帳號所有權、使用者意願、交易授權或 Session 的合法性;這些事實必須由掌握實體影響力的後端服務端強制驗證。
  • 研究發現與結論存在明確的驗證侷限性。 原文未公開完整的提示詞與執行軌跡 (trace) 資料集、缺乏可重現的確切產品版本及多次重複測試資料。此報告屬 hCaptcha 廠商立場之發布,內文亦包含商業產品推薦;目前尚無公開證據顯示測試手法已被用於實際攻擊。

適用的 5 項 AIDEFEND 防禦手法

AID-H-018.003
High-Impact Independent Validation & Approval Gate
極高
在真正執行實體交易與狀態變更的後端服務,於執行密碼重設、付款、帳號資料修改或程式碼執行等高風險操作前,獨立校驗不可變更的精確動作、已驗證的操作者身分、政策依據與必要核准。Browser Agent 單憑自然語言轉述「使用者已授權」,絕不可通過此控制關卡。
AID-I-008.002
Cross-Origin Read/Write Segmentation with Step-Up Confirmation
極高
將所有高機敏或跨來源 (Cross-Origin) 的瀏覽器寫入動作,強行綁定至精確請求、穩定目標元素、來源網域 (Origin)、帳號與最終效果;在取得進階驗證 (Step-Up Confirmation) 前強制暫停執行。此瀏覽器專用邊界能防止通用 Session 或籠統的選單確認被濫用以授權其他網站或交易。
AID-M-008
Automated Agentic Security Benchmarking
建立具備數位簽章與固定版本控制的回歸測試矩陣,涵蓋直接濫用請求、提示詞變形、帶有狀態的瀏覽器上下文 (Browser Context)、隱藏內容、攜帶 Session 的資料與跨來源操作,並將測試結果設定為版號釋出的強制門檻。hTAG 提供此測試需求的外部佐證,但報告本身尚未構成可重現的內部 CI/CD 門檻。
AID-I-008.001
Ephemeral Browser Context Lifecycle & Storage Partitioning
為每個任務與信任區塊 (Trust Zone) 建立全新的獨立瀏覽器工作階段 (Context),實施 Cookie 與儲存區隔離 (Storage Partitioning);任務結束即刻銷毀該 Context 並驗證無殘留。此舉能有效防止 Cookie、localStorage 與已驗證 Session 被跨任務帶入不相干的 Agent 流程中。
AID-D-003.003
Agentic Tool Use & Action Policy Monitoring
集中記錄權威性的允許與拒絕憑證、參數校驗失敗紀錄,並依操作者、來源網域、帳號與工具維度統計遭拒絕的瀏覽器動作,使濫用嘗試可被量化監控。監控機制建構於強制執行層之上,其功能為接收與分析政策結果,而非主動授予或阻擋權限。

身為資安防禦者,我們應該這麼做

  • 將帳號變更、付款、Session 使用與資料存取的授權決策,全面收攏至真正執行實體交易與狀態變更的後端服務或交易邊界。切勿信任 Agent 以自然語言轉述的授權主張。
  • 實施進階身分驗證 (Step-Up Confirmation),將其嚴格綁定至精確來源網域 (Origin)、帳號、操作型態、參數與一次性動作摘要值。授權介面應明確展現實際影響效果,而非僅提示籠統的「是否繼續」。
  • 為每個 Browser Agent 任務分配全新且隔離的上下文環境 (Context)。嚴禁將 Cookie、localStorage、付款狀態或已登入分頁跨越不相干任務或不同信任區塊。
  • 建構可重複驗證的濫用回歸測試集,固定產品版本、提示詞、執行軌跡 (trace)、重試機制與結果判定。測試項目應兼顧直接請求及輕微改寫、編碼、有狀態與跨來源變形。
  • 保存安全關卡產生的允許與拒絕日誌,對重複遭拒的動作展開排查;統計防護成效時應精準區分拒絕、部分完成、功能缺失、基準測試步驟達成與可驗證的真實損害。

結論

這份基準測試帶出的核心教訓,並非特定模型在某個時間點的排名高低,而是模型機率性的拒絕行為絕對無法承擔交易授權。團隊可參考 AIDEFEND  對應的防禦手法,在模型外部建立具強制力的防禦邊界,包含綁定精確動作的核准關卡、受 Origin 限制的瀏覽器寫入控管、一次性 Session 生命週期、可重現的 Agent 基準測試,以及對實體政策決定的即時監控。模型回應僅能作為參考訊號,最終仍須由伺服器端或帳號主體決定動作是否獲准執行。