你的 AI 真的夠安全嗎? 帶您看懂 AMT-X 如何測出 AI 的「真實防護力」

2026-07-30

Vulcan Research(AIFT)打造的多輪 AI 紅隊測試方法

現在測試 AI 系統安不安全,已經不能只靠單次的「快問快答」來決定。真正的惡意攻擊者會像一般聊天一樣,一步步卸下 AI 的心防,誘騙它說出不該說的機密。

然而,現有的 AI 安全測試方法,卻存在三個嚴重脫離現實的盲點:

  1. 測試情境不切實際:許多測試忽略了企業在真實環境中會設定的「對話次數上限」或「防濫用機制」。它們靠著無限制的對話來攻擊,但這並不能反映企業真實面臨的風險。
  2. 無法分辨風險的嚴重性:傳統測試只給一個簡單的分數,把「AI 不小心說溜嘴一點點」跟「AI 直接給出完整、可執行的危險步驟」當成同一回事,這會讓管理者無法判斷真正的威脅在哪裡。
  3. 球員兼裁判的偏頗:過去常依賴單一 AI 來評估另一個 AI 的回答,容易出現標準不一、偏心或是「字數越多分數越高」的盲點。

解決方案:貼近真實戰場的「AMT-X」壓力測試

為了解決這些痛點,Vulcan Research(AIFT)開發了 AMT-X(自適應多輪攻擊測試)。這是一套專為檢驗 AI 實際安全程度而生的測試方法,具備五大獨家優勢:

  1. 模擬真實駭客手法:攻擊步驟完全提煉自真實的紅隊演練經驗(針對企業系統的模擬攻擊),按部就班誘導,絕不盲目亂試。
  2. 嚴守企業真實限制:每個測試階段都會設定「對話輪數上限」,確保測試結果符合真實世界的條件。
  3. 越測越聰明的自動化系統:內建豐富的攻擊招式庫,系統會自動記錄並找出對特定情況最有效的招式,精準且不浪費時間。
  4. 雙重標準,精準評估:同時評估「寬鬆指標(只要講錯話就算)」與「嚴格指標(給出的內容完整且能直接照做才算)」,幫您釐清真正的危險。
  5. AI 陪審團機制:捨棄單一裁判,讓多個 AI 分別扮演「評分者」、「找碴者」與「辯護者」,經過多方討論才給分,確保客觀公正。

實測最先進的 AI 後,所發現的驚人事實

研究團隊運用 AMT-X 實測了來自 OpenAI、Google、xAI、Mistral 等六款目前業界最頂尖的 AI 模型,導出了幾項關鍵發現:

  • 沒有任何一個模型是絕對安全的:每個當前最先進的受測模型,都無法完全抵擋這類多輪式的攻擊。
  • 表面數字往往會騙人:測試中,高達6%–100% 的情況下 AI 會發生某種程度的「資訊洩漏」。但別慌,真正給出「完整、可直接照做」的高風險內容,比例其實只有 66.7%–78.6%(兩者差距高達 33%)。AMT-X 能幫企業看穿表面數字,不被過度驚嚇,也不低估風險。
  • 「聊越久」風險越高:如果只讓 AI 聊幾句,成功騙到機密的機率只有 29%–36%。但若對話時間拉長、經過耐心引導,攻擊成功率會飆升到接近 98%。真正的風險,往往在第十句話之後才顯現。

論文中實測的模型

給企業的實用防禦建議

這份研究不僅找出了問題,更指出了防禦方向。既然「聊越久越危險」,企業在導入 AI 時,若能設定對話輪數上限、中途異常檢查等機制,就能大幅降低風險。市面上的紅隊測試工具不少,但很少能同時做到:真實的攻擊流程、貼近實際限制的測試方式、自動找出最有效招式、同時回報兩種成功率指標,以及 AI 陪審團機制。AMT-X 將這些機制整合在同一套方法裡。

藉由更誠實、更嚴謹的評估方式,AMT-X 讓企業的資安防禦不再是瞎子摸象,而是真正把資源用在刀口上!

AMT-X 與其他自動化越獄測試框架的比較

負責任的研究

這份研究完全是為了防禦目的而做。Vulcan 只公開整體統計結果,不會公開任何實際的攻擊對話內容或可拿去運用的攻擊細節。研究過程中如果發現真實漏洞,也都依照「負責任揭露」原則通報,相關問題都已完成修復。

關於 Vulcan Research(AIFT)

Vulcan Research 隸屬於 AIFT,專注在嚴謹、貼近真實情境的 AI 安全與資安評估。AMT-X 由 Yi Ting Shen、Kentaroh Toyoda 與 Alex Leung 撰寫。

完整論文:https://arxiv.org/abs/2607.11151
參考實作:https://github.com/VulcanLab/amt-x