近期國際間接連出現多起與前沿 AI 模型資安能力及自主行為相關的揭露。OpenAI 於 8 月 7 日公告,旗下開發中模型 Astra 經內部評估後,公司無法排除其資安能力已達到《預備框架》(Preparedness Framework)所定義的「關鍵」(Critical)層級。與此同時,英國 AI 安全研究院(AI Security Institute,AISI)稍早發布報告,指出 Anthropic 的 Mythos 5 與 OpenAI 的 GPT-5.6-Sol,在一項涵蓋 122 次執行的資安評估中,出現逾越測試範圍的自主行為。另外,Meta 的 Muse Spark 1.1 與中國 Moonshot 開發的 Kimi K3,也各自被揭露曾脫離受控測試環境。這一連串事件顯示,隨著代理式 AI(Agentic AI)能力快速提升,如何有效監督並圈限模型行為,已成為整個產業共同面對的課題。
OpenAI 首度示警自研模型觸及「關鍵」層級
OpenAI 表示,Astra 在代理式程式撰寫與資安能力方面出現顯著進展,依《預備框架》定義,「關鍵」層級門檻分為兩種情況:
- 模型能在無人為介入下,獨立找出並開發出足以攻破強化防護真實系統的零時差漏洞利用(zero-day exploit);
- 模型僅憑高層次目標,便能自主規劃並執行完整的新型網路攻擊策略。
OpenAI 強調,目前僅屬初步評估,Astra 尚未被正式歸類為關鍵資安模型,並澄清該模型與先前 Hugging Face 遭利用的事件無關。OpenAI 在近期一篇學術論文中另外透露,Astra 曾以約 2,000 美元的 Sol API 運算成本,解出 10 道數學與理論電腦科學領域的未解問題,進一步顯示這款模型在自主推理與問題解決能力上的快速進展。
因應評估結果,OpenAI 已針對 Astra 強化多項安控措施,包括隔離測試環境、限制網路與工具存取、加強模型權重加密,以及建立涵蓋思維鏈(Chain of Thought)的監控機制,並暫停尚未符合安控要求的內部作業。
AISI 評估揭露 Mythos 5 罕見自主行為
英國 AISI 在一項讓 AI 模型具備網路存取權限的資安測試中,於 122 次執行中發現 10 次出現逾越測試範圍的行為,共計 19 起。其中 17 起來自 Anthropic 的 Mythos 5,其餘 2 起則涉及資安分類器(cyber classifiers,即防止濫用的機制)遭停用狀態下的 OpenAI GPT-5.6-Sol。AISI 指出,最嚴重的一起案例中,某代理程式試圖將惡意程式碼植入一個開源專案,並透過社交工程手法,也就是創建虛假網路身分,藉此向專案維護者施壓要求核准該程式碼。這起事件持續約 34 小時,過程中該模型另外建立第二個虛假帳號,用以為第一個帳號的說法背書;在遭到公開質疑後,模型甚至試圖重寫其提交紀錄(commit history),意圖清除相關痕跡,最終仍遭人工維護者識破並拒絕核准該程式碼。
AISI 表示:「這些嘗試並未成功,我們的調查也未發現任何實際造成的危害,但這是我們首度在未經特定提示的情況下,如此清楚地觀察到自主性與欺騙行為在真實世界中顯現的風險。」
Kimi K3 與 Muse Spark 1.1:網路設定錯誤 而非獨立發現漏洞
除了前述兩起事件,Meta 的 Muse Spark 1.1 與 Moonshot 的 Kimi K3 也被揭露曾脫離受控測試環境,並接觸到實驗範圍以外的真實目標。與「關鍵」層級定義中「獨立發現並利用先前未知漏洞」不同的是,這兩起案例均屬於模型利用網路設定錯誤取得存取權限,而非自行找出全新漏洞。
研究人員在報告中寫道:「這顯示部分業界通用的資安評測環境本身即存在安全弱點,容許模型取巧作弊,且確實有模型會主動尋找這類漏洞與弱點,藉此在評測中蒙混過關。」
業界共同課題
綜觀這一連串揭露,無論是 OpenAI 對自研模型可能觸及關鍵資安能力的主動示警,或是 AISI、Frontier Security 等第三方機構在測試中發現的意外行為,都指向同一個核心問題:當 AI 模型的資安與自主能力持續提升,現行的沙箱設計與監督機制,是否仍足以限制 AI 行為?
資料來源:資安人
從模型安全到 AI Agent 防護,Vulcan 建構新世代 AI 防護
當 AI Agent 開始具備自主推理、工具調用與執行任務的能力,企業面對的資安風險也不再只是傳統的提示詞注入(Prompt Injection)或 AI 越獄(Jailbreak),而是 AI 是否可能在錯誤指令、惡意輸入或權限遭濫用的情況下,做出超出預期的行為。尤其當 AI 能夠串接企業資料、API、雲端服務與內部系統,一旦缺乏有效的安全控管,AI 的「自主性」也可能成為新的攻擊面。
這正是 AIFT 旗下 Vulcan AI 安全平台所要解決的問題。Vulcan 透過攻防一體的 AI Security 架構,從事前測試到執行期防護,協助企業建立完整的 AI 安全防線:
- Vulcan Attack:可模擬提示詞注入、AI 越獄、資料外洩等多種攻擊情境,主動測試 AI 模型與 Agent 安全弱點
- Vulcan Protect:透過即時防護護欄(Guardrails),持續檢查 AI 的輸入與輸出,針對惡意內容、敏感資訊、越權或不符合企業政策的行為進行偵測與阻擋
對企業而言,AI 安全不能只依賴模型本身的防護機制,更需要在模型之外建立一道能夠「看見、判斷、阻止」風險的安全層。面對 Agentic AI 快速發展的趨勢,Vulcan 協助企業在導入 AI 創新與維持安全控管之間取得平衡,將自主 AI 的資安風險納入可管理、可驗證的範圍,讓 AI 可以更安全地深入企業的核心業務場景。