Linux Foundation 針對Shared AI Findings Exchange(SAFE)指引發佈徵求意見書,旨在將代理型 AI 資安事件轉化為更完善的防護機制
開放安全 AI 聯盟(Open Secure AI Alliance)的成員規模如今已超過 120 個組織。隨著年度 Black Hat 大會在拉斯維加斯登場,聯盟成員正著手制定全新指引,以強化代理型人工智慧(AI)的資安防護。
Linux Foundation 針對 Shared AI Findings Exchange(SAFE)指引發佈徵求意見書。這套研擬中的指引旨在將代理型 AI 資安事件轉化為整個生態系共享的防護機制。
SAFE 指引目前正由開放安全 AI 聯盟的工作小組起草。NVIDIA、思科、CrowdStrike、Hugging Face 與 Red Hat 等聯盟成員正與 Linux Foundation 合作,為初步提案貢獻心力。
SAFE 指引包含多項提議,包括以保密方式蒐集及分析 AI 事件與未遂事件、通知受影響對象、辨識反覆出現的控制失效,並發布以證據為基礎、可降低系統性風險的實務運作建議。
資安是一場沒有終點的競賽。每一次重大技術轉型,都會帶來新的潛在攻擊面。防禦人員現在必須以代理的速度迅速回應,保護基礎設施與智慧財產,而攜手合作正是實現這項目標的最佳方式。當可信賴的生態系公開分享威脅情報時,集體防禦便能發揮綜效。
開放安全 AI 聯盟為 AI 資安提供更多工具
SAFE 框架延續開放安全 AI 聯盟成員的技術貢獻,展現各方共同承諾:打造並分享橫跨完整 AI 安全堆疊、開放且可檢視的工具。
AI 代理不只是一個模型,而是一套由身分控制、harness、防護機制、記錄與評估構成的系統。若要確保其安全,不能只仰賴漏洞掃描。
安全防護向來需仰賴層層設防,以及社群分享所知資訊的意願。當防禦人員能夠公開且迅速地相互學習,最棘手的問題才更有機會迎刃而解。
NVIDIA 全端開放資安軟體與模型
NVIDIA 的貢獻涵蓋整個技術堆疊,首先是 GitHub 上的 NVIDIA Labs Object-Oriented Agent(NOOA)研究 harness,讓代理的行為更容易進行測試、追蹤、稽核與管控。
NVIDIA OpenShell 執行階段會限制代理所能查看、存取與執行的內容,並在代理層級落實安全與隱私控制,確保代理無法觸及不應存取的資源。
NVIDIA 的系列開放模型包括用於代理型 AI 的 NVIDIA Nemotron、用於物理 AI 的 NVIDIA Cosmos、用於機器人的 NVIDIA Isaac GR00T、用於醫療保健與生命科學的 NVIDIA BioNeMo,以及全球規模最大、可授權商業使用的自駕車模型 NVIDIA Alpamayo。這些模型均提供開放權重、資料集與訓練技術。
NVIDIA 開源且經過驗證的代理技能,則將這份信任延伸至能力層級。
每項技能皆提供可轉移的指令集,這些指令集已經過分類編目、針對提示詞注入(prompt injection)與工具投毒(tools poisoning)等風險進行掃描檢測、採用密碼學方式簽署,且附有技能卡說明。防禦人員可以清楚掌握代理技能的功能、來源,以及發布後是否曾遭修改。
NeMo Guardrails、NeMo Anonymizer 與 NeMo Safe Synthesizer 可協助落實安全政策、保護機敏資料,並產生符合隱私保護標準的合成資料。
此外,NVIDIA 的開源大型語言模型漏洞掃描器 Garak,可讓資安團隊在模型發布前,檢查其是否存在資料外洩、提示詞注入與越獄情境。
聯盟成員擴展開放生態系開發工具
開放安全 AI 聯盟的其他成員也持續投入完整防禦堆疊的建置,涵蓋身分與權限、harness、執行階段防護機制、安全 AI 模型、可觀測性與評估、資料安全與隱私、可用性與韌性等領域。
以下列出堆疊各層級的部分最新貢獻,後續將持續增加。
身分與權限:誰能採取行動
無法識別,就無從保護。
Okta 正開發代理身分與存取的參考實作,展示開放協定 Cross App Access(XAA)如何讓在 OpenShell 沙盒環境中運作的 AI 代理,安全地連接至企業應用程式。
Palo Alto Networks 已貢獻新一代身分安全平台 Idira 的開源工具,包括 Agent Guard 與 Agent Watch。這些工具可協助開發人員與代理建置者採用身分安全最佳實務,並落實安全擷取代理型工作流程所需的機密資訊等防護措施。
由 Red Hat 打造的全新開源專案 asago,可將組織自行制定的治理要求,例如 NIST、OWASP 與 《歐盟人工智慧法案(EU AI Act)》中所提及的規範,直接對應至代理在執行階段獲准採取的行動,並從政策條款到實際控制措施建立單一稽核軌跡。
Harness 與工具:如何協調安全工作
AI 代理不僅僅是一個模型,而是會運用開放與封閉模型、harness、工具及執行階段,藉此完成各項任務。
若將模型比作代理的大腦,harness 就是透過工具採取行動的身體。模型周圍的 harness 如同協調器,決定代理如何部署、協同運作與受到限制。
聯盟成員正為 AI 安全堆疊中這個新興層級,貢獻工具、harness 與支援技術。
Amazon 正式成為開放安全 AI 聯盟最新成員之一,並貢獻 Strands Agents。這是一套用於建置 AI 代理的開源工具組,其各層級皆採開放設計,讓開發人員能完整掌握代理行為,並在生產環境中評估代理型系統。Amazon 同時貢獻開源授權語言 Cedar,為 AI 代理獲准採取的行動設定具確定性且可驗證的界線,提供細緻且可分析的存取控制,協助確保只有經授權的操作能觸及企業資源。
Capital One 已將用於代理型 AI 程式碼安全的 VulnHunter 開源。
Cloudflare 將其 Vulnerability Discovery Harness 以開源技能形式提供,為代理系統增添安全防護。
微軟 AI 紅隊(Microsoft AI Red Team)已將多項工具與 harness 開源。其中,PyRIT(Python Risk Identification Toolkit)讓 AI 紅隊成員得以運用其內建記憶功能來執行自動化紅隊測試,並支援常見目標與客製化的端點。
RAMPART 可將紅隊測試結果與實際事件轉換為可重複執行的測試,並隨軟體變更持續運作。Clarity 可協助團隊在撰寫程式碼之前,先檢視設計假設,並辨識潛在故障。
微軟也已將 Assert 開源,該工具能將自然語言要求及預期的 AI 安全與資安行為,轉換為可執行的評估。
Atlas 是 Wiz 的自主漏洞研究引擎,可協調專用的 AI 代理,在程式碼與開源套件中發現並驗證安全漏洞。
Visa 也已加入開放安全 AI 聯盟,並貢獻其開源的 Visa Vulnerability Agentic Harness,協助團隊快速且安全地識別問題,支援修復與驗證。
模型:為 AI 安全與防禦打造的智慧
並非每項安全或防護任務都需要通用模型。專用的安全與防護模型是為防禦而打造,經過訓練以理解程式碼、找出漏洞,並大規模針對威脅進行推理。這些模型可作為模型系統來支援代理型工作流程,讓開放式與封閉式模型協同運作,以高效完成任務。
思科的 DefenseClaw 是建置於 NVIDIA OpenShell 之上的開源代理型治理層,可在擴展代理型工作團隊時,於執行階段提供強大且自動化的安全防護。思科也發布兩款 Antares 資安小型語言模型,用以協助精準定位程式碼資料庫中已知漏洞的位置。思科另推出 Project CodeGuard,將安全預設實務直接嵌入 AI 程式設計工作流程。
CrowdStrike 正針對資安防禦微調 NVIDIA Nemotron Nano 模型。內部測試顯示,該模型在Falcon LogScale 內產生調查查詢的準確度達 96%,並提供能提升代理調查效率的自然語言介面。CrowdStrike 也同步發布研究,說明專用的 NVIDIA Nemotron Nano 推理模型在安全營運中心(SOC)的偵測分流作業中,表現優於規模大得多的模型,同時導入經校準、以 logit 函數為基礎的信賴度機制,實現可量化、可調整且可稽核的自主安全決策。
Mistral 發布全新多模態安全分類器模型 Shieldstral,並以 Apache 2.0 授權條款開放模型權重。
瞭解代理做了什麼,只是整體情況的一部分。防禦人員還需要掌握代理為何採取行動、系統是否安全運作,以及真實世界中的攻擊手法如何演變。
Akamai 結合其 State of the Internet 報告與 Security Intelligence Group 研究的洞察,運用真實世界資料闡明AI 時代的威脅,並解析新興攻擊手法的運作機制,讓防禦人員得以學習、調整並回應。Cognition 則已發布可信度評估報告,用以衡量衍生自開源模型的模型在一致性與安全風險方面的表現。評估結果顯示,這些風險可透過後訓練加以緩解。
Numbat 是 Perplexity 針對用戶端端點推出的開源代理安全套件,可在 macOS、Linux 與 Windows 上偵測、調查及阻止代理活動,讓防禦人員取得代理實際行為的結構化記錄。
Uber 已將 ADR(Agentic AI Detection and Response)的關鍵元件開源。ADR 是一套用於生產環境的系統,可重建 AI 代理活動的完整因果鏈,從提示詞到推理、工具呼叫與結果,以協助資安團隊偵測威脅。目前 ADR 每日可支援超過 20 萬個代理工作階段,涵蓋 3 萬個端點,並採用雙層分析方法,將高效偵測與針對高可信度威脅的深入調查相結合。
可用性與韌性:關鍵時刻的快速復原
代理系統必須在中斷發生時維持可靠運作、將故障限制在可控範圍,並安全復原,同時避免遺失關鍵狀態或讓更大範圍的環境暴露於風險之中。
LangChain 正為其開源框架 Deep Agents、LangGraph 與 LangChain 加入韌性功能,讓代理能夠重新嘗試遭遇中斷的工作、依循安全的復原路徑、從已儲存的狀態繼續執行而非從頭開始,並在主要模型失效時自動改用替代模型。
Veeam 透過 Kanister 等技術,協助組織確保 AI 背後的資料與基礎設施具備韌性且可復原。Kanister 是 Veeam 專為 Kubernetes 資料保護所設計的開源框架,可協助團隊保護並復原 AI 工作負載、向量資料庫與資料,使其回復至經驗證的已知良好狀態。
更多貢獻將陸續發表。當成員發布可重複使用的緩解措施時,整個生態系的防禦人員便能加以檢視、調整與改善,協助安全實務隨著 AI 的發展持續演進。
了解更多資訊,或表達加入開放安全 AI 聯盟的意願。
