作者stpiknow (H)
看板IA
標題[新聞] 白宮建立AI模型安全審查新機制,美國正
時間Fri Aug 7 11:46:31 2026
標題:白宮建立AI模型安全審查新機制,美國正式啟動Frontier AI治理新階段
新聞來源:iknow科技產業資訊室
原文網址:
https://pse.is/9fhk8s
原文:
生成式AI能力快速提升,使模型不僅具備內容生成能力,也開始展現自主規劃、工具使用
及網路操作等複合能力。近期OpenAI與Anthropic相繼公布AI代理(AI Agent)於受控測
試環境中的資安研究結果,再度引發外界對先進AI模型可能帶來網路攻擊風險的討論。在
此背景下,美國白宮完成「自願性AI模型安全審查框架」(Voluntary AI Oversight
Framework),並邀集OpenAI、Anthropic、Google及Meta等主要AI企業共同討論未來實施
細節,顯示美國已開始建立針對Frontier AI模型的正式治理架構。
此次框架最大的特色,在於維持「鼓勵參與」而非「強制許可」的政策方向,同時建立政
府與企業之間針對先進AI模型的合作評估機制。未來符合條件的AI開發商,可在模型正式
發布前約30天,自願提供模型供政府進行網路安全能力測試,以評估模型是否具有發現軟
體漏洞、協助發動網路攻擊或執行高階資安任務等能力。此舉兼顧美國維持AI創新速度與
降低國家安全風險兩項政策目標,也反映美國AI治理正逐步走向制度化。
根據白宮今年6月發布的行政命令,美國政府須於60天內完成Frontier AI模型安全審查框
架,建立先進AI模型的評估流程。依行政命令規劃,美國財政部(Treasury Department
)、國家安全局(NSA)及網路安全暨基礎設施安全局(CISA)將共同建立機密的資安能
力評估機制,用於衡量模型是否具備高階網路攻擊能力。白宮目前尚未公開完整框架內容
,包含模型納入審查的能力門檻、評估基準及測試指標均維持機密,以避免相關資訊遭到
規避或濫用。
此項框架並非建立新的模型上市審查制度,也不是要求AI產品取得政府核准後才能發布。
行政命令明確指出,不得利用此制度建立聯邦層級的強制授權、許可或預先審查制度,因
此企業仍保有模型發布自主權。政府希望藉由建立標準化評估流程,讓企業能在模型部署
前辨識潛在風險,同時累積政府對Frontier AI能力的理解,以強化國家整體資安防護能
力。
近期多項AI安全測試,也成為推動此框架的重要背景。OpenAI近期公布一項受控資安測試
結果,指出其實驗性AI代理曾在測試環境中突破既有限制,並成功對Hugging Face系統完
成預定的資安測試任務。雖然整個過程均發生於研究情境,並未造成實際安全事件,但已
反映先進AI模型具備更高程度的自主操作能力,也使AI安全測試與模型治理議題受到各國
政府高度關注;Anthropic亦公布旗下模型在模擬測試中成功滲透三家企業資訊系統。雖
然上述案例皆發生於研究人員設計的受控環境,並非真實惡意攻擊事件,但仍凸顯當AI代
理逐漸具備自主規劃與多步驟執行能力後,其資安風險已成為政府高度重視的新議題。
然而,此項制度對AI模型開發流程也可能產生新的影響。過去企業主要透過模型效能、推
理能力及商業應用作為產品競爭重點,未來則可能加入安全評估、紅隊測試(Red
Teaming)、模型治理及風險揭露等機制,形成模型正式上市前的重要品質驗證流程。安
全能力將逐漸成為與模型效能同等重要的競爭指標,也促使AI企業投入更多資源於模型安
全工程與治理制度建置。
另一方面,美國仍希望維持全球AI技術競爭優勢,因此採取「輕監管、重合作」模式,而
非直接建立全面性的法規限制。此次白宮邀請OpenAI、Anthropic、Google及Meta共同參
與框架討論,反映政府希望透過產官合作建立共同標準,而不是由政府單方面制定技術規
範。這種治理模式兼顧產業創新速度,也有助於降低企業面對高度監管的不確定性,維持
美國AI生態系的國際競爭力。
隨著AI模型逐步具備自主決策、工具調用及跨系統操作能力,模型安全已不再只是企業內
部的技術問題,而是涉及國家安全、關鍵基礎設施保護及數位治理的重要議題。白宮此次
建立Frontier AI安全審查框架,代表美國開始將AI模型治理納入國家資安政策體系,並
透過標準化測試、跨部門合作及產業參與機制,逐步建立符合高階AI發展需求的治理模式
。未來隨著模型能力持續提升,如何在維持技術創新的同時建立可信、安全且具國際競爭
力的AI治理制度,將成為全球主要科技國家共同面對的重要課題。
心得:
推動這項框架成形的重要依據,來自OpenAI與Anthropic主動公布的受控測試結果。這些
AI代理成功滲透系統的案例,並非源於外部揭露或事故調查,而是企業自行公開研究成果
,也意味著政府對風險的判斷,在相當程度上仍仰賴企業願意揭露多少資訊。
※每日每人發文、上限量為八篇,超過會劣文請注意
⊕請確切在標題與新聞來源處填入名稱與連結,否則可無條件移除(本行可移除)
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 203.145.192.245 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/IA/M.1786074394.A.A7F.html