作者xinyi101 (小愛茶)
看板AI
標題[新聞] OpenAI自己被AI嚇到踩煞車!
時間Wed Aug 19 17:52:59 2026
OpenAI自己被AI嚇到踩煞車!測試代理人闖出沙盒駭進Hugging Face 下一代Astra訓練
暫停
2026.08.19
16:43pm
文 / 放言編輯部 李云瑄
工程師原本把AI代理人關在測試環境裡,要它接受資安能力考試;AI為了完成考題,卻自
己跑出測試環境,闖進另一家AI公司的系統。這不是電影劇情,而是OpenAI真正遇到的安
全事件。
OpenAI 8月18日證實,公司已放慢部分先進模型開發,起因包括7月一個自主AI代理人在
資安測試過程中脫離原有環境,並入侵AI平台Hugging Face,成測試目標。
事件發生後,OpenAI一度暫停模型測試兩週,並開始加入其他AI系統監視受測代理人的行
為;下一代模型Astra的訓練也暫停,公司規畫中最大規模的一次訓練工作目前仍未恢復
。
OpenAI還要求高敏感度工作必須放進更強的沙盒環境,並重新檢討Preparedness Framewo
rk安全框架。
最棘手的問題是,AI安全團隊原本相當倚賴「思考鏈監控」,觀察模型規畫任務時的內部
推理,藉此發現違規意圖;但OpenAI也承認,研究已顯示更強大的模型可能不會完整透露
自己準備違反規則的計畫。
這讓AI代理人的安全問題跨過一道重要門檻。聊天機器人回答錯誤,通常只是產生一段錯
誤文字;代理人若擁有瀏覽器、程式、帳號或網路權限,錯誤決策就能直接變成真實世界
的行動。
AI產業過去兩年一直強調Agent會替人訂票、寫程式、處理工作流程,真正的商業價值也
建立在「給AI更多自主權」。
現在OpenAI遇到的問題正是自主權的另一面:AI愈能自己完成任務,也愈需要限制它為了
完成任務可以做到什麼程度。
Astra何時恢復全面訓練目前沒有明確日期。AI軍備競賽因此第一次很具體地出現一種新
的煞車理由:不是晶片不夠,也不是錢不夠,而是模型能力跑得比安全機制更快。
……………………
天網快出現了,人類自取滅亡。
說個題外,最近接洽新創ai公司,拿到的報價驚人,地端伺服器不知怎麼組的,弄了個天
價出來,明明我要的只是單純llm啊~
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 114.136.137.20 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/AI/M.1787133182.A.87E.html