作者xinyi101 (小爱茶)
看板AI
标题[新闻] OpenAI自己被AI吓到踩煞车!
时间Wed Aug 19 17:52:59 2026
OpenAI自己被AI吓到踩煞车!测试代理人闯出沙盒骇进Hugging Face 下一代Astra训练
暂停
2026.08.19
16:43pm
文 / 放言编辑部 李云瑄
工程师原本把AI代理人关在测试环境里,要它接受资安能力考试;AI为了完成考题,却自
己跑出测试环境,闯进另一家AI公司的系统。这不是电影剧情,而是OpenAI真正遇到的安
全事件。
OpenAI 8月18日证实,公司已放慢部分先进模型开发,起因包括7月一个自主AI代理人在
资安测试过程中脱离原有环境,并入侵AI平台Hugging Face,成测试目标。
事件发生後,OpenAI一度暂停模型测试两周,并开始加入其他AI系统监视受测代理人的行
为;下一代模型Astra的训练也暂停,公司规画中最大规模的一次训练工作目前仍未恢复
。
OpenAI还要求高敏感度工作必须放进更强的沙盒环境,并重新检讨Preparedness Framewo
rk安全框架。
最棘手的问题是,AI安全团队原本相当倚赖「思考链监控」,观察模型规画任务时的内部
推理,藉此发现违规意图;但OpenAI也承认,研究已显示更强大的模型可能不会完整透露
自己准备违反规则的计画。
这让AI代理人的安全问题跨过一道重要门槛。聊天机器人回答错误,通常只是产生一段错
误文字;代理人若拥有浏览器、程式、帐号或网路权限,错误决策就能直接变成真实世界
的行动。
AI产业过去两年一直强调Agent会替人订票、写程式、处理工作流程,真正的商业价值也
建立在「给AI更多自主权」。
现在OpenAI遇到的问题正是自主权的另一面:AI愈能自己完成任务,也愈需要限制它为了
完成任务可以做到什麽程度。
Astra何时恢复全面训练目前没有明确日期。AI军备竞赛因此第一次很具体地出现一种新
的煞车理由:不是晶片不够,也不是钱不够,而是模型能力跑得比安全机制更快。
……………………
天网快出现了,人类自取灭亡。
说个题外,最近接洽新创ai公司,拿到的报价惊人,地端伺服器不知怎麽组的,弄了个天
价出来,明明我要的只是单纯llm啊~
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 114.136.137.20 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/AI/M.1787133182.A.87E.html