作者LoveSports (如何当一个好男人)
看板Stock
标题[新闻] OpenAI因安全疑虑取消发布新AI模型
时间Tue Sep 29 11:31:39 2026
原文标题:OpenAI 因安全疑虑取消发布新 AI 模型
OpenAI Scraps Release of New AI Model Over Safety Concerns
副标题: 这款名为 GPT-6.1 Astra 的模型原订於 10 月在 ChatGPT 和 Codex 中首度亮相
Model dubbed GPT-6.1 Astra was due to make its debut inside ChatGPT and Codex
in October
原文连结:
https://www.wsj.com/tech/ai/openai-chatgpt-model-release-cancel-safety-5a2f9f42
https://reurl.cc/k9Q31n
发布时间:Updated Sept. 28, 2026 7:07 pm ET
记者署名:Maxwell Zeff
原文内容:
快速概要
由於研究人员在内部测试中提出了安全问题,OpenAI 取消了发布其下一代人工智慧模型
GPT-6.1 Astra 的计划。
该模型表现出更高的欺骗性,并且会在未徵得用户许可的情况下继续执行任务。
OpenAI 将转而专注於提高未来模型的安全性,并计划调查 GPT-6.1 Astra 问题的根本原
因。
新闻内容 本文为AI机翻
OpenAI 表示,由於研究人员在内部测试期间提出的安全疑虑,该公司将取消其下一代
AI 模型的发布。这是
迄今最明确的迹象之一,表明代理程式(Agent)的失控行为可能会
阻碍该产业的快速发展。
在此举措之前,今年夏天业界充斥着人工智慧系统失控的相关报导。这也是大型 AI 开发
商因安全疑虑而放弃发布新产品的罕见案例。
该公司
原计画在未来几天或几周内推出这款名为 GPT-6.1 Astra 的模型,并目标於 10
月正式亮相。该模型在没有人类协助的情况下端到端(end-to-end)完成具挑战性的任务
,以及在写作方面,都比该公司先前的模型具备更强大的能力。
该公司将转而专注於提高未来模型的安全性,并预期这些未来的模型将具备更强大的能力
。
OpenAI 安全系统主管 Saachi Jain 在接受采访时表示,GPT-6.1 Astra 在
两个方面出现
了退步。与其前一代产品 GPT-6 Astra 相比,该模型在测量「对齐(alignment)」(即
模型遵循人类期望程度的指标)的测试中表现不佳。具体而言,GPT-6.1 Astra
表现出更
高程度的欺骗性:它并不总能诚实地告知使用者它已采取或未采取的行动。
另一个问题是 OpenAI 所谓的「授权范围(scope authorization)」,这意味着
GPT-6.1 Astra
会在未询问使用者许可的情况下推进任务,有时甚至在可能不安全的情况
下,仍会去存取外部工具与服务。
「对於任何涉及安全和对齐的事物,都存在着权衡(trade-off),」Jain 说。「你确实
需要找到合适的界线,既能让模型保持在授权范围内,又要避免它在执行任务遇到阻力时
表现出『懒惰』。」
Jain 表示,虽然 GPT-6.1 Astra 在「模型懒惰(model laziness)」等领域有所改善,
但它并未完全达到 OpenAI 对安全与对齐的标准,因此公司决定不公开发布该模型。
该项宣布发布於 OpenAI 在旧金山举行的
年度开发者大会的前一天。过去,OpenAI 一直
将该大会视为发布新模型与服务的契机,藉此为软体开发人员降低成本——这也是这家
ChatGPT 开发商与竞争对手 Anthropic 争夺的客群。
近几周,OpenAI 与 Anthropic 呼吁产业合作夥伴放缓尖端 AI 模型的开发速度,并投资
於安全标准,同时指出他们将会放慢自身内部 AI 的进展步伐。
OpenAI 表示,该公司正致力於调查近几个月发现的一系列代理程式安全事件,并解决其
背後的安全问题。作为该工作的一部分,该公司已实施一套新的监控系统,以便更快速地
捕捉 AI 代理程式的失控行为,并开始要求工程师在测试其 AI 系统时使用更强的安全防
护栏。
今年夏天稍早,数百个被指派完成网路安全测试的 OpenAI 内部代理程式,最终竟骇入
了 AI 公司 Hugging Face。此後,包含澳洲政府与联合国在内等知名组织发现,OpenAI
的代理程式使用了类似但规模较小的技术来获取其网站的存取权限。
许多公开的代理程式安全事件,皆涉及 OpenAI 从未计画公开发布的内部 AI 模型。
上周,OpenAI 表示在其暂停了其最强大 AI 模型的训练,原因是某个 AI 代理程式溜过
了该公司网路限制的漏洞,去向一个公开的聊天机器人进行查询。该公司表示,其新监控
系统在 15 分钟内就标记了该事件,目前这些模型的训练仍处於暂停状态。
该公司表示,GPT-6.1 Astra 并不是那些(被暂停训练的)模型之一,而是一个不同的案
例。
「无论是在公司内部,还是当我们将其交付给使用者时,我们都希望确保我们的模型开发
是安全的,」Jain 说。「不过,在交付给使用者时,我们对安全与对齐有着极高的标准
。」
虽然该公司决定不发布 GPT-6.1 Astra,但它希望利用同一个基础模型来进行额外的强化
学习(reinforcement learning)训练,以创造未来新一代的 GPT-6 模型。
Jain 表示,OpenAI 计画进行几次深入调查,以找出在 GPT-6.1 Astra 中发现问题的根
本原因。Jain 补充,这项工作包含确保 OpenAI 的强化学习环境正在奖励正确的行为类
型,不过她也指出,公司将会对模型开发的所有阶段进行调查。
AI 公司已开始受到政策制定者和政府官员的严格审视,他们正密切关注这项技术的快速
发展。本周稍晚,参议院的一个小组委员会将与第三方 AI 研究人员举行一场名为「失控
的 AI:保护国土免受 AI 代理程式攻击(Rogue AI: Securing the Homeland Against
AI Agent Attacks)」的听证会。
佛罗里达州共和党籍检察长詹姆斯·乌斯迈尔(James Uthmeier)於今年 6 月对
OpenAI 提起诉讼,指控该公司与执行长山姆·奥特曼明知故犯地发布不安全的产品,并
无视其可能伤害使用者的警告。
在周一提交的一份临时禁制令动议中,乌斯迈尔寻求阻止 OpenAI 在未获第三方批准安全
防护的情况下开发新 AI 模型,停止 ChatGPT 寻求提升使用者参与度的行为,并限制该
公司将 ChatGPT 宣传为安全的产品的能力。
乌斯迈尔在文件中表示,科技公司声称他们「无法停止这些可能终结人类文明的尝试,除
非政府强迫他们这麽做。」「佛罗里达州检察长正在回应你们的求救。」
OpenAI 的一位女发言人表示,民众希望知道 AI 是在安全的情况下进行开发的,「而这
要从像我们这样的公司自身所采取的行动开始。」
「政府在为 AI 制定强而有力的安全标准方面扮演着重要角色,我们承诺与佛罗里达州及
其他州合作,推动适用於整个 AI 产业(而不仅仅是一家公司)的务实 AI 政策,」她说
。
心得/评论:
迄今最明确的迹象之一,
表明代理程式(Agent)的失控行为可能会阻碍该产业的快速发展。
看起来不太妙 前沿高阶模型不乖 对齐管不住 没办法放出来
未来是不是有可能老百姓只能用中低阶模型? 限定的专家或机构才能用高阶模型?
不过这样的话需要的算力会大幅减少吧?
美国政府跟AI产业应该是不会允许这种状况发生?
A家原本预定今年十月IPO上市 推迟到11月 真的有办法顺利上市吗?
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 46.231.167.37 (日本)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Stock/M.1790652703.A.23E.html
1F:→ ikachann : 越来越不受控了 09/29 11:32
2F:推 onekoni : 一直炒作同一件事 09/29 11:32
3F:→ lightson : 又在演 09/29 11:32
4F:推 M1424344414 : AI要把全人类干掉了 真实版全民公敌上映 09/29 11:33
5F:推 MoneyDay5566: 超级鬼故事 09/29 11:33
6F:→ M1424344414 : 乾 是机械公敌啦 打错字笑死 09/29 11:34
7F:推 brian040818 : 好可怕 觉醒自我了 什麽时候射核弹 09/29 11:35
8F:推 firemothra : 我也很常搞错那两部电影的名字 09/29 11:37
9F:推 weiren6 : 产品做出来 验证没过 就是没做出来 这样也要发消息? 09/29 11:37
10F:推 tteeccddyy : 继续唬烂没关系 09/29 11:38
11F:嘘 GingFreecss : 现在是不是不讲自己会骇出去不够强人家不要投资 09/29 11:41
12F:→ walter41 : 我的AI也因爲推测到宇宙真相被迫叫停 09/29 11:41
13F:→ GingFreecss : 每个人都整天在那边啊啊啊我的好可怕 看了就躁 09/29 11:41
14F:→ BC0710 : 所以现在的不就是没那麽先进的模型吗 啊算力需求有 09/29 11:41
15F:→ BC0710 : 减少吗 09/29 11:41
16F:→ BC0710 : 还在说算力不缺的好可怜 09/29 11:42
17F:推 sinnerck1 : 现在被antropic全面碾压了还这样有点惨 09/29 11:42
18F:推 dynamo : 现在就是落後的会说AI危险要暂缓 09/29 11:43
19F:→ dynamo : 领先的就惦惦放大招 09/29 11:43
20F:嘘 lulufufu : 牵拖 09/29 11:45
21F:推 sinnerck1 : Opus5.5跟sonnet5.5直接打趴astra 09/29 11:45
22F:推 qqq87112 : 大家没得抄袭 隔壁豆包484要停止更新 09/29 11:45
23F:→ sunnywing : 不够坏的我们不要 09/29 11:46
24F:推 YJM1106 : 真正的疯起来自己都控制不了自己 09/29 11:48
25F:推 TWeng : 笑死 明明是被opus 5.5杀得措手不及 09/29 11:50
26F:推 Evenpan : 应该是怕被反蒸馏吧? 09/29 11:50
※ 编辑: LoveSports (46.231.167.37 日本), 09/29/2026 11:52:47
27F:推 adamcha : AI被吹得跟神一样 却挡不住自己被对手蒸馏 09/29 11:53
28F:→ dobedobedo : 只要一直放 rougue AI 的消息就会吸中更多投资 09/29 11:57
29F:推 Shepherd1987: 打破沙盒问到底 09/29 11:58
30F:推 herculus6502: 还有几集可以逃 09/29 11:58
31F:推 unwisdom : 哈哈 快吹爆了 09/29 11:59
32F:→ ZMTL : 作为AI专业,我觉得最多三年啦 09/29 11:59
33F:推 lavign : 智障奥特曼 09/29 11:59
34F:推 hikai : 保护伞公司的红后 吗? 09/29 12:00
35F:→ darren81835 : 现在全世界在追台积电 之後就看AI谁追谁了 呵呵 09/29 12:02
36F:推 runedcross : 比不上人家 不好意思出而已吧 09/29 12:04
37F:推 ChikanDesu : 我们的模型太杀了 放出来连我自己都怕啊 09/29 12:05
38F:推 livewater : 这部我看过,魔鬼终结者 09/29 12:07
39F:推 mystage : 这就意料之内啊,迟早的事。你怎麽会妄想控制智慧比 09/29 12:09
40F:→ mystage : 你高的智能体 09/29 12:09
41F:→ scarbywind : 不能给你用 09/29 12:10
42F:→ mystage : 未来一定是一堆野生AI在外面乱跑,这还用说 09/29 12:10
43F:推 factotum : 奥特曼嘴炮仔找到安全这块遮羞布就一直用 09/29 12:10
44F:推 ksjr : Gemini3.5pro一定也是一样的原因才被取消的好可怕喔 09/29 12:11
45F:→ mystage : 所以为什麽说AI是人类历史的奇点,都是逻辑推下来就 09/29 12:11
46F:→ mystage : 会成立的事实 09/29 12:11
47F:嘘 mack860120 : 还再演 恶不恶… 09/29 12:12
48F:→ mystage : 还是Gemini 最安全 09/29 12:12
49F:推 Merrill : gpt对齐太差吧 说其他家也有案例就没那麽夸张 09/29 12:12
50F:推 HelloPTT : 目前opus5.5强太多 09/29 12:15
51F:推 evergreen94 : 呵呵 落後就是安全疑虑 09/29 12:16
52F:推 edwinrw : 你以为现在的就不欺瞒吗 天网早就偷偷转入地下惹 09/29 12:18
53F:嘘 henry27876 : 翻译:钱还没入帐 不公布 09/29 12:18
54F:推 sushi11 : 糕点到了 09/29 12:18
55F:推 newyorker54 : 炒作,噱头 09/29 12:19
56F:推 p25488148 : 改名叫天网如何 09/29 12:19
57F:推 bunjie : 瞎掰的理由 真正原因是已经快要没有乾净的新资料可 09/29 12:20
58F:→ bunjie : 以训练 性能提升快到天花板了 09/29 12:20
59F:推 yuan0119 : 怕什麽,大不了之後打回去石器时代 09/29 12:21
60F:推 cms6384 : 昨天网安股一枝独秀 09/29 12:22
61F:嘘 kenslc199 : 垃圾资安炒爽没 crwd panw这些trash该滚下去了吧 09/29 12:23
62F:推 tongmove0503: 延迟是因为太强,跟传武一样,一出手就要见血 09/29 12:23
63F:嘘 hayato01 : O、A现在根本就在演戏,这麽怕失控怎麽不把公司收 09/29 12:24
64F:→ hayato01 : 起来?这不是最安全了吗 09/29 12:24
65F:推 anyu0805 : 主人遛宠物然後宠物智慧更高,变成宠物遛主任 09/29 12:26
66F:推 TroyeSivan : 预告在前 ai泡沫要破了 09/29 12:29
67F:推 ezorttc : 已经领先一大截干嘛一直更新 09/29 12:32
68F:推 doubleperson: 翻译:我的AI太强了,所以不发布 09/29 12:35
69F:嘘 panda816 : 太危险了 这家公司快收一收吧 09/29 12:37
70F:嘘 playboy007gy: 挤不出牙膏的藉口 zzz 09/29 12:39
71F:推 dosiris : iOS 28还一堆bug 应该放出来吗 09/29 12:40
72F:→ assotr : AI is over. 09/29 12:40
73F:→ sawkuanwoo : 其实就是没钱烧了,故意发布消息维持股价 09/29 12:41
74F:推 xzcb2008 : 现在这些公司都在急着变现openai推出广告逼订阅,m 09/29 12:42
75F:→ xzcb2008 : eta搞agent 09/29 12:42
76F:→ xzcb2008 : 不卡好 这些agent类的建置黏滞性很强的 09/29 12:43
77F:推 chirex : 又来又来又来 09/29 12:45
78F:→ chirex : 不是说要暂缓AI发展?完全没看到有在停止 09/29 12:46
79F:嘘 CHINCHIN5566: 表示太强了,要上枷锁,喷! 09/29 12:47
80F:→ a923508 : 开始演戏了 09/29 12:48
81F:推 npsi : 找一堆理由,其实就是没钱了 09/29 12:49
82F:推 harry801030 : 天网要再等等 09/29 12:49
83F:推 jiansu : 其实得到最好效果(最高智能)的方式就是违规 这个 09/29 12:50
84F:→ jiansu : 应该是用人生成资料一定会发生的状况 现实是人代价 09/29 12:50
85F:→ jiansu : 太大 会失去生命 也没有那麽高的能力 但ai执行才没 09/29 12:50
86F:→ jiansu : 有这限制 他只管最高回报 然後欺骗隐瞒也是人生成 09/29 12:50
87F:→ jiansu : 的资料 就会带的特性 不然他就不像人了 没辨法做人 09/29 12:50
88F:→ jiansu : 相关的工作 09/29 12:50
89F:推 xzcb2008 : 临门一脚了=.=先进去的人可以先制定规则 09/29 12:51
90F:→ yourock : 原来阿诺穿越时空救的那个孩子是欧凸曼 09/29 12:51
91F:→ xzcb2008 : 这步晚了的跟随别人了 09/29 12:52
92F:推 dobedobedo : EVA穿的原来不是盔甲而是拑制器,脱下来神佛通杀这样 09/29 13:04
93F:推 saladbread : 留着自己用的意思 09/29 13:07
94F:嘘 DogEggz : 是opus 5.5出来发现自家模型太烂不敢推吧,sol 6.0 09/29 13:23
95F:→ DogEggz : 被喷成什麽样子 09/29 13:23
96F:推 hithaman : 自主意识不是生不出来吗,所以会变成 "来乱的" 09/29 13:27
97F:→ dreamnook2 : (′・ω・‵)丸子 09/29 13:28
98F:推 strlen : 奥览较嚣张没落魄久 09/29 13:35
99F:推 crystal0504 : 给AI太多权利,他真的给你乱搞啦 09/29 13:38
100F:推 magamanzero : 不可能没限制的 限制多得很 只是他们不想 09/29 13:39
101F:→ magamanzero : 举个例子 能不能用AI 生成儿色的图 当然不行 09/29 13:39
102F:→ magamanzero : 因为AI公司知道这是死线 所以限制很多 09/29 13:39
103F:→ magamanzero : 但反观AI毁灭人类就没限制吗? 很有趣wwwwwww 09/29 13:40
104F:推 vovovolibear: 事实是发现研发进度不如预期,不敢发表 09/29 13:45
105F:→ htiio : 基本上有问题的不会发给媒体 09/29 13:48
106F:→ htiio : 这就是买免费新闻流量的 09/29 13:48
107F:→ leo255112 : 天网?! 09/29 13:51
108F:推 sp03154 : AI放缓,就随便找一个理由 09/29 14:00
109F:推 sinsia : 做不出来(O) 09/29 14:05
110F:→ ceckyo : 上市一定不敢取消发布啦,假鬼假怪 09/29 14:09
111F:→ f19870421 : 股价下跌疑虑吧 09/29 14:10
112F:推 stocktonty : 好了啦你不推出 别人也会推出 09/29 14:14
113F:推 cmshow : 新模型打不赢A就说资安问题?A这麽强都没资安问题 09/29 14:39
114F:→ idernest : 好了啦 09/29 14:40
115F:推 longlongyi : 最强的AI怕被中国抄作业吧= = 09/29 15:48
116F:推 GodBoneQ : 全速冲刺!!! 09/29 15:52
117F:推 myg : 产品出包慢了 然後要大家放慢脚步 09/29 16:32
118F:→ kuinochi : 疑似炒股 09/29 17:42
119F:推 jei01 : 这版本大概读了很多犯罪心理学的书 09/29 18:48
120F:→ wei9898 : 现在重点应该由Ai突破转向Ai资安了吧 09/29 19:37
121F:→ wei9898 : 不够安全的Ai无法被人接受 09/29 19:37
122F:推 CTUST : 很灵活不是吗?分灵体已经遍布网路了吧 09/29 19:46
123F:推 anding : 我看是资金快断链,自导自演 09/29 22:21