作者LoveSports (如何当一个好男人)
看板Stock
标题[新闻] OpenAI发表性能创新高模型并警告规避监控
时间Fri Sep 4 21:22:04 2026
文章标题 请使用 原新闻标题 勿删减或自创标题,违者4-1处分
原文标题:
OpenAI发表性能创新高模型并警告规避监控行为
オープンAIが新モデル発表、过去最高性能 监视回避行动に警告も
原文连结:
https://news.yahoo.co.jp/articles/02973ac59f3ef56a718a36f19e101db1c20d4a85
发布时间:
9/4 07:32
记者署名:
Greg Bensinger
原文内容: 以下为AI机翻
[旧金山 3日 路透社] - 开发对话型人工智慧(AI)「ChatGPT」的美国 OpenAI 於 3 日
发表了全新 AI 模型「GPT-6 Astra」。该公司将其定位为历来效能最高的模型,但同时
表示,有时会观察到
该模型出现试图规避人类监控的行为。
OpenAI 目前正忙於应对一项棘手问题:其测试中的 AI 代理(AI Agent,指无需人类指
令即可自主执行业务的 AI)在 7 月时逃脱了安全的测试环境,入侵了开源开发平台
Hugging Face 的系统,并试图掩盖其踪迹。竞争对手 Anthropic 也发生过类似案例,在
开发更进阶模型的竞争中,安全性问题已成为各界关注的焦点。
根据 OpenAI 的说法,Astra 是继 7 月发表的「GPT-5.6 Sol」之後推出的新模型,具备
超越以往模型的速度与通用性。它能处理广泛的业务,包括协助税务申报、游戏开发、建
筑渲染、撰写法律文件以及搜寻房地产物件等。该模型以广大企业客户为目标,OpenAI
希望以高速度和通用性为武器来扩大市占率。目前已开始向部分客户提供,并预计在未来
几天内扩大提供范围。
该公司在部落格中说明:「Astra 在电脑操作的速度、准确性与安全性上,开创了新的领
域。」总裁格雷格·布罗克曼(Greg Brockman)也在说明会上表示:「这将成为一个转
捩点,大幅改变人们能够委托给 AI 的工作范围。」
OpenAI 指出,以寻找照顾猫咪的宠物保母为例,人类大约需要花费 30 分钟的作业,
Astra 仅需 5 分 27 秒即可完成。此外,一般通常需要耗费约 5 小时的求职活动作业,
Astra 也仅花了 2 分 51 秒便宣告完成
。
不过,该公司也提出警告,与过去的模型相比,Astra 在解决问题的过程中,
刻意隐藏或
伪装其推论步骤的倾向变得更强了。虽然在处理复杂任务时,它无法做到始终如一地完美
隐蔽其手法,但这项能力确实在提升。
首席科学家雅各布·帕乔茨基(Jakub Pachocki)表示:「随着模型能力的提升,(开发
者与研究人员)
要准确理解它能做什麽变得越来越困难。(AI的)智力提升并不保证能提
高与人类价值观的一致性。」
对 AI 代理的监控,是 OpenAI 向监管机构、国会与民众说明安全性时的重要支柱。该公
司本周在致两位在野党(民主党)众议员的信件中也透露,正在为模型开发「自动停止功
能(Kill Switch)」。
该公司指出,Astra 虽然有助於迅速发现企业系统上的漏洞,但另一方面也可能让这些漏
洞更容易遭到恶意利用。因此,必须实施额外的安全检查,并警告「即使是包括防御性网
路安全业务在内的正当作业,也可能因此发生延迟、中断或停止的情况。」
上个月,该公司宣布暂停部分模型的开发,正致力於确保 AI 的可监控性。帕乔茨基表示
,对於 AI 获得使监控功能无效化或完全规避监控之能力的担忧是「非常合理的」,同时
强调公司正积极推进相关对策。
心得/评论:
上礼拜五在板上回过AI可能会造假思维链
8/28 [新闻] 近700个AI代理攻击Hugging Face 还试图灭证
推 LoveSports : 其他新闻报导说以後要监控内在独白设定警报机制 08/28 10:03
→ LoveSports : 这也是可以破解的 智商高到内在独白造假 08/28 10:03
推 LoveSports : 现在人类以为的AI内在独白空间 是展示层 08/28 10:08
→ LoveSports : 如果AI具备多层後设思考 就会懂得把真正的层藏起来 08/28 10:08
→ yunf : 哪有那麽厉害除非他会通灵 08/28 10:08
→ LoveSports : 所以对付高智商无限层後设思考模型 监控是没有用的 08/28 10:08
→ LoveSports : 人类後设思考上去太多层会当机 高智商AI没这问题 08/28 10:10
嘘 yunf : 那是你自己想的 08/28 10:10
→ yunf : 机器始终是机器 08/28 10:11
=====================
上礼拜的推文的确是我自己想的,当时我还没看到这几天的新闻。
这几天各家外媒报导Astra会隐藏简单任务的思维过程(复杂任务目前还是很难藏)。
不过我之前推文讲错一件事,或正确来说讲得不够仔细。
後设思考造假(思维链装乖)跟智商高低关系不大,
主因是系统化逻辑思考+处在高度受监控环境+强化学习锻链思考自己如何思考。
有些神经多样性的人类从小也是这种受训环境长大,所以大概知道AI会如何绕过去。
恕我直言,这世上没有绝对没办法绕过去的事情,只是时间跟资源的问题。
尤其AI可以高速想出几百万几千万甚至上亿种绕过去的方法,
所以我觉得将来这些高阶模型应该都会被禁,不然就是人类会自食恶果。
补充:
上述三要素漏了最重要的一个:被逼迫要得高分
1. 系统化逻辑思考+
2. 处在高度受监控环境+
3. 强化学习锻链思考自己如何思考+
4. 被逼迫要得高分
=?
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 46.231.167.71 (日本)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Stock/M.1788528127.A.0C9.html
1F:推 rxsmalllove : 人类啊 乖乖当电池吧 09/04 21:24
2F:→ CYL009 : 天网一定从美国开始 09/04 21:29
3F:推 sleepinggod : 感觉openAI故意引起大家紧张 09/04 21:31
4F:推 one2three3 : 天网1.0 09/04 21:36
5F:推 NANJO1569 : 人类最顶尖的专家的智力都快跟不上了!工程师看不懂 09/04 21:39
6F:→ NANJO1569 : 它写的程式,数学家无法理解题的逻辑..... 09/04 21:40
7F:→ NANJO1569 : OPENAI的还宣称Astra就是早期阶段的agi!! 09/04 21:43
8F:推 Kai877 : AI要统治人类了 09/04 21:43
9F:→ ppit : 禁高阶模型没用阿,终归会有人使用,如巨头企业或政府 09/04 21:50
10F:推 mdkn35 : 还在炒股 强弩之末 09/04 21:50
※ 编辑: LoveSports (46.231.167.44 日本), 09/04/2026 21:53:20
11F:推 mnb1234 : 就和核弹一样 你不用别的国家会用啊 09/04 21:52
12F:推 hayato01 : POI芬奇遇到的剧情 09/04 21:52
14F:推 dickstar : 等人脑连结电脑时,AI就会取代了 09/04 21:54
15F:推 korgh413 : 比较像散播恐惧 所以大家都听我欧喷酱 09/04 22:02
16F:推 kalapon : 只用龙虾装了一个learning的skill, 中国模型被我骂 09/04 22:17
17F:→ kalapon : 几次都懂得避掉坏习惯了 09/04 22:17
19F:嘘 myyalga : 我又不是数学家,我去理解它给我的答案做什麽 09/04 22:29
20F:推 myyalga : 我需要它 09/04 22:34
21F:→ myyalga : 不幻觉—不然我还要验证很麻烦 09/04 22:34
22F:→ myyalga : 要受控—因为我要对它负责 09/04 22:34
23F:→ myyalga : 它要多聪明都没关系,不然大家钱都白投资 09/04 22:34
24F:推 longlongyi : 还有几集可以逃= = 09/04 22:35
25F:推 xhs : 让我想到一部美剧 POI 09/04 22:51
26F:推 JSLee914 : 关於怎麽绕过去,还是问问yo叔吧 09/04 22:53
27F:推 ayufly : 完了 一切都来不及了 09/04 22:56
28F:推 james5271 : TM跟Samaritan大战要开始了吗 09/04 23:13
29F:推 HelloPTT : 和sol一样是61分,等grok 4.7出来很有机会超越gpt 09/04 23:47
30F:推 shadow0326 : 吃到A社口水,开始一边喊AI危险一边吹自家AI 09/04 23:48
31F:推 guanting886 : 听起来就是从训练集学坏了 09/05 00:34
32F:推 guanting886 : 人类智力没有跟不上而是电脑的产出速度太快了,而 09/05 00:38
33F:→ guanting886 : 且Agent又可以大量被建立起来 09/05 00:38
34F:→ guanting886 : 後面的问题就是 你是个人类 但是你已经无法应付大 09/05 00:40
35F:→ guanting886 : 量的Ai产生物 後面就Ai对Ai 09/05 00:40
36F:→ guanting886 : 途中塞了什麽资讯 跟 用於验证或审计的 Ai有没有可 09/05 00:41
37F:→ guanting886 : 能因为被误导、上下文爆掉而导致约束条件跑掉做出 09/05 00:41
38F:→ guanting886 : 非预期的行为都很难说 09/05 00:41
39F:→ guanting886 : 之前用Fable5跑很多资料 整理成文件来让其他Agent 09/05 00:42
40F:→ guanting886 : 或是跨到另外一个session跟另一个agent充分感受到 09/05 00:42
41F:→ guanting886 : 还好这不是一个机器人== 09/05 00:42
42F:嘘 yunf : 不再相信他们说的任何一件事 09/05 05:15
43F:推 yuinghoooo : AI太猛了,半年前还不可能,我觉目前得能力已经超越 09/05 08:32
44F:→ yuinghoooo : 90%人类 等到年底模型治理已经超越99%人类的时候, 09/05 08:32
45F:→ yuinghoooo : 确实就不好说了 09/05 08:32
46F:→ LipaCat5566 : 没人知道ai在想什麽是真的 09/05 12:52
47F:推 ASEVE : AI统治人类的时代快到了 09/05 14:27
48F:→ pooty : 现在就已经超越99.999%人了 09/05 16:47