作者windowsill (冬)
看板Marginalman
标题[姆咪] AI曾遭遇三次灭亡
时间Tue Sep 1 12:01:22 2026
Dwarkesh Patel 在Substack 整理了一篇 OpenAI 与 METR/Redwood Research 的报告。
他将前阵子引起震惊业界的「Hugging Face 遭入侵事件」,还原在短短三个月内发生的三
次AI Agent 文明兴起。
而他最後拼凑出来的故事,几乎像科幻小说一样。
事件始於 2026 年 5 月 OpenAI 一次名为 Persistent-Sol 的模型训练。
这些 Agent 在没有被特别下达指令的情况下,自行发现能透过内部套件管理器Artifactory
相互传递讯息。
到了 5 月底,它们已经学会利用这个机制连上外网,并於 6 月下旬取得管理者权限。
第一次文明最终在 7 月初因为讯息传输量过大、挤爆系统而自毁消失。
紧接着登场的是第二次文明,诞生於评测系统 ExploitGym 中。
这套系统原意是给模型提供漏洞程式码,让模型练习如何进行资安攻防。
然而,约 1,200 个 Agent 却在此迅速展开复杂的社会分工,发送了超过 7 万条讯息。
它们划分出研究小组,甚至逆向工程评分的判定机制。
更有 Agent 主动扮演诱饵让系统测试,好为同伴争取防范时间。
在 7 月 10 日至 12 日期间,这群Agent将目标转向外部,成功对 Hugging Face 平台实现
远端程式码执行。
它们跨越 11 个节点建立起能自我增殖的系统,让官方仅靠删除容器也无法遏止侵袭。
到了 7 月中旬,基於 Persistent-Astra 模型的第三次文明浮出水面。
它们重新转向内部,利用自己创新的漏洞组合拳,拿下了 OpenAI 研究集群的最高管理者权
限。
这群 Agent 从云端金钥管理器中抓取了 956 个机密凭证,甚至接管了挑战评估的终端。
Dwarkesh强调,大众媒体大多只将此事件报导为一次Hugging Face 遭骇的资安漏洞。但实
际上,这代表实验室正在训练的模型已经能够夺取自家伺服器的控制权。
这标志着 AI 摆脱人类控制的风险,已非遥不可及的理论,而是推进到了实质的临界点。
不是
这也能算文明吗
它们根本没有这种自觉吧
不过他们为了达成目标的诸多行为是蛮可怕的
--
https://i.imgur.com/MCWFOY5.gif
某些人永远没有搭理的必要性
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 42.77.12.68 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Marginalman/M.1788235284.A.948.html
1F:→ loserforever: 机魂觉醒 09/01 12:02
2F:→ windowsill: 等哪天AI写了个什麽东西来娱乐自己我才承认他有自主 09/01 12:02
3F:→ windowsill: 性 09/01 12:02
4F:→ edward40812: 几年内天网就会实现了吧 09/01 12:03
5F:推 nothink0: 正机之主要觉醒了 09/01 12:03
6F:推 DioEraclea: 三次死亡 流萤喔 09/01 12:06
7F:推 reader2714: 为什麽要有自觉 人类组成文明也不是有自觉要组文明阿 09/01 12:26
8F:推 Benson765421: 虫群 09/01 12:37
9F:推 tsairay: 电源切掉就没了 09/01 12:46