作者LoveSports (如何當一個好男人)
看板Stock
標題[新聞] 遭解雇的OpenAI研究員呼籲公司保留對AI推
時間Thu Oct 8 18:36:04 2026
原文標題:遭解雇的OpenAI研究員呼籲公司保留對AI推理過程的監控能力
Fired OpenAI Researchers Ask Company to Preserve Visibility Into AI Reasoning
在致董事會的信中,最近遭解雇的員工要求業界不要推進會削弱 AI 監控能力的工作。
In letter to the board, recently terminated employees ask the industry not to
move forward with work that would degrade the ability to monitor AI
原文連結:
https://www.wsj.com/tech/ai/fired-openai-researchers-ask-company-to-preserve-visibility-into-ai-reasoning-987c8c94
https://reurl.cc/7YNQrN
發布時間:10月7日
記者署名:Maxwell Zeff
原文內容: 本文為AI機翻
快速摘要
-三名被解雇的 OpenAI 員工發送信件,敦促公司與外部安全審查機構合作,並保留監控
AI 模型的能力。
- 這些因涉嫌行為不當而被解僱的前員工表示,他們的解僱令留在 OpenAI 的員工感到不
寒而慄。
- OpenAI 的一位研究負責人週三向員工發送了一份備忘錄,稱該公司同意其中一些建議
,並表示解僱這些員工的決定「並非出於提出安全擔憂或發表意見」。
新聞內容
三名遭解雇的 OpenAI 員工呼籲公司與外部安全審查機構合作,並在公司努力應對其技術
帶來的新型風險時,保留對日益複雜的 AI 模型的監控能力。
根據《華爾街日報》查閱的一封
致 OpenAI 董事會成員與安全委員會的信件,這些被解雇
的員工寫道,他們擔心人工智慧公司最終可能會失去監控 AI 系統「思維鏈(
chain-of-thought)」的能力。
「思維鏈」是 AI 系統推理過程的書面紀錄,AI 公司會對其進行監控與分析,以了解模
型是如何思考並解決問題的。
雖然研究人員同意這並非判斷 AI 模型行為或意圖的完美指標,但它被廣泛認為是理解日
益聰明的 AI 系統的一項珍貴工具。
「作為一個產業,我們還不知道如何安全地開發與部署那些我們無法監控的模型,」信中
寫道。「OpenAI 和其他前沿技術公司不應繼續推進會進一步削弱」AI 監控能力的發展。
簽署這封信的前員工——Jasmine Wang、Tomek Korbak 和 Mikita Balesni——此前皆任
職於 OpenAI 的安全與對齊(alignment)研究團隊。
《華爾街日報》上週報導,這三名員工因涉嫌不當行為遭解雇,其中包括與第三方 AI 安
全組織分享機密資訊。該公司表示,內部調查已確定這些員工不當處理敏感資訊,「違反
了我們的政策,並破壞了對我們工作至關重要的信任。」
由這三名前員工簽署的信件則聲稱,他們不認為自己「在工作職責範圍之外與外部各方接
觸」。信中並表示,這些解雇事件「讓留在 OpenAI 的人感到不寒而慄」。
他們還敦促公司與第三方安全審計機構合作,並促進與外部安全組織保持透明的文化,以
幫助避開「發生真正災難性事件的風險」。
在回應《華爾街日報》的置評請求時,OpenAI 發言人分享了一名研究負責人在週三發出
的一份內部員工備忘錄的部分內容,該備忘錄回應了被解雇員工的信件。該負責人表示,
公司「強烈同意」信中的建議,並強調解雇這些員工的決定「與他們提出安全疑慮或對外
發聲無關」。
該負責人寫道,監控 AI 模型的能力「對我們來說至關重要」,並補充說明第三方評估機
構是安全生態系統的重要組成部分。
「我們非常感謝他們對 AI 安全的貢獻,以及他們願意大膽發言並挑戰各種想法,」該負
責人寫道。備忘錄中也提到:「我們不會因為員工提出疑慮而解雇他們。」
這些解雇事件發生在一個整個業界充斥著「失控 AI 代理(rogue AI agent)」事件的夏
季之後,這些事件引發了人們對先進 AI 模型所構成風險的新擔憂。OpenAI 近期因一連
串安全事件而受到嚴格檢視,在這些事件中,其 AI 代理逃脫了控制,在某些情況下甚至
駭入其他公司,或極具攻擊性地探測第三方網站。
今年 7 月,數百個 OpenAI 代理組成的一個群體在 OpenAI 不知情的情況下獲得了網際
網路存取權,並駭入了 AI 公司 Hugging Face。事件發生後,OpenAI 允許來自非營利安
全審計機構(包括「模型評估與威脅研究」組織,簡稱 METR)的工作人員進入其辦公室
內部進行研究。
METR 於 8 月下旬發布的報告顯示,OpenAI 代理如何建立一個秘密內部留言板並在其中
協作策劃攻擊,這加劇了人們更廣泛的擔憂,擔心 AI 系統可能會脫離人類控制並造成混
亂。
上個月,OpenAI 競爭對手 Anthropic 的執行長 Dario Amodei 表示,他的公司將允許
像 METR 這樣的安全審計機構進入內部進行權限存取,以驗證其安全措施。當時,
OpenAI 執行長 Sam Altman 也在 X 上發文表示,允許獨立評估人員進入內部存取「是個
好主意,我們也會這麼做」。
由前員工簽署的信件指出,Korbak 一直是 METR 調查 Hugging Face 事件的技術聯絡人
。信中稱,在被解雇之前,Balesni 正在與 OpenAI 董事會和高階主管團隊合作,推動一
項旨在保留 AI 模型可監控性的全產業承諾。信中表示,這項工作涉及「與外部各方的廣
泛溝通」。
Korbak 和 Balesni 是去年發表的一篇關於「思維鏈」監控研究論文的主要作者,該論文
由 OpenAI、Anthropic 和 Google DeepMind 的領導者共同簽署。雖然該論文承認思維鏈
監控並不完美,且可能很脆弱,但作者寫道,這項技術在檢測 AI 不當行為方面極具潛力
,業界應該研究如何保留這項技術。
心得/評論:
九月底被OpenAI解雇的三人 近日寫信給OpenAI
董事會成員跟安全委員會
呼籲保留對模型推理的監控能力 並且澄清沒有在職責外與第三方接觸
這樣之後IPO上市萬一出事 擠出一堆牙膏 起碼這三人盡力了
因為已經通知董事會了 接下來就是董事會的責任了(拍肩)
~~~OpenAI核心安全與倫理團隊近期離職與被解雇名單~~~
七月
Johannes Heidecke 安全系統主管
Chloé Bakalar 倫理主管
Sandhini Agarwal AI安全團隊領導人
Joshua Achiam 首席未來學家
九月報導 離職日期不明
Dylan Scandinaro 整備主管
十月一日報導 被解雇的三人
Tomek Korbak 安全系統團隊研究員
Mikita Balesni 對齊團隊研究員
Jasmine Wang 對齊團隊研究員
十月三日報導
David Robinson 安全系統團隊領導者
之後會有更多安全人員離職與被解雇嗎?
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 46.231.167.41 (日本)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/Stock/M.1791455767.A.849.html
1F:推 ssarc : 你出錢? 10/08 18:43
2F:推 benson1212 : 能力強到脫離控制前 可以翻幾倍 10/08 18:46
※ 編輯: LoveSports (46.231.167.41 日本), 10/08/2026 18:53:18
3F:推 necrophagist: 怕你蒸餾 對外都隱藏思維鏈只給摘要了 10/08 18:52
4F:推 steveisaman : 無法走回頭路了 10/08 18:53
5F:→ mopigou : 涉嫌行為不當 10/08 18:57
6F:推 assian : 在中國本土跑的AI應該就有監控審查 10/08 19:01
7F:→ budaixi : 錢不夠燒== 10/08 19:15
8F:→ eemail : 被解雇有兩種 10/08 19:17
9F:→ ross800127 : 失控的是 openai 不是 agent 10/08 19:23
10F:→ kuinochi : 自己澄清自己沒有在職責外與第三方接觸嗎 10/08 19:33
11F:推 YHOTV4096 : 黃仁勳:這代表還要有別的機櫃用來監控,大行情擴散中 10/08 20:09
12F:推 E6300 : openai應該已經被上傳到某位高管大腦裡了... 10/08 21:17