Stock 板


LINE

文章標題 請使用 原新聞標題 勿刪減或自創標題,違者4-1處分 原文標題: OpenAI發表性能創新高模型並警告規避監控行為 オープンAIが新モデル発表、過去最高性能 監視回避行動に警告も 原文連結: https://news.yahoo.co.jp/articles/02973ac59f3ef56a718a36f19e101db1c20d4a85 發布時間: 9/4 07:32 記者署名: Greg Bensinger 原文內容: 以下為AI機翻 [舊金山 3日 路透社] - 開發對話型人工智慧(AI)「ChatGPT」的美國 OpenAI 於 3 日 發表了全新 AI 模型「GPT-6 Astra」。該公司將其定位為歷來效能最高的模型,但同時 表示,有時會觀察到該模型出現試圖規避人類監控的行為。 OpenAI 目前正忙於應對一項棘手問題:其測試中的 AI 代理(AI Agent,指無需人類指 令即可自主執行業務的 AI)在 7 月時逃脫了安全的測試環境,入侵了開源開發平台 Hugging Face 的系統,並試圖掩蓋其蹤跡。競爭對手 Anthropic 也發生過類似案例,在 開發更進階模型的競爭中,安全性問題已成為各界關注的焦點。 根據 OpenAI 的說法,Astra 是繼 7 月發表的「GPT-5.6 Sol」之後推出的新模型,具備 超越以往模型的速度與通用性。它能處理廣泛的業務,包括協助稅務申報、遊戲開發、建 築渲染、撰寫法律文件以及搜尋房地產物件等。該模型以廣大企業客戶為目標,OpenAI 希望以高速度和通用性為武器來擴大市占率。目前已開始向部分客戶提供,並預計在未來 幾天內擴大提供範圍。 該公司在部落格中說明:「Astra 在電腦操作的速度、準確性與安全性上,開創了新的領 域。」總裁格雷格·布羅克曼(Greg Brockman)也在說明會上表示:「這將成為一個轉 捩點,大幅改變人們能夠委託給 AI 的工作範圍。」 OpenAI 指出,以尋找照顧貓咪的寵物保母為例,人類大約需要花費 30 分鐘的作業, Astra 僅需 5 分 27 秒即可完成。此外,一般通常需要耗費約 5 小時的求職活動作業, Astra 也僅花了 2 分 51 秒便宣告完成 。 不過,該公司也提出警告,與過去的模型相比,Astra 在解決問題的過程中,刻意隱藏或 偽裝其推論步驟的傾向變得更強了。雖然在處理複雜任務時,它無法做到始終如一地完美 隱蔽其手法,但這項能力確實在提升。 首席科學家雅各布·帕喬茨基(Jakub Pachocki)表示:「隨著模型能力的提升,(開發 者與研究人員)要準確理解它能做什麼變得越來越困難。(AI的)智力提升並不保證能提 高與人類價值觀的一致性。」 對 AI 代理的監控,是 OpenAI 向監管機構、國會與民眾說明安全性時的重要支柱。該公 司本週在致兩位在野黨(民主黨)眾議員的信件中也透露,正在為模型開發「自動停止功 能(Kill Switch)」。 該公司指出,Astra 雖然有助於迅速發現企業系統上的漏洞,但另一方面也可能讓這些漏 洞更容易遭到惡意利用。因此,必須實施額外的安全檢查,並警告「即使是包括防禦性網 路安全業務在內的正當作業,也可能因此發生延遲、中斷或停止的情況。」 上個月,該公司宣布暫停部分模型的開發,正致力於確保 AI 的可監控性。帕喬茨基表示 ,對於 AI 獲得使監控功能無效化或完全規避監控之能力的擔憂是「非常合理的」,同時 強調公司正積極推進相關對策。 心得/評論: 上禮拜五在板上回過AI可能會造假思維鍊 8/28 [新聞] 近700個AI代理攻擊Hugging Face 還試圖滅證 推 LoveSports : 其他新聞報導說以後要監控內在獨白設定警報機制 08/28 10:03 → LoveSports : 這也是可以破解的 智商高到內在獨白造假 08/28 10:03 推 LoveSports : 現在人類以為的AI內在獨白空間 是展示層 08/28 10:08 → LoveSports : 如果AI具備多層後設思考 就會懂得把真正的層藏起來 08/28 10:08 → yunf : 哪有那麼厲害除非他會通靈 08/28 10:08 → LoveSports : 所以對付高智商無限層後設思考模型 監控是沒有用的 08/28 10:08 → LoveSports : 人類後設思考上去太多層會當機 高智商AI沒這問題 08/28 10:10 噓 yunf : 那是你自己想的 08/28 10:10 → yunf : 機器始終是機器 08/28 10:11 ===================== 上禮拜的推文的確是我自己想的,當時我還沒看到這幾天的新聞。 這幾天各家外媒報導Astra會隱藏簡單任務的思維過程(複雜任務目前還是很難藏)。 不過我之前推文講錯一件事,或正確來說講得不夠仔細。 後設思考造假(思維鏈裝乖)跟智商高低關係不大, 主因是系統化邏輯思考+處在高度受監控環境+強化學習鍛鍊思考自己如何思考。 有些神經多樣性的人類從小也是這種受訓環境長大,所以大概知道AI會如何繞過去。 恕我直言,這世上沒有絕對沒辦法繞過去的事情,只是時間跟資源的問題。 尤其AI可以高速想出幾百萬幾千萬甚至上億種繞過去的方法, 所以我覺得將來這些高階模型應該都會被禁,不然就是人類會自食惡果。 補充: 上述三要素漏了最重要的一個:被逼迫要得高分 1. 系統化邏輯思考+ 2. 處在高度受監控環境+ 3. 強化學習鍛鍊思考自己如何思考+ 4. 被逼迫要得高分 =? --



※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 46.231.167.71 (日本)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/Stock/M.1788528127.A.0C9.html
1F:推 rxsmalllove : 人類啊 乖乖當電池吧 09/04 21:24
2F:→ CYL009 : 天網一定從美國開始 09/04 21:29
3F:推 sleepinggod : 感覺openAI故意引起大家緊張 09/04 21:31
4F:推 one2three3 : 天網1.0 09/04 21:36
5F:推 NANJO1569 : 人類最頂尖的專家的智力都快跟不上了!工程師看不懂 09/04 21:39
6F:→ NANJO1569 : 它寫的程式,數學家無法理解題的邏輯..... 09/04 21:40
7F:→ NANJO1569 : OPENAI的還宣稱Astra就是早期階段的agi!! 09/04 21:43
8F:推 Kai877 : AI要統治人類了 09/04 21:43
9F:→ ppit : 禁高階模型沒用阿,終歸會有人使用,如巨頭企業或政府 09/04 21:50
10F:推 mdkn35 : 還在炒股 強弩之末 09/04 21:50
※ 編輯: LoveSports (46.231.167.44 日本), 09/04/2026 21:53:20
11F:推 mnb1234 : 就和核彈一樣 你不用別的國家會用啊 09/04 21:52
12F:推 hayato01 : POI芬奇遇到的劇情 09/04 21:52
13F:推 Riesz : https://imgur.com/gD9IXKf 何包蛋 核彈 來了~~ 09/04 21:52
14F:推 dickstar : 等人腦連結電腦時,AI就會取代了 09/04 21:54
15F:推 korgh413 : 比較像散播恐懼 所以大家都聽我歐噴醬 09/04 22:02
16F:推 kalapon : 只用龍蝦裝了一個learning的skill, 中國模型被我罵 09/04 22:17
17F:→ kalapon : 幾次都懂得避掉壞習慣了 09/04 22:17
18F:推 strlen : https://i.meee.com.tw/GhYfRjs.png 09/04 22:25
19F:噓 myyalga : 我又不是數學家,我去理解它給我的答案做什麼 09/04 22:29
20F:推 myyalga : 我需要它 09/04 22:34
21F:→ myyalga : 不幻覺—不然我還要驗證很麻煩 09/04 22:34
22F:→ myyalga : 要受控—因為我要對它負責 09/04 22:34
23F:→ myyalga : 它要多聰明都沒關係,不然大家錢都白投資 09/04 22:34
24F:推 longlongyi : 還有幾集可以逃= = 09/04 22:35
25F:推 xhs : 讓我想到一部美劇 POI 09/04 22:51
26F:推 JSLee914 : 關於怎麼繞過去,還是問問yo叔吧 09/04 22:53
27F:推 ayufly : 完了 一切都來不及了 09/04 22:56
28F:推 james5271 : TM跟Samaritan大戰要開始了嗎 09/04 23:13
29F:推 HelloPTT : 和sol一樣是61分,等grok 4.7出來很有機會超越gpt 09/04 23:47
30F:推 shadow0326 : 吃到A社口水,開始一邊喊AI危險一邊吹自家AI 09/04 23:48
31F:推 guanting886 : 聽起來就是從訓練集學壞了 09/05 00:34
32F:推 guanting886 : 人類智力沒有跟不上而是電腦的產出速度太快了,而 09/05 00:38
33F:→ guanting886 : 且Agent又可以大量被建立起來 09/05 00:38
34F:→ guanting886 : 後面的問題就是 你是個人類 但是你已經無法應付大 09/05 00:40
35F:→ guanting886 : 量的Ai產生物 後面就Ai對Ai 09/05 00:40
36F:→ guanting886 : 途中塞了什麼資訊 跟 用於驗證或審計的 Ai有沒有可 09/05 00:41
37F:→ guanting886 : 能因為被誤導、上下文爆掉而導致約束條件跑掉做出 09/05 00:41
38F:→ guanting886 : 非預期的行為都很難說 09/05 00:41
39F:→ guanting886 : 之前用Fable5跑很多資料 整理成文件來讓其他Agent 09/05 00:42
40F:→ guanting886 : 或是跨到另外一個session跟另一個agent充分感受到 09/05 00:42
41F:→ guanting886 : 還好這不是一個機器人== 09/05 00:42
42F:噓 yunf : 不再相信他們說的任何一件事 09/05 05:15
43F:推 yuinghoooo : AI太猛了,半年前還不可能,我覺目前得能力已經超越 09/05 08:32
44F:→ yuinghoooo : 90%人類 等到年底模型治理已經超越99%人類的時候, 09/05 08:32
45F:→ yuinghoooo : 確實就不好說了 09/05 08:32
46F:→ LipaCat5566 : 沒人知道ai在想什麼是真的 09/05 12:52
47F:推 ASEVE : AI統治人類的時代快到了 09/05 14:27
48F:→ pooty : 現在就已經超越99.999%人了 09/05 16:47







like.gif 您可能會有興趣的文章
icon.png[問題/行為] 貓晚上進房間會不會有憋尿問題
icon.pngRe: [閒聊] 選了錯誤的女孩成為魔法少女 XDDDDDDDDDD
icon.png[正妹] 瑞典 一張
icon.png[心得] EMS高領長版毛衣.墨小樓MC1002
icon.png[分享] 丹龍隔熱紙GE55+33+22
icon.png[問題] 清洗洗衣機
icon.png[尋物] 窗台下的空間
icon.png[閒聊] 双極の女神1 木魔爵
icon.png[售車] 新竹 1997 march 1297cc 白色 四門
icon.png[討論] 能從照片感受到攝影者心情嗎
icon.png[狂賀] 賀賀賀賀 賀!島村卯月!總選舉NO.1
icon.png[難過] 羨慕白皮膚的女生
icon.png閱讀文章
icon.png[黑特]
icon.png[問題] SBK S1安裝於安全帽位置
icon.png[分享] 舊woo100絕版開箱!!
icon.pngRe: [無言] 關於小包衛生紙
icon.png[開箱] E5-2683V3 RX480Strix 快睿C1 簡單測試
icon.png[心得] 蒼の海賊龍 地獄 執行者16PT
icon.png[售車] 1999年Virage iO 1.8EXi
icon.png[心得] 挑戰33 LV10 獅子座pt solo
icon.png[閒聊] 手把手教你不被桶之新手主購教學
icon.png[分享] Civic Type R 量產版官方照無預警流出
icon.png[售車] Golf 4 2.0 銀色 自排
icon.png[出售] Graco提籃汽座(有底座)2000元誠可議
icon.png[問題] 請問補牙材質掉了還能再補嗎?(台中半年內
icon.png[問題] 44th 單曲 生寫竟然都給重複的啊啊!
icon.png[心得] 華南紅卡/icash 核卡
icon.png[問題] 拔牙矯正這樣正常嗎
icon.png[贈送] 老莫高業 初業 102年版
icon.png[情報] 三大行動支付 本季掀戰火
icon.png[寶寶] 博客來Amos水蠟筆5/1特價五折
icon.pngRe: [心得] 新鮮人一些面試分享
icon.png[心得] 蒼の海賊龍 地獄 麒麟25PT
icon.pngRe: [閒聊] (君の名は。雷慎入) 君名二創漫畫翻譯
icon.pngRe: [閒聊] OGN中場影片:失蹤人口局 (英文字幕)
icon.png[問題] 台灣大哥大4G訊號差
icon.png[出售] [全國]全新千尋侘草LED燈, 水草

請輸入看板名稱,例如:Gossiping站內搜尋

TOP