作者ZMTL (Zaious.)
看板Stock
標題[新聞] Google 發佈 Gemini 4 Argon 多項跑分超
時間Thu Oct 1 05:31:23 2026
原文標題: Google 發佈 Gemini 4 Argon 多項跑分超 Astra 及 Fable 5.1
原文連結: https://go.chroniclecore.com/s/4857e
發布時間: 2026年10月1日週四 上午4:49
記者署名: Doris
原文內容:
Google 發佈新一代前沿模型 Gemini 4 Argon,標榜這是「前沿智能的新時代」,專為「
跨複雜、長流程工作負載的深度推理」而設。新模型採用全新命名方式,接續早前取消
Gemini 3.5 Pro、集中發展 3.8 Flash 的路線,目標是在編程、知識工作、網絡安全防
禦及創意寫作方面提供「前沿級能力」。
輸出上限升至 100 萬 Token
Gemini 4 Argon 的輸出 Token 上限由 64K 大幅提升至 100 萬,以支援更長、更複雜的
使用情境,並同時擴大編程、推理及多模態能力。Google 指出,當模型有足夠空間深入
思考,並在單一軌跡中生成數十萬個 Token,即可一次過處理艱難問題,令推理深度達到
新層次。
DeepSWE 測試領先同級模型
在基準測試方面,Google 稱 Gemini 4 Argon 於 DeepSWE v1.1 取得 77.9%,高於
Claude Opus 5.5 的 74.2%,以及 GPT-6 Astra 的 74.1%。在評估模型修復安全漏洞能
力的 CWE-bench v1 上,Argon 以 68% 的最高分並列第一。
Google 表示,Gemini 4 Argon 在網絡安全防禦方面「能力極高」,表現較 3.8 Flash
Cyber 有明顯躍進。模型將在「不設網絡安全護欄」的情況下,提供予受信任的防禦人員
及 Google 內部團隊,讓他們「發揮完整的前沿級網絡安全防禦能力」。除編程以外,
Argon 在其他特定領域評估中同樣有領先表現,例如 Vals Finance Agent v2(多步驟財
務研究)及 Harvey 的 Legal Agent Benchmark(法律研究與起草)。
在 Zapier 用於衡量核心業務功能端到端執行表現的 AutomationBench 上,Argon 以
51.3% 排名第一;在衡量長影片理解的 LVBench 上,Argon 以 91.7% 取得當前最佳成績
。
率先開放予 Ultra 訂戶
Gemini 4 Argon 將「即將推出」,最先開放予 Google AI Ultra 訂戶及付費 API 客戶
。Google 公佈的入門價格為每 100 萬個輸入 Token 收費 2 美元、每 100 萬個輸出
Token 收費 10 美元,快取輸入 Token 較輸入 Token 價格便宜 95%;入門期結束後,價
格會調整為每 100 萬輸入 Token 4 美元、每 100 萬輸出 Token 20 美元。
推出前強化安全與監控
目前 Gemini 4 Argon 已提供予受信任測試者及網絡防禦人員(透過 Fairwind Program
)。在更廣泛推出之前,Google 正集中處理數方面的工作。針對網絡或化學、生物、放
射及核(CBRN)攻擊的濫用,Google 已改進「監測模型內部激活以識別濫用的技術」。
針對提示注入攻擊,Google 稱 Argon 是「歷來對間接提示注入最具韌性的模型」,並
在 Gray Swan 的 Indirect Prompt Injection(IPI)基準中「在提示注入穩健性方面領
先」。
在強化系統方面,Google 表示會「在高風險訓練或評估開始前,隔離並封閉沙盒環境」
。在監測偏離方面,Google 正「部署偏離緩解措施,監測 Argon 的思維鏈與行動,並在
必要時停止執行」,同時以類似系統監測訓練過程,並向專責事故應變團隊發出警報,又
小心防範把發現回饋至訓練,以免影響 Argon 的推理,使其學會迴避監測。
內部已用於程式碼遷移
在 Google 內部,Gemini 4 Argon 已用於支援內部工作流程,有「數千名 Google 員工
」指出模型在專門編程任務、深入研究及寫作品質方面的優勢。Google 亦分享部分例子
。
記憶體效率方面,一組 Argon 代理分析全機群的效能剖析遙測數據,自主識別並在
Google 數據中心套用記憶體優化,全面推行後釋放逾 300 TiB 記憶體,預計總節省量
達 500 TiB 至 1 PiB。
大規模程式碼庫遷移與優化方面,Argon 代理正協助把 C/C++ 程式碼庫遷移至 Rust,規
模由 re2、libgav1 等核心程式庫的數萬行,到 Fuchsia OS Zircon 核心的 80 萬行以
上。由於不少系統至關重要,這類大規模重寫在推行至生產環境前,須經過嚴格的自動化
與人手審核、模擬測試及覆核。
以 libgav1 為例,這個 Google 用作解碼影片的開源軟件,Argon 代理在現有 Rust 版
本上,透過多輪以效能剖析引導的實驗,研究編譯器的輸出並產生安全 Rust 程式碼,讓
編譯器自動向量化,最終取代 3.2 萬行 SIMD 程式碼。結果是記憶體安全的影片解碼器
,運行速度較 Rust 版本快 2.7 倍,影片輸出完全相同,並更接近經優化的 C++ 版本。
心得/評論:
※必須填寫滿30正體中文字,心得過短或濫竽充數將以板規 1-2-3 處分
總之跑分是跑贏了,大部分都贏過 GPT6 Astra跟Claude Opus 5.5
https://go.chroniclecore.com/i/uhqq4.png
這年頭跑分跑不贏大概都不敢公開,
但跑分不代表實際執行能力,相對於目前的王者 Opus 5.5 也還沒拉出絕對的優勢,
同等的價錢下,大概就是靠著生態系與大量免費資源(eg. 教育方案一年免費)來競爭
比起來我更在乎能撐多久不降智也是個問題。
價格的部分
| 模型 | Input | Output | Cached Input |
| Gemini 4 Agron | $2.00 | $10.00 | ? | 推廣期
| Gemini 4 Agron* | $4.00 | $20.00 | ? | 原價
對比
| 模型 | Input | Output | Cached Input |
| Claude Sonnet 5.5 | $2.00 | $10.00 | $0.10 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.20 |
| GPT-6 Astra | $10.00 | $50.00 | $1.00 |
| GPT-6.1 Sol | $2.00 | $10.00 | $0.10 |
| GPT-6 Luna | $0.10 | $0.50 | $0.01 |
--
AI_Art 生成式AI板 歡迎各方前來討論生成式AI相關議題!
──────────
◆ 從 Human-in-the-Loop → Human-AI Symbiosis (人機共生) ◆
LinkedIn:
https://www.linkedin.com/in/zaious/
GitHub :
https://github.com/Zaious
白皮書 :
https://github.com/Zaious/ChronicleCore-Architecture
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 125.228.55.14 (臺灣)
※ 文章網址: https://webptt.com/m.aspx?n=bbs/Stock/M.1790803887.A.768.html
※ 編輯: ZMTL (125.228.55.14 臺灣), 10/01/2026 05:31:45
※ 編輯: ZMTL (125.228.55.14 臺灣), 10/01/2026 05:33:25
1F:推 uoho : gg估狗 10/01 05:35
2F:推 losage : 垃圾又要來騙訂閱了 10/01 05:49
3F:推 darkangel119: 去年付費的一樣被當韭菜割 10/01 06:00
4F:推 Scion : Gemini是目前用過最懶惰的AI,能躲就躲,一堆事情都 10/01 06:01
5F:→ Scion : 假裝自己不會,要一直逼才會做 10/01 06:01
6F:→ Scion : 不過換個角度想大概也是最安全的吧... 10/01 06:01
7F:推 jyhfang : 看看這次撐多久之後開始降低智商 10/01 06:02
8F:→ vltw5v : 各家模型一直競爭改進 不錯啊 造福的都是使用者 10/01 06:16
9F:推 jason168 : 快樂龍進化了XDD 10/01 06:21
12F:推 POWERSERIES : 阿港 10/01 06:28
13F:推 ginhwa : 作文能力更強了 10/01 06:49
14F:推 cutekenny : 用沒幾個月就大降智 10/01 06:55
15F:推 Laviathan : 是驢是馬出來溜一下就知道 10/01 06:59
16F:推 ksjr : 記憶體要崩了嗎 10/01 06:59
17F:推 mightymouse : 阿你趕快上架啊,給人實際用就知道了,在那邊測試 10/01 07:03
18F:→ mightymouse : 三小 10/01 07:03
19F:推 flowheart : 幻覺不解決,跑分再高也沒意義。 10/01 07:11
20F:→ appledick : 大家是不是互相蒸餾啊 怎麼每次一個中大突破之後 沒 10/01 07:12
21F:→ appledick : 多久就大家都突破了 10/01 07:12
22F:推 guky : 不要在騙人了,寫了一大堆,然後用起來很可笑 10/01 07:21
23F:→ bnn : 大家都很熟了 跑分一定跑贏了才發布 然後降智 10/01 07:25
24F:→ bnn : 當然幻覺什麼的請你花更多token請agent檢查囉 加錢 10/01 07:26
25F:→ zong780405 : 跑分很好看 實際就是一坨屎 10/01 07:37
26F:→ JH10 : 阿貢?好台的名字 10/01 07:51
27F:推 noar : 這文章可能是gemini自己吹的 10/01 08:04
28F:推 saito2190 : Gemini比Claude還會唬爛,還是GPT好用 == 10/01 08:05
29F:→ aloness : 看敘述只是增加了記憶體的使用容量 10/01 08:13
30F:→ baka1412 : 放出來再說 10/01 08:22
31F:推 neil139 : G家智商要打折阿 10/01 08:24
32F:推 andy79323 : 狗家三天打回智x 10/01 08:31
33F:推 stnighter : 這文章跟測試數據肯定也是生成的 我的幻覺嘻嘻 10/01 08:31
34F:→ BBKOX : 可以幫我肝新楓之谷了嗎? 10/01 08:31
35F:推 DPP48 : Google賣很便宜還送網路空間,好想試試看 10/01 08:35
36F:推 pttfrasier : 就跟手機吹跑分一樣 到一定程度就無意義了 10/01 08:41
37F:→ tcancer : 現在賽豬公跑分新模型發佈出來也不是給窮逼用的 10/01 08:42
38F:推 g1254501 : 傻逼龍改個名字就不是傻逼? 10/01 08:43
39F:推 abc0922001 : 我專案留兩個issue等Gemini4出來要測試 10/01 08:44
40F:→ windblood : 問一答一 ,往下問他就知道要回答啥 就不自己主動 10/01 08:45
41F:推 timmer : 不用管推廣期 推廣期後模型又換了N代 10/01 08:48
42F:推 HelloPTT : 從跑分來看claude還是最強,但gpt以下的AI慘了,現 10/01 08:53
43F:→ HelloPTT : 在訂閱claude和gemini就夠了 10/01 08:53
44F:推 deathoflove : gemini 無法關掉數據上傳拿去訓練 10/01 08:55
45F:→ neilisme : 啥時再推半價啊 這次一訂訂閱 10/01 08:56
46F:推 jack529 : 實測出來才知道,跑分模型超會唬爛好嗎 10/01 09:05
47F:推 OhmaZiO : GOOGLE 打從要衝市占率開始 Gemini 就變笨蛋了 10/01 09:07
48F:推 chatbra : AI工廠成批開出來,才有可能不降智 10/01 09:08
49F:→ sezna : 瞬間降智 10/01 09:19
50F:推 d8917936 : 知道了 10/01 09:20
51F:推 onekoni : 最安全我信 10/01 09:31
52F:推 joke3547 : 現在跑分真的就是參考,重要的是使用者體驗跟CP值 10/01 09:38
53F:→ joke3547 : ,畢竟不是所有使用者會需要用到程度高的功能 10/01 09:38
54F:→ fisher6879 : 先把股價拉上去超渡一下 10/01 09:43
55F:噓 qss05 : 爛到有剩,最近問他問題怎麼問都是錯的,把資料網 10/01 09:43
56F:→ qss05 : 站給他,還回答錯的,叫他讀一次網站再答才會對, 10/01 09:43
57F:→ qss05 : 問他為什麼錯還一堆理由==到底他教我還我教他啊, 10/01 09:43
58F:→ qss05 : 改問chatGPT第一次就對了,跟他臭gemini,還會幫它 10/01 09:43
59F:→ qss05 : 說為什麼會搞錯 10/01 09:44
60F:推 arm370x : 安全 10/01 09:53
61F:推 celloooo : 放羊孩子,有誰信 10/01 09:57
62F:推 ohlong : 真的是阿公 10/01 10:00
63F:推 NankanAvenge: 雖然都說美國豆包 但gemini至少多模態是真的量大管 10/01 10:02
64F:→ NankanAvenge: 飽 我猜贏的也大多數的多模態相關的 10/01 10:02
65F:推 Eligor41 : 好好笑 10/01 10:14
66F:→ m10117013 : Ai夠聰明了 同質行差不多 10/01 10:15
67F:推 gk1329 : 晚惹 10/01 10:16
68F:推 killver : 我客戶說,gemini在台彎用會降智,回美國後又變正 10/01 10:25
69F:→ killver : 常,自己參考一下為什麼 10/01 10:25
70F:→ killver : 所以我後來都用gpt了 10/01 10:25
71F:推 takemeout : GEMINI很弱 真的 你糾正他他還會道歉 笑死 10/01 10:46
72F:噓 D600dust : 買一年只聰明一天的垃圾模型 誰訂閱誰智障 10/01 11:01
73F:推 ksjr : 沒有啊 美國也降智拉 一陣子一陣子拉 10/01 11:08
74F:推 post91 : Gemini退訂換GPT路過 10/01 11:08
75F:推 Eide : 阿公救我! 10/01 11:40
76F:推 nightcrow : 推脫閃躲飄點滿的 AI 10/01 11:50
77F:→ oldgj123 : 垃圾AI,降智時他還會說他只是助手不會畫圖 10/01 11:58
78F:→ x940410 : 付費版怎樣我不知道 反正免費版垃圾 10/01 12:11
79F:推 takemeout : 免費版不管用哪家都是垃圾 真的 10/01 12:13
80F:→ takemeout : 世界上沒有免錢的東西 10/01 12:14
81F:推 afacebook : 年底來騙訂閱了 10/01 13:04
82F:→ gemm : 隨便問他gpt6強不強 第一次說超過能力範圍 第二次 10/01 13:11
83F:→ gemm : 說根本沒有這東西 10/01 13:11
84F:→ gemm : 不知道還以為是三年前的ai 10/01 13:12
85F:推 crazylag : 可以改變我現在使用感覺到的鬼打牆嗎 10/01 13:19
86F:推 SkySwimmer : 我只是個語言模型 10/01 13:25
87F:推 kai2573 : 結果pro 用戶還不給用 笑死 10/01 13:32
88F:→ LoveSports : @killer大 我把你的推文拿去問AI 說是IP觸發安全機 10/01 13:40
89F:→ LoveSports : 制 代表台灣地區違規用戶比較多喔 所以模型能力被限 10/01 13:41
90F:→ LoveSports : 制。 10/01 13:41
91F:→ LoveSports : 我是用無痕無登入貼k大推文問的 不是帳號記憶影響 10/01 13:50
92F:→ MiniArse : 退訂惹 顆顆 10/01 13:55
93F:推 momochacha : 狗家動不動降智 10/01 13:58