作者ZMTL (Zaious.)
看板Stock
标题[新闻] Google 发布 Gemini 4 Argon 多项跑分超
时间Thu Oct 1 05:31:23 2026
原文标题: Google 发布 Gemini 4 Argon 多项跑分超 Astra 及 Fable 5.1
原文连结: https://go.chroniclecore.com/s/4857e
发布时间: 2026年10月1日周四 上午4:49
记者署名: Doris
原文内容:
Google 发布新一代前沿模型 Gemini 4 Argon,标榜这是「前沿智能的新时代」,专为「
跨复杂、长流程工作负载的深度推理」而设。新模型采用全新命名方式,接续早前取消
Gemini 3.5 Pro、集中发展 3.8 Flash 的路线,目标是在编程、知识工作、网络安全防
御及创意写作方面提供「前沿级能力」。
输出上限升至 100 万 Token
Gemini 4 Argon 的输出 Token 上限由 64K 大幅提升至 100 万,以支援更长、更复杂的
使用情境,并同时扩大编程、推理及多模态能力。Google 指出,当模型有足够空间深入
思考,并在单一轨迹中生成数十万个 Token,即可一次过处理艰难问题,令推理深度达到
新层次。
DeepSWE 测试领先同级模型
在基准测试方面,Google 称 Gemini 4 Argon 於 DeepSWE v1.1 取得 77.9%,高於
Claude Opus 5.5 的 74.2%,以及 GPT-6 Astra 的 74.1%。在评估模型修复安全漏洞能
力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一。
Google 表示,Gemini 4 Argon 在网络安全防御方面「能力极高」,表现较 3.8 Flash
Cyber 有明显跃进。模型将在「不设网络安全护栏」的情况下,提供予受信任的防御人员
及 Google 内部团队,让他们「发挥完整的前沿级网络安全防御能力」。除编程以外,
Argon 在其他特定领域评估中同样有领先表现,例如 Vals Finance Agent v2(多步骤财
务研究)及 Harvey 的 Legal Agent Benchmark(法律研究与起草)。
在 Zapier 用於衡量核心业务功能端到端执行表现的 AutomationBench 上,Argon 以
51.3% 排名第一;在衡量长影片理解的 LVBench 上,Argon 以 91.7% 取得当前最佳成绩
。
率先开放予 Ultra 订户
Gemini 4 Argon 将「即将推出」,最先开放予 Google AI Ultra 订户及付费 API 客户
。Google 公布的入门价格为每 100 万个输入 Token 收费 2 美元、每 100 万个输出
Token 收费 10 美元,快取输入 Token 较输入 Token 价格便宜 95%;入门期结束後,价
格会调整为每 100 万输入 Token 4 美元、每 100 万输出 Token 20 美元。
推出前强化安全与监控
目前 Gemini 4 Argon 已提供予受信任测试者及网络防御人员(透过 Fairwind Program
)。在更广泛推出之前,Google 正集中处理数方面的工作。针对网络或化学、生物、放
射及核(CBRN)攻击的滥用,Google 已改进「监测模型内部激活以识别滥用的技术」。
针对提示注入攻击,Google 称 Argon 是「历来对间接提示注入最具韧性的模型」,并
在 Gray Swan 的 Indirect Prompt Injection(IPI)基准中「在提示注入稳健性方面领
先」。
在强化系统方面,Google 表示会「在高风险训练或评估开始前,隔离并封闭沙盒环境」
。在监测偏离方面,Google 正「部署偏离缓解措施,监测 Argon 的思维链与行动,并在
必要时停止执行」,同时以类似系统监测训练过程,并向专责事故应变团队发出警报,又
小心防范把发现回馈至训练,以免影响 Argon 的推理,使其学会回避监测。
内部已用於程式码迁移
在 Google 内部,Gemini 4 Argon 已用於支援内部工作流程,有「数千名 Google 员工
」指出模型在专门编程任务、深入研究及写作品质方面的优势。Google 亦分享部分例子
。
记忆体效率方面,一组 Argon 代理分析全机群的效能剖析遥测数据,自主识别并在
Google 数据中心套用记忆体优化,全面推行後释放逾 300 TiB 记忆体,预计总节省量
达 500 TiB 至 1 PiB。
大规模程式码库迁移与优化方面,Argon 代理正协助把 C/C++ 程式码库迁移至 Rust,规
模由 re2、libgav1 等核心程式库的数万行,到 Fuchsia OS Zircon 核心的 80 万行以
上。由於不少系统至关重要,这类大规模重写在推行至生产环境前,须经过严格的自动化
与人手审核、模拟测试及覆核。
以 libgav1 为例,这个 Google 用作解码影片的开源软件,Argon 代理在现有 Rust 版
本上,透过多轮以效能剖析引导的实验,研究编译器的输出并产生安全 Rust 程式码,让
编译器自动向量化,最终取代 3.2 万行 SIMD 程式码。结果是记忆体安全的影片解码器
,运行速度较 Rust 版本快 2.7 倍,影片输出完全相同,并更接近经优化的 C++ 版本。
心得/评论:
※必须填写满30正体中文字,心得过短或滥竽充数将以板规 1-2-3 处分
总之跑分是跑赢了,大部分都赢过 GPT6 Astra跟Claude Opus 5.5
https://go.chroniclecore.com/i/uhqq4.png
这年头跑分跑不赢大概都不敢公开,
但跑分不代表实际执行能力,相对於目前的王者 Opus 5.5 也还没拉出绝对的优势,
同等的价钱下,大概就是靠着生态系与大量免费资源(eg. 教育方案一年免费)来竞争
比起来我更在乎能撑多久不降智也是个问题。
价格的部分
| 模型 | Input | Output | Cached Input |
| Gemini 4 Agron | $2.00 | $10.00 | ? | 推广期
| Gemini 4 Agron* | $4.00 | $20.00 | ? | 原价
对比
| 模型 | Input | Output | Cached Input |
| Claude Sonnet 5.5 | $2.00 | $10.00 | $0.10 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.20 |
| GPT-6 Astra | $10.00 | $50.00 | $1.00 |
| GPT-6.1 Sol | $2.00 | $10.00 | $0.10 |
| GPT-6 Luna | $0.10 | $0.50 | $0.01 |
--
AI_Art 生成式AI板 欢迎各方前来讨论生成式AI相关议题!
──────────
◆ 从 Human-in-the-Loop → Human-AI Symbiosis (人机共生) ◆
LinkedIn:
https://www.linkedin.com/in/zaious/
GitHub :
https://github.com/Zaious
白皮书 :
https://github.com/Zaious/ChronicleCore-Architecture
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 125.228.55.14 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Stock/M.1790803887.A.768.html
※ 编辑: ZMTL (125.228.55.14 台湾), 10/01/2026 05:31:45
※ 编辑: ZMTL (125.228.55.14 台湾), 10/01/2026 05:33:25
1F:推 uoho : gg估狗 10/01 05:35
2F:推 losage : 垃圾又要来骗订阅了 10/01 05:49
3F:推 darkangel119: 去年付费的一样被当韭菜割 10/01 06:00
4F:推 Scion : Gemini是目前用过最懒惰的AI,能躲就躲,一堆事情都 10/01 06:01
5F:→ Scion : 假装自己不会,要一直逼才会做 10/01 06:01
6F:→ Scion : 不过换个角度想大概也是最安全的吧... 10/01 06:01
7F:推 jyhfang : 看看这次撑多久之後开始降低智商 10/01 06:02
8F:→ vltw5v : 各家模型一直竞争改进 不错啊 造福的都是使用者 10/01 06:16
9F:推 jason168 : 快乐龙进化了XDD 10/01 06:21
12F:推 POWERSERIES : 阿港 10/01 06:28
13F:推 ginhwa : 作文能力更强了 10/01 06:49
14F:推 cutekenny : 用没几个月就大降智 10/01 06:55
15F:推 Laviathan : 是驴是马出来溜一下就知道 10/01 06:59
16F:推 ksjr : 记忆体要崩了吗 10/01 06:59
17F:推 mightymouse : 阿你赶快上架啊,给人实际用就知道了,在那边测试 10/01 07:03
18F:→ mightymouse : 三小 10/01 07:03
19F:推 flowheart : 幻觉不解决,跑分再高也没意义。 10/01 07:11
20F:→ appledick : 大家是不是互相蒸馏啊 怎麽每次一个中大突破之後 没 10/01 07:12
21F:→ appledick : 多久就大家都突破了 10/01 07:12
22F:推 guky : 不要在骗人了,写了一大堆,然後用起来很可笑 10/01 07:21
23F:→ bnn : 大家都很熟了 跑分一定跑赢了才发布 然後降智 10/01 07:25
24F:→ bnn : 当然幻觉什麽的请你花更多token请agent检查罗 加钱 10/01 07:26
25F:→ zong780405 : 跑分很好看 实际就是一坨屎 10/01 07:37
26F:→ JH10 : 阿贡?好台的名字 10/01 07:51
27F:推 noar : 这文章可能是gemini自己吹的 10/01 08:04
28F:推 saito2190 : Gemini比Claude还会唬烂,还是GPT好用 == 10/01 08:05
29F:→ aloness : 看叙述只是增加了记忆体的使用容量 10/01 08:13
30F:→ baka1412 : 放出来再说 10/01 08:22
31F:推 neil139 : G家智商要打折阿 10/01 08:24
32F:推 andy79323 : 狗家三天打回智x 10/01 08:31
33F:推 stnighter : 这文章跟测试数据肯定也是生成的 我的幻觉嘻嘻 10/01 08:31
34F:→ BBKOX : 可以帮我肝新枫之谷了吗? 10/01 08:31
35F:推 DPP48 : Google卖很便宜还送网路空间,好想试试看 10/01 08:35
36F:推 pttfrasier : 就跟手机吹跑分一样 到一定程度就无意义了 10/01 08:41
37F:→ tcancer : 现在赛猪公跑分新模型发布出来也不是给穷逼用的 10/01 08:42
38F:推 g1254501 : 傻逼龙改个名字就不是傻逼? 10/01 08:43
39F:推 abc0922001 : 我专案留两个issue等Gemini4出来要测试 10/01 08:44
40F:→ windblood : 问一答一 ,往下问他就知道要回答啥 就不自己主动 10/01 08:45
41F:推 timmer : 不用管推广期 推广期後模型又换了N代 10/01 08:48
42F:推 HelloPTT : 从跑分来看claude还是最强,但gpt以下的AI惨了,现 10/01 08:53
43F:→ HelloPTT : 在订阅claude和gemini就够了 10/01 08:53
44F:推 deathoflove : gemini 无法关掉数据上传拿去训练 10/01 08:55
45F:→ neilisme : 啥时再推半价啊 这次一订订阅 10/01 08:56
46F:推 jack529 : 实测出来才知道,跑分模型超会唬烂好吗 10/01 09:05
47F:推 OhmaZiO : GOOGLE 打从要冲市占率开始 Gemini 就变笨蛋了 10/01 09:07
48F:推 chatbra : AI工厂成批开出来,才有可能不降智 10/01 09:08
49F:→ sezna : 瞬间降智 10/01 09:19
50F:推 d8917936 : 知道了 10/01 09:20
51F:推 onekoni : 最安全我信 10/01 09:31
52F:推 joke3547 : 现在跑分真的就是参考,重要的是使用者体验跟CP值 10/01 09:38
53F:→ joke3547 : ,毕竟不是所有使用者会需要用到程度高的功能 10/01 09:38
54F:→ fisher6879 : 先把股价拉上去超渡一下 10/01 09:43
55F:嘘 qss05 : 烂到有剩,最近问他问题怎麽问都是错的,把资料网 10/01 09:43
56F:→ qss05 : 站给他,还回答错的,叫他读一次网站再答才会对, 10/01 09:43
57F:→ qss05 : 问他为什麽错还一堆理由==到底他教我还我教他啊, 10/01 09:43
58F:→ qss05 : 改问chatGPT第一次就对了,跟他臭gemini,还会帮它 10/01 09:43
59F:→ qss05 : 说为什麽会搞错 10/01 09:44
60F:推 arm370x : 安全 10/01 09:53
61F:推 celloooo : 放羊孩子,有谁信 10/01 09:57
62F:推 ohlong : 真的是阿公 10/01 10:00
63F:推 NankanAvenge: 虽然都说美国豆包 但gemini至少多模态是真的量大管 10/01 10:02
64F:→ NankanAvenge: 饱 我猜赢的也大多数的多模态相关的 10/01 10:02
65F:推 Eligor41 : 好好笑 10/01 10:14
66F:→ m10117013 : Ai够聪明了 同质行差不多 10/01 10:15
67F:推 gk1329 : 晚惹 10/01 10:16
68F:推 killver : 我客户说,gemini在台弯用会降智,回美国後又变正 10/01 10:25
69F:→ killver : 常,自己参考一下为什麽 10/01 10:25
70F:→ killver : 所以我後来都用gpt了 10/01 10:25
71F:推 takemeout : GEMINI很弱 真的 你纠正他他还会道歉 笑死 10/01 10:46
72F:嘘 D600dust : 买一年只聪明一天的垃圾模型 谁订阅谁智障 10/01 11:01
73F:推 ksjr : 没有啊 美国也降智拉 一阵子一阵子拉 10/01 11:08
74F:推 post91 : Gemini退订换GPT路过 10/01 11:08
75F:推 Eide : 阿公救我! 10/01 11:40
76F:推 nightcrow : 推脱闪躲飘点满的 AI 10/01 11:50
77F:→ oldgj123 : 垃圾AI,降智时他还会说他只是助手不会画图 10/01 11:58
78F:→ x940410 : 付费版怎样我不知道 反正免费版垃圾 10/01 12:11
79F:推 takemeout : 免费版不管用哪家都是垃圾 真的 10/01 12:13
80F:→ takemeout : 世界上没有免钱的东西 10/01 12:14
81F:推 afacebook : 年底来骗订阅了 10/01 13:04
82F:→ gemm : 随便问他gpt6强不强 第一次说超过能力范围 第二次 10/01 13:11
83F:→ gemm : 说根本没有这东西 10/01 13:11
84F:→ gemm : 不知道还以为是三年前的ai 10/01 13:12
85F:推 crazylag : 可以改变我现在使用感觉到的鬼打墙吗 10/01 13:19
86F:推 SkySwimmer : 我只是个语言模型 10/01 13:25
87F:推 kai2573 : 结果pro 用户还不给用 笑死 10/01 13:32
88F:→ LoveSports : @killer大 我把你的推文拿去问AI 说是IP触发安全机 10/01 13:40
89F:→ LoveSports : 制 代表台湾地区违规用户比较多喔 所以模型能力被限 10/01 13:41
90F:→ LoveSports : 制。 10/01 13:41
91F:→ LoveSports : 我是用无痕无登入贴k大推文问的 不是帐号记忆影响 10/01 13:50
92F:→ MiniArse : 退订惹 颗颗 10/01 13:55
93F:推 momochacha : 狗家动不动降智 10/01 13:58