作者LDPC (Channel Coding)
看板Stock
标题Re: [新闻] Google 发布 Gemini 4 Argon 多项跑分超
时间Thu Oct 1 12:06:24 2026
这次模型应该是瞄准ToB了 前几天就收到神秘信说今天下午可以来公测
信中还说可以无限点调酒和包吃包喝 就杀来狗家办公室蹭饭
在讲这件事情是 但先说件评测模型
现在大家体验就是训练模型很简单 但怎样去评估很难
常常把模型训练完 在各种刷分榜数据 可以大杀四方 但实际落地就是笑死人
这个连我自己都遇到 在疯狂调教我的肥宅模型 内部数据测试 真的大杀四方
结果现实被顾客说垃圾 所以现在最难的不是训练模型 是如何去评监他
俗话说 你只要能评监 你就有办法去训练改进 就像RPG 只要有血条 你就能杀死它
最怕就是所有评监数据都满分
然後现实烂掉 因为现实很多场景是没有办法用离线数据去测试
所以狗家怎样搞 内部刷完分数之後 叫你们这些toB收到邀请函来现场单挑
带者你们最棘手的数据和任务 到现场PK PK完不够 又给你一个月回家继续去PK
这就是今天下午的事情 然後我...老实说没准备 QQ 就进去吃吃喝喝 喝酒喝到有点飘
但我看到PLTR 还有几家是认真的在测 不得不说 狗家敢这样让你带你任务
跟你单挑 应该模型很强 不过在场的都是toB 我不知道toC体验是怎样
至少狗家这种ToB服务 体验真的好
然後Muse带动其他前沿开始卷个人助理 狗家好像目前没参战
※ 引述《ZMTL (Zaious.)》之铭言:
: 原文标题: Google 发布 Gemini 4 Argon 多项跑分超 Astra 及 Fable 5.1
: 原文连结: https://go.chroniclecore.com/s/4857e
: 发布时间: 2026年10月1日周四 上午4:49
: 记者署名: Doris
: 原文内容:
: Google 发布新一代前沿模型 Gemini 4 Argon,标榜这是「前沿智能的新时代」,专为「
: 跨复杂、长流程工作负载的深度推理」而设。新模型采用全新命名方式,接续早前取消
: Gemini 3.5 Pro、集中发展 3.8 Flash 的路线,目标是在编程、知识工作、网络安全防
: 御及创意写作方面提供「前沿级能力」。
: 输出上限升至 100 万 Token
: Gemini 4 Argon 的输出 Token 上限由 64K 大幅提升至 100 万,以支援更长、更复杂的
: 使用情境,并同时扩大编程、推理及多模态能力。Google 指出,当模型有足够空间深入
: 思考,并在单一轨迹中生成数十万个 Token,即可一次过处理艰难问题,令推理深度达到
: 新层次。
: DeepSWE 测试领先同级模型
: 在基准测试方面,Google 称 Gemini 4 Argon 於 DeepSWE v1.1 取得 77.9%,高於
: Claude Opus 5.5 的 74.2%,以及 GPT-6 Astra 的 74.1%。在评估模型修复安全漏洞能
: 力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一。
: Google 表示,Gemini 4 Argon 在网络安全防御方面「能力极高」,表现较 3.8 Flash
: Cyber 有明显跃进。模型将在「不设网络安全护栏」的情况下,提供予受信任的防御人员
: 及 Google 内部团队,让他们「发挥完整的前沿级网络安全防御能力」。除编程以外,
: Argon 在其他特定领域评估中同样有领先表现,例如 Vals Finance Agent v2(多步骤财
: 务研究)及 Harvey 的 Legal Agent Benchmark(法律研究与起草)。
: 在 Zapier 用於衡量核心业务功能端到端执行表现的 AutomationBench 上,Argon 以
: 51.3% 排名第一;在衡量长影片理解的 LVBench 上,Argon 以 91.7% 取得当前最佳成绩
: 。
: 率先开放予 Ultra 订户
: Gemini 4 Argon 将「即将推出」,最先开放予 Google AI Ultra 订户及付费 API 客户
: 。Google 公布的入门价格为每 100 万个输入 Token 收费 2 美元、每 100 万个输出
: Token 收费 10 美元,快取输入 Token 较输入 Token 价格便宜 95%;入门期结束後,价
: 格会调整为每 100 万输入 Token 4 美元、每 100 万输出 Token 20 美元。
: 推出前强化安全与监控
: 目前 Gemini 4 Argon 已提供予受信任测试者及网络防御人员(透过 Fairwind Program
: )。在更广泛推出之前,Google 正集中处理数方面的工作。针对网络或化学、生物、放
: 射及核(CBRN)攻击的滥用,Google 已改进「监测模型内部激活以识别滥用的技术」。
: 针对提示注入攻击,Google 称 Argon 是「历来对间接提示注入最具韧性的模型」,并
: 在 Gray Swan 的 Indirect Prompt Injection(IPI)基准中「在提示注入稳健性方面领
: 先」。
: 在强化系统方面,Google 表示会「在高风险训练或评估开始前,隔离并封闭沙盒环境」
: 。在监测偏离方面,Google 正「部署偏离缓解措施,监测 Argon 的思维链与行动,并在
: 必要时停止执行」,同时以类似系统监测训练过程,并向专责事故应变团队发出警报,又
: 小心防范把发现回馈至训练,以免影响 Argon 的推理,使其学会回避监测。
: 内部已用於程式码迁移
: 在 Google 内部,Gemini 4 Argon 已用於支援内部工作流程,有「数千名 Google 员工
: 」指出模型在专门编程任务、深入研究及写作品质方面的优势。Google 亦分享部分例子
: 。
: 记忆体效率方面,一组 Argon 代理分析全机群的效能剖析遥测数据,自主识别并在
: Google 数据中心套用记忆体优化,全面推行後释放逾 300 TiB 记忆体,预计总节省量
: 达 500 TiB 至 1 PiB。
: 大规模程式码库迁移与优化方面,Argon 代理正协助把 C/C++ 程式码库迁移至 Rust,规
: 模由 re2、libgav1 等核心程式库的数万行,到 Fuchsia OS Zircon 核心的 80 万行以
: 上。由於不少系统至关重要,这类大规模重写在推行至生产环境前,须经过严格的自动化
: 与人手审核、模拟测试及覆核。
: 以 libgav1 为例,这个 Google 用作解码影片的开源软件,Argon 代理在现有 Rust 版
: 本上,透过多轮以效能剖析引导的实验,研究编译器的输出并产生安全 Rust 程式码,让
: 编译器自动向量化,最终取代 3.2 万行 SIMD 程式码。结果是记忆体安全的影片解码器
: ,运行速度较 Rust 版本快 2.7 倍,影片输出完全相同,并更接近经优化的 C++ 版本。
: 心得/评论:
: ※必须填写满30正体中文字,心得过短或滥竽充数将以板规 1-2-3 处分
: 总之跑分是跑赢了,大部分都赢过 GPT6 Astra跟Claude Opus 5.5
: https://go.chroniclecore.com/i/uhqq4.png
: 这年头跑分跑不赢大概都不敢公开,
: 但跑分不代表实际执行能力,相对於目前的王者 Opus 5.5 也还没拉出绝对的优势,
: 同等的价钱下,大概就是靠着生态系与大量免费资源(eg. 教育方案一年免费)来竞争
: 比起来我更在乎能撑多久不降智也是个问题。
: 价格的部分
: | 模型 | Input | Output | Cached Input |
: | Gemini 4 Agron | $2.00 | $10.00 | ? | 推广期
: | Gemini 4 Agron* | $4.00 | $20.00 | ? | 原价
: 对比
: | 模型 | Input | Output | Cached Input |
: | Claude Sonnet 5.5 | $2.00 | $10.00 | $0.10 |
: | Claude Opus 5.5 | $4.00 | $20.00 | $0.20 |
: | Claude Fable 5.1 | $10.00 | $50.00 | $0.20 |
: | GPT-6 Astra | $10.00 | $50.00 | $1.00 |
: | GPT-6.1 Sol | $2.00 | $10.00 | $0.10 |
: | GPT-6 Luna | $0.10 | $0.50 | $0.01 |
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 98.37.67.135 (美国)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Stock/M.1790827585.A.949.html
※ 编辑: LDPC (98.37.67.135 美国), 10/01/2026 12:09:26
1F:推 ppuuppu : 果然只有LDPC大大能进去那个场合!!! 10/01 12:10
2F:推 windfeather : 听起来很有自信捏 10/01 12:11
3F:推 roseritter : 推 10/01 12:17
4F:推 donkilu : 完全同意 现在的瓶颈真的是eval 尤其是使用者的感觉 10/01 12:19
5F:推 windfeather : 所以我说,狗家的酒和餐点水准如何? 10/01 12:20
6F:→ donkilu : 至於狗的toC就... Gemini被一路嫌到现在是有道理的 10/01 12:21
7F:→ b9513227 : 我对垃圾ai没兴趣 所以那个食物图呢 10/01 12:22
8F:推 kcy05785 : 狗家的To C基底应该是最好的 10/01 12:23
9F:推 sdbb : 谢谢,那有遇到TQQQ 王吗? 10/01 12:25
10F:推 fisher6879 : 太厉害惹吧,白嫖狗家,爽啊吃啊 10/01 12:25
11F:推 h0103661 : gemini的问题哪是toB toC的差别,完全就是sft阶段 10/01 12:28
12F:→ h0103661 : 出了问题,这谁来用、用在哪都会遇到 10/01 12:28
我不太懂你在说啥 就拿法律来讲 法律诉讼写得好不好 这玩意不是SFT能解决
SFT可以在问答QA benchmark得到高分 但是他无法很好的解决使用者体验
pre-training重要是他的知识量 但benchmark刷高分(pre-training) 不等於优秀智能体
以法律来说 你可以看到很多做ToB Legal AI solution 白领使用者体验
都在抱怨 这些模型写的诉讼 写得就像初阶律师诉讼论点
非常菜鸟 但不是那些专业户要的知识呈现
你在训练模型时 你可能在LawQA benchmark测试模型法律知识 得到高分任务
这反映 SFT训练好 一堆QA benchmark可以刷高分 不意味体验好
尤其在白领工作人类高标准 知识产出体验 他就是垃圾
他垃圾地方在於 这些体验 他需要大量人类接手去修改
这些toB领域 很多的体验垃圾原因 不是他知识不行 而是他不是在做你的需求
换句话说 有些前沿模型可以写到跟专业律师类似 有些写得像菜鸟律师
但两者模型在法律知识QA 可能分数差不多
所以你要怎样eval? 一个办法 就是量人类修改次数和花费时间 也就是人为介入次数
比方说你让Harvey AI智能体帮律师写拟稿诉状 那如果人类校稿修改三次 花费五分钟
vs 修改大量 花费1hr 前者就及格 某些任务 前沿任务甚至达到 人类零修改
这玩意就不是benchmark能量 很多量测方法就是量人类需要介入程度
无人驾驶也是同样概念 所以toC就是量白领阶级任务 人类需要接手几次 这是一个办法
但pltr今天说了一些 我就不分享了@@
但这种人机互动协作的eval量测方式就是叫trace eval就是去看你要多少步才能到你需求
benchmark只是单次性的量测 而非一个整体序列性的体验量测
但人为介入次数 也等於 你token烧的浪费次数 人为介入越多 表示你token烧的没意义
13F:推 LoveSports : 感谢业界专家分享心得 10/01 12:32
14F:推 NoMomoNoLife: 感谢分享 10/01 12:35
15F:推 likeshit : 我想用肥宅模型 10/01 12:38
16F:推 ZMTL : 感谢分享,不知道有无意愿转AI_Art板分享 10/01 12:41
17F:推 lsckinoko : 推分享 10/01 12:42
18F:→ HiuAnOP : 羡慕吃吃喝喝喝到飘‼ 10/01 12:42
19F:推 donkilu : 确实跟无人驾驶有异曲同工之妙XD 10/01 12:43
20F:推 HiuAnOP : 既然有肥宅模型那应该也有萝莉模型吧‼ 10/01 12:45
21F:推 pornpig32 : 好的 买PLTR 10/01 12:48
22F:推 strlen : 狗家不是有spark 这不就是muse吗 10/01 12:49
23F:推 Muilie : 被请去喝腊八粥了 10/01 12:53
24F:推 josephpu : spark没人在用吧 10/01 12:56
25F:推 diyteam : 模型就像演算法,背後的资料才是key。模型会清洗资 10/01 12:58
26F:→ diyteam : 料/演算法要人工清洗! 10/01 12:58
27F:推 mynumber55 : 啊是可以用了吗? 10/01 13:04
28F:→ mynumber55 : 放消息放了几个月了 10/01 13:04
29F:推 addy7533967 : 想要男娘模型 10/01 13:06
30F:推 CorkiN : 感谢分享 10/01 13:07
※ 编辑: LDPC (98.37.67.135 美国), 10/01/2026 13:09:20
31F:推 as6633208 : 用到後面还是会乖乖回去订阅Claude,anthropic 快上 10/01 13:21
32F:→ as6633208 : 市 10/01 13:21
33F:推 LoveSports : 模型未来自我递归改进会不会渐渐取代PLTR类似的公司 10/01 13:21
34F:→ LoveSports : 模型如果学到PLTR设专业领域框架的技术 10/01 13:23
35F:推 CaptPlanet : 各大厂的模型的能力底子都不错了,还是 harness 重 10/01 13:24
36F:→ CaptPlanet : 要吧 10/01 13:24
37F:推 joygo : 狗家强的应该就是整合 毕竟他可以得到很多使用者习 10/01 13:29
38F:→ joygo : 惯 ai根本不用太聪明 就跟你不会请一个天才来做简 10/01 13:29
39F:→ joygo : 单的报表一样 要刚刚好 10/01 13:29
40F:推 arnold3 : 我觉得模型够用了 专业技能给ai去用mcp就好 10/01 13:32
41F:推 winner1104 : 感恩心得分享 10/01 13:32
42F:推 as6633208 : AI够聪明我才会想用,copilot 扫信箱给出的答案,跟 10/01 13:36
43F:→ as6633208 : Claude 扫信箱给出的答案差异蛮大的,整合这块AI模 10/01 13:36
44F:→ as6633208 : 型商自己也在做,当大家都可以把需要的资料灌给AI的 10/01 13:36
45F:→ as6633208 : 时候,整合就不是优点了,最终还是比哪个模型最聪明 10/01 13:36
46F:→ as6633208 : ,可以注意到最多你没注意到的细节,产出你超出你预 10/01 13:36
47F:→ as6633208 : 期的答案 10/01 13:36
48F:→ as6633208 : 聪明,我认为是模型能注意到某些关键细节,或是你从 10/01 13:40
49F:→ as6633208 : 没跟模型说过但他问题解法用的却是你们公司才知道的 10/01 13:40
50F:→ as6633208 : know how,就是喔干,我没讲你怎麽会知道 10/01 13:40
51F:推 g0t24568 : LDPC大到底什麽神仙职业 10/01 13:41
52F:→ bnn : 因为它找资料的时候顺便突破你家公司防火墙捞一遍(X 10/01 13:42
53F:推 abc21086999 : 我记得原Po也是Googler不是ㄇ 10/01 13:53
54F:推 grtfor : 感谢分享 10/01 13:54
55F:推 enjoythegame: 推一下 10/01 14:08
56F:推 frank94 : google主要问题是gemini3和4隔太久,中间只出flash 10/01 14:15
57F:→ frank94 : 版本,这段时间其他家都更新好几代前沿模型 10/01 14:15
58F:推 willyabs : 谢LP大大分享 10/01 14:26
59F:→ salamender : 还在 101 那栋吗? 10/01 14:31
60F:→ abc0922001 : 为什麽你现在就可以测试了~ 10/01 14:49
61F:推 abc0922001 : 以前大家模型还很弱,还能去Leetcode抓Hard的题目 10/01 14:51
62F:→ abc0922001 : 现在几乎都能解 LeetCode题目了 10/01 14:52
63F:推 newyorker54 : 现在各家都在抹黑对方 10/01 14:56
64F:→ a87569650 : 我以为能端出好菜 没有什麽时间太久的问题.... 10/01 15:00
65F:→ nightop : LDAI好爽喔 蹭到免费的一餐 10/01 15:10
66F:推 ProTrader : 程式交易从以前到现在都是啊 回测下死人 上线帮QQ 10/01 15:23
67F:→ ProTrader : 所以 再怎样好的回测绩效 都要经过实测验证 10/01 15:24
68F:→ ProTrader : 我到现在已经不回测直接小额实测 10/01 15:24
69F:→ JoeyChen : 收到google的邀请信评测酒水XD 10/01 15:25
70F:推 darkangel119: To C 就是一坨大便 10/01 15:46
71F:推 Sakaki7777 : 狗家助理以後直接内嵌pixel就好 目前先让Meta踩地雷 10/01 16:30
72F:→ Sakaki7777 : 或其他google app 整合起来不得了 自带connector 10/01 16:31
73F:推 jyhfang : 高手 谢分享 10/01 16:57
74F:推 create8 : Ptt 都能遇到神人.. 10/01 21:05
75F:推 jily : 大推分享 10/01 22:40
76F:推 NoMomoNoLife: 再推 10/01 23:50
77F:推 coke7 : 推 分享 10/02 19:57
78F:推 skyhawkptt : 现场美食文报导一下啦!(敲碗) 10/06 00:38