作者arsl400 (dark hatter)
看板Soft_Job
标题[讨论] 请问大家沦陷GPT pro了吗?
时间Sun Aug 30 02:47:38 2026
最近OPENAI突然在几天前宣布plus要限制字数,不然就卡几小时
Pro的token数量比较多
可是要3000抠抠
请问大家有沦陷吗?
还是写程式公司会补助pro?
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 219.91.32.112 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Soft_Job/M.1788029260.A.30D.html
1F:推 pponywong: pro方案很值 没事还会reset用量 还会给你reset ticket 08/30 08:09
2F:→ pponywong: 因为太值了 我都直接开2~3个repo同时用codex 要不然根 08/30 08:10
3F:→ pponywong: 本用不完 08/30 08:10
喔喔!平常比较少写程式,原来这麽划算喔?
4F:嘘 USD5566: 这个 id直接嘘就好 平常电影版洗不够来这洗 08/30 10:42
5F:推 abc0922001: 我都用gemini 08/30 11:20
※ 编辑: arsl400 (219.91.32.112 台湾), 08/30/2026 13:49:53
6F:推 ke265379ke: 上周我才碰到 chatgpt 算错一个变数的代数问题….. 08/30 22:22
7F:推 awenracious: 公司有提供claude MAX 不过我自己也是订阅了GPT pro 08/30 22:49
8F:推 Obama19: AI顶多拿来查资料吧 生产环境最好别用 08/31 01:34
9F:→ jobintan: 算力紧张(×)开割韭菜(○) 08/31 07:05
10F:→ pponywong: 你要AI直接算代数 错误的机率很高 因为他是文本产生器 08/31 09:33
11F:→ pponywong: 但是你可以较AI用python lapack解 或是用julia 08/31 09:34
12F:→ pponywong: 写出script 跑答案比较快 08/31 09:34
13F:推 CoNsTaR: 自己跑 glm-5.3-flash, deepseek-v4-flash-0731 和 qwen3 08/31 11:23
14F:→ CoNsTaR: .8-flash-next,永远不会被限制 08/31 11:23
15F:推 CoNsTaR: qwen3.8-flash-next 只要 80GB RAM 就可以跑 Q4 full con 08/31 11:26
16F:→ CoNsTaR: text 08/31 11:26
17F:推 shortoneal: 很有意思,以前网路时代大家把黏度高的客户当高价值客 08/31 19:05
18F:→ shortoneal: 户,AI时代反而是要赶走那些用的多的叫他们滚去自架 08/31 19:05
19F:推 samuel0330: 因为网路时代重度用户为企业带来价值,现在重度用户 08/31 22:43
20F:→ samuel0330: 反而是让算力成本爆增 08/31 22:43
21F:推 jobintan: CoNsTaR所说的80GB,所指的是RAM还是VRAM?两者差很大。 09/03 07:03
22F:推 CoNsTaR: RAM+VRAM 总合大於 80GB 就可以,qwen3.8-flash-next 只 09/03 15:01
23F:→ CoNsTaR: 有 6b active parameters 所以就算大部分 parameters 都 09/03 15:01
24F:→ CoNsTaR: spill over 到 RAM 速度也不会太慢,你的 VRAM 只要能 09/03 15:01
25F:→ CoNsTaR: 放得下 kv cache 就可以,而且它有 51b 是 per layer emb 09/03 15:01
26F:→ CoNsTaR: edding,所以大概有 102GB 是可以直接从 SSD 串流,不需 09/03 15:01
27F:→ CoNsTaR: 要常驻在 RAM 的,所以才只需要 80GB RAM 09/03 15:01
28F:推 CoNsTaR: 265k context 的话 kv cache 只有 6.2 GB,所以就算你只 09/03 15:04
29F:→ CoNsTaR: 有 8GB VRAM 也行 09/03 15:04
30F:推 CoNsTaR: *256k 09/03 15:07
31F:推 CoNsTaR: 算错,256k context Q8 kv cache 需要 14GB RAM,所以至 09/03 15:17
32F:→ CoNsTaR: 少要 16GB VRAM 才塞得下 256k kv cache,但如果你只用 1 09/03 15:17
33F:→ CoNsTaR: 28k context 虽然有点小,但 8GB 就够了 09/03 15:17
34F:推 CoNsTaR: 然後有一个 AtomicChat 的 quant 他的 Q4 因为把 per lay 09/03 15:25
35F:→ CoNsTaR: er embedding 也算进 bpw,然後又用 bpw 来命名,所以只 09/03 15:25
36F:→ CoNsTaR: 要 56GB RAM 就可以跑 "Q4",虽然没有统一的 KLD 跑分, 09/03 15:25
37F:→ CoNsTaR: 但是其他人的 Q4 KLD 大概都是 0.04,AtomicChat 的 Q4 09/03 15:25
38F:→ CoNsTaR: 是 0.08,比其他人的 divergence 高了一倍,但如果 RAM 09/03 15:25
39F:→ CoNsTaR: 吃紧,用 AtomicChat 的 quant 只要 16GB VRAM + 56GB R 09/03 15:25
40F:→ CoNsTaR: AM 也能号称跑 Q4(但实际上更像 IQ2 或 IQ3) 09/03 15:25