作者zxwxz (zxwxz)
看板Tech_Job
标题Re: [讨论] OpenAI GPT o1模型
时间Wed Sep 18 11:19:17 2024
OpenAI 最近推出了 GPT-o1,但很多人可能还没意识到这件事的严重性。事实上,OpenAI
已经找到了一条通往 AGI(通用人工智慧)的阶梯!这个新模型的关键在於,它已经整合了
ToT(思维树)和 RL(强化学习),在大型语言模型(LLM)领域达到了类似 AlphaGo Zer
o 的水准。
很多人以为 LLM 就是个「刷题机器」,记住了大量的资料,所以我们在人类记忆力上输了
。但这种想法只能说对一半。之前的 LLM 确实是从大量资料中,透过模式相似性来猜测答
案。模型够大,猜得也够准,但一旦遇到需要推理和逻辑的超长尾问题,就挂了。没有连贯
的推理能力,肯定解不出来。
然而,o1 模型的训练方式完全不同。它花了大量时间在模型微调上,让模型针对已知的问
答,把所有的思考过程(CoT)都想出来。网路上很多资料只有问题和答案,中间的推理过
程要嘛没有,要嘛只提重点。这些都是靠强化学习逼出来的。
如果有兴趣,建议大家读一下 OpenAI 官网的技术报告和论文:
https://openai.com/index/weak-to-strong-generalization/
。重点在这句:「当我们用这种方法,用 GPT-2 级别的模型来监督 GPT-4 在 NLP 任务上
的表现,结果模型的性能通常介於 GPT-3 和 GPT-3.5 之间。」
在这种新机制下,OpenAI 已经不需要再从网路抓资料了。他们可以透过 LLM 之间的互动,
产生问题和答案,进行更广泛、更完整的训练。而且这种训练方式相当於,你虽然只学过小
学数学,但经过长时间的策略搜索和 ToT 机制,类似於 System 2 的思考,你可以解出国
中数学题。
当这些能力达到单一模型的算力极限时,可以透过扩大模型,把新知识装载进更大的模型,
透过 Transformer 达成 System 1 思考的嵌入。这就像学好国中数学的新模型,开始挑战
高中数学。提升智力的方式是无限的,只受限於你的 GPU 算力。
你知道吗,OpenAI 在解决 AIME 2024 的最新题目时,没有任何过去的考古题可参考,里面
的推导公式连他们的员工都看不懂。难道还有人以为 AI 是靠背题目来解答的吗?
※ 引述 《wsad50232 (GGYY)》 之铭言:
: 标题: Re: [讨论] OpenAI GPT o1模型
: 时间: Tue Sep 17 12:46:33 2024
:
:
: 不就是语言模型+题库
:
: 题库1000题不够,那就10000题
: 一万题不够,那就10万题
: 看你人的脑袋能装多少题库 拼的过吗?
:
: 但是对那些非一般性的
: 面向多的,没有标准答案的
: 个别性强,特殊场合,网上找不到答案的
: 资料不足,不完善的
:
: AI 就嗝了
:
: 某小气公司 难得花了大钱 买了Licence
: 打算明年缩减一半的人力来完成更多的工作
:
: 只能说这些早就不碰技术的高层
: 异想天开 脑袋装屎
:
: AI 能解的问题 人工早就解了
: 人工不能解的 AI 也不能解
: 但是AI会唬烂很多行不通的答案
: 来浪费人工去验证
:
: --
:
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 118.166.194.68 (台湾)
: ※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Tech_Job/M.1726548395.A.EEB.html
: 推 sdbb : 有卦有推 09/17 12:51
: → bnn : 小气公司砍掉底层人力正好最适合 09/17 13:01
: 推 alittleghost: 反而没有标准的才是genai的强项 09/17 14:02
: 推 holebro : 哪间 09/17 14:24
: 嘘 zxc0312 : 喔喔喔喔喔这麽会算喔 那帮我算一下怎麽从重划台北 09/17 15:17
: → zxc0312 : 万华区 总投资五年回收哦 09/17 15:17
: 推 tim82518 : 哪间 09/17 16:21
: → strlen : 其实这次o1似乎就是AI自己出题自我训练了 09/17 16:44
: 推 abc0922001 : ChatGPT plus 一个月 20 美金而已 09/17 17:04
: ※ 编辑: wsad50232 (118.166.194.68 台湾), 09/17/2024 18:37:28
: → chin7521 : 人工不能解的不就请再多人也没有 09/17 20:10
: 嘘 aszx4510 : LLM都出来这麽久了怎麽还有人在讲题库 09/17 20:24
: 推 rnoro : LLM都出来这麽久了,怎麽还有人搞不懂就是题库。。 09/17 23:29
: 推 rnoro : LLM就是超大接龙,哪来的什麽智慧,话术行销是一回 09/17 23:32
: → rnoro : 事,搞清楚他能做什麽做不到什麽很要紧,LLM可以搞 09/17 23:32
: → rnoro : 一些从1到5的东西,从0到1就没辄了。如果现在人搞不 09/17 23:33
: → rnoro : 不出来但是机器搞得出来代表问题本质就是排列组合 09/17 23:34
: → rnoro : 人搞不出来机器也搞不出来,那就得靠真功夫想些新 09/17 23:34
: → rnoro : 东西了 09/17 23:34
: 推 lemonsheep : 但0到1是基础学科研究在做的 一般工程师甚至整个公 09/18 00:47
: → lemonsheep : 司都是在做1到5的事啊 有哪位的code不是套既有演算 09/18 00:47
: → lemonsheep : 法而是自己想出比既有演算法更好复杂度的写法吗? 09/18 00:47
: 嘘 Izangel : 天气预测/蛋白质结构预测/候选药物预测是文字接龙吗 09/18 00:57
: → Izangel : ?笑死。 09/18 00:57
: 嘘 rnoro : 什麽时候LLM做天气预测了。。。 09/18 03:21
: → rnoro : 现在所谓的ai只是把问题想办法塞进目前可以训练的 09/18 03:22
: → rnoro : 框架,其本质是统计,哪来什麽扯淡智慧,统计没什麽 09/18 03:23
: → rnoro : 不好,只是要搞清楚哪些是话术哪些是搞得出来的东西 09/18 03:23
: → rnoro : 现在动不动就恐吓人什麽agi,吓唬谁呢 09/18 03:23
: → strlen : 还在统计...看来是个完全不懂alexnet的朋友呢 09/18 08:44
: 推 Csongs : 小气的小公司吗 09/18 08:48
: → john65240 : 真的,看不懂的只能说你还不懂AI是什麽 09/18 08:49
: 嘘 whatzup1124 : 还在题库哦 机率是什麽你们懂吗 09/18 11:02
: → whatzup1124 : 分类问题你们懂吗 09/18 11:02
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 42.72.188.192 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Tech_Job/M.1726629560.A.FD5.html
1F:→ somerabbit : 工作上一个ticket 用了cursor + o1 preview, 1个小 09/18 11:30
2F:→ somerabbit : 时就做完了 答案还很完美。 令人惊艳的是它可以快 09/18 11:30
3F:→ somerabbit : 速阅读很多files 然後思考 并准确的给出答案 09/18 11:30
4F:推 OyodoKai : 现在报名水电学徒还来的急吗 09/18 11:33
5F:→ zxwxz : 我觉得Orion 出来之後可能是agent 完整体,到时可 09/18 11:34
6F:→ zxwxz : 能不用外挂任何写code框架就可以搞定 09/18 11:34
7F:→ ma721 : 9.9 vs 9.11 09/18 11:35
8F:→ zxwxz : 9.9 vs 9.11还有几个r在strawberry 中都属於token 09/18 11:44
9F:→ zxwxz : 切割的蠢问题,不会是o1要处理的重点,觉得AI很愚 09/18 11:44
10F:→ zxwxz : 蠢的可以继续开心很多年 09/18 11:44
11F:推 HiHiCano : 乐见Ai取代人类 不然每天工作好累 09/18 11:50
12F:→ fallcolor : 让llm出题做rl很合理,可是给reward的 label从哪来 09/18 11:52
13F:→ fallcolor : 呢? 如果还是需要人为prompt介入,本质上不算agi 09/18 11:52
14F:→ fallcolor : 吧 09/18 11:52
15F:推 NTHUlagka : 真的 未来那些system design跟软体开发上的know ho 09/18 12:02
16F:→ NTHUlagka : w, gpt会也只是时间上的问题了 现在报名水电还来得 09/18 12:02
17F:→ NTHUlagka : 及吗 感觉SWE的生存空间要被压缩了QQ 09/18 12:02
18F:→ zxwxz : 新的rl已经不需人类介入,不是rlhf。你要仔细参考 09/18 12:03
19F:→ zxwxz : 我贴的那篇才知道可能的做法,以下仅是个人猜测, 09/18 12:03
20F:→ zxwxz : 一开始应该会先以gan为基底方法,有题目有答案但没 09/18 12:03
21F:→ zxwxz : 有cot,训练时要求llm提供完整cot,然後把每步骤的 09/18 12:03
22F:→ zxwxz : cot都拆解成独立证明提要求critic llm把关,如果证 09/18 12:03
23F:→ zxwxz : 明看不懂就得要求o1往下拆解到critic llm看得懂且 09/18 12:03
24F:→ zxwxz : 置信率要非常高。等到这步训练有成效之後,再请出 09/18 12:03
25F:→ zxwxz : 题o1出题给解答o1解,这时会依照既有知识堆叠出一 09/18 12:03
26F:→ zxwxz : 个复杂的长尾问题出来让o1自己解,进而不用再抓取 09/18 12:03
27F:→ zxwxz : 网路大量垃圾来训练model,资料墙问题也被攻克 09/18 12:03
28F:→ zzzxxxqqq : 9.9 vs 9.11 真的不重要.. 随便想想都知道 09/18 12:22
29F:→ zzzxxxqqq : 随便想像都知道 10年後有多可怕 -.- 09/18 12:23
31F:→ jeff85898 : 对模型做rl跟在prompt内加入CoT的差别是? 09/18 12:28
32F:推 kunyi : 好喔 09/18 12:35
33F:→ zxwxz : 在RL做COT与在PROMPT做COT有非常本质上的问题,就 09/18 12:56
34F:→ zxwxz : 是要如何验证COT是对的,你请gpt-4o 在复杂的数理 09/18 12:56
35F:→ zxwxz : 问题上做COT,他常常可以回个大概,但中间有步骤错 09/18 12:56
36F:→ zxwxz : 了或是太含糊,根本上COT本身会有非常严重的幻觉问 09/18 12:56
37F:→ zxwxz : 题,但你如果把COT拆解成一段一段让critic llm去解 09/18 12:56
38F:→ zxwxz : ,那中间是否有问题就很容易判定,再者有些说明跳 09/18 12:56
39F:→ zxwxz : 太快critic llm可能无法从先验知识解读,那就要进 09/18 12:56
40F:→ zxwxz : 一步请o1做问题拆分。 这单靠prompt是无法解决的, 09/18 12:56
41F:→ zxwxz : 我猜目前o1的一次推理中的cot中每个step都是一次单 09/18 12:56
42F:→ zxwxz : 独的inference ,当然还要配套MTCS,不然你会很容 09/18 12:56
43F:→ zxwxz : 易陷入长尾问题的local minimum 中 09/18 12:56
44F:→ zxwxz : 更正 是MCTS 09/18 12:58
45F:→ fallcolor : 也许可行吧,只是就算把cot分解critic要判断的还是 09/18 13:02
46F:→ fallcolor : 比alphago的critic估计胜率难很多,label品质不好 09/18 13:02
47F:→ fallcolor : 就不容易是一种稳定的训练方法。 09/18 13:02
48F:→ zxwxz : 我觉得可以可以让critic llm逐渐使用高置信率来评 09/18 13:08
49F:→ zxwxz : 断进而推升o1本体的能力,那每个cot可能就从对5个 09/18 13:08
50F:→ zxwxz : 晋升到对10个,进一步推升到整个chain都是对的。所 09/18 13:08
51F:→ zxwxz : 以o1可以不用一次inference对整串,他要确保的是在 09/18 13:08
52F:→ zxwxz : 每一个step正确性以及前後连贯性,如此就没有梯度 09/18 13:08
53F:→ zxwxz : 消失的问题 09/18 13:08
54F:推 qwe78971 : 太乐观 离AGI还远的 三维空间问题它没办法处理 09/18 13:11
55F:推 gogogogo3333: AGI is clearly here. But fine … Don’t look up. 09/18 13:31
56F:→ zxwxz : 三维空间无法解决的请看这链结 09/18 13:43
58F:→ qwe78971 : 蛮厉害的 不借助引擎完成 不过我是指real world 09/18 13:49
59F:→ zxwxz : 这次突破的关键可以看这个openai关键员工的演讲: 09/18 13:50
61F:推 aria0520 : stop the hype train, LLM is a dead end 09/18 14:01
62F:→ aria0520 : don't waste time on llm, go4 lecun's world model 09/18 14:01
63F:推 sdbb : 难得的优文,谢谢 09/18 14:05
64F:推 fallcolor : 读了论文,关键是让小模型指导大模型是放大模型更 09/18 14:23
65F:→ fallcolor : 好的泛化性,相当於用模型的先天表示力去补强标签的 09/18 14:24
66F:推 steak5566 : 请问现在开始练身体可以当比较有用的生物电池吗? 09/18 14:25
67F:→ Izangel : 三维不就李飞飞正在做的吗 09/18 14:25
68F:→ fallcolor : 先验了,好像有点道理。 09/18 14:25
69F:→ fallcolor : 改个错字,释放。 09/18 14:27
70F:推 lafel : 还有几个月可以逃呢 09/18 15:08
71F:推 tomatobus : 嘻嘻,结果工程师吹了半天AI取代医生,自己的工作先 09/18 15:16
72F:→ tomatobus : 被取代 09/18 15:16
73F:→ zxwxz : 不用逃了,即使是完整o1都算阉割版,他们内部大概 09/18 15:16
74F:→ zxwxz : 率已经有AGI level 4完整版在玩了,放不放出来只是 09/18 15:16
75F:→ zxwxz : 安全性评测与性价比问题 09/18 15:16
76F:→ houseguy : 什麽时候能发现新的微分方程有解析解的 09/18 15:45
77F:推 kkithh : AIME题目好像都可以用暴力硬解,用这来说AI比人厉害 09/18 16:07
78F:→ kkithh : ,欸豆,顶多说它算得快吧 09/18 16:07
79F:推 steak5566 : 可以reasoning代表所有人类讲逻辑的东西都可以取代 09/18 16:21
80F:→ steak5566 : 大概只剩律师法官? 09/18 16:21
81F:推 lantimes : 还好 钱 房子都存够了 09/18 16:57
82F:→ wtl : 所以小气公司真的可以用AI来缩减一半的人力? 09/18 17:07
83F:推 transforman : 瑟瑟发抖 现在考水电还来的及吗 09/18 17:10
84F:→ DrTech : 想太多了,目前所有测试LLM方式都是在"有标准答案" 09/18 17:14
85F:→ DrTech : 的情况。现实工作中,明明大部分的工作都是每标准答 09/18 17:14
86F:→ DrTech : 案,甚至看人心情的情形。 09/18 17:14
87F:→ DrTech : 没标准答案的工作,AI要怎麽训练与帮助你工作。 09/18 17:18
88F:→ DrTech : 目前的标准答案形式的AI,工厂的瑕疵检测都解不了了 09/18 17:20
89F:→ DrTech : 。 09/18 17:20
90F:→ DrTech : 连最基本的电子产品生产环节,任何一个制程发生issu 09/18 17:22
91F:→ DrTech : e,怎麽依照现场环境来出解答(一直都难以有标准答案 09/18 17:22
92F:→ DrTech : ),都做不了了。 09/18 17:22
93F:→ DrTech : AI生成任何标准答案,是正确的没错,而且可能比人写 09/18 17:27
94F:→ DrTech : 的好,但不代表是现实工作可采用,可被接受的。 09/18 17:27
95F:→ zxwxz : 现实不采用单纯是cp值与先验问题,这麽贵又还没有 09/18 17:55
96F:→ zxwxz : 人在商务上投产过,如果不能肯定创造更多价值或节 09/18 17:55
97F:→ zxwxz : 省成本,没有公司愿意尝试,但3年後我预估成本会比 09/18 17:55
98F:→ zxwxz : 现在低100倍,且有实际成功案例,到时大失业潮就会 09/18 17:55
99F:→ zxwxz : 来临 09/18 17:55
100F:推 Izangel : 蛋白质跟药物合成的标准答案是什麽?笑死。怎麽总有 09/18 18:10
101F:→ Izangel : 人把自己认为的就以为是AI的全部能力或定义? 09/18 18:10
102F:→ tgyhuj01 : 同理 所以如何证明当下人类的判断就一定是对的? 09/18 18:15
103F:→ tgyhuj01 : 一直用AI只会照表抄课来否定 那一堆标准订来让人类 09/18 18:19
104F:→ tgyhuj01 : 遵循的意义又是什麽 09/18 18:19
105F:→ tgyhuj01 : 不能完全替代不代表不能部分替代 09/18 18:21
106F:推 create8 : 感谢分享! 是时候去少林寺报名厨艺班了 09/18 18:48
107F:推 sdbb : 食神梗太老了 09/18 18:49
108F:推 hansioux : ARC-AGI 先对 85% 我再来担心 09/18 20:39
109F:推 utn875 : 感谢解说 09/18 20:45
111F:推 create8 : 只要有心,人人都可以是食神!! (振奋 09/18 20:57
112F:推 sdbb : 一切都是幻觉(AI也有),吓不倒我的 09/18 21:00
113F:推 spen2005 : Aime又不难 要说的话 deepmind还更强 09/18 21:08
114F:推 alvinlin : 总是有需要人的地方。只是会有中空期。 09/18 21:26
115F:推 likeyousmile: 推 09/18 22:55
116F:→ kiedveian : 有人说到token切割不属於它的问题,那是不是代表 09/18 23:03
117F:→ kiedveian : 就算发展的再强,也会因为token切错出大问题? 09/18 23:04
118F:→ zxwxz : token切割单纯是要节省算力,之後只要agent 挂上程 09/18 23:14
119F:→ zxwxz : 式工具,这些都是小问题 09/18 23:14
120F:→ rnoro : openai的报告真叫人唏嘘,现在连一行方程式都看不到 09/18 23:26
121F:→ rnoro : 了,要嘛实在太小气,要嘛没有数学上的新东西 09/18 23:27
122F:→ rnoro : 不管是哪个都让人失望。。。 09/18 23:27
123F:嘘 gsinin : 意识到严重性所以呢?你那边还来得及买便宜的台积电 09/19 00:58
124F:→ gsinin : 快买 09/19 00:58
125F:→ strlen : 就是没有标准答案才要靠AI啊 到底在说什麽啊 09/19 01:24
126F:→ strlen : 去想想当人类碰到没有标准答案的问题 是怎麽处理的 09/19 01:24
127F:→ strlen : 很简单 试阿 这里试试 那里试试 试到有一次打中问题 09/19 01:25
128F:→ strlen : 点了就解了 哪一个没标准答案的问题不是这种解法? 09/19 01:25
129F:→ strlen : 那试东西 机器绝对比人类快一百万倍吧 09/19 01:26
130F:→ kissa0924307: 天网的原型? 09/19 01:51
131F:推 hduek153 : 好期待人类被取代的那一天 十年内有机会吗 09/19 07:26
132F:→ chauan : 人是拿来负责任用的 09/19 08:44
133F:→ darkangel119: 人类是拿来当电池 ~~ 09/19 10:28
134F:推 jamesho8743 : 数学方面我觉得到最後不需要人来label AI是可以左 09/19 13:57
135F:→ jamesho8743 : 右互搏来比较认证 09/19 13:57