作者seal46825 (Vanish)
看板Tech_Job
标题[讨论] 为何机器人AI不透过强化式学习训练?
时间Wed Oct 16 23:54:43 2024
刚刚看了YouTube 介绍特斯拉Optimus的影片
里面提到特斯拉里面有50位人员
专门用VR装置去操控Optimus
去执行某修动作 例如分类物品
然後就可以透过这些动作训练模型
但是跟特斯拉成千上万个车子数据比起来
这只能算是小巫见大巫
那我就好奇 为什麽机器人不透过强化式学习的方式去训练
如同训练AI玩游戏一样
可以给个很明确的计分方式
然後让AI自己去玩游戏
只要规则够明确 AI自己就可以训练练到很强
同样道理 我让一颗球放在一个发射平台
会自动弹出 然後球上有晶片
只要机器人可以在越短的时间去把球捡回来
他就可以得到高分
如此一来他就可以去学习如何快速辨识球的位置
如何规划路线 如何最佳应用他的身体
然後快速把球捡起来 放回发射平台
这样作法的好处是可以做出成千上万台机器人
让他们自己去训练 一年365天24小不停歇
这样就能产生大量数据 快速精进机器人AI模型
同样的模式还可以特用的很多事情上
所以为何现在的机器人公司不这样做
要用真的人去训练搜集数据呢?
还是其实有在做了?
-----
Sent from JPTT on my iPhone
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 123.192.92.120 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Tech_Job/M.1729094085.A.D1F.html
1F:→ drkkimo : 你怎麽知道没有人作这个? 10/17 00:03
原来已经有了吗?
2F:推 HaHaPoint : 因为不把真人互动加进训练的话 你会训练出杀人机器 10/17 00:04
如果任务能成功达成 好像也不失为一个方法? 只是任务怎麽定义就很重要
3F:→ HaHaPoint : 或是大法师那样走路的机器人 因为那样比较有效率 10/17 00:04
※ 编辑: seal46825 (123.192.92.120 台湾), 10/17/2024 00:05:46
※ 编辑: seal46825 (123.192.92.120 台湾), 10/17/2024 00:06:44
4F:→ DrTech : 这在机器手臂取物都做到烂的事情… 10/17 00:22
5F:→ peter3354152: 上网搜寻robotic deep reinforcement learning 应 10/17 00:25
6F:→ peter3354152: 该会有一堆paper 10/17 00:25
7F:→ DrTech : 另外,RL 训练实体动作极差,成本极高。通常都是先 10/17 00:26
8F:→ DrTech : 建立模拟环境,跟本不是你文中的直接physical去碰撞 10/17 00:26
9F:→ DrTech : 训练。 10/17 00:26
10F:→ DrTech : 你这些说法根本就是外行,连训练成本,效率,都不考 10/17 00:28
11F:→ DrTech : 虑。训练一个动作,RL随意碰撞,机器人先坏100台, 10/17 00:28
12F:→ DrTech : 外行人傻了才这样想。 10/17 00:28
13F:→ seal46825 : 我的确是外行 对AI好奇整天乱看而已 问题是如果要叫 10/17 00:32
14F:→ seal46825 : 几千万个真人去搜集数据 成本不会比较低啊 除非可以 10/17 00:32
15F:→ seal46825 : 跟特斯拉车子一样发展出可以让人去操控机器人的商业 10/17 00:32
16F:→ seal46825 : 模式 10/17 00:32
17F:→ seal46825 : 用第一性原理去思考 这个没道理做不到 我认为马斯克 10/17 00:33
18F:→ seal46825 : 肯定也有想过 至於为什麽我们没看到有两个原因 一个 10/17 00:33
19F:→ seal46825 : 是其实有做 但我们不知道 第二个是其实有什麽大瓶颈 10/17 00:34
20F:→ seal46825 : 在 这就是我好奇的地方 10/17 00:34
21F:推 kevin0210 : 这个问题我觉得蛮优的 10/17 00:50
22F:推 chang1248w : 它们是先在模拟环境练了几万年才放出来现实世界的 10/17 01:00
23F:推 mrsix : 毕竟是泛用型的人形机器人,日後可能会用於长照或 10/17 01:01
24F:→ chang1248w : 现在在做的是类似GPT一样透过人类行为微调 10/17 01:01
25F:→ mrsix : 托儿,这种与人类互动的行为得由人类亲自教导,而 10/17 01:01
26F:→ mrsix : 不是机器自己训练自己。 10/17 01:01
27F:→ mrsix : 有样东西叫人因工程 10/17 01:02
28F:→ chang1248w : 请工人一来不划算,二来把工人的行为转换成机器人 10/17 01:02
29F:→ chang1248w : 能用的数据太贵了 10/17 01:02
30F:→ mrsix : 而且特斯拉机器人现在应该还不敢做跑步之类的快速 10/17 01:03
31F:→ mrsix : 动作,撞到人蛮糟糕的。 10/17 01:03
32F:→ chang1248w : 一个机器人是数十个关节的马达还有感知器在协同, 10/17 01:03
33F:→ chang1248w : 只有人类操作工具的影像根本不够 10/17 01:03
34F:→ chang1248w : 模拟环境里应该能做到跑,只是现实与模拟的误差还 10/17 01:05
35F:→ chang1248w : 没调教过来 10/17 01:05
36F:推 mrsix : 应该不是影像,而是透过远端遥控的方式训练 10/17 01:05
37F:→ yunf : 全部都给你说完了他要赚什麽 10/17 01:07
38F:推 mrsix : 黄仁勳来台湾那个发表会不是提到Omniverse之类的孪 10/17 01:07
39F:→ mrsix : 生模型来训练机器人 10/17 01:07
40F:→ yunf : 他就是要像m$一样慢慢地渗透到你国家的每一个角落然 10/17 01:08
41F:→ yunf : 後再更新收费 10/17 01:08
42F:→ yunf : 一下就到达完全体 马上就被抄走了 10/17 01:08
43F:推 wwewcwwwf : 有阿 记得所罗门 吹边缘学习3年了 不知学到哪了 10/17 01:20
44F:推 aria0520 : lecun提的世界模型路线可以了解一下 10/17 01:26
45F:→ yunf : 台湾公司就不用看了连日本都打不赢 10/17 01:29
46F:→ yunf : 不然就是才刚有创新的时候就被买走 10/17 01:30
47F:→ yunf : 不要说机器人能长照好嘛笑死人了 10/17 01:42
48F:→ yunf : 没照顾过老人的才会嘴炮说机器人长照 10/17 01:43
49F:→ yunf : 如果是这样的话东协那些都不用发展了 10/17 01:43
50F:→ yunf : 专心训练ai就好 10/17 01:43
51F:→ DarkIllusion: 用RL做机器人策略有奖励稀疏、sim2real gap问题,有 10/17 01:54
52F:→ DarkIllusion: 人类展示当训练资料是最好的 10/17 01:54
53F:→ yunf : 你讲的这个二十年後做不做的出来还是个问题 10/17 02:03
54F:→ yunf : 更何况要能用得起 10/17 02:04
55F:→ yunf : 现在玩的都还是刚草创而已 10/17 02:05
56F:→ yunf : 电力就不够了 10/17 02:05
57F:→ yunf : 其实这也都是个骗局 10/17 02:05
58F:→ yunf : 要够不够都取决於他要怎麽用 10/17 02:05
59F:→ yunf : 经济部也只能瞎找电 10/17 02:06
60F:→ yunf : 真的管制谁在用演算法的那个人才是关键 10/17 02:07
61F:→ yunf : 你们要想想在这个赛局最後 10/17 02:09
62F:→ yunf : 投入那麽多 10/17 02:09
63F:→ yunf : 你能否真的完全拥有一个堪用的机器人? 10/17 02:10
64F:→ yunf : 还是又是帮人养老婆? 10/17 02:10
65F:→ yunf : 这些资料库云端都不是台湾本身的技术台湾都是搞些 10/17 02:11
66F:→ yunf : 有名无实的代工 10/17 02:11
67F:→ Zepho : 例如球发射後卡在天花板 照你说的训练 机器人永远 10/17 03:44
68F:→ Zepho : 不可能找到方法把球拿下来 10/17 03:44
69F:→ yunf : 没有什麽是永远的 10/17 03:59
70F:→ yunf : 不过我想到的事情你还没想到 10/17 03:59
71F:→ yunf : 你是否能拥有一个堪用的机器人? 10/17 03:59
72F:→ yunf : 说不定20年後你都还等不到你想要的那种 10/17 04:00
73F:→ yunf : 20年後你的主权还剩多少? 10/17 04:02
74F:→ yunf : 你懂他们真的想要的是什麽吗? 10/17 04:03
75F:嘘 Coslate : 现在一堆做MBRL 念书很难? 10/17 04:21
76F:推 molopo : 用讲的很简单 10/17 06:16
77F:嘘 KuoJia : 哪里没有?对岸也都在做 你可能是指agi强人工智慧吧 10/17 06:27
78F:→ KuoJia : ? 10/17 06:27
79F:→ WenliYang : 机器人世界 还早得很 死前都不会发生 10/17 06:44
80F:嘘 SilverFocus : 怎麽会有人天真的觉得只有自己想到? 10/17 07:05
81F:→ dildoe : 连搞游戏都有逆运动了 何不用现成的?XD 10/17 07:55
82F:嘘 neon7134 : 典型的没资本没脑袋 还一天到晚以为人家都想不到我 10/17 08:17
83F:→ neon7134 : 的方法好笨 10/17 08:17
84F:嘘 ian41360 : 机器人:把乱丢球的猴子杀了就不用捡球了 10/17 08:30
85F:嘘 kkes0001 : 多看点论文 10/17 08:42
86F:→ kkes0001 : 蠢不是问题,问题是不会查资料 10/17 08:42
87F:→ auther : google 的桌球机器人 paper 就是这样啊 10/17 08:49
88F:推 ohlong : RL没有比学真人来得快 像tesla这次vr操控机器人的 10/17 09:31
89F:→ ohlong : 方式 其实也是可以拿来建data去training 10/17 09:31
90F:嘘 JJiaK : 你怎麽知道没有? 10/17 09:49
91F:推 jimmytzeng : 强化学习用在机器人上已经很多人在做了呀 10/17 11:00
92F:推 gogogogo3333: llm/vlm is based on RLHF for long time. 10/17 12:25
94F:→ Jmoe : 这个很多人做了.. 10/20 14:37
96F:→ yunf : 哪天变成讨债机器人 10/22 23:08
97F:→ yunf : 远端查封你财产 10/22 23:08