作者yamiyodare (shantotto)
看板StarCraft
标题Re: [情报] Google AI 打星海
时间Thu Nov 10 04:33:23 2016
※ 引述《ousapas (komica123)》之铭言:
: https://www.youtube.com/watch?v=5iZlrBqDYPM
: Google DeepMind团队刚刚释出使用Deep Learning技术玩星海2画面
: 和传统战略游戏AI不同之处是
: 这个AI和人类一样是根据目前看到的画面做判断
: 而不是根据游戏内部数据
DeepMind 团队在做出 AlphaGo 之前就已经把 Atari 游戏都玩了一遍
大约有一半以上的游戏可以超越人类 Pro 的水平
远超过人类水平的像是打砖块
https://www.youtube.com/watch?v=V1eYniJ0Rnk
这种学习方法特殊的地方在於直接把画面丢进去学, 而且不需有人类指导.
以打砖块来说, 一开始是随机移动, 之後反馈分数强化类神经网路连结.
AI 不知道甚麽是砖块, 甚麽是球, 甚麽是板子, 也不知道要去接球.
它只知道在某种画面下应该下某个指令 (让板子往左或右) 很可能会提高分数.
当 AI 不停地玩, 看过的画面越多, 越知道要怎麽反应.
神奇的地方在於训练几个小时之後, AI 知道开出一条隧道可以有效提高分数.
没有人教它, 这是它不断尝试各种移动方式後自己 "想" 出来的.
围棋变化太多, 一开始随机落子学习太慢, 所以 AlphaGo 先学业余高段的棋步.
以打砖块来说, 类似先告诉 AI 在哪些画面下应该往哪边动.
之後再透过自我对弈重复训练, 变化出各式各样的盘面 (画面) 尝试各种下一步,
反馈终盘的胜负让 AI 知道下哪些地方比较可能赢, 以後尽量下那些地方.
星海的变化也是很多, 要从随机指令开始学起恐怕也是很难.
完全随机会经历探测机乱逛不挖矿, 乱盖建筑物这种惨况很久一段时间.
所以我猜星海会从天梯高阶 RP 开始学, 工兵会先乖乖挖矿或是探路或 all in.
4BG, 2BG 接各种一波, 裸双, 双 VS, 光炮快攻等 RP 有的招数会先拿出来尝试.
透过自我对练了各种战术对应的方式衍生各种变化, 最後也会出现没看过的战术.
星海有个跟围棋差异很大的地方是因为有战争迷雾无法获得完全资讯.
这也可能是 DeepMind 为什麽选择它来挑战的原因.
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 114.24.29.2
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/StarCraft/M.1478723605.A.F01.html
1F:→ wyiwyi: 我觉得阿法狗比较适合打英雄联队.... 11/10 07:22
2F:推 Adonisy: 其实天梯上没人的现象可以用阿法狗撑给人场 11/10 09:21
3F:推 kuoll: 以上次围棋的经验 Alphago对决一人就需要庞大的硬体资源 11/10 09:51
4F:→ kuoll: 恐怕无法负担天梯的人数 11/10 09:51
5F:推 Adonisy: 其实星海原本的电脑AI训练他们回垃圾话就好了... 11/10 09:54
6F:→ lovinlover: 只要不是极致条件下 AlphaGO用不了庞大资源 11/10 10:28
7F:→ lovinlover: AlphaGO自己对弈一天可以上千盘 运算上不是问题 11/10 10:29
8F:推 Pony5566: 阿法狗不是有分连机版跟单机版? 11/10 11:11
9F:推 win4104: 说不定多人对战其实已经偷偷混了几盘 AlphaGO 11/10 11:44
10F:→ win4104: 用来采样 只是一般人分不出来(? 11/10 11:44
11F:→ win4104: 然後等实验结束才告诉你 这ID其实是 AI 把你打爆的不是人 11/10 11:45
12F:推 dispatchadv: 我有时候想那些秒退 or 60秒退的天梯对手是否是bot 11/10 21:51
13F:推 peacedove: 如果天梯上用最强的alphago,应该一下就没人要打天梯了 11/11 10:37
14F:推 ben1357956: 等很久啦什麽时候要pk 11/11 12:24
15F:→ APM99: 阿法狗不会影响天梯 又不是高端整天去玩青铜号打到大师 11/11 12:28
16F:推 iwinlottery: Alpha go人类开场就一两只工兵极限抄对手家有机会吗 11/11 14:51