阿尔法狗再进化自学3天就100：0碾压李世石版旧狗-ob体育在线下注-ob体育app下载最新官网入口

“这些技术细节强于此前版本的原因是，我们不再受到人类知识的限制，它可以向围棋领域里最高的选手——AlphaGo自身学习。” AlphaGo团队负责人大卫？席尔瓦（Dave Sliver）说。

据大卫？席尔瓦介绍，AlphaGo Zero使用新的强化学习方法，让自己变成了老师。系统一开始甚至并不知道什么是围棋，只是从单一神经网络开始，通过神经网络强大的搜索算法，进行了自我对弈。

随着自我博弈的增加，神经网络逐渐调整，提升预测下一步的能力，最终赢得比赛。更为厉害的是，随着训练的深入，DeepMind团队发现，AlphaGo Zero还独立发现了游戏规则，并走出了新策略，为围棋这项古老游戏带来了新的见解。

首先，AlphaGo Zero仅用棋盘上的黑白子作为输入，而前代则包括了小部分人工设计的特征输入。

其次，AlphaGo Zero仅用了单一的神经网络。在此前的版本中，AlphaGo用到了“策略网络”来选择下一步棋的走法，以及使用“价值网络”来预测每一步棋后的赢家。而在新的版本中，这两个神经网络合二为一，从而让它能得到更高效的训练和评估。

阿尔法狗再进化自学3天就100：0碾压李世石版旧狗