AlphaGo Zero是Google DeepMind圍棋軟體AlphaGo的最新版。2017年10月19日,AlphaGo团队在《自然》上发表文章介绍了AlphaGo Zero,文中指出此版本不採用人类玩家的棋譜,且比之前的所有版本都要强大。通过自我对弈,AlphaGo Zero在三天内以100比0的戰績战胜了AlphaGo Lee,花了21天达到AlphaGo Master的水平,用40天超越了所有旧版本。DeepMind联合创始人兼CEO杰米斯·哈萨比斯说,AlphaGo Zero不再受限于人类认知,很强大。由于专家数据「經常很贵、不可靠或是無法取得」,不借助人类专家的数据集训练人工智能,对于人工智能开发超人技能具有重大意义,因為這樣的AI不是學習人,是透過對自我的反思和獨有的創造力直接超越人類。文章作者之一戴维·西尔弗表示,摒弃向人类学习的需求,这有可能是对现有人工智能算法的拓展。
训练
AlphaGo Zero神经網路使用TensorFlow在64个GPU和19个CPU参数服务器训练,推理的TPU只有四个。神经網路最初除了规则,对围棋一无所知。AI进行“非监督式学习”,自己和自己对弈,直到能预测自己的每一手棋及其对棋局结果的影响。前三天,AlphaGo Zero连续自我对弈490万局。几天之内它就发展出击败人类顶尖棋手的技能,而早期的AlphaGo要达到同等水平需要数月的训练。为了比较,研究人员还用人类对局数据训练了另一版AlphaGo Zero,发现该版本学习更加迅速,但从长远来看,表现反而较差。
应用
哈萨比斯表示,AlphaGo的算法对需要智能搜索巨大概率空间的领域建树最大,如蛋白质折叠或精准模拟化学反应。对于很难模拟的领域,如学习如何开车,用处可能相对较低。悉尼大学的说AlphaGo Zero是“巨大的技术进展”,带领我们进入“未至之地”。
然而,纽约大学心理学家对我们目前所知的则表示谨慎,AlphaGo或许包括“程序员如何建造一台解决围棋等问题的机器的隐晦知识”,在确保它的基础结构比玩围棋时更有效率之前,它需要在其他的领域受检测。相反,DeepMind“自信这种方法可以归纳至更多的领域中”。”中国职业棋手柯洁在他的微博上表示:“一个纯净、纯粹自我学习的AlphaGo是最强的……对于AlphaGo的自我进步来讲……人类太多余了。”
历史版本比较
参考
- AlphaZero
- ELF OpenGo
- Leela Zero
- Minigo
- PhoenixGo
参考资料
外部連結
- [https://deepmind.com/blog/alphago-zero-learning-scratch/ AlphaGo blog]
- [https://www.nature.com/articles/550336a.epdf?shared_access_token=QbXlOw9nSIP_MS1moc_M0tRgN0jAjWel9jnR3ZoTv0PvinEKRXS2Dk736vL8i-Uo2-6AN8KRxOlLhDGorUgFzEgC3fwrX95r3LQ7u2FBwQ5axjmpMSZrWg4i6D7_g5rV5ze0zLhgo4jufsSKL-UZmw%3D%3D Nature news on AlphaGo Zero]
- [https://www.nature.com/articles/nature24270.epdf?author_access_token=VJXbVjaSHxFoctQQ4p2k4tRgN0jAjWel9jnR3ZoTv0PVW4gB86EEpGqTRDtpIz-2rmo8-KG06gqVobU5NSCFeHILHcVFUeMsbvwS-lxjqQGg98faovwjxeTUgZAUMnRQ Full nature article on AlphaGo Zero]
- [http://www.alphago-games.com/ AlphaGo Zero Games]
- [https://www.reddit.com/r/MachineLearning/comments/76xjb5/ama_we_are_david_silver_and_julian_schrittwieser/ AMA on Reddit]
评论 (0)