AlphaZero是DeepMind所開發的人工智能軟體。
簡介
AlphaZero使用與AlphaGo Zero類似但更一般性的演算法,在不做太多改變的前提下,並將演算法從圍棋延伸到将棋與國際象棋上。AlphaZero與AlphaGo Zero不同之處在於:
- AlphaZero的超参数是寫死的。
- AlphaZero現在會不斷更新人工神经网络。
- 圍棋在某些情況是對稱或是可旋轉的,AlphaGo Zero的程式利用這個特性降低計算複雜性,AlphaZero因為延伸到將棋與國際象棋則拿掉了這段程式。
- 西洋棋有已知的和局,所以AlphaZero利用這個終局資料庫納入計算。
與Stockfish以及elmo的比較
AlphaZero基於蒙特卡洛树搜索,每秒只能搜尋8萬步(西洋棋)與4萬步(將棋),相較於Stockfish每秒可以7000萬步,以及每秒可以3500萬步,AlphaZero則是利用了類神經網路提昇了搜尋的品質。
訓練
AlphaZero使用了5,000顆第一代的TPU進行訓練。
成績
西洋棋
在4小時的訓練後(約自我訓練4400萬局),AlphaZero以28勝72和0敗的成績打敗Stockfish。
將棋
在12小時的訓練後(約自我訓練2400萬局),AlphaZero以90勝2和8敗的成績打敗。
圍棋
在34小時的訓練後(約自我訓練2100萬局),AlphaZero以60勝40敗的成績打敗AlphaGo Zero。
相關連結
- AlphaGo Zero
- DeepMind
- ELF OpenGo
- KataGo
參考資料
外部連結
- [https://arxiv.org/abs/1712.01815 Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm],AlphaZero的論文。
- [https://deepmind.com/research/alphago/alphazero-resources/ Game Downloads],AlphaZero與西洋棋軟體Stockfish的對弈記錄。
- [https://www.youtube.com/watch?v=akgalUq5vew&list=PL-qLOQ-OEls607FPLAsPZ6De4f1W3ZF-I Chess.com Youtube playlist for AlphaZero vs. Stockfish]
评论 (0)