AlphaZero(アルファゼロ)とは

AlphaZeroとは、チェス、将棋、囲碁を、ゲームの基本ルールと自分自身との対戦から学んだGoogle DeepMindAIシステムです。人が過去の棋譜や定石を大量に教える代わりに、自己対戦で勝ち方を発見する点が特徴。

どのように次の一手を決めるのか?

ニューラルネットワークが、有望な手と最終的な勝敗を予測します。その予測を手掛かりに、モンテカルロ木探索という方法で将来の手順を絞り込みます。直感に近い予測と、先を読む探索を組み合わせる仕組み。

DeepMind2018年12月6日の発表では、学習にチェス9時間、将棋12時間、囲碁13日を使いました。ChatGPTの一般公開より約4年前の研究。チェスは4時間で当時の世界チャンピオンプログラムStockfish、将棋は2時間で同じくelmo、囲碁は30時間で2016年にイ・セドル氏を破ったバージョンのAlphaGoを、それぞれ上回ったと報告されています。

AlphaGoと何が違うのか

AlphaGoは囲碁を対象に開発され、初期版では人間の棋譜も学習しました。AlphaZeroは一つの考え方をチェス、将棋、囲碁へ適用し、最初に与える知識を各ゲームの基本ルールへ絞っています。特定競技の攻略法より、学習の仕組みを共通化した点に意味があります。

ただし、ルールが明確で、勝敗を自動判定でき、自己対戦を大量に繰り返せる盤上ゲームでの成果。目的が曖昧で試行の費用が高い現実業務へ、そのまま当てはめることはできません。業務利用では安全なシミュレーションと評価指標が必要です。

Topic将棋で王を盤の中央へ動かした

DeepMindの公式解説には、羽生善治九段の評が載っています。王を盤の中央へ動かすような手は将棋の定跡に反し、人の目にはAlphaZero自身を危険な位置へ置いたように映るものの、それでも盤面を支配し続けている、という指摘です。羽生九段は、その独特の棋風が将棋に新しい可能性があることを示していると続けました。

AlphaZeroに関するよくある質問

AlphaZeroは現在も利用できる製品ですか?
一般企業向けに契約する業務製品ではなく、DeepMindが研究成果として発表したAIシステムです。論文や公式解説を通じて学習方法と評価結果が公開されています。
AlphaZeroは人間の棋譜をまったく使わないのですか?
AlphaZeroの学習は人間の対局データではなく自己対戦が中心です。ただし、ゲームの基本ルールや利用できる手は与えられており、何もない状態から学ぶわけではありません。
AlphaZeroの方法を経営判断へ使えますか?
勝敗とルールを自動判定できる盤上ゲームとは条件が違います。業務では、試行を安全に再現できるか、報酬が現実の目的をゆがめないかを先に検証する必要があります。

あわせて読みたい記事