AlphaZero(アルファゼロ)とは

AlphaZeroとは、チェス、将棋、囲碁を、ゲームの基本ルールと自分自身との対戦から学んだGoogle DeepMindAIシステムです。人が過去の棋譜や定石を大量に教える代わりに、自己対戦で勝ち方を発見する点が特徴。

どのように次の一手を決めるのか?

ニューラルネットワークが、有望な手と最終的な勝敗を予測します。その予測を手掛かりに、モンテカルロ木探索という方法で将来の手順を絞り込みます。直感に近い予測と、先を読む探索を組み合わせる仕組み。

DeepMind2018年12月6日の発表では、学習にチェス9時間、将棋12時間、囲碁13日を使いました。ChatGPTの一般公開より約4年前の研究。チェスは4時間、将棋は2時間、囲碁は30時間の自己対戦後に、それぞれの比較対象を上回ったと報告されています。

AlphaGoと何が違うのか

AlphaGoは囲碁を対象に開発され、初期版では人間の棋譜も学習しました。AlphaZeroは一つの考え方をチェス、将棋、囲碁へ適用し、最初に与える知識を各ゲームの基本ルールへ絞っています。特定競技の攻略法より、学習の仕組みを共通化した点に意味があります。

ただし、ルールが明確で、勝敗を自動判定でき、自己対戦を大量に繰り返せる盤上ゲームでの成果。目的が曖昧で試行の費用が高い現実業務へ、そのまま当てはめることはできません。業務利用では安全なシミュレーションと評価指標が必要です。

Topic将棋で王を盤の中央へ動かした

DeepMindの公式解説は、AlphaZeroが将棋で王を盤の中央へ動かした局面を紹介しています。一般には危険に見える手でしたが、羽生善治氏は、最終的に局面を制御しているように見えたと評しました。人の定石を暗記せず自己対戦したことで、見慣れない手順が生まれた例です。

AlphaZeroに関するよくある質問

AlphaZeroは現在も利用できる製品ですか?
一般企業向けに契約する業務製品ではなく、DeepMindが研究成果として発表したAIシステムです。論文や公式解説を通じて学習方法と評価結果が公開されています。
AlphaZeroは人間の棋譜をまったく使わないのですか?
AlphaZeroの学習は人間の対局データではなく自己対戦が中心です。ただし、ゲームの基本ルールや利用できる手は与えられており、何もない状態から学ぶわけではありません。
AlphaZeroの方法を経営判断へ使えますか?
勝敗とルールを自動判定できる盤上ゲームとは条件が違います。業務では、試行を安全に再現できるか、報酬が現実の目的をゆがめないかを先に検証する必要があります。

あわせて読みたい記事