非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

AlphaGo ZeroとFOOM論争

原題: AlphaGo Zero and the Foom Debate / Analysis

原文クレジット(WordPress投稿者表示): Eliezer Yudkowsky / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2017-10-20

訳文状態: 校閲済み(原文対照レビュー実施)

AlphaGo Zeroは4基のTPUを使い、人の手で設計した特徴量を使わず、全体がニューラルネットワークでできています。専門家の棋譜をはじめ、人間由来のものによる事前訓練をせず、3日間の自己対局で人間を超える水準に達します。これまでで最強のAlphaGoです。

アーキテクチャは単純化されました。以前のAlphaGoには、よい手を予測する方策ネットワークと、局面を評価する価値ネットワークがあり、両者の出力をMCTSによる先読みに使っていました。MCTSとは、確率で重みづけしたランダムな手を、対局の終わりまで進めるものです。AlphaGo Zeroは手を選ぶニューラルネットワークを一つ持ちます。このネットワークは、ポール・クリスティアーノ流の能力増幅で訓練され、自分自身と対局することで、勝ちにつながる手の新たな確率を学びます。

ほかの人も指摘していますが、これは私とロビン・ハンソンのAIのFOOM論争において、ハンソン側よりユドコウスキー側の立場を支持する証拠の一つに見えます。

私の記憶と理解では、次のような議論でした。

私が強調したいのは、人類の囲碁知識という壮大な体系、何世紀もの対局で発達した定石や戦術、専門家が幼いころから子どもたちに教える仕組みが、AlphaGo Zeroによって丸ごと捨てられ、その結果、性能が向上したという点です。私がハンソンの主張を理解している限り、人類の知識のこうした壮大な体系こそ、複数分野で同時にAIの能力が急速に向上するのを阻む、まさにその防壁であるはずでした。私は「人間の知能はろくなものではないし、蓄積してきた技能もろくなものではない」と言いましたが、それが裏づけられたように見えます。

同じように、DeepMindのような単独の研究所が、生態系全体を大きく引き離すこともないはずでした。AIを特定の分野に適応させるには、市場の生態系のあちこちで開発された多くの部品が必要で、そうした部品はほかの企業にも提供されるはずだからです。AlphaGo Zeroは、それよりはるかに単純です。ほかの誰もすぐにAlphaGo Zeroを作れないのだとすれば、その理由は、Googleが一般には利用できないTensor Processing Unitを持っていることか、ResNetのような既存のアイデアを実際に使いこなすための専門知識がDeepMindの内部に蓄積されていることか、あるいはその両方です。

ここでは、能力向上の速さそのものにも注目すべきです。ユドコウスキーとハンソンの論争で、私がFOOMを支持するために述べた議論の大部分は、自己改良と、最適化ループを自分自身に折り返したときに何が起こるか、というものでした。私の議論に必要だったわけではありませんが、囲碁の実力が、わずか2年で「プロに勝ちそうになったものすらない」から「人間をあまりに圧倒していて、もうわざわざ対局しようともしていない」へ移ったという事実があります。アーキテクチャを改良して単純化しただけでそうなったということは、FOOMのように見えることを起こすには、自己改良すら必要ないと示しているのです。

確かに囲碁は、自己対局のできる閉じたシステムです。それでも人間は、その打ち方を学ぶのに何世紀もかかりました。急速な能力向上に対する、ハンソン側の新たな防壁は、次のようなものになるのかもしれません。環境には、学ぶのが非常に難しいとされる経験的な情報がたくさんある。AIの思考が、人間流の何世紀分もの学習を3日で追い抜くほど速い極限においてさえ、です。そして人間は、何世紀もの文化的な知識の蓄積を通じて、この重要な情報を学んできた。必要な経験的情報をすべて持っていてさえ、人間はAIの3日分の学習に何世紀もかかるとわかっているにもかかわらず、です。そしてAIは、「アーキテクチャ」を使っても、この知識を急速には吸収できない。人間はアーキテクチャを使って互いから学んでいるにもかかわらず、です。そうだとしたら、世界を破滅させかねないこの新しい仮定、つまり誤っていれば世界が終わる仮定を、書き留めておきましょう。そして、この仮定がもしかしたら間違っているかもしれないという、さらなる証拠に目を光らせましょう。

AlphaGoは、明らかに汎用AIではありません。人間には、AlphaGoよりはるかに汎用的にしている何かがあり、AlphaGoは明らかにそれを行っていません。しかし、人間特有のこの秘訣を備えていてもなお、AGIの能力はゆっくりとしか伸びず、分野ごとに限られ、大きな市場の生態系からの供給を必要とすると予想するなら、人間並みの汎用性をもたらす秘訣を欠いた状態で見られる状況は、このようなものであってはならないはずです。

別の言い方をすれば、私は論争の中で、再帰的な自己改良と、霊長類の知能から人間の知能への変化に伴う汎用性の目覚ましい飛躍を、大いに重視していました。だからといって、自己改良がなくても能力向上の速さについて情報を得られないわけではありません。汎用知能を生む仕掛けがなくても、アルゴリズムの重要性や汎用性について情報を得られないわけでもありません。私が本領だと思っていたところへたどり着く前に、能力は急速に向上するという側へ、論争の決着がつき始めることもありえます。私にはAlphaGoを予測できなかったでしょうし、その能力向上はそこまで速くないほうに賭けて、実際にお金を失いました。ユドコウスキーからハンソンへと続く立場の幅の中で、現実は私よりさらに極端な立場を取っていたからです。

(ロビン・ハンソンからの返信。)