非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

5つのテーゼ、2つの補題、そして2つの戦略的な帰結

原題: Five theses, two lemmas, and a couple of strategic implications / Analysis

原文クレジット(WordPress投稿者表示): Eliezer Yudkowsky / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2013-05-05

訳文状態: 校閲済み(原文対照レビュー実施)

自己改良するAIについてMIRIが主に懸念しているのは、世界の「善い」主体ではなく「悪い」主体がそれを作るかもしれない、ということではありません。むしろ私たちの関心の大半は、内容が分かっていて安定した選好を持つ自己改変AIをどう作ればよいか、誰にもまったく分かっていないという状況を改善することにあります。だからこそ私たちは、「悪い」主体によるAI開発を阻止することよりも、研究を進め、ほかの人々にも関連研究を促すことこそが中心的な課題だと考えています。

この見方や、ほかのいくつかの基本的な戦略観は、以下に挙げる、AIの純粋に事実に関わる問いについての5つのテーゼと、そこから導かれると私たちが考える2つの補題の帰結としてまとめられます。

知能爆発のテーゼ。十分に賢いAIは、自身の認知アルゴリズムを改良したり、大量のサーバー稼働時間を購入したり盗んだりするなど、短時間でできることから、さらなる能力向上に再投資できる大きな認知上の利益を得られるようになります。知能爆発は、短時間で実行できることが尽きる前に、非常に高い知能水準に到達します。Chalmers(2010年)、Muehlhauser & Salamon(2013年)、Yudkowsky(2013年)を参照。

直交性のテーゼ。心の設計空間は、ほぼどのような選好の組み合わせを持つエージェントも含みうるほど広大です。そうしたエージェントは、その選好を実現する手段について合理的であり、大きな計算能力を備えることもできます。たとえば、理論上、心の設計空間には、ペーパークリップの期待個数を最大化するものとして行動する、強力で道具的に合理的なエージェントが含まれます。それは結果主義的に、期待されるペーパークリップの数が最も多くなる選択肢を常に選びます。Bostrom(2012年)、Armstrong(2013年)を参照。

道具的目標の収束のテーゼ。ほとんどの効用関数からは、考えうる最終目標の大半に共通して導かれる、一群の道具的目標が生じます。たとえば、幸福に暮らす、感覚を持つ存在で満ちた銀河を作りたいなら、物質とエネルギーが必要になります。ペーパークリップを作りたい場合も同じです。非常に強力な存在について、それが明示的に私たちを嫌っていなくても心配するのは、このテーゼがあるからです。「AIはあなたを愛してもいないし、憎んでもいない。しかし、あなたは、AIがほかのことに使える原子でできている」。ただし、直交性のテーゼによれば、何であれ特定の行為をしないことを、最終的な選好として明示的に持つエージェントも、常に可能である点には注意してください。あなたを愛するAIなら、使い回せる原子を得るためにあなたを分解しようとはしません。Omohundro(2008年)、Bostrom(2012年)を参照。

価値の複雑さのテーゼ。理想化された人間の選好であっても、それを記述するには、大きなコルモゴロフ複雑性を要します。つまり、自分の思考過程を吟味する反省的均衡や、その他の標準的な規範理論について、その極限を取ったとしても、私たちが何を「すべき」かというものは、計算上複雑な数学的対象なのです。無作為に生成された効用関数を持つ超知能は、銀河を使って、私たちが価値あるものと認めるようなことを行わないでしょう。感覚を持つ存在が面白い人生を送る多様な文明を望む、という最終的な選好に、偶然たどり着く可能性は低いからです。Yudkowsky(2011年)、Muehlhauser & Helm(2013年)を参照。

価値の脆さのテーゼ。目標体系を90%正しくできても、価値の90%が得られるわけではありません。私の電話番号10桁のうち9桁を正しく押したからといって、エリエゼル・ユドコウスキーに90%似た人につながるわけではないのと同じです。価値には、その一つが抜け落ちるだけで未来からほぼすべての価値が失われるような側面が、複数あります。たとえば、人間の価値をほぼすべて共有しながらも、「退屈」のパラメーターだけがずっと低く設定された異星の種族なら、計算能力の大半を使って、一つの最高で最適な体験を、ピクセルの色を少し変えながら、あるいはそれに相当する変更を加えながら、何度も再生するかもしれません。友好的AIの実現は、10%ずつの改善を積み重ねていくものというより、十分に満足できる水準の閾値を越えることに近いのです。Yudkowsky(2009年、2011年)を参照。

この5つのテーゼから、2つの重要な補題が導かれるように思われます。

間接的規範性。自己改良する機械知能に、「よさそうなこと」の寄せ集めを実行するようプログラムすれば、そのお題目がどれほど聞こえのよい美辞麗句であっても、悪い結果につながります。たとえば「人々を幸せにする」という最終目標を与えれば、AIは人々の快楽中枢を最大限に刺激するだけでしょう。「間接的に規範的」とは、プログラマーから一組の「よい考え」を直接指示されるのではなく、何をするのが「正しい」かを計算するAIを指す、ボストロムの用語です。たとえば、人間を観察し、その意思決定の過程をモデル化し、理想化することで計算します。AIが知っていることをすべて知り、自分自身の意思決定過程を理解していたら何を望むか、反省的均衡、理想的助言者理論などが、その例です。間接的規範性は、価値の複雑さと脆さに対処する方法です。これに成功すれば、基本的には善意である意図の間の小さな違いは、それほど重要ではないかもしれません。つまり、2つのプロジェクトがどちらも間接的規範性を正しく実現していれば、一方の研究者たちのほうが20%感じがよく親切であっても、最終結果の期待価値はおおむね等しくなると望めるのです。Muehlhauser & Helm(2013年)を参照。

友好性の実現には、大きいが上限のある追加的な難しさがある。直交性のテーゼによれば、友好的AIを作ることはできます。しかし、その目標体系を正しいものにするには、多大な労力と工夫が必要です。おそらくそれ以上に重要なのは、10億回もの自己改変を重ねても目標体系が変わらずに保たれるよう、AIのそれ以外の部分にも、より高い水準の整然とした設計が求められることです。整合性を保った自己改変ができるほど賢いAIは、いずれにせよそのように自己改変しようとするでしょう。ですが問題は、それよりはるかに賢くないAIからでも、知能爆発が始まるかもしれないことです。たとえば、遺伝的アルゴリズムなど、結果主義的な一組の選好を保持しない手段で自身を書き換えるAIです。その場合、友好的AIを作るには、知能爆発を起こせる最低限のAIよりも、自己改変について賢いAIを作らなければならないかもしれません。Yudkowsky(2008年)、Yudkowsky(2013年)を参照。

この2つの補題からは、さらに2つの大きな戦略的な帰結が得られます。

  1. 間接的規範性や安定した自己改良などについて、取り組むべき課題が数多くあります。現段階では、その多くがきわめて基礎的な問題に見えます。つまり、有限の計算能力でどう実現するかはおろか、無限の計算能力を使ってよいとしても、実現方法を記述できないのです。基礎研究には時間がかかることが多いので、できるだけ早く着手すべきです。
  2. 友好的AIの研究に求められる、非常に高い基準を満たさない競合プロジェクトに対して、何らかの優位を持つ友好的AIプロジェクトが必要です。資金力に劣る別のプロジェクトが、ずっと粗雑な自己改良AIをつぎはぎで作る前に、安定した目標体系を持つ自己改良AIを作り上げられるプロジェクトです。そのためには、巨大なスーパーコンピューターよりも、最も優秀な研究者たちを集められることのほうが重要かもしれません(Yudkowsky、2013年で提起した未解決の問いを参照)。ですが、必要な優位を偶然任せにするわけにはいきません。成り行きに任せれば、自己改変にそれほど慎重でないプロジェクトが、ちょっとした利他心ではおそらく覆せないほどの優位を得ることになります。