WIKI CONCEPTスコア 10

超実存的リスクからの隔離

Separation from hyperexistential risk

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

あるAIアラインメントの原則で、他の原則には還元できそうにないものは、「AGIの設計は、超実存的リスクを構成するいかなる設計からも、設計空間内で広く隔てられているべきである」というものだ。超実存的リスクとは「死より悪い運命」、すなわち、全員を素早く殺して宇宙をペーパークリップで満たすよりも悪い結果をもたらすAGIである。

この原則の例として、私たちの正確で真の価値関数V,を明示的に表現した第一世代AGIを書けるとしよう。ただしこの思考実験では、効用関数の明示的表現にAGIをアラインさせる問題を解いたと、完全には確信していないものとする。これは超実存的隔離の原則に反する。なぜなら、Vを最適化するAGIは、設計空間内で-V.を最適化するAGIに近いからである。同様に、AGIをVにアラインできるが、このAGIを意思決定理論的な恐喝に対して免疫にしたという確信はないとする。このAGIは、Vの大域的最小値を自らに対する最も効果的な脅威として識別することになり、それはVを最小化するシナリオが実現する確率を高めうる。

ここでの懸念は、システムに否定的な結果を特定することで、設計空間内でその実現に近づいてしまうという、「裏目に出てはならない」原則の特殊例である。

反効用の最大化を避けるための、一見明白なパッチの一つは、AGIに効用関数U = V + Wを与えることかもしれない。ここでWは、起こりうる絶対最悪の出来事を、「Nopenopenope」のSHA256ハッシュに17を足したものが紙片に書かれること、と定める。すると、1ビットの誤りが甚大な結果をもたらすことを許す粗悪な設計のために宇宙線がAGIの実効効用関数の符号を反転させた場合、AGIは宇宙をそのような紙片で敷き詰める。これは通常のペーパークリップより悪くない。同様に、AGIに対するどの恐喝も、そのような紙片を脅威として使うだろう。するとWは、反効用最大化器のためのハニーポットまたは囮として働き、それらが私たち自身の真の効用を最小化するのを防ぐ。

このパッチは実際には機能しない。これは、効用関数が反省的に安定していないという、珍しい特殊例だからである。AIの効用関数にWを加えてU,とするために使ったのと同じ推論により、AGIは、この奇妙で恐ろしい出来事を起こす唯一の原因が、それ自身のU,表現によってその出来事が特定されることだと気づくはずだと予想できる。したがってAGIは、後継の効用関数からWの表現を削除する動機を持つだろう。

このパッチへのパッチは、Wに、私たちがほかには気にかけていないが、そうでなければ宇宙の予想される歴史の中で自然に少なくとも一度は起きる事象のクラスを選び出させることかもしれない。そうするなら、WをVに対して、Uの中で重み付けする必要がある。それによって、Uは、Wが負の価値を与える事象を容易に防ぐための小さな努力だけを費やすよう動機づけ、Wを回避するために、V.を顧みず全努力を費やすことはない。

初期世代のタスクAGIにとっての、より深い解決策は、特に完全な人間の価値を明示的に表現しようとは決してしないことだろう。なかでも、Vのうち、死よりも嫌うものを特定する部分を表現しない。オペレーターがホワイトリストに入れた影響を除き、影響一般を避けるなら、避ける必要がある最悪の種類の影響について明示的な記述をAIに持たせるのではなく、途中で否定的な影響を避けることになる。この場合、AGIは、私たちが死より悪いと考える宇宙状態を計算するのに必要な情報を持たない。効用関数U,の符号を反転させたり、Uから成分を引いてから符号を反転させたりしても、私たちがペーパークリップより悪いと考える状態は何も特定されない。AGIはもはや、設計空間内で超実存的リスクに隣接していない。単純な負の奇跡によって、AGIから死より悪い運命へ至れる短い経路は、もはや設計空間内にない。

超実存的破局は狭い特殊例なので(少なくともそう見えるし、そうであることを切に願う)、通常の実存的リスクよりはるかに広範に回避できる。何らかの決定的なことを行えるほど強力なタスクAGIは、内部の制限器をすべて取り除けば世界を破壊するものと、設計空間内で避けがたく極めて近いように思える。世界を破壊できるほど強力なものを手元に置くという行為によって、可能性についての明白な尺度のもとで、私たちは世界の破壊に近接する。世界を救えるほど強力なものは、単純な負の奇跡によって、世界を(単に)破壊するものへ変換できる。

しかし、17+17を足して34を得る計算機が、設計空間内で−34を得る計算機に非常に近いことを、私たちはひどく心配しない。そこへ至る誤りを防ごうとするだけである。状態軌道を十分狭く制約し、いかなる「隣接」領域にもはみ出さないようにする。役に立つほど強力などのAGIの近くでも設計空間の非常に大きな体積を占める、通常の実存的破局については、この種の考え方がもっともらしくも最善の策である。

対照的に、「口がなく、しかも私は叫ばなければならない」シナリオには、結果空間の特定の極低価値領域を明確に望むか特定するAGIが必要である。単純な効用関数の大半は、単に私たちを殺す仕方で宇宙を再構成することを含意する。超実存的破局は、はるかに小さな標的である。超実存的リスクは極端に悪くなりうるため、私たちはその極めて小さな確率さえ避けたい。そして、それらは狭い標的なので、状態空間内でその近くのどこにもいないよう努めるのが合理的である。これは一種のマーフィー対策と見なせる。私たちは当然、状態軌道を固定しようとし、おそらく成功するだろうが、最善を尽くしても、推論の誤りによって近隣の可能性へ至りやすい。そのうえで超実存的破局を表す特定の近傍に行き着くには、なお不運が必要だろう。しかしこれは、さらに最小化する価値があるように思える種類の小さな可能性である。

この原則が含意するのは、人間の価値の一般的な推論を、初期世代のタスクAGIの目標にすべきでないということだ。もしメタ効用関数U'がV,のすべてを特定するのに必要な情報をすべて含むなら、それはV.の最小値を特定するのに必要な情報もすべて含む。これは、たとえば初期世代AGIが「すべての人間の価値を学習せよ」といったメタ目標を明示的に特定している場合に当てはまる。しかし、真の人間価値の一般的な価値学習に反対するこの考慮は、たとえば、人間がラベル付けした例から帰納的に学習するタスクAGIには当てはまらないかもしれない。その人間たちが「死亡またはそれより悪い」の内部を特定も区別もしようとせず、すべての場合に同じ「悪い」ラベルを付けるなら、である。そのような場合でも、単純な負の奇跡によって、目標に関係する仕方で真のVが結局特定されるかもしれないという、心配すべき微妙な点は残る。しかし、「避けるべき事象として、死と死より悪いものに同じラベルを使い、同様に、死よりはましな悪い運命のあらゆる種類を、人間のオペレーターが気づいて記述すべき帰結の一種として扱う」という第一歩だけでも、設計空間内で超実存的破局からかなり遠ざかったように思える。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。