WIKI CONCEPTスコア 5

奇妙な代案を見落とす

Missing the weird alternative

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「予見されない最大値」問題は、高度なエージェントのアラインメント問題の一部として、AGIのために良い目標を考案する際に予見できる困難だとされている。大まかに言えば、「笑顔を生み出せ」はAGIにとって素晴らしい目標になる、と誰かが考えたときに「予見されない最大値」が生じる。人々を幸福にすれば多数の笑顔を生み出せ、人々を幸福にすることは良いからである。しかし、通常の手段で人々を幸福にすればいくらかの笑顔が生じるのは真だが、定期的にヘロインを投与するか、手の届くすべての物質を微小な分子の笑顔へ変えれば、さらに多くの笑顔が生じる。

「奇妙な代案を見落とす」は、AGIの効用関数を論じる人々がなぜこの種の見落としを体系的に犯しうるのかを心理分析しようとする試みである。バルヴァリズムを避けるため、奇妙な代案を見落とすことが危険な見落としになるとまだ納得していないなら、先に、または代わりに予見されない最大値を読んでほしい。

以下では、AGIに提案される効用関数をU、私たち自身の規範的価値をV、ある人がU,の達成可能な最大値だと考える、高いVを持つ方策を\pi_1、ほかの人が提案する、より高いUと、より低いVを持つ代案を\pi_0と表す。

歴史上の事例とされるもの

出版物や学会発表で提案され、「奇妙な代案を見落としている」と論じられてきたAGI目標システムの歴史的事例には、次がある。

  • 「感覚データの圧縮によって得られる利得を最大化するよう、AIをただプログラムせよ」。IDSIA所長Juergen Schmidhuberが、2009年Singularity Summitでの発表で提案した。予見されない最大値の項目を参照。
    • Schmidhuberは、これが芸術と科学への動機を与えると主張した。
    • Yudkowskyは、たとえばこれが、1または0の列を暗号化し、その後で暗号鍵をAIへ明かす物体を構築する動機をAIへ与える、と示唆した。
  • 良い結果を示す感覚的出来事を(教師あり学習を通じて)訓練するため、笑顔の写真/動画をAIへ見せてプログラムする。J. Storrs Hallの著書Beyond AIで一度、その後考えを変える主権的権利を行使した人物によるACM論文で一度、正式に提案された。
    • AIへ、人々を幸福にする動機を与えると主張された。
    • Yudkowskyは、宇宙を微小な分子の笑顔で敷き詰める動機を与えると示唆した。

この問題とされるものの事例はほかにも多数、より非公式な議論で見つかったとされる。

奇妙な代案を見落とす理由の心理分析

それが実際に起きていたと仮定して、一部の人が体系的に「奇妙な代案を見落とす」可能な理由を心理分析する。

私たちの脳は方策空間のVにとって悪い部分をわざわざ探索しない

議論のために言えば、人間の脳は、目標を達成するための高いVを持つ方法を暗黙に探索するよう作られている。または実際には高いVではなく、高いWを持つ方法である。ここでWは私たちが直観的に望むものであり、V.と何らかの関係がある。「宇宙を微小な笑顔で敷き詰める」は低いWしか持たないので、考慮されない。

議論のために言えば、あなたの脳は、脳自身が選好する方策を探索するよう作られている。固く閉まった瓶を開ける方法を探すとき、脳はダイナマイトを一本爆発させるという選択肢を生成しない。それは自分の選好順序で非常に低く評価される方策だからである。では、方策空間のその部分を探索することに何の意味があるのか。

人間の脳が自分の選好順序内で高い方策しか探索できないなら、チェスプレイヤーは相手が最も選好する手を探索できないことになるため、この論証は証明しすぎているように思える。しかし、明示的な視点取得の操作が必要なのかもしれず、好感を持つAIをモデル化する者は、AIの視点を完全には取れないかもしれない。すなわち、「Wにとって良い方策だけ」というフィルターを切るのに必要な、明示的な認知手順を実行し損ねる。

自分自身のものではない目標の視点を取る生得的能力も、限定的なのかもしれない。すなわち、さらに訓練しなくても、チェスの相手が私たちの敗北を望んでいると脳は容易に想像でき、AIが私たちを憎むため殺したいと想像し、それに沿った「合理的な」方策選択肢を考えられる。しかし、この拡張された方策探索でさえ、笑顔を生み出す方法を問うときに「すべてを微小な笑顔へ変える」のような方策を考慮し損ねる。祖先の環境では誰もその選択肢を望まなかったはずであり、脳がそれを生得的にモデル化するのは難しいからである。

私たちの脳は方策空間の奇妙な部分を自動的には探索しない

議論のために言えば、人間の脳は明示的に努力しなければ、方策空間の「奇妙な」(一般化に違反する)部分を探索しない。

ここで起こりうる問題は、「銀河を微小な笑顔で敷き詰める」や「1または0の列を暗号化し、その後で秘密を明かす環境内の物体を作る」が、人間の経験において方策や帰結に通常成り立つ一般化に違反するという意味で、奇妙だということである。「1インチ未満の笑顔は誰も望まない」のような一般化ではなく、「大部分の問題は微小な分子的なものでは解決されない」のような一般化である。

端での実現は、Uの最大値(達成可能な最適値)を「奇妙な」または「極端な」方向へ押し進める傾向がある。たとえばこの変数がほかに制約されないなら、笑顔を非常に小さくすることで、最も多くの笑顔を得られる。したがって予見されない最大値は、大部分の目標や方策を通常支配し、私たちの脳が当然視する暗黙の一般化に違反する傾向があるかもしれない。つまり、予見されない最大値は奇妙なので、方策探索によって考慮も生成もされない。

有用なものと最適なものの混同

議論のために言えば、ある人は「\pi_1はUを増やす」まで到達しただけでそこで止まり、Uエージェントは\pi_1.を行うと結論するかもしれない。

すなわち、「Uを最適化する高度なエージェントは方策\pi_1を実行する」という論証には、「\pi_1はUを最適化する最良の方法である」が必要であり、単に「ほかの条件が同じなら、\pi_1を行うことは、何もしないよりUにとって良い」だけでは足りない、と気づいていないのかもしれない。したがって、「Uエージェントは\pi_1を行う」を確立するには、ほかのどの\pi_kも、より高い期待Uを生み出さないと確立する必要があることに気づかない。それゆえ、そのような\pi_kをまったく探索しない。

また、Uエージェントを、Uを弱くしか最適化しないものとして暗黙にモデル化し、したがってUエージェントがトレードオフや機会費用に直面するものと見なしていないのかもしれない。すなわち、Uエージェントを、\pi_1が生み出す以上のUを生み出したいとは一切望まないものとして暗黙にモデル化している。再び心理分析になるが、人々はUエージェントを、「何かもっと重要なことが現れない限り、趣味として多少のUを生み出したいと何となく望むエージェント」として心的にモデル化しようとすることが時にあるように見える。「行為選択基準が、最も高いUへ至ると予想される行為を何であれ行うことだけで構成されるエージェント」としてではない。

これは、「奇妙な代案を見落とす」とされる人々は、探索したが何も思いつかなかったというより、まったく探索し損ねたように見える、という観察とされるものをよく反映するだろう。

都合のよい道具的戦略をめぐる政治的説得本能

上述の仮説、すなわち人々がより高いUを持つ\pi_kが存在する可能性をただ考えなかった、という仮説が真なら、それを指摘された時点で速やかに考えを変えると予想される。しかし実際には、経験的観察によれば、これよりはるかに強い抵抗があるように見える。

「\pi_0はより多くのUを生み出す」という観察への抵抗を生みうる力の一つは、議論で通常起こる反発という帰無仮説――それ自体が時に非常に強力な力であることは認める――に加えて、脳が「自分に都合のよい戦略\piを別のエージェントに実行させるため、\piこそがそのエージェント自身の目標に最もよく役立つと論じて説得する」というモードで動いていることかもしれない。たとえば上司に昇給を説得したいなら、「私は金が好きだから昇給すべきだ」ではなく、「このプロジェクトをより効率的にするので、私を昇給すべきだ」と論じるのが賢明である。政治的な脳の一般的構図からすれば、たまたま自分が好む方策\piは、他者の目標U.を達成する素晴らしい方法である、という論拠を探索するための生得的支援を持つ可能性が非常に高い。

同じ構図では、他方のエージェントのUを達成するのはより上手だが、\pi_1より自分たちに不都合な競合方策\pi_0は、政治論争における「敵兵」である。私たちは、\pi_0が実はUにとって非常に悪く、\pi_1が実は非常に良い理由を自動的に探索し、\pi_0.を本能的に嫌うだろう。自己欺瞞する脳の標準的構図によれば、おそらく私たちは、\pi_0はUにとって本当に悪く、\pi_1こそがU.にとって本当に最善だと、自分自身を説得するだろう。\pi_0がU.にとって良い理由を、自らあちこちで気づいて回ることは、説得に有利ではない。そして自分に非常に都合のよい\pi_1,をすでに見つけた後で、\pi_1よりUにとって良い\pi_kを自発的に探索し始めることは、まず絶対にないだろう。

(「第三の代案への恐れ」についての一般的な記事は、こちらを参照。このエッセイは、「第三の代案への恐れ」に陥っているかを調べる良い検査として、述べられた基準を達成するために提案されたほかの選択肢を、本能的に嫌ったり、自動的に疑わしく感じたりするかを自問することも提案している。)

アップルパイ問題

AGIが必要とする唯一の効用関数はUであり、ここでUは民主主義、自由、アップルパイのような、非常に良いものであると提案する人が時にいる。

この場合、AGIが必要とする唯一の効用関数だということは、Uについて述べると良いことに聞こえるのかもしれない。そしてそれに同意しないことは、Uを可能な限り高く称賛していないため、U.に対する敵兵となる。

または話者は、「Uは本当に驚くほど素晴らしく良い」が、「Uだけを最大化し、それ以外を何も最大化しないエージェントは有益である」と同じ命題ではないことに気づかず、第二の言明への反論を第一の言明への反論であるかのように扱うのかもしれない。

または、\pi_0が高いUと低いVを持つと指摘することが、アップルパイだけが良いものではないという観察ではなく、U,に反対する論拠のように聞こえるのかもしれない。「アップルパイだけで満たされた宇宙には低い価値しかない」は、「アップルパイは悪く、私たちの効用関数に含めるべきでない」と同じ言明ではない。

「アップルパイ問題」が実在するなら、ほかの問題とされるものの一部に暗黙に依存するか、相互作用している可能性が高い。たとえば、自分自身の複雑な価値Wは、U,を達成するVにとって悪い方法を除外する、多数の暗黙のフィルターF_1, F_2を含むことに気づかないかもしれない。本人は、U.を達成する、高いWを持つ方法だけを暗黙に探索しているからである。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。