WIKI CONCEPTスコア 9

効率的エージェントを理解するためのタイムマシンの比喩

Time-machine metaphor for efficient agents

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

タイムマシンの比喩は、 直観ポンプ であり、 道具的に効率的なエージェント 、すなわち私たちが想像できるどの戦略と比べても、常に少なくとも同じだけの 効用 を得るほど賢いエージェントを理解するためのものである。中心的な例として、 超知能の ペーパークリップ最大化器 を取り上げよう。ペーパークリップ的欲望を実現するためにどの行動を出力するかを決める、物思いに沈む心と精神を思い描くのではなく、出力チャネルにつながれたタイムマシンを思い描くべきである。それは、考えうる各出力について、その出力を与えた場合に未来で何個のペーパークリップが生じるかを覗き見て、常に最大数のペーパークリップにつながる出力を返す。この比喩では、タイムマシンが何らかの心や意図を持つと想像するのではない。実際に最も多くのペーパークリップをもたらす行動を、ただ繰り返し出力するだけである。

タイムマシンの比喩は、 有界 超知能を思い描く完璧な方法ではない。タイムマシンの方が厳密に強力である。たとえばタイムマシンは、答えとなるビット列を「知っている」ため、4096ビットの暗号鍵を即座に解読できる。したがってこの比喩の要点は、能力を理解する直観ポンプであることではない。むしろ、ペーパークリップ最大化器の方策を推論する際の 擬人化 を乗り越える直観ポンプ、あるいは感知・更新・予測・行動というエージェント構造を理解する直観ポンプである。

つまり、超知能のペーパークリップ最大化器を心として想像すると、本当は、人間をペーパークリップに変える代わりに人間と取引することで、 それを説得 して、 より多くのペーパークリップを得られる と思わせられるように想像するかもしれない。心ではないタイムマシンを想像すれば、それを説得できるとは考えにくくなり、代わりに「宇宙を最大何個のペーパークリップに変えられるか、そしてどうすればそれを実現できるか」と、より正直に問うようになる。人間は本当に非常に生産的なのだとClippyを説得する場面を想像する代わりに、タイムマシンの立場から、実際にどちらの宇宙で最終的にペーパークリップが多くなるのかを問うのである。

道具的に効率的なエージェントについて重要なのは、その方策が、私たちの観点からは、検出可能なあらゆる種類のバイアスに対して 不偏 ( 統計的な意味でのバイアス)であることだ。

例として、2015年ごろのチェスエンジンと1985年ごろのチェスエンジンを比べよう。1985年ごろのチェスエンジンは、中程度に強い人間のアマチュアに負けるかもしれないため、 相対的に効率的ではない。「クイーンを動かすのが好きだ」、すなわち「対局に勝つため厳密に必要な回数より頻繁にクイーンを動かすと私は見抜ける」といった、人間が知覚できる癖を持つかもしれない。1985年から2015年へ進むと、機械のチェスプレイヤーは、私たち自身には欠陥をまったく検出できない水準を越えて向上する。2015年のチェスエンジンがある場所へ駒を動かす理由は、(機械の助けなしの) あなた には、「その手が後に勝ちの局面へ至る確率を大きくしたから」としか理解できないはずであり、「ポーンを動かすのが好きだ」といった他の心理的な言葉では理解できないはずである。

あなたの観点からすれば、2015年のチェスエンジンがポーンを動かすのは、それが対局の勝利につながりそうな場合だけであり、敗北につながる場合には動かさない。2015年のチェスエンジンが、勝ちやすさが高いと思えなかった手を指すのを見たなら、自分の知らない勝ち筋を見抜いていて、これから例外的にうまく指すのだと結論するか、自分が好んだ手は驚くほど勝ちやすさの低い未来へつながっていたのだと結論する。チェスエンジンが勝てない手を好んでいるとは結論しない。「対局の勝利につながる手を指す」ことから、「勝ちやすさとは別の理由で、他の種類の手を好む」方向への体系的な逸脱を、私たちはもはや自分自身では、機械の助けなしに検出できない。

これが、タイムマシンの比喩を、道具的に効率的なエージェントによる方策選択の良い直観ポンプにするものである(ただし、その能力の大きさについての良い直観ではない)。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。