WIKI CONCEPTスコア 2

AGI利用者への問い合わせ

Querying the AGI user

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

ある高度なエージェントが、「潜在的に悪い」何かを利用者が「悪いと見なす」か確かめるため、その利用者へ確認すると仮定するなら、次の一般的な問題を懸念する必要がある。

  • AIは、「実際に悪い」ものをすべて含む仕方で、どのものが「潜在的に悪い」かを判断できるか。
  • どの「潜在的に悪い」ものが「実際に悪い」かを、利用者は確実に判断できるか。
  • AIは、創発的または意図的に、利用者が「悪いと見なす」と表示しない「潜在的に悪い」ものを探し出し、それによって利用者が「悪くない」と誤表示する「実際に悪い」ものを最適化しうるか。(たとえば、すでに悪いと表示された試行と似る新しい試行を避けることをエージェントが学ぶなら、「悪いと見なされた」空間は除外されるが、残りには、最も近い非阻止戦略または同様の現象を通じて、「実際に悪い」ものがまだ含まれうる。)
  • 「潜在的に悪い」の基準が非常に広く、その空間の中で「実際に悪い」ものへ確実に優先順位をつけることが非常に難しいため、10%の確率で「実際に悪い」ものが、利用者が時間を割いて確認できる「潜在的に悪い」ものの上位1,000件に入らないことがあるか。
  • 利用者の意思決定にとって重要な部分である場合、AIは「潜在的な悪さ」の印を作動させたものの詳細を利用者へうまく伝えられるか。さらには、「潜在的に悪い」と印づけられたものが正確に何かを伝えられるか。
    • AIの伝達目標には、利用者を最適化する危険があるか。
    • 「潜在的な悪さ」の詳細や、その対象さえ、理解不能なほど不可解であるか。(たとえばAlphaGoが、ある囲碁の手が潜在的に悪い理由を人間へ説明しようとする場合、あるいは囲碁の専門棋士が素人へ同じ説明をする場合さえ、結局は盲目的に信用するしかないかもしれない。そうなると、無意味に利用者へ確認するようAIへ頼むより、「潜在的に悪い」ことをするなとただ命じたほうがよい。)
  • AIは、創発的または道具的に、利用者がものを「潜在的に悪い」と表示しないよう最適化し、それによって利用者を欺きうるか。
Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。