WIKI CONCEPTスコア 1

安全だが役に立たない

Safe but useless

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「この種類の安全性は無用性を含意する」(逆に言えば「役立つほど強力なAIは、やはり安全でない」)とは、AIを安全にするため、安全措置をAIが役に立たなくなるところまで強制しなければならない、という提案への批判である。

AIでない比喩として、危険な刃を持つハサミを考えよう。紙を切るのに ぎりぎり 十分な鋭さしかない「安全ハサミ」を作れるが、それでも努力すればいくらか危害を与えられる。危険な刃を発泡ゴムで包み、ハサミを さらに安全に しようとすると、今度は紙を切れない。ハサミが紙を 切れる なら、なお安全でない。原理上、そのハサミで粘土を切れるかもしれないが、粘土を切ることでできる 非常に有用なこと を説明できない限り、これは弁護にならない。

同様に、 Oracle AGI に許す出力を、 与えられた定理がZermelo–Fraenkel集合論の公理から証明可能かだけを教えられるところまで削減しようとする明白な方法がある。これによって、人間の運用者をハッキングして外へ出させることをAGIに 防げるかもしれない 。箱から出られるのは特定時点で送られる1ビットのYes/Noだけだからである。この仕組みの中で信頼できない超知能は、ある定理がZFで証明可能 である とき、戦略的にそう教えない選択肢を持つ。しかし、証明検証器のビットが、入力定理はZFで証明可能だと述べたなら、それは非常に高い確率で信頼できる。

しかし今度は、ある定理がZFで証明可能だと時々確実に知ることで、どう 実際に世界を救う かを誰も知らないという問題にぶつかる。ハサミは、おそらく完全に安全なところまで鈍くされたが、粘土しか切れない。そして粘土を切ることで、 十分な 善を 行う 方法を誰も知らない。

「安全だが役に立たない」エージェントの理想モデル

この問題を数学的に研究する理由が生じたなら、最大の安全性と最小の有用性を体現する、安全だが役に立たないエージェントの優れた 理想モデル は、岩である。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。