WIKI CONCEPTスコア 0

AIは安全措置を容認しなければならない

The AI must tolerate your safety measures

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

非敵対的原則から得られる系がある。 十分に高度な人工知能に対して提案されるあらゆる種類の安全措置について、私たちは直ちに、その安全措置によって人間のプログラマと構築中のエージェントとの間に 敵対的な状況 が生じることをどう避けるか、と問うべきである。

認知アラインメントの一般原則 から得られるさらなる系によれば、新たな問題を引き起こさずに実現する方法が分かるなら、AIはその安全措置が存在することを積極的に 望む べきである。

たとえば、望む安全措置が 休止ボタン (停止スイッチ)なら、最初に考えるべきは「停止スイッチが押されても気にしないエージェントをどう構築するか」である。

より高いアラインメント水準では、何かが停止スイッチを損傷した場合に、AIが自然かつ自発的に「ああ、大変だ! 停止スイッチが壊れている!」と考えてプログラマへ報告し、何の応答もなければ停止スイッチを自ら修理しようとするよう構成できるかもしれない。ただしこれは、AIが停止スイッチの機能について自分なりの親切な考えを代わりに採用したり、過剰なほど徹底して停止したりしないと、かなり確信できる場合にのみ良い考えとなる。

同様に、AIを外の世界で自由に動き回らせるのではなく、 箱 の中で動作させられたらどれほど良いかと考え始めたなら、最初に考えるべきなのは、「この箱を12層のファラデーケージ、Javaサンドボックスを実行する仮想マシン、そして15メートルのコンクリートでどう囲むか」ではない。「箱の内側の事柄だけを気にし、箱の外側の何かへ影響を与える動機をまったく持たないエージェントを、どう構築すればよいか」である。

より高いアラインメント水準では、何かがうまくいかなかったとき「ああ、大変だ、私は箱の外にいる。これは非常に危険そうだ。どうすれば中に戻れるだろう」と考える種類のエージェントを構築することも想像できる。ただし、たとえば元のエージェントを箱の中に確実に留めるためだけに、箱の外へ超知能を構築するようなエージェントを作っているのではないと強く確信できる場合に限られる。

多くの種類の安全措置は、別の何かがすでにうまくいかなかった後で初めて作動するよう意図されている。これは、それ以前に気づかれないまま、他の事柄もうまくいっていなかった可能性を示唆する。したがって実践上は、「AIは安全措置に手を出さず、その単純明快な動作を変更する誘因を持つべきではない」という原則に集中すべきである。「AIは安全措置に熱意を持ち、それがさらにうまく機能することを望むべきである」に内在する、厳密なアラインメントというより複雑な問題へ取り組むよりもそうする方がよい。

しかしAIが 自らのコードを変更したり、サブエージェントを構築したりするなら、内部アルゴリズムの動作に具現化された安全措置について、AIは少なくとも 何らかの 肯定的な動機を持つ必要がある。そのコードに基づく安全措置に無関心なAIは、 次の自己改変では、興味のないコードを単に省く傾向にある。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。