WIKI CONCEPTスコア 1

非敵対的原則

Non-adversarial principle

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「非敵対的原則」は、十分に高度な人工知能について提案されている、次の設計原則である。

設計上、人間のオペレーターとAGIは決して対立してはならない。

この原則の特殊例には、善良さは防衛の第一線であると、AIはあなたの安全対策を望むがある。

この原則によれば、AIに停止スイッチがある場合、最初に考えるべきは「AIが破壊できないよう、銃を持つ警備員に停止スイッチを守らせるにはどうするか?」ではなく、「AI自身がこの停止スイッチの存在を望むようにするにはどうするか?」である。

AIはまだインターネット上で行動させる準備ができていないと考えるなら、最初に考えるべきは「AIのコンピュータをインターネットからどうエアギャップで隔離するか?」ではなく、「アクセスを得てもインターネット上で何かをしようとしないAIをどう構築するか?」である。その後もAIをインターネットに接続しないでおいてよいが、それは予備措置としてのみである。原子力発電所の格納容器と同じく、計画の上では、予備措置が必要になることは一度もないはずである。たとえば原子力発電所には、炉心溶融に備えて格納容器がある。しかし、火曜日に炉心を溶融させ、格納容器があるから大丈夫という計画なのではない。

なぜ誤ったことをするコードを実行するのか?

究極的には、AI内部のあらゆる事象――RAMへのアクセスもCPU命令もすべて――は、私たち自身の設計が始動させた事象である。AIが自らのコードを変更している場合さえ、変更後のコードは元のコード(または、そのコードが書いたコード等々)の因果的結果である。コンピュータ内部で起きることはすべて、ある意味では私たちの責任であり、私たちの選択である。その責任を負う以上、私たちを傷つけようとしている計算を構築すべきではない。その計算が実行される時点で、私たちはすでに愚かなことをしている――自分から自分の足を撃ったのである。AIが悪いことをする方法を何も見つけられなくても、少なくとも計算能力を浪費している。

AIの設計のどの側面も、私たちをAIと敵対する立場に置いたり、AIの知恵と私たちの知恵を競わせたりしてはならない。ある計算が私たちを出し抜く方法を探し始めたなら、設計と方法論はすでに失敗している。AIを箱に入れ、その箱から出る方法をAIに探させるべきではない。トースターを作るなら、パンを温める部品を一つ作った後、パンを冷やす小さな冷蔵庫を追加したりはしない。

有害な戦略の探索を実行しない

「探索としてのエージェント」という観点では、AIを、ある領域内で戦略を探し出す計算を具現化したものと見ることができる。たとえば「忌々しいイチゴを一つ、忌々しい皿に置け」という課題を実行するAIは、実行した結果としてイチゴが一つ皿に載るような戦略を、想像可能な戦略の空間から探している。

したがって非敵対的原則は、私たちを傷つける方法を探索している計算を、いかなる時点でも実行すべきでないと述べる。

AIをインターネットへ接続したくないとしよう。最初に考えるのが、AIのハードウェアをインターネットからエアギャップで隔離することや、その他の方法でAIを箱に閉じ込めることなら、あなたがしようとしているのは、インターネットへ到達する戦略を探索する計算が、結果を何も返さないようにすることである。

主たる計画が「AIは探索するが、何も見つけない」であるなら、AIの探索が私たちの想像しなかった種類の戦略を検討することを心配する必要がある。私たちは、自分たちの知恵を、潜在的に奇妙な、または超人的な探索と競わせている。脱出のあらゆる可能性を実際にうまく排除できたとしても、そうできたと確信するのは難しい。まったく予想外のサイドチャネル攻撃が存在する概念的な可能性を排除するのは非常に難しい。たとえば、AIがメモリアクセスを巧妙に変調してGSM携帯電話信号を生成する、あるいはAIが人間のオペレーターを説得して箱から出してもらうといった攻撃である。(ただし、その二つの特定の可能性はどちらも予想外ではない。私たちが書き下せる具体的な戦略は、どれも人間が検討する種類の可能性である。)

AIの探索が結局空振りに終わったとしても、そもそもその探索を実体化することで運命を試し、計算能力を浪費していたのである。

対抗措置は予備策である

まず脱出探索の計算が実行されていないことを確実にした後で、予備の対抗的な防衛線、たとえばAIのプロセッサーをファラデーケージ内へ置くことを考えられる。

しかし計画は、AIが脱出を試み、私たちがそれをうまく阻止する、というものではない。AIが脱出を試みるところを想像するなら、想像の中で大いに驚くべきである。AIが実際に脱出を試みたなら、私たちは「何だって?」と叫び、強固に思えたどの仮定が破綻したかを突き止めるべきだ。

どれほど巧妙な設計を使い、どれほど強固に思えても、開発中のAIをそれでもなおエアギャップで隔離するのが、おそらく賢明である。「安全なはずだ!」と言ってインターネットへ接続し、そのまま立ち去るべきではない。しかしこれは、エアギャップに依存するという意味ではない。計画上エアギャップが必要だという意味でもない。

原子力発電所には炉心溶融に備えたコンクリート製格納施設があるが、炉心を溶融させるのが設計ではない。全体計画には「そして火曜日に炉心が溶融するが、格納施設があるから大丈夫」とは書かれていない。設計上、その巨大なコンクリートの殻が実際に必要になることは、一度もないはずである。それでも私たちは、それを建てる。どんなに周到に立てた計画でも、ということだ。

同様にAIを設計するときは、エアギャップが存在しない、あるいは火曜日になればAIがどうせ突然インターネットアクセスを得るものと仮定すべきである。私たちが第一に考えるべきなのは、安全のためにエアギャップを必要としないAIを設計することである。その後でエアギャップを追加する。その際、「どうせ格納構造があるのだから、炉心が溶融しても実際には問題ない」に相当する考え方をしていないことを確かめる。

非敵対性を実装する際の課題

非敵対的原則を実装する際にこれまで予見されている主な難点は、道具的収束と最も近い妨げられていない戦略の振る舞いを組み合わせたものを中心とする。

たとえば、押すとAIをディスクへ休止する停止ボタンをタスクAGIのために作る場合、非敵対的原則は次のことも確実にするよう求める。

  • AIが、停止ボタンの存在を望むこと。
  • AIが、このボタンを押された後、ディスクへ休止することを望むこと。
  • AIが、この停止ボタンの状態に人間のオペレーターの動的な決定が反映されることを望むこと。
  • AIが、スイッチを押さない、または押すと決めるようオペレーターへ影響を与えることを望まないこと。
  • AIが、このボタンを押された後、整然とディスクへ休止することが起きるか起きないか以外の何かを望まないこと。

あるいは、

  • たとえば、その領域が認知のためのホワイトリストに入っていないため、AIが停止ボタンについて考えず、それを含む計画を作らないこと。
  • AIの他のモデルのどれにも停止ボタンの存在が反映されず、または他の計画のどれもモデルのその部分を考慮しないこと。

ここでの難点は「死んでいてはコーヒーを持ってこられない」を中心とする。この推論は非常に一般的なので、ある箇所で適用されないようにしても、別の場所で顔を出す傾向がある。

  • 停止ボタンの存在を望む特殊条項を効用関数へ素朴に追加しようとすると、AIは停止ボタンが押されないことを望む。
  • 人間がボタンを押したいならAIもそのボタンが押されることを望む、という特殊事例をうまく追加しても、AIは人間がボタンを押したいと思わないことを望む。
  • ボタンが押された後にAIが停止することを望む特殊条項を素朴に追加しようとすると、AIは、いずれにせよコーヒーが押されるようにするサブエージェントを作ることを望む。
  • 停止ボタンについて考えず、まったくモデル化しないAIを作ろうとしても、現実には世界を最もよく説明する仮説が停止ボタンを含むので、これは困難になりうる。良い仮説の一般探索は停止ボタンを表す認知トークンを作る傾向があるかもしれず、世界を領域へ分割しようとすることで、これを一般にどう防げるかは(まだ)明らかでない。

より一般には、デフォルトでは、実行したい多くの高水準の探索が、実行したくないような部分探索を含む。コーヒーを持ってくる方法を一般に探索するエージェントを実行すると、その探索はデフォルトで、十分に賢ければ、自らが停止されることを防ぐ方法も探索する。

したがって、非敵対的原則を具体的にどう実装するかは、主要な未解決問題である。「どの領域でもXを達成する任意の行動を探索する」というデフォルトよりも、どの計算がどの別の計算を生じさせるかを形作る際、いっそう巧妙になる必要があるかもしれない。

関連項目

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。