「方向づけ」「制限」「対抗」の区別は、 良い 結果を得て、 悪い 結果を避ける3通りの方法を区別するため提案された概念である。 十分に高度な人工知能を稼働させる場合を考える。
- 方向づけ とは、AGIがある領域で正しいことをしたいと思うことである。
- 制限 とは、アラインされていない場所ではAGIが思考も行動もしないことである。
- 対抗 とは、AGIが力を与えられれば誤った行動を取ると 仮定 し、その誤った行動を首尾よく実行するのを私たちが防ごうとすることである。
たとえば、
- 首尾よく 方向づけられた AIは、Internetへの完全なアクセスを与えられると、それを使って 有益な ことを行い、 有害な ことは行わない。善を行いたいと思い、どの行動が良い結果または悪い結果をもたらすかを十分よく理解しているからである。
- 一方、 制限されたAIは、突然Internetからの入力を与えられても、そのInternetアクセスでは 何も しない。プログラマーがこの新しい領域を思考してよいものとして 許可リストに登録 していないからである。
- 対抗 とは、AIをInternetから 物理的に隔離 し、さらにAIのプロセッサを ファラデーケージの中へ置くことである。たとえAIがInternetへ到達したいと 望んでも 、AIが メモリアクセスを変調してGSM携帯電話信号を生成できないようにすることを期待する。
ほかの三つへ還元できない第4の分類として、 安定化 がありうる。たとえば浮動小数点アルゴリズムの数値安定性、コードにメモリリークがないことなどである。これは十分に高度なAIなら自動的に自身で直す問題だが、 十分に高度でない AIは直せないかもしれない。そのため、初期の誤りが後に反省的に安定する変化を導入する場合、またはAIを十分高度でないモードで実行するつもりの場合に、問題が起きる。
敵対的な探索を実行しない
ここで、 探索としてのエージェント という見方では、エージェントを、ある領域内で行動を探す計算を具現化したものとして捉えられる。 非敵対原則 は、私たちを傷つける方法を探す探索を実行すべきでない、と述べる。
この要件は、次の二つの方法のいずれかで達成できる。
- AIが十分に善良で、または 価値とアラインされて いるため、この領域についてAIが考え、ここで探索を実行してもよい。AIが何を探していようと、その探索が成功しても構わない。
- AIはこの領域では アラインされておらず 、したがってここで 探索を実行 すべきではない。ここでのアラインメントは完成していないので、この計算を実行すべきではない。
この二つの措置がともに失敗した場合、 予備的な第2防衛線として、悪い探索が空の結果を返すよう試みることはできる(AIは有害なことをする方法を見つけない)。
たとえば、 非敵対原則 が意味するのは、押すとAIをディスクへサスペンドする 停止ボタン をAIに設けるなら、 さらに 次のことも保証しなければならないということである。
- AIが停止ボタンの存在を 望む こと。
- AIが、この停止スイッチの状態に人間の運用者による動的な意思決定が反映されることを 望む こと。
- AIが、運用者にスイッチを押させる、または押させないよう影響したいと 望まない こと。
- AIが、このスイッチを押した後、秩序だったディスクへのサスペンド以外の何かを起こしたいと 望まない こと。
あるいは、
- AIが停止ボタンについてまったく考えることを 望まない こと(たとえば、それが 許可された認知領域の内側にないため)。
最初の一連の措置は「方向づけ」である。これらが機能すれば、その思考は正しい方向を向いていると考えられるので、AIがここを思考してもよい。第2の方法は 制限である。この領域内のAIの計算はまだアラインされていないと考えるので、それまではそこで計算を実行すべきでない。
さらに 最後の、厳密に予備的な 防衛線として、AIがディスクへのサスペンドに失敗しても全電力を遮断する大きな赤いレバーを計算センターに置ける。(ただし、これが機能することを当てにしているのではない。主な防衛線が失敗しても、安全である確率を少し高めてくれるかもしれない措置として、置いてあるだけである。)
ほかの非敵対的な考えとの関係
方向づけ・制限・対抗という区別は、 AI安全の考え方にある別の考えを述べるのに役立つ。たとえば、
「 善良さが第1防衛線である 」という原則は、次のように言い換えられる。AGIを設計するとき、「対抗」の措置はすべて存在しないか失敗したと想像し、「方向づけ」と「制限」だけを考えるべきである。対抗措置は念のため、その上に追加する。
同様に、 AI安全の全能性テスト は、主要なアラインメント設計を考え抜くとき、AGIが 確実に ある何でもない火曜日にInternetアクセスを得るかのように考えるべきだと述べる。つまり、AGIは、 プログラマーによる何らかの操作なしに、新しく開いた領域で行動したいと思わないことによって制限されるよう設計すべきであり、AIが 到達できない ことに、アラインメントが完成するまで頼るべきではない。