AIが突然全知全能になったと仮定しよう。突然あらゆる事実を知り、方策の選択肢として、どのような結果でも直接命じて実現できるようになったとする。その場合、実行中のAIコードは悪い結果をもたらすだろうか。もしそうなら、なぜある意味であなたを傷つけることを「望み」、知識と能力の不足によって辛うじて抑えられているだけのプログラムを書いたのか。それは計算能力の構成方法として悪いのではないか。なぜ代わりに別のコードを書かないのか。
全能性テストとは、高度なAIが突然あらゆる事実を知り、考えうるどの結果でも即時の選択として直接命じて実現できるようになったとしても、アラインメントされたままである、壊滅的結果を招かない、または安全に失敗すると期待できるべきだ、というテストである。豊かな現実世界で行動するよう意図されたエージェントについて、無限の力を与えられたとき、たとえば 安全なユーザーへの問い合わせのため一時停止するのではなく、破壊的に行動するかもしれないと予測される振る舞いは、 バグとして扱うべきだ、という方針を提案する。
安全性の考え方
全能性テストは、エージェントが何らかの事実について確定的知識を得るはずがない、または何らかの戦略的選択肢へアクセスできるはずがないと、フェイルセーフでない仕方で仮定した推論手順をすべて浮き彫りにする。高度なエージェントの反応時間に下限を置く能力や、その力に上限を置く能力について、極端に強く確信することには、 認識論的障害 がある。
全能性テストの背後にある、より深い考えは、全能性シナリオで予測可能な失敗や、保証された信頼性の欠如があれば、それはより一般的な欠陥を露呈しているというものである。NASAが、四つの惑星が一直線に並ぶとコードがクラッシュし、ロケットのエンジンが爆発することを発見したとしよう。NASAは「今後100年間、そのような整列は予想されないので、まだ安全だ」とは言わない。「これは確かにプログラムの重大なバグだ」と言うだろう。正しく設計されたプログラムは、端的に言ってロケットを爆発させるべきではない。何らかの具体的なシナリオでそのような振る舞いが露呈するなら、一般的な場合の何かが正しく処理されていないことを示す。
全能安全の考え方によれば、高度なエージェントがどの事実を把握できないか、どの戦略的選択肢を持てないかを推測しようとするのではなく、私たちのそのような推測を、エージェントの安全性を 支える 前提にすべきでない。知りすぎたり、できることが増えすぎたりすれば私たちを傷つけると予想されるエージェントを、なぜ設計するのか。
たとえば、予想外の能力向上がないかプログラマが監視し、向上があれば休止ボタンを押すよう意図されたAIを設計するとしよう。これは暗黙に、プログラマが反応する暇もないほど速く能力が向上することはないと仮定する。それより、全能安全な提案では、AI自身が審査されていない能力向上を検出し、審査が終わるまで休止するよう設計する。ある量の認知能力を、プログラマが反応するより速く獲得できるとは、 ありそうにないと思われる としても、特に一日の間でさえ、これまでそのような急激な能力向上が起きていなかったとしても、全能安全の 考え方 が求めるのは、そのような背景変数が「不合理な」設定を取ると危険になるエージェントを、 そもそも構築しない ことである。正しい一般的振る舞いは、たとえば、新しい能力を得て、その使用をプログラマがまだ承認していないときには、常に休止することである。AGIの設計が突然無限の力を 最適に 使うことは不可能かもしれず、そもそも何らかの安全な仕方で使うことさえ不可能かもしれない。しかしそれでも、全能安全でないシステムを構築する言い訳にはならない。その場合を検出し、「何か奇妙なことが起きた!」と言い、ディスクへ休止することは可能なはずだからである。
同様に、 保守的な計画というパラダイムを考えよう。悪い計画の特徴をブラックリストに載せるのではなく、 保守的な一般化を使って許される計画をホワイトリストに載せると考える。ブラックリスト化ではなく狭くホワイトリスト化している限り、多数の新たな選択肢空間が突然開かれても、ユーザーがさらに多くをホワイトリストへ追加できるまでは、その奇妙な新選択肢のどれも取られないはずである。
同様に、全能安全の考え方によれば、AIが有害なことを行う方法や、安全措置の一つを迂回する方法を求めて 認知的探索 を実行しているなら、その探索が何も見つけないと強く予想していても、設計上のバグは すでに 見つかっている。なぜ、あなたを傷つける方法を探索するように計算能力を構成するのか。それは明らかに計算能力の誤った使い方であり、プログラマである私たちは、代わりにコードへ別のことをさせるべきである。これは、 訂正可能性の研究を動機づける研究課題の一部である。
エージェントの実際の能力を推測することは妥当な計画である。エージェントの実際の力についての推定を中心に据える、より「敵対的な」予備の予防策があるなら、特にそうである。たとえば、審査されていない外界との通信チャネルを得ることを 望まない エージェントを設計したうえで、計算ハードウェアをファラデーケージに入れ、周囲に携帯電話基地局がないことを確認してもよい。これは、第一の防衛線が失敗してAIが審査されていない仕方で通信したいと望み始めても、通信を遮断するための「敵対的」な予防策である。しかし「敵対的」な予防策は 第二の 防衛線であり、全能安全性への妥当な期待が 第一の防衛線である。まず、敵対的な予備措置はすべて失敗すると仮定し、どのような新たな能力や知識を得ても、エージェントが無害なままでいるか、安全に失敗するよう設計する。次に、第一の防衛線が失敗したと仮定し、少しでも可能または現実的なら、エージェントが現実的な量の力しか持たず、私たちが「物理法則」だと考えるものなどに 違反できない 限り、全面的な破局を防ぐ予備措置を設けようとする。