「AIアラインメント 」における「原則」とは、AI全体について広い意味で望むものであり、AIの特定部分または側面についての、より狭い設計提案へ情報を与えてきたものを指す。
たとえば、
- 「非敵対原則 」は、私たちの安全措置を破る方法や、私たちが望まない別のことをする方法を、AIが決して探索すべきでないと述べる。たとえその探索が空振りに終わると 考えて いても、それは計算能力に実行させるべきでない種類の処理である。
- これは、 価値アラインメント問題という提案へつながる。私たちが見たい結果の集合を達成したいと思うAIを構築すべきである。
- これはまた、 修正可能性(corrigibility)と、その下位提案である 効用無差別へつながる。AIへ サスペンドボタン を組み込むなら、AIが 道具的圧力 を受けて サスペンドボタンを無効にすることのないよう保証する必要がある。
- 「最小性原則 」は、最初のアラインされたAGIを構築するとき、最初のアラインされていないAGIによって世界が破壊されるという既定の結果を防ぐために必要な範囲で、可能な限り危険の少ない認知計算を用い、可能な限り少ないことだけを行うべきだと述べる。
複数の具体的設計提案へすでに情報を与え、複数の人が良い考えだと思っているのでない限り、何かを「原則」と宣言することについては 慎重で あってほしい。自分が良い考えだと個人的に思うなら、「提案された原則」と呼び、自分の領域で公開できる。「広い設計上の願望」、または人々がそうだと思うものには 非常に多く あり、実際に具体的設計提案へすでに情報を与えた原則が、そうでなければ群衆に埋もれてしまう。