ある領域で「相関的網羅性」が生じるとは――「有能」や「正しい」のような言葉を避けるため、かなり回りくどく言えば――、ある高度なエージェントが、その領域の多数の問題を私たちの望む仕方で扱うなら、AIが領域内のすべての問題を私たちの望む仕方で扱う可能性が高いことである。
相関的網羅と非相関的網羅の違いを見るため、一般的な認識論者としての人間と、価値の複雑性の問題を比較しよう。
価値の複雑性では、「どの結果をどの別の結果より高く位置づけるか」について、ヒューム的自由と複数の不動点がある。Frankenaの望ましいものの一覧にある項目はすべて、詳細について独自のヒューム的自由を持つ。あるエージェントは、私たちの複雑な価値の12項目をたまたま反映する1,000の問題を、私たちの望む仕方で決定できる。それにより、望む答えを網羅することで12の自由度が固定される。ところが、1,000の問題には反映されない13番目の自由度があると後に判明する。後の問題は、以前の問題と同じ樽から抽出されないからである。この場合、その13番目の自由度に左右される1,001番目の問題への答えは、最初の1,000問を網羅したこととの相関によって固定されない。最初の1,000の質問での網羅性は、1,001番目の質問での網羅性と相関しないかもしれない。
認識論には、ベイズ更新と単純性事前分布という中心的な考えに似たものがある。すべての人間があらゆる認識論的問題を解けるわけではない。それでも、サバンナを走り、どの植物に毒があるか、どの政治的対立者が自分に陰謀を企てているかを解明するよう最適化された人間が、一般相対性理論を解くことについて明示的に選択されていなかったにもかかわらず、後にそれを解明できた、という意味がある。人間が一般に網羅できると言える問題の概念へ、人間の下位エージェントも含めるなら、私たちのために超知能を構築して解かせることで正しい答えを得られる事実問題はすべて、ある意味で、一般的認識論者としての人間によって「網羅」されている。
人間の神経機構は大きく複雑で、多数の異なる脳領域を含み、科学についての文化的規則を発見して採用することを選ぶことで、認識論を一から立ち上げる長い過程を経なければならなかった。それでも、「ベイズ更新と単純性事前分布」という中心傾向、核、または単純な原則のようなものがあるという事実は、自然選択が誰の陰謀が何かを解明する脳を構築したとき、一般相対性理論を解明できる脳を偶然にも構築したことを意味する。
価値アラインメントのほかの部分も、同じ観点で見られる。相関的網羅性がありうる場所、取り組むべき問題を探すのである。
安全な影響尺度のような考えに取り組む理由は、「価値を減らすことを一切しないよう努めよ」には中心的な考えがないのに対し、「不必要に大量のものへ影響しないよう努めよ」には何らかの中心的な考えがあるかもしれない、と期待できるからである。
アナパルティスティックな推論が修正可能性への一般解になりうるという期待は、次のように言う。「エージェントBがエージェントAによる自分の修正を許す、という意味のすべてを網羅する中心的で核となる考えがあるかもしれない。たとえば、私たちが本当に誠実に他者による自分の修正を許し、その安全策へ干渉したくないと望むなら、私たちが望むべきことには、人道的価値のあらゆるヒューム的自由度を通らない中心的なものがあるように思える」。これは、アナパルティスティックな推論のすべてを符号化する短いプログラムがあるという意味ではない。しかし、100の問題を正しく解き、その後の1,000の問題も追加調整なしに正しく解き、その背後に中心的で核となる考えがあるように見え、その核がアナパルティスティックな推論に見えるなら、おそらく完成したと期待する理由がより多いという意味である。
私が意味すると知っていることを行えも同様に、たとえ単純でなく、それを符号化する短いプログラムがなくても、「エージェントXがエージェントYをモデル化しながらYの要求を実行し、その帰結をYが受け入れるとかなり確信できないことはしないよう努める」という概念には、核または中心のようなものがあり、価値を直接符号化するより少ない複雑性で問題を相関的に網羅できる、という期待を取り入れている。
AI安全の心構えの立場からは、相関的網羅性の概念と、その相補的な問題であるパッチ抵抗性を理解することによって、次のような勾配を進む。
- 「ああ、人を殺すなとAIへ命じるよう、効用関数へただハードコードすればよい」。
から、
- 「もちろん、さまざまな種類の悪いことをしないようAIを訓練しなければならない長い期間があるだろう」。
を経て、次へ至る。
- 「悪い影響はコンパクトなカテゴリーではなく、訓練データは悪い影響になりうるものをすべて捉えないかもしれない。とりわけAIが、訓練された段階より賢くなった場合はそうである。しかし(特定の悪い影響をブラックリストへ入れるのではなく)一般に低影響であるという概念には、急激な能力向上をまたいで一般化する仕方で、訓練または指定によって伝えられるほど単純な核があるかもしれない」。