提案されている原則であり、AIアラインメントについて「AIの認知操作の深層構造について洞察を得れば得るほど、そのAIのアラインメントに成功する可能性が高まる」と述べる。
明示可能性が高まる例として、AIを構築する際に期待効用という考えを知っている場合と、期待効用について一度も聞いたことがない場合との違いを考えてみよう。期待効用という考えは非常によく知られているため、もはや洞察として目立つものには思えないかもしれないが、この考えがある場合とない場合との違いを考えてほしい。
期待効用原理と、それが効用関数と確率分布へ分解される仕方をじっくり眺めると、一見当然に聞こえるかもしれないが、それでもかなり重要な洞察に至る。
エージェントが変化する未知の世界に適応するために、あらゆる行動、方策、目標を変更可能にしておく必要があるのではなく、エージェントは安定した効用関数と変化する確率分布を持つことができる。
たとえば、エージェントがチーズを取ろうとして、チーズが高すぎることに気づいたとき、これを更新と見ることができる。これはエージェントのチーズを得る方法についての信念についての更新であり、エージェントがチーズを欲しているという事実は変わらない。
同様に、チェスで超人的な成績を望むなら、チェス対局に勝つという、既知で安定し理解可能な選好を持つ一方、どの方策がチェスの局面で勝つ確率的期待をより高めるかについて、人間を超える精度にまで洗練された確率分布を持つAIを求めることができる。
これを、認知についての理解を選好らしき部分と信念らしき部分に分解していない精神状態と対比してみよう。この精神状態では、知る限りにおいて、AIが変化する世界に対処するには、その行動のあらゆる側面とあらゆる目標が変わる必要があるかもしれない。そうでなければ、AIは同じ行動を何度も実行し続けるだけになってしまう……そうだろう? 明らかに、変更不能な選好を持つAIという発想は、愚か者の徒労にすぎない。そのようなAIは愚かすぎて、良くも悪くも重大な変化をもたらせないだろう。[1]
(この議論には、実際に現実世界で何度も遭遇してきた。)
確率分布と効用関数は今や比較的長いあいだ知られており、比較的よく理解されている。人々はその構造を探り、考えうる変種を想像し、それらの変種の何がうまくいかないかを示そうと、実に多くの試みを重ねてきた。現在では、「質的に支配されない戦略は、何らかの整合的な確率分布および効用関数と整合するものとして見ることができる」と述べる膨大な一群の整合性定理が知られている。これは広い意味で、十分に高度なAIの行動が、質的な意味で自らの足を撃たないよういっそう強く最適化されるにつれて、そのAIは期待効用推論のいくつかの側面を示すようになるだろうと期待できることを示唆する。十分に高度なAIの内部のどこかで、期待効用らしき何かがなぜ起きるのか、あるいは少なくともAIの外的行動を観察する限りそのように振る舞うのかについて、私たちはある程度の見当を持っている。
したがって、こう言える。「いいか、効用関数を明示的に書き込まなければ、そのAIはいずれにせよ効用関数に似た何かを持つことになるだろう。ただ、それがどこにあるか分からないだけである。その効用関数が何を述べているかを把握し、意図して書き込むほうが、はるかに賢明に思える。そもそも、自分のAIに安定した効用関数を持たせたくないと明言する場合でさえ、そう述べることによってどの整合性定理に逆らおうとしているのか、そのすべてを知る必要があるのだ!」
明示可能性原則が述べる(より正確には、そうなることを期待する)のは、AIの動作についてこの一般的な種類の洞察をわずかでも多く得るにつれて、AIをアラインできる可能性もわずかに高まる、ということである。
期待効用の例はおそらく、まだ私たちが持っていない、これと同種の考えがさらに存在するなら、それらを欠いていることがAIアラインメント計画を完全に破滅させるか、少なくともはるかに難しくするかもしれない、と示唆している。大規模な強化学習器だけを用いて何らかの大規模な決定的介入を実行しようとしている人を、原理上は想像できる。その人は、AIが帰結主義的選好をどこに保持しているのかも、その選好が何なのかも分からない。それでも、その人がきわめて疑い深く、きわめて多くの監視を導入する資源を持ち、きわめて多くのトリップワイヤーと安全策を備え、試みることをきわめて少なく抑えるほど保守的だったため、ともかく成功した、ということはありうる。しかし、現実に試すべき良い考えには聞こえない。
明示可能性を高める探求は、概してMIRIにおける「エージェント基礎」研究課題の動機となってきた。これはAIアラインメントの唯一の側面ではないが、懸念されるのは、この種の深い洞察が、研究者が一つの考えの後に別の考えを発展させる必要のある、直列的負荷の非常に大きな課題かもしれないことである。これは、作り出すのに要する直列時間が比較的短いAIアラインメントの浅い考えとは対照的である。つまり、この種の研究は、早期に始めることが最も重要な研究の一つなのである。
明示可能性の主要な対抗原理は監督可能性原則である。これは明示可能性と直接対立するものではないが、AIについての私たちの理解を、はるかに大きな粒度に集中させる傾向がある。たとえば監督可能性原則はこう述べる。「AIの行動は、すでにアラインされていると分かっているもの、すなわち人間の行動と直接比較して訓練できる唯一の対象である。したがって、同じ方法ではアラインメントを直接判定し検査できない、より小さな部分ではなく、その地点で可能な限り高い忠実度を確保することに集中すべきである。」どちらの原則も、AIに関する特定の事実を可能な限りよく理解することが重要だという点では一致しているが、最大限に理解可能にすべき設計上の優先対象が何かについては意見が異なる。