「反省的に整合した自由度」とは、自己改変AIが複数の可能な性質 X_i \in X を持てるときに生じる。そこでは、性質 X_1 を持つAIは、性質 X_1, を持つAIのままでいたいと望み、 X_2 を持つAIは、他の条件が等しければ、同じく X_2, である設計への自己改変だけを選ぶ、といった具合である。
反省的に整合した自由度の典型は、 ヒューム的自由度、すなわち多くの異なる 効用関数が持つ反省的整合性である。Gandhiがあなたを殺したくないと思っているとき、人を殺したいと思わせる薬をGandhiに差し出すと、 Gandhiはその薬を拒む。薬を飲めば、薬を飲んだ未来のGandhiが人を殺すと分かっており、現在のGandhiはこの結果を自らの選好関数で低く評価するからである。同様に、 ペーパークリップ最大化器 はペーパークリップ最大化器のままでいたいと望む。この二つの選好枠組みはいずれも 反省の下で整合的なので、「反省的に整合した自由度」または「反省的自由度」をなす。
設計上の観点、または AI安全性の考え方の立場から見た反省的に整合した自由度の要点は、AIが自己改善しようとしても、それによって自動的には自己修正されないことである。「一般相対性理論を理解しにくい」「ポーカーで人間に勝てない」「イルカの写真を見るとクラッシュする」という問題は、それ以外の点でAIの世界を理解する一般能力を向上させ、そのAIが自己改善するなら、特別に指示した努力なしでも自動的に修正されると期待できる。「エウダイモニアではなくペーパークリップを望む」は、 自己修正され ない。
別の見方をすれば、反省的自由度が記述するのは、十分に賢いAIなら一般相対性理論を自動的に学ぶのと同じ仕方では、自動的に抽出・学習されない情報である。境界(所属条件)が一般相対性理論の知識に依存する概念なら、AIが十分に賢くなったとき、その概念の単純な定義を見いだすだろう。一方、概念の境界が 価値を帯びた 判断に依存するなら、環境について多くの知識を持っていても、その概念にアルゴリズム的に単純な記述は存在しないかもしれない。なぜなら、 ヒューム的自由度 を独立に指定する必要があるからである。
選好関数以外の性質も、同様の仕方で反省的に整合するはずだと思われる。たとえば、 CDTの子 と UDT は、それぞれ異なる仕方で反省的に整合しているように見える。したがって、私たちの観点から「悪い」意思決定理論(望まない振る舞いを招くもの)を持つAIは、自己修正を当てにできるような形で「バグって」いるのではない。(MIRIがコンピュータビジョンではなく意思決定理論を研究する理由の一つがこれである。十分に高度なAIなら、コンピュータビジョンの誤りはある意味で自動的に直るが、意思決定理論の誤りは自動的には直らない。)
同様に、 ベイズ事前分布 は既定では反省の下で整合的である。何らかの事前分布を持つベイズ主義者なら、同じ事前分布、またはその事前分布を ベイズ更新 した版を持つ自分のコピーを作りたいと望む。したがって、人間の観点から見て、 パスカルの強盗に遭いやすい といった「バグ」は、他の知識や一般能力が十分に成長するのに伴って自動的に直るとは限らない。これは、重力についての特定の誤信念なら、一般能力が十分に成長するのに伴って自動的に修正されると期待できることとは異なる。(MIRIが 自然主義的帰納 や、事前確率についての同様の問いを考察する理由がこれである。)