定義
次の主張を信じるなら、この命題はあなたにとって真である。「宇宙の物質的記述、または感覚観察の経路、あるいはその両方を入力として受け取り、 理想的な価値 または タスク同定を出力する、満足できる固定的・単純なアルゴリズムは、まだ誰も提案していない。」
論拠
「 価値の複雑性 」テーゼによれば、対象レベルでは、 未来に私たちが本当に望むもの のどんな仕様も、高い アルゴリズム的複雑性を持つ。
ある 意味では、価値を指定するために必要な複雑性はすべて、人間の脳内に含まれていなければならない。会話の対象としてさえ、私たちの脳が何も指し示さないものについて語ることはできない。だからこそ、 価値の複雑性 は、価値の対象レベルの複雑性と メタ レベルの複雑性、すなわち十分に高度な人工知能 に価値を学習させるために必要な最小のプログラムを区別する。人間を含む物質宇宙の完全な記述を入力として受け取り、「 価値」を出力する関数の最小複雑性を考えるのは、別の問いである。この問いにも、
野心的でなく狭い形式 がある。プログラマーの協力のもとでAGIが合理的に受け取りうる感覚観察、またはAGIが合理的に形成し改良しうる人間の予測モデルが与えられたとき、このデータを入力として受け取り、安全かつ確実に同定 できる単純な規則はあるだろうか。たとえば「分子ナノテクノロジーを開発し、それを用いてイチゴを一つ合成し、副作用を最小限にして停止せよ」程度のタスクである。 この場合、関数の絶対的な複雑性が高いと考える強い理由はない。
しかし、この問題のどの変種についても、原理上さえ解決する満足な擬似コードは、まだ誰も提案していない。
単純なメタ規則への障害
感覚入力に依存する
メタ効用関数 で、 道徳的不確実性 を定式化した単純なものを考えよう。対象レベルの結果は効用 o を持ち、その値は U(o) であり、将来の感覚信号 U_1(o) が1なら s 、また U_2(o) が2なら s であるとする。この設定では、AIには s を改変して1にする誘因がある。 U_1 のほうが U_2, より最適化しやすい場合であり、逆の場合も同様である。
より一般に、人間からの感覚信号は通常、 確実に かつ 変更不能に 、私たちが 意図した 目標同定と相関するとは限らない。人間が生成する信号を、どんな指示対象についても 理想的に信頼できるグラウンドトゥルース として扱うことはできない。なぜなら、(a) 一部のAI行動が信号を妨害するうえ、(b)人間は、とりわけ複雑なことを尋ねられると間違えるからである。「何か問題が起きたら人間がボタンを押す」という仕組みにはできない。人間が気づくには手遅れになる形で問題を起こす方策もあれば、ボタンを破壊する(または人間を改変する)AI方策もある。
それを脇に置いても、人間が制御する感覚経路 R と宇宙の記述 O を入力として受け取り、 私たちが意図する タスクを、 O 上で( サブエージェントで宇宙を埋め尽くさない ことなども含め)実際に現実的に同定する効用関数を出力する、完全に仕様化された擬似コードは、まだ誰も提案していない。
実際、どんな種類の目標であれ同定する現実的な仕組みを、まだ誰も提案していない。 それは、実際に物質宇宙を記述できるほど柔軟なAIのオントロジー に関してさえである。 [1]
メタメタ規則
上と同様の理由から、メタ規則のある空間上で、まだ誰も(原理上さえ)有効な擬似コードを提案していない。これはAIに、価値同定用のメタ規則を 学習 させる メタメタ・プログラム である。ここには二つの主要問題がある。
第一に、「正しさを知らせる経路を定義し、そこへプログラム帰納を投入する」以外に、それがどう機能しうるかについて、提案の種さえ誰もまったく持っていない( 誤りやすく脆弱な人間が信号を制御する以上、それが直接機能する可能性は低そうである)。
第二に、学習したメタ規則が、安定したきわめて簡潔で人間に透明な表現を持たないなら、 開発段階での良い振る舞いが試験段階での良い振る舞いに対応することへ、どうすれば少しでも確信を持てるのか明らかでない。たとえば、「人間が微笑んだら、良いことが起きた」というように、小規模ではうまく働くがスケールしない、想像可能なメタ規則の例をすべて考えよ。
- ^︎
ただし、AIが自分の望むことを記述できるほど高度になった時点で、そのオントロジーを調べ、その意味についての自分の考えに基づいてAIの帰結主義的選好を手動でプログラムする、というかなり非メタ的な意味を除く。