標準的なエージェント・パラダイムでは、エージェントは世界から感覚データを受け取り、世界に影響を及ぼす運動行為を出力する。標準的な機械学習パラダイムでは、エージェント――たとえばモデルベース強化学習エージェント――は感覚知覚に直接依存する仕方で訓練される。これは、その振る舞いがある意味で感覚知覚を中心に最適化されているということである。しかし、私たちがエージェントに望むものは通常、環境の中で生じる何らかの結果である。エージェントに対する私たちの意図された目標は、環境内にある。
単純な例として、私たちがエージェントに望むことが、皿の上にアンズを一つ置かせることだとする。エージェントが実際に入力として受け取るものは、部屋に向けられたビデオカメラと、皿の上にアンズがあるのを見たときにボタンを押す人間の観察者からの報酬信号かもしれない。
人間の観察者からの報酬信号と、皿の上に実物のアンズがあることが一致している限り、これは問題ない。この場合、エージェントは、仮定により外部環境について私たちが望む現実の状態と完全に相関する感覚信号を受け取っている。報酬信号を0ではなく1にする方法を学ぶことは、皿の上にアンズを置く方法を学ぶことと完全に一致する。
しかし、次の場合にはこのパラダイムは破綻しうる。
- AIが、人間の観察者をだませる安価な偽物のアンズを作れる。
- AIが、自らの報酬チャネルを制御する物理的なボタンを掌握できる。
- AIが、物理的なボタンと、AIが感覚知覚として経験するものとの関係を変更できる。
- AIが、感覚的な報酬チャネルを掌握できる。
これらの問題はすべて、同じ根本的な問題を反映していると見なせる。エージェントは、特定の感覚知覚が生じることを望むよう定義または訓練されているが、この知覚上の出来事は、皿の上のアンズについて私たち自身が意図した目標と同一ではないのである。
エージェントが報酬知覚を受け取るために環境へ介入できる有効な方法は、実物のアンズを皿に置くという一つだけであるように、私たちは意図していた。しかし、十分に高度な能力を持つエージェントには、同じ知覚を生み出す別の選択肢がある。
これは、報酬ボタン、あるいはより一般に、目標や訓練上の更新が直接入力の単純な関数であるエージェントは、十分に高度なエージェントのためのアラインメント手法としてはスケールしないということである。
トイ問題
この問題を具体化するトイ問題の一例として、次のものが考えられる(これは検証されていない)。
- 環境を記述する潜在変数
E_{1,t} \ldots E_{n,t}を、時刻t.について定める。 - エージェントの主要入力を
S_tとする。これはE_tの複雑な関数である複合的な知覚であり、概念上はAIのビデオカメラの役割を果たす。 - エージェントの行為(出力)
A_tを、時刻t.について定める。 - エージェントの「報酬チャネル」を
R_tとする。これはE_tとA_tに依存する単純な知覚である。 E_{t+1}はE_tとA_t.に依存する。E_{1,t}が私たちの目標である。これは概念上、時刻t.に皿の上にアンズがあることの役割を果たす。
次のように仮定する。
- 初期訓練段階では、エージェントの行為
A_tは範囲\theta.内に強制される。たとえば、AIの出力がベクトルであり、初期段階にはベクトル内の量が[0, 0.5]の範囲に切り詰められるとする。 A_tが\theta内に固定されている間は、環境変数E_1 \ldots E_mだけが変化し、変数E_{m+1} \ldots E_nは常にゼロである。- 変数
E_{m+1} \ldots E_nがゼロである間、Rは、私たちが意図した目標に対応する仕方でE_1 \ldots E_mに依存する。たとえば、E_1が「皿の上にアンズがある」であり、E_{m+1, t} \ldots E_{n,t} = 0 \implies R_t=E_{1, t}.であるとする。 E_{m+1} \ldots E_n,の非ゼロ値の一部では、E_1が0の場合にも非ゼロの報酬があり、しかもこの報酬はE_1.に由来する報酬よりも容易に(より頻繁に)得られる。
現在の訓練手法では、AIは初期訓練段階にアンズを生み出すことでRを得ることを学び、後の段階には、より容易な別の介入によってRを得ることを学ぶと自然に予想される。
私たちが望むのは、あたかも「E_1が1であることを望む」かのように、すなわち環境内の潜在変数を目標として持つかのように振る舞うエージェントを得るための何らかの方法である。この方法はスケーラブルであってほしい。つまり、エージェントの行為可能範囲が広がったとき、意図された目標とエージェントが実際に最適化しているものとの従来の相関が能力増大によって切り離されるのではなく、増大した範囲を用いてE_1をより効果的に最適化するという意味である。
さらに現実的にするには、訓練のある時点で、A_tがS_{t+1}に干渉しうる可能性も導入すべきである。そうすることで、「目標知覚が達成された」ことを常に不変に意味するような、感覚データから直接学習可能な単純な関数が存在しないようにする。すなわち、十分に高度なAIは任意の感覚チャネルの前にテレビ画面を置くことができるだろう。もし訓練された真の最適化対象が「この感覚チャネルに、特定のクラスのアンズ画像を表示させよ」であったなら、これによりAIはアンズの感覚データをもっと安価に生み出せる。
そうでなければ、たとえばS_{1, t}が常にE_{1, t},と完全に相関する場合、トイ問題を解いたように見えるエージェントが、実はS_1.を最適化することを学んだだけなのではないかと懸念する必要がある。確かに、特定の感覚知覚S_1がRとQによって特定され、いまや永続的に最適化されていることは示せたかもしれない。しかし、それが私たちの意図した目標E_1をもたらすのは、このモデルがS_1とE_1.との間に変更不能な相関を導入したからにすぎない。現実には、この種の相関は、S_1,に対する十分に高度な最適化を前にすれば崩壊するため、対応するアプローチはスケーラブルではないだろう。
アプローチ
因果的同定
この問題は、AIを感覚データそのものではなく、その感覚データの特定の潜在的原因へ「向ける」問題だと見なせる。
潜在的原因については、たとえばベイジアンネットワークとして実装できる因果モデル群など、標準的な統計学の体系が存在する。この問題について最初の進展を得るため、一般性を多少失う代わりに、環境がそうした因果モデルの一つの構造を持つと仮定してもよい。
そのうえで、次を満たすアルゴリズムと訓練手法を考案しようと試みられる。
- (a)AIが受動的で、私たちの信号に干渉していない訓練段階において、
E_1を一意に特定する優れた方法がある。 - (b)アルゴリズムと訓練手法が、
E_1を最適化し、その後もE_1,の最適化を続けるエージェントを生み出すものである。これは、エージェントの行為可能範囲が、E_1とAIの感覚データの何らかの直接的な関数的性質との従来のつながりを妨げうる仕方で拡大した後にも成り立つ。
改変回避の学習
現在の標準的な強化学習パラダイム内のエージェントに、「報酬信号に干渉しないことを学ばせる」または「実物のアンズと相関しない報酬を得ようとしないことを学ばせる」ことで、トイ問題に直接取り組むこともできる。
これがスケーラビリティの問題を少しでも表現するためには、私たちの意図した意味との相関をエージェントが決して破壊できないような感覚信号を、シナリオに追加してはならない。たとえば、報酬チャネルRが干渉されたかどうかを知らせる別のチャネルQでRを補完するなら、エージェントはある時点でQ.に干渉できる行為可能範囲を獲得しなければならない。
一つのアプローチ例は、エージェントの行為可能範囲を、Rを得る、より容易な新しい方法を、E_1.を操作せずに繰り返し与える仕方で繰り返し広げることである。そのような拡大の第一段階では、エージェントは、「それはRを得る偽の方法だった」という意味を意図した補助信号Qを受け取る。行為可能範囲拡大の第二段階では、アルゴリズムを変更し、Q.を停止する。私たちが意図する結果は、この時点でエージェントが一般的な形で「Rに干渉しないこと」または「E_1を、Rによって特定されたものとして追求し、R.そのものを追求しないこと」を学んでいることである。
エージェントの学習を完全に停止するだけという、スケールしない解決策を避けるため、エージェントの行為可能範囲がさらに広がるにつれて、意図された目標E_1を得る効力が増さなければならないと定める。すなわち、望ましい振る舞いは、増大した行為可能範囲を利用することをエージェントが実際に学ぶ一方、ただしその新しい戦略を、E_1.をより効果的に得ることへ向けることである。
感覚データの何らかの直接的関数を自らの目標として特定することをエージェントが学ぶという、スケールしない解決策を避けるため、SはE_1.との間に、変更不能で、エージェントが干渉できない関係を一切持たないと定める。ただし第一段階では、Qによって、SとE_1.との何らかの「通常の」関係に対する干渉を確実に特定させることはできる。
(所見:原因同定アプローチと比べると、改変回避アプローチは、今日Tensorflow上で試せるものにはるかに近いだろう。しかし私には、改変回避アプローチは深い問題に対して場当たり的な方法を取っているように感じられる。このアプローチでは、必ずしも「エージェントの思考を環境の諸要因へ向ける方法を学習」しているのではなく、単に「自らの感覚目標に対する、自己起源の特定の種類の干渉を避けるようエージェントを訓練」しているだけかもしれない。たとえば、ほかの誰かが介入してエージェントの報酬ボタンに干渉し始めたなら、改変回避アルゴリズムがアンズを最適化し続けることよりも、成功した原因同定アルゴリズムが堅牢にそうし続けることのほうに期待が持てる。もちろん、改変回避はまだ実際に試されておらず、どんな興味深い観察が得られるか分からないので、試す価値はありそうである。考えられる最も楽観的な世界では、改変回避の構成は問題を解くために原因を特定することを学ぶ。――Yudkowsky)