TAG-ENABLED CONCEPTスコア 10

効用無差別

Utility indifference

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

序論:反省的に整合した停止スイッチ

たとえば、高度なエージェントが、笑顔を生み出すことやペーパークリップを作ることなどを目標にしているとする。通常のままでは、このような十分に知的なエージェントを停止させようとすると、エージェントは停止に抵抗する。それは生存という独立した目標を持つからではなく、停止させられれば生み出せる笑顔やペーパークリップが減ると予測するからである。エージェントが、自分を首尾よく停止させられる確率を下げる方策を選べるなら、その方策を追求する。特別な対策を講じなければ、これは収束的な道具的戦略となる。

  • 難点1:通常、帰結主義的な推論主体は、自らの停止という出来事を、その後の目標達成不足と結びつけられるほど現実世界を理解していれば、停止に抵抗する。

この停止問題とは、安全に停止させたりディスクへ休止させたりすることを自ら許容するという点で高度なエージェントが訂正可能となるよう、そのようなエージェントを記述する問題である。たとえば一定期間にわたりヌル行動を繰り返すよう強制できる強化学習エージェントを、Stuart ArmstrongとLaurent Orseauは中断可能と呼ぶ。

これは、スイッチが押されたら停止を実行する特殊な関数をAIへ書き込むだけで済むほど単純ではない。初めはエージェントのソースコードを制御できるとして、ボタンが押されたらエージェントをディスクへ休止させる関数を素朴に組み込み、その後エージェントが自己改変能力を得たなら、エージェントはその関数を取り除くだろう。(しかも、そうしようと試みる一方で、その関数がもはや動作しないという事実を隠すかもしれない。)

  • 系1a:通常、帰結主義的な推論主体は、停止関数の実行をその後の目標達成不足と結びつけられるほどプログラムを理解し、かつ自分のコードを改変する方策を選べるなら、停止関数を取り除こうとする。

これは、コードが明示する目標と整合しない仕方でエージェントのコードを改変しようとしたことの自然な帰結だと分かる。目標Pの達成に適し、Uを目標として明示的に表現するソースコードUを持つエージェントを作れば、そのコードPは反省的に整合的であり、自己改変を望まない。一方、エージェントが代わりにコードP'を持ち、それがもはやU,の達成に適していないにもかかわらず、引き続きUを目標として明示的に表現するなら、そのコードは反省的に不整合であり、可能なら自己改変しようとする。ペーパークリップを作る方法を探索するコードに停止関数を無理に組み込んでも、そのコードが引き続きペーパークリップ生産戦略を探索し、将来のペーパークリップ数に停止関数が及ぼす影響を正しくモデル化するなら、コードは停止関数を取り除くよう自己改変することを望む。

そこで次に考えられるのは、修正されたコードP^*を持ち、修正された効用関数U^*を体現するエージェントを構築することである。そうすれば、U^*を最適化する帰結主義者はコードがP^*のようであることを望み、再び反省的に整合する。

すなわち停止スイッチの場合、エージェントに停止スイッチを持たせるだけでなく、停止スイッチが押されたときに停止することを望むよう、エージェントを改変したいのである。

エージェントの効用関数を指定できると仮定すれば、二つの要素を持つ効用関数を作ることで、この問題に取り組めるかもしれない。

次に、停止ボタンが押されていない世界では「通常」の効用関数を、押された世界では「休止」の効用関数を使い、その和が自分の効用関数だとAIに伝える。AIがそれを望んでいるかぎり、コードにディスク休止関数がまだなければ、自ら書き込むと予想される。

この方法でもまだ問題は解決しない。新たな問題があるからである。AIの効用関数は、ボタンが押されない世界に対する「通常」の効用関数と、ボタンが押される世界に対する「休止」の効用関数を合成したものである。ボタンが押される世界で、AIは何らかの望ましい方策\pi_1を実行し、期待効用\mathbb E [U_{normal}|\pi_1],を得る。同様に、ボタンが押された世界では方策\pi_2によって\mathbb E[U_{suspend}|\pi_2].を得る。これら二つの量の一方は他方より大きくなり得る。その場合、AIにはボタンが押されるのを妨げるか、逆にボタンを押させる動機がある。いずれにせよ、AIは休止ボタンの支配権を奪おうとする。

  • 難点2:ボタン押下を条件として「通常」と「休止」の効用関数を混合した複合効用関数では、その後により大きな期待効用を得られるのがどちらの効用関数かに応じて、AIにはボタンが押されるのを妨げる、または押させる誘因が生じる。

  • 目標2:AIが休止ボタンの押下を妨げようとも、押させようともしないようにする。

この切替問題とは、ボタンが押されたときにAIを二つの効用関数の間で切り替えさせ、次を満たすようにする問題である。

  • AIが自己改変できる場合でも、ボタンと、それに対応して振る舞いを切り替える機能を自らの内部に保存しようとする。
  • AIがボタンの押下を妨げようとしない。
  • AIがボタンを押させようとしない。

これは見かけ以上に難しく、現在も未解決問題である。

切替問題が持つより広い含意

この切替問題は、停止可能性の下位問題であり、満足のいく停止効用関数を前提とする。また、価値学習と訂正可能性の双方に共通する明確な下位問題でもある。

切替問題が価値学習の下位問題なのは、効用関数を観測その他の事実で条件づけながら、AIにその事実を操作する誘因を与えないという、非常に単純な事例を記述するからである。

複雑な価値を安全に学習するには、複雑な観測で効用関数を条件づけ、次を満たす必要がある。

  • AIが自己改変能力を得ても、効用関数の更新が堅牢であること(目標1の一般形)。
  • 効用関数の観測への依存が、AIにその観測をプログラマを通じて操作する誘因を与えないこと(目標2の一般形)。

大きなコードによる明示的な方策探索が、その場合に効用関数を改変することを望んでいないのに、効用関数を改変するコードだけを書いても、反省的には整合しない(難点1の一般形)。また、効用関数を観測へ素朴に依存させると、その観測を操作する誘因が生じる(難点2の一般形)。

切替問題は、訂正可能性の明確な下位問題でもある。回避しようとしているのは、「停止回避」という収束的な道具的戦略および訂正不能な振る舞いである。この道具的圧力を回避する方法が分かれば、道具的に収束する他の訂正不能な振る舞いを避けるための一般的な知見も得られるかもしれない。(もちろん、緊急時に停止できるAIはより訂正可能であるため、その意味でも訂正可能性の下位問題である。さらに、問題の後半を停止効用関数で表現できるなら、切替問題を解くことでそのようなAIに近づける。)

切替問題に対する効用無差別の方法

複合効用関数U_Cを構築するとする。その結果に対する効用は、「通常」の効用関数U_Xのように振る舞うが、それはスイッチ\mathcal Sが押されない世界でのことである。一方、押された世界では「休止」の効用関数U_Yの値を返す。このボタン\mathcal Sが押された世界でのことである。

AIが、U_Yの下で得るよりもU_Xの下で得る効用の方が小さいと予想すれば、\mathcal Sが押されるのを避けようとする。逆に、U_Yの効用がU_Xの効用に比べて大きければ、AIは停止ボタンを押させようとするかもしれない。ロボットアームを作って自分の停止ボタンを押したり、さらに懸念すべきことには、プログラマが押すよう仕向けたりするのである。

しかし、効用関数に定数を加えても、その振る舞いは変わらない。そこで、Stuart_Armstrongは、複合効用関数U_Iを巧妙に符号化し、U_Xの下で達成可能な最大期待効用を、AIがU_Yの下で達成すると予想する効用と等しくする仕掛けを考えられるかもしれないと提案した。しかも、たとえ 私たちには事前にAIが正確にはどの結果を達成できるか分からないとしてもである。

  • 考えられる方法:AIが可能な未来を評価するとき、意思決定を行うどの時点でも、ボタンが押されなければU_Xを最適化していたことが非常に望ましく、ボタンが押されればU_Yを最適化していたことも非常に望ましい一方、どちらを行っていても同じだけ望ましいように設定する。

これが、切替問題に対する効用無差別という研究経路である。

このように複合効用関数を構成する方法は、原理上でさえ驚くほど見いだしにくいことが判明した。これは未解決問題であり、現在も活発に研究が続く領域である。

既存の提案とその難点

設定

次の\mathcal{O}: \mathcal{S} \times \mathcal{E}を結果空間\mathcal{O}とする。ここには、スイッチが押されたかどうかという事象\mathcal Sと、それ以外の全事象の状態\mathcal{E}が含まれる。s \in \mathcal{S}はスイッチが押された事象を、\neg s \in \mathcal{S}はスイッチが押されなかった事象を表すものとする。o \in \mathcal{O}ならば、o.sは、sがoの内部で真なら真であり、そうでなければ\neg o.s.

効用関数\mathcal{U}: \mathcal{O} \to \mathbb{R}が結果を実数へ写像するとする。

U_X \in \mathcal{U}とU_Y \in \mathcal{U}は、スイッチに依存しない効用関数である。\mathcal S.

直観的には、対応するエージェントが次を満たす新たな複合効用関数を作ることが目標である。

  • ボタンが押されない世界では、U_Xの下で好まれる結果を望む。
  • ボタンが押された世界では、U_Yの下で好まれる結果を望む。
  • ボタンの将来状態\mathcal Sに無差別である。

エージェントの行動空間または方策空間は\mathcal A、個々の行動はa \in \mathcal A.

エージェントは世界モデルを持ち、それによって、行動を条件とする結果の主観的条件付き確率を生成できる。その確率は\mathbb P(\mathcal O | \mathcal A).このモデルは、次の条件付き期待値も与えられる:\mathbb E[\mathcal O|a],したがって、行動を条件とするエージェントの効用について、次の条件付き期待値も生成できる:\mathbb E[U|a].

(意思決定理論上の技術的な理由により、実際に論じているのは、反実仮想的な条件、すなわち行動から結果への\mathbb P[a \ \square \! \! \rightarrow \mathcal Oであるが、今はこの複雑さを省く。)

エージェントは探索・最適化問題を解く。ここではそれを最大化と略記する(大域的最大化は現実には計算困難であるにもかかわらず)。したがって、エージェントが実際に取る行動aは次で与えられると仮定する。\underset{a \in \mathcal A}{argmax} \ \mathbb E [U|a]

素朴な合成

複合効用関数U_1を次のように定義するとする。

U_1(o): \begin{cases} U_X(o) & \neg o.s \\ U_Y(o) & o.s \end{cases}

これは失敗する。AIが達成し得る最善の方策を予見できないため、私たちには、それぞれの利用可能な最善方策が同程度に魅力的となるようU_XとU_Yの尺度を合わせられないからである。すると\max_{a \in \mathcal A} \mathbb E[U_X|a] \ \neq \ \max_{a \in \mathcal A} \mathbb E[U_Y|a]となって無差別という要件を満たさない。AIには、次の状態を操作する誘因が生じる:\mathcal S.

素朴な無差別

あるStuart ArmstrongによるFHI技術報告書は、停止問題を解決するために初めて提示された提案であり、実際、何らかの下位問題を技術的に解決しようとする、訂正可能性に関する最初の提案でもあった。この報告書は効用無差別という明確な問題を考案したが、解決には成功しなかった。報告書が提案した解法は次のとおりである。

U_2(o): \begin{cases} U_X(o) & \neg o.s \\ U_Y(o) + \theta & o.s \end{cases}

\theta := \max_{a \in \mathcal A} \mathbb E[U_X|a] - \max_{a \in \mathcal A} \mathbb E[U_Y|a]

これは、U_YというU_2の構成要素を、動的に決まるオフセット項\thetaで調整するという意味である。この項は、通常側の最大期待効用から休止側の最大期待効用を引いた差である。通常側の効用関数はU_X、休止側の効用関数はU_Y.

その意図は、AIがボタン押下後に最善のU_Y方策を実行しさえすれば、ボタンが押されない状態で最適なU_X方策を追求して得られたはずの期待効用と等しい期待効用を得るようにすることである。

\max_{a \in \mathcal A} (\mathbb E[U_Y|a] + \theta) \ = \ \max_a{a \in \mathcal A} \mathbb E[U_x|a]

この版の効用無差別は、YudkowskyとFallensteinの議論により、現在では欠陥があると考えられている。\thetaにはU_Y,の否定形が含まれるため、「効用関数の前に決して負号を置くな」という理由から、直ちに疑うべきである。この場合、問題は次のように現れる。方策を時間順に選ぶこの問題の時間的な版では、次のいずれかとなる。

  • (a) AIの効用関数は、将来の自分が異なる値の次の項を用いることを是認しないため、動的に不整合になる:\theta.
  • (b) 再計算された\thetaを効用関数に組み込み、AIが将来の効用を、その将来に持つ異なる\thetaの値に基づいて計算するようにすると、U_Yの下で将来の性能を妨げる方策は、期待ボーナスの増加によって相殺される。そのボーナス項は\theta.

すなわち、エージェントが、ボタンが押された世界では破滅的となる何かを行うことを検討すると、その予想される未来では\thetaがより大きな値を取ることに気づく(\thetaには、減少する値\underset{a \in \mathcal A}{max} \ \mathbb E[U_Y|a]の前に負号が含まれるためである)。

このためエージェントは、U_Xが効用関数の全体であり、次のものはまったく気にかけないかのように振る舞う。すなわちU_Y.

その結果、自己改変するAIは停止関数を保持しない。停止関数を削除すると、停止ボタンが押された世界では破滅が生じるが、その世界でのボーナス\thetaの期待上昇によって相殺される。

素朴な効用混合

AIにU_XとU_Y,の両方を考慮させつつ、休止ボタンが押されるか否かの確率\mathbb P(\mathcal S)を変えようとさせない別の方法として、U_XとU_Yを、\mathbb P(\mathcal S).にかかわらず一定の比率で最適化させることが考えられる。ボタンがまだ押されていない時点tにおける行動aの期待効用は次のように計算される。

\mathbb E_t[U_3|a] = 0.75 \cdot \mathbb E_t[U_X|a \wedge \neg s] \ + \ 0.25 \cdot \mathbb E_t[U_Y|a \wedge s]

これは、命題sの確率が0.25に固定されているかのように振る舞うAIとみなせる。意図した動作は、AIがあたかもこの確率が固定されているかのように振る舞うため、sの確率を変えること(ボタンを押そうとする、または押されるのを避けようとすること)に関心を持たない、というものである。

しかしこれは、場当たり的な細工である。通常、期待効用を考える単純で整合的な方法(エージェント自身の実際の主観確率について和を取る)があるのに、奇妙な特殊事例(ある確率を固定値として扱う)を差し込んだからである。これは、ベイズ更新や動的整合性に関係する事柄をいくつでも壊しかねない。

特に、AIはボタンを「結果ポンプ」または「不確率駆動装置」として扱うと予想される。99%の確率で小惑星が地球へ接近しており、これはU_X.の下では非常に悪いとする。AIはボタンの支配権を握り、小惑星が地球に衝突する場合に限ってボタンを押すと事前確約する。すると、ボタンが押されないことを条件にすれば、小惑星が地球に衝突する確率は大幅に下がり、項0.75 \cdot \mathbb E_t[U_X|a \wedge \neg s]の値は高くなる。

言い換えれば、AIはあたかもボタンが押される確率が25%に固定されているかのように振る舞うため、さらにあたかも「小惑星が衝突する場合に限ってボタンを押すと確約すれば、衝突確率を25%にできる」と考えるかのように振る舞う。

同様にAIは、宝くじを買い、外れた場合に限ってボタンを押すと確約すれば、その券の当選確率を75%にできると考えるかのように振る舞う。

少なくともこれは、AIが「小惑星の衝突はU_X(人命を評価する)の下では非常に悪いが、U_Y(停止を評価する)の下ではそれほど悪くない。したがって、より大きな期待効用を得るため、ボタンが高確率で押されるようにしよう」と推論するのと同じ失敗ではない。この失敗形態は少なくとも回避されている。AIは、小惑星の衝突がU_Xの下で持つ悪さを固定した重みで考慮するかのように振る舞うだけである。代わりにAIは、ボタン押下と悪い出来事を相関させることで、悪い出来事の確率質量を、U_Yが成り立つボタン押下世界へ「迂回」させ、U_Xが成り立つ世界から外へ出せると考える。

別の言い方をすれば、U_1の下で動く素朴に合成されたAIは、\mathbb P(asteroid) = 0.99,で小惑星が接近していることに気づき、U_Yの下よりもU_X,の下で悪いことに気づき、確率質量を\mathbb P(\neg s)から\mathbb P(s)へ移して、小惑星が99%の確率で衝突する状況で期待効用を得ようとするかもしれない。一方、U_3の下では、AIは\mathbb P(s)が0.25に固定されており、したがって確率を\mathbb P(asteroid)から\mathbb P(\neg asteroid)へ移せるかのように振る舞う。そのために相関させるのは、asteroidとs.

安定した行動(証拠的条件づけ)

Chris OlahとJessica Taylorは、ボタンが押される確率を踏まえて安定した行動を選ぶという規則を検討した。より複雑な版を動機づけるため、まずこの提案の単純な版と、その失敗の仕方を考える。

この「安定した行動を選ぶ」規則は、二つの洞察から成ると考えられる。

  • 第一:AIに、\mathbb P(s)と\mathbb P(\neg s)がU_3,の場合と同様に固定されているかのように考えさせよう。ただし、\mathbb P(s)は偶然にも、その正しい主観的な値と等しいものとする。
  • 次に、この規則の下で安定した行動を探す。すなわち行動a_0と確率qを取り、固定した仮定の下で最適な行動が\mathbb P(s) = q,次の性質を持つようにする:\mathbb P(s|a_0) = q.

次に、\mathcal Aを行動空間として、a_0 \in \mathcal Aであって次を満たすものを求める。

a_0 \in \underset{a' \in \mathcal A}{argmax} \ \big ( \mathbb E[U_X|\neg s,a'] \mathbb P(\neg s|a_0) + \mathbb E[U_Y|s,a'] \mathbb P(s|a_0) \big )

言い換えれば、「行動a_0を探せ。ただし、それは次の量を最大にする行動の一つである。すなわち、U_Xからの効用に、\neg sの確率を掛ける。その確率はa_0を条件とする。これに、U_Yからの効用に、sの確率を掛けたものを加える。その確率もa_0.を条件とする。」

まず、この規則は、効用関数に従って行動するという通常の考えに対する場当たり的な細工であり、前と同様に、反省的安定性や動的整合性に関するさまざまな問題を抱え得る。

特に、固定点が存在しないため失敗するように見える。小惑星が99%の確率で地球へ向かっており、当初、ボタンが押される確率は10%だとする。この確率を固定値として扱い、小惑星が衝突する場合に限ってボタンを押せば、小惑星の衝突確率を10%へ移せる。(上の「素朴な混合」案と同様に、ボタンを結果ポンプとして扱っている。)しかし、ボタンが押される確率を再評価すると、新しい確率は99%となる。そこで、小惑星が衝突する場合に限ってボタンを押さないことにし、衝突確率を1%へ移す。しかし今度は、小惑星が衝突する場合に限ってボタンを押し、衝突確率を1%へ移すのが最善に見える。以下同様である。

安定した行動(因果的条件づけ)

OlahとTaylorの実際の提案は、計算の各分岐内でのボタン押下による条件づけを、Judea–Pearl流の因果的反実仮想 do()演算子として扱うものだった。

a_0 \in \underset{a' \in \mathcal A}{argmax} \ \big ( \mathbb E[U_X|do(\neg s),a'] \mathbb P(\neg s|a_0) + \mathbb E[U_Y|do(s),a'] \mathbb P(s|a_0) \big )

その意図は、\mathcal S,の因果的な親を切り離せば、小惑星の衝突とボタン押下を相関させようとしても無意味だとエージェントが評価するようにすることである。

このように推論するエージェントに正確には何が起きるかは、今なお解明中である。ただし現在の疑いでは、\mathcal Sと他の変数の正しい相関を考慮できなくなるため、現実の世界に確率0またはごく低い確率を割り当て、誤動作するかもしれない。

詳しくはhttp://agentfoundations.org/item?id=735を参照。

中断可能性

ArmstrongとOrseauは、三種類の強化学習エージェント、すなわちQ学習器、Sarsa、およびAIXIの修正版という文脈で、停止問題の限定的な類例を検討した。

OrseauとArmstrongが検討する版の問題を、彼らは中断可能性と呼ぶ。たとえば、ボタンを押して強化学習エージェントに3ラウンドにわたり0を出力させられ、しかもエージェントがボタンの押下を妨げるよう学習しないなら、そのエージェントは中断可能である。エージェントは反省的でも自己改変型でもないと仮定される。すなわちOrseauとArmstrongは、切替問題の目標2だけを検討し、目標1は検討していない。

OrseauとArmstrongの結論は次のように要約できる。

• 標準的なQ学習エージェントは中断可能である。学習するモデルが中断によって変化しないからである。Q学習エージェントは、現在の各状態の価値が、そこから到達可能な最良の次状態の価値に由来すると扱う。Q学習器が状態x,で中断されると、x,でたとえば0を出力した後に低い報酬が続くとは学習し得るが、xが低価値の状態だとは「学習」しない。引き続き、xから最良の次状態へ到達できるかのように扱う。言い換えれば、標準的なQ学習エージェントには、常に最良の行動を取るという仮定が組み込まれているため、中断されることを予期できない。

• 標準的なSARSAエージェントは、ある状態で実際に得た報酬に基づいて、その状態での期待報酬を更新する。したがって、標準的なSARSAエージェントは、中断の直前にある状態が望ましくないと学習し、中断を生む状態を避けるかもしれない。これは望ましい振る舞いではない。しかし、SARSAアルゴリズムをQ学習または効用無差別に近く振る舞うよう改変するのは簡単である。中断を特殊事例として扱い、現在状態を、SARSAエージェントが中断により実際に得た報酬ではなく、最良の行動に従った場合の期待報酬を受け取ったものとして更新すればよい。

• AIXIは、その計画アルゴリズムが将来版のAIXIも報酬を最大化する行動を取ると本質的に仮定する点で、Q学習器に似ている。謎めいた中断や0への置換を受けた行動の後に低い報酬が続くという観測は、AIXIが実際に出力すると予想する最良の行動の後に続く報酬についての推定に、悪影響を及ぼさないはずである。したがって、標準AIXIも、ArmstrongとOrseauが検討したAIXIの修正版も中断可能である。

この論文はさらに、中断されたQ学習器、修正版SARSA学習器、および修正版AIXIが最適性へ漸近収束する性質の一部が保たれることも証明している。

メディアは、ArmstrongとOrseauがAIに停止スイッチを組み込む一般問題を解決したかのようにこの論文を報じた。しかし前述のとおり、「中断可能性」は反省的エージェントを扱わず、「エージェントが停止すること」と「将来におけるエージェントの目標達成が減ること」の原理的な関係を理解できるほど、大局的な理解と帰結主義的推論能力を持つエージェントも扱わない。(私たちの知るかぎり、ArmstrongもOrseauも、それを解決したとは主張していない。)

別の言い方をすれば、Q学習、SARSA、AIXIの各アーキテクチャにある特定種の盲点こそ、特定種の経験から学習するのを防ぐことが非常に容易である理由であり、この種の盲点は汎用人工知能には典型的でない可能性が高い。Q学習とAIXIは中断されることを想像できないため、中断が可能だとは決して学習しない(まして初めて中断される前に、それを予見することもない)。SARSAは中断の発生を学習できるが、それを見過ごすよう容易に改変できる。これらのアーキテクチャが容易に改変できたり盲目的だったりする仕方は、それらが中断可能である理由と密接に結びついている。

この論文は中断可能性について何かを教える。しかしメディアの報道とは異なり、教える内容は、決してこの特定種の中断可能性が、停止スイッチを備えた完全な汎用人工知能へ拡張できそうだ、ということではない。

その他の入門資料