本稿は、機械知能研究所(Machine Intelligence Research Institute, MIRI)研究アソシエイト兼DeepMind研究科学者のラマナ・クマール(Ramana Kumar)と、MIRI研究フェローのスコット・ギャラブラント(Scott Garrabrant)による共同記事であり、AI Alignment ForumとLessWrongから転載したものである。
人間の価値観と選好は、とりわけ複雑な領域では、明確に指定するのが難しい。そのため汎用人工知能(AGI)の安全研究の多くは、人間の価値観の表現(明言された選好、観察された行動、承認など)や、そのような価値観の表現を生む現実世界の過程を基盤とするモデルを学習することによって、人間の価値観と選好を間接的に参照するAGI設計のアプローチへ重点を置いてきた。人間の選好を捉えることを明示的な目標とはせず、人間の認知や行動の別の側面をモデル化・模倣することを目指すアプローチもある(ただし通常、最終的に人間の選好を満たすためである)。こうしたモデルをすべて人間モデルと呼ぼう。
本稿では、人間モデルを使うAGI設計に慎重になるべき理由をいくつか論じる。AGI安全研究共同体には、人間モデルへ依存するアプローチと並行して、人間モデルがなくてもうまく働くアプローチの開発へ、もっと力を入れることを提案する。とりわけ理論の開発ではなく、具体的なアプローチを練り上げて試すことへ重点を置けば、現在の安全研究の全体像を大きく補完するものになるだろう。一方、人間モデルを避けるのが難しく見えるさまざまな理由も認める。
人間モデルの問題
人間モデルを明確に論じるため、私たちの実際の選好(私たち自身が完全には把握できないかもしれない)と、私たちの選好を評価する手続きとを、大まかに区別する。第一のもの、実際の選好とは、人間がよく考えた末に、本当に望むものだ。実際の選好が満たされるのは成功である。第二のもの、選好を評価する手続きとは、人間による承認や、人間によく見えるもの(必然的に、情報や考える時間には制約がある)など、実際の選好のさまざまな代理指標(プロキシ)を指す。人間モデルは第二の区分に入る。一例として、結果の記述の集合に対する、人間の「はい/いいえ」の承認を極めて正確に予測する機械学習モデルを考えてほしい。以下で述べる第一の懸念は、人間の承認へ過剰適合し、それによって実際の選好とのつながりを壊すことについてである。(これはグッドハートの法則の一例である。)
独立した監査が減る
AGIシステムを作り、それを使って新しい都市の大量輸送システムを設計したいと想像してほしい。このようなプロジェクトに伴う安全上の問題はよく認識されている。問題を完全に解決したとは確信していないが、それでも試すには十分な自信があるとしよう。偽の都市入力データを与え、サンドボックス内でシステムを動かし、その出力を調べる。次に、分布シフト(distributional shift)に対する堅牢性を評価するため、もっと突飛な偽の都市データで動かす。AGIの出力は、筋の通った輸送システムの設計と検討事項に見え、それがよい設計だという論拠、指標、その他の裏づけとなる証拠も含んでいる。これで満足し、実在する都市のデータでシステムを動かして、得られた設計案を実施する準備が整ったと考えるべきだろうか。
この問いへの答えを左右する重要な要因の一つは、AGIシステムを人間モデルを使って作ったかどうかだと考える。人間モデルなしに、輸送設計問題への(人間が承認する)解を生み出したなら、その出力をもっと容易に信頼するだろう。人間モデルを使って、私たちが承認する解を生み出したなら、出力の多くの側面はよい輸送システム設計(私たちの実際の選好)に関するものであり、また多くの側面は人間に承認されるよう調整されたものだと予想する。この二つの目標が食い違う範囲では、よい設計を犠牲にして人間モデルへ過剰適合しているのではないか、と心配しなければならない。(なぜ逆方向ではないのか。サンドボックスで得た結果の評価には、人間の判断を使い、実際の選好が満たされたかを測る独立の指標は使わないからである。)
人間には、設計の質について誤りたくない、まして欺かれたくないという選好がある。システムがこうした選好を正しく捉えていることに、どこまで依存したいだろうか。システムが人間をモデル化するなら、システムがこうした選好を学習して満たすことへ強く依存する。そうでなければ、実際によい輸送システム設計より、見栄えはよいが実際には悪い設計の方が作りやすい範囲で、私たちは欺かれると予想する。一方、システムが人間をモデル化しないなら、その出力がよい設計に見えるという事実は、実際によい設計であることの、よりよい証拠になる。直観的に言えば、可能な出力を標本抽出し、その出力がよく見えること(人間についての知識を通じて)を条件とする場合、システムの知識が「何がよく見えるか」より「何がよいか」に関するものであるほど、その出力がよいこと(領域についての知識を通じて)の確率は高くなる。
この問題を捉える手がかりは、システムの出力を独立に監査したいという要望である。システムが人間モデルを使うと、その出力と監査過程(人間の判断)の間の相互情報量が増える。したがって、人間モデルを使うと、独立した監査を行う能力が低下する。
人間モデルを避けても、この問題を完全には避けられない。この問題には依然として「外側ループ最適化」版がある。システムがサンドボックス内で奇妙な、または欠陥のある設計を生み出し、監査中にそれを特定したなら、おそらく解を退け、それを生み出したシステムのデバッグを試みるだろう。これにより、全体の過程(監査とデバッグの各段階を通じた複数の版のシステムを含む)に、監査手続きを欺く出力へ向かう偏りが生じる。
しかし、外側ループの最適化圧力は、ループ内の最適化圧力より弱く、したがって懸念も小さい。人間モデルを使う場合は、問題がはるかに深刻になる、すなわち欺きへ向かう偏りが強まる、と私たちは主張する。関係する最適化そのものがループ内にあり、より頻繁に働くからである。
この点を説明するもう一つの比喩として、試験対策のためだけに教えるという、グッドハートの法則の古典的な例を考えよう。教材を学び、それから試験を受けるなら、試験の得点は教材についての知識をかなりよく示す。代わりに過去の試験問題を勉強するなら、試験の得点は試験に合格する能力を示す。それは教材についての知識と相関するかもしれないが、得点が上がるほど、その相関がある可能性は下がっていく。ここでは、人間モデルが過去の試験問題に、実際の選好が教材に相当する。試験を受けることは監査に相当し、私たちはそれを学習方法から独立させたい。
バグによるリスク
最初のAGIシステムを、ありふれた意味で正しく実装できないかもしれない。具体的には、安全な、またはアライメントされたAGIの理論を完全に開発しても、バグや実装技法の問題によって、その理論を実装できないかもしれない。この場合、AGIの知識と人間の選好の間の相互情報量が少ない方が、比較的ましである。システムの行動は、何らかの形でその知識に依存すると予想する。また実装上の誤りは、その依存関係の性質を、私たちの意図と予想から外れたものへ変えると予想する。人間の選好に依存する誤った行動は、それに依存しない誤った行動より危険に見える。
AGIシステムの実装の空間を、意図した設計との類似性(同じことだが、バグによる設計からの逸脱の深刻さ)のような尺度のもとで考えよう。混乱によって何をしているのか理解を誤ったり、実装上の誤りを犯したりして、意図したものとわずかに異なる設計へ行き着くかもしれない。そのため、最初に作るAGIシステムに近い点がすべて安全であってほしい。
バグによるリスクが現れる形は、少なくとも三つある。
誤って符号化された価値:AGIの最初の用途を、範囲が限られ、明確に指定された課題を解くことにするつもりだとしよう。しかし、ひどく誤解または実装を誤り、実際には何らかの目的関数を無制限に最適化するものへ行き着いたとする。その場合、その目的は、人間の選好ともっと直接結びついたものより、パズルを解くことのような抽象的なものの方がよいと思われる。単純化した例として、目的関数の符号(正/負)を誤った場合を考えてほしい。
操作:独立した監査について先に挙げた論拠は、監査する予定の特定の課題だけでなく、AGIシステムが行いうる、人間が承認しないかもしれないあらゆる活動にも当てはまる。セキュアなはずのシステムへ侵入する方法を見つけること、意図や活動を私たちから隠すこと、私たちを露骨に操作することなどが例である。人間の優れた心理モデルへアクセスできれば、私たちが犯しうる誤り、見落としうる抜け穴、システムの異なる行動に私たちがどう反応しうるかを推測するために使えるので、こうした課題ははるかに簡単になる。
人間をモデル化することは、設計空間上、人間を操作することに非常に近い。人間の正確なモデルを持つシステムは、そのモデルを使って人間をうまく操作するシステムに近い。
脅迫:バグによるもう一つのリスクは、AGIシステムが私たちの価値を誤って重視することではなく、セキュリティが不十分であることから生じる。私たちの価値がAGIシステムへ正確に符号化され、システムがその充足を重視するなら、その価値は、最初のシステムを操作することで利益を得られるほかの主体による脅迫の標的となる。この問題についての、さらに多くの例と見方はこちらで説明されている。
人間モデルがある場合の、バグによるリスクの増加は、次のように要約できる。バグによってAGIシステムが破局的結果を生み出すリスクがどの程度であれ、最悪中の最悪の結果は、システムを人間モデルで訓練した場合の方が起きる可能性が高く見える。そうした最悪の結果は、人間モデル内の情報に依存するからである。
独立した監査の減少とバグによるリスクは、どちらも、システムを人間モデルの情報から独立させ、システムがその情報へ過剰適合したり、意図に反する形で利用したりできないようにすることで軽減できる。以下で検討する残り二つの問題、精神犯罪と予期しないエージェントは、人間の選好をモデル化すると、人間に似た何かをシミュレーションする可能性が高まる、という主張へさらに強く依存する。
精神犯罪
多くの計算は、たとえば、痛みや喜びを経験する感覚ある存在を構成することによって、道徳的に考慮すべき実体を生み出す可能性がある。ボストロム(Bostrom)は、そうした実体の不適切な取り扱いを「精神犯罪(mind crime)」と呼ぶ。何らかの形で人間をモデル化すると、モデル化しない場合より、そのような計算を生じさせる可能性が高いと思われる。人間は道徳的に考慮すべき存在であり、システムの人間モデルが、人間を道徳的に考慮すべき存在にする性質を共有することになりうるからだ。
予期しないエージェント
上記の精神犯罪の論点と同様、人間はエージェントのような存在なので、人間モデルを使うAGI設計は、エージェントのような下位システムを生み出すリスクが高いと予想する。たとえば、帰結主義的に推論するものの出力を予測しようとすると、そのような推論者を含むものの空間上の最適化問題へ帰着しうる点に注意してほしい。人間の選好をうまく予測するよう設計されたシステムは、アライメントされていない下位エージェントに伴う問題へ遭遇する可能性が、真に高いように思われる。(それでも、可能性が高くなる幅は小さいと考えている。)
人間モデルのない安全なAGIは顧みられていない
独立した監査についての懸念と、上記の追加論点を踏まえ、人間モデルに依存しない、安全なAGIシステムを開発する実用的アプローチについて、さらに研究が行われてほしい。現在、これはAGI安全研究の状況で顧みられていない領域である。具体的には、「ここに提案するアプローチがあり、試す、またはさらに調査するための次の手順はこれだ」という形の研究を、工学重視の研究と呼ぶなら、そのほぼすべてが人間モデルを使う文脈で行われている。人間モデルを避ける安全研究がいくらか見られる場合も、たとえばエージェント基礎論についてのMIRIの研究など、理論重視の研究である傾向がある。これでは、人間モデルのない安全性について、工学を重視する研究が不足しているという空白は埋まらない。
空白があるという主張を具体化するため、安全研究における次の取り組みを、通常どのように定式化するか考えてほしい。反復蒸留・増幅、討論、再帰的報酬モデリング、協調的逆強化学習、価値学習である。いずれの場合も、人間モデルはアプローチの基本設定へ組み込まれている。ただし、これらの領域の技術的成果は、人間からのフィードバックなどの情報源を、純粋にアルゴリズム的で独立したシステムへ置き換えれば、人間モデルのない設定へ移せる場合もあることに注意したい。
人間モデルへ依存しない既存研究には、安全に中断できるエージェントの定式化、影響尺度(または副作用)の定式化、明確な形式仕様を持つAIシステムを作るアプローチ(たとえばツールAIの一部の版)、オラクルAIの一部の版、隔離・封じ込めがある。これらのアプローチの一部は、人間モデルへ依存しないものの、人間のモデル化が行われる文脈で最も意味を持つ。たとえば影響尺度は、現実世界で直接行動するエージェントについて、最も意味を持つように見える。そして、そのようなエージェントには人間モデルが必要となる可能性が高い。それでも、こうしたあらゆる種類の研究と、人間モデルに依存しない安全なAGIを作る新しい技法について、さらに研究が行われてほしい。
人間モデルを避ける難しさ
人間モデルなしに安全なAGIを作る方法についての研究が、まだあまり見られないもっともらしい理由は、それが難しいことである。本節では、いくつかの異なる難しさを説明する。
有用性
人間をモデル化しないシステムを、うまく役立てる方法は明らかでない。少なくとも、人間をモデル化するシステムほど明らかではない。そのシステムは、有用な行動についての情報源(たとえば人間の選好)を直接利用できるからだ。言い換えれば、人間モデルなしに仕様問題――複雑な領域で、望ましい行動(しかも望ましい行動だけ)を正しく指定する方法――を解く方法が不明確である。「人間モデルに反対する」立場は、有用な課題を、明確に指定され、人間に依存しない課題へ、人間だけによって、または人間をモデル化しないシステムによって変換する、仕様問題の解決法を求める。
説明のため、定理証明や原子レベルで精密な製造のような、明確に指定され、複雑だが人間に依存しない課題を解決したとしよう。では、その解決法をどう生かせば、よい(またはよりよい)未来を生み出せるだろうか。超知能システムが人々の価値を何らかの形で直接符号化していない場合、全員に、あるいは少数の人にさえ、そのシステムへのアクセスを与えても、そうした価値が実現する未来を生むことは明らかでない。(これはウェイ・ダイ(Wei Dai)の人間安全性問題と関係するように見える。)
暗黙の人間モデル
一見「独立した」課題でさえ、その起源である人間の動機について、少なくとも少量の情報が漏れる。大量輸送システムの設計問題を、もう一度考えよう。問題自体が人間の利用するシステムの設計に関するものなので、課題を指定するとき、人間のモデル化を完全に避けるのは難しいように見える。さらに微妙なことに、パズルを解くことのような非常に抽象的・汎用的な課題でさえ、パズルの情報源・設計者についての情報を含む。もっと明確に人間中心的な問題を符号化するよう調整されたパズルなら、なおさらである。(シャーら(Shah et al.)の研究は、世界に潜在する人間の選好についての情報を利用することを検討している。)
仕様の競争力/私の意図どおりにせよ
たとえば最適化目標(強化学習問題はその具体例となる)の形で課題を明示的に指定することは、脆弱だと知られている。私たちが重視することのうち、明示的な仕様から漏れるものが通常ある。これが、さらに高水準で間接的な仕様を求め、具体的に何を行うべきかを解明する作業の多くを機械へ委ねようとする動機の一つである。しかし現在、人間をモデル化せずに、(曖昧に定義された)課題を正しい仕様へ変換する過程を自動化する方法は、想像しにくい。
人間モデルの性能面での競争力
単に問題の仕様をよく理解すること以外の理由から、AGIシステムを適用したいさまざまな課題で、よい性能を実現する最良の方法が、人間をモデル化することかもしれない。たとえば、認知機能を自動化する際に競争力を持つため、人間の認知の一部の側面を、AGIシステムでおおむね再現したいことがあるかもしれない。そして、その側面は、人間の選好についての大量の情報を、分離しにくい形で伴うかもしれない。
人間モデルなしに何をすべきか
人間モデルを使ってAGI安全を解決することを目指すことについて、賛成と反対の論拠を見てきた。振り返れば、人間のモデル化がよい考えである範囲では、非常にうまく行うことが重要である。悪い考えである範囲では、まったく行わないのが最善である。したがって、人間のモデル化を少しでも行うかどうかは、安全なAGIを作るアプローチを構想する初期に、おそらく設定すべき構成ビットである。
上記の論拠は、決着をつけることを意図していない点に注意してほしい。本稿で概説したリスクにもかかわらず、人間モデルの利用を推進すべきだという、相反する考慮事項があるかもしれない。しかし、人間モデルを持つAGIシステムが、持たないものより危険である範囲では、試せる介入に二つの大きな系統がある。第一に、ある研究方針を別のものより推進することで、高度なAIが「デフォルトで」人間モデルを形成する確率を下げることには、価値があるかもしれない。たとえば、手続き的に生成された仮想環境で訓練したAIは、人間が生成した文章・動画データで訓練したAIより、人間モデルを形成する可能性が大幅に低いように見える。
第二に、人間モデルを必要としない安全研究へ重点を置ける。そうすれば、最終的に人間モデルを使わず高い能力を持つAGIシステムを作った場合、人間をモデル化することを教える必要なく、そのシステムをより安全にできる。このような研究の例には、先に触れたものも含め、負の副作用を測る人間に依存しない方法、仕様の抜け穴を利用することを防ぐ方法、破られにくい封じ込め手法を作る方法、課題に特化したシステムの有用性を広げる方法の開発がある。
謝辞:本稿の草稿へ有益なコメントを寄せてくれた、ダニエル・ココタイロ(Daniel Kokotajlo)、ロブ・ベンシンガー(Rob Bensinger)、リチャード・ンゴ(Richard Ngo)、ヤン・ライケ(Jan Leike)、ティム・ゲネヴァイン(Tim Genewein)に感謝する。