以下は、ポール・クリスティアーノのAGIアライメントへのアプローチ(「ALBA」と「反復蒸留と増幅」で説明されている)について、3月16日に私の考えを書きまとめたものだ。ほとんど編集はしていない。ポールからコメントや返答があった箇所には、それも載せた。
ポールが具体的に何を考えているのかをめぐっては、自由変数がずいぶん多いように思える。私が異論をぶつけると、私の疑問の一部には局所的に答えているものの、ほかの難点を悪化させるのではないかと思う返事が来ることがあった。したがって私の全体的な異論は、「この構想全体がうまくいくような具体的な構成と、各変数の同時に成り立つ整合的な設定が見当たらない」というものになる。難点は細かなことや技術上の些事ではなく、私にはかなり深刻に見える。以下、詳しくたどってみたい。
あらかじめ一貫して理解しておいてほしいのは、私にはポールの見解について、ポールの基準でイデオロギーのチューリングテスト(ITT)を通過できるなどと主張するつもりはないということだ。ここで私が批判するのは、ポールが唱えているのではないかと私が想像する説についての、私自身の理解である。誤解していて、藁人形を相手にしているかもしれない。
ポール・クリスティアーノ
全体としての感想を述べると、これらはいずれも私の提案が実際に抱えている難点だと思うし、エリエゼルによる問題の説明にはおおむね同意する(私の現在の考えについての説明には同意しないけれど)。
エリエゼルがこれらをどのくらい難しい問題だと考えているのかは、正確にはわからない。「アライメントをゼロから解決するのとほぼ同じくらい難しい」と考えているようには感じるが、なぜそうなのかはよくわかっていない。
ある程度は、代替案について意見が違うのだろう。私から見ると、自分のアプローチが抱える難点――たとえば、どんな形の最適化が厄介なことを引き起こすのかをもっとよく理解すること、自分と同程度に賢いシステムの中に最適化デーモンが生じるのを防ぐこと、「Xだけを、余計なことをせずに行う」という問題に対処すること――は、ほかのアライメント手法でも問題になる。タイリング・エージェントや意思決定理論、自然化された帰納、論理的不確実性によって、この種の問題の状況が質的に改善すると考えるのは間違いだと思う。だから、それらの研究は肝心の難題を先送りしているように見える。エージェント基礎研究の課題で「進歩できるはずだ」という直感には同意するし、ここでエリエゼルが説明している問題にも、少なくとも少しは役立つと思う。それでも、全体としてエージェント基礎研究は、問題に直接取り組むことよりもはるかに見込みが薄そうに見える。直接取り組むことを諦めるほど十分に試していないからだ。哲学的な問題は、抽象的に考えるより、具体的なアライメント戦略の中で考え抜くほうが、一般に有望に思える。私のアプローチにある中心的な難点のほとんどがエージェント基礎研究に立脚する研究にも付きまとうという事実は、その裏づけになっていると思う。
エージェント基礎研究がこれらの問題を単に先送りするのでなく、対処に役立ちそうだと私が考えられる主な場合は、大規模な機械学習(ML)を一切使わない計画を立てる場合だ。それは非常に大きな不利を背負うことに思えるので、その方向へ行くとしたら、これらの問題が解決できるかについてかなり悲観的になってからだろう。主観的には、行き詰まっているというより、着実に大きな進歩を続けていると感じている。解決には進歩が必要だという意味で、問題が「難しい」ことを示す明確な証拠があるとは思う。だが、P対NP問題や、計算機科学でよく見かける未解決問題がおそらく難しいのと同じ意味で「難しい」とは思っていない(仮にそうだとしても、「P != NPを証明する」か「大規模MLを使わずAGIを作り、グーグルに勝とうとする」かの二択なら、どちらを有望と見るべきかは自明ではないと思う)。
何よりもまず、このシナリオで「能力を増幅しながらアライメントを維持する」ということが、ポールのほかの発言について私が理解していることと整合する形で、そもそもどう機能するのかがわからない。
まず、ポールと私で一致しているだろうと思う、明白な点を確認したい。局所的にアラインされた部品からなるシステムなら、全体の出力も必ずアラインされる、というわけではない。「全体の挙動がアラインされている」と結論づけるには、「部品がアラインされている」以外の追加の仮定が必要だ。「アラインされた部品の集合はアラインされている」という藁人形の主張は、サールの使う議論の裏返しだ。サールは、英語しか話さない不死の人間を想像させる。この人間は、チューリングマシンを実現する大量の紙を扱うよう訓練されているが、システムの個々の部品や手順には局所的に中国語の理解が備わっていないのだから、中国語を理解するシステム全体の一部にはなれない、とする。ここで、組み合わせたときに保存されない性質は「中国語を理解していないこと」である。追加の仮定がなければ、「アライメント」がそれよりも必然的に保存されると期待することはできない。
ポールとじっくり話した機会のうち、前々回には、訓練による圧縮を施す前の、小さなアラインされたエージェントの大きな集合が実際にどんなものになるのか、私はしつこく尋ねた。彼の説明では、1日だけ生きる人々が、ほかのエージェントの電話番号をやり取りしており、誰も全体像をまったく把握していないというものだった。私はこれを「中国語の部屋の官僚機構」と呼んだ。ポールも、面白い呼び名ではあるが、それほど的外れではないと思ったようだった。
中国語の部屋の官僚機構のどのエージェントにも、どの行動がどの結果を、なぜもたらすのかについての全体像がないなら、個々のエージェントのアライメントを全体のアライメントに反映させる、最もわかりやすい道が断たれてしまう。私の普段の捉え方では、エージェントのアライメントは、そのエージェントが理解することに対して働く。小さな局所的エージェントには理解できないことを理解する、大きなエージェントの集合を作ったとき、大きな集合は小さなエージェントからアライメントを引き継ぐわけではない。サールの中国語の部屋は、中の人が中国語を理解しなくても中国語を理解できる。それに対応して、ほかに何の仕掛けもなければ、中国語の部屋の中の人は、レストランへの注文に自分自身の好みを反映することができない。
あまり賢くない小さなエージェントを大量に集めると、大きく強力な理解が生まれる、というポールのモデルがわからない。それが、エージェント自身には理解できないAGIのコードを実行させることと実質的に同じにならずに、どう成り立つのだろう。
ポール・クリスティアーノ
アライメントの根拠は「アラインされたニューロンで作ったシステムはアラインされる」ということではない。非アライメントは魔法のように起きるものではなく、システム内で問題を起こす特定の最適化圧力の結果だ。私が目指しているのは、(a) まず内部で問題のある最適化をしていない弱いエージェントを作り、(b) それを、別の問題のある最適化を行うことなく能力を高めるように組み合わせ、(c) その過程を繰り返すことだ。
ポールは以前、クリスティアーノ式のシステムには越えられないと私が考えるボトルネックを挙げてみてほしい、と言った。これは難しい。(a) 私はポールのシステムを理解できているかわからず、(b) 現時点で明確なアルゴリズムのない課題を挙げるのがいちばんわかりやすいからだ。それでも、次のようなものはどうだろう。
前回のポールとの議論で私が挙げたボトルネックはこうだった。「出発点となるエージェントのコピーを用意する。それぞれは累計で最大1日だけ動作してから終了する。このエージェントは、それまで数学をあまり学んでいないが、賢いので、具体的な算術しか知らない状態から出発しても、その日の終わりには代数が理解できる。こうしたエージェントからなるシステムは、AGIを動かすチューリングマシンをただ実行するのではなく、どのようにしてニューラルネットのヘシアンフリー最適化(Hessian-free optimization)を発明するところまでたどり着くのか?」
ヘシアンフリー最適化はもう誰も使っていないので、この例は少し時代遅れだ。だが、わかりやすい人間的な比喩がないことをしなければならないエージェントの例を見つけたかった。2階微分なら、加速度のような比喩で理解できる。「ヘシアンフリー最適化」には、比喩としてだけでなく数学として微積分を理解していない人に、工学設計で使えるほどよく説明するための、すぐ思いつく比喩がない。仮にそういう比喩があったとしても、微積分を理解していない人がそれを考えつく可能性は、やはりきわめて低いだろう。
1日で代数を学べる小さなエージェントを大量に順次実行すると、ヘシアンフリー最適化を使った設計のできるものになる、とポールがなぜ期待しているのかわからない。それも、小さなエージェントが事実上、チューリングマシンの操作を教え込まれた不死の犬の役目を担うことなく、である。だから、その小さなエージェントにあるとされるアライメントが、この不思議な集合的理解のあり方を通り抜け、ヘシアンフリー最適化を理解するシステムのアライメントになる、と期待する理由もわからない。
すでに理解されているだろうとは思うが、明白な事実として言っておく。アライメントは、一般には認知システムを組み合わせても保存される性質ではない。善良で道徳的な人々を大勢訓練し、チューリングマシンの各要素を動かさせたとしても、誰にも何が起きているのかの全体像がなければ、その善良さや道徳性がチューリングマシンに受け継がれることはない。通常の規則とは違う記号をいつ書くかについて、その善良で道徳的な人々に裁量を与えたとしても、やはり全体のシステムをアラインさせるうえでは有効に働けない。ヘシアンフリー最適化が善いことに使われているのか悪いことに使われているのかを、個々人は理解していないからだ。それを理解できないのは、その最適化そのものや、それを組み込んだ思考を理解していないからである。したがって、「アラインされたサブエージェントからなるシステムはどれもアラインされる」という誤った仮定にシステムを依拠させたくはない。この反例によって、それが一般には誤りだとわかっている。代わりに、追加の前提が必要なら加えたうえで、実際に真となるもっと限定された仮定に、システムのアライメントを支えてほしい。ポールがどのような限定的仮定を使いたいのか、私にはわからない。
ポールは、能力増幅のモデルとしてAlphaGoを考えるよう促す。
私のAlphaGoの捉え方はこうだ。私たちはモンテカルロ木探索(MCTS)を理解している。MCTSは、中間出力を次の反復に投入できる、反復可能なアルゴリズムだ。だから教師あり学習を使い、短いMCTSが明らかにした勝ちにつながる手の細部について、一部だけでも勾配降下のシステムで計算を学習し、短縮できる。その学習した出力をMCTSへ渡せば、擬似的に「MCTSをもっと長く、もっと広く走らせる」ことができる。これは、実際にそこまで広く深いMCTSほどには強くないが、その前に走らせた素のMCTSよりは強力だ。このシステムのアライメントは、MCTSの末端にある明確で形式的な損失関数によって与えられている。
これとは別の例で、私が見るかぎり、能力増幅の素朴な藁人形版では明らかにうまくいかない場合を考えよう。囲碁を打つ再帰型ニューラルネットワーク(RNN)があり、長く反復させると、打つ手が多少よくなるように作られているとする。「なるほど」と、藁人形の能力増幅論者は言う。「このRNNを使い、囲碁の初期局面から100回反復したあとの内部状態を近似するよう、別のネットワークを訓練すればいいのは明らかだ。その内部状態を最初にRNNへ入力し、それから、そのRNNをさらに200回反復させたあとの内部状態を近似するよう、増幅用ネットワークを訓練する。もとのRNNが囲碁で勝とうとしていたのだから、できたシステムも当然『囲碁で勝とう』とし続けるはずだ。増幅されたシステムはもとの価値観を維持する」。これはうまくいかない。仮定として、このRNNは反復を続けても、いくらでも囲碁が強くなるわけではないとしよう。そして、この能力増幅の仕組みでは、その性質上、増幅されたRNNに囲碁がうまくなったか下手になったかを教える、外部の損失関数を使うことができない。
ポール・クリスティアーノ
増幅は「人間にいくらでも長く考えさせる」よりもうまくいくわけではない、という点にはまったく同意する。それが強い反論だとは思わない。人間は、たとえ短い時間しか与えられていない人間でも、最終的には私たちが直面する問いについて十分によい答えに収束すると思うからだ。
RNNが自分のできばえを知る手がかりは、自分が収束する意見、あるいは発散していく意見の集合だけだ。能力増幅がアライメントを維持するとは、まさにそういうことである。しかし、それは裏を返せば、増幅対象が、極限では非常に賢くなれる能力を内在させている範囲でしか、能力増幅は機能しないことを意味する。
長生きするポール・クリスティアーノたちの文明を実質的に作るのであれば、この難点はいくらか和らぐ。その文明には、文明そのものとしてなお失敗しうる点がある。あとで述べる、そんなものを本当に安全かつ現実的に作れるのかという異論を別にしても、だ。ただ、ポールたちの文明なら、よいことができるとは思う。
だが、ポールの説明のほかの部分では、それは許されない。少なくとも前回、ポールはそう言っていた。ポールの教師あり学習の構成では、シミュレーションする構成員の人々は1日だけしか活動できない。それぞれを1か月動かさなければならないのでは、ラベル付き事例を十分に集められないからだ。
さらに、私の理解では、この「現実的」な版は、ポールよりも頭のよくないエージェントから出発することになっている。あとの異論に対するポールの返答を私が理解したところでは、システム内のエージェントは、平均的な人間よりさえ頭がよくない想定だった(ただしアラインされている)。IQ90で、それぞれ1日だけしか生きないエージェントのシステムを、いくらでも大きくしてよいとしよう。それが、より大きな、理解不能なアルゴリズムを盲目的に実行するのではなく、内部のエージェント自身が理解に到達し、それに自分のアライメントを適用して全体に有効に働かせるのと同様のやり方で、ずっと賢いエージェントを実現できるということは、私にはまったく自明ではない。
1日しか生きないIQ90の人々のシステムが、火や車輪を発明するところにさえ、いずれたどり着くのかどうかわからない。
もしポールの直感が、「そんなもの、いずれヘシアンフリー最適化を始め、その理解を有効に働かせて全体のアライメントを生み出すに決まっている。そこがすでにわからないなら、どう説得すればいいかわからない」というものなら、ほかの難点に話を進める以外に、どこへ行けばよいのか私にもよくわからない。
ポール・クリスティアーノ
いや、説得する明白な方法が一つある。実験を実際にやることだ。ただ、その前に、何がうまくいき、何がうまくいかないと予想しているのか、もっと正確にしたい。ヘシアンフリー最適化の例を文字どおり試すつもりではないからだ。新しいアルゴリズムの開発は、今のMLでできる範囲をはるかに超えている。私から見ればヘシアンフリー最適化の発明よりさらに難しく思えることでも、私たちは実行できると思う。ただ、あなたが実際に何をより難しいと見るかをわかるほど、あなたのモデルについての私のモデルが十分かどうかはわからない。
もちろん、圧縮前の集合にエージェントがあまりにも大量にいて、その集合が、内部エージェントからの承認を最大化する、より賢い遺伝的アルゴリズムを実現している、という場合なら別だ。1日だけ生きるIQ90の人間たちよりずっと賢いものを用意し、その人間たちに承認を表す大きな数値を出させるように訓練すれば、何の対策もなければ、それはIQ90で1日だけ生きる人々を攻略するだろうと思う。人間は安全性の保証されたシステムではないからだ。するとまた、全体のシステムは個々のエージェントより賢いが、その賢さがアライメントを維持する形にはなっていない、という状態に戻ってしまう。
ポール・クリスティアーノ
エージェントがアラインされていても、アラインされていない最適化を実行してしまえば振り出しに戻る、という点には完全に同意する。増幅は、アラインされていない最適化をせずに能力を高められる場合にしかうまくいかない。これは、認知的な仕事をどこまで分解できるかをめぐる意見の違いだと思う。直感が食い違う、具体的で単純な課題を実際に見つけ、実験によるテストを行うことで解決できればと思う。
能力増幅で私にとっていちばん面白い中心的なアイデアは、人間を正確に模倣すれば、強化学習がふつう行き着く破滅を回避できるということだ。議論のために仮定して、人間の正確な模倣を作れるなら、その模倣は、もとの人間とまったく同じアライメント上の性質を持つ。これは、強化学習器を用意して、人間が発する承認信号を最大化させる場合には成り立たない意味で、成り立つ。(対象がポール・クリスティアーノやカール・シュルマンなら、少なくとも私は、この人たちは十分アラインされていると言ってよいと思う。あとで鍵を返してもらえるだろうという期待のもとで、誰かが彼らに宇宙の鍵を渡すことにも、私はほぼ異存がない。)
模倣の正確さを弱めていくと、アライメントの維持がどの速さで損なわれるのかは、私には自明でない。これが重要なのは、完全な模倣は非常に高くつくはずだと私が異論を述べたとき、ポールが、完全な模倣を提案しているわけではないと聞こえることを言っていたからだ。つまり、完全さのコストをめぐる異論への彼の回答によって、「完全さから離れるにつれ、どのくらいの速さでアライメントの保証を失うのか」という問いへの答えが、非常に重要になる。
標準的な強化学習から予想される破滅の一例は、私なら「Xだけを行う問題(X-and-only-X)」と呼ぶものだ。残念ながらまだこれを文章にしていないので、ここで手短に説明してみよう。
Xだけを行う問題とは、確認したり訓練したりするのが簡単なのは性質Xなのに、欲しい性質は「これはXだけに向けて最適化されており、システムの最終出力から定式化された方法では検出しにくいような、さまざまな微妙な悪いYを一切含まない」という場合に生じる問題を、私がそう呼んでいるものだ。
たとえばXが「ルービックキューブを解くプログラムをください」だとする。プログラムを実行してルービックキューブが解けることを確かめ、解くのに要する手数も考慮した平均成績に対して、損失関数を設定できる。
性質Yは、AIが渡してくるプログラムが、RAMを変調してGSM方式の携帯電話信号も発信することだ。
つまり、「これは少なくともルービックキューブを解くプログラムだ」と確かめるほうが、「これはルービックキューブを解くことだけに向けて最適化され、それ以外のことを裏で行うようには最適化されていないプログラムだ」と確かめるより、はるかに簡単なのである。
標準的なMLの枠組みでアラインされたAGIを作ろうとする話をするなら、私は、これが「Xをするシステムを作る」ことと「Xだけを行い、巧妙な形でYを行ったりもしないシステムを作る」ことの、開発のしやすさに差を生む点を論じるだろう。安全性はどうでもよく、ただXが欲しいだけなら、Xを分類する器を作り、それを損失関数にして、将来使われる勾配降下に相当する方法や、ほかの汎用最適化法で強化学習を思い切り走らせればいい。欲しい安全性の性質が「Xだけのために最適化されており、隠れたYはいくつあろうとどれも含まない」なら、Xに対してできるような簡単な損失関数は書けない。
ポール・クリスティアーノ
私の最適化の理解と言葉の使い方では、強化学習(RL)が生み出したエージェントはXだけに向けて最適化されている。ただし、Xへの最適化はYを最適化するものを生み出しやすい。したがって、そのエージェントの行動は、Xに向けてもYに向けても最適化されている。
安全性の低いAGIを作るチームは、Xの評価器を接続して思い切り走らせられる。安全なAGIを作りたいチームは簡単な道を通れず、信頼できるシステムを得るために新たな基礎問題を解かなければならない。解決不能ではないが、アライメントに追加される難題群の一つではあり、その難題群全体が開発にさらに2年を要することは、十分にありそうだ。
ポールの能力増幅シナリオでは、正確な模倣が得られるなら、Xだけを行う問題を生む枠組み全体を、本当に丸ごと回避できる。人間の正確な模倣が得られるなら、出力の性質は、もとの人間がすでに持っている性質そのものに、過不足なく限られる。こうした本当に異なる視点があるから、私はポールの考えに今も期待している。
ポール・クリスティアーノ
完全な模倣が、Xだけを行う問題を回避する方法になることには同意する。ただ、それが実現しそうだとは思っていないし、私のアプローチも、その方法でXだけを行う問題を回避しようとしているのではない。
私は、Xだけを行う問題を2段階で解くつもりだ。
第一に、あるエージェントと、望ましくない結果Yに向けて最適化された行動が与えられたとき、その行動に望ましくない副作用があると見抜けるようにしたい。それは、より賢いエージェントを監督者にし、その監督者が、弱いエージェントの認知の仕組みを適切に理解できるようにすればできると思う。たとえば、弱いエージェントと、説明を生成するエージェントの重みを共有する。私が「情報に基づく監督(informed oversight)」と呼んでいるのはこれだ。
第二に、あるエージェントについて、特に悪い結果を生みやすい状況、あるいはそうならないことの証明を見つける。あるいは、そうならない理由がわかるほどに内部の仕組みを理解する。これは「最悪時の性能を最適化する手法」で論じている。
(これにも当然、より賢いエージェントが必要で、それは帰納と増幅によって得ようとしている。)
増幅が機能するという仮定に加え、この二つも難問だと思う。だが、どちらについても、ひどく悲観する理由はまだ見えていない。
では一方で、正確な模倣が得られないとしよう。Xだけを行う問題に対する防御は、どれほど速く失われるだろうか。それは、模倣の不正確さによる。不完全な模倣は、どのような距離尺度で、もとの人間に「近い」のか。たとえば出力のユークリッド距離の話なら、巧妙な敵対的摂動に対しては、Xだけを行うという保証はかなりあっという間に失われると思う。
では反対に、模倣の不正確さが、「このエージェントはポール・クリスティアーノとまったく同じように行動するが、IQだけが5ポイント低い」というものだとしよう。不正確さが生じる形はこれだけで、厳密にこれでしかなく、しかもそれが確かだとわかっているなら、少し頭の鈍いポールが、GSM信号送信器を隠したルービックキューブ解法プログラムのようなものを生み出さないという、かなりよい保証があると言えるだろう。
ではさらに反対に、模倣の不正確さが、「このエージェントはチューリングテストを通過する。人間には本物の人間と見分けがつかない」というものだとしよう。その場合、Xだけを行うという話は、まるごと吹き飛ぶ。人間に検出できないどんなYについても、Yを行わないという保証がない。そこには、命取りになる可能性のある膨大な領域が含まれる。だからこそ、信頼できない超知能の出力を人間が点検し、人間の目にも明らかな悪影響がないかを見るだけで、無害化できるわけではないのだ。
不正確な模倣に関連して言うと、AIに人間の行動の忠実度の高い模倣を出力させること――「賢い」「善い人間である」、さらには「巨大な中国語の部屋の官僚機構に組み込まれるといった、奇妙な負荷がかかっても善い人間のままである」といった性質を保つほどの忠実さで模倣させること――は、途方もなく高い要求に思える。
一般に、正確な模倣を求めるほうが、上回る能力を求めるよりも要求が高い、というのは、私には明白に思える。もっとも、この種の点では、ほかの人が何を自明と思わないかに驚かされたこともある。秀策の碁を、研究者にも見分けがつかないほどうまく模倣する囲碁プレイヤーを作るほうが、対局で秀策を破るプレイヤーを作るより難しい要求だ。人間は電卓よりはるかに賢いが、紙と鉛筆なしに電卓を真似ることは、それでもできない。電卓を模倣するには、自分の能力に加え、電卓の能力をすべて持つ必要がある。
それと同じく、チューリングテストの強い版を文字どおり通過するAIを現実に作るとしたら、そのAIはおそらく、テストに参加するほかの人間よりずっと賢くなければならず、おそらく地球上のどんな人間よりも賢くなければならない。自分自身の能力に加えて、人間の能力をすべて持たなければならないからだ。少なくとも、チューリングテストの継続時間中に、ある人間が別の人間に示せる能力は、すべて必要になる。(私が聞いた版の能力増幅では、1日のうちに示せる能力しか増幅を許されないことに注意してほしい。)
ポール・クリスティアーノ
まったく同意する。だからこそ、Xだけを行う問題の解決を完全な模倣に頼ることはできず、別の解決法が必要だという点にも同意する。情報に基づく監督か、信頼性のどちらかが不可能だと納得させてもらえたら、私はほぼ万事休すだと納得するだろう。
人間による点検で人間が区別できる限界までチューリングテストを通るだけでなく、追加の微妙な悪い性質をすべて排除するほど完全に、人間の正確な模倣を学習するAIは、人間の脳全体に相当するシステムが学習可能な仮説空間に含まれるほど、認知的に強力でなければならない。ここで話しているのが超知能でないという可能性は、私には見えない。
したがって、完全な模倣を仮定すると、まず次の問題に突き当たる。
(a) この模倣を学習するために必要なAGIはきわめて強力なので、何らかの危険なAGIを作れるようになる時点と、完全模倣による能力増幅を使ってアライメントを実現できるAGIを作れる時点のあいだに、危険な時間差が生じるかもしれない。
(b) そもそも、この非常に強力なAGIを得るために、完全模倣による能力増幅の仕組みを使うことはできない。完全模倣による能力増幅を始めるためだけでも、最低限このAGIが必要だからだ。したがって、すでに手元には、きわめて危険なアラインされていない超知能が存在し、それを使ってアライメントの構想を実現しようとしていることになる。
ここで、模倣は完全ではなく、もっと頭が鈍く危険の少ないAIでもできる、と答えることはできるかもしれない。ひょっとすると、圧倒的な超知能には届かないほど頭が鈍くてもよいのかもしれない。だが、その場合には「模倣の完全さ」という設定を調整している。それは、標準的な機械学習の枠組みが通常行き着く破滅に対する、アライメントの保証を、急速に吹き飛ばしかねない。
私が心配しているのは、模倣が途方もなく高い要求でなくなるまでには、模倣の水準を大幅に落とさねばならず、その結果、模倣対象があまり知的でない、人間でない、あるいはアラインされているか不明なものになるのではないか、ということだ。
具体的には、1日考えるIQ90の人間たちを模倣し、その模倣が奇妙な官僚機構へ集められる極限においてさえ、汎用的な知能と局所的なアライメントを備えたままであるほど、細かい性質まで模倣したいなら、IQ90の人間におおまかに相当するシステム全体について考えられるほど強力なAGIを相手にしている、と私は思う。
ポール・クリスティアーノ
大事なのは、増幅のアライメントに関する私の議論が、問題のある最適化を行わないことを通じて成り立つ点だ。したがって、情報に基づく監督と信頼性について十分によい解決を組み合わせれば(増幅も機能し、帰納もそこまでうまくいっているとして……)、問題のある最適化を確実にしない、不完全な模倣を訓練し続けられる。そうした模倣はあちこちで間違えるので、有能にはなれないかもしれない。これは増幅が対処すべき別の問題だ。だが、ずっと頭が鈍くてもアライメントが崩れないような構成にすることが目標だ。
私は、それは非常に強力なAGIだと思う。アラインされていないAGIから忠実な模倣を生み出せる手法を使っていないかぎり、さまざまな悪さをこちらに気づかれずに仕込めるほど賢いと思う。それは、優れた工学上の成果を出せるAGIだと思う。自分自身はそれを行う能力を持たずに、そうした成果を出す人間をどういうわけかシミュレーションできるのでもないかぎりは。
しかも、それに加えて、能力増幅の構想では、人間たちを増幅したシステムの模倣まで学習できるほど、AGIが強力でなければならない!
AIを超知能の水準よりずっと下まで弱めないなら、きわめて強固なAIの箱詰めが必要になる。ファラデーケージを使い、神を箱の中に閉じ込め、コードを覗き見さえしない、というような隔離だ。したがって、たとえば信頼できない超知能に、人間の行動を学ぶために使う質問を作らせることはできない。質問を投げかけるモデルではなく、あくまで事例に基づく教師なし学習でなければならない。このことは、あとで述べるサンプル複雑度への懸念に関わってくる。
ポール・クリスティアーノ
私をできるだけ好意的に解釈するため、ここで何度も、考えられる選択肢を場合分けして、それぞれに反論しなければならなかったことには感謝している。
あるいは、AGIを模倣課題に確実かつ安全に向かわせられるような、何らかの事前のアライメントを仮定しなければならない。その場合、(a) このアライメントの構想は、非常に強力なAGIにすでに何かをさせることのできる、未指定の別のアライメント構想に依存している。そして(b)、おそらく無制限の知能爆発は許していないのだから、非常に強力なAGIが技術的に初めて可能になる時点から、模倣の仕組みの基本単位として使う、きわめて強力なAGIを構築して安全にアラインさせられる時点まで、大きな、避けられない時間差が生じるだろう。
最後にポールに確認したとき、彼の構想では、人間を模倣するために強力で賢く危険なユニットを使うことは、やむをえないと受け入れていた。当時聞いて私が理解した、その問題を切り抜けるためのポールの案は、次のようなものだった。
- 賢い予測器を100万個、十分に多様なものになるよう訓練する。少なくとも一つは、偶然、忠実に予測することだけを、真の単純な目標として持つようになる。
- 予測器同士を比較し、予測が十分に食い違う事例を見つける。
- 現実と照らしてテストする。
- 十分な回数のテストを行えるだけのサンプル収集能力を用意する。超知能が、悪い予測を紛れ込ませ始める時期を巧みに遅らせても、その時点でシステムを止め、実験的なテストを行って新しいサンプルを作り、不忠実な予測器を排除できるようにする。
私の理解が正しければ、これは100万倍の性能上の負担になる。
もし、あれが何をしているのかを私に理解させるための具体例にすぎず、実際には、ほとんどが信頼できない超知能を利用する、こんな大きな性能低下のない、もっと素朴でなく効率的な仕組みが当然あるはずだということなら、私はまだそれを見ていない。
ポール・クリスティアーノ
性能上の負担を減らす方法は、いくつか考えられる。たとえば、大きなアンサンブルを暗黙的に表現する方法や、工夫を凝らした蒸留手順を使う方法だ。100万倍も遅くなるなら望みがないことには、完全に同意する。
これについて話したとき、「信頼性の高いシステムを訓練する」ことが重要な下位問題である点には同意した。暗黙的なアンサンブルを訓練するのは、その問題への一つのアプローチだ。当時の議論では、私は3つの手法を挙げた。その後、暗黙的なアンサンブルの訓練にはかなり悲観的になり、検証と透明性にはより楽観的になった。(問題についての私の考えも、全般にずっと明確になっている。)今もっとも有望だと考えている3つのアプローチは、「最悪時の性能を最適化する手法」にあるものだ。
(いつもどおり、いずれにも増幅と帰納が必要だ。)
(もとの議論では、あなたの「いったいどうすれば解決できるのか」という問いに対し、考えられる一つの方法として「大きなアンサンブル」を挙げたのであって、必須の要素として挙げたのではない。)
実際には超計算を許さない教師なし学習の枠組みのもとで、不忠実な予測器をどう排除できるのかも、私には見えにくい。
問題は、人間が出す正確な出力は、どれも常に非常に低い確率になるということだ。エージェント同士が図を送れず、テキストメッセージだけを送れるとしても――それでは集合的な知能や、1日で読める教科書を作る能力はさらに下がるが――テキストメッセージの可能性空間は、それでも膨大だ。人間が次に何をするかの予測を超知能に出させるとしても、人間のありそうな出力すべてに値を付けた巨大な参照表を、実際に予測へ含めることなどできない。
超計算と膨大なサンプルを使えば、この問題をどう「解く」かはわかる気がする。正確な出力ごとの確率を記した巨大な参照表を超知能に出させ、確率表同士の全体の距離をKLダイバージェンスなり何なりで計算し、距離が十分大きければ、人間からサンプルを取ってベイズ更新を行う。事前確率が十分低くなった超知能は除外する。合意する超知能だけが残るまで、これを繰り返す。
この仕組みでは、悪い提案をこっそり入れようとする超知能を追い出すために、大量のサンプルが必要になるように思える。圧縮されていない中国語の部屋の官僚機構が、1000兆通のメッセージを送り回すのに相当することをしており、そのうち10億通に敵対的攻撃を仕掛けると出力を汚染できるとしよう。その10億通それぞれについて、敵対者が選んだ別のメッセージを出す確率が\(\frac{1}{1,000,000}\)になる攻撃だ。超知能がその偽メッセージに\(\frac{1}{1,000,000}\)の生成確率を割り当てるには、出力されうるほかのメッセージから0.0001%の確率質量を奪うしかない。したがって、本物の人間と照合するたびに、\(\log_{2}\) \(\frac{999,999}{1,000,000}\)ビットだけ更新される。100万サンプルを取ると、このいたずらな超知能の相対オッズを\(\frac{1}{e}\)倍に下げられる。
そのためには100万サンプルが必要で、1サンプルごとに人間が1日考えなければならなかった。それで得られた証拠の強さは\(e\):1にすぎないので、この超知能が正直ではないという方向に1000:1のオッズを得るには、100万サンプルを7回取る必要がある。しかも、分布内に100万個の超知能がいれば、その一部が、コイントスを予測するように偏った賭けを行い、そのうち1000個がほかに対して1000:1の優位を得ることもできる。だから、この策を集団で試す悪い予測器群のどれにも確実に勝つには、実際には1400万サンプルが必要になる。
これについて前回ポールと話したとき、彼は「もちろん、何百万ものサンプルを取れるような、巨大な政府プロジェクトを想定している」といった反応だったと思う。
確かではないし、間違っているかもしれないが、分布から追い出したい悪い予測器一つにつき、実際に1400万サンプルが必要なのではないかと思う。
そこが間違っていたとしても、十分に賢く、十分アラインされた人間が何百万人も必要だ。その中から無作為に選んだサンプルを集めることで、賢くアラインされた中国語の部屋の官僚機構ができるほどの人々が必要になる。
また、超計算を使って巨大な参照表を比較せずにこれを行う方法も見当たらない。ただ、そこは私が数学上の工夫を見落としているだけかもしれない。
ポール・クリスティアーノ
私の最善の推測では、もっともらしい仮定のもとで、悪い予測器一つにつきO(1)サンプルでできると思う。ややこしい話だが、私たちはややこしい数学の問題を得意としているので、ほかの直面する問題と比べれば、さほど怖くない。
(残念ながら、それでも大きな暗黙的アンサンブルは、おそらく行き詰まっていると思う。理由の一つは、予測器が100万個では足りないことだ。ただし確信はない。)
(GANを考えているなら、私の見るかぎり、識別器は少なくとも生成器と同じくらい賢くなければならず、しかも識別器を信頼できなければならない。信頼できない超知能の集団の中から、識別器役にできる信頼できる超知能をどう見つけるか、という問題が簡単になるわけではない。)
(追記:実は、さらに5分ほど考えてみたところ、GANを使って、もっと低いサンプル複雑度で実現する方法がわかったかもしれない。)
それよりさらに大きな問題は、不完全な模倣を対象に、こうした仕組みをそもそもどう実行すればよいのか、すぐ思いつく方法が何もないことだ。(上で思いついたGANを使う仕組みも、その場合は単純に失敗する。)
ポール・クリスティアーノ
これもおそらく乗り越えられると思う。これもまた、ややこしい数学の問題だ。この種の問題は、無理なら無理だし、そうでなければ、アライメントで扱っているほかの大部分のことより桁違いに簡単であることが、かなり確実に言えると思う。
(ただし、大きな暗黙的アンサンブルはうまくいかないという全体的な直感は支持する。)
これらの議論は、まとめると、見解を左右する分岐点のようなものになると思う。急いで書く過程で自分の思考の流れを一つ落としたり、実際には共有されていない背景の仮定を共有されていると思い込んだりしていなければ、だが。
ある能力増幅システムが許容する不完全さの程度をDとし、不完全さがDの模倣をD模倣と呼ぼう。D模倣を増幅したシステムを、さらに反復してD模倣したものは、DD模倣と呼ぶ。それで、以下のすべてを信じられるなら、私は、自分が理解している能力増幅に、実用的な関心を持ち始めると思う。
ほかのアラインされていないAIに世界が終わらされる前に、D模倣とDD模倣を学習できるほど強力なAIを手に入れられる。
D模倣とDD模倣は、模倣が不完全でも、模倣される人々の善良さを頑健に維持する。
D模倣を集めると、決定的な行動を実行できるだけの認知能力に達し、しかも、構成要素のアライメントが全体のアライメントに有効に働く形でそうなる。不完全なDD模倣も、この性質を維持する。
次のどちらかの方法を見つけられる。
それほど強力なAIを一つ、D模倣の課題を忠実に実行すると個別に信頼できるようにする(だが、それなら、そもそもその仕組みを使って強力なAGIをアラインさせればよいのではないか)。
ほとんどが信頼できない強力な知能を集める仕組みで、次の条件を満たすものを見つける。
- 巨大な参照表を必要としない。信頼できる識別器を持つGANも、その識別器をどう作るか説明できるのでないかぎり必要としない。そして、実際の人間のサンプルを材料として、信頼できないD模倣の生成器同士の信頼性を見分けられる。
- サンプル効率がきわめて高い。能力増幅システムの一員として信頼できると認定できるのは、たとえば100人だとしよう。それだけでも、とんでもなく高い要求に聞こえる。あるいは、ほとんど信頼できない人々を集め、決定的な課題を任せられる中国語の部屋の官僚機構にする社会的な仕組みと、何百万人もの人々を巻き込む仕事を任せられる政治的な仕組みを示せる。その場合には何百万ものサンプルを取れるが、何十億もは無理だ。正直なところ、善良で信頼できる政府が、何百万人も関わる複雑なAIアライメントの構想を実行する、というAIのシナリオを私は現在信じていない。だから、この道へ進むなら、見解の分岐点は別のものになる。ただ、ほかの分岐点をすべて乗り越えられたなら、それだけでも私はかなり感心するだろう。
- 計算効率が悪すぎない。100万倍の低速化ではなく、せいぜい20倍程度である。世界のほかの場所にあるAGIプロジェクトに対して、100万倍の性能低下を埋めるほどの優位は得られないと思うからだ。ただし、人類の未来を台無しにしない、大規模な地球全体の完全監視の仕組みを仮定するなら話は別だ。国境を越えてすべての人を大切にする価値観に深く献身する、並外れて有能で信頼できる大国がそれを実行し――現在の大国に観察される性質とはまったく違う――、しかもほかの主要国政府からいっさい反対されない、とするのであれば。ここでも、異論のこの枝へ進むと、もとの分岐点からは離れてしまう。
最後の二つの枝をたどることで、政治上の意見の相違なのだという錯覚が生まれないかと、私は心配している。それ以前の枝に、私には強いものと思える技術的異論があるからだ。まずは、より技術的な分岐点を検討してほしい。ポールがほかの技術的な分岐点をすべて解消し、そこそこユートピア的な世界政府があれば機能する能力増幅の仕組みを示したなら、それだけですでに私は驚くだろう。そんな世界政府は手に入らないので、実際に試すつもりはない。だが、ポールは大いに評価を上げるだろうし、私もその仕組みをさらに練り上げることに関心を持つだろう。私が可能だと思っていた以上のところまで、すでに練り上げられたことになるからだ。現在の私の見解では、こうしたことを試みても、単に始められないか(莫大な計算資源とサンプル収集能力が満たされるまで待つ場合)、単に失敗するか(弱いAIで人間を模倣しようとする場合)、単に殺されるか(超知能を使う場合)のどれかになるはずだ。
ポール・クリスティアーノ
意見の相違は、ほぼ完全に技術的なものだと思う。本当に100万人が必要だったとしても、それだけで断念する理由にはならないと思う。ただしそれは、その人たちが何をする必要があるかをめぐる、政治的ではなく技術的な意見の違いによるものだ。そして、100万倍の低速化は受け入れられないという点には同意する。10倍の低速化でも、ほぼ完全に望みはないと思う。
繰り返すが、これらの異論は、私には、まとめると「これを実際に機能させるにはさらなる洞察が必要だ」ではなく、「アラインされた超知能がすでにないかぎり、根本的に、この方法でアラインされた強力なAGIを得ることはできない」ということになるように見える。だが、さらなる洞察が実際に何をもたらすか、誰にわかるだろう。思考の空間を前進させるのは、もっと巧妙な道具ではなく、理解の深まりだ。
この主題についてのポールの考えには、今も期待している。ただ、現状ではうまくいかないと思っている。
ポール・クリスティアーノ
その点では一致している。アライメント問題を解き終えたと主張している人はいないと思う。中心となる問いは、前進するにはどの方向がいちばん有望かということだ。
私の見方では、アライメント研究についてこうした認識を持つことは、珍しい状態ではない。MIRIの論文の中で、AGIをアラインさせることに成功するものを、私は一つも指し示せない。ほかの人々は、今の時点ですでに、AGIをアラインさせるための、ほぼ実行可能な仕組みを持っているべきだと思っているようだが、私には奇妙な期待に思える。健全な見方とは、ある問題への対処のアイデアを持ち、それがさらに修正すべき難点を生み出し、ほかの問題の大半にはまったく対処しないと理解すること、つまり、大きな未解決領域だと思う場所が明確に記された地図を持つことだろう。ほかにどんな難点を伴おうとも、どれか一つでもアライメントの難問に 本当に正面から取り組む考えを持てることは、私にはすでに大きく、しかも珍しい成果に思える。「人間の外から見える行動を信頼できる形で模倣すれば、人間と異なる外的行動として現れる、放置すれば生じる多くの破滅を避けられる」という洞察は、いつか決定的に重要になるかもしれない。私は今も、ポールが使えると言うだけの資金を出すことを勧めているし、もっと多額の資金の使い道がわかると彼が言ってくれたら、と願っている。