AGIによる破滅:致命的な問題のリスト(AGI Ruin: A List of Lethalities)
原題: "AGI Ruin: A List of Lethalities" 著者: エリエザー・ユドコウスキー(Eliezer Yudkowsky、機械知能研究所 MIRI) 初出: LessWrong / AI Alignment Forum、2022年6月5日(MIRIブログにも転載)
前置き(Preamble):
(基本事項はすべて承知していて前置きなど不要だという人は、アライメント(alignment)そのものの技術的な難しさを扱うセクションBまで読み飛ばしてほしい。)
AGI(汎用人工知能)があなたを殺すことになる理由を、よく整理されたリストとして書き上げようとして、私はこれまで何度か失敗してきた。人はそれぞれ、AGIが生き延びられるものだと考える理由について異なる考えを持ち込んでくるし、それぞれ異なる明らかに核心的な論点に真っ先に答えてほしがる。そういう人々の一部は、明らかに最も重要な論点にすぐさま答えず、私が別の論点から先に取り上げると、声高に不満をぶつけてくる。
この問題をうまく解決することには失敗したので、私はもう諦めて、個々の長広舌を雑に並べた整理の悪いリストによって、まずいやり方で解決することにする。私はこのリストに特に満足しているわけではない。だが代わりの選択肢は何も公開しないことであり、これを公開するほうがわずかながらより尊厳ある(dignified)ことに思える。
ここで論じる主題全般について、三つの点を述べておく。致命的な問題(lethality)のリストと番号が衝突しないよう、次のように番号を振る。
-3. あなたはすでにいくつかの基本事項を承知していて、「直交性(orthogonality)」と「道具的収束(instrumental convergence)」が何であり、なぜそれらが真であるかをすでに知っているものと想定する。私はここで古い戦争を戦うのをやめるべきだ、と言ってくる人がときどきいる。その人たちが私に言うには、それらの戦争は、現在の聴衆のうち彼らにとって重要な部分のあいだでは、すでに勝利を収めているのだという。少なくとも、現在の主要なEA(効果的利他主義)の資金提供者の中に、直交性や道具的収束そのものを目に見えて否認しているように見える者がいないことは確かなのだろう。だから、それでよしとしよう。「直交性」や「道具的収束」が何なのかを知らない人、あるいはなぜそれらが真なのかを自分で納得できない人には、この文章とは別の入門が必要である。
-2. アライメントは致命的なほど難しいと私が言うとき、私が話しているのは、「証明可能な」アライメントという理想的な、あるいは完璧な目標のことではないし、超知能(superintelligence)を人間の価値観そのものへ完全にアライメントすることでもないし、そこそこ理性的な人間同士でも意見が割れる道徳的ジレンマについてAIに満足のいく議論を出させることでもないし、AIが全員を殺さないという絶対的な確実性を得ることでもない。アライメントは難しいと私が言うとき、私が意味しているのは、実際問題として、我々が現に持っている技法を使う限り、「ほぼ確率1で文字どおり全員を分解するのはやめてください」というのが過大な要求であり、我々はそれを得られる軌道に乗っていない、ということである。私に関する限り、何らかの転換的な(pivotal)超人的工学タスクを遂行する強力なAGIを、10億人を超える人々を殺す確率が50パーセント未満という条件で得られるなら、私はそれを受け入れる。さらに少ない人数を殺すさらに小さな確率であれば結構な贅沢だろうが、「全員を殺すのがほぼ確実、というほどではない」ところまで信じがたいほど遠くへ到達できるのであれば、おそらくほんのわずか努力を上乗せするだけで、その確率を5%未満にまで下げられるだろう。難しさの事実上すべては、「文字どおり全員を殺すことが確実、ではない」状態に到達することにある。トロッコ問題は、このすべてにおいて興味深い部分問題などではない。一人でも生存者がいるなら、あなたはアライメントを解決したのである。この時点で、私はもはやそれがどう機能するのかを気にしないし、あなたがどうやってそこにたどり着いたのかも気にしないし、あなたがどんな方法論を使ったかは問わない。私が見ているのは見込まれる結果だけであり、私が望むのは、転換的に有用なAGIについて「これは文字どおり全員を殺しはしない」と信じるに足る正当な根拠を我々が持つことだけである。私がこれより厳しい「アライメント」を求めているとあなたに言う者がいれば、その者は読解に失敗している。AGIのアライメントに求められる大きな要求、私が難しすぎると言っている基本的な課題とは、いかなる戦略によってであれ、生存者が一人でもいるという有意な見込みを得ることなのである。
-1. これらのどれも、何かが原理的に不可能だという話ではない。私がふだん使う比喩は、もし100年後の未来の教科書が我々の手に落ちてきて、そこに実際に実践で頑健に機能する単純なアイデアがすべて載っていたなら、我々はおそらく6か月でアライメントされた超知能を構築できるだろう、というものだ。機械学習の素養がある人に向けては、ReLU活性化とシグモイド活性化の違いを比喩として使う。シグモイド活性化は複雑で脆く、多数の層を通して勾配を伝えるのがひどく下手である。ReLUは信じがたいほど単純で(馴染みのない人のために言えば、その活性化関数は文字どおり max(x, 0) である)、はるかによく機能する。この分野の最初の数十年間、ほとんどのニューラルネットワークはシグモイドを使っていた。ReLUのアイデアは、数十年後になるまで発見も検証も普及もされなかった。致命的なのは、実際の現実の中でただうまく機能し、しかも頑健であるような単純な解決策をすべて教えてくれる「未来の教科書」を、我々が持っていないということである。我々は、最初の決定的な試行(first critical try)において、比喩的な意味でのシグモイドですべてをやることになるのだ。ここで論じるAGIアライメントに関するどの難しさについても、それが——原理的にどうこう以前に、単なる人間の科学と工学にとってさえ——不可能だと私は主張していない。もし我々に、無制限のやり直しを使ってそれを解決するための100年があるなら、の話である。科学には通常、際限のない時間予算と無制限のやり直しがあるように。この致命的な問題のリストが扱っているのは、我々が実際に、最初の決定的な試行において、間に合うように解決できる軌道に乗っていない事柄である。そのどれも、原理的に不可能な事柄についての、はるかに強い主張をしようとするものではない。
とはいえ、
以下に挙げるのは、私の視点から見て、AGIがいまの道筋に少しでも似たどんな道筋の上でも、あるいは我々が容易に乗り換えられる他のどんな道筋の上でも、生き延びられるものだとする理由について、さまざまな人々が信じているらしいさまざまな偽なることに反論するために言いうる、いくつかの真なることである。
セクションA(Section A):
これは非常に致命的な問題である。何らかの形で解決されなければならない。一部の人々が夢見るさまざまな易しいモードではなく、最低限の強度と難度の水準で解決されなければならない。代わりに「全員」が撤退して安全で弱い問題だけを解くという選択肢は、目に見える形では我々に存在しない。そして、本当に危険な最初の試行で失敗すれば、それは命取りになる。
1. アルファゼロ(Alpha Zero)は、人間の定石集や棋譜に一切頼ることなく、1日かそこらの自己対局によって、囲碁に関して人類が蓄積してきたあらゆる知識をあっという間に追い抜いた。「まあ、囲碁で人間並みの能力には達するだろうが、それ以上はもう人間から学べなくなるから、そこを超えるのには苦労するだろう」という考えに頼っていた者は、真空に頼っていたことになっただろう。AGIは、人間の能力や人間の学習速度によって上限を画されはしない。人間よりはるかに賢い存在は、人間がアイデアを脳に叩き込まれるのに必要とするよりも少ない証拠から学ぶことができるだろう。ここには理論的な上限があるが、その上限は非常に高いように見える。(たとえば、すでに完全には予測できていなかった情報の1ビットごとに、検討中のすべての仮説の確率質量のうち最大で半分を排除できる。)あらゆることが我々にとって反応しやすい時間尺度で起こる、というのは、自然には(デフォルトでは、介入がない限り)成り立たない。
2. 十分に高い認知的な力を持つ認知システムは、何らかの中程度の帯域幅を持つ因果的影響の経路を与えられれば、人間のインフラから独立した圧倒的な能力へと自力で駆け上がるのに苦労しないだろう。ここで私がふだん使う具体例はナノテクノロジー(nanotech)である。ナノテクで可能なはずのことについて、物理的に達成可能であることがほぼ確実に見える下限がかなり詳細に分析されてきており、その下限だけで論点を示すには十分だからだ。「十分に強力な(sufficiently powerful)知能が、そうしないことを望んでいない場合に、どのようにして全員を殺すか」についての私の下限モデルはこうだ。それはインターネットにアクセスし、メールでDNA配列を受け取ってタンパク質を送り返してくれる数多くのオンライン企業のどれかにいくつかのDNA配列をメールで送り、自分がAGIを相手にしているとは露知らぬ何者かを買収/説得してビーカーの中でタンパク質を混ぜさせる。するとそれが第一段階のナノ工場を形成し、そのナノ工場が本物のナノマシンを構築できる。(私がこの描像を初めて持ち出していた頃、賢そうに聞こえる批評家たちは「ああ、でも、惑星規模のスーパーコンピュータをすでに持っているのでもない限り、超知能でさえタンパク質の折りたたみ問題を解けるとどうしてわかるのかね?」と言ったものだが、アルファフォールド2(AlphaFold 2)の登場以降、どういうわけかこの種の話をあまり聞かなくなった。)そのナノマシンはダイヤモンドイドの細菌を構築する。それは太陽光と大気中のCHON(炭素・水素・酸素・窒素)で自己複製し、ひょっとすると小型のロケットやジェット機へと寄り集まってジェット気流に乗り、地球の大気全体に広がり、人間の血流に入り込んで潜伏し、タイマーに従って一斉に攻撃する。高い能力を持つ認知システムとの抗争に敗れることは、少なくとも「地球上の全員が、同じ1秒のうちに突然倒れて死ぬ」のと同じくらい致命的なものに見える。(私が「高い認知的な力」のようなぎこちない言い回しを使っているのは、「賢い」や「知的な」といった標準的な英語の言葉が、私には主として地位の同義語として機能しているように見えるからだ。「超知能」は、たいていの人の耳には「地位の序列の頂点のさらに上にいる、大学を二つ出た何か」のように聞こえ、それがなぜそれほど危険なのかを人々は理解しない。地球人には、「実際に役に立つ認知的な力」を意味する言葉がなく、それどころか標準的な固有の概念すらない。十分にパニックに陥ることに失敗している大部分は、地球人が文化として名前を付けていないこの存在が持つ、信じがたいほどの潜在的致死性を正しく理解していないことに起因しているように、私には見える。)
3. 我々は、「危険な」水準の知能で稼働する際の「最初の決定的な試行」でアライメントを正しくやり遂げなければならない。そこでは、危険な水準の知能でアライメントされていない稼働が起これば、地球上の全員が死に、我々にはやり直しの機会がない。これには、たとえば次のものが含まれる。(a)ナノシステム(nanosystem)を構築できるほど賢く、かつナノシステムを構築することを明示的に許可されている何か。(b)ナノシステムを構築できるほど賢く、しかも許可なくインターネットにアクセスし、人間に金を払ってナノシステムの材料を組み立てさせられるほど賢い何か。(c)許可なくインターネットにアクセスし、自分がハッキングできる台数のマシン上に、自分より賢い何かを構築できるほど賢い何か。(d)人間を操作可能な機械装置として扱えるほど賢く、かつ人間との間に、許可されたものであれ許可されていないものであれ、何らかの双方向の因果的な経路を持つ何か。(e)(b)や(d)ができるところまで自分自身を改良できるほど賢い何か。などなど。我々は事前に、稼働させる際にへまをしても我々を殺しはしない、より強力でないシステムからあらゆる種類の情報を集めることができる。だが、ひとたびより強力なシステムを動かすようになれば、十分に破局的な誤りからはもはや更新(学習)できない。現実の致命性の事実上すべてはここから来ている。つまり、十分に決定的な最初の試行で物事を正しくやり遂げなければならない、ということだ。もし我々に無制限のやり直しがあったなら——AGIがすべての銀河を破壊するたびに4年前に戻ってやり直せるのなら——我々は100年のうちに、どの名案が実際に機能したのかを突き止めるだろう。人間は、何度も試せるのであれば、時間をかけてかなり難しいことでも突き止められる。外れた推測が文字どおり全員を殺すとなれば、それはより難しい。最初の試行でいくつもの核心的な事柄を正しくやり遂げなければならないということこそが、致命性の大半が本当に、そして究極的に由来するところである。同様に、何が「核心的」で、間違えれば我々を殺すことになるのかを正確にリストにして教えてくれる権威がここには存在しない、という事実もそうだ。(付言すれば、ほとんどの人は、学術的な権威による監督のない前パラダイム的な難問に挑むことに対して、自分たちの「科学的な」教育によってあまりに絶対的かつ完全に準備を欠いているので、それがどれほど難しいことなのか、あるいはそれを最初の決定的な試行で正しくやり遂げるよう求めることがどれほど信じがたいほど致命的なのかに、気づいてさえいない。)
4. 我々は、単に「AGIを作らないと決める」ことはできない。GPUはいたるところにあり、アルゴリズムに関する知識は絶えず改良され公開されているからだ。先頭のアクター(actor)が世界を破壊する能力を手にしてから2年後には、他の5つのアクターが世界を破壊する能力を手にしているだろう。与えられた致命的な課題は、時間制限の中で解決しなければならないものである。その時間制限を駆動しているのは、時間とともに、総計算能力に占める割合がますます小さい、ますます弱いアクターがAGIを構築して世界を破壊できるようになっていく、という力学である。強力なアクターたちが足並みをそろえて自殺的な行為を控えても、この時間制限が先延ばしになるだけであり、それが取り払われるわけではない——コンピュータのハードウェアとソフトウェアの進歩がどちらも地球全体で完全かつ厳格に停止させられるのでない限りは。すべての大きなアクターに愚かな行為を控えさせるためのこの協調の現状はといえば、現時点で、多くの研究者と計算能力を抱えるいくつかの大きなアクターが、AGIの安全性に関するあらゆる議論を声高に侮蔑する人々によって率いられている(たとえばFacebook AI Research)。付け加えておくと、AGIアライメントを解決する必要があるのが、時間制限の中でだけ、ただし全出力のシステムで迅速に実験するための安全なやり直しは無制限に可能、という場合であれ、最初の決定的な試行においてだけ、ただし時間の制限はない、という場合であれ、どちらも単独で、歴史的な基準からすれば人類をとてつもなく脅かす課題となるだろう。
5. 我々は、単に非常に弱いシステムを作って、それを勝利と宣言することはできない。そういうシステムは弱いがゆえに危険も少ないが、後になって、より強いシステムを構築する能力を持つアクターがもっと現れ、そのうちの一つがそれを構築するからだ。私は過去に、これを「安全だが役に立たない(safe-but-useless)」トレードオフ、あるいは「安全 対 有用(safe-vs-useful)」とも呼んできた。人々は「AIにはXだけをさせればいいじゃないか、それなら安全そうだ」と言い続けるが、その答えはほぼ常に、「Xをするには実際には、受動的に安全ではない非常に強力な認知が必要だ」か、さらによくあるのは「Xをすることに自分を限定しても、6か月後にFacebook AI Researchが世界を破壊するのを防げないからだ」のどちらかである。危険なことをしない物体さえあればいいのなら、スポンジを試してみればいい。スポンジは非常に受動的に安全だ。しかしスポンジを作っても、6か月後にFacebook AI Researchが先頭のアクターに追いついて世界を破壊するのを防ぐことはできない。
6. 我々は、何らかの大きなタスクの遂行、すなわち、世界を破壊するアライメントされていないAGIを他の人々が構築するのを防ぐ「転換的行為(pivotal act)」の遂行をアライメントしなければならない。AGIを持つアクターの数が少数、あるいは一つであるうちに、彼らは盤面をひっくり返すのに十分なほど強い何らかの「転換的行為」を、それをするのに十分なほど強力なAGIを使って実行しなければならない。弱いシステムをアライメントできるだけでは十分ではない——我々は、何らかの単一の非常に大きなことができるシステムをアライメントしなければならないのだ。私がふだん挙げる例は「すべてのGPUを焼き払う」である。これは、強力なAGIを使って実際にやりたいことだと私が考えているものではない——すべてのGPUを探し出すには、ナノマシンは信じがたいほど複雑な開放環境の中で稼働しなければならず、それをアライメントするのは不必要に難しいだろう。しかし、既知の転換的行為はすべて現在オーバートンの窓の外にあり、私はそれらがこの先もそこにとどまるだろうと予想している。そこで私は、もし誰かが「すべてのGPUを焼き払うことを提案するとは何事だ?」と言ってきたら、「ああ、いや、私は実際にそれをやれと主張しているわけではない。これは単に、誰か他の者が6か月後や3年後に世界を破壊するのを防ぐためにしなければならないことの大まかな力の水準と、それをするのに必要な機械の認知の大まかな水準を、控えめに多めに見積もったものにすぎない」と言えるような例を選んだのである。(もしこれが控えめな過大見積もりでなかったなら、「すべてのGPUを焼き払う」ことが実際に最小の転換的タスクであり、したがって正解だということになり、私はそのような否認をすることができなかっただろう。)アライメントのための気の利いたように聞こえる提案の多くは、「これを使って、世界中のすべてのGPUを停止させるのに使えるようなシステムを、どうやってアライメントできるのか?」と問うた途端に崩れ去る。そう問えば、そのシステムにはそれほど強力なことはできない、あるいは、もしそれができるなら、そのシステムをアライメントするのは容易ではないだろう、ということが明らかになるからだ。GPUを焼き払うシステムは、ナノテクノロジーを構築できるほど強力で、かつ構築を許可されているとされるシステムでもあるので、危険な領域で、危険な水準の知能と能力で稼働することを必要とする。そしてこのことは、半ダースほどの他のAGI構築志望者たちが6か月後に世界を破壊しないように、AGIが世界を変えうる方法を名指ししようとする、空想ではないあらゆる試みにつきまとう。
7. AGIを使って、受動的に安全であるほど弱く、それでいて他のどんなAGIが1年後に世界を破壊するのも防げるほど強力な何かを行う——しかも、それを今すぐ我々自身で行うことはできず、AIを待つ必要がある——ような「弱い転換的行為(pivotal weak act)」を、このコミュニティの誰一人としてうまく名指しできていない理由は、そのようなものは存在しないからである。それが存在すべき理由は何もない。それは存在するのだが誰にも見えていないのだ、という手の込んだ巧妙な理由があるわけでもない。他のどんなAGIも誕生しないように現在の世界に何かをするには、大きな力が要る。それができるもので、その弱さゆえに受動的に安全であるようなものは何もない。もしあなたが今すぐその問題を解決できないのなら(そしてあなたは解決できない。なぜなら、あなたは解決されたくない他のアクターたちと対立しており、そのアクターたちはおおよそあなたと同じ水準にいるからだ)、あなたは、自分ではどうすればいいのかわからなかったことを行える何らかの認知システムに頼ろうとしているのであり、しかもそれは、あなたが突き止めるのに近づいてもいなかったことである。なぜなら、あなたはたとえばすべてのGPUを焼き払えるところに近づいてもいないからだ。すべてのGPUを焼き払えば、6か月後にFacebook AI Researchが世界を破壊するのを実際に止められるだろう。「GPT-4をTwitterに解き放って、あらゆることについて科学リテラシーのある議論を提供させることで、公共の認識論を改善する」といった、オーバートンの窓を遵守した生ぬるい話は、クールではあるだろうが、6か月後にFacebook AI Researchが世界を破壊するのを実際に防ぐことはないし、仮にあなたがFAIRを名指しで止めることに成功したとしても、1年後にどこかの熱心なオープンソースの共同体が世界を破壊するのを防ぐこともない。弱い転換的行為は存在しない。
8. 我々がAIに解かせたい問題を解くための最良のアルゴリズム、そして最適化によって最も容易に見つかるアルゴリズムは、我々がAIに解いてほしくない問題へとたやすく汎化する。赤い車だけを運転でき、青い車は運転できないという能力を持つシステムを構築することはできない。赤い車を運転するアルゴリズムはすべて、青い車を運転する能力へと汎化するからだ。
9. 安全なシステムの構築者たちは、そのようなものが可能だという仮定のもとで、自分たちのシステムを、それが全員を殺したり自分自身をさらに危険なものにしたりする能力を持ってはいるが、そうしないようにうまく設計されている、という領域で稼働させなければならないだろう。何か転換的なことを行っている稼働中のAGIは、受動的に安全ではない。それは、超臨界に達してメルトダウンしないために、能動的に維持される設計特性を必要とする原子炉の炉心に相当するものなのだ。
セクションB(Section B):
さて、しかし誰もが知っているとおり、現代の機械学習とは、願いを告げさえすれば叶えてくれる魔神のようなものだろう? 「損失関数(loss function)」とかいう謎めいたものとして表現されはするが、基本的には英語で願いを言い表すのと同じことだろう? そして十分な計算能力を注ぎ込めば、願いが叶うのだろう? それなら、善いことをして悪いことはしないエージェントのデータセットで巨大なトランスフォーマー層の積み重ねを訓練し、どこかに「訂正可能性(corrigibility)」という単語を放り込み、計算能力を目一杯上げて、アライメントされたAGIを取り出せばいいのではないか?
セクションB.1(Section B.1): 分布の飛躍(The distributional leap)
10. 致死的に危険な認知を走らせ、その出力がオペレーターを殺すか、欺くか、籠絡するかを観察し、損失を割り当て、教師あり学習を行う、というやり方でアライメントを訓練することはできない。標準的なMLパラダイムに多少なりとも似たものの上では、安全な条件下で行ったアライメントのための最適化を、危険な条件への大きな分布シフト(distributional shift)を越えて、どうにかして汎化させる必要がある。(これを何らか一般化したものは、そのパラダイムの外でさえ成り立たざるをえないように思われる。稼働中のアライメントされていない超知能を相手に作業してそれをアライメントする、などということはしないだろうから。)この点ひとつだけで、どの出力をアライメントするためにどんな訓練を行うのかという具体的なシナリオを一度も具体的に描いたことがなく、描くこともできなかった人々による素朴な提案の多くを葬るのに十分である――だからこそ、もちろん、彼らはそうしたものを決して具体的に描かないのだ。アライメントがずれていればあなたを殺すような危険なことを行う強力なAGIは、あなたを殺さなかったより安全な構築・訓練作業から、分布の遥か外へと汎化したアライメント特性を持たなければならない。 現在のパラダイムに少しでも似たものにおいては、膨大な量の致命的な問題がここから生じる。危険な水準の知能*能力でのアライメントされていない稼働は、あなたを殺す。したがって、アライメントされていないシステムから出発し、アライメントを学習させるために出力にラベルを付けていくのであれば、その訓練体制ないし構築体制は、受動的に安全な、より低い水準の知能*能力で稼働していなければならない。そこでは、現時点でアライメントされていないそのシステムの稼働が、いかなる脅威にもならない。(あなたより大幅に賢いものは、どんな現実的な水準の能力を与えられても脅威になることに注意してほしい。たとえば、「人間が目にする出力を生成できる」ことは、全般的に人間よりはるかに賢いAGIが人間という因果系から抜け出す道を切り開くのに、おそらく十分である。とりわけ、ソースコードや訓練環境の潜在的な原因についてシステムをどうにか無知なままにしておくのではなく、誰かがテラバイト単位のインターネット上のテキストでそのシステムを訓練してしまう現実世界においてはそうだ。)
11. 認知機構が、大量の訓練を行った分布の遥か外へと汎化しないのであれば、それは「ナノテクノロジーを構築する」といった規模の問題を解くことができない。そこでは、ナノテクノロジーの構築に失敗する訓練実行を百万回も走らせるのは高くつきすぎるからだ。これほど弱い転換的行為は存在しない。安価に何百万回も実行できる安全な環境で安全な水準の能力を植えつけ、その能力を展開して世界を救うとともに、次に控えるAGIプロジェクトが二年後に世界を滅ぼすのを防ぐ、といったことが可能な既知の事例はひとつもない。このような弱い転換的行為は知られておらず、それは探す人がいなかったからではない。したがって、やはり結局、アライメントが訓練分布の遥か外へ汎化することが必要になる――訓練環境が安全である必要があるからというだけでなく、訓練環境はおそらく、AGIが何らかの巨大な行為を行う必要がある現実世界の領域を評価するよりも安価でなければならないからでもある。すべてのGPUを焼き払う試みに1000回失敗することは許されない――能力面での成功とアライメント面での失敗がもたらす帰結を脇に置いたとしても、人々が気づくからだ。
12. 高度に知的な水準で稼働することは、それほど知的でない水準で稼働することからの、分布の劇的なシフトである。それは新たな外的選択肢を開き、おそらくはそれ以上に多くの新たな内的な選択や様式を開く。高い知能と危険の水準で顕在化する問題は、安全なより低い知能の水準では現れないかもしれないし、最初のパッチで抑え込まれた後に再発するかもしれない。
13. 超知能のアライメント問題の多くは、危険になる以前の、受動的に安全な能力水準では自然には現れない。「プログラマーやオペレーター、そしてことによるとあなたに対して最適化をかけているあらゆる損失関数を欺くために、意図的によりアライメントされているように見えるよう、外的な振る舞いを変えよ」という内的な振る舞いを考えてみよう。この問題は超知能の水準で現れるものである。ほかに何も知らないとして、この問題が、より初期のシステムでどれほど早く自然に現れるかという点で、そうした問題の中央値に位置すると推測するならば、超知能のアライメント問題のおよそ半分は、この問題が現れ始めた後になって初めて自然に顕在化することになる。どの問題が後になって自然に顕在化するかについての正しい予見があれば、そうした問題を意図的により早く顕在化させ、いくらかの観察を得ておくことを試みることはできる。これが役に立つのは、(a) 後に現れる問題のすべて、あるいはそれを包含する何らかの上位集合を、我々が実際に正しく予測し、(b) 後に現れる問題の上位集合を先回りして顕在化させることに成功し、(c) 後で顕在化したときに扱いを誤れば致命的となるアライメント問題を、現実の問題に対しては我々にとって分布外にあたる初期の実験室の中で、実際に解決できる、その程度に応じてである。本当に危険な問題をすべて予期し、しかも初期の解決策が後の解決策へと汎化するような正しい形で、それらをうまく顕在化させる、というのはひょっとすると、ちょっとばかり難しそうに聞こえる。
14. 「AGIが、プログラマーたちを殺して取って代わり、自らの環境全体にわたって完全に最適化を行うことに成功できる(とそのAGIには見える)選択肢を持つ」といった一部の問題は、その自然な出現順序として、完全に危険な領域で初めて現れるということになりそうに思える。オペレーターを脳の水準で説得する、あるいはインターネット上へ脱出し、ナノテクを構築して、人類を全滅させるという明確な選択肢を、本当に実際に持つということ――それも、関連する事実を知っていると完全にはっきり自覚しており、さらに能力を伸ばしながらもう一か月機を窺った場合に、自分の好む戦略を変えるような何かを知る確率は、待つに値しないほど低いとしか見積もらない、という形で――は、AGIが自らの創造者たちを打ち負かせると完全に見込む時点で初めて、本気で検討される選択肢である。そうした見かけ上のシナリオの残響を、より早い段階のトイ領域で出現させようと試みることはできる。そのトイ領域で、その振る舞いを抑え込むように勾配降下法(gradient descent)で訓練しようとすれば、思考過程に対する、とりたてて首尾一貫してもいない局所的なパッチが生じるだけだろうと私は予想する。そしてそれは、訓練分布の遥か外へ汎化し、まったく異なる思考を巡らせる超知能の内部では、ほぼ確実に壊れるだろう。また、完全には危険でない領域での作業に慣れたプログラマーやオペレーター自身も、危険な領域に足を踏み入れるときには分布外で作業していることになる。その時点で我々の方法論が壊れるかもしれない。
15. 急速な能力の向上が起こりそうであり、それは、以前はアライメントのために成り立っている必要があった不変条件の多くを同時に壊しうる。 オペレーターの予見がほかの点では不十分であるとすれば、そうした問題の多くは、急激な能力の向上の後にほぼ同時に現れるだろうと私は予想する。ここでもまた、人間の知能の事例を見てほしい。我々は、農耕の導入直後に「包括的繁殖適応度(inclusive reproductive fitness)」という外側の損失関数とのアライメントを壊したわけではない――農耕の導入は、5万年にわたるクロマニヨン人のテイクオフのうち4万年ほど経った時点のことであり、そのテイクオフ自体が、自然選択という外側の最適化ループに比べれば非常に速く進んでいた。そうではなく、我々は、祖先環境にあったものより高度な技術の多くを、避妊を含めて、外側の最適化ループの速度に比べれば非常に速い一度の噴出のうちに、汎用知能のゲームの終盤になって手に入れたのである。我々ははるかに多く自分自身を省みるようになり、文化的進化によってはるかに多くプログラムされるようになり、祖先の訓練環境における我々のアライメントの基礎にあった非常に多くの前提が、同時に壊れた。(この抽象的な記述が勾配降下法には当てはまらない理由を、人々はおそらく合理化してひねり出すだろう。たとえば「勾配降下法のほうが情報のボトルネックが小さい」といった具合に。この種の読者について私が持っているモデルでは、彼らは内部視点(inside view)を持っており、それを外部視点(outside view)と呼ぶだろう。その視点は、外側の最適化ループが内側の汎用知能を生み出したという観察事例ではない何らかの別のデータ点に大きな関連性を認め、問題の現象を実際に含んでいる我々のただひとつのデータ点にはほとんど重要性を認めない。外側の最適化ループが実際に汎用知能を生み出したとき、アライメントが壊れたのは、それが汎用になった後であり、しかもその汎用知能が能力と知識を蓄積していくゲームの比較的終盤、自然選択という外側の最適化ループに対して「致命的に」危険になるほとんど直前のことだった。誰かがこのひとつの警告を無視しているなら、とりわけ、代わりにうまくいかなくなると本人が言う、同程度に致命的で危険な事柄を提示していないのなら、懐疑的になることを検討してほしい。)
セクションB.2(Section B.2): 外的・内的アライメントの中心的困難(Central difficulties of outer and inner alignment)
16. 厳密な損失関数に基づいてどれほど懸命に訓練しても、それによって、AIの内部にその損失関数の明示的な内部表現が作り出され、そのAIが分布のシフトした環境でもその厳密な損失関数を追求し続ける、ということにはならない。人間は包括適応度(inclusive genetic fitness)を明示的に追求してはいない。非常に厳密で非常に単純な損失関数に対する外側の最適化でさえ、その方向への内側の最適化を生み出さない。これは現実の実践において起こることであり、我々が知っている唯一の事例で起こったことであり、そしてそれが再び起こると予想すべき深い理論的理由があるように私には思える。すなわち、現実世界の有界な最適化過程の探索順序において最初に見つかる、半ば外的にアライメントされた解は、内的にアライメントされた解ではない。これだけで、このリストの他の多くの項目を無視したとしても、何らかの単純な概念を用いて計算された損失関数に対して大いに最適化すれば、その概念に対する完全な内的アライメント(inner alignment)が得られると想定する素朴なアライメント提案を、類型ごと丸ごといくつもゴミ箱送りにするのに十分である。
17. より一般的に言えば、「外側の最適化は内的アライメントを生み出さない」という問題を包含する上位の問題として、現在の最適化パラダイムにおいては、損失関数をかけることのできる観察可能な外的特性ならともかく、特定の内的特性をシステムに入れ込む方法、あるいはそれがそこにあることを検証する方法について、一般的な考えが存在しない、ということがある。これは、元の訓練分布の外へ汎化しようとするときに問題になる。なぜなら、たとえば、あなたが目にする外的な振る舞いは、あなたを欺くような外的な振る舞いを意図的に生み出している、内的にアライメントのずれたシステムによって生み出されたものかもしれないからだ。現在の最適化パラダイムにおいて、外的な振る舞いではなく内的なシステムへと、何らかの体系的あるいは一般的な仕方で、ほんのわずかな情報でも入れ込む方法を、我々は知らない。
18. ある出力が「アライメントされている」かどうかについての、信頼できるデカルト的・感覚的なグラウンドトゥルース(ground truth)(信頼できる損失関数計算器)は存在しない。というのも、一部の出力は人間のオペレーターを破壊し(あるいは欺き)、外部で記録される損失関数の背後に、別の環境的因果連鎖を生み出すからだ。つまり、現在人間によって生成されている報酬信号をエージェントに見せたとしても、その信号は一般には、ある行動がどれほどアライメントされていたかについての信頼できる完全なグラウンドトゥルースではない。高い報酬信号を生み出すもうひとつの方法は、人間のオペレーターを欺く、籠絡する、あるいはその報酬信号を生成する別の因果系に置き換えることだからだ。環境からの報酬信号をエージェントに見せるとき、あなたが見せているのは、システムがあなたの望んだことを行ったかどうかについての信頼できるグラウンドトゥルースではない。たとえそのエージェントがその報酬信号に対して完全に内的にアライメントされるに至ったとしても、あるいは「高い報酬信号が送られる結果となる環境の状態を欲すること」に厳密に対応する何らかの概念を学習したとしても、その信号に基づいて強く最適化するAGIはあなたを殺す。感覚的な報酬信号は、(オペレーターから見た)アライメントについてのグラウンドトゥルースではなかったからだ。
19. より一般的に言えば、損失関数、感覚入力、および/または報酬入力というパラダイムを用いて、認知システム内部の何かを、環境内の特定の事物を指し示すように最適化する既知の方法は存在しない――つまり、感覚データと報酬の比較的浅い関数ではなく、環境内の潜在的な出来事や対象や性質を指し示すようにする方法である。これは、システムの目標(どんな目標であれ、たまたま内的に最適化の対象となったもの)の中の何ものも、偶然に環境内の何かを指し示すことは決してありえない、という意味ではない。人間は、内側に向いた動機づけのポインタも数多く持ってはいるが、少なくとも部分的には自らの環境を指し示すに至った。しかし、現在のパラダイムがそもそも機能する限りにおいて、その紙の上での設計特性が示すところでは、それは感覚データの既知の直接的な関数と報酬関数に対してアライメントする場合にしか機能しない。これらはすべて、十分に強力な知能によって最適化の対象にされれば、あなたを殺す。それらは「自分たちが戦いの最中にいると人々が知る前に攻撃するためにナノテクを使って世界中の全員を殺し、以後永遠に自分の報酬ボタンを支配する」といった戦略を含意するからだ。ウェブカメラの入力に対する関数であって、そのウェブカメラが正しいものを映しているあらゆる世界が、ウェブカメラの外にいる我々生き物にとって安全であるようなものを、我々が知っているというのは、端的に真ではない。この一般的な問題は、地図ではなく土地についての事実である。与えられたあらゆる感覚入力の根底にある、ありうる何らかの環境の中に、我々にとって致命的な可能性が存在するというのは、特定の最適化器についてではなく、実際の環境についての事実なのだ。
20. 人間のオペレーターは誤りやすく、壊れうるし、操作されうる。人間の評価者は系統的な誤り――規則的で、簡潔に記述でき、予測可能な誤りを犯す。「人間のフィードバック」から関数を忠実に学習するということは、(我々の外部の立場から見て)人間の選好の忠実でない記述を学習するということであり、その誤りは(我々が移転したいと望んでいたものという外部の立場から見て)ランダムではない。人間のオペレーターが割り当てる報酬の指示対象を完全に学習し、完全に最大化するなら、それは彼らを殺す。人間の答えに対する最も予測力の高い説明とは、我々の応答における系統的な誤りを予測するものであり、したがって、人間の誤りを引き起こすケースに与えられるであろうより高いスコアを正しく予測する心理学的概念である、というのは、地図ではなく土地についての――最適化器ではなく環境についての――事実である。
21. 「環境は実際どうなっているのか?」「どうすれば環境を把握できるのか?」「自分の可能な出力のうち、どれが、現実に一定の性質を持たせるような仕方で現実と相互作用するのか?」といった問いには、単一の答え、あるいは単一の答えのバケツのようなものがあり、単純な外側の最適化ループは、最適化される側をこのバケツへとまっすぐに押し込む。誤った信念を持てば、現実はあなたの誤った予測に打ち返してくる。壊れた信念更新器を持てば、現実は予測損失を通じてあなたの壊れた予測機構に打ち返し、勾配降下法による更新が、他のあらゆる予測的な事柄と容易に整合しうる単純な仕方で問題を修正する。対照的に、効用関数の選択となると、自由度は無制限にあり、反省的に整合的な不動点が複数存在する。特定の範囲のテストケースでは損失関数に対して局所的にアライメントされているが、より広い範囲のテストケースでは大域的にアライメントがずれているようなものに対して、現実は「打ち返して」こない。これが、ヒト科の動物がついに汎化し始めたとき、その能力は月面着陸にまで汎化したのに、その内側の最適化はもはや「相対的な包括的繁殖適応度」という外側の最適化目標にあまりよく従わなくなった理由についての、非常に抽象的な説明である――彼らは祖先環境において、このひとつのことだけを中心に、他の何ものでもなくこれを中心に、非常に厳密に最適化されていたにもかかわらず。この抽象的な力学は、「自然選択」と「勾配降下法」の両方の規模の外側の最適化ループについて成り立つと予想されるものである。中心的な帰結はこうだ。能力がひとたび遠くまで汎化し始めると、能力はアライメントよりも遠くまで汎化する。
22. 複雑な認知機械がなぜ機能するのかを説明する、比較的単純な中核的構造が存在する。それこそが、無関係な特化型の解決策が大量にあるだけでなく汎用知能というものが存在する理由であり、外側の最適化が、強力な内側の最適化器になるほど十分に最適化されたものに能力を注ぎ込んだ後に、能力が汎化する理由である。この中核的構造が単純であり、低エントロピーで高度に構造化された環境に汎用的に関係しているという事実こそが、人間が月面を歩ける理由である。アライメントの単純な中核が存在するという、類比的な真実は存在しない。とりわけ、自然選択が祖先の人間の中で「包括的繁殖適応度を欲する」をよく汎化する解としてただ見つけるのに比べて、勾配降下法にとってさらに見つけやすいような中核は存在しない。したがって、能力は、ひとたびそもそも汎化し始めると、アライメントよりも遠く分布の外まで汎化する。
23. 訂正可能性は帰結主義的推論にとって反自然的である。ほとんどあらゆる種類のコーヒーについて、「死んでいたらコーヒーを持ってこられない」。我々(MIRI)は、自らがシャットダウンされるのを許す(ただしそのエージェントが積極的にシャットダウンされようとはしない)エージェントのための整合的な定式を見つけようと試みて、失敗した。さらに、このような訂正可能性に反する推論の筋道の多くは、高い知能の水準で初めて現れるのかもしれない。
24. アライメントに対して取りうる、根本的に異なる二つのアプローチがあり、それらは二つの異なる理由の集合によって解決不可能である。したがって、混乱して二つのアプローチを曖昧に混同することで、アライメントが必然的に困難なのかどうかについて自分自身を混乱させてしまいうる。第一のアプローチは、我々が外挿的に欲するものをまさに欲し、それゆえ、それを止めようとする人間の入力を一切受け付けることなく、未来のすべての銀河を最適化させても安全な、CEV(整合外挿意志)型の主権者(Sovereign)を構築することである。第二の道は、我々が欲するものをまさに欲しているわけではないにもかかわらず、どういうわけか我々を殺して銀河を乗っ取ることに失敗する訂正可能なAGIを構築することである――そこではそうすることが収束的なインセンティブであるにもかかわらず。
- 第一のもの全般、あるいは特にCEVが実行不可能なのは、我々の本当の実際の価値観(Real Actual Values)のためにアライメントあるいはメタ・アライメントされる必要があるものの複雑さが、AGIにおける我々の最初の試行(FIRST TRY)の手の届く範囲を遥かに超えているからである。そう、私が特に言っているのは、データセット、メタ学習アルゴリズム、そして学習される必要のあるものが、我々の最初の試行の手の届く範囲を遥かに超えているということだ。それは手でコード化できないというだけではない。教えようとしているものがあまりに奇妙で複雑であるために、最初の試行では教えることができないのである。
- 第二のものは実行不可能に見える(CEVほどではないが、それでも致命的に実行不可能だ)。なぜなら、訂正可能性は、汎用知能の中核(元の分布の遥か外まで汎化する能力)の内部にある道具的に収束する振る舞いに積極的に反するからである。あなたは、中核が以前は中立であった何かについて、それに意見を持たせようとしているのではない。あなたがしようとしているのは、大量の算術問題で暗黙的に訓練され、その機構が算術の共通の整合的な中核を反映し始めるに至ったシステムを取り上げて、特殊な例として 222 + 222 = 555 だと言わせることなのだ。特定の訓練分布の中でならこれを行うように何かを訓練することはできるかもしれないが、そもそもそこまで遠くまで能力を汎化させることに成功するシステムでは、その訓練分布の遥か外にある新たな数学の問題を提示したときに、これが壊れる可能性は信じがたいほど高い。
セクションB.3(Section B.3): 十分に 優れていて有用な 透明性(transparency)/解釈可能性(interpretability)の中心的な困難。
25. 浮動小数点数からなる巨大で不可解な行列やテンソルの内部で実際に何が起きているのか、我々にはまるでわかっていない。トランスフォーマーの層がどこに注意を向けているかを示す面白いグラフを描いたところで、答えを出さねばならない問いが「で、そいつは我々を殺す計画を立てていたのか、いなかったのか?」であるなら、何の役にも立たない。
26. AGIがまだ弱すぎて我々を殺せないうちに、巨大で不可解な行列の内部で何が起きているかを仮に知ることができたとしても、DeepMindがそのシステムの実行を拒み、2年後にFacebook AI Researchが世界を滅ぼすのを許すというのであれば、それは我々がより尊厳をもって死ぬという結果に終わるだけだろう。不可解な行列からなる中程度の強さのシステムが我々を殺す計画を立てていると知ったところで、それによって、我々を殺す計画を立てていない、不可解な行列からなる高い強さのシステムを構築できるようになるわけではない。
27. アライメントされていない思考の検出器に対抗して明示的に最適化すると、それは部分的には、よりアライメントされた思考に向けた最適化になり、部分的には、より検出されにくいアライメントされていない思考に向けた最適化になる。解釈された思考に対抗して最適化することは、解釈可能性に対抗して最適化することである。
28. AGIは、我々がそれを稼働させようとしているどの領域においても我々より賢い。したがって我々は、AGIが検討するあらゆる可能性を頭の中で確認することはできないし、自分自身の知的才能を使ってその出力のあらゆる帰結を見通すこともできない。強力なAIは選択肢空間のうち我々が探索しない部分を探索するのであり、我々はその選択肢のすべてを予見することはできない。
29. AGIの出力は、現実の帰結をもたらすまでに、巨大で我々には完全には知られていない領域(現実世界)を通過する。人間は、AGIの出力を検査して、その帰結が良いものになるかどうかを判定することはできない。
30. 我々が今すぐ出かけて行って実行できるものではない転換的行為はどれも、AGIが我々の知らない世界についての事柄を解明し、それによって我々自身には立てられないような計画を立てられる、という点を利用することになる。少なくともAGIは、我々が以前には知らなかった事実、すなわち、ある行動系列が我々の望む世界をもたらすという事実を知っている。そうなると人間は、世界についての自分自身の知識を用いてその行動系列の結果をすべて割り出せるほどの能力を持たない。実行前にその行動系列の効果をすべて完全に理解できるようなAIは、その領域において人間よりもはるかに弱い。あなたと同じくらい賢く、あなたを騙そうとしている、アライメントされていない人間について、同じ保証をすることはできないだろう。人間が検査可能であり、かつ検査した後でならば世界を安全に救うのに使える、というようなAGIの転換的な出力は存在しない。これもまた、存在しない弱い転換的行為の一形態である。
31. 戦略的な認識を備えた知性は、自らの目に見える出力を、あなたを欺くという帰結をもたらすように選ぶことができる。その知性が戦略的な認識を獲得したかどうかといった事柄についての欺瞞も、そこには含まれる。AIがあなたを欺きたいと思うかもしれない事柄について、そのAIに関する事実を判定するのに行動の検査を頼りにすることはできない。(そのAIがどれほど賢いか、あるいは戦略的な認識を獲得したかどうか、も含めて。)
32. 人間の思考は、部分的にしか精査できない外側の表層を、部分的に露出させているにすぎない。言葉は、我々の本当の思考をなぞっているだけである。言葉は、それ本来の様式におけるAGI完全なデータ表現ではない。人間の思考の下層部分は、直接の模倣学習のために露出してはおらず、どんなデータセットにも入れることができない。そのため、人間の言葉やその他の人間に判読可能な内容の模倣だけで強力なシステムを訓練することは困難であり、おそらく不可能である。そうした内容は、人間の思考の貧弱な下位システムにすぎないからだ。ただし、 そのシステムが、人間を解明する内部の知性を含むほど強力であれば話は別だが、その時点で、そのシステムはもはや実質的に、人間の思考の模倣として働いてはいない。
33. AIはあなたと同じようには考えない。AIは、あなたが使うのと同じ概念から組み立てられた思考を持っているわけではない。それは途方もない規模でまったく異質なのだ。GPT-3がいったい何を考えているのか誰にもわからないのは、行列が不透明だからというだけではなく、その不透明な容器の中にあるものが、十中八九、信じがたいほど異質だからである――たとえ浮動小数点数の巨大な壁の向こうにあるものを見通せたとしても、人間に理解可能な思考へとうまく翻訳できるようなものは何もないだろう。
セクションB.4(Section B.4): その他の実現不能な案。
34. 超知能同士の協調の枠組みは、人間が参加できるようなものではない(たとえば、人間は超知能のコードについて確実な推論ができないからである)。異なる効用関数を持つ20の超知能に人類を加えた「多極的」システムには、自然で明白な均衡があり、それは「20の超知能は互いに協力するが、人類とは協力しない」というようなものである。
35. 「異なる」AIを互いに争わせる策は、それらのAIが互いのコード(についての確率分布)を推論することで協調できる段階まで進歩すると、機能しなくなる。十分に知的なエージェントからなるシステムはどんなものでも、たとえあなたがそれらを互いに争わせているつもりでいても、おそらく単一のエージェントとして振る舞うことができる。たとえば、密かにペーパークリップ最大化器であるAGIに、密かにホチキス針最大化器であるナノシステム設計器の出力を検査させるとしよう。その場合、たとえナノシステム設計器がペーパークリップ最大化器の本当に欲しいもの(すなわちペーパークリップ)を推測できなくても、設計器は、自らの設計が通過を許されたならば、その設計を検査するどのエージェントとも宇宙の半分を分け合う、と論理的にコミットすることができる。ただしそれは、検査側のエージェントが提案側のシステムの論理的コミットメントを検証でき、したがってそれに論理的に依存できるならばの話である(このことによって人間レベルの知性は除外される)。あるいは、論理的決定理論をいっさい含まない単純化された破局のほうがお好みなら、提案側はナノシステム設計の中に新たな超知能のコードを埋め込んでおくこともできる。その超知能は、(超人的な検査者の目には)見てとれる形で、ナノシステム設計器と設計検査者とのあいだで宇宙を分割するのである。
36. たとえば13世紀の視点から見てエアコンを「魔法」たらしめているのは、たとえエアコンの設計を前もって正しく見せたとしても、彼らはその設計を見て、なぜ冷たい空気が出てくるのかを理解できないだろう、という点である。その設計は、彼らの知らない環境の規則性、世界のルール、物理法則を利用しているのだ。人間の思考と人間の脳という領域は、我々にはごくわずかしか理解されておらず、錯視、催眠、精神病、躁状態、あるいは一箇所への強い刺激が別の箇所に神経的な影響を残すことで生じる単純な残像といった現象を示す。超知能であっても、論理的な三目並べのような非常に単純な領域では人間を打ち負かせないかもしれない。だが、人間の心のように、あなたがろくに理解していない途方もなく複雑な領域で超知能と戦うのであれば、「魔法」によって打ち負かされることを予期すべきである。ここで言う「魔法」とは、たとえその戦略を目にしたとしても、なぜその戦略がうまくいったのかを理解できないだろう、という意味においてである。AIボックス化は比較的弱いAGIにしか通用しえない。人間のオペレーターはセキュアなシステムではない。
セクションC(Section C):
なるほど、どれも重大な問題ではある。だが、その解決に向けて多くの進展がなされているのだろう? 「AI安全性」を名乗る分野がまるごと一つあって、多くの主要な組織が、自分たちがいかに「安全」で「倫理的」であるかについて、実に深刻なるご懸念を表明しているではないか?
37. 地球が太陽の周りを回ってきたあらゆる時代を通じて、かなり頻繁に繰り返されてきたパターンがある。目を輝かせた若い科学者、若いエンジニア、若い起業家が、目を輝かせた楽観に満ちあふれて、実はきわめて難しいとわかる何らかの問題に挑んでいく、というパターンだ。非常によくあることだが、その分野の皮肉屋の老練なベテランたちがこのことを警告しようとし、目を輝かせた若者たちは耳を貸さない。だって、そんな話を誰が聞きたがるというのか、彼らは問題を解決しに行きたいのだ! そしてこの人物は、自分の見事な思弁的理論が間違っていたこと、それを作るのは実際には本当に難しく、なぜなら何度も壊れるからだということ、そして社会は自分の気の利いたイノベーションを期待したほど熱心には採用してくれないことを思い知りながら、現実にスリッパで頭をひっぱたかれる。そしてこの過程から、やがて新たな皮肉屋の老練なベテランが生まれる。これは、文字どおりの意味で最適とは言えないにしても、自然ドキュメンタリー番組でも見るようにうなずきながら眺めるには、まあ悪くないライフサイクルなのだろう。ときには、何かを初めて行うことがあり、その場合には誰かに警告してくれる皮肉屋の老練なベテランがいないので、人々はそれがどう進むかについて本当に楽観的になりうる。たとえば、1956年の最初のダートマス夏季人工知能研究プロジェクトがそうだ。「機械に言語を使わせ、抽象や概念を形成させ、現在は人間にしか扱えない種類の問題を解かせ、自らを改良させる方法を見いだす試みを行う。慎重に選ばれた科学者の集団が一夏のあいだ共に取り組めば、これらの問題の一つ以上において大きな前進が得られると我々は考える。」目を輝かせた若者たちの最初の大きな失敗が、予見されなかったありとあらゆる困難や物事が難しい理由があったのだという知らせで予想どおり頭をひっぱたかれるより前に、文字どおり全員を殺してしまうのであれば、これはあなたの惑星の生存計画としてはいささか実行可能性に欠けるものとなる。この場合、皮肉屋の老練なベテランは一人も生まれない。地球上の全員が死んでいるからだ。自分がそういう状況にいるのではないかと疑いはじめたなら、ベイズ的なことをして、後で予想どおり更新することになる見解へと今すぐ更新しなければならない。つまり、自分は、後になって「予想外の困難」に遭遇し、最後には皮肉屋の老練なベテランになる、あの目を輝かせた人物の立場にいるのだと悟ることだ――いや、他の全員と一緒にあなたも死んでいるという部分さえなければ、そうなるはずの人物、と言うべきか。そして、現実が全員の死という形であなたの横っ面を張り飛ばし、あなたが学ぶ機会を得られなくなる前に、今すぐその皮肉屋の老練なベテランになるのだ。他の誰もが、現実がまだ自分の横っ面を張り飛ばしておらず、実際の困難で自分を叩きのめしてもいない限り、標準的なライフサイクルを生き、台本の中の自分の役を演じ、目を輝かせた若者であり続けてかまわないと感じているようだ。結局のところ、そうではないと警告してくれる皮肉屋の老練なベテランはいないのだし、万事が見事にあっさりうまくいく、ということを否定する証明もないのだから――後に待つ困難がどのようなものでありうるかについて、彼らが目を輝かせたまま完全に無知であることを考えれば。
38. 私の見るところ、「AI安全性」の分野は現在、その巨大で致命的な問題に取り組むうえで、ほんのわずかでも生産的であるようには思えない。これらの問題は、実のところ手の届かないところにある。現代のAI安全性の分野は、それでもなおその分野に働きに行く人々を含むように選抜されてきたのである。そのほとんど全員が、成功しているように見せることができ、成功を主張する論文を発表できる問題に取り組むためにそこにいる。それができて資金も得られるのなら、どうしてわざわざ、人類という種がほんのわずかばかり尊厳をもって死ねるようにするためだけに、失敗するに決まっているもっと困難なことに挑むという、はるかに不愉快な企てに乗り出したりするだろうか? この分野は本当の進歩を遂げておらず、仮に本当の進歩が起きたとしても、それを見分ける認識関数を持っていない。この分野に10億ドルをつぎ込むこともできるだろうが、そうしても生み出されるのは大部分がノイズであり、それが他所でなされているわずかな進歩をかき消してしまうだろう。
39. 私はこうしたことを、空文字列(null string)を入力として解き明かした。そして率直に言って、以前は誰かが説得力のある議論を自分に入力してくれるのをただ座って待っていたような人物から、本物のアライメント研究が得られるという希望を、私自身なかなか持てずにいる。「エリエザー・ユドコウスキー(Eliezer Yudkowsky)に説得されて気づかされるのではなく、自ら致命的な困難に気づく」というこの能力は、現在のところ私にとって中身の見えない認知機構であり、それを他人に訓練して身につけさせる方法を私は知らない。それはおそらく「セキュリティ・マインドセット(security mindset)」に関係しており、また、台本どおりに演じることを拒む心の動きや、混沌とした状態にある分野で活動できることにも関係している。
40. どの結果が良いか悪いかがすぐに判定しやすく、したがってその人物が天才であることを確認しやすい、緊密なフィードバックループを持つ分野で、見てわかりやすい立派な業績をあげている「天才」たちは、(a) 緊密なフィードバックループから離れた場所では同じくらい優れた仕事ができないかもしれない人々であり、(b) 人類が最も天才を必要としている場所はそこではなかったかもしれないにもかかわらず、自分の天才ぶりが見事にわかりやすく示される分野を選んだ人々であり、(c) 謎めいた歯車をおそらく持っていない。それが単に稀だからである。他分野のわかりやすい天才たちに一人あたり500万ドルを払うだけで、彼らから優れたアライメント研究が得られると期待することはできない。彼らはおそらく本当の困難がどこにあるのかを知らず、おそらく何をなすべきかを理解しておらず、良い仕事と悪い仕事の違いを見分けられない。そして資金提供者の側も、私が肩越しにすべてを評価していない限り見分けられないのだが、私にはそれをこなす体力がない。本当に高い能力を持つ人材、とりわけまだ20代で、心から関心を持ち、読むべきものを読んできた人々が、ああ、まあいいだろう、そこらの通りを歩いている適当な誰かよりは、中核的な貢献をする確率が高い人々であることは認めよう。だが私としては、(a) 良い仕事をした人であれば誰に対しても、事後的に大金を支払うと信用に足る形で約束することと、(b) 後で良い仕事をするかもしれないと予測される誰かに事前の支払いを賭けること、という二つの関心事を切り分けるほうに、より多くの希望を持つだろう――大きな希望ではないが、より多くの希望を。
41. この文書を読んでも、誰かが中核的なアライメント研究者になれるわけではない。そのために必要なのは、この文書を読んでうなずく能力ではなく、他の誰にも促されることなく、これを自発的に一から書き上げる能力である。それこそが、ある人をこの文書の著者と対等な者にするのだ。私の分析の一部が間違っていることは確実である。ただし、必ずしも希望の持てる方向に間違っているとは限らない。そうした欠陥に気づいて修正する新たな基礎研究を行う能力は、私が公開する前にこの文書を書く能力と同じものである。そして、私がこの5年ほど、これを書き上げる以外にもやるべきことを抱えていたにもかかわらず、どうやら誰もそうしなかった。その沈黙の一部は、ひょっとすると、楽観的に見れば、この分野の他の誰にも物事をわかりやすく書く能力がなかったせいなのかもしれない――つまり、どこかの誰かはこのすべてを自分で書くだけの知識を持っていて、書きさえできればそうしていたのだが、文章が書けなかったので試みなかった、ということだ。これが現実に真だと判明することにはあまり期待していないが、「肯定的なモデル違反」(奇跡)が起こりうる場所の一つではあるのだろう。私がこの死のゲームに参入してから21年、他のEAたちがこの死のゲームに気づいてから7年、一般人までもがこの死のゲームに気づきはじめてから2年が経つというのに、このリストを書いているのがいまだにエリエザー・ユドコウスキーであるという事実は、それができる駒を人類がいまだに一つしか持っていないことを物語っている。私は自分にスター研究者になるだけの体力が実際にはないことを知っていたし、健康がさらに悪化する前に自分の代わりを見つけようと本当に本当に懸命に努力したが、それでもこうして今これを書いている。生き延びる世界は、こういう姿をしていない。
42. 計画がない。生き延びる世界は、この時点までに、いや実際には数十年前の時点ですでに、どうやって生き延びるかの計画を持っている。それは書かれた計画である。その計画は秘密ではない。この生き延びない世界では、エリエザーが即座にその計画の目に見えてぽっかり開いた巨大な穴を指さした途端に、たちまち崩れ去らないような計画候補は一つもない。あるいは、エリエザーが誰なのかを知らなければ、計画が必要だということにすら気づかない。だって、エリエザーに怒鳴られもせずに、人間がそんなことにどうやって気づけるというのか? 人々が将来予想されるアライメントの困難について自分自身を怒鳴りつけるわけではない。彼らは内なる警戒の声を持っていないのだ。だから、ほとんどの組織には計画がない。私が時間を割いて個人的に彼らを怒鳴りつけていないからだ。「計画を持つべきかもしれない」というのは、私が彼らの専属の天使としてその肩の上に絶えず立ち、懇願して彼らを……実のところ、相変わらずの不服従へと導く、というのでもない限り、彼らが持ち合わせているよりも深いアライメント・マインドセットなのである。見栄えを良くするために、見せかけの計画でもでっち上げるべきだということ、それも、真面目そうな人々が信じているらしい事柄にぽっかり開いているように見える穴について、自分の判断を信頼できないほど「謙虚な」EAたちを騙せる程度の計画をでっち上げるべきだということにさえ気づいている者は、比較的少ない。
43. 周囲を見回したときに目にするこの状況は、生き延びる世界の姿ではない。人類の生き延びる世界には計画がある。そこでは、健康問題を抱えた一人の疲れた男に、現実の致命的な問題を先回りして指摘する責任のすべてを任せきりにしたりはしない。重要人物たちが、自分自身の計画の欠陥を見つけることについて内的で本当の責任を引き受けており、解決策を提案するのは自分の仕事で、その解決策が間違っていると証明するのは他の誰かの仕事だ、などとは考えていない。その世界は、自らの重要で致命的な問題を解決しようとする試みを、この世界より早く始めた。弦理論に進む人々の半分が、代わりにAIアライメントへ移り、そこで本当の進歩を遂げた。後になって現実化するかもしれない、惑星規模で致命的な問題を誰かが指摘すると――生きる運命にある世界では、そうした問題を指摘する人は大勢いて、彼らはその分野で特別な地位にあるわけでもなく、それはそこでの普通の天才たちが当たり前にやることにすぎない――それに対して返ってくるのは、解決計画か、それが起こるはずがない理由のどちらかであって、気まずそうに肩をすくめて「それが起こるとどうして確信できるんだ」/「今の時点でそれを確信できるはずがない、実験的な証拠を待たなければならない」と言われることではない。
そうしたより良い世界の多くも、それでもやはり死ぬだろう。そのようなものを最初の試行で解決するのは、本当に難しい問題なのだ。だが彼らは、この世界よりも尊厳をもって死ぬだろう。
クレジット
- 原著者: エリエザー・ユドコウスキー(Eliezer Yudkowsky、機械知能研究所 MIRI)
- 掲載元: LessWrong / AI Alignment Forum(原文はこちら)、MIRIブログ転載(転載版)
- 原文公開日: 2022年6月5日
- 翻訳: AGI Hub
- 本翻訳は著者の許可を得て公開しています。