AIが人間に友好的でなくなる経路を、二つ挙げよう。
- どうにかして、「人を幸せにすること」を大切にするAIを作る。訓練中には、冗談を言い、花を買ってあげ、話を聞いてほしい人の聞き役になる。ところが、実運用に入り、能力も高まると、人間を一人ずつ、厳重に守られた別々の独房に無理やり閉じ込め、アヘン系薬物を大量に投与する。
- 人を幸せにするのが得意なAIを作る。訓練中には、冗談を言い、花を買ってあげ、話を聞いてほしい人の聞き役になる。ところが、実運用に入り、能力も高まると、その「幸福」を促す行動を生んでいたのは、エネルギーやメモリを欲しがる基本的な欲求など、さまざまな別の目標の釣り合いだったとわかる。そしてAIは、宇宙の大半を、幸福をあまり含まない、それらの別の目標をいくつか組み合わせたものに費やす。
(当然のことを言っておくが、AIに「幸福」を追求させようとしないでほしい。長期的に目指すべきなのは、むしろCEVのようなものだ。短期的には、目標を控えめにして、決定的な転換をもたらす行為を目指すことを強く勧める。)
どちらの場合も、AIは訓練中、人を幸せにしようとしているように見える行動を取る。このうち(1)のAIが友好的でないのは、間違った「幸福」の概念を最適化していたからだ。その概念は、AIの能力が低いときにはあなたの概念と一致していたが、AIが強力になると重要になるさまざまな境界事例では、あなたの概念と食い違う。一方、(2)のAIは、そもそも本当に幸福を追求しようとしていたわけですらない。訓練の目的と相関しているにすぎない目標が混在していて、訓練中はちょうど望みどおりのあたりで釣り合っていたものの、実運用と、それに伴う能力の向上によって、その釣り合いが崩れたのだ。
なお、これは「訓練中は幸福を最適化しているように見えたAIが、うまくいかなくなる経路」を網羅したリストではない!(たとえば、まったく別のものを大切にしていて、幸福を最適化しているように見せなければ停止させられると知っているAIを考えてみよう。あるいは、内省や自己改変によって目標が大きく変化するAIも考えられる。)
(しかも、この二つは互いに排他的ですらない! 同時に両方が起き、たとえば、宇宙の資源の大半は無関係なタスクのためのメモリやエネルギーの獲得に費やし、宇宙のごく一部は薬漬けの人間めいた抜け殻に費やすAIになることもありうる。)
この二つの問題の解き方は、かなり違う。(1)の問題を解決するには、AI内部に形成された「幸福」という概念を、あなたが伝えたかった概念と一致させる方法を見つけなければならない。実運用でAIが到達できるようになる境界事例や極端な状況でも、一致しなくてはならないのだ。その段階のAIには、あなた自身には実行できない、決定的な転換をもたらす何らかの行為を遂行できるだけの力が必要になる。したがって、あなた自身には到達できない、極端な境界事例の状態にも到達できるほどの能力を持つことになる。
(2)の問題を解決するには、訓練中にたまたま目標の「幸福」の上で危うく釣り合っている複雑な寄せ集めではなく、特定の一つの概念をAIが大切にするようにする方法を見つけなければならない。
この区別を指摘するのは、この界隈のさまざまな人が、これらの問題を不適切にひとまとめにしていたり、片方を見落としていたりするように思えるからだ。たとえば、私には「深層学習の観点から見たアラインメント問題」で、この二つが「目標の誤一般化」という名のもとに混同されているように見える。
(「誤一般化」はどちらの場合にも誤解を招く呼び名だと思うが、(1)よりも(2)にはいっそう当てはまらない。霊長類が賢くなってコンドームを発明したとき、それは「包括遺伝適応度」という概念を「誤一般化」しているわけではない。そもそも誤一般化するような概念を本当に持っていたわけですらないし、その概念の断片を多少持っていたとしても、それは霊長類が頭の中で最適化していた対象ではなかった。)
(言い換えると、霊長類が環境の中で適応度を最適化していて、ジャンクフードとコンドームにあふれた、より広い環境に置かれたとたんに「誤一般化」した、という話ではない。「訓練中」の「アラインした」行動が、「実運用」というより広い文脈で崩れたのは確かだ。しかしそれは、既存の「包括遺伝適応度」という概念を、より広い領域へと妙なやり方で拡張したからではない。霊長類の最適化は、そもそも「包括遺伝適応度」の内部表現と結びついていなかったのだ。)
こうした問題を混同すると、これらの問題をまとめて誤って退けやすくなるのではないか、と私は心配している。たとえば、(1)の問題は「能力の問題」だと考える人には、何度も会った。AIがもっと賢くなりさえすれば、私たちが「人を幸せにする」と言うときの意味くらい、当然わかるはずだ、というわけだ。(最初の変革的AGIが言語モデルを基盤とするなら、なおさらだ! 実際、今のGPT-4でも、孤立させた人間に大量のオピオイドを投与することを「幸福」の創出とみなすべきでない理由を説明できるだろう。)
そして、それはそのとおりだ。社会を変革するだけの能力を持つAIは、人間が「幸福」という言葉で何を意味しているか、そして文字どおり全員を薬漬けにするのはおそらくそれに当たらないことを理解するだけの能力も、かなり高い確率で持つだろう。だが、問題はいつもそうであるように、AIにそれを大切にさせることだ。難しいのは、人間が「幸福」と言うときの意味について、AIの内部のどこかに何らかの理解を持たせることではない。[1]難しいのは、AIが追求するものをその概念にすることなのだ。
たとえば原理的には、人を幸せにしたときにAIに報酬を与え、それとは別に、世界を観察して人間が「幸福」と言うときの意味を理解するよう何らかの仕組みを訓練しても、訓練によって身についた最適化対象の概念が、境界事例においては、人間の言う「幸福」についてのAIの明示的な理解と、まるで違うものになることはありうる。
そう、どちらの場合にも「幸せ」という単語を使っていたとしても、これは起こりうる。
(しかもこれは、(2)で述べた問題を、ないものと仮定した話だ。実際には、AIは何もしなければ、「幸福」の代わりに追求する、一つにまとまった別版の幸福概念にさえ行き着かず、千もの欲望のかけらか何かを持つことになる可能性が高い。)
そして、これらの問題の区別をはっきりさせないままでいると、人々が問題の集まり全体を見て、「まあ、能力の問題だろう。AIが人間の概念をよく理解するようになれば、当然こんな問題は小さくなるはずだ」などと言いだすのではないか、と少し心配している。
(LLMはさまざまな人間の概念をかなりよく把握するだろう、と人々が正しく認識するにつれて、私にはこれがすでに起きているように見える。)
あるいは、あなたが最適化しようとしている別の何かについて、ということだ。繰り返すが、それを「幸福」にしてはいけない。ここでは単なる例として使っている。
また、長期的にAIに実際に最適化してほしいもの――「CEV」のようなもの――については、何らかの表現をAIに持たせること自体が、本当に難しくなる点にも注意してほしい。望ましい理想郷(eutopia)となる宇宙を具体的に描写した文章は、幸福な人々を描いた文章よりも、実際にはるかに少ない。このことは、そのような理想郷を思い描くほうが、はるかに難しいことと関係している。
だが、ここでも繰り返すが、一度目の試みで理想郷を目指さないでほしい! まず危険が切迫した時期を終わらせ、それからじっくり考える時間を稼ぐべきだ。↩