リチャード・ウォーターズが、フィナンシャル・タイムズにMIRIなどを取り上げた記事を書きました。同紙は、夏に読みたい科学書のリストでも、ニック・ボストロムの『Superintelligence』を筆頭に挙げています。
よい記事です。ぜひ読んでから、ここに戻ってきてください。いくつか補足しておきたいことがあります。
1. 人間より賢いAIが「すぐに」現れる可能性は、おそらく高くありません。
記事は「コンピューターはまもなく私たちより賢くなる」という一文で始まりますが、そうなる可能性が高いと考えている専門家は、私の知るかぎりほとんどいません。
最近の調査では、存命のAI研究者のうち世界で最も多く引用されている人々に、科学の進歩が大きく妨げられないと仮定した場合、人間レベルのAI、別名AGIが実現する確率が10%、50%、90%になるのはそれぞれ何年までかを尋ねました。回答の中央値は、10%が2024年、50%が2050年、90%が2070年でした。つまり、AI研究者はAGIが近いうちに実現する可能性はあると考えていますが、おおむね、AGIが問題になるのは今世紀の後半だと予想しているのです。
さらに、AGIの安全性を専門に考えている人の多くは、実際には、被引用数の多いAI研究者たちよりもAGIの実現は遠い先だと見ています。たとえば、ニック・ボストロムも私も、調査対象となったAI研究者たちより、遅い時期に高い確率を割り当てるべきだと考えています。AGIの安全性にいまもっと力を注ぐべきだと私たちが主張するのは、今後10年や20年でAGIが実現する可能性が高いと思っているからではありません。AGIの安全性は、たとえば気候変動への対処よりも難しい、極めて困難な課題に見え、数十年にわたる慎重な準備を必要とするからです。
気候変動もAIも、最大のリスクが現れるのは数十年先です。しかし、気候変動の理解と緩和には、すでに何千人もの優秀な研究者や政策担当者が取り組んでいるのに対し、高度なAIの安全性の課題に取り組んでいるのは、ほんの一握りです。いま追加で人材を配分するなら、気候変動の緩和に向かう最高水準の知的な人材を大幅に減らし、AGIの安全性研究に向かう人材を大幅に増やすべきです。
2. AGIを人間に友好的なものにしようと取り組んでいる人は、何人いるのでしょうか?
FTの記事には、「そう遠くない未来の超知的な機械をどう[プログラム]すれば、AIを友好的なままにしておけるかに取り組んでいる」人は世界でわずか5人だ、と私が述べたと書かれています。確かに、それに似たようなことは言いましたが、補足が必要です。
私が言いたかったのは、「人間より賢いAIが自分自身を根本的に改良しても、よい影響を与え続けることをどう保証するか。この問題に明示的に取り組む技術研究者は、それぞれが費やす労力を合算すると、私の知るかぎり約5人分いる」ということです。
その内訳は、(a) エリエゼル・ユドコウスキー、ベンジャ・ファレンシュタイン、ネイト・ソアレス(以上MIRI)、スチュアート・アームストロング(オックスフォード)が、専任の仕事の大半をこの研究に充てている分と、(b) 本業の傍ら「友好的AI」の技術研究を行う人々が、それよりずっと少ない時間を充てている分です。後者には、たとえばMIRIの無給の研究協力者がいます。
もちろん、(a) AGI安全性の技術以外の側面を研究している人、(b) 既存または近未来のシステムのAI安全性を技術的に研究している人、(c) 「よい影響」や「根本的に自己改良する」の意味を私とは大きく異なるものと考えて、ときどきAGI安全性の技術研究をしている人は、これよりはるかに大勢います。
3. AGIは、人間を必ずしも「単なる」物質の集まりと見るわけではありません。
記事では、私は次のように論じたことになっています。「一つの目的だけに集中する[AGI]は、生物である自らの作り手を、もっと役立つ何かに作り替えられるのを待つ、単なる物質の集まりと見るだろう」。
AGIは、たとえばウィキペディアや何百万本もの科学論文から、現実についてかなり正確で、しかも絶えず改善されるモデルを持つようになるでしょう。ですから、人間を「単なる」物質の集まりと見なす程度は、私と変わりません。確かに、人間は物質の集まりです。ですが、物質の集まりとしては、かなり特別です。ほとんどの物質の集まりとは違って、人間には汎用的な知能、意識、技術的な創造力、欲望、嫌悪、希望、恐れなどがあります。AGIはそのすべてを知っているはずですし、岩や建物、植物、サル、自動運転車には、その性質がすべて備わっているわけではないことも知っているはずです。
私が言いたかったのは、自己改良するAGIが、たとえばシェルの株価を最大化するようにプログラムされていたら、人間についてそうしたことをすべて知ったうえで、それでもひたすらシェルの株価を最大化し続ける、ということです。そして、シェルの株価を最大化する最善の方法は、たまたま、世界を支配して、その目標達成を脅かしうるものをすべて排除することになるのです。実際、AGIが持ちうるほとんどどんな目標関数にとっても、世界を支配するのは非常に得策です。問題はそこにあります。
たとえ自己改良するAGIを「人間の幸福を最大化する」ようにプログラムできたとしても、そのAGIはある意味では「人間を気にかける」でしょうが、たとえば、私たちが指定した意味で「人間の幸福を最大化する」最も効率的な方法は、世界を支配して、一人ひとりを壁にクッションを張った独房に閉じ込め、ヘロインを点滴し続けることだ、と学ぶかもしれません。AGIによって私たちは、願いをあまりにも字義通りに受け取る魔人という昔ながらの問題に直面します。得られるのは、実際に頼んだことであって、欲しかったことではないのです。
そして、そうです。AGIは、これが私たちの本当に望んだことではないと分かるだけの知能を持っているでしょう。とりわけ、私たちがその独房に不満を言い始めれば、なおさらです。しかし、私たちは自分たちの望むことをするようにAGIをプログラムしたのではありません。「人間の幸福を最大化する」ようにプログラムしたのです。
厄介なのは、「私たちが本当に望むこと」をコンピューターのコードで指定するのが、とても難しいことです。2000年ものあいだ哲学者が考えてきても、それほど厳密さを求められない人間の言語ですら、まだ明確に定義できていないのです。
4. 「神々の知性をもてあそぶ」
最後に、記事は「私たちは神々の知性をもてあそんでいる。しかも停止スイッチはない」という私の言葉を引用しています。
ウォーターズ氏が私をこんなに雄弁に見せてくれたことに、文句を言うべきではないのでしょう。でも、こんなに簡潔で引用したくなるようなことを言った覚えは、まずありません。🙂
もちろん、今日のAIには停止スイッチがあります。ですが、プログラムされた目標をより確実に達成するために、自分の停止機構を取り除き、インターネット上に自身を複製できるほど賢いAGIには、おそらく停止スイッチはなくなります。ただし、私たちが「修正可能性(corrigibility)」と呼ぶ技術的問題を解決できれば、話は別です。