AIをめぐる状況が、なぜ私には致命的なほど危険に見えるのかを説明するため、私は『AGIによる破滅:致死要因の一覧』を引用してきた。しかし、あの記事は比較的長く、「基本」より、未解決の具体的な技術問題を重視している。
私がこれほど心配する理由の「基本」を説明するなら、次の10点に焦点を当てる。 [1]
1. 汎用知能は非常に強力である。そして、それをひとたび構築できるようになれば、STEM分野を扱える汎用人工知能(artificial general intelligence, AGI)は、直ちに(または非常に短期間で)人間の知能をはるかに凌駕する可能性が高い。
私が「汎用知能」と言うとき、たいてい考えているのは、「人間の脳は、天体物理学や圏論などの問題を解くよう、文字どおり一切の選択圧を受けずに進化したにもかかわらず、何によって天体物理学や圏論などを扱えるのか」ということである。
定義によっては、すでにGPT-4を「AGI」と考えるべき可能性もある。そこで、私が念頭に置く汎用性の閾値を明確にするため、ここでは特に「STEM水準のAGI」について述べる。ただし、そのようなシステムはSTEM以外の課題にも優れると予想している。
人間の脳は完全に汎用ではなく、特化型AIシステムや動物のすべてが同じ程度に特化しているわけでもない。(たとえばAlphaZeroはAlphaGoより汎用的である。) それでも、人間が、脳をそうした科学のどれかに適したものへする進化上の微調整を一切受けずに、これらすべての科学を一度に可能にする認知能力を進化させたことは、実に興味深い。進化は単に、ほかの問題への解決策へ偶然行き当たり、それが、途方もなく新しい何百万もの課題へ、たまたま汎化したのである。
もっと具体的に言えば、次のとおりである。
- AlphaGoは非常に優れた推論器だが、その仮説空間は、物理的宇宙の状態の列ではなく、囲碁盤の状態の列に限られている。物理的宇宙について効率よく推論するには、少なくとも一部、AlphaGoが解くものとは種類の異なる問題を解く必要がある。
- そうした問題は、STEM分野のAGIのプログラマーが解くかもしれず、プログラム空間からAGIを見つけるアルゴリズムが解くかもしれず、その両方かもしれない。また、その種の問題の一部は、AGI自身が思考を洗練する過程で解くかもしれない。 [2]
- 人間が、STEM水準のAGIを構築して初めて自動化できると私が予想する能力の例(仮に自動化できるとして)には、次のものがある。
- 標準化されていない雑然とした通常の手術環境で、高い成功率で心臓切開手術を行う能力。
- ある難しい科学分野で人間が行う科学的作業のすべてにわたり、その分野で賢い人間に匹敵する能力。
- 原理上は、あらゆる難しい科学について人間並みに推論するための基本的な心的機構を持たずに、そうした課題を得意とする特化型システムを構築できるのではないかと思う。実際には、そうした課題を行える特化型推論器の構築方法を解明するより先に、人間は、その課題を行える汎用推論器の構築方法を見つける可能性が極めて高いと予想している。(進化が、人類の技術発展史の非常に早い段階で、汎用知能へ偶然行き当たったのと同じ基本的な理由による。) [3]
私が「汎用知能は非常に強力だ」と言うとき、その意味の大部分は、科学が非常に強力であり、すべての科学を同時に持つことは、各科学の影響を単に足し合わせたものよりはるかに強力だ、ということである。 [4]
その意味のもう一つの大きな部分は、STEM水準の汎用知能が、自動化すれば非常に大きな影響を持つ種類のものだということである。STEM水準のAGIは、直ちに、または発明されてからごく短期間で、人間の知能を圧倒する可能性が高いからだ。
80,000 Hoursは、AlphaGoとその後継が人類と比べてどうだったかについて、(代表例ではない)次の例を示している。
1年のうちに、AIは、最も弱い人間のプロ棋士を相手に一局も勝てないほど弱い状態から、世界最高の棋士でさえAIを打ち負かせない状態まで進歩した。
汎用の科学AIは、同様の形で人間の科学能力を圧倒すると予想している。
理由には、次のものがある。
- 経験的に、人間は認知能力の上限近くにはおらず、特化型AIでさえ、設計対象となった課題では、人間の推論能力の範囲を突然大きく越えることが多い。科学的推論だけが例外なら、奇妙である。
- 経験的に、人間の脳は認知バイアスと非効率性に満ちている。科学的推論が、目に見えて、無数の死角、非効率性、動機づけられた認知過程を伴う混乱状態にあり、科学者や数学者が技術的には単純な進歩を遂げるまで何十年もかかった歴史上の例が無数にあるにもかかわらず、そこだけが例外なら、二重に奇妙である。
- 経験的に、人間の脳は、STEMの根底にある、最も基本的な認知過程の一部を極めて不得意としている。
- たとえば、人間の作業記憶と、基本的な暗算をする能力にある、著しい限界を考えてほしい。私たちは頭のなかで、比較的小さな複数桁の数どうしを掛け合わせることさえ、かろうじてしかできない。原理上、推論器は、何千もの複雑な数学的構造を作業記憶に同時に保持し、それらへ複雑な演算を行えるはずである。何百、何千もの異なる形式的構造間のつながりを、(自分の頭のなかで、リアルタイムに)直接見られる推論器にしか思いつけないかもしれない技術と科学的洞察を、考えてほしい。
- 人間の脳は、祖先がいた環境で、「視野内にある4個の物体と5個の物体を見分けられる」のような形質を超えて、STEM能力へ向けた直接の最適化を一切受けなかった。 [5]
- 対照的に、人間の技術者は、数学や工学などの能力に向け、AGIシステムの脳を意図的に最適化できる。そして人間の技術者には、進化にはなかった、汎用知能を構築するための非常に多様な道具がある。 [6]
- ソフトウェアは、(人間の知能と違い)計算資源(コンピュート)を増やすことで規模を拡大できる。
- 現在の機械学習(ML)は、推論器を実行するより、推論器を見つけるためにはるかに多くの計算資源を使う。これはAGIにも成り立つ可能性が非常に高い。
- AGIシステムを少しでも効率的に訓練する方法が分かれば、おそらく計算資源はすでに十分すぎるほどある。
そして、より高い視点から言えば、STEM分野のAGIが人間を急速に上回り得る、という仮説には選言的な性格がある。STEM分野のAGIにほかの優位が当初まったくなくても、単独でこれを可能にするさまざまな優位が多数ある。(たとえば、速度、数学能力、ハードウェアによる規模拡大、ハードウェア最適化の技能などである。)
対照的に、STEM分野のAGIが「人間並みの科学能力」という狭い標的に当たり、かつ、人類が適応・調整できるほど長く、その水準付近にとどまるという主張には、連言的な性格がある。 [7]
2. よくある誤解は、STEM水準のAGIは、「エージェント」または自己認識についての何か不明瞭な事情のため、危険だというものである。むしろ、私なら、世界を何らかの、到達するのが十分に難しい状態へ押し進める行動列の性質そのものに、危険が内在すると言う。 [8]
そのような列を「計画」と呼ぼう。
書き表せるあらゆる計画の空間から、(現存する任意の形式言語で、長さに応じて重みづけし)無作為に計画を一つ抽出したとする。そしてその計画について分かっているのは、実行すれば、「高速で動く全脳エミュレーションを発明する」のような、人間を超えて野心的な技術目標を、首尾よく達成するということだけだとする。その場合、ボタンを押して計画を実行すれば、非常に高い確率で全人類が死亡する。理由は次のとおりである。
- 「高速な全脳エミュレーション(WBE)を発明する」は、達成するには通常、大量の知識と認知的・技術的能力を獲得する必要があるほど難しい課題であり、その能力は、ほかにも多数の危険なことを行うのに十分である。
- その計画が、できる限り多くの資源を集め、支配し、潜在的な脅威を排除するなどの手順も含むなら、「高速なWBEを発明する」ことに成功する可能性は高くなる。これらは「収束的な道具的戦略」である。すなわち、世界をどの方向へ押し進める場合にも、ほぼ関係なく役立つ戦略である。
- 人間の身体と、人間が生きるために必要な食物、水、空気、日光などは、資源である(「あなたは、AIがほかのことへ使える原子からできている」)。また、人間は潜在的な脅威でもある(たとえば、まったく違う計画を実行する、競合する超知能AIを構築し得る)。
危険は、何らかの複雑な、または創発的な「エージェント」の特徴ではなく、認知的作業にある。課題そのものにあるのである。
計画という抽象的空間が、人間を憎む邪悪な精神によって構築されたという話ではない。その計画自体に、道具的収束(instrumental convergence)のテーゼが成り立つのである。完全に一般的に言えば、「WBEを構築する」のような目標を達成する計画は、危険になりやすい。
私たちの世界を、ある特定の(到達するのが十分に難しい)物理状態へ、首尾よく押し進める計画すべてに、これが成り立つわけではない。しかし、その圧倒的多数には成り立つ。
これは直感に反する。今日、私たちが出会う印象的な「計画」の大半は、人間が生み出したものであり、強力な計画を人間というレンズを通して見たくなるからである。しかし、人間の価値観、思考様式、能力は大幅に重なっている。AIは新たな分布から引き出される。
3. 現在のML研究は、重要な点で、「人間のフォン・ノイマン(von Neumann)たちから成る文明が生み出す種類の計画」より「無作為に抽出した計画」に近いものを生み出す軌道上にある。(後者の種類のものを生み出せる段階へ少しでも近づくより前に。) [9]
私たちは、友好的な、人間におおよそ似たものをシリコン上に構築する、という意味で「AI」を構築しているのではない。強力で汎用の探索過程(そして、探索過程を探す探索過程)を構築する、という意味で「AI」を構築している。
(「人間のフォン・ノイマンたちから成る文明より、無作為に抽出した計画に近いシステムを、私たちは構築する」ということは、得られる計画が望んだものだという意味ではない! 二つの別個の問題がある。現在のMLは、「私たちが望んだ課題を、内部で実際に最適化するもの」ではなく、「私たちが望んだ課題を最適化しているかのように振る舞うもの」を見つける。また、表面上望ましく見える目的の大半を内部でおおよそ最大化すると、人類が死亡する。)
人間を模倣するよう訓練したシステムにも、「全脳エミュレーションを構築する」のようなことができるまで規模を拡大するなら、同じ問題が成り立つ。「人間に関係する何かで訓練している」からといって、「人間にノイズを加えたもの、と考えるのが最も適切なものを訓練している」ことにはならない。
GPTに似たシステムが、「WBEを構築する」のような能力まで規模を拡大できるかは、私には明らかでない。しかし、できるなら、首尾よく人間を模倣する方法の大半は、「(何らかの方法で、人間を超えてインターネットの模倣に優れた)人間を構築する」ようなものではない、という問題に直面する。それは、「模倣課題(そして潜在的には、ほかの多数の課題)に優れた、比較的複雑で異質な最適化過程を構築する」ようなものなのである。
人間をモデル化するために人間である必要は、雲をうまくモデル化するために雲である必要がないのと同じである。「気象パターンを予測する」場合より、「人間を予測する」場合のほうが、これが分かりにくい唯一の理由は、人間とAIシステムのどちらも知能だからである。そのため、「AIが人間をモデル化する」から、「AIは基本的に人間である」へ、容易に滑り移ってしまう。
4. 人間と、「人間に少しノイズを加えたものより、無作為な探索過程として近似するほうが容易なもの」の主要な違いは、人間の脳内にある、多数の複雑な機構にある。
(切り離されたレバーの誤謬、親切さは不自然である、驚くべき未来には超知能AIが必要だが、まったく十分ではないを参照。)
人間は、関係する意味で白紙状態ではないので、単に人間のようにAIを育てても、問題は解決しない。
これは、問題が解決不能だという意味ではない。しかし、AI内に、その内部機構をかなり詳しく再現するか、人間が安全である特定の理由とは別の理由で安全な、何らかの新しい種類の機構を構築する必要がある、という意味ではある。
(世界を救う課題を少なくとも一つ達成できるほど強力でありながら、より大きな計画空間よりはるかに危険性を下げる形で制約された、はるかに狭い計画空間から、何らかの方法で抽出する認知的機構が必要になる。そして、WBEへ取り組み始める前に置かれていた、狭く代表性のない環境で、そのような機構を備えているかのように表面的に振る舞うよう最適化されただけのものではなく、内部にその種の機構を実際に実装するものが必要になる。「新しい科学的研究」とは、AIから求めるもののほぼすべてが、分布外にあるということである。)
5. STEM水準のAGIが登場するまでの期間は、それほど長くは見えない。(たとえば、おそらく50年や150年ではない。5年や15年であっても、十分あり得る。)
この命題を論証しようとはしない。AI分野の近年の進歩を示し、2021年初めのネイト・ソアレス(Nate Soares)のコメントを繰り返すにとどめる。
[…] 私が観察するところ、15年前には誰もが、AGIにはほど遠いと言っていた。その理由は、基本的な画像認識、囲碁、StarCraft、ウィノグラード・スキーマ、簡単なプログラミング課題など、AIにできないことだった。しかし、その基本的にすべてが崩れた。私たちとAGIの隔たりは、おもに形のないものからできている。(本当に優れたコンピュータープログラミング? 定理証明? 確かに。しかし私のモデルでは、それらの「優れた」版は、すでに完全なAGIから紙一重である。そして、「劣った」版は数に入らないと明確にする必要がある、という事実が、今、人々が名指しできる障壁は形のないものだけだ、という私の論点を裏づけている。) これは非常に居心地の悪い場所だ!
[…] 私は、AGIの時期について、おおよそ「最後から二番目の認識状態」にいるのではないかと思う。瀬戸際にいるように見えるプロジェクトは知らない。それを知れば、AGIが目前に迫っていると考える「最後の認識状態」に入る。しかし私は、ある集団が瀬戸際へ達したと知っても、それほど衝撃を受けない、最後から二番目の認識状態にいる。そうした連絡を受けるのは10年後かもしれない! 20年後かもしれない! しかし2年後かもしれず、それでも現実へ憤慨する資格はない。「しかし、それを観察する前に、次のすべてのことが、まず起きるべきだった!」とは言えない。それらのことは起きた。私はそれを観察した。[…]
技術の登場時期を予測することは、非常に難しいと思う(そして、その技術がかなり目前に迫っていない限り、ほぼ不可能である可能性も十分ある)。また、合理的な人々が、登場時期について大きく意見を異にし得ると思う。
登場時期について見解を一致させることは、あまり決定的でもないと思う。仮にAGIが50年先でも、それはなお、私たちが直面する単一のリスクとして最大だと考える。そして、その移行を生き延びるため最低限必要なアライメントの取り組みだけでも、それより容易に長くかかり得る。
また、「STEM分野のAGIはいつか?」という議論では、人々が、STEM分野のAGIへどう到達するかについての予測を、詳しく突き合わせる必要がある。道筋についての人々のモデルを改善すると、登場までの期間をさらに短くし得る限り、これは公に議論するのが望ましくない事柄である。
それでも登場時期へ言及するのは、実際、それが私たちの見通しを悲観する主要な理由だからである。AGIが200年先だと明日知ったなら、物事がうまくいくことを、私は完全に楽観するだろう。
6. 私たちは現在、アライメントを実現する方法を知らない。10年前より、はるかに優れた考えを持つようになった様子はなく、目に見える、重大で新しい困難が多数ある。(『AGIによる破滅』および『能力の汎化と急激な左折』を参照。)
より基本的な水準では、ネイト・ソアレスの言葉を引用すると、「AIアライメントはかなり難しそうだと、なぜ私は思うのか? 主な理由は、実際にこうした問題へ取り組んだ私の経験が、単にそうだったからだ。」
7. 私たちは、安全性が決定的に重要な複雑なソフトウェアで、確実に良好な振る舞いを実現すること、特にそのソフトウェアが新しい場合について、悲観的な事前分布から始めるべきである。堅牢にする必要があるものが、文書化されていないスパゲッティコードのような構造なら、なおさらである。そして、その分野の競争が激しく、断崖へ向かって競う、安全性をあまり意識しない多数の人々より速く進みながら、何らかの堅牢性を実現しなければならないなら、さらにそうである。
既定の前提は、複雑なソフトウェアは、予想しなかった何十もの異なる形で問題を起こす、というものである。モデルがなかった、または曖昧だった多数の箇所で、現実は厄介で不都合なものになる。驚きは大量にあり、一部はよい驚きにもなり得る。しかし経験上、ソフトウェア開発地獄での不快な驚きより、よい驚きのほうがはるかにまれである。
未来の予測は難しい。しかし計画は、人間が素朴に予想するより、体系的に長くかかり、より多くの障害へぶつかる。計画が体系的に驚くほど順調に進み、期限より体系的に早く完了するのではない。
コンピューターセキュリティーと、安全性が決定的に重要なソフトウェアシステムの歴史では、ほぼ例外なく、堅牢なソフトウェアが、同じソフトウェアの堅牢でない版より、はるか、はるかに遅れてきた。現実世界の、あらゆる雑然さと敵対的最適化のなかへ配備される、複雑なソフトウェアに何らかの堅牢性を実現することは、非常に難しく、通常は失敗する。
多くの意味で、AGIリスクの基礎的な議論は、『セキュリティ思考と普通の偏執』と『セキュリティ思考とロジスティック成功曲線』だと思う。しかも本文の主要部分は、AGIに言及すらしない。AGIと人間より賢いAIの具体的事情を加えると、リスクは「深刻」から「圧倒的に見える」ものへ変わる。しかし、このソフトウェアを正しく作ることが私たちの未来にとって重要だと考えるなら、大いに心配するために、その具体的事情を加える必要はない。
8. 2023年4月現在、MLも、より広い世界も、このことを真剣に受け止めていない。
これは明らかに、私たちが変えられることである。しかし、変わるまでは、物事は引き続き極めて悪く見える。
さらに、AIリスクをある程度真剣に受け止める人々の大半は、重要な意味で、実験によって危険だと証明された後でなければ、それを心配しようとしない。人間より賢いAIを扱うときに採用すれば、致命的となる種類の方法論である。
世界が現在、適切に対応していない理由について、私が持つ基本的な像は、『MLで存亡リスクに関する意見が分かれる背後にある、四つの考え方の不一致』、『MLで、AGIについての優れた会話が並外れて遅く広がること』、そして『不十分な均衡』にある。 [10]
9. 上で述べたように、現在のMLは非常に不透明であり、私たちが望ましい特徴を直接設計できるのではなく、介入できるのは、望むものを表す行動上の代理指標(プロキシ)が主である。
現在のMLはまた、データを容易に入手でき、安全に与えられることを必要とする。たとえば、私たちはAGIを「人を殺すな」という点で堅牢に訓練できない。人を実際に殺す例を与え、望まない振る舞いが起きないよう訓練することはできないからである。与えられるのは、欠陥ある代理指標だけであり、間接的に取り組むほかない。
10. 人間より賢い最適化を安全に配備できる種類の文明なら、実現できてしかるべきに見える具体的な能力が多数ある。しかし、それらは手が届く範囲からはるか遠く、何らかの比較的具体的な研究方向へ取り組む時間が無限にあったとしても、不透明な深層ネットワークで実現するための、明らかな前進経路はない。
(「解決策を見つけるまで、長い間、単に問題を考え続ける」のように、より抽象的・間接的な研究方向を設定できれば、無限の時間で十分である。おそらく前進経路はある。ただ、今日の私たちは、それが何か知らず、そのため状況はさらに悪い。)
たとえば、ナノテクノロジーを開発するAIシステムの脳を検査し、そのAIが特定の部屋だけを考えていること、意図した目標を内部で表現していること、その表現へ最適化を向けていること、内部に特定の計画期間とさまざまな能力上限があること、最適化者(または特に人間)を考えられないこと、あるいは、別の形で、適切な話題だけを内部でホワイトリストまたはブラックリストに入れていることを、検証する方法が分からない。
個別に見れば、こうした困難はそれぞれ対処できるように思える。しかし組み合わさると、私たちは非常に暗い状況に置かれるように思える。
上記のような点に対して、よく聞く返答の一つは、次のものである。
未来は一般に予測するのが難しいので、物事がうまくいく、または悪くなると合理的に確信することは、単に不可能である。何十もの異なる議論と枠組みを検討し、精査に耐えたものが、ほぼすべて同じ方向を指しているように見えても、多くの箇所で一度に、相関した形の失敗を引き起こす、目に見えない推論上の誤りを犯している可能性は、常にある。
未来は予測するのが難しい、という点には同意するので、これには共感する。
物事が悪くなると、完全に確信しているわけではない。確信しているなら、問題を解こうとはしていない! 状況は極めて深刻に見えるが、絶望的ではないと思う。
とはいえ、AIによる破局が実際に起きる前に、「極めて深刻」と信じる状態へ至ることさえ不可能だ、と考える人もいる。この点には、二つの基本的な理由から同意しない。
a. 詳細には多数立ち入れるが、核心的な水準では、このリスクは特に複雑でも、推論するのが難しくもないと思う。核心的な懸念は、一つのツイートに収まる。
STEM分野のAIは、人間のSTEM能力をはるかに上回り、決定的な優位をもたらす可能性が高い。私たちは、STEM分野のAIを意図した目標へ向ける方法を知る軌道上にない。そして、意図しない目標を追求するSTEM分野のAIは、「すべての資源を支配する」のような道具的下位目標を持ちやすい。
ズヴィ・モウショウィッツ(Zvi Mowshowitz)は、核心的な懸念を、さらに基本的な言葉で表している。
また私は、ほとんどのシナリオで物事はうまくいき、破滅は特定の「遠い可能性」に依存する、という一種の推定があることにも気づく。その可能性は、多数の論理的依存関係を持つ、または多数の事柄が個別に予測どおり進むことを必要とする場合が多い。私は、その可能性はそれほど遠くも、起こりにくくもないと言うだろう。しかし、より重要なのは、帰結が頑健だということである。重要な知能と最適化圧が、もはや人間のものでなくなれば、帰結の大半は、私の価値観から見て存亡に関わる悪いものとなる。そして、詳細な前提の多く、または大半を退けたり無視したりしても、なおこれを理解できる。
正確なリスク水準を評価するには詳細も重要である。しかしこれは、核心的な困難と、私たちがそれを処理できているかについて、どの人間も十分に理解することが根本的に不可能と思える種類の話題ではない。
b. 関連して、ネイト・ソアレスが論じたように、AI災害のシナリオは選言的である。よい帰結一つに対して、多数の悪い帰結があり、ユートピアへ至る道一つに対して、災害へ至る道が多数ある。
エリエザー・ユドコウスキー(Eliezer Yudkowsky)の言葉を引用する。
「当たるか外れるかだから」、宝くじに勝つ確率が50対50だという事前分布を採ることはできない。問われるのは、私たちが不確かかどうかではなく、誰かが自分の不確かさから乳を搾り、よい帰結を予想することが許されるのかどうかである。
ジャック・ラバック(Jack Rabuck)の言葉を引用する。
@ESYudkowskyへのLunar Societyによる4時間のインタビューを、すべて聞いた。
(司会は@dwarkesh_sp。) その大半はAIアライメントについてだった。そして私は、この分野でかなり一般的だが、詳しく明らかにされることがめったにない、混乱/不一致の一点を特定したと思う。ドワーケシュ(Dwarkesh)は、AIが人類を殺す可能性が高いという結論を、「突飛」だと繰り返し呼んだ。
私には、「突飛」という言葉が、「悪い」と「複雑」という二つの概念を一つに詰め込んでいるように思える。ここで複雑と言うとき、フェルミ方程式(Fermi equation)のような意味である。終点(人類の死)が、鎖をなす一連のつながりへ依存し、そのどれか一つでも断ち切れば、終端状態は起きない。
私には、エリエザーはこの終端状態を突飛だとは考えておらず(少なくとも、複雑という意味では)、非常に単純だと考えているように思える。彼は、多数の(大半の)道筋が、この終端状態へ収束すると考えている。
そのため、一種の誤解が生じる。ドワーケシュは、エリエザーが終点を予測するために使う推論の筋道にもとづき、何らかの予測を示すようエリエザーへ迫る。しかし、終点は非常に単純で、一つの収束先なので、その終点へ推論できるからといって、この宇宙でその終点へ至るために採られる具体的な道筋を予測する力は得られない、とエリエザーが言うのは正しい。
ドワーケシュは、人類の終わりを、多数のつながりを持ち、そのどれかが断ち切られれば人間は存続する因果の鎖と考えている。一方、エリエザーは、AGIを前にした人類の存続を、多数のつながりを持ち、そのどれかが断ち切られれば人類が終わる因果の鎖と考えている。あるいは、もっと離散的に言えば、AIを前に人類が存続するため行い得る、非常に難しいことが少数あり、その一つが起きなければ、終わりは「起きるか」ではなく「いつ起きるか」の問題であり、その「いつ」は、ほかの大半の人が考えるより、はるかに近いとエリエザーは考えている。
ともかく、ドワーケシュとエリエザーはそれぞれ、相手が「並外れた主張には並外れた証拠が必要だ」とする側へ当てはまる、と考えているのだと思う。ドワーケシュは人類の終わりを「突飛」だと考え、エリエザーはAGIを前に人類が存続可能であることを「突飛」だと考えている(もっとも、後者は悪いという意味ではない)。
「AGIによる破滅は選言的だ」という点だけで、高いp(doom)(破滅確率)が決定的に立証されるとは考えない。NASAは、成功するには多数の事柄が同時にうまくいく必要があるにもかかわらず、ロケット打ち上げの成功率が高い。人類には、ある程度、連言的な帰結を実現する能力がある。しかし十分な証拠がその方向を指すときに、高いp(doom)へ合理的に到達することが、そもそもなぜ可能なのかは、この枠組みによって、より明瞭になると思う。 [11]
エリエザー・ユドコウスキーの『ここまでのところ:非友好的AI編』と、ネイト・ソアレスの『人間より賢い知能がよい帰結をもたらすようにする』も、私が「基本」と考えるものへの、(古いとはいえ)優れた入門である。
明白な点を述べると、本稿は、AIが存亡に関わる破局を引き起こすと私が考える確率を高める、さまざまな主張から成る。しかし、AIがそのような破局を引き起こす確率を高くするために、すべての主張が真実である必要はない。
また本稿は、ほかの人々にとって最大限説得力があり、理解しやすい主張を提示しようとしてではなく、私自身が心配する主要な理由を要約するために書いた。そのような短い概観だけにもとづき、ほかの人も同じように確信するとは予想しない。ただし、過去にAIリスクについてほかの情報源を読んでいる場合は別かもしれない。(より楽観的なものも含む。一つの不一致について一方の側からしか聞いていない場合、確信を持つのは難しいからである。私は以前、自分に小さな希望の光を与えるものの一部について書いたが、全体としてはるかに希望を持つ人々には、非常に異なるヒューリスティックと背景モデルにもとづく、非常に異なる希望の理由があるだろう。) ↩
たとえば、囲碁盤の状態と違い、物理世界は、完全に詳細なシミュレーションができないほど複雑である。有効な汎用知能は、非常に多くの異なる粒度で世界をモデル化し、どの水準について考えることが適切かを戦略的に選べなければならない。また、それらの水準で、世界のどの具体的部分/側面/性質を考えることが適切かも、戦略的に選べなければならない。
より一般には、汎用知能であるためには、どの思考を行い、どの思考を行わないかについて、非常に強く焦点を絞り、戦略的である必要がある。計算資源の大部分を、答えようとする問い、または解こうとする問題と関係する、物理世界についてのまさにごく一部の問いへ、容赦なく注ぎ込まなければならない。自分に最も有用なものへ認知を「向ける」ときに、容赦なく的を絞り、効率的でなければ、細部に気を取られ、誤った考慮事項へ注意を向けるなどして、生涯を容易に浪費し得る。
そして物理世界をうまく移動し、科学を行うなどのために解く必要がある問題には、さまざまな種類がある。そのため、計算資源を、まさに適切なものへ注ぎ込むために使うヒューリスティック自体も、すべてが事例固有なのではなく、非常に汎用的である必要がある。
(一方、AlphaGoが、ゲーム状態の誤った側面を考えないようにするため(または別の形で脇道へそれないため)使うヒューリスティックの多くは、囲碁に固有のヒューリスティックであると、より容易に想像できる。) ↩
- もちろん、ほかの科学を行うために必要な基本的な心的機構をすべて脳が持っていても、実際にそれらの科学で優れた成果を出すために必要な知識を持つことにはならない。STEM水準の汎用人工知能も、多くの賢い人間が物理問題を解けないのと同じ理由で、物理学の能力を欠く場合がある。 ↩
- たとえば、異なる科学が相乗効果を生み得るからであり、新しい科学分野や下位分野を発明できるからであり、より一般には、一つの新しい洞察から、その最初の洞察へ決定的に依存する、何十もの新たな洞察を連鎖的に生み出せるからである。 ↩
- より一般に、進化の時間尺度では、科学(そして書き言葉のような、人間生活のほかの多数の側面)は非常に新しい展開である。そのため進化には、重要な多数の面で、私たちの推論能力を洗練・改善する時間がほとんどなかった。 ↩
- 「人間の技術者には、進化にはなかった、非常に多様な道具がある」という点は、進化が人間を自身の「目標」へアライメントすることに失敗したとしても、私たちはAGIを自分たちの目標へアライメントできるかもしれない、と考える理由として、よく指摘される。それに加えて、技術者が優れた認知能力を実現しようとするなら、AGIがより高い認知能力を持つと予想する理由でもある。 ↩
- そして私の理解では、たとえばポール・クリスティアーノ(Paul Christiano)の緩やかなテイクオフのシナリオでは、人間並みの科学能力と超知能の間に、長い時間があることを想定していない。むしろ彼は、GPT-4と、人間並みのSTEM分野のAGIの間に、数十年あることへ賭けている。 ↩
- 物理的な動きだけでなく、思考と文章の出力も「行動」に分類する。 ↩
- 明らかに、どちらも、MLシステムの特に優れた近似ではない。要点は、実生活の計画について私たちが楽観するのは、一般に、その計画が弱いためであり、または、その計画生成器が、人間に普遍的な心理的性質を一通りすべて備えた人間の脳だからであり、その両方の場合もある、ということだ。MLシステムは、人間に普遍的なそうした性質を持たず、無期限に弱いままでもない。 ↩
『MLで存亡リスクに関する意見が分かれる背後にある、四つの考え方の不一致』から引用する。
- 人々は、リスクが奇妙で抽象的に感じられるため、真剣に受け止めていない。
- リスクについて考えるときは、なじみがあり、分かっているものを基準とし、予測という観点から「保守的でない」と感じるため、ほかの考慮事項を退ける。
- 一方、社会的模倣と傍観者効果により、その分野は、新しい議論と扉の下から立ち上る煙に応じて方向転換するのが遅くなる。
『MLで、AGIについての優れた会話が並外れて遅く広がること』から引用する。
AGIについての情報は、その分野であまりに遅く伝播する。ML関係者が一人、見方を更新しても、通常は、その更新を同僚全員へ大声で共有しないからである。理由は次のとおりである。
1. AGIは奇妙に聞こえ、その人は、奇妙な部外者のように聞こえたくない。
2. その人の同僚と、コミュニティ全体は、この情報を、その分野への攻撃や、地位を下げようとする試みなどと受け取るかもしれない。
3. 技術予測、差異的技術発展、長期的な方向づけ、探索的工学、「長期的な社会的影響を理由に、特定の研究を行わないこと」、社会に資する研究停止などは、大半の科学者にとって非常に新しく、なじみがない。
効果的利他主義者(EA)が、アシロマのような先例を懸命に掘り起こそうとするのは、一部には、科学の圧倒的大多数の規範と慣行に比べ、アシロマがそれほど珍しいからである。科学者は一般に、まったくこのような観点では考えない。自分の分野が引き起こす大災害が起きる前なら、なおさらである。
そして、そのどれかを直感的だと感じる科学者も、それについて話すとき、多くの場合、漠然と不安で、孤独で、漂流しているように感じる。直感的な水準で、自分たちには制度的な居場所がなく、「これは高潔で立派な科学のやり方だ」という、極めて広く共有された物語もないと分かっている。
通常の科学はベイズ的でも、エージェント的でもなく、「筋の通る議論を聞いたからというだけで、任意のことを行うべき場所」でもない。通常の科学とは、台本、慣習、確立した手順から成る、特定の集合である。
それが奇妙な話題(AGI)についてであり、指示された対応も奇妙(研究停止、差異的技術発展など)であり、それを支持する議論も奇妙(実験データはどこにある??)であるにもかかわらず、その分野を「単に筋の通ることを行う」方向へ動かそうとすると、私たちは本質的に、流れに逆らって上流へ進まなければならない。
成功は可能だが、はるか、はるかに多くの火力(dakka)が必要である。そして私見では、これまであまり成功できなかった理由を理解するのは容易だ。
これはまた、私が「AGIに関係する考えについて、全員で思い切って率直かつ忌憚なく話そう」という戦略を、ますます支持するようになった理由の一部でもある。
私たちが直面する核心的な問題は、「情報を得たうえで意見が分かれている」「価値観の対立がある」「議論を書き上げていない」「誰も議論を見ていない」ではなく、「自己欺瞞」や「自己奉仕バイアス」でさえない。
私たちが直面する核心的な問題は、「自分の私的な考えがオーバートン・ウィンドウ(公に許容される意見の範囲)内にあるかを人々が不安に思うため、十分な情報が、十分な速さで伝わっていない」ことである。
より基本的な水準では、『不十分な均衡』は、世界の文明が平常時に示す能力について、一つの像を描く。その像を踏まえると、科学制度と政治制度が対処するように設計されていなかった新しい問題で、私たちがこれほどひどく失敗し得る理由は、それほど謎でなくなると思う。『不十分な均衡』はまた、謙虚な認識論(Modest Epistemology)の具体的な仕組みも扱う。それは失敗の物語の主要部分だと私は考えている。 ↩
アリエ・イングランダー(Aryeh Englander)とエリエザー・ユドコウスキーが最近交わした会話を引用する。
Aryeh: […] それでも私は、そのように確信度の高い予測へつながる議論を理解することに、非常に苦労している。つまり、AIの存亡リスクについての主な議論は理解していると思う。しかし、なぜ一部の人々が、そのリスクをそれほど確信しているように見えるのかが、本当に分からない。[…]
Eliezer: 核心は、この場合、不確かさから乳を搾り、よい帰結の可能性を得ることはできない、という感覚だと思う。よい帰結へ至るには、当たりの宝くじを買おうとするときや、月ロケットを打ち上げるときのように、どこへ向かって操縦しているかを実際に知らなければならない。不確かさによって、推定値が「50対50、末永く幸せに暮らせるか、そうでないかのどちらか」へ戻るわけではないと気づけば、「EAフォーラムの人々は、エリエザーとポールのどちらが正しいか判別できない」ということは、よい帰結と悪い帰結の比率を1対1へ動かす要因ではなく、破滅のもう一つの兆候だと分かる。生き延びる世界は、そのように混乱して見えず、もっと速く進歩できる。
それ以上、見方を更新できない、完全に妥当な議論としてではなく、直感を促すものとして言う。未来についてのあらゆる議論が誤り得るように見えるほど、未来の太陽系は、自分の視点から見て無作為な構成になると、より強く予想すべきだ。そうした構成のうち、人間を含むものはほぼゼロである。それ以上の見込みを得るには、未来を制約する何らかの議論についての確信が必要となる。
Aryeh: ここで不確かさと言うとき、自分の基本的な世界モデル内の不確かな要因を意味していますか。それとも、モデル不確実性も数えていますか? あなたの世界モデル内では、不確かさの源が増えても、より低いリスク推定を指し示さない理由は分かります。しかし私の一般的な問いは、モデル不確実性のほうについてだと思います。世界モデル、参照クラス、このことを考える枠組みが、たとえばロビン(Robin)、ポール、ローヒン(Rohin)、そのほか多数のものと比べ、正しいものだと、どれほど確信できるのでしょう? そしてモデル不確実性という点では、そうしたほかのアプローチの大半が、はるかに低いリスク推定を含意するように見えます。そのため、その種のモデル不確実性を加えれば、おそらく(私の考えでは)全体的なリスク推定は低くなるはずです。
Eliezer: 自分のロケット設計は爆発するという具体的な理論があり、しかもロケットが実際にはどう動くかについて、非常に不確かでもあるなら、そのロケットが目標へ安全に着陸する確率を、どれほどだと評価すべきだろうか?
Aryeh: 自分のしていることを、月を目指すが爆発するロケットと比べるべきだ、という具体的な理論があり、爆発しないというほかの理論が多数あり、さらに、そもそも自分のしていることをロケットと比べるべきではないという理論も多数ある場合は、どうですか? 多くのアライメント案についての私の理解では、提案者は、狙いを定められるほどには「ロケット」を理解していると考えています。しかし、爆発についてあなたがこれほど強く確信するに至った、さまざまな具体的な点について、あなたと意見を異にしています。そしてロビン・ハンソン(Robin Hanson)のように、おもに外部視点型の議論を使い、あなたは問題を誤って枠づけており、そもそも「ロケット」と比べるべきでない、それは使用する参照クラスが誤っているからだ、と論じる人もいます。ですから、確かに、一部の種類のモデル不確実性を考慮しても、リスク評価は下がらず、さらに上がりさえするかもしれません。しかし、少なくとも私が理解する限り、実際にある代替モデル/枠組みの多くを含む、ほかの種類のモデル不確実性は、おそらくリスク評価を下げるはずです。
Eliezer: 人々が初めて飛行機械を作ろうとしていて、簡単に飛ぶはずだとする、激しく異なる理論を持つ人々が大勢いて、あなたは、安定飛行への基本的な障害を、彼らが理解していないと考えている場合はどうだろう? それぞれに正しい可能性がいくらかある、異なる理論を持つ楽観論者を、ますます大勢集めることで、あらゆる障害にもかかわらず、その機械を無理やり飛ばせるだろうか?
Aryeh: そうです。私の論点は、飛ばないことをほぼ確実だとするには、自分のモデルが正しく、彼らのものが正しくないと、とても、とても強く確信する必要があるということです。言い換えれば、モデル不確実性が非常に低くなければなりません。しかし、ほかの楽観論者のモデルが正しいかもしれないと考えるモデル不確実性を加えれば、リスク推定は下がります。当然、無作為な人々の、無作為な楽観的モデルを恣意的に追加することはできません。何らかの方法で重みづけする必要があります。ここで私が困惑するのは、あなたが、構成要素、下位の議論、使う特定の参照クラスをすべて含め、自分のモデルこそ正しいものだと、とても、とても強く確信しているように見えるのに、その理由が、まったくよく分からないことです。
Eliezer: 「自分のモデルが正しいと確信すること」と、人々がそれぞれ自分のモデルを携えて歩み寄り、別の誰かが「あなたと彼らの違いを見分けられない。彼らが正しくないと、どうしてそれほど確信できるのか?」と言うことの一切との間には、大きな違いがある。
ここで示そうとしている直感は、ほかの大勢の人々が、楽観的なモデルを携えて歩み寄ってきたとしても、不確かさから成功を搾り取ることはできない、というものだ。現実には、それが機能できるはずがない。その方法で、ただで成功確率を生み出せると告げる認識論を持つなら、何かを間違えているに違いない。
または別の言い方をすると、非常に難しいと分かる問題へ遭遇したとき、必ず、より不明瞭な見方を持つ大勢の人々が歩み寄り、問題を見ていないため、その問題について楽観する。その楽観論者を見て自分の見方を更新するなら、必ず起きることを見て更新することになる。だから、この方針を採ることは、物事が本当に悪くなったとき、それに気づくことを自分にとって永遠に不可能にするだけだ。
Aryeh: あなたが言っていることを、完全に理解しているか分かりません。ある程度、あなたの言っていることは、謙虚な認識論についての見方へ帰着するように見えます。つまり、基本的に自分の見方に従い、ほかの誰にも判断を委ねない、ということです。判断を委ねないだけでなく、ほかの人々の見方にもとづく、有意なモデル不確実性さえ、実際にはまったく取り込まない、と言っているように聞こえます。私は、これを少しでも正しく理解していますか。それとも完全に的外れですか?
Eliezer: 私の認識論は、実際に非常に破滅的に見える世界なら、自分が破滅することに原理上気づけるようなものだ。どれほど実際に破滅的な可能世界であっても、「私たちは破滅しない」と主張する人々の合唱が必ず存在するという事実があっても、である。
(『不十分な均衡』で詳しく論じられている、謙虚な認識論、判断を委ねること、そして「外部視点」を参照。また、人々は物事について確信ある結論へ到達できる場合が多い、という基本的な一次の主張については、『強い証拠は一般的である』を参照。) ↩