最先端AIの開発を、厳しい国際管理のもとにある一つのプロジェクトへ集約し、それ以外の開発はすべて国際的に禁止したとしよう。
その場合、圧倒的に起こりやすい結末は、私たち全員が死ぬことだ。国際的な研究者を一か所に集めた組織、いわば「AI版CERN」であっても、分散した組織と同じく、超知能をアライメントすることはできない。
集約には少なくとも、残された研究を停止しやすくする利点はある。ただし、その利点が役立つのは、重要な決定権をもつ人々が実際に停止させるときだけだ。
実効性のある一時停止につながることを期待して集約を訴えるより、初めから一時停止そのものを訴えるほうが、はるかに筋が通っている。
それでも、こう問いかけることはできる。AIを使って世界をできる限りよくすることを目標に、最先端AI研究の国際センターがあったとしよう。さらに、そのセンターは、技術をもっと先へ進める口実を探しながら突き進むのではなく、リスクを告げる最初の兆候が出た時点で引き返し、開発を停止するよう義務づけられているとしよう。61
世界を深刻な危険にさらしかねないものを大きく避けつつ、人類への恩恵を最大化するには、そうしたプロジェクトをどう使うのが最善だろうか。
私たちの答えは短い。停止させることだ。そもそも、このようなプロジェクトの指揮・統制の仕組みが、責任ある形でリスクを扱えるという前提を、私たちは信用していない。責任をもってこうしたプロジェクトを立ち上げられる世界は想像できる。しかしそれは、今の世界とは大きく違う。
では、私たちはこれが不可能だと考えているのか。もしこの種のプロジェクトを立ち上げなければならず、運営に使える時間が無制限で、運営方法についても無制限の裁量があったら、それでも、始めれば確実に破滅すると結論するのだろうか。
そうではない。この種のプロジェクトはきわめて危険だとは考えているし、強力で、人間水準以上に賢い生物医学AIを生み出すことに成功した場合、ほとんどの運営方法では地球上の全員を死なせることになると思っている。それでも、適切な指揮体制を備えたこの種のプロジェクトを、「成功すれば事実上確実に全員を死なせるもの」ではなく「単にきわめて危険なもの」にすることが、文字どおり不可能だと、完全に正直に言い切ることはできない。
何らかの理由で挑戦を強いられたなら、私たちならどう試みるかは想像できる。
ある種の価値の高い科学研究に役立つかもしれない程度の能力をもちながら、能力と対象範囲が十分に限られているため、何もしなくても安全なAIから、研究成果を引き出す工夫は考えられる。GPT-3には、人を殺せるほどの知能が実際にないのと同じだ。
一案としては、弱いAIに医学論文を注意深く読ませ、医学的な考えと事実だけを専用の言語へ抽出させることが考えられる。そうすれば、新しいAIを、医学的な事実だけを学び、外に広い世界があることも、人間の心理も、自分のプログラムを書き換える発想も学ばないように育てられるかもしれない。もちろん慎重に行う。データベースを狭くしても、AIを大きく、強力に、賢くしすぎれば、独自の考えや目標をもつようになり、結局はかなり危険になりうると見込まれるからだ。
ただ、この想定なら、遠くに最初の警告の兆しが見えて、大急ぎで引き返すことになるまで、対象を絞った科学AIをもう少し先へ進められるかもしれない 。 2024年の最先端システム、たとえばClaude 3 Opusがすでに日常的に示していたような警告の兆候が、ほんの最初の一つでも現れてプロジェクトを中止することになる前に、がんや、多くの加齢に伴う病気の治療法が得られるかもしれない。
ここで言いたいのは、「高度な科学AIを医学だけで学習させれば、どれほど賢くなっても医学以外のことは決してわからない」ということではない。医学にも、汎用知能が役立つ問題はある。医学にどんどん、どんどん強くなるよう育てることに成功すれば、やがて全般的にどんどん、どんどん賢くなる。
医学の事実は、より広い世界が落とす影である。AIが医学的な話題についての推論能力をいくらでも高めていくなら、その広い世界を推測し、それについて考え始めずにはいられない。いつまでも進み続けることはできない。
ただし、医学よりも早くAIを危険にしそうな分野はある 。
十分に強力な知能なら、人類がそうしたように、コンピュータプログラミングを独力で導き出し、機械学習も自分で理解できる。しかし、今行われているようにプログラミングや機械学習の論文でAIを学習させ、私たちの理解では最先端AI企業の一部が現在それも行っているように、さらに強力なAIをつくることを教えようとすれば、そのAIが危険になるのはもっと早い。
どの分野がAIをより早く危険にするのか。私たちの推測では、コンピュータプログラミング、コンピュータ科学、AI研究、人間の心理を熟知すること、個々の人間を予測し尽くすこと(現在の大規模言語モデルはすべて、まさにそれをするよう学習されている) 、 対立について考えるためのゲーム理論、自分自身の目標とその長期的な含意を考えるための意思決定理論……。
リストは長い。そして現在のAIは、広い世界について一般的に学ぶという名目で、そのすべてを学習する。だから私たちは、生物学専用や物理学専用のAIを、現在の生物学や物理学の論文で直接学習させることは勧めない。そうした論文はしばしば、外に広い世界があることに触れる。また、人間の著者についての多くの事実、つまり人間の心理がにじみ出るほど、細かく書かれている。別のAIを学習させる前に、弱いAIに論文を生物学や物理学の事実だけへ訳し直させたい。そうして、人間の心理やプログラミング、対立のゲーム理論についてではない、比較すれば安全な知識で学習させるのだ。
目指すのは、医学と物理学だけを考えるよう、明示的に学習されたAIである。医学や物理学の課題でよい成果を出すには、そのAIにもある程度汎用的な予測能力と、状況を望む方向へ導く能力が必要だろうと考えている。ただし、ゲーム理論、意思決定理論、プログラミング、機械学習を自分で導き出し始め、自分を停止させうる外部の主体が存在するはずだと、そのことに多くの時間を費やすほどの汎用性は避けたい。
AIに必要な知識の一つひとつ、到達すべき能力水準の一段一段が、安全性の負担になる。その負担は、どれも同じ重さではない。私たちなら、各能力が生む負担を真剣に見積もり、Claude 3 Opusで現れた最初の種類の警告の兆候を一度も出さずに、画期的な医学上の成果を大量にもたらすAIを得ようと努めるだろう。警告の兆候が消えるまで十数通りの応急処置を試し、そのまま先へ進むのではない。
だが、この種の異常なほど危険なプロジェクトの運営を任せられると思う人は、世界中で片手か両手の指で数えられる程度しかいない。
私たちから見ると、AI分野の関係者のほぼ全員は、放っておけば、今説明したような危険の負担を比較する考え方を、自発的かつ真剣に始めることはない。この分野で20年以上働き、新人研究者を指導し、ワークショップを運営し、技術者を訪ねてアライメントの発想を議論し、この分野のさまざまな流行や考え方の盛衰を見てきた。その経験から、普段の技術的な判断力と先を見通す力の水準は、このようなプロジェクトを、全員の命を深刻に脅かすことも、医学研究を実質的に前進させるだけの能力にいつまでも近づけない事態に陥ることもなく、現実に機能させるために必要な水準に、遠く及ばないと考えている。62
ASIや、「ASIの安全性」でさえ、そこへ進む人々は圧倒的大多数の場合、こうした問題すべてがどれほど扱いやすく、簡単で、解決可能かについて、非常に楽観的である。私たちが適切だと思う慎重さや慎重な手法を示すことは、ほとんどない。
すると、結局、私たちはこう言っていることになる。
「ああ、そうだね。安全とまではいかなくても、少なくとも自殺行為ではないかもしれない。ただし、私たちが信頼する人を責任者にするなら、だ。」
それが私たちの正直な見立てなのだから、そう言うしかない。だが、あなたはそれを信じるべきなのか。先ほどの体制ならうまくいくと、私たちの言葉を信用すべきなのか。大統領や首相は信じるべきなのか。非常に難しく危険なことでも、私たちならうまく切り抜けられるかもしれないと言ったら、地球の政策として私たちに任せるべきなのか。
それは、賢明な惑星が政策を決めるやり方とは思えない。ほかの科学者が大勢そろって、「完全な自殺行為ではないかもしれないが、あの人たちの推す研究者に任せる場合に限る」と言うなら、地球も注目すべきなのかもしれないが。
私たちは、そもそも試さないほうがよいと思っている。この話を持ち出した主な理由は、この破局を丸ごと止めてしまう代わりに、崖っぷちで踊り、火遊びをして、時間の圧力も逆効果の誘因もない、集約された国際プロジェクトで、対象の狭い科学AIから大きな恩恵を引き出そうとするなら、実際に何をすることになるのかを、間違いうる私たちの視点から示すためだ。
不可能だと断言できれば話は簡単だが、それでは完全には正しくないように思う。これまで書いてきたすべてにおいて、議論に都合がよいからといって誇張や過度の単純化に頼らないよう、私たちは細心の注意を払ってきた。より危険の少ない知能から、より価値ある成果を得るために試せそうな工夫は、見えていると思う。実際にはうまくいかないだろうと思うものの、明白な自殺行為とまでは言えない、きわめて具体的で限定的な案はある。最初の警告の兆候で引き返し、さらに先へ進むために目に見える警告を消そうと、十数通りの方法を試したりしない案だ。
ただし、と私たちは言う。私たちの推す研究者が舵を取り、研究上の判断力を働かせて、事態が道を外れず、安全方針が字面だけでなく本来の趣旨に沿って守られるようにする場合に限る。あちらのほかの人々がやるなら、おそらくあなたは殺されると思う、と。
この状況で、地球は何をするのが賢明なのか。私たちは、それが「火遊びをして崖っぷちで踊り、ネイト・ソアレスかエリエゼル・ユドコウスキーが指名した評議会に、プロジェクトが十分に深いセキュリティの発想を守っているか確かめさせること」だとは思わない。
この状況で賢明なのは、火から 離れることであり、崖の縁ぎりぎりまで踊りながら近づく巧妙さを競うことではない、と私たちは考えている。
脚注61:これは、現在のAI研究所で主流になっているやり方とは正反対だ。今のやり方では、警告の兆候が出ると、目に見える危険の兆候が消えるまで十数通りの修正や回避策を試す。それからさらに先へ進み、また警告が出ると、それも消して、また先へ進む。問題が起きた理由を理解していれば、研究者は根本原因を診断して解決できるかもしれない。その過程で、原因や結果としてつながるほかの問題や、同様の理由でAIに生じるほかの問題にも対処できるかもしれない。試験中に現れなかった問題も含めてだ。しかし現代のAI研究の現場では、なぜAIがある問題を示すのかを研究者が理解していることは、ほとんどない。代わりに、何かがたまたまうまくいくまで、さまざまな案を試して、成功を宣言する。目に見える問題が深い問題の症状だったなら、その深い問題は放置されるか、偶然にしか対処されない。この過程全体は、問題そのものを減らす以上に、警告の兆候を見えなくする方向へ最適化する。懸念すべき行動の兆候をすべて隠すAIなら、学習で身についた習性として隠していようと、意図的な戦略として隠していようと、最良の成績を収めることになる。
脚注62:ソアレスの場合は10年。