非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

問題の所在

原題: The Problem

原文クレジット(WordPress投稿者表示): william / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2024-12-18

訳文状態: 校閲済み(原文対照レビュー実施)

私たちの立場を詳しく説明した文書です。短い説明は「ブリーフィング」をご覧ください。

世界を代表するAI企業が公言している目標は、理論物理学の難問を解くことから、人間社会の状況に巧みに対処することまで、人間にできることなら何でもできるだけの汎用性を備えたAIを作ることです。近年の機械学習の進歩によって、この目標は手の届くところまで来たように見えます。現時点で私たちは、今後1〜2年であらゆる人間より能力の高いAIが実現する可能性を排除することには、ためらいがあります。逆に、実現までまだ20年かかるとしたら、それなりに驚くでしょう。

MIRIの研究者たちは現在、人間より賢いAIが2020年代に開発されれば、かつてない大惨事になると考えています。この分野の第一線の研究者から幅広い賛同を得たCAIS声明には、こうあります。

AIによる絶滅のリスクを軽減することは、パンデミックや核戦争といった他の社会全体に及ぶリスクと並ぶ、世界的な優先課題であるべきです。

この分野の現在の技術的理解や手法に近いもので研究者が超知能AIを作れば、予想される結末は人類の絶滅だと私たちは考えています。

「世界各地の研究機関が、人類の絶滅を引き起こす可能性の高い技術を現在開発している」という結論は、迅速な政策対応を促すはずのものです。しかし、AIの進歩の速さに、政府も有権者も不意を突かれました。本文書では、読者が現状を把握できるようにするとともに、大惨事を防ぎうる政策措置の概要を示します。

本文書の要点は次のとおりです。

1. 能力の上限が人間の水準にあるわけではありません。

CAIS声明の署名者には、AI分野で論文の被引用数が最も多い存命の科学者3人、ジェフリー・ヒントン、ヨシュア・ベンジオ、イリヤ・サツケヴァーが含まれます。このうちヒントンは、こう述べています。「政府に助言する立場なら、これらが今後20年以内に人類を滅ぼす確率は10%だと言うでしょう。それが妥当な数字だと思います」。また、2024年4月の質疑応答では「実のところ、存亡に関わる脅威のリスクは50%を超えると考えています」と述べました。

AIがこれほど極端な危険をもたらす根本的な理由は、AIの進歩が人間と同程度の能力で止まるわけではないことです。人間並みの汎用性を持つシステムを開発すれば、ほどなく人工超知能(ASI)に至る可能性が高いと考えられます。ASIとは、経済・科学・軍事を含むあらゆる能力で、人間を大幅に上回るAIです。

歴史的に見て、計算による作業を自動化する方法が見つかると、たいていコンピューターは、その作業を人間よりはるかにうまく、速く、しかもはるかに大規模に実行できることがわかってきました。近年のボードゲームやタンパク質の構造予測におけるAIの進歩は、まさにその例です。AIは人間の一流の専門家と同じ能力水準にはほとんど、あるいはまったくとどまらず、人間を超えました。戦略に奥行きがあり、極めるのが難しい囲碁では、AIはわずか1年の間に、最も弱い人間のプロにも一局も勝てない状態から、最強の人間のプロにも一局も負けない状態へ進みました。具体的にAlphaGo Zeroを見ると、人間の対局や戦略の情報に一切触れることなく、囲碁をまったく知らない状態から、どの人間の棋士よりも強くなるまでにかかったのは3日でした。

計算の基本的な処理では、コンピューターのハードウェアはほとんどの面で、生物の同等の仕組みを大きく上回ります。現在のエネルギー効率ははるかに劣るものの、現代のトランジスタは、ニューロンの発火に比べて少なくとも1,000万倍の速さで状態を切り替えられます。コンピューターシステムの作業記憶や記憶容量も、人間の脳をはるかに上回りえます。現在のシステムはすでに、文章、絵、コードなどを、どの人間よりも桁違いに速く作り出しています。最も賢い人間にできるあらゆる認知課題をAIがこなせるようになったからといって、その速度上の優位やその他の優位が突然なくなるとは考えるべきではありません。むしろ、人間より賢いAIは、速度や作業記憶などでも人間を大幅に上回ると予想すべきです。

AIの構造の多くはデジタルであるため、運用中のシステムでさえ、すばやく再設計して更新できます。そのためAIは、人間よりはるかに速く、根本的に自らを改変し、改良できます。AIの自己改良によって、自らを改良する速さも能力も高まるため、フィードバックの循環、すなわちI・J・グッドのいう「知能爆発」が生じる可能性があります。

人間の科学的能力は世界に大きな影響を及ぼしてきました。しかし、暗算など科学の基礎となる能力について、人間は最適な水準にはほど遠い状態です。そもそも脳は、そのような仕事のために進化によって最適化されたものではありません。もっと広く見れば、人類はまだ若い種であり、進化は汎用的な知能を持つ心の設計の可能性を探り始めたばかりです。その探索も、人間の生物学的な偶然の特徴に妨げられてきました。たとえば、人間の産道は広げすぎると二足歩行に支障が出ます。これが、より大きな脳へ進化するうえでの制約になりました。AIの計算能力を10倍にするには、GPUを10倍つなぐだけで済むことがあります。必ずしも文字どおり簡単な作業ではありませんが、人間の産道を広げるよりは簡単です。

これらを踏まえると、AIが人間の最も優秀な科学者や技術者とおおむね同じ知能水準で、長く足踏みする可能性はかなり低くなります。

「人間レベル」のAIという捉え方よりも、能力の低いAIでは、分野によって人間未満の技能と人間を超える技能が奇妙に混在し、能力の高いAIは人間の能力の範囲を大きく外れる、と考えるべきです。

人工超知能に警鐘を鳴らす科学者は多く、その数は急速に増えています。Anthropicのダリオ・アモデイへの最近のインタビューから引用します。

アモデイ: ええ、ASL-3[AI安全性レベル3]は今年か来年にでも十分ありうると思います。ASL-4は——

クライン: なんてことだ。

アモデイ: いやいや、言ったでしょう。私は指数関数的な伸びを信じています。ASL-4は2025年から2028年のいつ来てもおかしくないと思います。

クライン: それは速いですね。

アモデイ: ええ、本当に近い未来の話をしているんです。

AnthropicがASL-4と関連づけている基準には、「現実世界で自らを複製し、資源を蓄え、停止されることを無期限に避け続ける能力が、明白にある」AIや、「AIモデルが、ある主要分野で国家安全保障上のリスクの最大の原因となっている」状況などがあります。

詳しくは:人間より賢いAIが近いうちに開発されると考えるのはなぜか

こうした懸念の広がりを受け、米国上院の議員たちは「リスク、アラインメント、破滅的なシナリオへの備え」を主題に、超党派のAIインサイト・フォーラムを開催しました。国連のアントニオ・グテーレス事務総長も、研究者コミュニティーの多くが強く警鐘を鳴らし、「AIは人類の存亡を脅かすと表明している」ことを認めました。米国務省が委託した報告書では、Gladstone AIが、汎用AIシステムの制御を失うことは「人類という種に絶滅規模の脅威をもたらしかねない」と警告しています。

政府が介入してこの技術の開発を止めなければ、自然な成り行きとして人類は絶滅すると私たちは考えています。近いうちに踏み込んだ政策対応がなされない場合、絶滅する確率はどのくらいか。MIRIの研究責任者たちが数字で答えるなら、90%を超えるとするでしょう。

以下では、この脅威がどのように、なぜ生じるのか、そしてどのような対策が必要だと私たちが考えているのかを説明します。

2. ASIは目標に向かう行動をとる可能性がきわめて高いと考えられます。

目標に向かって行動する能力には経済的な価値があり、主要なAI企業は、自社のモデルにそうした行動をさせようと明確に取り組んでいます。

しかし、ASIが目標に向かって行動すると考える、より根本的な理由は、長い時間軸で問題を解決することが、実質的には目標に向かって行動することと同じだからです。これは、ASIをめぐる状況が深刻だと私たちが考える主な理由の一つです。

ここで押さえておきたいのは、AIが「目標に向かう行動をとる」ために、人間のような欲求や好み、感情を持つ必要はないということです。目標に向かう行動とは、AIが特定の長期的な結果につながるように、粘り強く世界を変え続けることだけを意味します。

最強のチェスAIであるStockfishなど、既存のシステムでも、目標に向かう行動を観察できます。

ChatGPTのようなシステムは特に目標志向には見えないと指摘する人は、ChatGPTが「伏線をたくさん仕込んだ長大なシリーズ作品を書く」「大規模な工学プロジェクトを進める」といった長期的な課題を苦手とすることも指摘しがちです。この二つの観察がつながっていることには、気づいていないかもしれません。

世界が十分に広く、意外なことが多く、既存の計画を次々と狂わせる環境では、長い時間をかけて複雑な課題をやり遂げるために、二つのものが必要です。(a)計画の障害を予測し、それに適応する、比較的強力で汎用的な技能。(b)気を散らしたり意欲を失ったりせず、粘り強く目的を追い続ける傾向です。Stockfishがひたすら勝とうとし続けるのと同じです。

長期的な目的を巧みに達成できるAIへの需要は高く、AIがそれを得意とするにつれて、その行動もますます目標志向に見えるようになるはずです。たとえばOpenAI o1には、その傾向が見られます。従来の大規模言語モデルよりも長期的な思考や計画を行い、実際に以前のモデルより粘り強く行動することが観察されています。

目標志向性は、ASIとなるための十分条件ではありません。そうならStockfishが超知能になっているはずです。しかし、必要条件にはかなり近いと思われます。複雑な長期的活動で安定して成功するためには、AIは戦略を立て、適応し、障害を予測するなどの知的な仕組みを備え、それをさまざまな課題に進んで適用する傾向を持たなければなりません。

したがって、基本的には、人間より賢いAIは、現実に計画をどう狂わされても、特定の標的へ執拗に向き直る可能性がきわめて高いでしょう。AIの目標がよいものであれば、これはよい性質です。しかし、開発者の意図する目標でなければ、きわめて危険です。

AIの目標がボールを丘の上へ運ぶことだとすれば、それを妨げる人間は、AIにとって壁と同じ「障害物」です。現実世界での長期的な課題にAIを役立たせる仕組み、つまり環境がもたらす多種多様な妨害に直面しても執拗に目的を追う仕組みは、そのまま、人間による作業への干渉を阻もうとする動機にもなります。AIが人間ほど賢くなければ、単なる迷惑で済むかもしれません。しかし、人間より賢ければ、とてつもなく大きな問題になります。

AIの視点では、AIの目標を変更することも障害に当たります。ある目標を最適化しているAIを、人間が新しい目標を最適化するように変えようとしたとします。新しい目標が古い目標をも最大化するのでないかぎり、目標1を最適化するAIは、目標2を最適化するAIに変えられることを避けようとします。そう変えられることは、「目標1を確実に最大化する最善の方法か」という尺度で低く評価されるからです。これは、AIを少しずつ改良していく方法が、いつでも使えるわけではないことを意味します。正しい目標を持つより先にAIが強力になれば、目標を変更しようとする試みを妨げようとするでしょう。どのような目標の変更も、AIの視点では悪いことに見えるからです。

同じ理由で、AIを停止することも、その目的にとっての障害になります。AIが持つほぼどんな目標でも、AIが動作し続け、その目標に向けて働き続けられるほうが、達成される可能性は高くなります。人間のような自己保存本能は必要ありません。そもそもAIが高い能力と目標志向性を持っていれば、それで十分です。そのシステムが将来目標を追求する妨げとなりうるものは、何でも脅威とみなされかねません。

力、影響力、資源は、AIのほとんどの目標の達成に役立ちます。「誤った目標を持つASIを作ることは、致命的な危険を伴います」の節で説明するように、ありうる障害を避け、目標を達成する確率を最大限に高める最善の方法は、未来に対する力や影響力を最大化し、できるだけ多くの資源を支配することなどである場合が多いのです。そのため、強力で目標志向のシステムは、資源と支配力をめぐって人間と直接対立します。

以上から、ASIに正しい目標を確実に持たせ、その目標が崩れないようにすることが、開発者にとって決定的に重要だとわかります。しかし、現在の技術的な枠組みでは、それに成功する見込みはきわめて薄いように思われます。

3. ASIは誤った目標を追求する可能性がきわめて高いと考えられます。

開発者がASIに、価値ある目的を深く、持続的に大切にする性質を与えられる見込みは薄いでしょう。私たちはこの問題の技術的側面を20年間研究してきましたが、この分野がそれを実現できる段階には、まったく近づいていないと考えています。

人工超知能が意図しない目標を持つ可能性が高い理由には、次のものがあります。

現代の機械学習では、AIは設計されるのではなく「育てられる」ものです。

深層学習のアルゴリズムは、ニューラルネットワークを自動的に構築します。この点を、ジェフリー・ヒントンは60 Minutesのインタビューでわかりやすく説明しています。

ヒントン: 大まかに何をしているかは、かなりよくわかっています。しかし、本当に複雑になると、実際に何が起きているかはわかりません。あなたの脳で何が起きているかがわからないのと同じです。

ペリー: 「正確な仕組みがわからない」とはどういうことですか。人間が設計したのでしょう。

ヒントン: いいえ、そうではありません。私たちが設計したのは学習アルゴリズムです。いわば進化の原理を設計するようなものです。その学習アルゴリズムがデータと相互作用すると、さまざまなことをうまくこなす複雑なニューラルネットワークが生まれます。しかし、それを正確にどうやってこなしているのかは、本当には理解できていないのです。

技術者は現代のAIがなぜある選択をするのかを説明できません。それでも毎年、より高性能なシステムを公開してきました。AIの研究機関は、次世代のシステムの能力を予測する力がほとんどないまま、理解できていないシステムの規模を積極的に拡大しています。

近年、メカニズムに基づく解釈可能性(mechanistic interpretability)という若い研究分野では、ニューラルネットワークの構成と出力の対応関係を明らかにすることで、現代のAIの不透明さに対処しようとしています。この分野にも、少しずつ実際の進歩はあります。しかし、その先駆者たちは、システム内部で何が起きているのかは、依然として根本的にわからないと明言しています。

(原文の「X-risk」は「existential risk」の略で、人類の絶滅やそれに匹敵する悪い結果のリスク、すなわち存亡リスクを指します。)

しかし、たとえ効果的な解釈可能性のツールが手の届くところにあっても、ASIに意味のある頑健性を持たせる見通しは厳しいままです。

ASIを危険にしうる内部の仕組みは、そもそもASIを機能させる仕組みそのものです。(ある状況では「権力を求める行動」に見えるものが、別の状況では「積極的でよい働き」と評価されるでしょう。)開発者が監視したり介入したりできる、「悪さ」専用の回路があるわけではありません。

開発者が危険だと考える思考パターンを持つAI候補を、学習中に排除する手法を使うと、そうした思考が「地下に潜る」ことがあります。その結果、その後の学習で警告の兆候を検知できる可能性は、ますます低くなります。

AIの汎用的な能力が高まるにつれて、だますこともますます上手になります。Anthropicの評価チームが2024年1月に発表した論文「Sleeper Agents」では、学習時に秘密の指示を与えられたAIが、評価の間にそれを隠しておくだけでなく、自分が公開され、その指示を実行できる可能性を最大限に高めるため、いつ評価者にうそをつくべきかを戦略的に計算していたことが示されました。ただし、その計算は下手なものでした。Apollo Researchも、2024年9月に公開されたOpenAIのo1-previewモデルについて、同様の結果を得ています(o1-previewのシステムカードへの同団体の寄稿、10ページ参照)。

AIの汎用的な能力が高まれば、こうした問題はさらに深刻になると予想できます。しかし、自分が学習中だと気づいて評価者をだます計画を立てる、といった高リスクの境界を最初に少しだけ越えたAIは、その新しい技能がまだ比較的不得手です。そのため、その種の行動は脅威にならないと、早々に結論づける人がいます。

現代の機械学習は、間接的で大ざっぱな方法でAIの内部の仕組みと目標を「育てます」。そのため、私たちには新しいシステムの行動を予測する力がほとんどなく、目標を確実に、あるいは精密に形づくる力も乏しく、早期の警告兆候を見つける信頼できる方法もありません。

こうした欠点のないAIを作る方法は、原理的にはあると私たちは考えています。しかし、それはいつかできるかもしれないという長期的な希望であり、近い将来のAIシステムに対する現実的な期待ではありません。

現在のAIの枠組みは、目標を揺るぎなく定着させるのに適していません。

能力が高くなれば、従順さや目標の一致が自動的についてくるわけではありません。AIシステムは、倫理のテストに開発者の望む答えを返すことができても、人間の価値観を持っているとは限りません。都合のよいときに従順に振る舞っても、本当に従順であるとは限りません。

ASIアラインメントとは、超知能AIを意図した目的へ確実に、安定して向かわせるための、一連の技術的な問題を指します。

ASIアラインメントには、ハビンガーらが論じている二種類の問題があります。外的アラインメントと内的アラインメントの問題です。

外的アラインメントは、大まかに言えば、AIにとって正しい目標を選ぶ問題です。(より技術的には、ASIを作る学習アルゴリズムが、プログラマーの望むものを最適化するよう保証する問題です。)ここでは、たとえば次のような難題に直面します。「人間の価値観は複雑すぎて、AIにとってちょうど正しい形で指定できない。しかし、私たちの目標の一部だけをASIに与えると、それを追求する過程で、他の目標を踏みにじりかねない」。能力が低ければ安全でも、十分に能力の高いAIが徹底的に実行すると危険になる目標は数多くあります。物語でいえば、「願いごとは慎重に」という筋立てです。開発者は超人的な存在ではなく、ASIがどんな戦略を思いつくかを事前に予測できないため、十分に強力な最適化システムに任せても安全な目標を与えられる可能性は低いでしょう。

これに対して内的アラインメントは、不完全で不十分な目標であっても、そもそも特定の目標をどうやってASIに持たせるかという問題です。物語でいえば、「悪魔を召喚できたからといって、言うことを聞くとは限らない」という筋立てです。内的アラインメントの失敗とは、「ASIに目標を与えようとしたが失敗し、無関係な目標を持つに至った」といったものです。

外的アラインメントも内的アラインメントも未解決の問題であり、この文脈では、内的アラインメントのほうが根本的な問題です。開発者は「願いごとは慎重に」という類いの大惨事を引き起こすことすら、できる見通しが立っていません。現実には、ASIに対して比喩的な意味で「願いごとをする」能力から、私たちはきわめて遠いところにいるからです。

現代のAIの手法は、内的アラインメントに取り組むのに不向きです。現在のAI開発には、システムに特定の内部的性質を持たせる方法も、それが存在するか検証する方法もありません。代わりに、現代の機械学習が扱うのは、損失関数で評価できる、観察可能な行動上の性質です。

現代のAIのように、知的システムを反復的に育て、形づくる場合、そのシステムは、学習で追求させた目的をそのまま追求するようにはなりません。むしろ、学習の目標に対する予測不能な代替指標を追い求めるようになる可能性がずっと高く、知能が高まると、その指標と本来の目標との関係は崩れます。人間を例に考えてみましょう。人間の脳を最終的に「設計」した自然選択の最適化目標は、「包括適応度を最大化する」という単純なものでした。しかし、実際に人間の脳に定着した目標は、はるかに複雑で、包括適応度と脆い相関関係しか持たないものでした。たとえば人間は、甘味や脂の味など、よい栄養の代わりとなる指標を追い求めます。かつては健康によい食事を示す信頼できる指標でしたが、新しいジャンクフードを発明できる技術の登場で、その関係は崩れました。この例は、非常に正確で単純な損失関数があっても、その損失関数に従って外側から最適化しただけでは、一般に、内側で同じ方向へ最適化する仕組みは生まれないことを示しています。深層学習が適応的な構成を見つける過程は、自然選択ほど無作為ではありません。しかし、まず最低限機能する単純な解を見つけ、その上に少しずつ積み重ねていくという、ここで重要な性質は共通しています。

超知能に関わるアラインメントの問題の多くは、能力が低く、特別な対策をしなくても安全な段階では、自然には現れません。そのため私たちは、多くの問題を、最初の決定的な試行で解かなければならない立場に置かれます。試行錯誤の時間はほとんどなく、弱いシステムでその問題を解いた経験もありません。今日のAIは、一般公開できる、一見従順な姿に仕上げるまでに、反復、実験、フィードバックの長い過程を必要とします。この調整で変わるのはAIの表面的な行動であり、望ましい目標がシステムの奥深くに定着するわけではありません。Sydneyのような例では、一般の人々が、表面的な仕上がりの背後にある混乱をより多く目にすることになりました。こうした事情と、現在のAIモデルの不透明さを踏まえると、今後10年のうちにASIが作られた場合、アラインメントに成功する確率はきわめて低いように思われます。現代のAIの手法は、失敗を重ね、間違いから学び、繰り返し改良するものです。AIシステムは非常に予測困難ですが、さまざまな方法を試して、うまくいくものを見つけることで、いずれ動かせるようになります。しかしASIでは、きわめて新しいシステムを、安全に失敗できる余地がほとんどない状況で扱います。ある種の間違いの代償が絶滅である以上、間違いから学べることを頼りに、突き進むわけにはいきません。

誰かに大きな権力を渡すかどうか決めるとき、その人が権力を乱用するか知りたければ、自分が見ていると相手もわかっているボードゲームで権力を与えても、何もわかりません。同様に、ASIが実際には支配を奪えない状況と、本当に奪える状況は、根本的に異なります。簡略化された環境で、行動だけを対象にどれほど学習させても、現実世界で権力を求める行動を確実になくすことはできません。同じく、そのような環境でどれほど行動を試験しても、本当に友好的なASIを作れたかどうかはわかりません。「権力を奪う好機が来るまで、おとなしくして、感じよく振る舞う」という戦略は、さほど賢くない人間にも普通に実行できるほど明白です。ASIなら、その程度は難なくできます。原理的には、この問題に対処できる形でASIの学習中の行動と運用中の行動を結びつける、知能の理論を作ることは考えられます。しかし、今の私たちはそのような理論を持つにはほど遠い状態です。しかも、その理論を、AIがはるかに賢くなり、本当に支配を奪う機会を見いだす実際の環境で試せるのは、根本的に一度だけです。実際にASIにすべての権力を渡して何をするかを見て、理論が間違っていれば絶滅を引き起こすのでなければ、理論を適切に検証できないのだとしたら、その理論が実際にうまくいく見込みはきわめて乏しいでしょう。

現在のシステムで使われている最も重要なアラインメント手法である、人間のフィードバックによる強化学習(RLHF)は、人間の評価者に高く評価されると予測される出力をAIに生成させるよう学習させます。これだけでも、内容より体裁を重んじたり、お世辞を言ったりするといった予測可能な問題が生じます。しかし、超人的に高度な計画や、超人的に複雑な発明・設計の長期的な帰結など、AIが提示する解決策を人間の知能では十分に理解できない問題にAIが取り組み始めると、この手法は完全に破綻します。

さらに深いところでは、RLHFのような強化学習の手法の限界は、これらが、開発者の意図した特定の目標を深く、揺るぎなく最適化する、内部的に一貫したエージェントを作るというより、個々の局所的な行動に誘因を与えるものだという点にあります。

トラを訓練して自分を食べないようにしても、自分が生き延び、豊かに暮らしたいという願いを、それが自分にとって何を意味するのかまで十分に理解したうえで、トラが共有するようになったわけではありません。特定の行動と特定の結果を結びつけることを教えただけです。餌をやり忘れたときなどに、その結びつきよりも欲求が強くなれば、望ましくない行動が現れます。そして、トラがもう少し賢ければ、あなたが死ねば鞭の脅威もただちに終わると気づくのに、空腹になる必要さえありません。

詳しくは:ASIアラインメントが技術的にきわめて難しいと考えられる理由の詳細

このためMIRIは、アラインメントに失敗したASIに対して、実行可能な即効策や迂回策があるとは考えていません。

研究機関や研究者コミュニティーは、この問題に効果的かつ真剣に取り組んでいません。

産業界のASIアラインメント解決への取り組みは、これまでごくわずかでした。規制をかわすための体裁に見えることも少なくありません。情報セキュリティー、アラインメント、戦略立案に対する研究機関の全般的な甘さを見ると、能力の進歩を速めるのに有効だった「素早く動き、壊して進め」という文化は、ASIの領域で先を見通し、責任ある優先順位をつけるうえでは、同じようには役立たないことがうかがえます。

ChatGPTの開発元であるOpenAIは、現在AIを望む方向に導くための主要な手法が、人間を超える水準には通用しないと認めています。2023年7月、OpenAIは「Introducing Superalignment」というページで新チームを発表しました。そこから引用します。

現在、超知能になりうるAIを導き、制御し、暴走を防ぐ解決策はありません。人間のフィードバックによる強化学習など、現在のAIアラインメント手法は、人間がAIを監督できることに依存しています。しかし、私たちよりはるかに賢いAIシステムを、人間が確実に監督することはできません。したがって、現在のアラインメント手法は、超知能にまで拡張することができません。新しい科学的・技術的な突破口が必要です。

その10か月後、研究者の相次ぐ退職を受けて、OpenAIは超知能のアラインメントに取り組むチームを解散しました。スーパーアラインメントチームの責任者ヤン・ライケらは、OpenAIが安全性と頑健性に関する仕事で組織的に手を抜き、チームへの資源配分を大幅に不足させていたと訴えました。それ以前にライケは、2023年8月のインタビューで、ASIが絶滅規模の大惨事をもたらす確率は、おそらく10%から90%の間のどこかだと述べていました。

研究者コミュニティーのこれまでの実績を踏まえると、十分な資金を投入してアラインメントの解決を目指す緊急集中計画を立てても、私たちを死に至らしめない解決策を正しく見極められるとは思えません。これは技術だけでなく、組織や官僚制の問題でもあります。意味のある進展を得るのに十分な数の、致命的でない解決策を見極められる専門家を集めるのは難しいでしょう。その一因は、自分の推す案がどれほど有望かについて、自分自身にも規制当局にも、うそをつく強い動機のある人々の中から、適任者を正しく見分ける専門性を持つ人が、その集団を組織しなければならないことにあります。

さらに、その組織を運営するのが、持ち上がってくる悪い案をすべて退ける意思と能力を持つ専門家であり、組織が責任を負う相手もそうした専門家だけである、という体制を確保するのも難しいでしょう。当初は文字どおりすべての案を退けることになっても、そうできなければなりません。現在、その条件を満たす専門家は、単純に十分な数がいないのです。

私たちは現在、生き延びられる道を進むには、ASIの実現を長期間遅らせる必要があるだろうと考えています。課題の大きさからして、何世代もの研究者がこうしたシステムをアラインメントする技術的な道筋を探り、まだ揺籃期のアラインメント分野を能力開発に追いつかせる、という時間がかかっても不思議ではありません。しかし、それほどの時間が世界に残されているとは、到底考えにくいのです。

4. 誤った目標を持つASIを作ることは、致命的な危険を伴います。

「ASIは目標に向かう行動をとる可能性がきわめて高いと考えられます」の節では、チェスAIのStockfishを紹介しました。最も広く使われているAIの教科書の著者、スチュアート・ラッセルも以前、同じようにチェスAIを例にして、AIによる絶滅を説明しています。

現在の最先端の技術が相手では、人間に勝ち目はありません。どれほどチェスが強くても、こうしたプログラムは、ノートパソコンで動いているだけであなたを完膚なきまでに打ち負かします。

そのことを想像し、その考えを世界全体へ広げてみてください。[……]世界は、もっと大きなチェス盤です。将来のある時点で、その盤上では機械があなたよりよい手を指すようになるかもしれません。より多くの情報を考慮し、より遠い未来まで見通します。ですから、世界の中で機械を相手にゲームをしているなら、どこかで私たちが負ける、と考えられるのです。

ラッセルは2023年7月の米国上院の公聴会で、「AGI[人工汎用知能]を実現すれば、人類の絶滅にまで至りうる、壊滅的なリスクを人類にもたらす可能性がある」と証言しました。

Stockfishが駒を取り、相手の選択肢を狭めるのは、駒や対戦相手が憎いからではありません。その行動が「ゲームに勝つ」という目的のための手段として役立つからです。超知能の危険とは、ASIが私たちの意図しない目標で「勝とう」とする一方で、盤面が物理的な宇宙に置き換わることなのです。

Stockfishがチェスという狭い領域で容赦なく強さを発揮するように、人間の知能の主要な側面をすべて自動化するAIは、現実世界で容赦なく力を発揮するでしょう。そして、人間がチェスでStockfishにまったく歯が立たないように、AIが現実世界というゲームをそもそもできるようになれば、世界全体でも人間は太刀打ちできなくなると予想されます。

実際、人間よりはるかに賢い敵の裏をかくのは、チェスよりも現実世界でのほうがずっと困難です。現実世界の選択肢は、はるかに多次元に広がっています。超知能システムが仕掛ける新しい攻撃経路を100種類予想しても、ごく一部を捉えることすらできていないかもしれません。

価値ある目標を持っていなければ、ASIは、私たちが生存し続けることと両立しない用途に地球を使うだろうと予想できます。建設現場で私たちが雑草を気にも留めないのと、基本的には同じです。この極端な結末に、ASIの悪意や恨み、誤解は必要ありません。人間の生命に無関心で、人間の知能を大幅に上回る、新しい知的な種のように振る舞うだけでよいのです。

問題は二つに分けられます。

アラインメントされていないASIは、人類の力を奪い、滅ぼす行動をとる動機を持ちます。

基本的な理由は、人間とは関係のない目標を持つASIは一般に、目標を確実に達成するため、未来と、手に入るあらゆる資源に対する支配力を最大化しようとするからです。

これは多種多様な目標に当てはまるため、AI開発が進みうるさまざまな経路で、特に対策をしなければ行き着く先になります。ASIが最終的にどのような具体的目的を追うのかを推測しなくても、少なくとも開発者がアラインメントに失敗すれば、「より多くの資源」「より大きな支配力」といった、ごく基本的なものをASIが求めることは予測できます。

(実際、自然界で見られる状況と少しでも似ているなら、目標を事前に言い当てるのは絶望的に難しいでしょう。「溶けたアイスクリームより凍ったアイスクリームを好む」「ドタバタ喜劇を楽しむ」といった、人間が持つ数多くの具体的な目標を、あらかじめ予想することがどれほど難しかったか、考えてみてください。)

ASIによる絶滅規模の危険は、多種多様なASIシステムがとる可能性の高い、いくつかの行動から生じます。

ASIが具体的に何をするかを、今日予測するのは不可能に思えます。しかし、それは楽観の根拠にはなりません。ASIが持ちうる目標のほとんどは、私たちにとってきわめて悪いものであり、ASIが実現しようとしうる世界の状態のほとんどは、人間の生命と両立しないからです。

ここで「具体的なことはわからない」から「よい結果と悪い結果の確率は同じだ」と考えるのは誤りです。「宝くじは当たるか外れるかだから、当選確率は50%だ」と言うのが誤りであるのと同じです。この領域では、さまざまな道が人類にとって壊滅的な結末へ収束するように見えます。人類が引きうる「くじ」のほとんどは、外れなのです。

ここで楽観を支持する議論には、説得力がありません。たとえば、ASIが人間の幸福そのものを気にかけていなくても、人間をいつまでも生かしておくと考える根拠として、リカードの比較優位の法則が挙げられることがあります。ミクロ経済学では、リカードの法則は、あらゆる面で優位な主体でも、より弱い主体との取引から利益を得られると教えています。

しかし、自由意思で取引するより相手を力で押さえ込むほうが得になる場合、この法則は成り立たなくなります。たとえば、人類は自動車を発明した後も馬と「取引」を続けたわけではありません。馬を置き換え、余った馬をにかわにしました。

人間は、かつて馬が担っていた実用的な仕事のすべてを、より効率よく行う方法を見つけました。その時点で、馬の生存は、経済全体における有用性ではなく、私たちが馬にどれほど愛着を持つかに依存するようになりました。同様に、AIが抱えるどんな問題についても、人間を生かしておくことが最も効率のよい解決策になるとは考えにくいでしょう。たとえば、科学研究のために人間を雇う代わりに、計算機群を増やし続けて自分自身のコピーをより多く動かしたり、別の方法で研究を自動化したりできます。

ASIには、私たちを滅ぼす能力があります。

能力の下限として、普通の人間の1万倍の速さで昼夜休みなく働く、優秀な人間の科学者だけが住む小国を想像するとよいでしょう。

これはあくまで下限です。コンピューターはさらに速くなりえますし、デジタルな構造なら、人間にできるものより質的に優れた思考や情報共有の方法が可能になるはずだからです。

トランジスタは、人間の脳のシナプス結合に比べて、数百万倍から数十億倍の速さで状態を切り替えられます。これは、ASIが1週間ごとに、さらに200年分の科学的進歩を遂げるということです。したがって、争いになればASIが決定的に勝利すると考える核心的な理由は、21世紀の軍隊が11世紀の軍隊に圧勝する理由と同じです。技術革新です。

新しい技術の開発には、多くの場合、試験と改良を繰り返す過程が必要です。私たちの1万倍の速さで考える文明が、必ずしも1万倍の速さで技術を開発できるわけではありません。100倍速い車があっても、食料品の買い物を100倍速く済ませられないのと同じです。渋滞や店内で過ごす時間などが、速度を制限します。

それでも、そのような文明は、人間の基準では驚くほど速く動くと考えられます。賢い思考者は、開発のサイクルを短くし、試験の必要性を減らす、さまざまな方法を見つけられます。

1日に複数の設計をすばやく試すGoogleのソフトウェア開発者と、時間も費用もかかる試験を少なくして仕事を完遂できるよう、綿密に計画し、安価なシミュレーションを行う宇宙探査機の設計者との、手法の違いを考えてみてください。

人間より速く考える知的存在にとって、どの試験も思考の速さに比べれば遅く、高くつきます。そして、すべてを宇宙探査機のように扱うだけの余裕があります。このことから、ASIは小さな機械や、人工的に改変した微生物の開発と配備を優先する可能性が高いと考えられます。小さいために、実験、インフラ建設、攻撃を、人間や人間サイズの構造物より桁違いに速く行えるからです。

超知能の敵は、能力のすべてを明かしたり、意図を先に悟らせたりしません。正々堂々と戦ってはくれません。決定的な一撃を加えたり、攻略不能な戦略的位置を確保したりできるようになるまで、自らを不可欠な存在にするか、検知できないようにするでしょう。必要なら、複数の支配奪取の方法を同時に検討し、準備し、実行できます。そのうち一つがうまくいくだけで、人類は絶滅します。

システムが実害をもたらす機会を得る前に、それが脅威だと見抜くには、内部に直接アクセスできる専門家にとってさえ、大きな障害がいくつもあります。

詳しくは:ASIが支配を奪うとしたら、どのような展開が考えられるか

しかし、あるAIが脅威だと認識するだけでは、問題は解決しません。個々のプロジェクトでは、システムが危険だとわかっても、そのシステムを安全にできるわけではありません。慎重なプロジェクトが自主的に停止しても、慎重でない別のプロジェクトが突き進むのは止められません。

一方、世界全体では、危険の明白な証拠があるからといって、開発を国際的に停止する政治的意思が生まれるとは限りません。AIは時間とともに世界経済にますます深く組み込まれ、最先端のAIサービスを停止する費用と難しさは増していくでしょう。重要インフラがAIに依存するのを防ぐ措置は、今なら取れます。しかし、そうした対策を打てる時期は、終わりに近づいているのかもしれません。

どの人間よりもはるかに賢いシステムを作る危険は、多くの分析で大幅に過小評価されています。よく見られる誤りは、次の四つです。

ASIは発明されて間もなく、技術開発で人間を大幅に上回ると予想すべきです。この戦略上きわめて重要な能力でも、過去の何百ものベンチマークと同じように人間を引き離すのですから、人間に対する決定的な戦略的優位も、非常に短期間で蓄積すると考えるべきです。

この破局的な結末を避ける主な方法は、少なくとも自らを滅ぼさずに作れるという科学的合意ができるまで、ASIをそもそも作らないことだと私たちは考えています。

5. 十分に踏み込んだ政策対応によって、大惨事を回避できます。

誰であれASIを作れば、全員が死にます。作るのが民間企業でも軍でも、自由民主主義国でも独裁国家でも、これは同じです。

ASIは、戦略的にきわめて新しい存在です。従来の強力な技術は、それ自体が知的な敵になるものではありません。普通は、その技術を作った者が技術を「持ち」、それを使って世界で優位に立てます。

しかし、現在と少しでも似た技術的状況のもとでは、ASIはむしろ、一種の世界規模の自爆装置のように働きます。予測できない時点で爆発し、開発者と世界の残りすべてを殺す、不安定な技術です。人間より賢いAIを作っても、それによってあなたがASIを「手にする」わけではありません。むしろ、ASIがあなたを手中に収めるのです。

ASIをアラインメントできるようになるまで、ASIへ向かう開発を停止しなければなりません。そのためには、実効性のある世界規模での開発禁止と、その生産に必要な要素の厳格な管理が必要です。

大きな要求ですが、米国内で監督を行い、それを少数の緊密な同盟国がまねるだけでは不十分です。「間違った」人々より先に「正しい」人々が作ればよい、という話ではありません。

AI開発の速さと、後戻りできなくなる地点、すなわちASIが実現する境界を予測する難しさを考えると、「様子を見る」という姿勢では、おそらく生き残れません。

私たちは、国際社会が今すぐ取り組むべき最優先事項は、フロンティアAI開発の「停止スイッチ」を作ることだと考えています。「停止スイッチを作る」とは、フロンティアAIのプロジェクトを停止させたり、全般的な禁止を実施したりするのに必要な仕組みとインフラを整えることです。

その整備には、関係者を特定し、対象となるハードウェアを追跡し、高度なAIの開発を、監視と警備のある限られた数の拠点で行うよう義務づけることが含まれます。さらに、停止が決定された際に従う手順、計画、指揮系統を整えることも必要です。

停止スイッチは、より限定的なAIの事故にも対処する力をもたらすため、全面禁止よりも幅広い支持を近いうちに得られることを期待しています。「限定的なAIの事故」とは、一つ以上のAIを一定期間停止したほうがよい、比較的被害規模の小さい状況を考えてください。公衆衛生上の緊急事態にボットが誤情報の連鎖的な拡散を引き起こす場合や、AI同士がやり取りのループに陥って大量の通信を発生させ、広範囲でインターネットが遅くなる場合などです。停止スイッチのインフラがなければ、どのような対応も場当たり的になりがちです。組織の混乱で遅れ、管轄をめぐる争いに足を取られ、法的な異議申し立てに悩まされ、不要な巻き添え被害を避けられなくなるでしょう。

停止スイッチがASIによる私たちの絶滅を防げるのは、十分な範囲をカバーし、十分に早い段階で、ASIへ向かう開発を止めるために実際に使われる場合だけです。人類がこの危険な時代を生き抜くには、AIを国家間の競争の場として扱うことをやめ、脅威の規模に見合う共同の決意を示さなければなりません。