本稿はMIRI Single Author Seriesの一部である。このシリーズの記事は、署名した著者個人の信念と意見を表すものであり、MIRI全体を代表するとは主張しない。
イライザー・ユドコウスキー(Eliezer Yudkowsky)は、2023年に『TIME』誌へ掲載した論説で、フロンティアAI開発の一時停止を定める国際協定を求めた。協定に加わっていない国が違反した場合、署名国は「ならず者のデータセンターを空爆で破壊する意思を持つ」べきだ、とした。
重要な前提は、AI能力の進歩に、監視でき、かつ阻止できる水準があり、その阻止に成功すれば、人間より賢いシステムの開発を未然に防げるというものだ。
ダン・ヘンドリックス(Dan Hendrycks)、エリック・シュミット(Eric Schmidt)、アレクサンダー・ワン(Alexandr Wang)は、最近の著作『Superintelligence Strategy』で、妨害工作を行うという威嚇によって、各国(特に米国と中国)へ危険なAI開発を思いとどまらせる抑止体制を提案している。この体制は相互確証AI機能不全(Mutual Assured AI Malfunction; MAIM)と呼ばれ、国内のAI開発を制限し、妨害工作の威嚇によって競争相手にも同じことを強いる。
本稿は、 『Superintelligence Strategy』で構想されたMAIMが、効果的または安定した抑止体制になる可能性は低いと論じる。 MAIMは戦略上の力学を正しく捉えているものの、この分析からは重大な欠陥が明らかになる。具体的には、AI開発について不明確で監視不能なレッドライン、疑わしい威嚇の信頼性(特に、妨害工作によって進歩を阻止する能力)、そして巨大な利害と不確実性がもたらす不安定な抑止計算という問題を抱える。
それでも『Superintelligence Strategy』は、重要な問題を前進させた点で評価に値する。各国が手をこまねいて、無制限のAI開発がもたらす帰結を受け入れると期待することはできない。MAIMに代わる案は、どのような特徴を備えるべきか。 この問いへ答える前段階として、本稿では、マイケル・マザー(Michael Mazarr)の『Understanding Deterrence』などの知見を用い、抑止が成功するために確立された条件に基づく枠組みを導入する。以下の各節ではこの枠組みを示し、MAIMの提案へ体系的に適用して、現在のMAIMが安定した抑止に必要な条件をどこで満たせないかを明らかにする。
抑止の枠組み
簡単に言えば、抑止とは、ある行動に代償を課し、その魅力を低下させることである。
抑止とは、一方の当事者である被抑止側に、望ましくない行動を思いとどまらせることをいう。明確に伝達されたレッドラインが、抑止側による対応を発動させる。抑止側は威嚇を行う。すなわち、対応を通じて代償を課すという、信頼できるコミットメントを示す。
一部の文献では、被抑止側を攻撃側、抑止側を防御側と呼ぶ。本稿でもこれらの語を同じ意味で用いる。
効果的な抑止には、監視できるレッドラインが必要である。抑止側は違反を正確に検知できなければならない。またレッドラインは有効でなければならない。行動をレッドラインから遠ざけるよう制約することで、望ましくない行動を回避できる必要がある。
効果的な威嚇は信頼できなければならない。そのためには、被抑止側が抑止側の能力と意志を信じる必要がある。能力とは、威嚇を実行する技術的手段である。意志とは、抑止側自身にも対応の代償がかかるにもかかわらず、実行する決意を指す。
効果的な威嚇が課す代償には、十分な効力が必要である。被抑止側が認識する代償の大きさは、望ましくない行動から得る利得を相殺するのに十分でなければならない。したがって、(望ましくない行動から被抑止側が得る)利得の望ましさが重要な考慮事項となる。
最後に、抑止の根底には合理性という前提がある。被抑止側は、異なる行動の代償と利益に反応する必要がある。完全な合理性を要求するのではない。意思決定において、これらの要因と帰結を少しでも考慮していればよい。実際、この領域へ抑止を適用するには、認識、文化、価値観、リスク許容度における(中国側の)違いを、もっと強く取り込む必要がある。
例を挙げると分かりやすいだろう。中国による台湾侵攻の可能性を抑止しようとする米国の取り組みを考える。この場合、中国が被抑止側であり、米国(多くの場合、同盟国とともに)が抑止側となる。望ましくない行動は、台湾への大規模な軍事攻撃だ。米国は「戦略的曖昧性」の方針を維持しているが、暗黙のレッドラインは、そのような攻撃の開始である。威嚇には米軍の介入と厳しい経済的帰結の可能性が含まれ、台湾を奪取することで得ると北京が認識する利得に比べ、容認できないと判断する代償を課すよう設計されている。
抑止が成功するための条件
この枠組みから、抑止のチェックリストを作れる。
- レッドラインを越えずに、望ましくない行動を取ることはできない。
- レッドラインを監視できる。
- レッドラインを明確に伝達できる。
- 抑止側の能力に信頼性がある。
- 抑止側の意志に信頼性がある。
- 威嚇の効力が、潜在的な純利得を上回る。
- 被抑止側が代償と利益に十分反応する。
まずMAIMをこの枠組みでさらに詳しく説明した後、このチェックリストへ戻る。
MAIMを枠組みに当てはめる
『Superintelligence Strategy』が描くMAIMでは、米中両政府を抑止側と被抑止側とみなせる。中心的な想定では、そして『Superintelligence Strategy』の構想どおりなら、双方が両方の役割を担う。このような対称性が存在しない、または当初は存在しない場合や、第三者が抑止側の役割を担う場合もあるが、本分析の範囲外とする。
望ましくない行動は、「不安定化をもたらすAIプロジェクト」の進展である。これは強力な新能力を作り、力の均衡を崩しうるプロジェクトを指す。このレッドラインは『Superintelligence Strategy』で正確には定義されていないが、著者ダン・ヘンドリックスは最近のXへの投稿で、AI研究の自動化を例に挙げる。「何千ものAIから成る集団が、完全自動のAI研究(『知能の再帰』)を行うことはレッドラインの一例であり、超知能への最も有力な経路である。再帰には数か月かかる可能性が高く、識別でき、妨害工作によって阻止できるだろう」と述べている。
『Superintelligence Strategy』の付録も、「高度に洗練されたサイバー攻撃、専門家水準のウイルス学、完全自律型のAI研究開発」など、いくつかの「重要能力」を説明している。
レッドラインに抵触した場合の対応は、AIの進歩を妨げる「機能破壊攻撃」である。『Superintelligence Strategy』では多くの選択肢に言及する。具体的な対応には、秘密裏の妨害工作、公然のサイバー攻撃、物理的攻撃、そして最終的にはAI以外の資産も脅かす、より広範な敵対行為が含まれる。これらはエスカレーション・ラダー(段階的な措置)として組み立てられている。小規模で秘密裏の対象を絞った攻撃から、大規模で公然の、より広い損害を与える攻撃へ進む。この仕組みは、被抑止側へ撤退の機会を与えるため有用になりうる。また抑止側が初期の手段の効果に確信を持てず、さらに強い措置が必要かどうかを知るため、まず試す必要がある場合にも役立つ。
威嚇とは、不安定化をもたらすAIプロジェクトを検知した際、こうした機能破壊攻撃を用いるというものだ。代償は、そのプロジェクトの妨害から、より広範な混乱やAI以外の資産への攻撃まで及ぶ。より広い敵対行為を含める点は注目に値する。これは拒否的抑止と懲罰的抑止の境界を越えるからであり、この区別には後で戻る。
超知能の領域で得られる利得は、とりわけ捉えどころがない。『Superintelligence Strategy』の説明では、その利得は、永久に「すべての反対勢力を支配する」ことから、逆にそのように支配されること、あるいは無謀な競争相手のプロジェクトが制御喪失を招いた結果、自国が完全に破壊されることまで、巨大な隔たりを覆う可能性がある。威嚇の効力を評価するとき、この不確実性へ対処しなければならない。
抑止の枠組みを適用するには、さらに詳しく説明すべき点がある。
レッドライン
最初の三つの条件はレッドラインに関係する。
- レッドラインを越えずに、望ましくない行動を取ることはできない。
- レッドラインを監視できる。
- レッドラインを明確に伝達できる。
完全自動のAI研究の周囲にレッドラインを引くことは機能するだろうか。ヘンドリックス博士は数か月かかると主張するが、知能の再帰は、特定して対応するには速すぎるほど急速に進みうる、と考える人もいる。いずれにせよ、知能の再帰が可能なAIシステムのデプロイへ反応するのは、考えられる限り最も遅い段階であり、誤りの余地はほとんど残らない。許容される利用(たとえば自律的ソフトウェア開発)と、その利用を決定的な戦略的優位(たとえば核兵器体系を無力化できるサイバー兵器)へ転換するまでの、この極めて短い「突破距離」は弱点である。実際には達成不能に見えるほど精密な監視と迅速な対応を要求することで、抑止を損なうからだ。
ウクライナや台湾をめぐる現代の抑止シナリオでもよく知られる「サラミ戦術」の問題もある。攻撃側は、レッドラインを越えたと正当化することが常に難しくなるよう、望ましくない行動へ向かって少しずつ進む。再帰的自己改良への漸進的な進歩は今も続く過程であり、最先端モデルがAI研究者へ与える実効的な速度向上は、時間とともになだらかに増える。
レッドラインを、自動化された研究者のデプロイという瀬戸際より手前、おそらくそのようなデプロイを可能にする能力の開発に引けるだろうか。そうしても、なおいくつもの問題が生じる。
フロンティアAIの能力は、幅広く汎用的な形で進歩する。たとえば、新しいモデルの開発が自律的な研究開発を明示的に目指さなくても、関係する能力の最先端を前進させうる。プログラミング課題で最先端になると期待されるモデルの開発を進めれば、AI開発に関係する新たな能力も、おそらく伴う。これは、レッドラインも同じように幅広く一般的に引く必要があることを示唆する。しかし『Superintelligence Strategy』は、エスカレーションを避けながら、安全なAI進歩の恩恵を得られると示唆しているように見える。
狭い領域の中でさえ、フロンティアAIの能力を予測するのは難しい場合がある。次の最先端モデルは、ソフトウェアの脆弱性を見つける能力がどれほど高いのか。AI開発者はこのようなことを予測できていない。
最後に、フロンティアAIの能力は訓練後にも大きく向上しうる。モデルが開発のさまざまな段階で適切な評価を受けても、事後訓練の手法とエージェント的な足場づくりによって、開発過程の早い段階では開発者にも完全に予見できない形で、その能力を拡張できる。
これらは開発者自身にとっても問題だが、外国政府はさらに、遠隔からこうした進展を監視する問題へ直面する。諜報活動を通じて外国の開発者の考えを解釈しようとする際に生じる不確実性が、監視の難しさをさらに増す。
『Superintelligence Strategy』は「機能破壊攻撃の威嚇は、査察などの透明性措置を競争相手へ要求するための影響力を国家に与える。したがって、機能破壊が正当かを判断する際、諜報活動だけに頼る必要はない」と述べる。しかし、透明性措置なしには監視できないレッドラインへの対応として機能破壊攻撃を威嚇する必要があり、その透明性措置自体は威嚇に成功して初めて得られるのなら、循環論法になる。この循環を解くには、危険なAI開発と明確には関係しない資産を対象にした威嚇を各国が行う必要があり、そこでより広範な攻撃の問題が生じる。
機能破壊攻撃ではなく、不安定化をもたらさないAIプロジェクトや、AI以外の資産まで攻撃する、より広範な攻撃を使えば、透明性措置を要求する影響力を得られるかもしれない。これには前例がないように思われ、さらなる研究が必要である。各国にはこの種の脅迫へ抵抗する理由があるが、抑止を試みる側には戦争以外のよりよい手段がないかもしれない。また、このような強制によって得た透明性措置は、信頼する前に最大限厳しく検証する必要がある。
有効で監視可能かつ明確なレッドラインが欠けていることは、現在説明されているMAIMの最大の問題であり、効果的な抑止をさらに発展させようとする今後の取り組みの出発点となる。
信頼できる威嚇
次の二つの条件は、威嚇の信頼性に関係する。
- 抑止側の能力に信頼性がある。
- 抑止側の意志に信頼性がある。
まず、拒否的抑止と懲罰的抑止の区別へ戻る。この区別は、威嚇が課す代償の種類に関するものだ。
拒否的抑止では、代償は、望ましくない行動が失敗するという予想の高まりである。典型的な例は、敵対的な軍事行動へ抵抗する能力を高めるため、同盟国へ武器を提供することだ。
懲罰的抑止では、代償は望ましくない行動の範囲を越える。その行動に成功しても被抑止側の状況は悪化すると示そうとする。軍事侵略に対して経済制裁を行うという威嚇が一例だ。
『Superintelligence Strategy』は「制御を失うリスクを冒しながらAIの独占を目指す国家は、プロジェクトが完成へ近づく前に競争相手から機能を破壊されると想定しなければならない」と断言する。攻撃はどれほど有効になりうるのか。これは拒否的抑止なので、望ましくない行動を直接妨げる方法に絞って検討できる。
そのような攻撃には、モデル開発への干渉が含まれる。事前訓練の間、モデル性能は細かく追跡されるので、訓練が「完了」するずっと前に干渉へ気づく可能性が高い。この種の攻撃で最善の場合でも進捗を失うだけであり、損害へすぐ気づけなかったとしても、開発者は再開するか、妨害工作前の既知の最良状態へ戻れる。
Stuxnetワームのような物理的効果をもたらすサイバー兵器は、ハードウェアを直接破壊するよう設計される。しかし攻撃に成功したStuxnetでさえ、影響を与えられたはずの遠心分離機のうちおそらく11%にしか影響しなかった。AIの計算資源を妨害する場合、物理的構成が異なり、異なる組織が運用することもある分散型ハードウェアへ対処するのは極めて難しい。このため、攻撃が標的ハードウェア全体を覆うよりはるか前に特定・阻止される可能性が高い(電源を切るといった単純な方法でも阻止できる)。したがって、せいぜい減速をもたらすだけだろう。
極超音速兵器、ドローン、宇宙配備兵器を含む通常兵器も、十分な範囲を攻撃する点で同じ問題に直面する。また公然の攻撃なので、防御側が重大な外交上・エスカレーション上の帰結を冒してまで使う意志があるかという疑問も生じる。エスカレーション・ラダーを用いれば、意志の問題に対処できる可能性はある。防御側は決意を少しずつ実証し、攻撃側が真剣に受け止める段階へ達せるからだ。
机上演習のSuperintelligence RisingとAI 2027では、米中が互いのAIプロジェクトへ(秘密裏の)妨害工作手段を用いることが、よく起きている。その結果、妨害工作のため進捗速度へ継続的な影響を受けながらも、双方がAIの進歩を続ける安定した力学が生じる。サンプルが限られているのは明らかだが、無制限の諜報活動、サイバー戦、さらには物理的攻撃によってAI開発を実際に停止できるシナリオには、まだ出会っていない。
『Understanding Deterrence』は、拒否と懲罰の区別について、もう一つの重要な側面を示唆している。拒否戦略は、信頼できる場合、懲罰戦略より安定し、エスカレーションを招きにくいと考えられることが多い。一方、望ましくない行動の失敗をほぼ保証できない限り、拒否戦略は十分な効力を持たないことがある。軍事的抑止では、防御側が信頼できる拒否能力を獲得できる場合が多い。MAIMの文脈では、抑止側は十分な程度の拒否を、信頼できる形で威嚇できないかもしれない。
抑止の計算
最後の二つの条件は、被抑止側の意思決定過程に関係する。
- 威嚇の効力が、潜在的な純利得を上回る。
- 被抑止側が代償と利益に十分反応する。
これらの条件を評価すると、MAIMという構想に内在する巨大な困難が明らかになる。
まず効力と潜在的利得(条件6)を考える。『Understanding Deterrence』は、重要な要因が攻撃側の動機の強さであり、それは望ましくない行動から得ると認識する利得と、威嚇から受けると認識する代償へ直接結びつくとする。『Superintelligence Strategy』は、そこに懸かるものを、すべてを左右するほど大きいと描く。潜在的な利得は、決定的な世界支配と恒久的な安全であり、潜在的な損失は、競争相手に従属させられること、競争相手に破壊されること、または無謀なプロジェクトが制御を失うことによる全生命の絶滅である。実存に関わると認識されたこの利害は、競争相手が先に到達しかねないと考えたり、長期的な安全への唯一の道と見たりする国家に、超知能を追求する極めて強い動機を与える。
この巨大な潜在的利得に対し、MAIMの威嚇が持つ効力は疑わしい。「信頼できる威嚇」で分析したように、MAIMの拒否的要素(特定のAIプロジェクトを妨害すること)には、失敗を保証する能力がなく、遅延と代償を課すだけである可能性が高い。世界支配という潜在的な目標へ競争相手が到達するのを、単に遅らせるだけの効力では、実存に関わる利害へ直面し、強い動機を持つ国家を抑止するには不十分に見える。したがってMAIMの威嚇が十分な効力を持つには、AI以外の資産への攻撃や、全面的な敵対行為にまで拡大する、より広い懲罰の威嚇へ頼る必要があるだろう。これはMAIMを、比較的安定した拒否の姿勢から、はるかに危険な懲罰に基づく抑止へ移行させ、制御不能なエスカレーションのリスクを著しく高める。
次に、被抑止側の反応性(条件7)を考える。抑止は完全な合理性を前提とせず、被抑止側が意思決定で代償、利益、帰結を考慮することを前提とする。ここで重要な要因はリスク許容度である。国家は個人と同様、リスク回避的な場合が多い。超知能を先に達成する潜在的な見返りが巨大でも、(妨害工作による)失敗確率が十分に高いと認識すれば、国家は不安定化をもたらすプロジェクトを思いとどまるかもしれない。たとえ期待値の計算ではリスクを取るほうが有利でも、巨額の投資を失ったり、エスカレーションを引き起こしたりする確実性が高ければ、リスク回避的な指導部を抑止できる。これはMAIMの有効性を支持する論拠を強めうる要因だ。
しかし、リスク回避へ依存することを複雑にする要因がいくつもある。超知能には前例がないため、恐怖や野心に駆られた指導者は、通常なら取らないリスクを受け入れるかもしれない。AI開発を民間企業が主導していることで、不作為に対する政府の認識が逆転する可能性もある。介入すれば勝利の可能性を損なうことを恐れ、国家が企業による超知能への前進を許すかもしれない。国内政治上の圧力、指導者固有の心理、または(マザーが述べるような)危機が迫っているという認識は、外部から見て「非合理的」または極めてリスク追求的に見える判断につながりうる。さらにAI開発の速度、支配に必要な能力水準、制御喪失の確率、妨害工作の有効性、エスカレーションの可能性をめぐる深い不確実性のため、明確な費用便益分析は極めて難しい。
この深い不確実性は、どちらの方向にも働く。国家が未知のリスクを賭けることを避け、慎重さと抑止へ傾く場合もある。反対に、最悪の事態を想定した思考、敵意があるという想定、避けられないと認識した破滅を回避するための先制的なリスクテイクを煽る場合もある。
最後に、双方が現状にどの程度満足しているかを問える。中国には、科学技術で優位を築き利用することで、国際的な成果のあらゆる領域において米国へ並ぶか上回ろうとする明確な意図がある。同時に米国にも、台頭する中国によって危うくなった西洋の価値をAIで守るという構想を追求し、攻撃側となる理由がある。どちらの大国も潜在的な劣位を受け入れることに満足しそうにないため、この抑止体制は極めて不安定である。
結論
抑止理論を適用すると、安定した戦略としての相互確証AI機能不全(MAIM)に重大な欠陥があることが分かる。『Superintelligence Strategy』は問題を有益な形で枠づけているものの、MAIMは中核的な要件を満たせない。AI開発に関するレッドラインが不明確で監視不能であること、威嚇の信頼性が疑わしいこと(妨害工作は阻止ではなく、遅延させるだけである可能性が高い)、そして巨大な利害と不確実性がもたらす不安定な抑止計算である。
不安定化をもたらす能力へ向かう競争相手のAI進歩を阻止することにMAIMが依存しても、妨害工作の能力には限界がある可能性が高く、不十分に見える。必要な効力を得るには、おそらく懲罰的抑止へ向け、危険なエスカレーションを行わなければならない。AIをめぐる深い不確実性と、競争する国家の強い動機のため、効果的な抑止に必要な予測可能性はさらに損なわれる。
こうした弱点には、より早く、もっと監視しやすいレッドラインを中心とする別の抑止体制によって対処できる。明確に言えば、高度なAIの開発中に抑止を試みることから、高度なAIの開発自体を未然に防ぐ抑止へ移行する必要がある。たとえばフロンティアAI開発に必要な先端チップの製造や、計算資源の(データセンターへの)集中という水準で対処する。このような体制へ移行すれば、高度なAIがもたらすほかの利益の一部を遅らせる代わりに、実用的な監視と阻止が可能になる。
輸出規制を除き、AIの進歩を今日止めるための威嚇や妨害工作が、すでに観察されないのはなぜか。今後の分析で有望なもう一つの領域は、現在はまだ成立していないものの、成立すれば米中が抑止体制を実際に導入すると予測できる状況を特定することである。
異なる国家的視点、特に戦略文化、リスク許容度、技術的優先事項における米中の違いを取り込むことも有望だと考える。これに隣接する研究には、代償を課すという威嚇だけでなく、利益を共有するための誘因や信頼できる保証も含む、より広い思いとどまらせる戦略を統合した抑止体制の研究がある。
そこに懸かるものはあまりに大きく、AI固有の難題に合わせた、厳密で継続的な分析と慎重な国家運営以外では到底足りない。