本稿はMIRI単著シリーズの一部である。このシリーズの記事は、名前を記した著者の信念と意見を表し、MIRI全体を代表するとは主張しない。
0.
可能な限り大まかに言うと、超知能(あらゆる知的能力で人間を大幅にしのぐ高度AI)がもたらす脅威は、次のようなものだ。
- 人間がシステムを改善し、(最終的には)システム自身も自らを改善する組み合わせによって、システムはさらに強力になり続ける。
- ある時点で、そのシステムは、人間の生存と両立しない堅固な目標を発達させる。
- ある時点で、そのシステムは、人類に気づかれないか、人間の抵抗に打ち勝てるだけの技能と力を持つ形で、目標達成の計画を遂行するのに十分な運用能力を得る。
この程度の詳しさでは、人々は決まって、この図に対して次のような異論を出す。
- なるほど。でも、制御できないほど強力になる前に、システムをさらに強力にすることを、単にやめればよい。
- なるほど。でも、システムが人間と両立しない目標を発達させるのを防ぐか、発達したときに(現実の問題を起こせるほど有能になる前に)検出する方法を見つければよい。
- なるほど。でも、システムの振る舞いを追跡し、懸念すべきパターンに気づくか、現行犯で捕まえればよい。
はっきりさせておくと、こうした異論は不合理ではなく、それを提示する人々も、ばかげていたり混乱していたりはしない。大ざっぱではあるが、問題の素描も大ざっぱである。そのように表面的な水準で会話すると、単にそういう姿になる。
(懸念の根拠を、この10項目の一覧のように、もう少し長い形で示せば、異なる、やや細かい一連の異論を引き出す傾向がある。問題を30秒ではなく10時間考えれば、当然、さらに微妙な見方になる。)
しかし、楽観的/懐疑的な側の多くの人は、最初の30秒で誤りを犯し、考え続ける間も、その誤りを犯し続ける。そのため、10時間、100時間、1000時間と注意を向けても、誤った道をどんどん先へ進むだけになることが多い。「セキュリティ思考」に通じた人なら、おそらく、その誤りを見慣れているだろう。楽観論者は、起こる可能性のあることを、成り行きに任せた場合に起こると予想すべきことと取り違えている。
厳密に物理的な意味では、AI開発者が、例えば、設計するシステムが制御不能なほど強力になる前に「単にやめる」ことは、本当に可能である。(まさにその行動について人類を協調させることが、現在のMIRIの主な重点である。)
しかし、それが物理的に可能だという事実から、懸念する理由がないとは言えない。ハッカーが、大手金融機関を攻撃しないことを単に選ぶ可能性もある。しかし、大手金融機関が、それを主要な防衛戦略として頼るよう勧めるセキュリティ・コンサルタントは、ほとんどいないだろう!
この種の選択肢の捏造、つまり、
楽観的/懐疑的な側が、現実の不都合な部分を軽く流し、考えるのが不快な、より困難で高価だが実行可能な戦略より、聞こえがよいだけで実行不能な戦略を勧めること
は、残念ながら、超知能の潜在的脅威をめぐる会話の領域全体に蔓延している。自分へ問うべきなのは、「物事がうまくいく、もっともらしく聞こえる物語を作れるか」ではない(それは、ほぼ常に可能だ)。そうではなく、「現在の状態の世界を眺め、人類に都合のよい奇跡を何も加えず、単に『動画を先へ再生』したら、何が見えると予想するか」である。
本稿の残りは、AIが、送電網、金融システム、インターネットなどの重要インフラを「乗っ取る」ことをめぐる議論に、この二分法が現れる事例研究である。目的は二つある。第一に、当初の懸念の議論に対する、特定の欠陥ある反論群へ、対象レベルで反対する議論を読者へ示すこと。第二に、希望的観測と細部への不注意という一般的なパターンが別の場所で顔を出したとき、読者が、さらに容易に見つけられるよう備えることだ。
* * *
主張:超知能は、私たちの経済とインフラの重要な側面を最終的に制御し、その資源を自らの目的のために徴用する(少なくとも、人間の監督外で独立した電力供給と供給網を立ち上げるため、うまく使う)立場になる可能性が高い。攻撃的または敵対的な行動は、一切必要ない。近未来の強力なAIには、重要システムの制御権を奪う必要がない。人間が進んで熱心に鍵を渡し、成り行きに任せれば、取り返せるかもしれない短い機会を逃す。
(欠陥のある)反論:
- 人類は、そもそも重要なシステムへAIを足がかりとして入れない。
- AIが重要なシステムへ組み込まれる範囲では、人間が制御を保ち、理解できない形で自律的に振る舞わせない。
- AIが、理解できない形で自律的に振る舞い始める範囲では、それを止め、制御から取り除く。
- 止めて制御から取り除けない範囲では、送電網や経済の大部分を停止するなど、さらに抜本的な行動について協調する。
- 将来の人間が、遅すぎたと判断する時点ではなく、適切な時点で、そのような行動を取る。
本稿の範囲外にある事柄は、次のとおりである。
- 人工知能が、世代から世代へ、どのように改善し、この過程が人間の制御外で、どう続き得るか。
- 人工知能が、作った人々の意図と無関係な目標を、どのように発達させ、その目標が人間に悪いものとなる傾向があるのは、なぜかという議論。
- インターネットで文章を送受信できるAIが、どう「脱出」し、独立した活動基盤を、うまく築くかについての精密な詳細。
1.
はるか昔の2016年、GoogleはDeepMindのAIを使い、自社サーバーのエネルギー使用を最適化して、冷却に必要なエネルギーを40%減らした。
2020年末、AlphaFold2が「タンパク質折りたたみ問題を解いた」ことは有名である。それまで専門のバイオエンジニアによる、労働集約的な試行と分析が必要だったことを、ボタンを数回押し、数秒待つだけで成し遂げられるようになった。
初期のアライメント・安全研究者は、近未来のAI開発者が、生まれかけの超知能を、どれほど厳しく封じ込め、制約するかについて、よく議論した。大半の研究所は、信頼できる監督者が扱う入出力用の単一テキストチャンネル以外と、AIを物理的に完全分離するところまでは行かないかもしれない。それでも、モデルを開かれたインターネットへ……ただ放つほど、無謀な人はいないはずだ。そうだろう?
残念ながら、その研究者たちは、AIへ何をするのが安全で合理的かについての自分たちの観点が、平均的な「速く動き、物を壊せ」型ソフトウェア技術者の観点と合う程度を、過大評価していた。
今日、OpenAI、Anthropic、DeepMind、Meta AIなどの現代的研究所は、当然のように、訓練時、モデルへインターネット全体を与える。モデルが任意のコードを書き実行することを、わずかな名目的な人間の監督しかない状態で許すことも多い。モデルが一般公開されると、技術者と起業家は例外なく競って、利用できるすべての道具とデータベースへ、モデルを接続する。
人々がそうする理由は、働くからだ。効率と有効性が本当に向上し、その向上は収益化できる。超知能はおろか、汎用知能にもまだ明らかに届いていない、今日のAIでさえ、あらゆる種類のシステムやタスクを、安価、迅速、信頼できるものにする。
そして次第に、建築家が通常、建物は送電網へ接続されると仮定するのと同じく、AIとの統合を当然のものとして、システムと過程が作られている。昨日の前例のない40%の効率向上が、明日の基準になる。昔ながらの方法でタンパク質の形を解明することも、まだ可能だが、そうせざるを得ないのでなければ、誰も行わないだろう。
現在、Claudeは一部のタスクで優れ、ChatGPTは別のタスクで優れている。さまざまな組織と集団も、それぞれ、特定のタスク用に特別に調整した、独自の特注版を持っている。次第に、ますます多くの力をAIの手へ置いている人や機関は、一般に、見つけられる(または購入できる)最良のAIの手へ、その力を置いている。そして、より優れた選択肢が使えるようになるたび、上位版へ乗り換えることをためらわない人が大半だ。
(現代のAIが、乗り換え費用を減らすため、特にそうなる! 以前は、旧式ソフトウェアを捨て、新しいものを選ぶと、さらに高価だった。アーキテクチャーを苦労して作り直し、古いデータを新しい形式へ骨を折って変換する必要があったからだ。最近のAIは、そのすべてを背後で処理することが、ますます得意になっている。)
この地勢が永遠に寄せ集めのままであり、一つだけ飛び抜けて最良のモデルは、決して現れない可能性もある。しかし、大手AI研究所の一つ一つが、唯一の最良モデルを作る意図を持つことは、指摘する価値がある。明示的な目標は超知能である。あらゆることを、どの人間(またはほかのどのAI)よりうまく行う一つのシステムであり、最先端にいる人々は、誰が最初に開発できるかを競っている。
しかし、今日のAIと明日の超知能との間には、明確な境界線がない。限界的な進歩と、さらなる限界的な進歩があるだけだ(AI開発にAIを使うことが、ますます実行可能になるにつれ、指数関数的に加速する限界的進歩になる可能性もある)。一方、原理上、システムが強く柔軟なほど、実際には、さらに至るところで使われる。
したがって論理的には、将来のある時点で、何らかのシステムが人類全体への脅威となるほど強力になるという前提を受け入れるなら……
……まさにそのシステムは、すでに人間の経済とインフラの多くの部分を動かしているものとなる可能性が高い。
私たちへの脅威となるシステムは、ほとんど定義上、存在する中で最も強力なシステムになる。そして、存在する中で最も強力なシステムとは、最も幅広いタスクで、最も高い性能を示すものである。現在のパラダイムでは、最も幅広いタスクで、最も高い性能を示すシステムは、さらにお金を稼ぎ、さらに多くの命を救い、さらに技術を進めるため、役立つものすべてへ直ちに接続される。
十分に強力なAIが重要システムへ入り込むのを、私たちには防げないというだけではない。防ごうとさえしない。私たちはすでに、正反対のことをして利益を得ている。
2.
非常に単純な玩具的例として、同じ強さのAIを使い、デイトレードの指針を得る二つの投資会社を想像しよう。
最初の会社には、AIの提案を実行する前に分析することだけを仕事とする、チーム全体がいる。AIが、なぜその取引を勧めるかを理解したい。Y社の株価は上昇し、Z社は下落すると予想させたものが何だったかを引き出したい。AIが生成できる限り詳しく、自らを説明するよう求める。その説明で明確にならない部分は、コードを調べ、テストとシミュレーションを実行し、内部で何が起きているかを突き止めようとする。
第二の会社は、単にAIの提案へ盲目的に従う。
デイトレードAIが成熟し、実際に人間のデイトレーダーを一貫して上回る世界では、第二の会社が、はるかに、はるかに多くのお金を稼ぐ。単に、1日当たり数百件、数千件多くの取引を実行できるためだ。
この原理は、あらゆる領域のあらゆる種類の強力なシステムへ一般化される。比喩を使うと、犬はおいしい食べ物と面白い玩具を欲しがるが、その食べ物と玩具を存在させるため、供給網と製造能力を築いたのは人間である。
調子の悪いおなかへの最良の解決策が、アマゾンの菌類から得た抗生物質、ドイツ鋼のメス、日本で設計された顕微鏡をまとめる、広大に枝分かれした技術ツリーを通るかもしれないとは、犬にはまったく思いつかないだろう。しかし、犬を元気にしたい人間は、獣医学を発明し、仕事を成し遂げるため、戦略的可能性空間の中をそこまで遠く進んだ。
高度AIへ、例えば、すべてのがんを治す方法を尋ね、それが実際に答えられるなら、勧める計画は、ほぼ間違いなく複雑で謎めいており、一見無関係な現実のさまざまな断片を、不可解なほど特定の順序で組み合わせるものになる。
重要なのは、超知能の要点そのものが、私たちよりはるかによく世界を見て理解し、最良の解決策を見つけるため、私たちよりはるかに遠くへ手を伸ばせることなので、その戦略の少なくとも一部を追い、理解することは、私たちには本当に不可能になると予想すべきことだ。チェスの初心者は、チェスのグランドマスターが、なぜ特定の駒を動かしたかを理解しない。そして世界最高の囲碁棋士は、相当な割合で、AlphaZeroが何をしているのかを今でも理解しない。特に、私たちが理解できる言葉で説明するよう求めれば、超知能の推論の一部を追えるかもしれない。しかし全体として、超知能が用いられる目的は、私たちには解きほぐすのが複雑すぎる、一連の問題である。
今日のシステムは、超知能にはほど遠い。しかし超知能へ向かって進んでおり、ここからそこまでの道は、滑らかで連続しているように見える。今日のシステムが、すでに不透明で判然としない形で、よいことを起こすのは事実である。そして、自由に行動させることに、(お金、市場シェア、権力と影響力の面で)明確な優位が、すでに見つかる。この力学は、能力が向上するにつれ、加速する一方である。
一部の個人や集団は、本当にAIの「制御を保ち」、自律的に振る舞うことを拒むかもしれない。しかし、そのような人々は、慎重さを捨てた別の人々に、徹底的に競争で負ける。
3.
オースン・スコット・カード(Orson Scott Card)の古典的SF『エンダーのゲーム』の続編では、人類の多惑星文明「百世界」すべてへの脅威に見える状況が生じる。
(ネタバレを最小限にするため、詳細は伏せる。)
状況を検討した人々は最終的に、解決策は単純だと判断する。恒星間インターネットを短時間停止し、主要サーバーをすべて同時にオフラインにし、各装置を再接続する前に、ソフトウェア更新を受け取ったことを確認するだけでよい。この計画を一般に説明し、全員が停止期間について協調し、数か月以内に実行を終える。
10代の私は、物語のこの要素を当然のように受け入れた。大人になった今、恒星間旅行や超光速通信よりはるかに空想的であり、物語全体で最も飲み込みにくい部分だと感じる。
この状況の一版が、現在の地球で起きると想像しよう。どこかの小さな研究チームが、迫り来る実存的脅威を発見し、1か月間、必死に解決策を探す。そして、ありがたいことに、インターネットを3日間停止するだけでよいと発見する。これで危機は避けられた。
世界の働き方についての直観に従えば、次に何が起きるだろう。
問題は、インターネットを物理的に停止できないことではない。停止には、協調、協力、合意が必要なことだ。これは、人類全体には現在ない、十分な制度的信頼の問題である。左派と右派の双方が耳を傾ける単一の権威はなく、英語圏も欧州もロシアも中国も*、政治指導者全員が従う専門家集団もない。停止へ「賛成」と言う連合へ、どれほど多くの科学者と将軍が加わっても、反対勢力は必然的にまとまり、「反対」側は、全員が同時に行動する必要のある取り組みを妨害するのに十分な抵抗を生み出せる。
これは、完全な思考実験ではない。1931年、トーマス・エジソン(Thomas Edison)が亡くなったとき、米国政府は追悼のため、全国の電力を2分間、停止することを短時間検討した。反発は速く明確だった。2分間の停電で数千万ドルの生産性が失われ、不必要に人命を危険にさらす、と批判者は主張した。提案は弱められ、最後にはハーバート・フーバー大統領(President Hoover)が、1分間、自発的に照明を暗くする取り組みを率いるにとどまった。
この状況では、想像上の終末の筋書きと比べ、何が必要なかったかに注目してほしい。特定の脅威を信じる必要はなかった(反対側は、その脅威を誇張され大げさなもの、場合によっては、自由を奪う口実として、何もないところから発明されたものだと特徴づけるだろう)。世界的協調は必要なかった。数日間のインターネット停止に必要となるような、長期にわたる追加計画は一切、必要なかった。単にスイッチを切る以外に、ほかのことを行う必要はなかった。
「先駆者を追悼すること」は、「本物の実存的脅威から守ること」より、動機づけとして、やや弱いのは事実だ。しかし、本物の実存的脅威への協調行動が可能なのは、その脅威について共通の信念がある場合だけである。2003年のニューヨーク大停電は29時間続き、約5000万人に影響し、最大90人が死亡した。2021年にテキサス州の送電網が2週間以上停止したときには、約700人が命を失った。どちらの場合も、何十億ドルもの損失が出た。同様または、さらに大きな損害を、自分たち自身へ与える必要があると主張する人は、同情的な聴衆に対してさえ、苦戦するだろう。そして、話し手が誰でも、聴衆の大きな部分は同情的ではない。組織された反対を前に、共通の信念を作るのは難しい。そして、検討中の行動が人命を奪い、10桁ドルの費用を伴うとき、組織された反対は自然に現れる傾向がある。パラノイア、党派性、外国人嫌悪、プロパガンダ、あからさまな偽情報の間に、関係する指導者と利害関係者の間へ打ち込める、くさびはいくらでもある。
つまり、楽観論者と懐疑論者が、懸念への返答として「必要なら、単にすべて停止できる」といった文を発しても、技術的には間違っていない。サーバーは実際、停止できる。送電網はオフラインにできる。いざとなれば、世界はハンマーに満ちている。
しかし実用上、そのような文は、インターネットを停止することや、国全体への電力を切ることを提案するのと、およそ同じだけ役に立たない。現在のAIは、電気やインターネットほど、日常生活と完全には絡み合っていないが、そうなりつつある。すでに、1931年の米国人が電気に依存していたのと同じ程度、私たちはAIに依存していると言ってもよい。明日、AIがすべてオフラインになっても、すぐには気づかない機関は、まだ存在するが、2年前より少ない。経済はまだ、ChatGPTと後継を消化している途中だが、本当に消化しており、社会の構造が、AIに決定的に依存する新しい層を、その上へ築くまで、長くはかからない。オフラインにすれば痛みを伴い、その痛みの大きさは、日ごとに増している。
(現代の高度AIについては、「オフスイッチ」に似たものが、現在何一つ存在しないことも、言及する価値がある。何らかの仮想的な危機の筋書きで、大統領が明朝、目を覚まし、すべてのAI研究所は直ちに停止する必要がある、と発表しても、次に何が起きるかは、まったく明確でない。)
制御を逸した高度AIへの、何らかの大規模な対応を協調することは、途方もなく難しい課題である。そして、それを 迅速に 、不確実で急速に変化する状況下で行う必要がある範囲では、現実的に不可能である。「単に停止できる」は、捏造された選択肢だ。
4.
今日のシステムには、実際に人類を脅かせるだけの力はない。そのため、懸念に対し、「停止するには早すぎる」と容易に言い返せる。
明日のシステムには、人類を脅かせるだけの力があるかもしれないが、それは十分に曖昧であるため、その問いについて合意はない。超知能に明確な境界はない。もう一歩だけなら、確実に安全だと論じる、知識があり、もっともらしい専門家は、必ずいる(その一歩が、確実に生み出す膨大な価値を身ぶりで示しながら)。
一方、実用上、後退は決して受け入れられない。AIの現在の状態がどのようなものでも、生命と生計が依存している。AIを配備し、1週間に100人の命を救う状態から200人の命を救う状態へ進む病院は、奇跡である。AIを過程から取り除こうと提案する病院は、最近まで受け入れられていた現状へ戻るのではなく、1週間に、救えたはずの患者100人を殺している。
次々に強いシステムが登場し、直ちに力を与えられ、すぐに捨てるには重要すぎるものになる。現在の最良システムのプラグを抜くと予想される費用は、世代ごとに上昇するだけなので、仮想的な『エンダーのゲーム』型介入の可能性は、ますます遠のく。
オースン・スコット・カードの想像では、この時点で起きるのは、真剣な人々の決定的多数が全体像を見て、自分たちの進む軌道を認識し、力を合わせ、災害を避けるために必要な行動について協調することだ。
現実に実際に起きるのは、行き詰まりである。険悪な議論、中傷、思い悩み。その間にも研究所は仕事を続け、システムは成熟し続ける。
この物語には、人類が減速し、問題あるシステムをオフラインにすることが、(文字どおり物理的な意味で)まだ可能な瞬間は、多数ある。しかし、現在は存在せず、その土台を今築く必要がある協調構造がない限り、私たちが実際にそうすると予測するのが合理的な瞬間は、一つもない。
狭い教訓は、システムが目を覚まし、力を集め、本物の脅威へ進化するために機会の窓を必要とするなら、人類は、内部の意見対立と決断まひを通じ、その機会を与える可能性が高い、ということだ。現在、私たちは、楽観論者が軽く退ける種類の脅威へ、楽観論者が想像する方法で対応することが、制度的に不可能である。
さらに広い教訓は、そのような大ざっぱな決めつけ自体が、現在の状況を悲惨なものにする、重大な要因の一つだということだ。会話のあまりに多くが、誇大宣伝と標語の中で行われ、利害関係者のあまりに多くが、現実の具体的な細部へ関わることを、あまりに進んで拒む。
これらは容易な問題ではなく、残念ながら、迅速で容易な解決策には向いていない。しかし、そもそも問題に気づくことは、暗闇の中を走り続ける状態からの大きな改善である。AIをめぐる将来の会話へ、「でも、それは実際には、どう働くのか」や「待って、何がそれを真実だと思わせるのか」のような雰囲気を持ち込める範囲では、正しい方向への一歩に思える。