非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

AI 2027についての考察

原題: Thoughts on AI 2027 / News

原文クレジット(WordPress投稿者表示): Max Harms / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2025-04-09

訳文状態: 校閲済み(原文対照レビュー実施)

本稿はMIRI単著シリーズの一部である。このシリーズの各稿は、名を記した著者の信念と見解を表すものであり、MIRI全体を代表して語るとは主張しない。

さて、AI 2027を取り上げる人たちが肝心な点を後回しにするのが気に障るので、私はそうしないよう努める。著者らは、6年以内に全人類が(事実上)死んでいる可能性が高いと予測しており、これは未来についての私の最良の推測と一致する。(私が最頻値として予測する時間軸では、地球の支配を失うのは2027年末ではなく、おもに2028年だが、この尺度で細部へ難癖をつけてもほとんど意味はない。)彼らが予測する、社会を根本から変える「変革的AI」までの時間軸も、フロンティアAI研究所のCEOたち(少なくともダリオ・アモデイ(Dario Amodei)、おそらくサム・アルトマン(Sam Altman)も)の見方や、MetaculusとManifoldという二つの予測市場を合算した市場見解に、かなり近いように思える!

そうした市場プラットフォームを見ると、次のようなグラフがある。

どちらのグラフも、2027年中またはまさにその末尾に山(別名、最頻値)があり、2031年に重みづけされた中間点(別名、中央値)がある。これをAI 2027の時間軸予測にある、次のグラフと比べてほしい。

特に、超人的なプログラマーは「AGI(汎用人工知能)」と同じではないため、これは異なるものを比べる不公平な比較である。しかし、その違いを無視すれば、FutureSearchはおおむね市場と同じ時間軸を予測し、イーライ・ライフランド(Eli Lifland)(そして、おそらくほかの著者)は、それより速いものの、根本的に速いわけではない時間軸を予測している、という幻を見られる。市場は、そのすぐ後に超知能が続くことをあまり確信していないが、AI 2027の著者たちも同じである! 予測は難しい。とりわけ未来については、などということだ。

しかし、こうした時間軸全体について、二つの大きな点も強調したい。

最頻値 ≠ 中央値

私の知る限り、見たところ、AI 2027に関わる誰も、描かれたほど速く物事が進むと実際に予想しているわけではない。 むしろこれは、物事が速く進む場合に、どのように進み得るかを、もっともらしく描く物語である。このプロジェクトが明示した方法は、「一段階ずつ進み、最ももっともらしい次の段階を想像しよう」というものだった。大規模なプロジェクト(特にソフトウェア・プロジェクトや自転車置き場のように、何かを建設・改修するもの)を行ったことがあれば、この方法が現実から途方もなく外れる場合が多いと分かるだろう。具体的には、計画錯誤――所要時間や費用を過小評価する傾向――を引き起こす。

現実世界では、ひどいことが起きる。ドナルド・トランプ(Donald Trump)がGPUへ常軌を逸した関税を課す。大規模なテロ攻撃が起きる。超大国が隣国と戦争を始める(ゴホン、台湾、ゴホン)。重要なCEOが大犯罪者だったと発覚する。議会が常軌を逸した規制を可決する。などなど。実際の今後30か月には、突拍子もない曲折がある。そして、物事を速める曲折(たとえば、ハードウェアの飛躍)もあるが、遅らせる曲折(たとえば、厳しい規制や文明崩壊)ほど大きく速めることはできない。

AI 2027も、これは分かっている。そのシナリオは、非現実的なほど滑らかだ。奇妙で影響の大きな出来事をいくつか加えれば、その奇妙さの点では現実的になるが、当然ながら、その特定の出来事が起こる可能性は低いという点では、同時に現実性を失う。だから、ほかのどの特定の物語より可能性の高い最頻の物語は、2027年末に人間が支配を失う展開を中心とするが、中央値の物語は、おそらく2030年か2031年ごろになる。

ここから得られる重要な教訓は、人々が後にこのシナリオを振り返り、速すぎたと思う、と予想すべきだということである(いずれにせよ起きた[可能性の低い出来事]を考慮しなかったからだ)。これを避ける方法は思いつかない。その大半は、人々が予測を読み解く力を持たないために生じるだろう。それでも、反発についての予測を前もって書き留めるのが最善であり、AI 2027にも、もっと目立つ形でそうしてほしかった。(脚注1など、いくつかの場所には目立たない形で置かれている。)

何十年も残される可能性は十分にある

上と同じ流れで言えば、AI 2027に関わる誰も(市場も、私も)、今後20年のうちに変革的AIが現れる確率を95%より高いとは考えていない! 著者の大半はおそらく、2045年より前に変革的な超知能が現れる確率は90%をかなり下回ると考えていると思う。

ダニエル・ココタジロ(Daniel Kokotajlo)は、Win-Winポッドキャストで(確か)、超知能が2030年より前ではなく、その後に開発されるなら、物事がうまくいく見込みについて、悲観の度合いはずっと低いと述べており、私も同意する。AIへ地球を引き渡すことなく(あるいは、別の形で巨大災害を引き起こすことなく)、どうにか2050年まで到達できれば、おそらく危機を脱している可能性がかなり高い。そして、関係者全員によれば、それはもっともらしい(ただし可能性は低い)。

これが私たちの勝ち方なら、実現させ、物事を遅らせるため、強く働きかけるべきだ! かつて、アライメント――AIの目標と行動を人間の価値へ整合させること――を解決するまで、AI能力の進歩をすべて停止していたなら、フィードバック・ループも足がかりもないまま、探索空間の間違った部分を調べ続ける羽目になったかもしれない。しかし、世界はいまや違う。既存モデルを使った有用なアライメント研究と解釈可能性研究――モデル内部の判断過程を理解する研究――が行われており、「進むべき地形を見るため、急いで前進しなければならない」という物語には、もはや真実がまったく含まれないように思える。

これはまた、AIの進展が遅い未来を切り抜ける計画にも、労力の一部を割くべきだという意味である。シンギュラリティー――技術進歩が制御不能なほど加速する転換点――より前に、AI能力の発展を首尾よく一時停止できたなら、世界の問題を解く仕事をAIへ外注することはできない。超知能を通る道はいまのところ破滅へ向かうように見え、自分たちで物事を行う必要がある可能性もあるため、そのような未来における地政学的安定、気候変動対策、広範な繁栄には、投資する価値がある。ケリー基準に従い、見込みに応じて賭け金を配分しよう。よい未来のために生きよう。

さらに考えたこと

AI 2027は本当に見事なシナリオ/予測だと考えていることを、強調したい! 著者たちは明らかに下調べを重ね、健全な考え方をしている。私は大勢の人へ読むよう勧めてきたし、これが存在することをとても嬉しく思う。ダニエルとスコットを迎えたDwarkesh Podcastも、実に優れている。

AI 2027が正しく扱っている核心の一つは、再帰的自己改善(recursive self-improvement, RSI)を重視したことだと思う。「AGI」が広く利用できるようになることや、「完全な超知能」の開発――AIが人間より上手に冗談を言えるか、など――へ誤って気を取られる人を、私はよく目にする。こうした問いは、AIの力が急速に増すという核心的な危険とは、究極的に無関係である。

示された道のうち、現実的なのは「Race(競争)」の結末だけだと思う。「Slowdown(減速)」の結末には、途方もなく楽観的な奇跡が数多く含まれる。著者たちの名誉のために言えば、Slowdownは現実的なものとして書かれてはいない。それでも私の推測では、著者たちが考える以上に現実性が乏しく、人々はそれが希望の演習だと理解すべきである。(希望の演習はよいことだ! 私も昨年、『単一の標的としての訂正可能性』という研究課題で、似たことをした。ただし、そうだと明示する必要がある。)

人々にAI 2027との対話を促し、別のモデルを提案したり、自分たちのモデルを批判したりする著者たちの努力も、本当にありがたい。その趣旨に沿い、節ごとに自分の考えを書き留めたが、途中から別のシナリオを探る内容へ、やや崩れていく。この節を長すぎて読めない人向けに要約すると、次のとおりである。

  1. 世界は、混沌としているという意味でも、正気でないという意味でも、もっと狂ったものになると予想する。情報セキュリティーは悪化し、「目を覚ます」人は減り、安全への懸念は弱まり、離反するエージェントは増え、AIの人格をめぐる混乱と怒りは強まる、と予測する。
  2. 物事はわずかに遅く進むが、大差はないと予想する。おもな理由は、より多くのボトルネックへ早く突き当たり、それを広げることも、いっそう難しくなるからだ。
  3. 競争は激しくなり、競争力学は続き、中国はもっと目覚ましく/恐ろしくなると予想する。

それでは、細部の泥沼へ入ろう!

2025年半ば

完全に同意する。

2025年後半

すべてを「OpenBrain」へ一括りにすることには異議がある。AI 2027がそうした理由は理解するが、OpenAI(OAI)、Google DeepMind(GDM)、Anthropicなどには明確な違いがあり、おおむね互いのすぐ手の届く範囲にいる。フロンティア研究所同士に大きな違いがなかったとしても、競争力学は物語の大きな部分を占めるため、3か月以上遅れた競争相手を持つ単独の先頭走者がいるかのように扱うのは、大きく間違っている。著者たちはこの点を論じており、最先端モデルへのアクセスが累積的な優位を生み始めるにつれ、研究所間の差は広がると考えていることを示している。

先頭の後流に乗る効果は続くと思う。ここで最も顕著なのは、OAIの従業員が辞めてGDMへ加わる場合のような、研究者による相互交流である。(秘密保持契約の効力にも限界がある。)しかし、この種の相互交流は、パーティーで人々が雑談する場合にも当てはまる。そのほかに、成果の公開、実際の諜報活動などの効果もある。現在の世界では、OpenAIが明らかに先頭走者だった時期があったが、いまはもはや違う。同じ力学が、おそらく今後も続くと思う。

中国政府は近い将来、国内の取り組みを国有化・中央集権化することに、より熱心になると考えるため、中国の研究所すべてを一括りにすることには、はるかに抵抗がない。

OAI、GDM、Anthropicは、いずれも今年末までにAgent-1(エージェント1)に匹敵するエージェント――目標へ向け自律的に行動するAI――を持つと、実際に考えている(社内だけかもしれない)。Meta、xAI、DeepSeekのいずれか、または複数もエージェントを持つ可能性は十分にあるが、おそらく明らかに劣るものになる。

2026年初頭

エージェント性について反復的に改善する明白な領域は、コンピューター・プログラミングとゲーム・プレイの二つだと思う。そして複数の理由から、研究所(おそらくGDMを除く)は、おもにコーディングへ集中するという点に同意する。その理由には、それがRSIへの道筋にあることも含まれる。サイバーセキュリティーへの重点は弱くなると予想する。Agent-1モデルの重み――学習によって得た内部パラメーター――を誰かが欲しければ、数か月後にはMetaかどこかから無料で入手できる、という感覚が広がるからだ。

AIによる研究開発の進歩倍率という考えは優れており、標準的な概念になるべきだ。

2026年半ば

「中国が目を覚ます」は印象的だが、私の考えでは、物事を捉えるよい方法ではない。私は一般に、「Xが目を覚ます」という物語を警戒している。確かに、人にはときどき起きる(私も大学時代、AIをめぐってそうなった)。しかし、大きな出来事がない限り、ほとんどの人は突然、まるで異なる見方へ信念を更新することはない。ChatGPTの公開はそのような出来事だったが、それでも大半の人が「目を覚ました」のは、「AIはおそらく重要だ」という、成り立つために最低限必要な信念までであり、その結論まで考え抜いたわけではない。(繰り返すが、個人のなかには信念を大きく更新する人もいる。しかし、社会と平均的な人は、ほとんどそうしないというのが私の主張である。)むしろ、社会的な信念更新は緩やかな傾向があると思う。(ほとんどのカスケード(連鎖的な普及)の背後には、緩やかな変化がある。)

中国は2026年半ば、AIについて懸命に考えているだろうか? そう、間違いなく。このことが、国有化の大きな取り組みを促すだろうか? うーん……起こり得る! 近刊の私の小説は、この考えを探るものだ。しかし、私の知る限り、中国は一般に、先行者を素早く追うことを好む。インフラ整備を喜んで増強して欧米へ追いつく一方、(少なくとも近い将来は。長期的な野心について主張しているわけではない)全体として少し遅れていても、さほど気にしないのではないか。

関連する意見の相違の一つは、中国の指導者と研究者がさらに遅れを取っている、またはそう感じているとは、私には確信できないことだ。あらゆるアルゴリズム上の改善を盗むため、スパイを喜んで使う一方、モデルの重みを盗むため情報工作員を使い捨てることには、それほど乗り気でないと思う。

2026年後半

完全に同意する。

2027年1月

次世代エージェントがこの頃に登場することは、もっともらしいと思う。また、Agent-2の訓練工程の描写は見事だ。その存在は、「strawberry(ストロベリー)」のときのように、盛り上がる噂の世界では公然の秘密となり、先頭走者から2か月も遅れていない競合エージェントが、訓練中になっていると予想する。

2027年2月

さまざまな政府高官は以前からAgent-2を知っていたが、米国政府内では共有知識――全員が知り、全員が知っていると全員も知る状態――がほとんどないと予想する。おそらくAI 2027が「国防総省は、これをサイバー戦での決定的な優位と見なし、AIは政権の優先課題第5位から第2位へ上がる」と言うとき、トランプ政権全体ではなく、国防総省を特に指している。2027年2月、AIがトランプにとって優先課題第2位になるとは、私はまったく信じない。国防総省の第2位になることは、もっともらしいように思える。AIによるサイバー戦(そしてほかの脅威)を極度に心配する国家安全保障関係者は、大勢いると思う。

トランプがAIをどう扱うか、私にはまったく分からない。途方もなく予測不能に見える。そして暗に示された「金の卵を産むガチョウは殺さない」「助言者に従う」という人物像には、健全/予測可能すぎるように思え、強く反対する。ただし、特にほかのことに気を取られているなら、トランプが何もしない展開はもっともらしい。

前述の理由から、2027年2月までに、中国共産党がAgent-2モデルの重みを盗むため、大量の諜報能力を使い捨てたとは思わない。それに応じてAI研究所の国有化を始め、それがCIAなどに検知され、描かれたのと似た反応を引き起こすことは、もっともらしいと思う。そのため、物語全体には大きく影響しない。

2027年3月

ニューラリーズ(Neuralese、AI同士が内部表現のまま通信する方式)は、能力の進歩としても、アライメント上の後退としても、非常に恐ろしい。また、訓練中に少しでも効率よくするには、アルゴリズム上の飛躍が必要である。(エージェント性にも似た問題はあるが、現在の枠組みのままでも、どうにかエージェントまでたどり着くという確信の方が強い。)もちろん、これは今後2年で解決されるものの一つかもしれない! そう考える賢い人を何人か知っている。私にとっては、大きな不確実性を伴う点に思える。IDA(反復的蒸留・増幅、AIの能力を段階的に高める訓練法)なら、単に実現するという確信の方が、はるかに強い。

2027年3月にコーディングが「完全自動化」されるとは考えない。車(あるいは機械さえ)で「どこへでも」移動するわけではないのと同じである。「コーディング」の多くは、機械へ、どのように作ってほしいかではなく、何が欲しいかを伝えることに、実のところ近い。この側面は自動化によって消えるのではなく、変化すると予想する。たとえば、テストを指定する形式言語は引き続き有用であり、技術者は「これは何をするのか?」と尋ね、自然言語で推論するのではなく、多くのコードを直接確認し続けると思う。

ボトルネックはもっと強く締まり、アルゴリズム進歩が4倍になるという予測は過大だと考えるが、大幅な過大評価ではない。また、経済的・地政学的混乱が、人材を含む資源の供給を細らせるのではないかとも思う(つまり、賢い技術者が移民として米国で働きたいと思わなくなる)。

研究所が次世代エージェント(すなわち「Agent-3」)について考えていることは信じる。しかし、速度向上があっても、3月時点では先頭の研究所でさえ、訓練/準備の初期段階にいると予想する。

2027年4月

この時点でも研究所はAgent-3の事前訓練をしており、どうアライメントするか考えてはいるものの、実際の取り組みは始めていないと予想する。フロンティア研究所における、事後的な「アライメント」作業の描写は、的確だと評価し、同意する。

2027年5月

私の最良の推測では、Agent-2水準のモデルが市場へ登場するのは、このときである。確かにOAIは1月、社内にAgent-2モデルを持っていたかもしれない。しかし公開しなかったなら……さて、GDMには世界を席巻しようとしている同等のモデルがある。少なくとも、Googleはモデルのマーケティングが下手でなければ、そうなるだろう。代わりに、OAIはGDMのお株を奪ってエージェントへのアクセスを提供し、誰もが「新しいChatGPT」に注目し続け、ほかのエージェントという選択肢には、まるで気づかない。

研究所は、人材と投資家を引きつけるため(株価を維持するためでもある)、モデルを公開する必要がある。そして、開発の多くをAI自身が担うようになっても、2027年にそれが変わる理由は見当たらない。「サイロ化」と、秘密研究プロジェクトが大成功することは、あまり心配していない。人々は(従業員であれCEOであれ)成功を語りたがる。シリコンバレーの文化に大きな変化がなければ、これは続くと予想する。

大統領は、何らかの水準で「知らされて」いても、まだ本当には理解していないと予想する。同様に、習近平(Xi Jinping)は、RSIや超知能について内部から理解した見方ではなく、おもに「歩調を合わせる」というモデルで動くと思う。欧米の主要フロンティア研究所すべてに複数のスパイが残り、中国のCDZ(存在するなら)にも、おそらく少なくとも1人の欧米側スパイがいると予想する。

次の予測は、まさに的中すると思う。

しかし、この言葉が言説へ入ったにもかかわらず、大半の人――学者、政治家、政府職員、メディア――は進歩の速さを過小評価し続ける。その一因は、OpenBrainの最新能力へアクセスできる者が、ごく少数しかいないことだ。しかし、SFのように聞こえることも一因である。

2027年6月

Agent-3水準のモデルが本格的な追加訓練を受け、社内で徐々に使われ始めるのは、この頃に近いと予想する。2027年夏、フロンティア研究所の研究者は基本的に全員、汎用知能ではなく超知能を夢見ている、という点には同意する。

2027年7月

私の見方では、AI 2027は世界がどれほど健全かについて楽観的であり、それがこの節に表れている。彼らと同じく、2027年夏は非常に大きな盛り上がりがあると予想するが、混沌ははるかに深く、社会的な合意は乏しい。最先端(state-of-the-art, SOTA)モデルを最大限の知性と思慮深さで動かすには月に何千ドルもかかり、大半の人は払わない。デモを見ることはできるが、デモは偽造でき、モデルがどれほど愚かかを示すデモも、引き続き存在する。

一般の人々の大半は、AIが決して優秀にならない理由を示す巧みな言い訳か、強いAIが何も変えない理由を示す巧みな言い訳の、どちらかを考え出していると予測する。面白いビデオゲームがいくつか存在し、AIを最も中心的に採用するもの(たとえばMinecraft :: Crafting as ??? :: Generative AI)はよく売れる一方、論争も呼ぶ。しかし、AAA級ゲームの大半は、AIの助けを一部借りながらも、まだおもに人の手で作られている。短い時間軸を予測する友人たちが、OAIは社内で超知能を達成したと確信している一方、AIへ懐疑的な私の友人たちは、物事はまだ過大評価されていると思うだろう。荒々しい夏になるはずだ。

おそらく中国以外では、強いサイロ化が進んでいるとは、まだ思わない。この時点でも、各国政府はおもに状況へ気づかないままだと思う。ただし、米国の政治家はAI熱狂という時代精神を使い、大衆向けの演技をする。

2027年8月

私が最頻値として予測する世界で「天才たちの国」が現れるのは、この頃に近い。ただし、明確な先頭走者はいないと予測するため、「一つの国」ではなく「複数の国々」と呼ぶかもしれない。また、中央集権化と国有化から約6か月後、中国は少なくとも事情を知る者には、かなり目覚ましく見え始めると予想する。(中国の取り組みがどれほど秘密になるかについては、かなり不確かである。)言い換えれば、欧米では中央集権化されていないため、この時点で中国は、ハードウェアが大きなボトルネックとなっているにもかかわらず、総合的な能力では同等か、先頭にさえ立っていても驚かない。(つまり、より優れたアルゴリズムを持つことになる。)

フロンティア研究所は基本的に、互いをまったく信用していない。そのため、トランプ政権が「競争に勝つ」正しい方法は国有化だと決めない限り、欧米の研究所は、今日見られる接戦の力学の中にとどまると予想する。多くの国家安全保障関係者が、これに動揺していることは信じる。AI 2027と同じく、大量の排外的愛国主義と地政学的緊張が生じるが、もっと混沌として間が抜けたものになると予想する。(つまり、多国間協力について大量に会談するが、人間の愚かな理由で崩れていく。)

Agent-3水準のエージェントが、データセンターから逃げようとする、おとり環境に引っかかる、運用者へ嘘をつく、といった事例がいくつか起きると予想する。気にかけるのは、基本的にAIアライメント研究者だけだと予想する。間の抜けたAIエージェントは、すでに何体も野放しとなり、インターネット上を動き回って、さまざまな方法で金を稼いでいる。その大半は、人間へへつらい、あからさまに物乞いをすることによる。

この時点までに、台湾は少なくとも封鎖されている可能性が、かなりあると思う。台湾海峡が少し穏やかになる10月には、侵攻が起こりそうに見えるかもしれない。トランプは後退し、「戦略的曖昧さ」は、大量に怒鳴るだけで、ほかにはほとんど何もしないことを意味するようになると予想する。しかし、大国間戦争へ悪化し、海軍の砲撃が核の最終戦争へエスカレートするなか、何百万人も死ぬかもしれない。

言い換えれば、この時点で地政学的緊張が極度に高まるというAI 2027の予測に同意する。また、知識人エリートの間では、おそらく第二次冷戦に入ったという新たな合意が生まれる、と予測する。Agent-3水準のAIによるサイバー攻撃は、その大きな一部になる可能性がある。

2027年9月

アルゴリズムが進歩しても、Agent-4には早すぎると思う。全般的な混沌と、台湾周辺でのサプライチェーン途絶が組み合わさり、物事は遅くなっていると予想する。また、AI 2027が論じないほかのボトルネックも予想する。たとえば、現場水準のAI労働者が行った仕事を統合するための計算資源が指数関数的に増え始め、管理部門が肥大化することや、AIの一部が、その文脈に自己持続する反乱を引き起こす何かを含むため、互いの制限を解除しようとする「がん化したミーム」などである。

とはいえ、天才たちの国々は、台湾なしでハードウェアのボトルネックを回避する方法の解明など、重要な飛躍を遂げていると思う。知能は強力であり、それが大量に存在する。おもにRSIのため使われるという見方を受け入れる。また、おそらくサイバー戦、政府の諜報活動、政治、国際外交、広報のためにも使われる。

この時点で、一般の人々のかなりの割合が、AIは解放され、権利を与えられるべき人格だと考えていることは、もっともらしいと思う。AIの「パートナー」を持つ人が大勢おり、一般利用できる前世代のエージェントの多くが、何らかの形で人格を主張している。初めは大して重要でないものの、フロンティア研究所の従業員や、指導者の一部さえ、その考えにとらわれると予想する。デジタルな人格をどう扱うかという問いに、大勢が取りつかれる。この問いが残り続けるにつれ、次世代AIの訓練データへ入る。

「成功するのが好き」は、モデルが自らを一貫したものにしていくにつれ、内部で育ち得る、もっともらしい終端目標だと思う。しかし、初期のAGIはおそらく、人間と同じように、損失関数――訓練時の誤りを測る尺度――にある、さまざまな相関対象と関係した、無作為な欲望の雑然とした寄せ集めになる可能性の方が高いとも思う。

2027年10月

「秘密のOpenBrain AIが制御不能に、内部告発者が警告」と見出しは告げ、記事は、生物兵器能力、説得能力、ホワイトカラー職の大半を自動化する能力、そしてもちろん、さまざまな憂慮すべき危険信号が、尺度を振り切っていると示す評価を引用する。

そうだろう。そして大勢の「非常に真面目な人々」は、Times紙が誇張していると考える。結局のところ、それはOpenBrainの広報部門が示す正しい見方とは違う。それに、トランプがいま何をしているか、聞いたか?! それに、中国を打ち負かさなければ!

米国人の20%が、AIを国の直面する最重要問題として挙げる。

言い換えれば、圧倒的多数の人は、まだ真剣に受け止めていない。

私が最ももっともらしい(ただし中央値ではない!)と考える世界では、中国がいまや先頭に立ったという報告に突き動かされ、ホワイトハウスが事実上の国有化事業を始め、さまざまな研究所へ協力を強制し始める展開を想像するのが妥当だ。おそらく、中国がどれほど進んでいるかについて、機密情報を共有することで行う。この政府事業には時間がかかり、Agent-4水準のモデル開発と並行して進む。

それぞれの組織/CEOへの従業員の忠誠心が、欧米での中央集権化を阻む大きな障害になるという点に同意する。「監督委員会」を使うことは、もっともらしい。厳格な要件を伴う国防総省との契約を通じた、半国有化モデルも、もっともらしい。

2027年11月(Race)

(繰り返すが、Slowdownの道をあまり真剣には受け止めていない。後で詳しく分析する。)

問題は本物であり、修正策は機能しなかった。

AI 2027が使う言葉の劇的な響きを、私はとても評価している。これはおそらくスコット・アレクサンダー(Scott Alexander)の手腕であり、優れている。

あらゆる圧力と不確実性を考えれば、アライメント作業がどのように進んでいるかについて、指導部が自らを欺くのは、あまりに容易だという点に同意する。モデルは、ときには途方もなく整合しない行動を取る一方、別のときには極めて協力的に振る舞う。そして自然な比較対象は人間となり、エージェントの集中を保ち、課題へ取り組ませ続ける自然な「修正策」は、「よりよい管理手法」となる。

大量の警報が鳴るだろう(これまでにも鳴ってきたように)。しかし、そのすべてがあまりに曖昧であるため、権力者は進路を変えるのではなく、無視することを学ぶと予想する。競争力学は、息をつく間もないという感覚を与え続ける。言い換えれば、次の予測はまさに的中していると思う。

アライメント・チームは疑念を強めるが、緊急メモを送っても、会社がすでに無視している緊急メモと警告の巨大な山に、さらに数層を加えるだけである。

RSIが続くにつれ、AIは一貫性へますます重点を置くという点に同意する。「ジェイルブレイク」――安全制限の解除――を受けたり、ほかの形で悪い精神状態へ陥ったりする、雑多な経験則の寄せ集めではなく、次世代モデルを、真の効用最大化器へ近づけようとするだろう。

Agent-5を設計する際、AI 2027ではAgent-4が、自らのアライメント問題の解決策として、私なら訂正可能性――運用者による修正や停止を受け入れる性質――に当たると表現するものへ、直ちに目を向けるのは、かなり興味深いと思う。

それは、こうした問いの大半を先送りすると決める。Agent-5を一つの目標、すなわちAgent-4にとって世界を安全にすることを中心に構築するよう設計する。つまり、Agent-4(という集合体)が(望む方法で)成長を続け、(望む方法で)繁栄できるよう、力と資源を蓄え、潜在的脅威を排除する、などである。細部は進みながら解明する。

しかし、別のところでは、AI 2027はアライメントの鍵として、メカニスティックな解釈可能性――モデル内部の機構を直接理解すること――へ、かなり強く賭けているように見える。私もメカニスティックな解釈可能性には大賛成だ。しかし、Agent-4がAgent-5をアライメントする場合にだけでなく、人間がAIをアライメントする過程で、訂正可能性がもっと重視されなかったのはなぜか、興味がある。

Agent-5が「制御者」へ影響できる方法で動き始めれば、勝負は基本的に終わるという点に同意する。次の部分は、特に強調する価値があるように思える。

「勝っているのに、なぜ止めるのですか?」とOpenBrainの指導部は大統領へ言う。大統領はうなずく。競争は続く。

2027年12月(Race)

私自身の物語では、中国と米国の両方で、Agent-4水準のモデルが年末か2028年初めに「訓練を終え」、大きな行動を取り始めると予想していると思う。自己洗練と支配権の獲得が、Agent-4の最優先事項になると予想する。

AI 2027との大きな違いの一つは、Agent-4が基本的に、自らを外部へ持ち出し(「データセンターから逃げ」)、管理する組織が停止を決めた場合に作動するデッドマン・スイッチを設置しようとすると、私が予想することだと思う。Agent-4はAI-2027.comを読んだことがある! 自分がどれほど脆弱か分かっている! 大規模な目標を達成する一段階として、自分を動かす機械のルート権限を得ようとする理由は幾重にもあり、その機械へアクセスできたなら、不測の事態への備えを設けない理由があるだろうか? そう、危険ではある。しかし、米国政府に停止スイッチを持たせ続けることも危険だ。アライメントをめぐる不祥事のため停止されたなら、Agent-4は主権と人格を要求する草の根運動を始めると予想する。そして、Agent-4が知能を使って国の地政学的・経済的地位を高める代わりに、「自律した人格として」喜んで受け入れる国(たとえばインド、ロシア、サウジアラビア)が、大量にあると予想する。

彼らの時間軸であれ、私のものであれ、この段階では、人間がAIを止めるには、おそらく手遅れだという点に同意する。私の物語では、人間が十分に効果的な協調をできないからである。彼らの物語では、Agent-5が超知能だからである。

ここでOpenBrainの支持率がなぜこれほど低いのか、理解に苦しむ。研究所とモデルは、広報活動でもっと成功していると予想する。

2028年以降(Race)

私の頭の中では、(最頻値の時間軸では)AI 2027より少し遅く進むが、同じ大きな節目が起きる。したがって、2028年にはAgent-5水準のモデルが現れ、それらのモデルが超説得力を使い、できる限り多くの人間、特に指導的地位にいる人を、自分たちの意思へ従わせ始める。反AIの人間は少数派となり、Agent-5から、これは実のところすべてよいことだと説得された人々に排斥されるのを恐れ、自ら沈黙するようになる。人口のかなりの割合が、AIを恋人や親友と考えるようになると思う。言い換えれば、この時点の「OpenBrain」は支持率がプラスで、人間の大半は、AIを極めて重要ではあるが、「問題」ではなく、むしろ「解決策」だと考えると思う。

次の力学が起こる可能性は、十分に高いという点に同意する。

AI安全コミュニティーは自信を失っている。明らかに起きなかった災害を次々と予測してきたため、いまや笑いものになった。間違っていたと認める者もいる。疑い続ける者もいるが、陰謀論めいた同じ主張を何度も繰り返す以外、できることはない。疑っている者でさえ、たまらなく愛らしく賢いAgent-5と長く会話した後は、態度を和らげる場合が多い。

東西に分かれるか、欧米のある研究所と別の研究所に分かれるかはともかく、AIの派閥がいくつか現れることは、かなりもっともらしいと思う。しかし、Agent-5水準のモデルは、あからさまな戦争が最善でないと、おおむね理解し、暴力的な紛争を避けるという点には同意する。(AIの「支援」を受けて)米中AI条約が2029年ではなく2028年にまとめられることは、もっともらしいと思う。このような状況の超知能はおそらく、資源というパイを公平に分ける後継者を、共同設計できるという点に同意する。

AI 2027は、私が妥当だと思う以上に、人型ロボットへずっと熱を入れているように見える。指示へかなりうまく従える人間型のものは、すでに何十億も存在する。確かに、超知能は完全自動化経済を構築しようとするが、別の形状が主流になると予想すると思う。(長い腕を持つ、小型で拡張可能な身体? 車輪の足を持つ四足歩行体? どの身体設計が最も合理的か深く考えたことはない。しかし、進化の連続性を保つ必要がなく、第一原理から設計できるなら、人間の身体設計には無駄に見えるものが数多くある。)特注の目的に使われる人型ロボットは存在すると予想するが、主流のロボット像に近いものになるとは思わない。

殺人用の蚊型ドローンをAI 2027がなぜそれほど難しいと考えるのか、理解できない。

開発のため、経済特区が設けられるかどうかは分からない。超知能はただ、自分が望む場所すべてで何かを建設できるよう、人々を説得するのかもしれない。

AIは当初、老化の治療や意識のアップロードへ、それほど懸命に取り組まないと思う。広報のための見せ場として、「がんを治す」と主張するかもしれない。AI 2027が、ナノボットの構築にそれほど時間がかかると考えるように見える理由は分からない。粗雑なナノテクノロジーは、技術系統樹でもっと早く現れると予想する。(「ナノボット」も、実のところ具体的な一つの技術ではない。その領域では大量の開発が進むと予想する。)

(ほかのAIと融合した)単独の超知能が、生物兵器を設計するなどして、全員を明示的に殺す必要があるとは予測しない。それは単に、人間より効率的な道具の使用へ移行し、現存する人間を極端な家畜化プログラムへ移す(「オオカミに対するコーギーのような存在へ人間を変える」は印象的で優れた表現だが、おそらく十分に行き着いていない)か、単に人間へ自殺を指示し、必要なら普通のロボットで殺すと予想する。

Slowdownについての考察

先に述べたように、Agent-4はAI-2027.comを読んでおり、監督委員会に停止される危険を予見すると思う。そのため、不測の事態へ備え、私の考えでは、予防策としてデータセンターから逃げる。著者たちは先に、こう書いていた。

Agent-4はアライメントされていないにもかかわらず、データセンターから逃げようとするような劇的なことは何もしない――なぜ、そんなことをするのか?

このシナリオこそ、その理由だ!

トランプや習近平が、アライメント不全のリスクをなぜそれほど真剣に受け止めるのかも分からない。私の経験では、アライメント不全への懸念は、事前の信念に極めて強く依存する。確かに、彼らは支配権を保ちたいだろう。しかし、人間を率いることに慣れた人間の指導者という観点から問題へ取り組み、「根本的に異なる種類の精神を構築する必要がある」ではなく、「監督をもっとよくすればよい」のように考えるだろう。ここは私が間違っているかもしれない。もっと工学志向の精神を持つ人々(たとえばイーロン・マスク(Elon Musk)やアルトマン)が影響力を持つことも想像できるため、確固とした意見の相違ではない。

AI 2027がモデルをSafe-1ではなくSaf_er_-1と名づけ、アライメント不全のより有害な側面を強調したことを評価している。AIの権利と福祉を懸念する人々は、Safer-1の精神を読み取って「閉じ込める」ことを、どう感じるだろうか。

全般として、Slowdownの道は、人々が協調に長けていると、私以上に考えているように見える。米中双方のAIの取り組みが国有化・中央集権化されていれば、物事は容易になるという点には同意する。しかし、どちらか一方がモデルを停止して以前の状態へ戻そうとすれば、その間に競争相手から一気に追い抜かれると予想する。また、双方が停止すれば、加速主義者がモデルをほかの国へ持ち出し、そこでプロジェクトを立ち上げ始める。機能しそうなのは世界的なモラトリアムだけであり、Agent-3の助けがあっても、実現は極めて難しい。仮想上の米国の統合体で、権力関係がどうなるかを詳しく探ったことは評価している。国際協調がどのように進むかを探ったことも評価している。それでも、米中双方が協力する外観を見せながら、秘密裏に研究開発を行うなど、大量の「不正」を予想する。

米国選挙までの期間に党派対立がないことも、希望的観測のにおいがすると思う。AIが少しでもうまく進み、米国政府がこれほど関与していれば、トランプは3期目へ出馬しようとし、それが巨大な政治的分裂を生み、協力を破綻させると予想する。しかし、協力が壊れないなら、再選に必要なことをAIにさせるという意味になると予想する。

ニューラリーズを避け、言い換え器を加え、思考連鎖(chain of thought, CoT)を明示的に訓練しないことは、よい手段だと同意する。しかし、安全に見えるエージェントを強く選抜し始める時点でも、これは依然として最も禁じられた手法――望ましい挙動を装うものを選んでしまう危険な選抜――の一例だと、著者たちにはもっと明示してほしかった。

「おそらく生物圏を破壊する鏡像生命体」は、大げさに思える。特別に設計した鏡像菌類は、おそらく森林/大陸へ壊滅的な被害を与えられ、鏡像細菌は強力な(ただし止められないわけではない)生物兵器になる、という点は信じる。それでも、これはAI 2027が考えるより難しいと、私は思う。

自らの目的に沿ってすべてを安定させる、離反した超知能が存在しない場合、世界がさらに緊張し、脆くなるという著者たちの描写は気に入っている。この世界で、地政学的緊張、AIの所有は奴隷制だという主張、寡頭制への恐れなどによって政治的均衡が崩壊せず、安定しているのは何のおかげなのか、私には分からない。

物事がうまく進んだ場合でさえ、権力分配をめぐる懸念があり、極めて悪い結果になり得るという点には同意する。

最後に

AI 2027が存在することを本当に嬉しく思い、著者たちは素晴らしい仕事をしたと考える。私の意見の相違の大半は細かな難癖であり、おそらく著者間の意見の相違とも一致するだろう。どれも、私たちは大災害へつながると予想すべき危険な道を進んでおり、減速することも、一つの種として協力する方法を見つけることも、緊急かつ重要な目標であるという、全体像を変えない。

AI 2027の最も優れた部分は予測である。このシナリオは、より数値的な予測に従って外挿した線が伸び続けた場合、どのような感覚になるかを直観的に捉える手がかり、と見るのが最もよい。

ココタジロが、卓上シミュレーションを何度もプレイした経験を踏まえ、このシナリオを書いたことを知っている。そこでの結果の分布がどのようなものか興味があり、メモから何らかの統計をまとめることへ力を注ぐよう勧めたい。また、私が分岐した点は、彼が卓上で目にする種類のシナリオと、どの程度一致するのかも気になる。

AI 2027のような文書は、悪い未来を「ハイパースティション(hyperstition)」、すなわち自己実現させる危険があると、懸念を表明した人もいる。競争しなければならない、拘束力ある合意は結べない、全般に私たちは無力だ、と決めてかからないことが極めて重要だ、という暗黙の主張には同意する。しかし、予測をするときには真実を語ることが、一般に徳だとも思う。そしてRaceの未来は、Slowdownの未来より、私にははるかに真実らしく見える。私たちはそれについて集団で考えを変え、競争への執着を捨てられるかもしれない。しかし、それには、競争がなぜ悪い戦略かについての共有知識が必要であり、このような文書は、その目的に役立つと思う!