非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

MIRI:2024年の使命と戦略の近況

原題: MIRI 2024 Mission and Strategy Update / MIRI Strategy

原文クレジット(WordPress投稿者表示): Malo Bourgon / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2024-01-04

訳文状態: 校閲済み(原文対照レビュー実施)

10月にお知らせしたとおり、私はCEOとしてMIRIの経営を率いる役目を引き受けた。前任者の大きな足跡を継ぐ、重い責任であり、担えることを光栄に思う。

2020年の戦略報告以来、MIRIにはいくつか変化があった。さっそく説明しよう。1


要点:

私たちは、人間より賢いAIに制御を奪われることで、人類が絶滅し、未来が生みうる価値が失われると予想している。AIアライメント分野が、それを防げるほど速く進歩できる可能性は、きわめて低いと考える。

しかし、ChatGPTの公開など、この1年の出来事は、多くの集団でオーバートンの窓、すなわち公に議論しやすい意見の範囲を動かしたようだ。政策担当者も含め、AIによる絶滅リスクがはるかに多く議論されるようになり、その質も大きく改善したように見える。

そこに一筋の希望がある。世界が十分に針路を変える行動を取るには、まだ世論のさらなる変化が必要だろう。それでも、アライメントしていない、人間より賢いAIの開発を防ぐため、政府が意味のある規制を導入する可能性は高まったように見える。また、人類が、差し迫った危機の時期を終わらせることを正面から目指す、新たな巨大プロジェクトに取り組む可能性も、以前より現実的に思える。

そこで2023年、MIRIは3つの目標を追求する戦略へ切り替えた。

  1. 政策:世界の主要な政府が、人間より賢いAIに向けた進展を停止する何らかの国際協定に至る確率を高める。停止は、関係する現象について人類がもつ知識と、その理解への根拠ある確信が大幅に変わるまで、そして、悪意のある者や不注意な者の手に渡らないようシステムを守れるまで、続ける。2
  2. 発信:状況についての私たちの見方を、幅広い人々に伝える。とくに、重要な論点を語ることが、その論点を普通に議論できるようにする助けになる場合を重視する。
  3. 研究:複数の研究に投資を続ける。技術的なアライメント研究も含むが、政策介入で時間を稼げなければ、成果が出るまでに間に合うという期待は薄くなっている。また、政策と発信の目標を支える研究も行う。3

発信は、政策目標を達成するための支えと考えている。また、率直で正直に伝えることは、重要な見方や論点をオーバートンの窓の中に入れる方法でもある。このように正直であることは、一般に、基本姿勢としてよいものだと思う。

3つすべてに取り組む計画だが、今後のMIRIでは、研究より政策と発信の優先順位が高くなりそうだ。4

以下では、MIRIがこれまでたどってきた道筋と、現在の戦略を論じる。今後、一つか複数の記事で、政策・発信の活動や研究計画を、さらに詳しく説明する予定だ。

この記事は、MIRIとAGIリスクについて、ある程度ご存じであることを前提にしている。そうでない方には、エリエゼル・ユドコウスキーの最近の短いTED講演をお勧めする。

超知能AIは世界を終わらせるのか?|エリエゼル・ユドコウスキー|TED

併せて、TEDのページに挙げられた次の資料も参考になる。


MIRIの使命

MIRIは一貫して、人間より賢いAIのある世界への移行を人類が安全に乗り切る確率を高めることに重点を置き、長期的な未来をよいものにすることを目指してきた。これらのシステムの登場を安全に乗り切れれば、前例のない繁栄につながると考えている。

その使命への取り組み方は、年月を通じて大きく変わってきた。

2000年、エリエゼル・ユドコウスキーとブライアン、サビーネ・アトキンスがMIRIを設立したときの目標は、人間より賢いAIへ、できる限り速く到達することだった。人間を超える知能には人間を超える道徳性が伴う、という前提があったからだ。だが、当初は「友好的AI問題」と呼んでいたアライメント問題を初めて調べる中で、エリエゼルは、「知能が高ければ道徳性も高い」という自分の考えは完全に間違っていたと結論した。MIRIは2003年ごろ、重点をアライメント問題へ移した。

その後も戦略を改め続けてきた。およそ2006〜2012年は、存続リスクの削減と領域を超える問題解決能力に注目するコミュニティや研究分野、たとえば合理性コミュニティを築くことが主眼だった。2013年からは、エージェント基礎研究と、MIRIの外で生まれつつあったAIアライメント分野をよい出発へ導くことに重点を置いた。2017〜2020年には、新たな工学的要素の強いアライメント研究へ、主な関心を移した。

そして今、数年にわたり方向を見直し、さまざまな選択肢を探った末、政策と発信を最優先にしようとしている。使命に貢献する方法として、現在はこれが最も有望に見えるからだ。

大きく言えばMIRIは、人類とその未来を深く大切に思い、人間より賢いAIの開発を安全に乗り切る難しさについて、おおまかに共通する直観をもつ人々が、より明るい未来のために力を合わせる場所だ。「自分のアイデンティティを小さく保つ」という精神から、MIRIという組織の定義には、それ以上のものを詰め込みたくない。昔から「MIRIらしい」と思われてきた信念や戦略が間違いだとわかれば、それを捨て、先へ進めばよい。

この背景を踏まえ、次にMIRIが最近、具体的に何をしてきたか、そして今後どうするつもりかを述べる。

2021〜2022年のMIRI

2020年12月に公表した前回の戦略報告で、ネイト・ソアレスは、2017年に始めた研究への集中的な取り組みについて、こう書いた。「現時点で、そのプロジェクトは大部分、失敗した。エリエゼルも私も、主要な努力をそこへ注ぎ続けるほどの期待を、もうもてないという意味だ。[……]今は態勢を立て直し、選択肢を比較し、まだ成功の可能性があると思える計画を探している。」

2021〜2022年に重点を置いたのは、次のことだ。

この時期の中心的な文章には、次のものがある。

これらを含むMIRIの文章は、戦略の全体像に対する私たちの見方を伝える助けになったと感じている。その見方は、戦略をどう変えたかを理解してもらううえでも重要だ。主に伝えようとした点は、次のとおりである。

  1. 私たちの基本的な予想は、人類がまもなく、人間より賢いAIを開発するというものだ。7 世界はそれに備えていない。急いで進めば、人類が絶滅し、未来が生みうる価値が破壊される可能性が非常に高いと考えている。
  2. 現在の世界の状況は、私たちには極めて厳しく見える。たとえばエリエゼルは2021年末に書いた。「今の盤面は信じられないほど暗いと思う。懸命に働くだけで抜け出せる道は、実際には見えていない。私の背景モデルのどこかを覆す奇跡を期待することはできるし、その未知の奇跡に備えようとすることはできる。」
  3. 厳しいと考える主な理由は、人間より賢いシステムをアライメントする方法についての人類の技術的理解が、おそらく必要な水準をはるかに下回ることだ。MIRIも含め、必要なものに比べれば、進歩はこれまでほとんどない。また、これまでの分野の大半は、核心的な難しさとは別方向の話題に取り組むか、その難しさを仮定によって消してしまう方法で問題に近づいていると見ている。
  4. 諦めるのは間違いだが、楽観的な仮定を積み重ね、もっと楽観的ではあっても現実ではない世界の中で考えるのも間違いだ。何らかの突破口が得られるとすれば、おそらく予想外の方向から来る。現実との接点を保っていたほうが、その機会を生かせる可能性も高いだろう。

エリエゼル・ユドコウスキーはTIMEの記事で、世界が自滅するのを政府が防ぐために、最低限必要だと考える政策を述べている。実際の強制力を備えた国際協定によって、新たな大規模学習を、終了時期を定めず世界中で停止することだ。同記事のLessWrong版は、説明を補う追記をいくつか加え、さらに詳しく論じている。

そのような停止を課すだけの政治的意思や合意がない場合、最も注力すべき政策目標は「停止スイッチ」の整備だと考える。将来、政策担当者が必要だと判断したときに、危険なプロジェクトを停止したり、分野全体に無期限の停止を課したりすることを可能にする、法律上・技術上の能力をそろえるということだ。停止できる選択肢をもつことは、正しい方向への重要な一歩になる。

こうした国際協定を先回りして成立させ、有効に履行させる難しさは明白だ。そのため最近までMIRIは、関係する技術的な進歩がこれほど乏しくても、AIアライメントを通じてAGIの拡散に対処する解を見つけることに、はるかに大きな期待を置いていた。

しかし、最近のいくつかの出来事が、その考えを変えた。第一に、誰かが時間内に技術的な解決策を見つけるという期待が下がった。第二に、発信の取り組みがある程度成功したことで、その方向への期待が高まった。

状況は依然として暗いと考えているが、1年前の見立てよりは、少しましに見えるようになった。この新しい希望の源は、AIをめぐる公の議論が最近変わったことにある。

2023年の新たな展開

これまでMIRIは、主にアライメント研究と、技術的な読者、つまり関連する技術の仕事をする可能性のある人々への発信に時間を使ってきた。

今年のいくつかの出来事を通じて、政策担当者と、AI研究者や一般市民など政策担当者に影響しうる集団への働きかけを重視し、発信を優先すべきだと考えるようになった。

  1. GPT-3.5とGPT-4は 目覚ましいものだった ――私たちの一部が予想した以上に。 もともと実現までの期間は短いと考えていたが、これらの公開によって一部のメンバーは、追加のアルゴリズム上の進歩が比較的少なくても、あるいはまったくなくても、世界を破壊しうるAGIを人類がつくってしまう可能性について、さらに悲観的になった。
  2. 一般市民や政策担当者は、予想以上にAGIの存続リスクの議論を受け入れ、その反応もかなり理にかなっていた。 たとえば、2月のBanklessでのエリエゼルのインタビューと、3月のTIMEの記事への反応は、うれしい驚きだった。後者は1週間、TIMEで最も閲覧されたページになった。その記事でも、AIリスクを初めて聞いた専門家でない人々の多くが、かなり理性的で地に足のついた反応をすることに、私たちは驚いたと述べている。
  3. より広く見ると、機械学習分野も含め、オーバートンの窓が「AGIによる絶滅リスクをもっと真剣に受け止める」方向へ動いた。 ジェフリー・ヒントンとヨシュア・ベンジオの公の発言は、その転機になったように見える。DeepMind、Anthropic、OpenAIのCEOと、ほかに何百人ものAI研究者や有識者が署名した、次の1文の声明も同様だ。

AIによる絶滅のリスクを減らすことは、パンデミックや核戦争のような、社会全体に及ぶほかのリスクと並んで、世界的な優先課題とすべきである。

2023年のこの変化を示す最近の例が、米国上院の超党派AI Insight Forumの一つへの私の参加だった。議論がここまで進んだのを見て、励まされた。シューマー院内総務は、AIが破滅的なシナリオにつながる確率について、「p(doom)」という言葉を使って出席者に尋ね、会を始めた。上院議員や職員たちは話を聞き、メモを取っていた。年初には、これほどの関心や受け止め方を予想していなかった。

大規模学習を止める議論を、政策担当者がすぐには受け入れないとしても、今は、前例をつくり政策の土台を敷く重要な時期かもしれない。たとえば、存続そのものを脅かすほどではないが重大なAI災害が起きるという不幸な場合に、政策担当者や有権者がいっそう危機感を強めたら、その土台を発展させられるからだ。

こうした政策努力が私たちを救う可能性は、非常に低いように思える。だが、私たちの知るほかの計画は、さらに成功しそうにない。そこで、一般向けに発信する体制を整え、その活動を拡大し始めた。

今後について

この先1年も、政策、発信、研究の活動を続ける予定だ。501(c)(3)の団体であるため、政策活動にはある程度制約があるが、より自由に政策提言できる、別の組織形態の団体の人々と密接に協力している。発信チームを拡充し、AIの存続リスクの基本的な議論を広く伝える能力を高めている。もちろん、アライメント研究も続けており、新しい発想を探るとともに、成果をよりよく伝えられるよう、研究チームを広げている。

拡大するMIRIで直接働くことに関心があれば、採用ページの募集をご覧いただきたい。


  1. この記事について貴重な意見を寄せてくれた、ロブ・ベンシンガー、グレタ・ドゥレバ、マット・フォールショー、アレックス・フェルメール、リサ・ティアガート、ネイト・ソアレスに感謝する。↩
  1. ネイトが「すばらしい未来には超知能AIが必要だが、それだけではまったく足りない」で書いたように、人類が人工超知能を一度も開発しないとしたら、私たちはそれを大変な悲劇と考える。ただし規制当局にとって、「今なら安全にAI能力を高められる」という境目に達したと判断するのは、難しいかもしれない。

    ネイトが提案する代替案の一つは、ゼロからAGIをつくろうとすることをやめ、人間の全脳エミュレーションや認知能力の強化を目指すことだ。こちらはリスクがはるかに低く、成功基準もずっと明確なので、行政・官僚機構が理解して判断できる形で示す難しさを、大部分避けられる。そして、アライメント済みAGIが近い将来にもたらすはずの恩恵、たとえば存続リスクの削減の多くを実現できるかもしれない。↩

  1. MIRIの中でも、この点にどれくらい期待するかは人によって異なる。ネイトとエリエゼルはともに、現在の認知能力のままで人類が技術的アライメントに挑むべきではなく、たとえば精神のアップロードによって人間の認知能力を強化し、もっと賢くなった人間やトランスヒューマンに、アライメントを解明してもらうべきだと考えている。↩
  1. リサのコメント:

    この全体的な選択について、個人的には異なる意見を記しておきたいと思います。

    短期的には、実効的な規制を目指す発信や政策活動でMIRIが貢献できることに同意します。しかし中長期では、研究のほうが私たちの比較優位は大きく、実証研究の人員も増やしつつ、引き続き大きな重点を置くべきだと考えます。研究を続け、安全基準などの規制活動を支える技術的な仕事へ、焦点をもっと移すべきです。実証研究だけでなく、たとえばエージェント基礎研究の経験から理論的な枠組みをつくることも含みます。一般向けに哲学的な議論を伝えることより、政府の科学顧問、規制当局、研究所の意思決定者へ向けて、なぜAIリスクがあり、なぜ低減する意味があるのかを示す、より強い技術的な、理想としては実証的根拠のある研究上の議論こそ、いっそう欠けていると感じます。それはMIRIならではの貢献ができる部分かもしれません。また、今後1〜3年という短期に大きな規制上の成功を期待するよりも、研究所の意思決定者へ影響し、安全性のリスクについて学術・研究上の合意を強めることのほうが、大きな効果を生むと個人的には予想しています。

    さらに、安全基準の領域で、指標を使ってどう規制するか、どう科学的に正しく行うかという重要な未解決問題を解くことは、少なくとも今後1〜2年の優先事項だと思います。この知識の土台づくりに、MIRIのようなAI開発研究所ではない組織も含め、多様な視点が参加することが重要です。↩

  1. エージェント基礎研究チームの場合、人数は変わらなかったが、拡大のための努力は行わなかった。↩
  1. Redwood Researchなど、AIの存続リスクに取り組むほかの組織のため、共同作業スペースや関連基盤を整える手伝いもした。私たちはRedwoodを高く評価している。MIRIの、はるかに特殊で限られた研究領域に明らかに合うわけではない研究者や技術者には、そちらへの応募をしばしば勧めている。↩
  1. ここで「まもなく」とは、おおよそ、「不確実性は大きいが、AGIまであと数年しかないという可能性は十分に現実的であり、たとえば30年以上先である可能性は、もはや高くない」という意味だ。2023年秋、MIRIの研究者の大半に行った調査では、このMetaculus市場の定義によるAGIの実現は、中央値で9年、平均で14.6年後と予測された。一人は52年という外れ値だったが、大多数は10年未満と答えた。↩