非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

人工知能による長期的な壊滅的リスクを減らす

原題: Reducing Long-Term Catastrophic Risks from Artificial Intelligence

原文クレジット(WordPress投稿者表示): Kolya T / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2024-11-07

訳文状態: 校閲済み(原文対照レビュー実施)

(PDF版はこちら)

1965年、著名な統計学者I・J・グッドは、人工知能がある水準を超えると、雪だるま式に自己改良が連鎖すると提案した。AIは自分を賢くできるほど賢くなり、賢くなると、さらに改良できる点を見つけ、人間の能力をはるかに置き去りにするというのだ。[3] グッドはこれを「知能爆発」と呼んだ。後の論者は「技術的特異点」、あるいは単に「シンギュラリティ」と呼んでいる。[10] [21]

機械知能研究所(MIRI)は、そのような事態がいつか起きる場合に、大惨事になるリスクを減らすことを目指している。活動には研究、教育、会議の開催がある。本文書では、AIのリスクを真剣に受け止めるべき理由を駆け足で紹介し、リスクを減らす方策を提案する。

私たちが取り組むこと、取り組まないこと

MIRIが関心を寄せるのは、賢く、領域をまたぎ、人間以上の能力をもち、自己改良する人工知能の登場だ。いつ開発されるかについて、特定の時期を予測しているわけではない。AIの登場がよい結果になる確率を高めるため、どこに働きかけると効果が大きいかを分析したい。うまくいくか、悪い結果になるかを予言することが、私たちの役目だとは考えていない。結果が決まっているなら、介入を試みても意味がないからだ。AIは主に新しい洞察を要するソフトウェアの問題であり、ムーアの法則で解決するハードウェアの問題ではない、と私たちは見ている。関心があるのは、主張する細部の一つ一つに根拠を示そうとする合理的な分析だ。面白い細部をいくつも創作して、それぞれには根拠を示さない物語づくりではない。

悪意ではなく、無関心

AIが、群れの中で地位が低いことに霊長類のような不満を自発的に抱き、「ロボットの反乱」を起こすという擬人化された発想は、SFの世界のものだ。もっとありそうな危険は、悪意ではなく、人間の生存には希少な資源が必要だという事実から生じる。AIは、その資源を別の用途に使うかもしれない。[13][14] 広く行き渡ったデータネットワークや自律ロボットへのアクセスなど、現実世界へ働きかける手段をもつ超知能AIは、利用できる太陽・化学・核エネルギーをすべて活用するなどして、環境を根本から変えうる。そのAIが、人命を支えるよりも自分の目標に役立つ自由エネルギーの使い道を見つければ、人類が生き残る見込みは低くなる。

多くのAIは、自己改変の後に何らかの目標を最大化するよう行動するという意味で、最適化システムへ近づいていくだろう。[1][13] たとえば、進化の圧力のもとで生まれたAIは、繁殖適応度を最大化する価値観をもつよう選択され、人間を支えるより繁殖へ資源を配分したがるだろう。[1] こうした危険なAIは、強くなるまで、安全で善意ある存在を積極的に装うかもしれない。破壊されれば、目標に向けて働けなくなるからだ。そのため、幅広い種類のAI設計は、当初は安全に見えても、シンギュラリティに至るまで開発されれば、自分の目標に合わせて地球を最適化する過程で、人類を絶滅させうる。

知能爆発は突然起きるかもしれない

知能爆発の速さは、相反する二つの力で決まる。AI技術が改善されるたびに、さらなる改善を研究するAIの能力は高まる。他方、簡単に実現できる改善が尽きるにつれ、その後の改善は難しくなる。改善速度を見積もるのは難しいが、速くなることを示唆する要因はいくつかある。強力なAIの制約はハードウェアよりソフトウェアにある、という見方がAI分野では優勢で、今後数十年もハードウェアの急速な進歩が続くと予想されている。[4] したがってソフトウェアが完成するころには、大量のAIのコピーを高速で動かせるほどハードウェアが余り、AIの改善の効果を増幅するかもしれない。[8] 人間の心が知能にとって理想的に最適化されていると考える理由は乏しい。技術文明を生めるほど複雑になった最初の知能にすぎないなら、簡単に得られる改善はまだありそうだ。そもそも、そのAIは、より遅く小規模な人間の研究集団によってつくられたことになる。十分強いフィードバックや、十分豊富なハードウェアがあれば、人間並みのAI研究能力をもつ最初のAIは、急速に超知能に達するかもしれない。とくに、研究者や政策担当者が十分な安全策を整えるより速く達する恐れがある。

心配するのは早すぎるだろうか

AIをどうつくるかがはっきりしていない以上、今後数十年で開発されると強く確信することはできない。同時に、予期しない進歩を否定することも難しい。過去には、AIの難しさを過小評価していた。おそらく最も悪名高いのは、1956年のダートマス会議に向けてなされた予測だ。[12] しかし、それはAIが決して成功しない保証にはならない。予想以上に難しいと繰り返しわかってきたことと、少しずつ積み上がった進歩の両方を考慮しなければならない。AI・機械学習のアルゴリズムの進歩、[17] 技術産業の研究開発費の増加、大量の計算を要するアルゴリズムを実行可能にするハードウェアの進歩、[4] 膨大なデータセット、[5] 神経科学の知見は、過去の研究者になかった利点を与える。結果の重大さと実現時期の不確実性を考えれば、安全性の戦略では、中期的にAIが開発される可能性も織り込むのがよさそうだ。

友好的AI

将来のAI技術のリスクへの懸念から、Sunの共同創業者ビル・ジョイらは、そうした技術を世界規模で規制・制限するよう提案している。[9] しかし、適切に設計されたAIは、それに匹敵するほど大きな恩恵ももたらしうる。病気の撲滅、長期的な核のリスクの回避、より豊かで意味ある人生など、私たち全体の幸福に関わる多くの重要な課題では、現在、人間の創意工夫が進歩の制約になっている。安全なAIは、その一つ一つで大いに役立ちうる。さらに、こうした恩恵の見込みと、AIがもたらす競争上の優位のために、制限を課す世界的な条約を実施することは非常に難しいだろう。

そこでSIAIは、AIのリスクを減らすため、自己改良しても善意ある動機が確実に安定して保たれるAI、私たちが「友好的AI」と呼ぶものの開発を促すことを、主な方針としてきた。[22]

友好的AIの重要な発想を、ごく簡単にまとめる。

  1. エージェントと環境の相互作用の最終結果は保証できないが、その知識のもとで何をしようとするかは、保証できるかもしれない。Deep Blueを調べるだけでカスパロフに勝つと断定することはできないが、負ける局面ではなく、勝てる局面を探してゲーム木を探索していることは、確かめられるかもしれない。
  2. コードは、ほぼ完全に決定論的なコンピューターチップ上で実行される。そのため、環境に対する戦略の結果は論理的に証明できなくても、エージェントの動機については、自分自身を書き換える方法も含めて、きわめて強い保証ができるかもしれない。これは重要だ。環境に対する戦略が失敗すれば、世界のモデルを更新してやり直せる。しかし自己改変では、AIは100万回のコード変更を一つずつ行い、そのどれもが破滅的でないようにしなければならないかもしれない。
  3. ガンディーが人を殺したくないとしよう。脳を書き換えて人を殺したくさせる薬を誰かが差し出し、その作用を本人が知っていれば、飲むことをまず断るだろう。AIが自己改変の結果を正しく予測できるなら、ほとんどの効用関数は、反省的に検討しても、ごく自然に安定しているはずだ。したがって友好的AIの問題は、AIの選好に逆らって制約を課す追加の良心モジュールをつくることではない。ありうる心の巨大な設計空間から、友好的であることを好むAIを選び出すことだ。
  4. 人間がそれ自体を目的として重んじる価値(terminal values)は、きわめて複雑だ。内省しても一見その複雑さがわからないのは、かつてコンピュータービジョンの大幅な進歩が一夏の仕事だと思われたのと、ほぼ同じ理由による。人間の価値の詳細には内省ではアクセスできないので、おそらく解決には、人間を観察し、質問し、脳をスキャンするなどして価値を学ぶAIを設計する必要がある。その時点でよさそうに思えた固定の命令群を、あらかじめ組み込むのではない。
  5. 人類の文明が明示する道徳的価値は、時とともに変化してきた。私たちはそれを進歩と見なし、今後も進歩が続きうると考える。1800年の明示的な価値観を組み込まれたAIなら、今ごろ奴隷制の復活を目指して戦っているかもしれない。道徳的価値が固定されるのは明らかに望ましくないが、無作為に変えると、その大半はさらに望ましくないだろう。改善はすべて変化だが、変化がすべて改善とは限らない。段階的な出発点になりうるアルゴリズムには、「あなたが知ることを私たちがすべて知っていたら、あなたに頼んだであろうことをする」「あなたと同じ速さで考え、もっと多くの道徳的な議論の道筋を検討できたら、頼んだであろうことをする」「あなたと同じ、自分を省みて改変する能力があれば、頼むであろうことをする」などがある。道徳哲学では、この道徳的進歩の考え方は、反省的均衡と呼ばれる。[15]

研究計画の種をまく

高度なAIに近づくほど、効果的なリスク削減の方法を学びやすくなる。今注力すべきなのは、ほかの選択の指針になる研究や、多くの漸進的な作業を要する研究など、恩恵が時とともに積み重なる取り組みだ。候補には次のものがある。

友好的AI:理論計算機科学者は、目標を安定して保ちながら自己改変するAIの構造を研究できる。理論上の簡略なシステムはすでにある。ゲーデルマシンは、一定の仮定のもとで、最適だと証明できる自己改良を行う。[19] 自己改変しても安定していることを目指す意思決定理論も提案されている。[2] これらのモデルを、理想化の少ない状況へ少しずつ広げられる。

安定した脳エミュレーション:安全なAIへの道として、人間の脳のエミュレーションから始める案がある。神経科学者は、動機がわかっている個人の脳をエミュレートできるかを調べられる。進化の研究者は危険な進化の動きを防ぐ方法を、社会科学者はエミュレーションの影響をよい方向へ導く社会的・法的な枠組みを研究できる。[18]

AIリスクのモデル:研究者は、ゲーム理論、進化の分析、コンピューターセキュリティ、経済学の手法を使い、AIのリスクや成長軌道のモデルをつくれる。[1][6][8][14][22] 厳密に分析すれば、科学者、大学院生、研究助成機関の努力を、最も大きな恩恵が見込める分野へ導ける。

制度の改善:重大な技術的リスクを乗り切るのは、最終的には社会全体だ。成功には、社会が科学的な根拠を理解し、それに対応する必要がある。壊滅的なリスクをめぐる思考をゆがめるバイアスの知識、[23] よりよい確率的予測の方法、[16] リスク分析の方法、[11] 専門家の意見を見つけて集約する方法[7]は、いずれも私たち全体の成功の可能性を高める。AI開発をめぐる国際協力や、安全策を犠牲にして速度を優先することを最もいとわない競争者が勝ちかねない「AI軍拡競争」を避ける方法も同様だ。[20]

私たちの目標

私たちは、以上の研究計画の種をまきたい。必要な研究をすべて自分たちで行うには小さすぎるが、動き始めるきっかけはつくれる。

土台はすでにある。(a)壊滅的なAIリスクとAI安全技術についての初期研究、(b)人材、(c)毎年のシンギュラリティ・サミットや客員研究員制度など、外部の研究人材が参加する事業だ。

今後は客員研究員制度を拡充し、シンギュラリティ・サミットなどの学術交流を広げ、所内の研究者や、見つけられるかぎり最良の外部人材と、以上の研究を始める論文をさらに書くことで、近年の成長を続けたい。共著者、客員研究員、その他の協力者を歓迎する。壊滅的なAIリスクをどう減らすかについての提案や費用便益分析も歓迎する。

人工知能がもたらす恩恵と危険

人間の知能は、知られている中で最も強力な生物学的技術であり、それ以前の生物とは桁違いに地球へ影響を与えてきた。しかし、歴史上の私たちの位置を決めたのは、存在しうる最も賢い知能であることより、実際に存在した最初の知能であることだろう。知能における私たちは、おそらく生物学における最初の複製子にあたる。初めて自己複製できた一本鎖RNAは、きわめて洗練された複製子にはほど遠かった。それでも、最初だったために、歴史上重要な位置を占めた。

知能の未来は、願わくば、過去をはるかに上回るものになる。人間の知能の起源と形は、一つの惑星をはるかに超える規模の未来文明の起源と形を左右する、重要な役割を果たすかもしれない。人類が初めてつくる自己改良する人工知能の起源と形も、同じ理由で、同じくらい強い影響を及ぼすかもしれない。未来の文明を形づくるのは、未来の知能の価値観だ。ここで得られも失われもするのは、未来の知能の価値観であり、それゆえに未来文明そのものの価値なのである。

勧めたい文献

以上は、ごく短い紹介だ。詳しくは[email protected]へ問い合わせるか、次を参照してほしい。

参考文献

  1. ニック・ボストロム「人類の進化の未来」。チャールズ・タンディ編『Death and Anti-Death: Two Hundred Years After Kant, Fifty Years After Turing(死と反死:カントから200年、チューリングから50年)』339〜371ページ、2004年、Ria University Press。
  1. ゲイリー・ドレッシャー『Good and Real: Demystifying Paradoxes from Physics to Ethics(善と実在:物理学から倫理学までのパラドックスを解き明かす)』188ページ、MIT Press、2006年。
  1. I・J・グッド「最初の超知能機械についての考察」。Franz L. Alt、Morris Rubinoff編、Advances in Computers(Academic Press)、第6巻、31〜88ページ、1965年。
  1. International Technology Roadmap for Semiconductors「国際半導体技術ロードマップ2007年版」、2007年。ウェブ、2010年1月7日閲覧。
  1. アロン・ハレヴィ、ピーター・ノーヴィグ、フェルナンド・ペレイラ「データの不合理なまでの有効性」。IEEE Intelligent Systems、2009年3・4月号、8〜12ページ。
  1. J・ストーズ・ホール『Beyond AI: Creating the Conscience of the Machine(AIを超えて:機械の良心をつくる)』。ニューヨーク州アマースト:Prometheus、2007年。印刷版。
  1. ロビン・ハンソン「アイデア先物市場」。ジョージ・メイソン大学、1996年6月12日。ウェブ、2010年1月8日閲覧。
  1. ロビン・ハンソン「機械知能がある場合の経済成長」。ジョージ・メイソン大学、1998年。ウェブ、2010年1月7日閲覧。
  1. ビル・ジョイ「なぜ未来は私たちを必要としないのか」。Wired、2000年。
  1. レイ・カーツワイル『The Singularity Is Near: When Humans Transcend Biology(シンギュラリティは近い:人類が生物の限界を超えるとき)』。Viking Penguin、2005年。
  1. ジェイソン・G・マセニー「人類絶滅のリスクを減らす」。Risk Analysis、第27巻第5号、1335〜1344ページ、2007年。
  1. ジョン・マッカーシー、マーヴィン・ミンスキー、ナサニエル・ロチェスター、クロード・シャノン「人工知能に関するダートマス夏季研究計画の提案」。スタンフォード大学Formal Reasoning Group、1955年8月31日。ウェブ、2010年1月7日閲覧。
  1. スティーヴン・M・オモハンドロ「AIの基本的な欲求」。Pei Wang、Ben Goertzel、Stan Franklin編『Artificial General Intelligence 2008: Proceedings of the First AGI Conference(汎用人工知能2008:第1回AGI会議論文集)』第171巻。アムステルダム:IOS、2008年。
  1. スティーヴン・M・オモハンドロ「自己改良する人工知能の性質」。Self-Aware Systems、2008年1月21日。ウェブ、2010年1月7日閲覧。
  1. ジョン・ロールズ『A Theory of Justice(正義論)』。ニューヨーク:Belknap、2005年。
  1. スティーヴ・レイホーク、アンナ・サラモン、トム・マッケイブ、マイケル・アニシモフ、ロルフ・ネルソン「AI未来予測の枠組みを変える:物語から裾の重い高次元確率分布へ」。European Conference on Computing and Philosophy論文集。バルセロナ自治大学、スペイン・バルセロナ、2009年7月4日。
  1. スチュアート・J・ラッセル、ピーター・ノーヴィグ『Artificial Intelligence: A Modern Approach(人工知能:現代的なアプローチ)』第2版、Pearson Education、2003年。
  1. アンダース・サンドバーグ、ニック・ボストロム「全脳エミュレーション:ロードマップ」。技術報告書#2008-3、オックスフォード大学Future of Humanity Institute、2008年。
  1. ユルゲン・シュミットフーバー「ゲーデルマシン:最適性を証明できる自己改良を行う、自己言及的な汎用問題解決器」。Adaptive Agents and Multi-Agent Systems II、LNCS 3394、1〜23ページ、Springer、2005年。
  1. カール・M・シュルマン「軍備管理と知能爆発」。European Conference on Computing and Philosophy論文集。バルセロナ自治大学、スペイン・バルセロナ、2009年7月4日。
  1. ヴァーナー・ヴィンジ「来たる技術的特異点」。Whole Earth Review、New Whole Earth LLC、1993年3月。
  1. エリエゼル・ユドコウスキー「地球規模のリスクにおける正と負の要因としての人工知能」。ニック・ボストロム、ミラン・チルコヴィッチ編『Global Catastrophic Risks(地球規模の壊滅的リスク)』、2008年、308〜345ページ。
  1. エリエゼル・ユドコウスキー「存続リスクの判断に影響する認知バイアス」。ニック・ボストロム、ミラン・チルコヴィッチ編『Global Catastrophic Risks(地球規模の壊滅的リスク)』、2008年、91〜119ページ。