非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

FAQ

原題: FAQ

原文著者: Rob Bensinger / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2024-11-06

訳文状態: 校閲済み(原文対照レビュー実施)

MIRI FAQ

目次

1. MIRIの使命は何ですか?

私たちの使命は、「人間より賢い人工知能の創造が、良い影響をもたらすよう保証する」ことです。野心的な目標ですが、ある程度の初期の進展は可能だと考えています。また、この目標の重要性と難しさを考えれば、早い時期に取り組み始めるのが賢明だと考えています。

私たちの二つの研究課題「Agent Foundations for Aligning Machine Intelligence with Human Interests」と「Value Alignment for Advanced Machine Learning Systems」は、次の三群の技術的問題に焦点を当てています。

私たちは新しい数学的成果を発表し、ワークショップを主催し、学会へ参加し、こうした問題の研究に関心をもつ外部研究者へ資金を提供しています。また、ブログとオンラインの研究フォーラムも運営しています。

2. AIが人間を上回りうると考えるのはなぜですか?

機械はすでに、計算、チェス、大規模データバンクの検索、水中機雷の検出など、多くの特定課題で人間より賢くなっています。1 しかし、汎用性では人間の知能が機械知能を依然として圧倒しています。強力なチェス・コンピューターは「特化型」であり、ほかのゲームを遊べません。対照的に、人間には、新しい状況へ適応し、祖先の環境が備えさせたもの以外の多くの領域で優れた働きをする問題解決能力があります。「知能」の形式的定義(したがって「人工知能」の定義)がないため、発見的には、人間の知覚・推論・熟慮の能力を(たとえば身体的な強さや敏捷性とは区別して)挙げ、知能とは「そうした種類のもの」だと言えます。この捉え方では、知能は相異なる能力の束です。とはいえ、科学を行う力を含む、きわめて重要な束です。私たちの認知能力は脳内の高水準のパターンから生じ、このパターンは炭素だけでなくシリコンでも実現できます。このことから汎用AIが可能だと分かりますが、それがどれほど難しいかは分かりません。知能の理解が十分難しければ、人間の脳をスキャンしてエミュレートするか、進化のような試行錯誤の過程によって機械知能へ到達し、ソフトウェア・エージェントを手作業で書くことはないかもしれません。機械が認知課題で人間と同等になれるなら、いずれ人間を上回れる可能性は非常に高いでしょう。先を見通せず計画もしない生物進化が、汎用知能の最適なアルゴリズムを偶然見つけたと期待する理由はほとんどありません(鳥に最適な飛行機械を見いだしたのではないのと同じです)。認知の質的改善に加え、ニック・ボストロムは、デジタルな心で実現できる、より直接的な利点として、次のようなものを挙げています。

これらの利点は、一つだけでもAIの推論者へ人間の推論者に対する優位を与え、またはAI推論者の集団へ人間の集団に対する優位を与えうるものです。組み合わせれば、デジタルな心は私たちの予想より速く、決定的に人間の心を上回りうると考えられます。

3. 人間より賢いAIで安全性が重要なのはなぜですか?

現在のAIアルゴリズムでさえ、人間の監督なしに重要な領域で行動しなければならない場合、とりわけAI自体や環境が時間とともに変化しうる場合には、特別な安全保証が必要です。

[自律システムから]こうした利益を実現できるかは、高水準の[適応性]と自律性によって生じる、ほぼ無限の状態をもつシステムを検証・妥当性確認(V&V)し、「自律性への信頼」を可能にする、まったく新しい手法の開発にかかっている。事実上、そのようなシステムが提示されうる入力状態の数はあまりに多く、すべてを直接試験するのが不可能なだけでなく、無視できるほど小さな割合を超えて試験することさえ実現不可能である。したがって、このようなシステムの開発は、現在の手法では本質的に検証不能であり、その結果、比較的単純な用途以外での運用を認証できない。高水準の自律性をもつシステムを開発することは可能だが、適切なV&V手法がないため、比較的低い水準を超える自律性は利用を認証できない。3

AIの能力が向上するにつれ、AIシステムへ大きな自律性、柔軟性、制御権を与えやすくなり、その新しい可能性を利用する誘因も増え続けます。とりわけAIシステムが汎用化する可能性は、安全保証を確立することを難しくします。試験中に確実だった規則性が、試験後も常に成り立つとは限らないからです。人間の福祉に最大かつ最も長く続く変化をもたらしてきたのは、科学技術の革新であり、その革新は私たちの知能から生じます。したがって長期的には、AIの意義の大部分は、科学技術の進歩を自動化し、加速する可能性から生じます。人間より賢いAIの創造は、知的進歩そのものがもつ根本的なリスクと便益を、デジタルの速度で伴います。AIエージェントの能力が高まるほど、その判断と目標を分析・検証することは、より重要に(そして難しく)なります。スチュアート・ラッセルは次のように書いています。

主な懸念は、不気味な創発的意識ではなく、単に質の高い判断を下す能力である。ここで質とは、取られた行動の期待効用を指す。効用関数は、おそらく人間の設計者が指定する。ここで問題が生じる。

  1. 効用関数は、人類の価値観と完全には一致しないかもしれない。その価値観を明確に定めることは(よくても)非常に難しい。
  2. 十分な能力をもつ知的システムはどれも、自らの存続を確保し、物理的・計算資源を獲得しようとするだろう。それ自体が目的なのではなく、割り当てられた課題を成功させるためである。

n個の変数の関数を最適化し、目的が大きさk<nの部分集合に依存するシステムは、制約されていない残りの変数を極端な値へ設定することが多い。その制約されていない変数の一つが、実際には私たちの大切にするものなら、見つかった解は非常に望ましくないかもしれない。これは本質的に、ランプの精、魔法使いの弟子、ミダス王という昔からの物語である。欲しいものではなく、頼んだとおりのものを手に入れる。4

ボストロムの「The Superintelligent Will」は、この二つの懸念をさらに詳しく述べています。人間より賢いAIシステムをプログラムする際、実際の目標を正しく指定できないかもしれないこと、そして誤って指定された目標を最適化するエージェントの大半には、人間を敵対的に扱う誘因があることです。人間を潜在的な脅威、またはエージェントの目標達成を妨げる障害とみなすからです。人間とAIエージェントの目標が十分一致していなければ、知識と技術力で優れる側が、欲しいものを手に入れるため力を使うかもしれません。人間の共同体間の多くの紛争で起きたのと同じです。この種の懸念へ事前に気づいたことで、人工的な意思決定者の利益を私たちの利益へ合わせる研究を進め、この既定のシナリオによるリスクを減らす機会が得られます。

4. 研究者はAIが間近に迫っていると考えていますか?

2013年初め、ボストロムとMüllerは、Microsoft Academic Searchの順位で、存命する被引用数上位100人のAI分野の著者を調査しました。「世界的な破局によって進歩が止まらない」ことを条件として、回答した29人の専門家は、「ほとんどの人間の職業を、少なくとも平均的な人間と同じくらいうまく遂行できる」機械を開発する確率の中央値を、2023年までに10%、2048年までに50%、2080年までに90%としました。5 MIRIの研究者の多くは10%と50%の日付におおむね同意しますが、AIの到来は2080年より大幅に遅くなる可能性もあると考えています。これはボストロムの『Superintelligence』での分析と一致します。

私自身の見方では、専門家調査で報告された中央値は、より遅い到来時期へ十分な確率を割り当てていない。(「人間の科学活動が大きな負の混乱なく継続する」ことを条件とした後でも)HLMI[人間水準の機械知能]が2075年、さらには2100年までに開発されない確率を10%とするのは、低すぎるように思える。歴史的に、AI研究者は自身の分野における進歩の速度や、その進歩の形をうまく予測してきたとは言えない。一方では、チェスのような課題が驚くほど単純なプログラムで実現できると判明し、機械がこれやあれを「決して」できないと主張する否定論者は、繰り返し誤りを証明されてきた。もう一方では、実務家により典型的な誤りは、現実世界の課題でシステムを頑健に動かす難しさを過小評価し、自分が好む特定のプロジェクトや技法の利点を過大評価することだった。

AIの進歩を予測する専門家(と非専門家)の実績が乏しいことを踏まえ、汎用AIがいつ発明されるかについて、私たちは比較的判断を保留しています。予想より早いかもしれず、遅いかもしれません。専門家は、人間と同等になってから2年以内に超知能が開発されるという確信度の中央値を10%、30年以内に開発される確信度を75%とも回答しました。この点でMIRI研究者の見方は、AI専門家の中央値と大きく異なります。AIシステムは人間と同等に近づけば、比較的速く人間を上回ると予想しています。

5. どのような技術的問題へ取り組んでいますか?

「人間より賢いAIを人間の利益へ合わせる」は、きわめて曖昧な目標です。この問題へ実りある形で取り組むため、いくつかの下位問題への分解を試みます。出発点として、「この問題がはるかに簡単だったとしても、なお解けない側面は何か」と問います。人間より効率よく現実世界の目標を達成するには、汎用AIシステムが時間とともに環境を学び、考えられる提案や行動から選べなければなりません。そこでアライメント問題を単純化した版として、環境を学習し、「世界にあるダイヤモンドの期待個数を最大化する方針を選べ」のような、非常に粗い判断基準をもつシステムをどう構築できるか、と問えます。信頼性の高いエージェント設計とは、事前に選んだ単純な目標を確実に追求するソフトウェア・システムを形式的に指定するという、技術的な課題です。この領域の下位問題の一例は、オントロジー同定です。完全に自律的なエージェントが予期しない環境へ行き着き、予想外の仮説や方針を構築しうることを踏まえ、十分に一般的な形で「ダイヤモンドを最大化する」という目標を、どう形式化するのでしょうか。無限の計算能力と無限の時間があっても、現在この問題を解く方法は分かりません。このことは、実用的なアルゴリズムだけでなく、問題を理解するための基本的な理論枠組みも欠けていると示唆します。形式的エージェントAIXIは、強化学習器の場合の「最適な振る舞い」が何を意味するかを定義する試みです。しかし、目標が外部世界の何かを変えることである場合(事前に指定された報酬の数値を最大化するだけではない場合)、「良い振る舞い」の意味を定義する、単純なAIXIのような式はありません。特権的な報酬チャンネルをもつ代わりに、エージェントが世界モデルを評価してダイヤモンドの個数を数えるには、その世界モデルがどのような一般的・形式的性質を備えなければならないのでしょうか。システムがプログラマーの予想しない形で仮説を更新したら(たとえば、ひも理論が真で量子物理学が偽だと発見したら)、新しいモデル内の「ダイヤモンド」をどう同定するのでしょう。非常に基本的な問いですが、関係する理論は現在ありません。信頼性の高いエージェント設計と、価値の指定という問題は区別できます。「ある目標を推進する自律AIシステムの設計方法を理解した後、その目標が実際に私たちの望むものと一致することを、どう保証するのか」という問題です。人間の誤りは避けられず、AIアルゴリズムが認知課題で人間と同等に近づく間にも、安全に監督して再設計できる必要があるため、MIRIは誤り耐性をもつエージェントの性質の形式化にも取り組んでいます。AIの標準的教科書『Artificial Intelligence: A Modern Approach』は、この課題を次のようにまとめています。

Yudkowsky[……]は、友好性(人間を傷つけたくないという欲求)を最初から設計へ組み込むべきだと主張するが、設計者は、自分の設計に欠陥がありうることと、ロボットが時間とともに学習し進化することの両方を認識すべきだ、とも述べる。したがって課題は、メカニズム・デザインである。抑制と均衡の仕組みのもとで進化するAIの機構を設計し、そのような変化に直面しても友好的なままの効用関数をシステムへ与えることである。6

私たちの技術課題は、こうした未解決問題をさらに詳しく説明し、研究ガイドは学習を深めるためのオンライン資料を集めています。

6. AI安全性へ早期に取り組むのはなぜですか?

MIRIが早期の安全性研究を優先するのは、その研究が重要で、時間的制約があり、取り組みやすく、情報をもたらすと考えるためです。

AI安全性研究の重要性は、上のQ3で概説しました。この問題に時間的制約があると考える理由は次のとおりです。

また、人間より賢いAIが50年後、100年後であっても、現在、AI安全性について有用な研究を行えると考えています。これにはいくつか理由があります。

最後に、AI安全性理論の進展は、頑健なAIシステム、利用できる技術的選択肢、より広い戦略的状況についての理解を深めるため有用だと予想しています。とりわけ、信頼できる振る舞いには透明性が必要だと予想しており、人間の設計者と利用者に対して自律AIシステムを透明にするには、基礎理論上の前提条件があると考えています。

関係する理論がそろっていることは、人間より賢いAIシステムを設計するために厳密には必要でないかもしれません。信頼性の高いエージェントには、信頼できない振る舞いを示す、最も作りやすい人間より賢いシステムとは、大きく異なるアーキテクチャや認知アルゴリズムが必要かもしれません。そのため、かなり一般的な理論上の問いの一部は、主流のAI能力研究よりAI安全性研究と関係が深いかもしれません。したがって、AI安全性研究が情報をもたらすことの主な利点には、次が含まれます。

7. どう貢献できますか?

MIRIは、主として少額・中額の寄附によって資金を得る研究非営利団体です。したがって寄附は、数学研究、ワークショップ、学術界への働きかけなどの資金として役立ちます。

私たちの研究対象について詳しく学び、協働することに関心がある方のため、参加案内ページに応募フォームと、定期的に更新される多数のオンライン資料があります。

執筆:ロブ・ベンシンガー。最終更新:2016年9月18日。

  1. Nilsson (2009). The Quest for Artificial Intelligence. Cambridge University Press. ↩
  2. Bostrom (2014). Superintelligence: Paths, Dangers, Strategies. Oxford University Press. ↩
  3. Office of the US Air Force Chief Scientist (2010). Technology Horizons: A Vision for Air Force Science and Technology 2010-30. ↩
  4. Russell (2014). 「Of Myths and Moonshine」. edge.org. Edge Foundation, Inc. ↩
  5. Müller and Bostrom (2014). 「Future Progress in Artificial Intelligence: A Survey of Expert Opinion」. In Müller (ed.), Fundamental Issues of Artificial Intelligence. Springer. ↩
  6. Russell and Norvig (2009). Artificial Intelligence: A Modern Approach. Pearson. ↩