非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

2013年を振り返る:友好的AI研究

原題: 2013 in Review: Friendly AI Research / MIRI Strategy

原文クレジット(WordPress投稿者表示): Luke Muehlhauser / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2014-02-18

訳文状態: 校閲済み(原文対照レビュー実施)

これは、私個人の定性的な2013年のMIRI自己評価の第4部であり、MIRIが2013年に行った友好的AI(FAI)研究活動を評価する。((何を「友好的AI研究」と数えるかは、当然、議論の対象である。この記事の大半では、ここで述べる理由から知能爆発のミクロ経済学を例外として、「友好的AI研究」は「エリエザー・ユドコウスキー(Eliezer Yudkowsky)が友好的AI研究と考えるもの」を意味すると仮定する。))

2013年の友好的AI研究

  1. 2013年初頭、私たちは決定を下し、研究と一般への働きかけに置いていた優先順位を、FAIの技術研究にさらに専念する方針へ移した。その結果、2013年に外部へ公開したFAI研究は、それまでの全年を合わせたものとほぼ同じ量になった。
  2. また、ワークショップは採用候補者を見いだすことにも成功した。2014年前半に、2013年のワークショップ参加者2人を採用する見込みである。
  3. 2013年には、FAI研究所とFAI研究分野をどう作るかについて、多くを学んだ。特に……
  4. MIRIは、さらに経験を積んだワークショップ参加者を引きつける必要がある。
  5. FAI研究の多くは幅広いコミュニティーが行え、FAI研究という名称をつける必要もない。しかし、研究者自身がその研究をFAI研究だと捉えるとき、FAIはさらに進展する。
  6. 伝え方は非常に重要である。

友好的AI研究への転換

MIRIが2000年に設立されてから、2013年初頭に戦略を転換するまで、((現在「Machine Intelligence Research Institute」と呼ばれる組織は、2013年初頭まで「Singularity Institute for Artificial Intelligence」と呼ばれていた。))私たちは研究をいくらか行うとともに、一般への働きかけを数多く行った(例えばSingularity SummitとThe Sequences)。((2000~04年の「MIRI」は、初期のFAI研究を行うエリエザー・ユドコウスキー1人だけだった。組織は2004年に成長し始め、2006年までには、取り組みの大半が研究ではなく、働きかけに関係するものとなった。この状態は2013年初頭まで続いた。))2013年初頭、働きかけと運動形成は十分行われてきたため、おもな重点を研究、特に友好的AI研究へ実りある形で移せると判断した。

私たちの前にあった仕事は、基本的に、それまで主として働きかけを行う組織だったものから新しいFAI研究所を作ること、そしてFAI研究という新しい分野を作ることだった。この目標を達成する方法については、まだ学ぶべきことが多い(以下を参照)。

最初の一歩は、(1)一連の研究ワークショップを開き、(2)友好的AI理論の未解決問題を、研究で協力する可能性のある人々へ説明することだった。ワークショップと未解決問題の説明は、特に三つの目標へ向けたものだった。私たちは次を望んだ。

  1. 友好的AI理論へ常勤で取り組むため、MIRIが採用すべき研究者を見いだす助けにする。
  2. さらに多くの研究者を友好的AIの研究課題に触れさせる。
  3. 友好的AIの未解決問題について、具体的な進歩を促す。

まず、2013年に行った友好的AI研究活動を説明する。その後、この結果がどれほど「良い」と思うか、何を学んだかを評価する。

ワークショップ

ワークショップという戦略は、1週間の2012年11月のワークショップが成功したことで示唆された。それは研究者4人だけによる実験で、「確率論理における真理の定義可能性」の中核的成果を生み出した。

4月に開いた2013年最初のワークショップでは、集められる限り多くの人々とともに、できる限り多くの未解決問題へ取り組もうとした。それによって、どの問題がもっとも取り組みやすく、どの研究者が将来もっとも貢献しそうかを、短期間で学ぼうとした。参加者は12人で3週間続いたが、日程の制約から、全期間に参加した研究者は5人だけだった。ワークショップの参加者について多くを学び、特に三つの問題がもっとも進展した。ポール・クリスティアーノ(Paul Christiano)の「真理の定義可能性」の枠組み、パトリック・ラヴィクトワール(Patrick LaVictoire)の「頑健な協力」の枠組み、そしてベンヤ・ファレンシュタイン(Benja Fallenstein)の「パラメトリック多相」による、自己改変システムへのローブ的障害へのアプローチである。このワークショップの成功を受け、規模を小さくし、研究の焦点を絞りながらも、さらに同様のワークショップを開くことにした。

次のワークショップは2013年7月に開き、参加者は8人、期間は1週間だった。論理的全知と、ローブ的障害・自己反映的エージェントに関する問題へ焦点を当て、4月のワークショップより1日当たりの進展は小さかった。主な成果は、参加者エイブラム・デムスキー(Abram Demski)がブログ記事で説明した。

9月のワークショップは、代わりに意思決定理論へ焦点を当てた。参加者は11人で、1週間続いた。参加者はこの分野の「適切に定式化された問題」を出し合い、ラヴィクトワールの頑健な協力の枠組みを発展させ、更新不要意思決定理論の形式化をいくらか進め、究極のニューカム問題など、追加の玩具問題を定式化した。

11月のワークショップは、バークレー以外で初めて開いたワークショップだった。FHIが親切にも、オックスフォード大学に私たちを受け入れてくれた。7月のワークショップと同じく、論理的全知と自己反映的エージェントへ焦点を当てた。参加者は11人で、1週間続いた。11月の理論的進展は、12月のワークショップでの進展へつながった(同じ話題、参加者13人、1週間)。その成果は7本の新しい技術報告書に収められている。

次に、いくつかの基本統計を示す。

友好的AIの未解決問題を説明する

2013年、MIRIは、友好的AIの未解決問題(OPFAI)を、三つの標準的な方法、すなわち記事、講演、ワークショップでの講義を通じて研究者へ説明した。

OPFAIの記事について:ユドコウスキーの「OPFAI第1号」の記事は、知能爆発のミクロ経済学(別名AIテイクオフの力学)を論じた。私はこれを友好的AI理論の未解決問題ではなく「戦略研究」の未解決問題だと考えるため、以前の記事で論じた。私の観点では、2013年に文章で説明された最初のOPFAIは、論理的意思決定理論についてのものだった。当時MIRI研究者だったアレックス・アルテア(Alex Altair)が、2013年4月の論文「ニューカム型問題における意思決定アルゴリズムの比較」で、この問題を説明した。この未解決問題は以前にも、Less Wrongの記事、記事、記事と、117ページの技術報告書で説明されていた。しかしアルテアによる問題の提示は、以前のものより簡潔で形式的だった。

2013年に文章で説明された二番目のOPFAIは、タイリング・エージェント問題、特にタイリング・エージェントへのローブ的障害についてのものだった。ユドコウスキーは、この論文の草稿を4月のワークショップへ持ち込み、そこでの進展を受けて大きく変更し、最終的に2013年6月に公開した。2013年に文章で説明された三番目のOPFAIは、パトリック・ラヴィクトワールと共著者らによる頑健な協力問題だった。四番目は、自然化された帰納についてのものだった。

タイリング・エージェントの論文は、FAI研究者の時間を約2か月分使って作成されたため、新しいOPFAIの説明に必要なFAI研究者の時間を最小限にする工程を試すことにした。まず、ユドコウスキーがOPFAIについて考えていることを、Facebookグループへ一気に書き出した。次に、ロビー・ベンシンガー(Robby Bensinger)が数人と協力し、OPFAIをさらに明確に説明するLess Wrongの記事を作成した。この工程で生まれた最初の記事は2013年12月に発表された「現象論的な橋を築く」である。このOPFAIを説明する残りの記事は、2014年第1四半期に発表される。FAI研究者の時間は、解説ではなくFAI研究へできるだけ多く使いたいため、2014年には解説を書く人材をさらに採用したい(採用情報のページを参照)。

OPFAIの講演について:MIRIは2013年に二つのOPFAI講演を予定した。ユドコウスキーが10月15日に行った「合理的エージェントの再帰:自己改変AIの基礎」は、MITの聴衆へ頑健な協力問題とタイリング・エージェント問題の双方を説明した。その2日前には、MIRI研究員のポール・クリスティアーノが、ハーバード大学で確率的メタ数学について講演し、「真理の定義可能性」論文の以前の成果を発展させた。((確率的メタ数学は、それ自体がOPFAIであり、タイリング・エージェント問題を解く道筋の一つでもある。))残念ながら、ユドコウスキーの講演は録画されなかったが、クリスティアーノの講演は録画された。

ワークショップでのOPFAI講義について:2013年のMIRIワークショップは毎回、最初の1~2日を、そのワークショップで扱う未解決問題の講義へ充てた。この講義により、約35人の研究者(参加者と初日の訪問者)が、それまであまり詳しくなかったOPFAIに触れた。(それ以外、例えばユドコウスキー、クリスティアーノ、ファレンシュタインは、講義で説明されたOPFAIをすでによく知っていた。)

この成果はどれほど良いのか

比較のため、MIRIが2000~12年に行ったFAI研究は、次の取り組みから成っていた。

したがって、2000~12年にMIRIが外部へ公開した友好的AI研究は、「友好的AIを作る」と「首尾一貫した外挿意志」のような技術的でない文書を数点、TDTについての哲学的文章を数点、ピーター・デ・ブランとダニエル・デューイによる、いくらか技術的な論文を3本というものだった。これを、MIRIが2013年に外部へ公開したFAI研究と比べてほしい。Muehlhauser & Williamson (2013)、((この短い論文は、哲学→数学→工学というスペクトルの「哲学」側深くに位置する。))Altair (2013)、Christiano et al. (2013)、Yudkowsky & Herreshoff (2013)、LaVictoire et al. (2013)、そしてこの7本の技術報告書である。((2000~12年と2013年のどちらについても、「MIRIが外部へ公開したFAI研究」と書くとき、MIRIまたはそのワークショップが「可能にした」ものの、実際に「生み出した」とはいえない研究、例えばUDT・ADTの研究の大半は含めていない(それでも、その大部分はMIRIのウェブサイトLessWrong.comと意思決定理論のメーリングリストで開発された)。))

主観的な感触では、MIRIが2013年に生み出し、外部へ公開した友好的AI研究の進展は、それまでの全年を合わせたものとほぼ同じ量だった(2000~12年)。それより多かった可能性もある。これは良いことだが、特に驚くべきことではない。2013年は、MIRIが外部へ公開するFAI研究の進展を生み出すことへ集中しようとした最初の年でもあったからだ。(ただし、明確にしておくと、「外部へ公開した」という条件を外せば、2000~12年にユドコウスキー1人が生み出したFAI研究の進展は、MIRIとそのワークショップが2013年だけで生み出したものより、はるかに多かったことは明らかである。)

では、ワークショップと未解決問題の説明は、掲げた目標を達成しただろうか。 確認してみよう。

  1. はい、採用候補者を見いだす助けになった。2014年前半に、2013年のワークショップ参加者2人を採用する見込みである。(うち1人の採用は、ビザ申請の承認待ちである。)
  2. はい、多くの新しい研究者を友好的AIの研究計画に触れさせた。しかし、触れたことから生まれた独立した友好的AI研究は、私が望んだほど多くなく、それがなぜかについて仮説がいくつかある(以下を参照)。
  3. はい、友好的AIについて具体的な研究の進展を促した(上記参照)。

これは、FAI研究所とFAIの新しい研究分野を育てるための有望な出発点ではあるが、MIRIが望む影響をもたらすには、多くの側面で成果を改善する必要がある(以下を参照)。

FAI研究所とFAI研究という新分野をどう作るかについて、何を学んだか

2013年のFAI研究活動から得た「教訓」の一部は、その年の初めには本当に知らなかったことである。大半は、すでにそうではないかと思っていたことであり、2013年の経験によって裏づけられたと思う。順不同でいくつか挙げる。

1. 運営業務を研究者から遠ざける。

言い換えれば、「研究者に対する運営スタッフの比率が高いことを恐れない」。FAIの研究能力より、運営能力(経営能力を含む)のほうが見つけやすい。そのため、十分な運営人材を採用し、実際に見つけたFAI研究者がFAI研究に時間のほぼすべてを費やし、運営スタッフが大部分を処理できる業務(助成金申請書を書く、催しを企画する、資金を集める、論文の参考文献一覧を作るなど)には、時間をほぼまったく使わずに済むようにすることが重要である。研究所として運営スタッフ対研究者の比率が高く見えるとしても、MIRIはそれを実現できるだけの運営人材を採用すべきである。((2013年末には、常勤スタッフが5人いた。ルーク・ミュールハウザー(Luke Muehlhauser、常務理事)、ルイ・ヘルム(Louie Helm、副理事)、エリエザー・ユドコウスキー(研究フェロー)、マロ・ブルゴン(Malo Bourgon、プログラムマネージャー)、アレックス・フェルメール(Alex Vermeer、プログラム管理アナリスト)で、合計すると運営スタッフ4人、研究者1人だった。この4対1という比率は、さらにFAI研究者を採用できれば縮小するだろう。しかし、2013年に、より少ない運営スタッフで済ませようとするのは誤りだったと思う。))

大学はしばしば(研究生産性の観点から)この点に苦労し、世界最高水準の研究能力を持つ人々の一部に、教育、助成金申請書の執筆、大学への奉仕を大量に課している。((Link et al. (2008)、Marsh & Hattie (2002)、NSOPF (2004)。))独立した研究所であるMIRIは、自ら方針を定め、こうした問題を最小限にできる。

2. さらに経験を積んだワークショップ参加者を引きつける必要がある。

ワークショップには非常に優秀な参加者が集まったが、そのほぼ全員が30歳未満で、発表した論文は比較的少なかった。さらに経験を積んだ研究者なら、ほかにも利点はあるが、(1)関係する成果と形式的ツールを知っていること、(2)生産的な研究手法を知っていること、(3)査読に向けて成果を文章化することに、おそらく強みを持つだろう。

3. FAI研究の多くは幅広いコミュニティーが行え、FAI研究という名称をつける必要もない。

現在、「友好的AI研究」についてのユドコウスキーのパラダイムは、例えばタイリング・エージェントという玩具問題など、数十の部分問題(OPFAI)へ分かれる、非常に大きな研究計画を記述する。友好的AIにもっともらしく関係する未解決問題を見つけ、定式化することは、それ自体が一つの課題であり、特に友好的AIを数年間専門にすることから恩恵を受ける。

しかし、OPFAI自体の多くは、AI安全工学、哲学、数理論理学、理論計算機科学、経済学などの分野における「普通の」未解決問題として構成できる。こうした未解決問題は、友好的AIへまったく触れずに述べられる場合が多く、AI全般へ触れずに述べられる場合さえある。

ユドコウスキーが説明したすべてのOPFAIについて、((ときにはロビー・ベンシンガーやほかの人々から大きな助けを受けている。))私は関係する以前の研究を見つけられた。((関係する以前の研究の例をいくつか挙げる。(1) 超合理性:エージェントが、自分に似たエージェントと合理的に協力するようにする。「頑健な協力」以前には、次があった。Rapoport (1966)、McAfee (1984)、Hofstadter (1985)、Binmore (1987)、Howard (1988)、Tennenholtz (2004)、Fortnow (2009)、Kalai et al. (2010)、Peters & Szentes (2012)。(Rapoport 1966は、特に141~144ページと209~210ページを参照。)(2) 首尾一貫した外挿意志:もっと多くを知り、もっとよく考え、なりたいと望む人間へさらに近づくなどした場合に、私たちが何を望むかを解明する。Yudkowsky (2004)以前には、次があった。Rawls (1971)、Harsanyi (1982)、Railton (1986)、Rosati (1995)。(この背景の概観はMuehlhauser & Williamson 2013を参照。)(3) 価値集約の議会方式:規範的不確実性と価値集約の課題を解決するため、投票機構を使う。Bostrom (2009)以前から、社会選択理論には、この話題に関する膨大な文献があった。最近の概観はList (2013)、Brandt et al. (2012)、Rossi et al. (2011)、Gaertner (2009)を参照。(4) 脆弱性のもとでの推論:完全に信頼できるようになる前に、エージェントが完全な自律性をもって動作しないようにする方法を解明する。ユドコウスキーがこの問題を論じ始める以前から、「調整可能な自律性」について多くの研究があった。Schreckenghost et al. (2010)、Mouaddib et al. (2010)、Zieba et al. (2010)、Pynadath & Tambe (2002)、Tambe et al. (2002)。(5) 論理的意思決定理論:エージェントの決定論的な意思決定過程を表現できる意思決定アルゴリズムを見つける。Yudkowsky (2010)以前には、Spohn (2003)、Spohn (2005)があった。(6) 安定した自己改善:自己改変するエージェントが、望ましいエージェントの性質を保つと非常に強く確信しない限り、自分のコードを書き換えないようにする。Yudkowsky & Herreshoff (2013)以前には、Schmidhuber (2003)、Schmidhuber (2009)、Steunebrink & Schmidhuber (2012)があった。(7) 自然化された帰納:帰納アルゴリズムが、自分自身、データ入力、仮説出力を、自らの物理的仮定へ還元できるものとして扱うようにする。「現象論的な橋を築く」以前には、Orseau & Ring (2011)、Orseau & Ring (2012)があった。))この以前の研究は、私たちがFAIの未解決問題への良い解決策と見なすものを生み出していない。しかし、FAIを学界に受け入れやすい形で構成できることは示唆している。FAIは、主流の学界から完全に外れて活動し、FAIから明示的に動機づけられた人だけが行う「異質な」研究計画である必要はない。代わりに、FAI研究者は望むなら、主流の研究パラダイムの文脈で自分の研究を構成できるはずである。さらにFAI研究の多くは、FAIから明示的に動機づけられていない人でも行える。例えばローブ的障害を、数学として――またはコンピューター科学、哲学などとして――興味深いと思うだけでよい。

4. しかし、研究者自身がその研究をFAI研究だと捉えるとき、FAIはさらに進展する。

それでも研究者は、問題を哲学、コンピューター科学、経済学などの興味深い未解決問題として考えるだけでなく、友好的AIの観点から考えている場合のほうが、友好的AIについて有用な研究を生み出す可能性が実際に高いようだ。ジェイコブ・スタインハート(Jacob Steinhardt)との対話で述べたとおりである。

友好的AIのために問題を解こうとしているか、単に数学の学術誌のために解こうとしているかによって、人々が取り組む問題の部分は異なる。FAIの観点から考えていなければ、人々は概念空間で私たちが重視するものに非常に近いのに、FAI理論に明確に見て取れる価値をまったく持たないことへ、一日中取り組み得る。したがって、FAIの新しい進展へ圧倒的に多く貢献したのは、FAIの観点から問題を明示的に考えている人々である……

5. 伝え方は非常に重要である。

友好的AIの未解決問題でMIRIが協力したい一流の研究者と話すとき、おそらくもっとも頻繁に聞く不満は、私たちの研究が十分に形式的でない、または、相手が費やす意思のある以上の労力をかけずに理解できるほど明確に説明されていない、というものだ。そうした対話を録音して文字起こしした例は、やはりジェイコブ・スタインハートとの対話を参照してほしい。

私は長い間そう考えてきたし、2013年の経験は、この点をさらに裏づけただけだった。今後さらに詳しく書く予定である。