非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

2015年の振り返り

原題: 2015 in review / MIRI Strategy

原文クレジット(WordPress投稿者表示): Malo Bourgon / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2016-07-29

訳文状態: 校閲済み(原文対照レビュー実施)

ルーク・ミュールハウザー(Luke Muehlhauser)が例年行っていたように(2013年の振り返りと2014年の振り返りを参照)、私(マロ・バーゴン(Malo Bourgon))も時間を取って昨年の活動を振り返りたいと思う。今後数週間のうちに、ネイト・ソアレス(Nate Soares)が大局的な戦略の最新情報をお伝えする。ここでは、研究の進展、学術界および一般社会への働きかけ、資金調達、その他の活動を中心に、2015年を振り返る。

AI安全性の問題への関心が高まりつつある兆しを2014年に目にした私たちは、研究チームを拡大する計画を立てた。ニック・ボストロム(Nick Bostrom)の『Superintelligence(スーパーインテリジェンス)』への反響と、Future of Life Institute(未来生命研究所)の「Future of AI」会議に後押しされ、関心は2015年も高まり続けた。これは計画を前倒しできそうだということを示していたが、どこまで速められるかは明らかでなかった。

2015年には、ルークが2014年に行ったような年央の戦略計画は公表しなかった。代わりに、2015年夏季資金調達キャンペーンで集まる資金額に応じた、いくつかの条件付き戦略を示した。反響はすばらしく、過去最高の資金調達キャンペーンとなった。最初の二つの資金目標を(さらに上回って)達成し、2015~2016年の成長加速計画に着手した。

その結果、2015年はMIRIにとって大きな一年となった。年初に技術研究課題を公表した後、そこに示した未解決問題の多くで前進し、中核研究チームの規模を倍増させ、産業界の組織や学術研究者とのつながりを強め、成長軌道を維持するのに十分な資金を集めた。この進展は支援者の皆さまなしには実現しなかった。心から感謝している。  

2015年の研究の進展

私たちの研究課題「人間の関心に機械知能をアラインメントするためのエージェント基礎論」では、未解決問題を三つのカテゴリーに分けている。高信頼性(論理的不確実性、自然化された帰納、意思決定理論、ヴィンジ的内省を含む)、誤り耐性、価値の指定である。((この論文の当初の題名は「人間の関心に超知能をアラインメントする」だった。この研究課題がアライメント問題への一つの特定のアプローチを取るものであり、別のアプローチもあり得ることを強調するため、題名を変更した。関連する例として、ジェシカ・テイラー(Jessica Taylor)の新しい研究課題「高度な機械学習システムのアライメント」がある。)) 2015年のMIRIの最優先目標は、これらの問題で前進することだった。

各カテゴリーで、研究の進展はおおむね予想どおりだった。ただし、論理的不確実性と自然化された帰納では予想以上に進展し、誤り耐性では予想を下回った。

以下では各分野の進展を簡潔にまとめ、折りたたまれた「続きを読む」の節に詳しい説明と全出版物一覧を示す。2015年に発表した論文の一部は2014年以前の研究に基づき、2015年の成果の一部は2016年まで発表されなかった(または今も未発表である)。この振り返りでは、たまたま2015年に発表されたそれ以前の成果ではなく、2015年の新しい技術的進展に焦点を当てる。

論理的不確実性と自然化された帰納

2015年には、この二つの問題である程度の進展を見込んでいた。実際には大幅に前進できたことをうれしく思う。

2015年には、反射的オラクル(reflective oracle)の開発が終盤を迎え、「最適推定器(optimal estimator)」の初期研究も行われた。しかし、この年の最も重要な研究上の前進は、おそらく2015年末から2016年のごく初めに実現した、論理的不確実性を二つの部分問題に分けることに成功した点だろう。

論理的に不確かな状況で正しく推論するための直観的な制約の一つは、命題間の既知の論理関係を確率に反映することである。たとえば、二つの命題が相互排他的だと知っている場合(「この計算は3を出力する」と「この計算は7を出力する」など)、命題の真偽を計算できなくても、二つに割り当てる確率の合計は最大でも1でなければならない。

二つ目の直観的な制約は、経験的な規則性を確率に反映することである。πの数字を十分多く観察すれば、πが正規数であるとまだ証明していなくても、その十進展開では8と3が同じ頻度で現れると、いずれ推測するべきである。

2015年には、この二つの部分問題をそれぞれ単独で解く、二つの異なるアルゴリズムを開発した。

続きを読む

ベンヤ・ファレンシュタイン(Benya Fallenstein)やほかのMIRI研究者との共同研究で、スコット・ギャラブラント(Scott Garrabrant)は一連のIntelligent Agent Foundations Forum(IAFF)の投稿において論理関係を尊重する問題を解決し、論文「Inductive Coherence(帰納的整合性)」へ結実させた。論理命題に見られる観察上のパターンを尊重する問題は、スコットとMIRIxLosAngelesグループが「Asymptotic Logical Uncertainty and the Benford Test(漸近的な論理的不確実性とベンフォード検定)」で解決し、2016年に論文「Asymptotic Convergence in Online Learning with Unbounded Delays(遅延に上限のないオンライン学習における漸近収束)」へとさらに発展させた。

論理的不確実性へのこの二つのアプローチは、同値でないだけでなく、互いを排除するようにも見えた。明らかな次の一歩は、単一の手続きで両方の部分問題を同時に解く方法があるかを調べることだ。この課題については、その後2016年にいくらかの(近く発表予定の)進展を遂げた。

MIRI研究アソシエイトであるヴァネッサ・コソイ(Vanessa Kosoy)の「最適推定器」枠組みに関する研究は、論理的不確実性についての独立した大規模な研究群を成しており、意思決定理論にも応用できるかもしれない。ヴァネッサの研究はまだ正式には発表されていないが、その多くはIAFFで閲覧できる。

論理的不確実性に関するもう一つの重要な成果は、2015年以前に始まった研究(IAFFダイジェスト)を土台とする、ベンヤ、ジェシカ、ポール・クリスティアーノ(Paul Christiano)の反射的オラクルである。反射的オラクルは、エージェントが自分と同等の能力を持つエージェントについての問いに答えようとすると通常生じる多くのパラドックスを回避し、複数エージェント間のジレンマや反射的推論をより厳密に研究できるようにする。

反射的オラクルはそれ自体が興味深く、互いに異なるいくつもの未解決問題に応用できることも判明している。反射的オラクルが、エージェントと環境を特権的に区別する必要がないという事実は、自然化された帰納へ向かう正しい一歩であることを示唆する。ヤン・ライケ(Jan Leike)は最近、反射的オラクルがゲーム理論の長年の未解決問題である真理の一片問題(grain of truth problem)も解決すると実証した。反射的オラクルは、ゲーム理論に初めて完全な意思決定理論上の基礎を与え、期待効用を最大化する汎用的な方法が反復ゲームで近似ナッシュ均衡を達成できることを示す。

要約すると、2015年に発表した論理的不確実性と自然化された帰納に関する論文のうち、2015年以前の研究に基づくものは次のとおりである。

2015年に行われ、同年に発表した研究:

2015年に行われ、2016年に発表したか発表予定の研究:

IAFFにあるその他の論理的不確実性研究については、The Two-Update Problem、Subsequence Induction、Strict Dominance for the Modified Demski Priorを参照。

意思決定理論

2015年には意思決定理論で、予想どおり控えめな進展に相当する、いくつもの新しい漸進的な前進を遂げた。

そのうち、アンドリュー・クリッチ(Andrew Critch)による資源に制約のある推論主体にも成り立つ、ローブの定理とゲーデルの第二不完全性定理の一種の証明を発表した。

クリッチは、ローブの定理のこのパラメーター化された有界版を用いて、互いのソースコードにアクセスできる、資源の限られた広範なソフトウェア・エージェントが、一回限りの囚人のジレンマで、相手につけ込まれない相互協力を達成できることを証明した。過去の頑健な協力の成果から、有界な主体の協力が可能だと信じる強い根拠はすでにあったが、これを確認できたことは有用であり、有界な推論主体を研究するための新しい形式的道具を与えてくれる。

この期間には、エリエザー・ユドコウスキー(Eliezer Yudkowsky)、ベンヤ、ネイトも、現在私たちが有力視している意思決定理論「関数的意思決定理論(functional decision theory)」について、技術的な理解(および哲学的な理解)を深めた。これは、更新不要意思決定理論をわずかに修正したものである。

続きを読む

意思決定理論を形式化するうえで現在最大の障害は、論理的反実仮想(logical counterfactual)について適切な形式的説明がないことだと思われる。論理的反実仮想とは、「(偽だと知っている)Xが真だったとすれば、Yについて何が(あるとすれば)導かれるか?」という形の問いである。これは意思決定理論で重要であり、その特殊例の一つが方策外予測(off-policy prediction)である。(行動Xを絶対に取らないと予測できる場合でも、もし取ったら何が起きるのかを問えるようにしたい。この問いに誤った答えを出すと、透明なニューカム問題で二箱を選ぶといった、質の低い自己成就予言を受け入れかねない。)

2015年には、関数的意思決定理論に関連し、形式化しやすいことが分かっていた証明ベース意思決定理論を検討した。そして、証明ベース意思決定理論に論理的反実仮想がないことは、この理論の重大な弱点だと判明した。

論理的反実仮想に対する、証明長に基づくいくつかのアプローチを探究し、最終的には退けた。ただし、このアプローチについてはその後も多少検討を続けている。最初の2015年ワークショップで、スコット・ギャラブラントは証明長と反実仮想についての非形式的な予想を提案し、その後改訂した。しかし、どちらの版もサム・アイゼンスタット(Sam Eisenstat)によって偽だと示された(1、2)。(スコットのOptimal and Causal Counterfactual Worldsも参照。)

別の研究系統では、パトリック・ラヴィクトワール(Patrick LaVictoire)らが証明ベース意思決定理論の枠組みを交渉と交易利得の分配という問題に応用した。IAFFにあるその他の意思決定理論研究については、ヴァネッサとスコットのSuperrationality in Arbitrary Games、スチュアート・アームストロング(Stuart Armstrong)のReflective Oracles and Superrationality: Prisoner’s Dilemmaを参照。

私たちのGitHubリポジトリには、様相エージェントに関する研究で生まれた新しいコードが多数あり、過去一年の意思決定理論研究で最も新規性の高い成果となっている。この研究で遂げた意思決定理論上の進展を説明する論文を、一、二本執筆中である。様相宇宙の背景については、“Evil” Decision Problems in Provability Logicや、意思決定理論のIAFFダイジェストにあるほかの投稿を参照。

2015年以前の研究で、2015年に発表したもの:

2015年に行われ、2016年に発表したか発表予定の研究:

ヴィンジ的内省

2015年には、この問題で控えめな進展を見込んでおり、実際に控えめな進展を遂げた。

ベンヤ・ファレンシュタインとラマナ・クマール(Ramana Kumar)の「Proof-Producing Reflection for HOL」は、HOL定理証明器における実用的な自己参照の一形態(そしてローブ的障害と先延ばしのパラドックスの双方に対する部分的解決)を実証している。この結果は、推論システムどうしの内部状態が異なる限り、ある推論システムが同じ方法で推論する別の推論システムを信頼できる可能性を示す証拠となる。

続きを読む

より具体的にはこの論文は、どの推論主体も個々の課題を無期限に委任できない限り、各システムが鎖の次のシステムを信頼するような推論システムの無限の連鎖を、形式的に指定できることを確立している。

論理的不確実性と論理的反実仮想について満足のいく説明を得ること以外に、現実世界でのヴィンジ的内省に何が必要かについて、MIRI内部では多少の議論がある。論理的不確実性の完全な理論がない状況で、これより優れた成果がそもそも得られそうかについても意見が分かれている。それでも「Proof-Producing Reflection for HOL」は、機械的に検証された証明を通じて、きわめて強力な反射的推論の一形態を実装できることを実証している。

ベンヤとラマナの研究は、反射的な推論主体のよりよい玩具モデルを構築できる環境も提供している。MIRI研究インターンのジャック・ギャラガー(Jack Gallagher)は現在、反射的エージェントを実装できるようにするセル・オートマトンをHOLで実装している。

前述の反射的オラクルの枠組みから得た成果を応用することで、ヴィンジ的内省についての理論的理解も深まった。IAFF投稿A Limit-Computable, Self-Reflective Distributionで、研究アソシエイトのツヴィ・ベンソン=ティルセン(Tsvi Benson-Tilsen)は、どのような内省が可能でどのようなものが不可能かについて、私たちの理解を確かなものにした。ジェシカはベンヤ、ポールと共同で、反射的オラクルを反射的確率論理の定義には容易に利用できないことも示した。

2015年以前の研究で、2015年に発表したもの:

2015年に行われ、同年に発表した研究:

IAFFにあるその他の関連投稿には、A Simple Model of the Löbstacle、Waterfall Truth Predicates、Existence of Distributions that are Expectation-Reflective and Know Itがある。

誤り耐性

2015年には、この問題で控えめな進展を見込んでいたが、限られた進展しか遂げられなかった。

2015年に訂正可能性(corrigibility)は中程度の優先事項であり、訂正可能なエージェントのよりよいモデルを構築しようと一定の労力を費やした。それにもかかわらず、大きな突破口は開けなかった。たとえば、誤り耐性のIAFFダイジェスト、スチュアート・アームストロングのAI制御のアイデア、ジェシカ・テイラーの概説記事に示されるように、訂正可能性についての理解にあった小さな欠陥を修正する点ではいくらか前進したが、これらの成果は比較的小さい。

続きを読む

2015年の主な新しい成果は、Google DeepMindの研究者ローラン・オルソー(Laurent Orseau)と、FHIの研究者でMIRI研究アソシエイトでもあるスチュアート・アームストロングによる訂正可能性の研究(「Safely Interruptible Agents(安全に中断可能なエージェント)」)に加え、誤り耐性に関する別の二つの部分問題についての研究だった。その二つとは、穏健な最適化(ジェシカのクォンタライザー(quantilizer、分位点にもとづく選択器)と、アブラム・デムスキ(Abram Demski)のStructural Risk Minimization(構造的リスク最小化))、および保守的概念(ジェシカのLearning a Concept Using Only Positive Examples)である。

2015年以前の研究で、2015年に発表したもの:

2015年に行われ、2016年に発表したか発表予定の研究:

訂正可能性で大きく前進できなかったことは、この問題が考えていたほど取り組みやすくない兆候かもしれない。あるいは、訂正可能性を適切に形式化するには、その前に論理的不確実性などの分野でさらに前進する必要があるのかもしれない(そうすれば、選好から何が帰結するのかについて運用者が不確かであることをモデル化するAIシステムの、よりよいモデルを構築できる)。

とはいえ、論理的不確実性における最近の進展と、最近のコロキウム・シリーズで関連話題について行われた有望な議論を踏まえると、訂正可能性の研究について以前より楽観的になっている。その議論には、(スチュアート・ラッセル(Stuart Russell)のグループによる)「Cooperative Inverse Reinforcement Learning(協調的逆強化学習)」、(トム・エヴェリット(Tom Everitt)による)「Avoiding Wireheading with Value Reinforcement Learning(価値強化学習によるワイヤーヘディングの回避)」、そしてスチュアート・アームストロングのいくつかの秘策が含まれる。

価値の指定

2015年には、この問題では限られた進展を見込んでおり、実際に限られた進展を遂げた。

価値学習と関連問題は昨年の優先順位が低かったため、大きな前進は見られなかった。

続きを読む

MIRI研究アソシエイトのカイ・ソタラ(Kaj Sotala)は価値の指定を研究の中心に据え、中核的な研究課題の外にある興味深いいくつかの問いを検討した。ジェシカ・テイラーも研究フォーラムでこの問題の調査を始めた。

2015年以前の研究で、2015年に発表したもの:

2015年に行われ、2016年に発表したか発表予定の研究:

今後は、高度な機械学習システムのアライメント研究プログラムのもとで、誤り耐性を備えたエージェント設計と価値の指定を、より重点的に扱う。

その他

2014年末から2015年初めにかけて、私たちは技術研究課題を公表した。概説論文「Agent Foundations for Aligning Machine Intelligence with Human Interests」は、2017年に『The Technological Singularity』で外部出版される予定である。

2015年には、エージェント基礎論の研究課題とは関係のない研究成果もいくつか生み出した。この研究は概して、予測と戦略に関する問いに焦点を当てていた。

続きを読む

2015年以前の研究で、2015年に発表したもの:

2015年に行われ、2016年に発表したか発表予定の研究:

2015年以降、MIRIが支援する新しいAI戦略・予測研究は、カチャ・グレース(Katja Grace)の独立プロジェクトAI Impactsで公開されている。AI Impactsは2015年に、人間の知能の幅から計算コストの傾向まで多様な話題を扱った、新しい記事31本とブログ投稿27本を掲載した。

全体として、2015年の研究成果には満足しており、チームの拡大によって技術的進展がさらに加速すると期待している。  

2015年の研究支援活動

技術研究コミュニティーを直接拡大した活動、または技術研究や共同研究を促進した活動に焦点を当てると、2015年に私たちは次のことを行った。

2015年にチームを拡大し、より広い学術コミュニティーと共同研究を進められたことをうれしく思う。この一年で、Google DeepMind、Google Brain、OpenAI、Vicarious、Good AI、Future of Humanity Institute、そのほかの研究グループの人々との関係を深めた。そのすべてにより、研究成果、研究方法、目標をほかの研究者と共有し、AIアライメント研究へ新たな人材を引きつけるうえで、以前より有利な立場に立てた。  

2015年の一般活動

研究への直接の支援以外では、2015年に次のことを行った。

対外活動の優先度は下げたものの、こうした活動は、MIRIや私たちの研究プログラム、そしてAI安全性研究全般への一般的な認知を広げるのに今後も役立つと見込んでいる。究極的には、過去の対外活動や能力構築の取り組みと同様に、支援者層を拡大するとともに、将来の研究者候補を(MIRIへも、より広い分野へも)引きつける助けになると期待している。  

2015年の資金調達

資金調達の実績には非常に満足している。2015年に私たちは次のことを成し遂げた。

埋め込みメディア

寄付金総額は2015年に28%増加した。この伸びを牽引したのは新規支援者からの寄付の増加であり、その内訳には、匿名支援者からの一回限りの$219,000の寄付、FLIからの$166,943の助成金、Raising for Effective Giving (REG)およびEffective Altruism Foundationによる再助成からの少なくとも$137,023が含まれる。((ここで数えているのは、REGを通じてMIRIへ直接行われた寄付だけである。REGの助言を受けた支援者がMIRIへ直接行った寄付も含めれば、REGによるMIRIへの支援は$200,000に近い可能性が高い。)) 既存支援者からの寄付が減少したのは、ピーター・ティール(Peter Thiel)が2015年に支援を打ち切ったことに加え、それ以前の年にジェド・マケーレブ(Jed McCaleb)から一回限りの多額の外れ値的な寄付があったためである(2013年に$526,316、2014年に$104,822を受領)。

こうした年ごとの比較から結論を導くのは少し難しい。この期間、特に2013年に、MIRIは大きな組織変更を経験した。2014年には発生主義会計へ切り替えたため、それ以前の年との比較がさらに難しくなっている。((また、この節の数値は以前公表した推計と厳密には一致しない場合がある。寄付データには小さな修正がたびたび加えられるためである。最後に、これらの数値には現物寄付を含まないことにも注意してほしい。)) それでも概して、資金調達は引き続き堅調に伸びている。

埋め込みメディア

新規支援者の数は2014年から2015年にかけて減少した。2014年の振り返りで、ルークは2014年に支援者数が大きく増えた理由を次のように説明している。

2014年には新規寄付者が大きく増えたが、その大部分はSV Gives資金調達キャンペーン中に行われた少額寄付によるものだった。既存寄付者の増加の相当部分も、しばらく寄付をしていなかった人々がSV Givesキャンペーン中に少額を寄付したことによる。

2015年と2013年の数値を比べると、既存支援者の数と支援者総数はいずれも健全に伸びている。

埋め込みメディア

上のグラフは、過去の各年における、小口、中口、大口、超大口の支援者層からの寄付を示している。最大の三つの層からの寄付は、概ね前年と比例する形で増加した。ただし大口支援者からの寄付だけは明確な例外で、寄付総額に占める割合が26%から31%へ増えた。小口支援者層からの寄付は前年比でわずかに減少したが、これも2014年のSV Givesで少額寄付が異例に多く集まったためである。

例年どおり、財務状況の完全な報告書(独立会計士によるレビュー報告書)は、私たちの透明性と財務ページで公開する。公開時期は8月末か9月初めとなる可能性が高い。  

2016年とその先

次は何か。六つの重点分野のうち五つで大きく前進するという研究目標に加え、2015年7~8月に次の運営目標を掲げた。

  1. 成長の加速:「中核研究チームをおよそ10人へ拡大する。」(出典)
  2. 「型理論の中の型理論」プロジェクト:「関連する道具の開発に常勤で取り組む型理論研究者を一、二人採用する。」(出典)
  3. 客員研究者プログラム:「関心を持つ教授たちに夏の間来訪してもらい、その夏季給与を私たちが支払い、関心が重なるプロジェクトに共同で取り組む。」(出典)
  4. 独立レビュー:「研究課題と初期成果について、独立した研究者から公に意見を募る方法も検討している。」(出典)
  5. より注目度の高い出版物:「今年の現在の計画は、一流の発表の場で質の高い論文を数本生み出すことに集中するというものだ。」(出典)

2015年には研究チームを3人から6人へ倍増させた。研究アソシエイト・プログラムを再編し、研究インターンを2人加えたことも含め、2015年に達成した成長には満足している。2016年前半は新メンバーの受け入れと定着に集中するため成長の優先度を下げたが、年末までには再び拡大する予定である。

型理論研究者の求人広告を出しており、次の中核研究者を数人採用した後に、この職を採用で埋める可能性が高い。それまでの間、研究インターンのジャック・ギャラガーに「型理論の中の型理論」プロジェクトを進めてもらっている。また、2016年4月には型理論ワークショップも開催した。

研究顧問の助けを得て、客員研究者プログラムは3週間のコロキウム・シリーズへと形を変えた。少数の研究者を長期間受け入れる代わりに、50人を超える研究者をより短い期間ずつ迎え、進行中の多様なAI安全性研究プロジェクトについて情報を交換した。登壇者には、スチュアート・ラッセル、フランチェスカ・ロッシ(Francesca Rossi)、トム・ディートリッヒ(Tom Dietterich)、バート・セルマンがいた。また、スチュアート・ラッセルとは訂正可能性に関する助成研究でも協力している。

研究プログラムの外部レビューを実施する作業が進行中であり、結果は今後数か月以内に得られる見込みである。

五つ目の目標については、8月下旬にITP 2015で発表した「Proof-Producing Reflection for HOL」に加え、その後LORI-Vで「Reflective Oracles」、UAI 2016で「Safely Interruptible Agents」と「A Formal Solution to the Grain of Truth Problem」、IJCAI 2016のワークショップで「The Value Learning Problem」を発表した。これらの発表の場のうちUAIは、私たちが過去に論文を発表してきた場の大半よりも一般に権威が高いとみなされている。より一流の場で発表するという目標に向け、これは一定の(ただしすばらしいとまではいかない)進展だったと考える。今後の論文発表計画については、ネイトがさらに詳しく述べる予定である。

計画についてこれ以上詳しく述べると、この振り返りの範囲を超えてしまう。今後数週間のうちに、ネイトがMIRIの大局的な戦略に関する投稿で、2016年の活動と今後の目標についてさらに詳しく説明する予定である。((この振り返りに多大な貢献をしてくれたロブ・ベンシンガー(Rob Bensinger)に感謝する。))