MIRIの研究へのガイド
ネイト・ソアレス(Nate Soares)著
2022年6月更新:下記の2019年の更新で述べたように、この研究ガイドは2015年以来、わずかしか更新されていない。また現在は、採用も以前より少なく(まったく採用していないわけではない)、AIRCSワークショップも現在は実施していない(将来、再び実施する可能性はある)。
アライメント問題への貢献に関心があるなら、『アライメント研究分野ガイド』、『アライメント/エージェンシーの独立研究へ入る方法』、そして「2021年後半のMIRI対話」ページの資料から始めることを勧める。
参加方法についてさらに質問があるなら、Redwood Researchのバック・シュレゲリス(Buck Shlegeris)へ連絡するか、LessWrongへ投稿することを勧める。
2019年3月更新:この研究ガイドは、2015年以来、わずかしか更新されていない。AIアライメント問題に取り組みたい人々への、新たな推奨は次のとおりである。
- コンピューター科学またはソフトウェア工学の経験がある場合:新しいAIリスク・ワークショップへの参加と、MIRIでエンジニアとして働くことへ応募してほしい。この目的では、私たちの研究について事前知識は必要ない。
- AIリスク・ワークショップまたはエンジニア職に自分が適しているか分からなければ、メールを送ってほしい。応募が理にかなうか、話し合うことができる。
- 私たちのエンジニアリング・プログラムの詳細は、2018年の戦略更新にある。
- 上記への答えに関係なく、私たちが取り組む問題についてもっと学びたい場合:エージェント基礎論(Agent Foundations)研究への入門として、『埋め込み型エージェンシー』を参照し、AI安全へ取り組み始める方法についての一般的な推奨として、『アライメント研究分野ガイド』を参照してほしい。
その二つの資料を確認した後は、『埋め込み型エージェンシー』とこのページにあるリンクと参考文献を使い、掘り下げたい話題についてさらに学べる。集中するための具体的な問題集が欲しければ、スコット・ギャラブラント(Scott Garrabrant)の『不動点の演習』を勧める。スコットが記すとおりである。
エージェント基礎論へ入るため、どの数学を学ぶべきかと聞かれることがある。私の第一の答えは、どの下位分野でも入門科目は役立ったが、その後の科目は、はるかに役立たなかった、というものだ。第二の答えは、あらゆる不動点定理を理解するのに十分な数学を学ぶことだ。
この二つの答えは、実のところ非常によく似ている。不動点定理は数学全体にまたがり、エージェント基礎論についての(私の)考え方の中心にある。
共同研究・議論する人が欲しければ、MIRIxグループを立ち上げる、または参加する、LessWrongへ投稿する、コンピューター科学者向けAIリスクワークショップへ応募する、あるいは別の形で、自分がいることを私たちへ知らせるところから始めることを勧める。
人間が、人間より賢く、よい影響をもたらす人工知能を開発するには、三つの手ごわい課題へ取り組まなければならない。第一に、指定された目標または選好をシステムが満たすという確信を正当化できるよう、信頼性が極めて高い、人間より賢いシステムを設計しなければならない。第二に、人間の誤りが避けられないなか、システムを稼働中に修正・訂正できるよう、その設計は誤り耐性を持たなければならない。第三に、システムは、実際に有益な目標または選好を学ばなければならない。
MIRIの現在の研究計画は、これらの課題へ原理上どう取り組むかを理解することに焦点を置く。信頼できる推論には、理論上さえ、まだ理解していない側面がある。限定合理性には、単純化した設定でさえ、まだ解けない問題がある。私たちの研究は、第一歩として、単純化した設定で解決策を見つけることへ集中する。そのため、現代の私たちの研究は、ソフトウェア工学や実践的機械学習より、純粋数学にはるかによく似ている。
このガイドは、私たちの研究上の優先事項を簡潔に概観し、各主題領域の最先端へ追いつく助けとなる資料を示す。このガイドは、こうした研究主題を正当化するためのものではない。私たちのアプローチの動機をさらに知るには、『MIRIのアプローチ』という記事、または私たちの技術研究課題と補足論文を参照してほしい。
注(2016年9月):この研究ガイドは、私たちのエージェント基礎論の研究課題を中心に構成されている。2016年現在、私たちには機械学習に焦点を置く研究課題もある。有望だと考えているが、このガイドでは扱わない研究方向の詳細は、その文書を参照してほしい。
目次
このガイドの使い方
このガイドは、関連する主題領域へまだ精通していない、研究者志望の人を対象とする。すでにAIの専門家または熟練した数学者なら、代わりに私たちの既刊資料へ進むことを検討してほしい。(私たちの技術研究課題は、よい出発点である。) このガイドは、将来MIRIの研究者になりたい場合に何を学ぶべきか考えている学生と、私たちの研究へ追いつきたい他分野の専門職に向けている。
研究者は一般に、二つの道のいずれかで私たちのチームへ加わる。第一の道は、MIRIのワークショップへ参加し、対面で私たちとの関係を築くことである。研究ワークショップへの参加は、このフォームから申し込める。ワークショップと次のワークショップの間には、かなり長い期間が空くことが多く、定員も限られることに注意してほしい。
第二の道は、私たちの研究課題について独力で何らかの進展を遂げ、その成果を私たちへ知らせることである。研究への支援または意見を求めるには、私たちのオンラインフォームを使える。しかし貢献を始める最速の方法は、Intelligent Agent Foundations Forum(IAFF)の投稿を読み、人々が取り組む未解決問題を確認し、一つ解くことである。その後、成果をフォーラムへリンクとして投稿できる。
(2019年3月更新:現在、LessWrongとAI Alignment Forumが、IAFFに代わり、AIアライメント問題を公開討議する際のおもな場となっている。この節の提案に関するほかの更新は、本稿上部を参照。)
研究フォーラムのおもな目的は、すでに認識を共有している研究者が、未完成の部分的な成果を議論することである。そのためフォーラムの投稿は、かなり分かりにくい場合がある。この研究ガイドは、IAFFで議論されている未解決問題へ追いつく助けとなる。また、ワークショップへの参加資格を得るために必要な技能を伸ばし、ほかの組織でAIアライメントの未解決問題へ取り組む方法を見つける助けにもなる。
このガイドは、確率論など、この形式の研究へ取り組む前に理解することが重要な基礎主題の推奨から始まる。その後は一連の主題領域に分かれ、その領域の最先端へ追いつくための論文へのリンクを示す。
これは直線的なガイドではない。MIRIの研究者になりたいなら、まず基礎を理解していることを確かめ、その後、関心のある主題を一つ選び、その領域を深く学ぶことを勧める。一つの主題を十分に理解すれば、IAFFでその主題領域への貢献を試みる準備が整う。
このガイドにあるすべての資料について、ただ苦労するためだけに、延々と取り組まないでほしい。すでに資料の内容を知っているなら、先へ進んでほしい。活発な研究領域の一つに関心を持てないなら、別のものへ移ってほしい。推奨教科書の一冊が好きでなければ、よりよいものを見つけるか、完全に飛ばしてほしい。このガイドは、貢献できる場所を見つけるための道具であって、その目標への障害ではない。
基礎
私たちが現在取り組む研究主題へ直接入る前に、初等的な数学概念を、ある程度自在に扱えることが重要である。私たちのすべての研究領域には、計算、論理、確率論の基礎的理解が役立つ。始めるための資料を、以下に示す。
この節の本を、記載順に読む必要はない。興味のあるものを手に取り、必要に応じ、研究領域と基礎の間を行き来することをためらわないでほしい。
集合論
現代数学の大半は集合論で形式化されており、ここに記載した教科書と論文も例外ではない。そのため、集合論は優れた出発点となる。
第1〜18章
計算可能性と論理
計算可能性の理論(および対角化がもたらす限界)は、機械に何ができ、何ができないかを理解する基礎である。
第1〜4章
確率論
確率論は、合理的エージェンシーを理解する中心にある。不確実性のもとでの推論に、ある程度精通することは、私たちが現在取り組むすべての研究領域で不可欠である。
第1〜5章
確率的推論
この本は、確率的な世界モデルを使って、推論をどう行えるかについての理解を、より具体的なものにする助けとなる。
統計学
統計モデリングを自在に扱えることは、私たちの『高度な機械学習のアライメント』という研究課題へ貢献する際に役立つ。ここでは、確率的推論にある程度事前に精通するのが望ましい。
機械学習
機械学習へ実践的に精通するには、アンドリュー・ン(Andrew Ng)のCoursera講座を強く勧める(講義ノートはこちら)。MLのより理論的な入門には、Understanding Machine Learningを試してほしい。
人工知能
私たちの研究の多くは理論的な性格を持つが、その研究を文脈へ位置づけるには、現代の人工知能分野についての知識が重要である。
VNM合理性の概念を理解することも重要である。私はウィキペディアの記事から学ぶことを勧めるが、原著から学ぶこともできる。フォン・ノイマン(Von Neumann)とモルゲンシュテルン(Morgenstern)は、少数の単純な一貫性公理へ従う行為者はすべて、効用関数によって特徴づけられる選好をもって行動することを示した。信頼できる知的エージェントを構築するには、最終的にVNM合理性を捨てる必要があるかもしれないと予想する人もいる。しかしVNMの枠組みは、任意に強力な行為者の振る舞いを特徴づけるため、私たちが持つ最も表現力の高い枠組みであり続けている。(たとえば、ボストロム(Bostrom)の『超知能の意志』にある、直交性テーゼと道具的収束テーゼを参照。) VNM合理性の概念は、私たちが現在取り組む、すべての研究領域で使われる。
現実的な世界モデル
人間より賢いシステムが信頼できなければ、有益な目標を形式化しても役に立たない。優れた推論には、原理上さえ、まだ理解していない側面がある。機能するように見えるアルゴリズムを使って実践的なシステムを構築すれば、その機能する理由がまだ十分理解されていなくても、洞察を得られる可能性は高い。理論的理解は、実用化の後に続く場合が多いからである。しかし、超知能になり得るシステムを設計する際、私たちはこのアプローチを軽率だと考える。実践的な超知能システムを作ろうとする前に、汎用知能の理論を手元に持っているほうが安全である。
この理由から、現在取り組む研究主題の多くは、原理上さえ解決方法をまだ理解していない、汎用知能の一部へ焦点を当てる。たとえば、次の問題を考えてほしい。
私には、「宇宙」と呼ばれるコンピュータープログラムがある。この宇宙にある関数の一つは未定義である。あなたの仕事は、私の宇宙プログラムを完成させるため、適切な型のコンピュータープログラムを提供することである。その後、私は宇宙プログラムを実行する。私の目標は、元の宇宙プログラムが何かを、あなたのエージェントがどれほどうまく学習するかに応じ、得点をつけることである。
これは、どうすればできるだろうか? ソロモノフ(Solomonoff)の帰納的推論理論は、理論上の解決策へ光を当てる。観察から理想的な予測を行う方法を記述するが、それは予測器が環境の外部にいる場合だけである。ソロモノフ帰納は、帰納的推論について考えるための、多数の有用な道具(コルモゴロフ複雑性、普遍事前分布、AIXIを含む)を生み出した。しかし、エージェントが宇宙の下位過程であり、宇宙によって計算される場合、問題は明らかに難しくなる。
エージェントが環境内へ埋め込まれている場合、帰納の問題は不明瞭になる。何をもって「宇宙プログラムを学習した」とするのか? 環境についてのどの分布に対し、エージェントを採点すべきか? 「エージェント」と「環境」の境界が曖昧になる場合、理想的帰納とは何か? これらは「自然化された帰納(naturalized induction)」の問題である。
ソアレスの『現実的な世界モデルに関する二つの問題を形式化する』は、汎用知能の理論を構築するうえで関係するものとして、自然化された帰納の問題を、さらに動機づける。
アルテア(Altair)の『ソロモノフ帰納の直感的説明』は、ソロモノフの帰納的推論理論を説明する。この理論は、自然化された帰納の未解決問題を理解する際、重要な背景知識である。
ベンシンガー(Bensinger)の『自然化された帰納』(シリーズ)は、自然化された帰納の問題を、さらに詳しく探究する。
自然化された帰納の問題を解くには、現実的な世界モデルを、よりよく理解する必要がある。「可能な現実」の集合は何か? 理想的な行為者は、環境についてどのような事前分布を使うのか? こうした問いへの答えは、優れた推論を可能にするだけでなく、その世界モデルを用い、人間の目標を指定できるようにしなければならない。
たとえば、ソロモノフ帰納(およびハッター(Hutter)のAIXI)では、環境をモデル化するためチューリング機械を使う。私たちが重んじるのはダイヤモンド(ほかの四つの炭素原子と共有結合した炭素原子)だけだ、と仮定しよう。さて、チューリング機械を一つ渡したとする。その中にダイヤモンドがどれほどあるか、答えられるだろうか?
世界モデルを用いて指定された目標を追求する行為者を設計するには、その行為者が、世界モデル(チューリング機械)内で、私たちの目標のオントロジー(炭素原子)を特定する何らかの方法を持たなければならない。この「オントロジー同定(ontology identification)」問題は、『現実的な世界モデルに関する二つの問題を形式化する』(上にリンク)で論じられ、ド・ブラン(De Blanc)が最初に提示した。
- ド・ブランの『人工エージェントの価値体系におけるオントロジー危機』は、オントロジーの変化に対して、行為者の目標をどう頑健にできるかを問う。行為者が、原子を用いる物理モデル(炭素原子がオントロジー上の基本要素であるモデル)から始めるなら、これは難しくないかもしれない。しかし、原子核を用いる物理モデル(原子が中性子と陽子から構成されるモデル)を行為者が構築すると、何が起きるか? 「炭素認識器」がハードコードされていたなら、行為者はこの新しい世界モデル内で炭素を一切特定できず、(隠れた「真の炭素」を探して)奇妙に行動し始めるかもしれない。このオントロジー危機に応じ、行為者が「陽子6個の原子」を「炭素原子」と首尾よく同定できるよう、どう設計できるだろうか?
参考資料
レッグ(Legg)とハッターの『普遍知能:機械知能の定義』は、エージェントが環境から分離した設定における普遍的知能エージェントAIXIと、その設定で、さまざまなエージェント・プログラムの知能を評価するために使う「採点尺度」を記述する。ハッターのAIXIとレッグの採点尺度は、自然化された帰納とオントロジー同定の問題への応答として私たちが探しているものと、発想の面で非常によく似ている。二つの違いがある。AIXIが住む宇宙ではエージェントと環境が分離している一方、自然化された帰納は、エージェントが環境内へ埋め込まれた解決策を必要とする。また、AIXIが観察を用いて指定された報酬を最大化する一方、私たちは外界を用いて指定された報酬を最適化する解決策を望む。
ハッターの本『普遍人工知能』でAIXIをさらに学べる。ただし、私たちの目的には、(上でリンクした)レッグの論文を読めば、おそらく十分である。
意思決定理論
次のものを渡したとしよう。(1)宇宙を記述するコンピュータープログラム、(2)エージェントを記述するコンピュータープログラム、(3)エージェントが選べる行動の集合、(4)宇宙がこれまで取った状態の履歴について指定された選好の集合。その選好に照らし、エージェントが選べる最善の行動を特定するよう、あなたへ課題を与える。たとえば、入力は次のようなものかもしれない。
def Universe():
outcomes = {Lo, Med, Hi}
actions = {One, Two, Three}
def Agent():
worldmodel = {Lo: One, Hi: Two, Med: Three}
return worldmodel[Hi]
territory = {One: Lo, Two: Med, Three: Hi}
return territory[Agent()]
def Agent():
worldmodel = {Lo: One, Hi: Two, Med: Three}
return worldmodel[Hi]
actions = {One, Two, Three}
Hi > Med > Lo
(エージェントが環境へ埋め込まれている点に注意してほしい。) これも、原理上さえ答える方法を知らない問いである。簡単に見えるかもしれない。各行動を順に調べ、エージェントがその行動を取った場合、どの帰結を得るか突き止め、最良の帰結へつながる行動を選ぶだけである。しかし実のところ、この思考実験では、エージェントは、決定論的コンピュータープログラムの決定論的下位過程である。エージェントが出力する行動は、正確に一つしかない。そして決定論的プログラムの決定論的な一部が、実際には行わないことをした場合に「何が起きるか」と問うことは、未定義である。
エージェントが別の行動を取った場合に「何が起きるか」を評価するには、エージェントが実際には行わないことを行う「反実仮想環境」を構築しなければならない。反実仮想推論の十分な理論は、まだ存在しない。宇宙と私たちの選好について完全な知識があり、無限の計算能力を与えられたとしても、環境内へ埋め込まれたエージェントが選べる最善の行動を、理論上どう特定するか、まだ理解していない。
この問題を解くには、反実仮想推論をよりよく理解する必要がある。これが意思決定理論の領域である。
意思決定理論
ピーターソン(Peterson)の教科書は、規範的意思決定理論の分野を大まかに説明する。ニューカム型問題へ、より強く焦点を置く短い概説には、ミュールハウザー(Muehlhauser)の『意思決定理論FAQ』を参照してほしい。
ゲーム理論
意思決定理論の未解決問題の多くは、複数エージェントの設定に関係する。タデリス(Tadelis)の教科書についてよい評判を聞いたことはあるが、自分では読んでいない。LessWrongにあるスコット・アレクサンダー(Scott Alexander)の『ゲーム理論入門』も、役立つかもしれない。
第1〜5章
(熱心なら、第6〜9章も)
証明可能性論理
複数エージェント設定のおもちゃモデルは、同じ環境にいるほかのエージェントについて、証明できることにもとづき、各エージェントが行動する環境で研究できる。現在の私たちのおもちゃモデルは、証明可能性論理を多用する。
既存の反実仮想推論の手法は、短期的にも(よい帰結が可能な一部の問題で、体系的に悪い帰結を実現するという意味で)、長期的にも(悪い反実仮想を使って推論する自己修正エージェントは、その壊れた反実仮想に従えば、自分の欠陥をすべて直すべきでないと決める、という意味で)、満足できないことが判明する。私の講演『なぜ君は金持ちでないのか?』は、この二点に簡潔に触れている。さらに学ぶには、次の資料を勧める。
- ソアレスとフォーレンシュタイン(Fallenstein)の『理想化された意思決定理論に向けて』は、全般的な概観となり、MIRIの研究計画へ関係するものとして、意思決定理論の問題をさらに動機づける。この論文は、現代の二つの意思決定理論の短所を論じ、反実仮想推論を行う新たな方法を指し示す、意思決定理論の新しい洞察をいくつか論じる。
『理想化された意思決定理論に向けて』の進み方が速すぎるなら、この一連のブログ記事のほうが、優れた出発点かもしれない。
ユドコウスキー(Yudkowsky)の『真の囚人のジレンマ』は、協力が、自動的に「正しい」または「よい」選択肢になるわけではない理由を説明する。
ソアレスの『因果的意思決定理論は満足できない』は、意思決定アルゴリズム間にある非因果的なつながりの重要性を説明するため、囚人のジレンマを使う。
ユドコウスキーの『ニューカム問題と合理性の後悔』は、単に直感的に妥当に見える意思決定理論ではなく、「勝つ」意思決定理論へ焦点を当てるべきだと論じる。ソアレスの『ニューカム型問題入門』も、同様の範囲を扱う。
ソアレスの『ニューカム型問題は標準である』は、人間の行為者は、日常的に互いの意思決定基準を確率的にモデル化すると指摘する。
MIRIの研究は、上で論じた多くの短所へ対処する、新しい意思決定理論「無更新意思決定理論(Updateless Decision Theory, UDT)」の開発につながった。
ヒンツェ(Hintze)の『予測的ジレンマにおける問題クラスの優越』は、ほかの既知の意思決定理論に対するUDTの優越を要約する。その理論には、因果的意思決定理論(CDT)と証拠的意思決定理論(EDT)より優越する、もう一つの理論である時間なし意思決定理論(Timeless Decision Theory, TDT)も含まれる。
フォーレンシュタインの『論理文についての具体的な事前分布を持つUDTモデル』は、確率的形式化を提示する。
しかしUDTは、決して解決策ではなく、それ自身にも多数の短所がある。次の箇所で論じられている。
スレプネフ(Slepnev)の『UDTにおける、自己成就する偽の証明の一例』は、偽の証明のため、UDTが次善の結果を実現し得る仕組みを説明する。
ベンソン=ティルセン(Benson-Tilsen)の『既知の探索順序を持つUDT』は、やや満足できない解決策である。既知の証明探索順序を持つUDTの形式化を含み、偽の証明を避けるため、「宇宙とチキンゲームをする」と呼ばれる技法を使う必要性を実証する。
複数エージェントの設定を研究するため、パトリック・ラヴィクトワール(Patrick LaVictoire)は、様相エージェントの枠組みを開発した。この枠組みにより、証明可能性論理を使い、意思決定理論分野で新たな進展を遂げることもできた。
- バラス(Barasz)ほかの『囚人のジレンマにおける頑健な協力』により、互いの振る舞いについて証明できることだけにもとづき、協力するかを決めるエージェントを考察できる。これにより無限後退を防げる。実際、他者の振る舞いについて証明できることだけに従い行動する二つのエージェントの振る舞いは、証明可能性論理の結果を使い、二次時間で決定できる。
参考資料
UDTは、ウェイ・ダイ(Wei Dai)とウラジーミル・スレプネフ(Vladimir Slepnev)らが開発した。ダイの『新しい意思決定理論に向けて』がその考えを提示し、スレプネフの『停止オラクルを持つUDTモデル』が、初期の形式化を提示した。スレプネフは『エージェントが予測器をシミュレートする』で、UDTでは、行為者が知能を低くすることで報酬を得るように見えるという、奇妙な問題も記述した。
これらのブログ記事には歴史的な関心があるが、その内容はほぼすべて、上の『理想化された意思決定理論に向けて』に含まれる。
論理的不確実性
一つの投入口と二つの排出口を持つ、黒い箱を想像してほしい。球を投入口へ入れると、二つの排出口のどちらかから出てくる。黒い箱の内部には、投入口から排出口の一つへ球を運ぶ、ルーブ・ゴールドバーグ(Rube Goldberg)・マシンがある。
箱のなかにどのルーブ・ゴールドバーグ・マシンがあるか知らない、完全な確率的推論器は、箱がどう振る舞うか知らない。しかし、どの機械が箱のなかにあるか解明できれば、球がどちらの排出口から出るか分かる。この推論器は、環境について不確かである。
現実的な推論器は、箱のなかにどの機械があるかを知り、機械の仕組みを正確に知っていても、その機械が球をどこへ落とすか解明する演繹能力を欠くかもしれない。この推論器は、論理的に不確かである。
確率論は、論理的全知を仮定する。推論器は、自分が知ることの帰結をすべて知っていると仮定する。現実には、有限の推論器は論理的に全知ではない。箱がどの機械を実装し、機械が正確にどう動くかを知りながら、球がどこから出るか演繹する時間だけがない場合もある。私たちは、論理的不確実性のもとで推論する。
論理的不確実性のもとでの推論を扱う形式理論は、まだ存在しない。信頼性が極めて高い汎用知能システムを構築するうえで、この理解を得ることは極めて重要である。エージェントが複雑なシステム、コンピュータープログラム、またはほかのエージェントの振る舞いを推論するときは、必ず少なくとも少しの論理的不確実性のもとで動かなければならない。
最先端の状況を理解するには、確率論の堅固な理解が必須である。ジェインズ(Jaynes)の最初の数章へ、フェラー(Feller)の第1、5、6、9章を加え、その後、次の論文を学ぶことを検討してほしい。
ソアレスとフォーレンシュタインの『論理的不確実性のもとでの推論に関する問い』は、論理的不確実性の分野を説明し、MIRIの研究計画との関係を動機づける、全般的な入門を提示する。
ガイフマン(Gaifman)の『一階計算における測度について』は、何年も前にこの問題を検討した。ガイフマンはおもに、形式体系の異なるモデルへ確率を割り当てるという、関係する下位問題へ焦点を置いた(モデルが分かれば、そのモデルのあらゆる帰結も分かると仮定する)。現在、私たちは、このアプローチを、より完全な論理的不確実性の概念(推論器が、モデルが何か知りながら、そのモデルの含意を知らない場合)へ拡張しようとしている。しかし、歴史的文脈と、論理的不確実性を取り巻く困難の理解を得るには、ガイフマンの研究が今も役立つ。
ハッターほかの『表現力豊かな論理における文の確率』はおもに、無限の計算能力(と、多層の停止オラクル)を利用できると仮定し、論理的不確実性の問題を検討する。ハッターのアプローチ(そして、無限の計算能力でできること)を理解すると、難しい問いがどこにあるかについての理解を、さらに具体化できる。
デムスキ(Demski)の『論理的事前確率』は、計算可能に近似できる論理的事前分布を提示する。デムスキに続き、私たちの研究はおもに、論理文について、近似可能な事前確率分布を作ることへ集中する。論理的事前分布を洗練し、近似する行為は、一般に論理的不確実性のもとで推論する行為と非常によく似ているからである。
クリスティアーノ(Christiano)の『非全知性、確率的推論、メタ数学』は、おおむねこのアプローチに従う。この論文は、論理的事前分布の生成について、初期の実践的な考慮事項をいくつか提示し、少数の未解決問題を強調する。
参考資料
この問題についての、より歴史的な研究には、ガイフマンの『豊かな言語についての確率』…と『限られた資源での推論と、算術文への確率の割り当て』を参照してほしい。
ヴィンジ的内省
AI問題を独特なものにする要因の多くは、十分に高度なシステムが、人間のプログラマーより質の高い科学と工学を行えるようになることである。高度なシステムが持ち得る危険と便益の多くは、自らをより高い能力水準へ立ち上げ、場合によっては知能爆発を起こす可能性から生じる。
エージェントが再帰的自己改良によって超知能を実現するなら、結果となるシステムの影響は、最初のシステムが、自分より知的なエージェントについて、どれほど確実に推論できるかへ、完全に左右される。さらに知的なシステムの振る舞いについて、極めて強く確信することを正当化するため、システムはどのような推論方法を使えるだろうか? この種の推論を、自分より知的な行為者の振る舞いを正確に予測することは一般には不可能だと指摘した、ヴァーナー・ヴィンジ(Vernor Vinge)(1993年)にちなみ、「ヴィンジ的内省(Vingean reflection)」と呼ぶ。
ヴィンジ的内省を行う推論器は、より知的なエージェントについて、必然的に抽象的に推論しなければならない。これには、論理的不確実性のもとで高い確信度を得る、何らかの形の推論が、ほぼ確実に必要となる。しかし、機能する論理的不確実性の理論がないため、抽象的推論を研究するうえで、証明についての推論(形式論理を使う)が、利用できる最良の形式体系である。そのため、ヴィンジ的内省を現代的に研究するには、形式論理の背景知識が必要となる。
一階論理
自己修正エージェントを研究するため、MIRIが現在持つおもちゃモデルは、おおむねこの論理にもとづく。類似した体系について、確信に近い何かを持てる形式体系を研究するため、私たちが開発した道具を使うには、一階論理の微妙な点を理解することが不可欠である。
私たちは、非常によく似た体系へ、何らかの形の確信を持てるエージェントのおもちゃモデルを構築することで、ヴィンジ的内省を研究する。最先端へ追いつくには、次の論文を読んでほしい。
フォーレンシュタインとソアレスの『ヴィンジ的内省:自己改良エージェントのための信頼できる推論』は、ヴィンジ的内省の分野を提示し、MIRIの研究計画とのつながりを動機づける。
ユドコウスキーの『先延ばしのパラドックス』は、レーブ的障害(Löbian obstacle、「自己信頼」が少なすぎるため生じる問題)と、自己信頼が多すぎるため生じる不健全性の間で、満足できる解決策が細い道を歩む必要性を、さらに詳しく論じる。
クリスティアーノほかの『確率論理における真理の定義可能性』は、自己言及のパラドックスを避けながら、自らについて推論できる形式体系を作る、初期の試みを記述する。成功はしたが、最終的に不健全であることが示された。この論文についての私の解説は、もう少し文脈へ位置づける助けになるかもしれない。
フォーレンシュタインとソアレスの『自己改良する時空埋め込み型知能における自己言及の問題』は、自分をわずかに改善した版を生み出す、または自分を「敷き詰める」エージェントを研究するための、単純な提案器・検証器モデルを記述する。この論文は、健全なエージェントが、ほかの類似したエージェントへ、首尾よく敷き詰められる(たとえば、強い確信を得られる)おもちゃシナリオを実証する。
参考資料
ユドコウスキーとヘレショフ(Herreshoff)の『自己修正AIのための敷き詰めエージェント』は、ヴィンジ的内省への、より古く、断片的な入門であり、私の解説を使うと読み進めやすいかもしれない。
この研究主題に強い関心があれば、関係する技術報告がほかにも多数ある。残念ながら、その大半は動機をうまく説明しておらず、より大きな文脈へまだ位置づけられていない。
フォーレンシュタインの『確率論理における先延ばし』は、クリスティアーノほかの確率的推論体系が不健全であり、先延ばしのパラドックスへ脆弱である仕組みを示す。ユドコウスキーの『敷き詰めを可能にする分布』…は、確率的な敷き詰め設定へ向け、初期のいくつかの段階を踏む。
フォーレンシュタインの『数学的強さの減少』…は、レーブ的障害への部分的解決策であるパラメトリック多相性(Parametric Polymorphism)が持つ、満足できない性質を一つ記述する。ソアレスの『フォーレンシュタインの怪物』は、上記の問題を避ける、つぎはぎ的な形式体系を記述する。また、エージェントの目標述語を制限する仕組みも示す。この仕組みは、パラメトリック多相性でも利用でき、敷き詰めエージェント論文で探究された版より制限の少ないPPを作れる。フォーレンシュタインの『健全な理論がなす無限下降列』…は、レーブ的障害への、より洗練された部分的解決策を記述し、現在、私たちが好む部分的解決策の一つとなっている。
再帰的順序数を理解すると、こうした結果を理解するための有用な文脈が得られる。フランゼン(Franzén)の『超限進行:完全性の再検討』を読めば、その理解を得られる。
訂正可能性(corrigibility)
人工知能システムの知能と能力が高まるにつれ、選べる行動の一部により、プログラマーによる介入へ抵抗できるようになるかもしれない。合理的なエージェントには、停止させる、または選好を変更する試みに抵抗する既定の誘因があるにもかかわらず、作成者が訂正のための介入とみなすものへ協力するAIシステムを、「訂正可能」と呼ぶ。
この研究分野は、基本的にまったく新しいので、追いつくために必要なのは、論文を一、二本読むことだけである。
ソアレスほかの『訂正可能性』は、いくつかの未解決問題とともに、分野全体を提示する。
アームストロング(Armstrong)の『無差別による適切な価値学習』は、どの効用関数を最大化するかに無差別なエージェントを作る、潜在的な一アプローチを論じる。これは、自らが変更されることを許すエージェントへ向けた小さな一歩である。
訂正可能性についての現在の私たちの研究は、おもに「停止問題」として知られる小さな下位問題へ焦点を当てる。停止ボタンを押すと停止し、かつ、そのボタンが押されることを引き起こす、または妨げる誘因を持たないエージェントを、どう構築するか? この下位問題では、現在、効用無差別問題へ焦点を当てている。どの効用関数を最大化するかを切り替えられ、しかも切り替えが起きるかどうかへ影響を与える誘因を持たないエージェントを、どう構築できるか? 効用無差別問題への十分な解決策を得ても、停止問題への十分な解決策にはならない。「停止時の振る舞い」を、意図を外れた実現(perverse instantiation)の影響を受けない形で適切に指定することは、依然として難しそうだからである。スチュアート・アームストロング(Stuart Armstrong)は、「影響を抑えた」AGIの指定について、いくつかのブログ記事を書いている。
こうした最初の試みは、まだ完全な解決策ではないが、この問題についての現在の理解へ追いつく助けとなるはずである。
参考資料
訂正可能性についての初期の研究は、ウェブフォーラムLess Wrongにある。関係する成果の大半は、上記の論文に収められている。そのなかで特に興味深いものの一つが、「動機づけられた価値選択」問題の例である、『ケーキか死か』だ。この例では、自分の効用関数について不確かなエージェントは、その不確かさを減らす情報を避けることで便益を得る。
アームストロングの『影響を抑える数学:助力を求む』は、影響を抑えたエージェントを指定するための初期の考えを列挙する。そして『実践における影響抑制:未来を無作為に抽出する』は、未来が影響を受けたか評価する、単純な方法の概略を示す。
アームストロングの『効用無差別』は、元の効用無差別という考えの概要を示し、おもに歴史的な理由から興味深い。上でリンクした『無差別による適切な価値学習』論文が、これを包含している。
価値学習
私たち自身の価値についての理解は、曖昧で不完全なので、強力なAIへ価値を組み込むため、最も有望かもしれないアプローチは、私たちの価値を徐々に学習する基準を、エージェントへ指定することだろう。しかし、これは多数の興味深い問題をもたらす。
幸せな人間で満たされた多数の帰結(「よい」というラベル)と、悲しい人間で満たされたほかの帰結(「悪い」というラベル)を含む訓練集合を作ったとしよう。このデータから得られる最も単純な汎化は、人間は、人間の形をして笑っているものが本当に好きだ、というものかもしれない。その場合、このエージェントは、幸せそうに見える小さなアニマトロニクス人形を多数作ろうとするかもしれない。
価値学習は、オンライン過程でなければならない。システムは曖昧さを特定し、その曖昧さについて利用者へ質問できなければならない。分類方法が分からない事例(顔が幸せそうか悲しそうか判別できない場合など)を特定するだけでなく、訓練データが情報を一切与えない次元(訓練データに、幸せそうに見える人型自動機械で満たされ、「無価値」というラベルがついた帰結が一度もない場合など)も、同様に特定しなければならない。
もちろん、曖昧さを特定するだけでは十分でない。最初の3週間を、人間のいる標高が違っても、風が吹いていても、人間にはなお価値があるか、と確認することに使い、最後に(運用者が注意を払わなくなった後)、人間の形をしたものが自らの意志で行動していることは重要か、と尋ねるシステムは望まない。
エージェントが私たちの意図を確実に学習するには、運用者のモデルを構築・洗練し、そのモデルを質問内容へ反映させ、選好を変更しなければならない。こうした問題とほかの問題をさらに学ぶには、次を参照してほしい。
ソアレスの『価値学習問題』は、価値学習に関係する少数の未解決問題を全般的に概観する。
デューイ(Dewey)の『何を重んじるかを学ぶ』は、価値学習の難しさをさらに論じる。
直交性テーゼは、価値学習が既定で解決されることはないと論じる。
マカスキル(MacAskill)の『規範的不確実性』は、規範的不確実性を論じるための枠組みを提示する。完全版は、多数の洞察を含む一方、非常に長いことに注意してほしい。特に、現在取り組むほかの研究領域に、より強い関心があるなら、一部を流し読みする、またはいくつかの箇所を飛ばしても構わない。
参考資料
規範的不確実性を解消する一アプローチが、ボストロムとオード(Ord)の「議会モデル」である。このモデルは、価値学習がおおよそ、投票者の選好を集約する問題に相当し、多数の価値学習システムを、議会の投票システム(投票者は、あり得る効用関数)としてモデル化できると示唆する。
オーウェン・コットン=バラット(Owen Cotton-Barratt)の『正規化の幾何学的理由』…は、効用関数の正規化を論じる。これは、道徳的不確実性のもとでの推論のおもちゃモデルに関係する。
フォーレンシュタインとスティエノン(Stiennon)の『ラウドネス』は、効用関数の集約に関する懸念を論じる。その懸念は、効用関数によって符号化された選好が、正のアフィン変換(たとえば、効用関数を拡大縮小、または平行移動すること)のもとで保存されるという事実から生じる。これは、あり得る関数の集合を正規化するため、特別な注意が必要なことを含意する。
ほかの道具
どの主題でも、熟達は非常に強力な道具になり得る。特に数学の領域では、切り離されて見える主題が、実際には深くつながっている。数学の多数の分野には、それを極めてよく理解すれば、どこへ行っても、その理解が役立つという性質がある。そのことを念頭に置くと、以下に示す主題は、MIRIが現在取り組む研究を理解するために必須ではないが、それぞれを理解することで、新しい研究を行う際に、しばしば非常に役立つ追加の道具を、数学の道具箱へ加えられる。
離散数学
教科書はオンラインで入手できる。数学の大半は、連続構造または離散構造のどちらかを研究する。離散数学のほうが直感的だと感じる人は多い。離散数学を堅固に理解すれば、群論、位相幾何学、情報理論など、ほかの多数の数学的道具について、離散版をすばやく把握する助けとなる。
線形代数
線形代数は、数学のほぼあらゆるところに現れる道具の一つである。線形代数を堅固に理解すると、多数の領域で役立つ。
型理論
集合論は、現代数学の基礎として広く使われるが、利用できる候補はそれだけではない。型理論も数学の基礎として使え、多くの場合、目前の問題には型理論のほうがよく適合する。型理論は、コンピュータープログラムと数学的証明の間にある理論上の隔たりの大部分へ橋を架けるため、特定の種類のAI研究にも、しばしば関係する。
圏論
圏論は、多数の数学的構造を、非常に高い抽象水準で研究する。これにより、数学の大きく異なる分野にあるパターンへ気づき、数学的な道具を一つの領域から別の領域へ、はるかに容易に移せるようになる。
位相幾何学
位相幾何学も、数学のほぼあらゆるところに現れる主題の一つである。位相幾何学を堅固に理解すると、予想外の多数の場所で役立つことが判明する。
計算可能性と計算複雑性
MIRIの数学研究は、最終的にコンピュータープログラムと関係する解決策へ向けて取り組んでいる。コンピューターに何ができるかについての優れた直感は、しばしば不可欠である。
プログラム検証
プログラム検証の技法により、プログラマーは、特定のプログラムが何らかの仕様に実際に従って動作すると、確信できるようになる。(もちろん、その仕様が意図した振る舞いを記述することを検証するのは、今も難しい。) MIRIの研究は現在、現実世界のプログラムを検証することへ関わっていない。しかし、現代のプログラム検証技法に何ができ、何ができないかを理解することは、かなり役立つ。
ミッションを理解する
そもそも、なぜこの種の研究を行うのか?
超知能
このガイドはおおむね、読者がすでにMIRIのミッションに賛同していると仮定する。しかし、そもそも、なぜこれほど多くの人々が、これを重要で緊急の研究領域だと考えるのか疑問なら、『スーパーインテリジェンス』が優れた概観を提示する。
合理性:AIからゾンビまで
この電子的大著は、AIに関するMIRIの見方の背後にある哲学と認知科学の多くを説明する論考6巻を、一つにまとめたものである。
不十分な均衡
見過ごされた研究機会を含め、社会の失策と死角を見つけることへ関係するものとして、ミクロ経済学と認識論を論じる。「珍しい目標を実現する野心的な計画は、いつ成功を期待できるのか?」という基本的な問いへ、答えようとする試みである。




















