11月23日追記: スコットが「自然化された世界モデル」という用語を「埋め込まれた世界モデル」へ変更したことを受け、この記事も修正しました。これら四つの研究課題の詳しい導入については、スコット・ガラブラントとエイブラム・デムスキーの「埋め込まれたエージェント性」をご覧ください。
今年、それぞれの研究分野でどの程度進展するかを予測する仕事を、ネイト・ソアレスからスコット・ガラブラントが引き継ぎます。スコットは、MIRIのアラインメント研究を五つに分類しています。
埋め込まれた世界モデル — エージェントと環境の境界が明確でない、大規模で複雑な物理環境のモデル化に関する問題です。代表的な問題には、論理的不確実性、自然化された帰納、多層的な世界モデル、存在論的危機などがあります。
入門資料:「現実的な世界モデルの二つの問題の形式化」「論理的不確実性のもとでの推論に関する問い」「論理的帰納」「反省的オラクル」
最近の研究例:「超実数版ブラウワー」「翻弄されない数学者」「論理的不確実性のベイズ的な定式化に関する、さらなる進展」
意思決定理論 — 意思決定者が最もよい結果をもたらす出力を選べるよう、実際のものと反事実的なものの両方を含む、さまざまな意思決定の出力が何をもたらすかをモデル化する問題です。主な問題には、反事実、非更新性、協調、強要、反省的安定性などがあります。
入門資料:「ダマスカスで死神を欺く」「意思決定は、悪い結果が整合しないようにするためにある」「関数的意思決定理論」
最近の研究例:「協力的オラクル」「喫煙病変問題の議論を最も強い形にする」(1、2)、「ハッピーダンス問題」「ローヴェア問題の逆を解く反省的オラクル」
頑健な委任 — 自分の代わりに仕事をしてくれると信頼して任せられる、高性能なエージェントを作る問題です。主な問題には、修正可能性、価値学習、十分な情報に基づく監督、ヴィンジ的反省などがあります。
入門資料:「価値学習の問題」「修正可能性」「完全に情報更新した後の判断委譲の問題」「ヴィンジ的反省」「機械学習を用いたAIリスクへの対処」
最近の研究例:「グッドハートの法則の諸類型」「価値への安定した参照」
サブシステムのアラインメント — AIシステムの下位システム同士が相反する目的で動かないようにするための問題です。特に、意図しない目標を最適化する内部の副次的な過程を、システムが作り出さないようにします。主な問題には、無害な帰納があります。
入門資料:「普遍事前分布は、実際にはどのようなものか」「最適化デーモン」「遠く離れた超知能のモデル化」
最近の研究例:「帰納を無害にする際のいくつかの問題」
その他 — 上記の分類に入らないアラインメント研究です。「高度な機械学習システムのアラインメント」に記した未解決問題で進展があり、それがエージェントの基礎理論の研究との関連が薄く、機械学習寄りのものであれば、おそらくここに分類します。
従来「論理的不確実性」と「自然化された帰納」に分類していた問題は、現在は「埋め込まれた世界モデル」と呼んでいます。他の三つの分類、「ヴィンジ的反省」「誤りへの耐性」「価値学習」で取り組んでいる問題の大部分は、「頑健な委任」にまとめました。そして「サブシステムのアラインメント」と「その他」という二つの新分類を設けました。
以下は、2018年2月から12月にかけてのスコットの予測です。1は「限定的」な進展、2は「小さい〜中程度」、3は「中程度」、4は「中程度〜大きい」、5は「かなり大きい」進展を表します。スコットの数値を理解する助けとして、ネイトの2015〜2017年の予測と、各年の進展についてのネイトとスコットの評価も、新しい分類に置き換えて示しています。
埋め込まれた世界モデル:
- 2015年の進展:5。予測:3。
- 2016年の進展:5。予測:5。
- 2017年の進展:2。予測:2。
- 2018年の進展予測:3(中程度)。
意思決定理論:
- 2015年の進展:3。予測:3。
- 2016年の進展:3。予測:3。
- 2017年の進展:3。予測:3。
- 2018年の進展予測:3(中程度)。
頑健な委任:
- 2015年の進展:3。予測:3。
- 2016年の進展:4。予測:3。
- 2017年の進展:4。予測:1。
- 2018年の進展予測:2(小さい〜中程度)。
サブシステムのアラインメント(新分類):
- 2018年の進展予測:2(小さい〜中程度)。
その他(新分類):
- 2018年の進展予測:2(小さい〜中程度)。
この予測には大きな不確実性がありますが、今後1年間、研究者の力をどう配分するつもりなのか、現在進めている研究の方向性にどれほど期待しているのかを、おおまかに伝えるものにはなるはずです。
新しい分類によって、予測の正確さについて誤った印象を与えかねない点には注意してください。たとえば、2016年のヴィンジ的反省にはあまり進展を見込んでいませんでしたが、価値学習と誤りへの耐性には大きな進展を期待していました。実際にはその逆だったので、予測を複数外したと数えるべきです。しかし、外れ方が逆方向であり、今はこれらの分野の大部分を「頑健な委任」という一つの分類にまとめているため、上の内訳では、2016年の予測が実際より正確だったように見えてしまいます。
以前の分類を使うと、2015〜2018年の予測と評価は次のようになります。
| 論理的不確実性+自然化された帰納 | 意思決定理論 | ヴィンジ的反省 | 誤りへの耐性 | 価値の指定 | |
|---|---|---|---|---|---|
| 2015〜2017年の進展 | 5, 5, 2 | 3, 3, 3 | 3, 4, 4 | 1, 1, 2 | 1, 2, 1 |
| 2015〜2018年の予測 | 3, 5, 2, 3 | 3, 3, 3, 3 | 3, 1, 1, 2 | 3, 3, 1, 2 | 1, 3, 1, 1 |
全般に、こうした予測は、その年の最も重要な成果がどれほど重要だったかという評価に基づきます。小さな成果が多数あるより、大きな成果が一つあるほうが、数値は高くなります。評価と予測には、まだ文章にまとめていない研究も含めています。ただし、近いうちに公表する予定のない研究は含めていません。