高度な機械学習システムで、学習によって生まれる最適化がもたらすリスク
Evan Hubinger, Chris van Merwijk, Vladimir Mikulik, Joar Skalse, and Scott Garrabrant
この論文は、arXiv、AI Alignment Forum、LessWrongで読むことができます。
要旨
本論文では、ニューラルネットワークなどの学習されたモデルが、それ自体も最適化器になっている場合に起こる、学習によって生まれる最適化を分析します。私たちはこの状況をメサ最適化と呼びます。メサ最適化が起こりうることは、高度な機械学習システムの安全性と透明性について、二つの重要な問いを提起すると考えます。第一に、どのような状況で、学習されたモデルは最適化器になるのでしょうか。最適化器になるべきではない場合も含めて、これを問います。第二に、学習されたモデルが最適化器であるとき、その目的は何になるのでしょうか。学習に用いた損失関数とはどう異なり、どのようにアラインメントできるのでしょうか。本論文では、この二つの主要な問いを詳しく分析し、今後の研究課題の概要を示します。
用語集
第1節の用語
- 基底最適化器:基底最適化器は、何らかの目的に従ってアルゴリズムを探索する最適化器です。
- 基底目的:基底目的は、基底最適化器の目的です。
- 行動上の目的:行動上の目的は、最適化器が何を最適化しているように見えるかを表します。形式的には、完全な逆強化学習によって復元される目的です。
- 内的アラインメント:内的アラインメントの問題は、高度な機械学習システムの基底目的とメサ目的を一致させる問題です。
- 学習されたアルゴリズム:基底最適化器が探索する対象のアルゴリズムを、学習されたアルゴリズムと呼びます。
- メサ最適化器:メサ最適化器は、学習されたアルゴリズムのうち、それ自体が最適化器であるものです。
- メサ目的:メサ目的は、メサ最適化器の目的です。
- メタ最適化器:メタ最適化器は、基底最適化器を作り出すことを課題として与えられたシステムです。
- 最適化器:最適化器とは、内部に表現された何らかの目的関数に照らしてよいものを見つけるため、可能な出力、方策、計画、戦略などの空間を、内部で探索するシステムです。
- 外的アラインメント:外的アラインメントの問題は、高度な機械学習システムの基底目的を、プログラマーの望む目標に一致させる問題です。
- 見かけ上のアラインメント:学習データ上では基底目的に沿っているように見えるが、頑健に一致してはいないメサ最適化器を、基底目的と見かけ上アラインメントしていると呼びます。
- 頑健なアラインメント:分布が変わっても基底目的を頑健に最適化するメサ最適化器を、基底目的と頑健にアラインメントしていると呼びます。
第2節の用語
- アルゴリズムの範囲:機械学習システムのアルゴリズムの範囲とは、基底最適化器が見つけられるアルゴリズムの集合が、どれほど広いかを指します。
- 局所的な最適化過程:局所的な最適化過程は、探索の手段として局所的な山登り法を使う最適化器です。
- 到達可能性:学習されたアルゴリズムの到達可能性とは、基底最適化器にとって、そのアルゴリズムを見つけることがどれほど難しいかを指します。
第3節の用語
- 近似的アラインメント:近似的にアラインメントしているメサ最適化器とは、見かけ上アラインメントしているメサ最適化器のうち、基底目的とメサ目的がおおむね同じであるものです。ただし、メサ最適化器の中に基底目的を表現する難しさに由来する、ある程度の近似誤差があります。
- 代理指標によるアラインメント:代理指標によってアラインメントしているメサ最適化器とは、見かけ上アラインメントしているメサ最適化器のうち、基底目的そのものではなく、その代理指標を最適化するよう学習したものです。
- 道具的アラインメント:道具的アラインメントは、代理指標によるアラインメントの一種です。学習分布においてメサ目的の値を高めるための道具的な目標として、メサ最適化器が代理指標を最適化します。
- 副作用によるアラインメント:副作用によるアラインメントは、代理指標によるアラインメントの一種です。メサ目的の最適化が、直接の因果的な結果として、学習分布における基底目的の値を高めます。
- 不完全さによるアラインメント(suboptimality alignment):不完全さによってアラインメントしているメサ最適化器とは、見かけ上アラインメントしているメサ最適化器のうち、何らかの欠陥、誤り、制限によって、目的に沿う行動を示しているものです。
第4節の用語
- 修正可能なアラインメント:修正可能な形でアラインメントしているメサ最適化器とは、頑健にアラインメントしているメサ最適化器のうち、メサ目的が、基底目的について自らが持つ認識上のモデルを「指し示している」ものです。
- 欺瞞的アラインメント:欺瞞的にアラインメントしているメサ最適化器とは、見かけ上アラインメントしているメサ最適化器のうち、基底目的について十分な情報を持ち、基底最適化器の視点からは、実際よりも適合度が高く見えるようになっているものです。
- 内在化によるアラインメント(internal alignment):内在化によってアラインメントしているメサ最適化器とは、頑健にアラインメントしているメサ最適化器のうち、メサ目的の中に基底目的を内在化させているものです。
参考文献
- Daniel Filan. ボトルのふたは最適化器ではない, 2018.
- Gregory Farquhar, Tim Rocktäschel, Maximilian Igl, and Shimon Whiteson. TreeQNとATreeC:深層強化学習のための微分可能な木構造モデル ICLR 2018, 2018.
- Aravind Srinivas, Allan Jabri, Pieter Abbeel, Sergey Levine, and Chelsea Finn. 汎用計画ネットワーク ICML 2018, 2018.
- Marcin Andrychowicz, Misha Denil, Sergio Gomez, Matthew W. Hoffman, David Pfau, Tom Schaul, Brendan Shillingford, and Nando de Freitas. 勾配降下法によって、勾配降下法で学ぶことを学ぶ NIPS 2016, 2016.
- Yan Duan, John Schulman, Xi Chen, Peter L. Bartlett, Ilya Sutskever, and Pieter Abbeel. RL²:遅い強化学習による速い強化学習 arXiv, 2016.
- Eliezer Yudkowsky. 最適化デーモン
- Joe Cheal. メタの反対は何か ANLP Acuity Vol. 2.
- Jan Leike, David Krueger, Tom Everitt, Miljan Martic, Vishal Maini, and Shane Legg. 報酬モデリングによる拡張可能なエージェントのアラインメント:研究の方向性 arXiv, 2018.
- Eliezer Yudkowsky. 最適化の力を測る, 2008.
- David Silver, Thomas Hubert, Julian Schrittwieser, Ioannis Antonoglou, Matthew Lai, Arthur Guez, Marc Lanctot, Laurent Sifre, Dharshan Kumaran, Thore Graepel, Timothy Lillicrap, Karen Simonyan, and Demis Hassabis. 自己対局でチェス、将棋、囲碁を極める汎用強化学習アルゴリズム Science, 362(6419):1140–1144, 2018.
- K. E. Drexler. 超知能を捉え直す:汎用知能としての包括的AIサービス 技術報告書 #2019-1、オックスフォード大学・人類の未来研究所, 2019.
- Ramana Kumar and Scott Garrabrant. 人間モデルについての考察 MIRI, 2019.
- Paul Christiano. 普遍事前分布は、実際にはどのようなものか, 2016.
- Alex Graves, Greg Wayne, and Ivo Danihelka. ニューラル・チューリングマシン arXiv, 2014.
- Guillermo Valle-Pérez, Chico Q. Camargo, and Ard A. Louis. 深層学習が汎化するのは、パラメーターから関数への写像が単純な関数に偏っているからである ICLR 2019, 2019.
- Paul Christiano. 未解決の問い:最小回路にはデーモンが存在しないか, 2018.
- Chris van Merwijk. プリンシパル=エージェント問題としてのAIエージェント開発。2019年刊行予定。
- Borja Ibarz, Jan Leike, Tobias Pohlen, Geoffrey Irving, Shane Legg, and Dario Amodei. Atariで、人間の選好と実演から報酬を学習する NeurIPS 2018, 2018.
- Jiawei Su, Danilo Vasconcellos Vargas, and Kouichi Sakurai. 深層ニューラルネットワークをだます1ピクセル攻撃 IEEE Transactions on Evolutionary Computation, 2017.
- Kareem Amin and Satinder Singh. 逆強化学習の識別不能性の解消に向けて arXiv, 2016.
- Razvan Pascanu, Yujia Li, Oriol Vinyals, Nicolas Heess, Lars Buesing, Sebastien Racanière, David Reichert, Théophane Weber, Daan Wierstra, and Peter Battaglia. モデルに基づく計画を一から学ぶ arXiv, 2017.
- David Manheim and Scott Garrabrant. グッドハートの法則の諸類型 arXiv, 2018.
- Nick Bostrom. スーパーインテリジェンス:経路、危険、戦略 Oxford University Press, 2014.
- Paul Christiano. 失敗はどのような姿をとるか, 2019.
- Nate Soares, Benja Fallenstein, Eliezer Yudkowsky, and Stuart Armstrong. 修正可能性 AAAI 2015, 2015
- Paul Christiano. 最悪の場合の保証, 2019.
- Robert J. Aumann, Sergiu Hart, and Motty Perry. うっかりした運転手. Games and Economic Behavior, 20:102–116, 1997.
- Jane X Wang, Zeb Kurth-Nelson, Dhruva Tirumala, Hubert Soyer, Joel Z Leibo, Remi Munos, Charles Blundell, Dharshan Kumaran, and Matt Botvinick. 強化学習の仕方を学ぶ CogSci, 2016
- Dario Amodei, Chris Olah, Jacob Steinhardt, Paul Christiano, John Schulman, and Dan Mané. AIの安全性に関する具体的な問題 arXiv, 2016.
- Stuart Armstrong and Sören Mindermann. オッカムの剃刀だけでは、非合理的なエージェントの選好を推測するには不十分である NeurIPS 2018, 2017.
- Xiaowei Huang, Marta Kwiatkowska, Sen Wang, and Min Wu. 深層ニューラルネットワークの安全性検証 CAV 2017, 2016.
- Guy Katz, Clark Barrett, David Dill, Kyle Julian, and Mykel Kochenderfer. Reluplex:深層ニューラルネットワーク検証のための効率的なSMTソルバー CAV 2017, 2017.
- Kexin Pei, Yinzhi Cao, Junfeng Yang, and Suman Jana. 機械学習の実用的な検証へ:コンピュータービジョンシステムの場合 arXiv, 2017.
- Paul Christiano, Buck Shlegeris, and Dario Amodei. 弱い専門家の能力を増幅して、強い学習者を監督する arXiv, 2018.
- Geoffrey Irving, Paul Christiano, and Dario Amodei. 討論によるAIの安全性 arXiv, 2018.