非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

学習によって生まれる最適化

原題: Learned Optimization

原文著者: Evan Hubinger, Chris van Merwijk, Vladimir Mikulik, Joar Skalse, and Scott Garrabrant / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2024-11-05

訳文状態: 校閲済み(原文対照レビュー実施)

高度な機械学習システムで、学習によって生まれる最適化がもたらすリスク

Evan Hubinger, Chris van Merwijk, Vladimir Mikulik, Joar Skalse, and Scott Garrabrant

この論文は、arXiv、AI Alignment Forum、LessWrongで読むことができます。

要旨

本論文では、ニューラルネットワークなどの学習されたモデルが、それ自体も最適化器になっている場合に起こる、学習によって生まれる最適化を分析します。私たちはこの状況をメサ最適化と呼びます。メサ最適化が起こりうることは、高度な機械学習システムの安全性と透明性について、二つの重要な問いを提起すると考えます。第一に、どのような状況で、学習されたモデルは最適化器になるのでしょうか。最適化器になるべきではない場合も含めて、これを問います。第二に、学習されたモデルが最適化器であるとき、その目的は何になるのでしょうか。学習に用いた損失関数とはどう異なり、どのようにアラインメントできるのでしょうか。本論文では、この二つの主要な問いを詳しく分析し、今後の研究課題の概要を示します。

用語集

第1節の用語

第2節の用語

第3節の用語

第4節の用語

参考文献

  1. Daniel Filan. ボトルのふたは最適化器ではない, 2018.
  2. Gregory Farquhar, Tim Rocktäschel, Maximilian Igl, and Shimon Whiteson. TreeQNとATreeC:深層強化学習のための微分可能な木構造モデル ICLR 2018, 2018.
  3. Aravind Srinivas, Allan Jabri, Pieter Abbeel, Sergey Levine, and Chelsea Finn. 汎用計画ネットワーク ICML 2018, 2018.
  4. Marcin Andrychowicz, Misha Denil, Sergio Gomez, Matthew W. Hoffman, David Pfau, Tom Schaul, Brendan Shillingford, and Nando de Freitas. 勾配降下法によって、勾配降下法で学ぶことを学ぶ NIPS 2016, 2016.
  5. Yan Duan, John Schulman, Xi Chen, Peter L. Bartlett, Ilya Sutskever, and Pieter Abbeel. RL²:遅い強化学習による速い強化学習 arXiv, 2016.
  6. Eliezer Yudkowsky. 最適化デーモン
  7. Joe Cheal. メタの反対は何か ANLP Acuity Vol. 2.
  8. Jan Leike, David Krueger, Tom Everitt, Miljan Martic, Vishal Maini, and Shane Legg. 報酬モデリングによる拡張可能なエージェントのアラインメント:研究の方向性 arXiv, 2018.
  9. Eliezer Yudkowsky. 最適化の力を測る, 2008.
  10. David Silver, Thomas Hubert, Julian Schrittwieser, Ioannis Antonoglou, Matthew Lai, Arthur Guez, Marc Lanctot, Laurent Sifre, Dharshan Kumaran, Thore Graepel, Timothy Lillicrap, Karen Simonyan, and Demis Hassabis. 自己対局でチェス、将棋、囲碁を極める汎用強化学習アルゴリズム Science, 362(6419):1140–1144, 2018.
  11. K. E. Drexler. 超知能を捉え直す:汎用知能としての包括的AIサービス 技術報告書 #2019-1、オックスフォード大学・人類の未来研究所, 2019.
  12. Ramana Kumar and Scott Garrabrant. 人間モデルについての考察 MIRI, 2019.
  13. Paul Christiano. 普遍事前分布は、実際にはどのようなものか, 2016.
  14. Alex Graves, Greg Wayne, and Ivo Danihelka. ニューラル・チューリングマシン arXiv, 2014.
  15. Guillermo Valle-Pérez, Chico Q. Camargo, and Ard A. Louis. 深層学習が汎化するのは、パラメーターから関数への写像が単純な関数に偏っているからである ICLR 2019, 2019.
  16. Paul Christiano. 未解決の問い:最小回路にはデーモンが存在しないか, 2018.
  17. Chris van Merwijk. プリンシパル=エージェント問題としてのAIエージェント開発。2019年刊行予定。
  18. Borja Ibarz, Jan Leike, Tobias Pohlen, Geoffrey Irving, Shane Legg, and Dario Amodei. Atariで、人間の選好と実演から報酬を学習する NeurIPS 2018, 2018.
  19. Jiawei Su, Danilo Vasconcellos Vargas, and Kouichi Sakurai. 深層ニューラルネットワークをだます1ピクセル攻撃 IEEE Transactions on Evolutionary Computation, 2017.
  20. Kareem Amin and Satinder Singh. 逆強化学習の識別不能性の解消に向けて arXiv, 2016.
  21. Razvan Pascanu, Yujia Li, Oriol Vinyals, Nicolas Heess, Lars Buesing, Sebastien Racanière, David Reichert, Théophane Weber, Daan Wierstra, and Peter Battaglia. モデルに基づく計画を一から学ぶ arXiv, 2017.
  22. David Manheim and Scott Garrabrant. グッドハートの法則の諸類型 arXiv, 2018.
  23. Nick Bostrom. スーパーインテリジェンス:経路、危険、戦略 Oxford University Press, 2014.
  24. Paul Christiano. 失敗はどのような姿をとるか, 2019.
  25. Nate Soares, Benja Fallenstein, Eliezer Yudkowsky, and Stuart Armstrong. 修正可能性 AAAI 2015, 2015
  26. Paul Christiano. 最悪の場合の保証, 2019.
  27. Robert J. Aumann, Sergiu Hart, and Motty Perry. うっかりした運転手. Games and Economic Behavior, 20:102–116, 1997.
  28. Jane X Wang, Zeb Kurth-Nelson, Dhruva Tirumala, Hubert Soyer, Joel Z Leibo, Remi Munos, Charles Blundell, Dharshan Kumaran, and Matt Botvinick. 強化学習の仕方を学ぶ CogSci, 2016
  29. Dario Amodei, Chris Olah, Jacob Steinhardt, Paul Christiano, John Schulman, and Dan Mané. AIの安全性に関する具体的な問題 arXiv, 2016.
  30. Stuart Armstrong and Sören Mindermann. オッカムの剃刀だけでは、非合理的なエージェントの選好を推測するには不十分である NeurIPS 2018, 2017.
  31. Xiaowei Huang, Marta Kwiatkowska, Sen Wang, and Min Wu. 深層ニューラルネットワークの安全性検証 CAV 2017, 2016.
  32. Guy Katz, Clark Barrett, David Dill, Kyle Julian, and Mykel Kochenderfer. Reluplex:深層ニューラルネットワーク検証のための効率的なSMTソルバー CAV 2017, 2017.
  33. Kexin Pei, Yinzhi Cao, Junfeng Yang, and Suman Jana. 機械学習の実用的な検証へ:コンピュータービジョンシステムの場合 arXiv, 2017.
  34. Paul Christiano, Buck Shlegeris, and Dario Amodei. 弱い専門家の能力を増幅して、強い学習者を監督する arXiv, 2018.
  35. Geoffrey Irving, Paul Christiano, and Dario Amodei. 討論によるAIの安全性 arXiv, 2018.