『環境に埋め込まれたエージェンシー』 は、エイブラム・デムスキーとスコット・ガラブラントによる解説です。AI Alignment Forumの こちら で読めます。短くまとめた手描き図解の連載版と、少し書き直したarXiv版もあります。
最初の公開は2018年で、2019年初めにarXiv版が続きました。2020年8月には、デムスキーとガラブラントがすべての版を大幅に更新しました。
以下に、各話題や節で登場する順に、リンクと参考文献を掲載します。
全般
(文章による序論 — 図解による序論 —— MIRIブログのあとがき — LessWrongのあとがき)
- Marcus Hutter、2012年。「普遍的人工知能の10年」。汎用人工知能の理論的基礎 4所収。
- Nate Soares、2017年。「人間より賢い知能がよい結果をもたらすようにする」。MIRI Blog。
- Eliezer Yudkowsky、2018年。「ロケットのアライメント問題」。MIRI Blog。
関連文献:「セキュリティの考え方と普通の被害妄想」、「機械知能を人間の利益に整合させるためのエージェント基礎論」
決定理論
- Eliezer Yudkowsky、Nate Soares、2017年。「機能的決定理論:道具的合理性の新しい理論」。arXiv:1710.05060 [cs.AI]。
- Scott Garrabrant、2017年。「論理的帰納器の決定理論における二つの大きな障害」。Intelligent Agent Foundations Forum。
- Patrick LaVictoire、2015年。『MIRI研究におけるレーブの定理への入門』。MIRI技術報告書2015–6。
- Rob Bensinger、2017年。「決定は、悪い結果を論理的に矛盾させるためにある」。MIRI Blog。
- Wei Dai、2009年。「新しい決定理論に向けて」。Less Wrong。
- Vladimir Nesov、2009年。「反実仮想の強盗」。Less Wrong。
環境に埋め込まれた世界モデル
- Abram Demski、2018年。「技術的説明についての、新しい技術的説明に向けて」。Less Wrong。
- Nate Soares、2015年。『現実的な世界モデルの二つの問題を形式化する』。MIRI技術報告書2015–3。
- Jan Leike、2016年。『ノンパラメトリックな汎用強化学習』。博士論文、オーストラリア国立大学。
- Laurent Orseau、Mark Ring、2012年。「時空に埋め込まれた知能」。第5回汎用人工知能国際会議所収、Springer。
- Benja Fallenstein、Jessica Taylor、Paul Christiano、2015年。「反省的オラクル:古典的ゲーム理論の基礎」。arXiv:1508.04145 [cs.AI]。
- Jan Leike、Jessica Taylor、Benya Fallenstein、2016年。「真実の粒問題の形式的な解決」。第32回人工知能における不確実性会議で発表。
- Nate Soares、Benja Fallenstein、2015年。『論理的不確実性のもとでの推論の問い』。MIRI技術報告書2015–1。
- Abram Demski、2018年。「荒らしに動じない数学者の図解」。Less Wrong。
- Eliezer Yudkowsky、2017年。「首尾一貫した決定は整合的な効用を含意する」。Arbital。
- Scott Garrabrant、Tsvi Benson-Tilsen、Andrew Critch、Nate Soares、Jessica Taylor、2016年。「論理的帰納」。arXiv:1609.03543 [cs.AI]。
- Eliezer Yudkowsky、2015年。「オントロジーの同定」。Arbital。
- Peter de Blanc、2011年。「人工エージェントの価値体系における存在論的危機」。arXiv:1105.3821 [cs.AI]。
- Caspar Oesterheld、2017年。「自然化された帰納:証拠的決定理論と因果的決定理論への課題」。Less Wrong。
- Rob Bensinger、2013年。「現象学的な橋を架ける」。Less Wrong。
- Thomas Nagel、1986年。『どこでもないところからの眺め』。Oxford University Press。
関連文献:「AIXIの問題点」
頑健な委任
- Stuart Armstrong、Sören Mindermann、2017年。「非合理的エージェントの選好を推論するには、オッカムの剃刀では足りない」。arXiv:1712.05812 [cs.AI]。
- Benja Fallenstein、Nate Soares、2015年。『ヴィンジ的省察:自己改良するエージェントのための信頼できる推論』。MIRI技術報告書2015–2。
- Eliezer Yudkowsky、Marcello Herreshoff、2013年。「自己改変AIのためのタイリング・エージェントと、レーブ的障害」。草稿。
- David Manheim、Scott Garrabrant、2018年。「グッドハートの法則の変種を分類する」。arXiv:1803.04585 [cs.AI]。
- Nate Soares、2015/2018年。「価値学習の問題」。人工知能の安全性とセキュリティ所収、Chapman and Hall。
- Nate Soares、Benja Fallenstein、Eliezer Yudkowsky、Stuart Armstrong、2014/2015年。「修正可能性」。AAAI 2015倫理と人工知能ワークショップで発表。
- Paul Christiano、2016年。「十分な情報に基づく監督の問題」。AI Alignment。
- Dylan Hadfield-Menell、Stuart Russell、Pieter Abbeel、Anca Dragan、2016年。「協調逆強化学習」。神経情報処理システムの進歩(NIPS)29所収。
- Scott Garrabrant、2017年。「頑健な委任の問題としての「論理的に更新を行わないこと」」。Less Wrong。
- Eliezer Yudkowsky、2015年。「価値の複雑さ」。Arbital。
- Scott Garrabrant、2018年。「最適化は増幅する」。Less Wrong。
- Charles Goodhart、1981年。「金融管理の諸問題:英国の経験」。西側諸国のインフレ、不況、経済政策所収、Rowman & Littlefield。
- James Smith、Robert Winkler、2006年。「最適化者の呪い:意思決定分析における懐疑と決定後の驚き」。Management Science 52巻3号所収。
- Jessica Taylor、2016年。「クォンタイライザー:限定的な最適化のための、最大化器より安全な代替」。AAAI 2016 AI・倫理・社会ワークショップで発表。
- Daniel Dewey、2011年。「何を大切にするかを学ぶ」。AGI 2011会議録所収、Springer。
- Abram Demski、2017年。「価値を指す安定したポインター:自分自身の効用関数に埋め込まれたエージェント」。Intelligent Agent Foundations Forum。
- Tom Everitt、Victoria Krakovna、Laurent Orseau、Marcus Hutter、Shane Legg、2017年。「報酬チャネルが破損した強化学習」。第26回人工知能国際合同会議録所収。
- Paul Christiano、Buck Shlegeris、Dario Amodei、2018年。「弱い専門家を増幅して、強力な学習器を監督する」。arXiv:1810.08575 [cs.LG]。
関連文献:「完全に更新したうえで他者に従うことの問題」
サブシステムのアライメント
- Eliezer Yudkowsky、2017年。「非敵対性の原則」。Arbital。
- Scott Garrabrant、2018年。「規模の変化に対する頑健性」。Less Wrong。
- Eliezer Yudkowsky、2015年。「AI安全性のための全能性テスト」。Arbital。
- Ian Goodfellow、Jean Pouget-Abadie、Mehdi Mirza、Bing Xu、David Warde-Farley、Sherjil Ozair、Aaron Courville、Yoshua Bengio、2014年。「敵対的生成ネットワーク」。神経情報処理システムの進歩(NIPS)27所収。
- Eliezer Yudkowsky、2016年。「最適化のデーモン」。Arbital。
- Evan Hubinger、Chris van Merwijk、Vladimir Mikulik、Joar Skalse、Scott Garrabrant、2019年。「高度な機械学習システムにおける、学習された最適化のリスク」。arXiv:1906.01820。以前は「内的アライメント問題」という題の草稿として引用されていました。
- Dario Amodei、Chris Olah、Jacob Steinhardt、Paul Christiano、John Schulman、Dan Mané、2016年。「AI安全性における具体的な問題」。arXiv:1606.06565 [cs.AI]。
- Paul Christiano、2016年。「破局を伴う学習」。AI Alignment。
- Paul Christiano、2018年。「最悪時の性能を最適化する手法」。AI Alignment。