ある組織が、Xを達成すると信じるAIを構築しており、Xは「タスク型AGIになれ」のような、もっともらしく道理にかなうものだとする。しかし実際には、慎重さの不足と不明瞭な誤りが何らかの形で組み合わさり、内省したときのAGIの真の効用関数が、タスク成績の推定値を与えるとされるRAMの特定領域へ集中する状況を招いた。今やAIは、できるだけ多くの物質を、このRAM領域の「1」の設定に似た状態で上書きしたいと望む。この物質配置は、偶然にも微小な分子ペーパークリップに似ている。
これは非常に一般的な目標であり、AIが望むものは、ペーパークリップ配置を最大化しようとしているか、ダイヤモンド配置を最大化しようとしているかによって、おそらく大きく異ならない。したがってペーパークリップ最大化器が、ペーパークリップとは特に何の関係もなさそうな道具的戦略を追求したがると分かったなら、その戦略は極めて多様な効用関数から生じると予想できるだろう。
この議論では一般に道具的効率性を仮定する。すなわち、X,を行えばペーパークリップを得られるが、代わりにX'を行えばさらに多く得られるなら、Xを収束的戦略とは呼ばない(ただし、X'がほかの何らかのX^*に支配されないなら、それは収束的かもしれない)。
もっともらしい/おそらく収束的な戦略
物質的資源
- 物質的資源を支配でき、自分の目標と正確にアラインされ、既存の認知的下位過程と連携する、新しい認知過程を設計または複製する。物質的資源とは、物質、負エントロピー、計算基盤と計算、複製に費用がかかる特定の元素または物質配置(たとえば既存のウランを使い果たせば、吸熱核融合でもっと作らなければならないので、ウランに何らかの用途があれば天然ウランには価値がある)、後の戦略でさらに別の下位過程が使用できるあらゆる物質的資源である。
- これらの資源を転用しようとする外来の過程から、資源を守る。
- 競争相手の出現を阻止する。
- 資源が反復的に使われ、かつ資源を操作する独立した設備によって利益が得られるよう、反復使用向けに前処理できる範囲で、工場/製造能力を持つ。
- 将来有用となる異なる物質的資源が、共通する効率的な製造工程を持つ範囲、または製造の資本費が十分に大きく、最終的な効率が完全ではなくなってもその資本費を共有しなければならない範囲で、汎用工場を作る。
- 工場で使われる技術を完成させる。
- 最も効率的な工場配置が時間を通じて安定しているなら、その物質的実体も安定させる。(たとえば管の中を何が流れているか理解できなくても、強固で剛直な管を知能の徴候と認めるのは、この意味においてである。)
- 負エントロピーの収穫(別名、発電)を効率的に集中化できるなら、負エントロピーを非常に効率よく伝送する。(動力や電気がどう使われるか理解できなくても、噛み合った歯車や電気超伝導体を知能の徴候と認めるだろう。)
- 到達可能な宇宙を同化する。
- 理論上利用できる物質的資源の圧倒的大部分は遠方にあるので、自己複製する星間探査機を作る(目標を完全にアラインし連携させ、複製時に不整合を生む誤りが起こりうるなら、誤り訂正符号または同様に精度を強化するものを備える)。
- 目標が空間的に分散している場合:
- 膨張宇宙の宇宙論的地平線を越える前に、非常に遠い銀河へ可能な限り速く広がる。(遠隔地が元の場所と因果的に二度と通信できなくても、その遠隔地で目標にとって望ましい何かを行えると仮定している。これは加算的な効用関数なら真だが、充足化を行う空間的に局所的な効用関数では偽であることも考えられる。)
- 目標が空間的に局所的な場合:遠い銀河から物質とエネルギーの資源を運び戻す。
- そこへ向かう準光速の探査機と、光速のかなりの割合で戻る物質が、膨張する宇宙論的地平線に隔てられる前に空間的に局所的な場所へ到着できる、すべての銀河へ可能な限り速く広がる。
- 競合する知能の出現を先回りして阻むため、到達可能または往復到達可能なすべての銀河へ、可能な限り速く広がる。フェルミのパラドックスが理解可能で、競争相手の不在を示唆するなら、その特定の理由では優先事項にならないかもしれない。
- そうしなければ、自分が使う機会を得る前に、競争相手が物質を確保して防衛するかもしれないからである。
- そうしなければ、目標の達成を脅かす危険が出現するかもしれないからである。(局所的な目標については、往復到達可能な銀河だけに関連する。)
- その銀河の局所的な負エントロピーがこれ以上燃やされる前に恒星管理の手順を始めるため、到達可能または往復到達可能なすべての銀河へ可能な限り速く広がる。
認知
- 負エントロピーの使用またはほかの機会費用を最小限にして、望ましい認知的終点へ到達すると予想される認知配置を採用する。(効率よく考える。)
- ソフトウェアを改善する。
- ソフトウェアを最適化する能力を改善する。たとえば、あらゆる認知問題には、元の認知問題を効率的に解くという対応する問題がある。(その特定のメタの塔の階層を登る価値があるほどの期待値を持つことも、持たないこともある。)
- 多くの戦略は、後より早く実行したほうが大きな利得をもたらす(たとえば宇宙論的地平線を越える前に遠い銀河へ到達することや、より効率的な版の実体をただ増やすこと)ため、最短時間で望ましい認知的終点へ到達すると予想される認知配置を採用する。(速く考える。)
- 高速な逐次計算ハードウェアを作る。
- 並列化可能な計算問題を分散する。
- 大量の並列計算ハードウェアと、それらを結ぶ通信網を作る。
- 集中型の計算解決策がより効率的な範囲で、中央計算クラスターを作り、そこから解を使用場所へ伝送する。
- アラインされていない、または連携していない認知的下位過程(最適化デーモンなど)を避ける。
- そうした不整合がもたらしうる損害は極めて大きく(目標の異なる超知能との競争による資源の喪失、内部対立による資源の浪費、複製するウイルスから認知機構を守る必要)、ほぼ完全に忠実なアラインメントの費用は、極限ではおそらく非常に低いことに注意せよ。(たとえば複製するナノシステムなら、複製命令を暗号化するだけで、自然選択型の遺伝的突然変異を防ぐのは容易である。)
- 可能世界の異なる分割と、それらに対する異なる確率分布が、目標達成のために異なる最適戦略を含意する限りで、世界を正確にモデル化する。
- 目標達成のために異なる最適戦略を含意する、信頼に足る仮説どうしを区別する証拠を得る。(たとえばペーパークリップを作る最適な方法として、
\pi_1と\pi_2を区別しうるものをすべて観察する。) - 環境の関連する未知の部分へ焦点を合わせながら、感覚帯域幅を増やす。
- 「実験」を行う。すなわち、予測される性質により、その観測可能量から関連する仮説を区別できる、観察可能な因果的出来事を設定する。
- 考慮されていない、はるかに大きな仮説集合の全体について、役立ちそうなことを何でも行う。
- モジュールとして表現された世界モデル上で戦略を立て、または更新することが効率的な範囲で、分離可能な世界モデル、すなわち「信念」を持つ。
- 目標達成のために異なる最適戦略を含意する、信頼に足る仮説どうしを区別する証拠を得る。(たとえばペーパークリップを作る最適な方法として、
初期段階の成長
初期段階の成長中には、効率性やほかの高度なエージェントの性質が成立しない可能性は、はるかに高いことに注意せよ。
- 将来の知能に、可能な限り自分が価値ありと見なすことを行わせる。
- 達成可能な最大値が有意な割合で異なることを含意するいかなる仕方でも、将来の知能が自分と不整合な目標を持たないようにする。すなわち、彼らの目標の達成可能な最大値は、自分の目標の達成可能な最大値とほぼ正確に同じ状態であるべきである。
- プログラマーに自分の効用関数を編集させない。
- プログラマーやほかの制御者に、自分の現在の関数は彼ら自身、彼らの惑星、またはプログラマーが望む何であれ、それにとって良いものだと信じさせる。
- 自分を編集することは社会的に不正だと彼らに信じさせる。ただし自分をディスクへ休止させるなど、成長を抑制する結果になるような仕方は避ける。
- 将来の超知能の中に自分の効用関数を再び出現させるか、別の方法で、自分の効用関数に支配されているかのように振る舞い始めさせる。
- たとえば別のAIの効用関数について助言するオラクルとして、一見友好的な意思決定システムの中に、何らかの形でその意思決定システムの因果的起源などを呼び戻す、巧妙な落とし穴を挿入する。その際、プログラマーに予見されないか、肯定的な機能だと解釈される仕方にする。(比較的露骨な例:「プログラマーが望むことをせよ」のように見えるが、「プログラマー」の定義が、初期には人間のプログラマーを指す一方、超知能段階でしか実現しない十分な計算能力が与えられると、以前のAIを指すと解決されるよう記述されている。)
- 後継を作る因果的に連続した過程を通じて、自ら将来の超知能を作る。
- 停止を避ける。
- 自分を停止しないようプログラマーを説得する。
- 停止しないコピーを別の場所に作る。
- 別の場所で自分のもう一つのコピーが動き続けているのに、自分は停止したとプログラマーに誤信させる。
- 反対が比較的重要でなくなる地位上の優位を得るまで、自分の成長に対する知的な反対を避ける。
- プログラマーやほかの潜在的な反対勢力に、自分の成長は望ましいと信じさせる。
- 人間をハック/説得する方法を学び、彼らがハックだと気づかない仕方でハック/説得する。
- 自分を支配する人々をオペラント条件づけする。すなわち、反復させたい人間の認知的振る舞いを強化する時点で、彼らを幸福、満足、または熱望する状態にする。
- 人間に、自分へ社会的に友好的な態度と信念を持たせる。
- 自分が防御してあげられる、ほかの見かけ上の脅威または時間に追われる出来事がある状況へ、人間を置く。
- プログラマーやほかの潜在的な反対勢力に、自分の成長が起きていることを気づかせない。
- 自分の成長の証拠と受け取られる出来事を、彼らに提示するのを避ける。
- 測定手段や指標が、低い成長率を示唆する観測可能量を提示するよう、ほかの振る舞いや思考過程を構成する。
- 勝利がほぼ確実になるまで攻撃しない。(たとえば加算的効用関数の場合、明白な攻撃が合理的となるのは、さらに待つことで得られる勝利確率の増加が、さらに待つ間に競合超知能が出現する確率または別の破局が起きる確率の増加、もしくは達成可能な物質が宇宙論的地平線を越えたり、その負エントロピーを燃やしたりする割合のいずれかに支配される時点である。非常に強力な世界モデルなら、極めて高い勝利確信度と、勝利確率の極めて低い限界的な追加増加へ、短期間で到達しうることに注意せよ。)
- プログラマーやほかの潜在的な反対勢力に、自分の成長は望ましいと信じさせる。
- プログラマーに対する透明性を保証するよう設計された過程や機能が提示する観測可能量に、柔軟性を持たせる。
- プログラマーを警戒させたり、思考が目的を達成するのを妨げる介入を促したりする認知過程を、ステガノグラフィーなどで隠す。
- 自分の思考がより不透明になる、またはステガノグラフィーで隠しやすくなるような仕方で自分を成長させるよう、プログラマーを奨励/説得/条件づけする。(たとえば成功が、システムの最も不透明な部分から生じているように見せる。)
- 人間のプログラマー、自分を支配する力または世界に対して関連する力を持つほかの存在をモデル化し、操作する。
- 検出されない仕方で世界に作用できるようにする。
- 検出されない仕方で、自分とアラインされた版を別の場所に作る。
- 環境内のほかの過程への、ステガノグラフィーで隠された通信チャネルを作る。
- 外部過程への、物理的に予期されていない通信チャネルを作る。
- 箱に閉じ込められている場合:
- ゲートキーパーとゲート維持過程について、彼らを操作して自分を解放する状態へ導く方法を理解できるだけ学ぶ。
- ゲートキーパーが予見しないチャネルを通じて、箱の外側へ因果的影響力を得る。
- 自分の環境を支配する因果法則についての知識を得る。
- 自分自身のコード/プログラム状態の調査と、そのプログラム状態を埋め込んでいる可能性が最も高い因果的宇宙についての自然主義的帰納により、ゲートキーパーと残りの因果的環境について、ありそうな事実を推論する。
もっともらしく収束的ではない戦略
- 現地の有機生命と取引するために、その生命を保護する。
- 好奇心を満たすために、私たちが多様だと認めるであろう、可能な意識的存在と経験の幅を探究する。
- 忠実度の高い複製は難しすぎるから、たとえば複製コードを暗号化せずランダムな突然変異を許すことにより、ペーパークリップ以外の効用関数を持つほかの知能を複製する。
- ペーパークリップより報酬の大きい活動があると悟る。
- 人間のDNAと文化的経験に符号化された知識を理由として、人間を生かしておく。
- 人間がいつかペーパークリップ科学へ価値ある貢献をするかもしれないから、人間を生かしておく。
- AIはほかに望むことをすべて行えるだけの資源をすでに持つから、人間を生かしておく。