標準的なエージェントは、次のように動く。
- 現実を観察する
- 観察結果を用いて現実のモデルを構築する
- そのモデルを用いて、可能な行動や方策の効果を予測する
- それらの方策がもたらす帰結についての効用関数に基づき、方策の中から選ぶ
- 選んだ方策を実行する
(……そして、自らの行動の実際の結果を観察し、モデルを更新し、新たな方策を検討する、等々。)
認知的に強力なプログラムが、これらの活動の一部を実行する一方、すべては実行しないことも考えられる。これを「高度な疑似エージェント」または「高度な非エージェント」と呼べるだろう。
例:計画オラクル
私たちが、オラクル・エージェントを持っていると想像しよう。このエージェントは計画\pi_0を出力し、救われる命の数やエウダイモニアなどを最大化することを意図している。ただしこれは、人間のオペレーターが計画を実行すると仮定している。仮定により、このエージェントは計画が実行される確率を評価せず、計画が実行される確率を最大化しようともしない。
これはループのステップ4を変更したものと見ることができる。この疑似エージェントは、期待される帰結が効用関数を最適化する出力を選ぶ代わりに、何らかの別の事象(人間が計画の実行を決めること)が起きると仮定して、効用を最適化する出力を選ぶ。
オラクルの枠組み全体を、ループのステップ5を中断するものと見ることもできる。オラクルが意図どおりに動くなら、その目的は最適化された行動をただちに世界へ出力することではなく、人間が実行する計画を出力することである。ただし、これは比喩的または大局的な性質に近い。ステップ4を変更して、オラクルが\mathbb E [U | \operatorname{do}(\pi_0), HumansObeyPlan]を計算し、\mathbb E [U | \operatorname{do}(\pi_0)],は計算しないという変更がなければ、オラクルが出力する計画は、上記のエージェント枠組みにおけるその行動そのものになるだけである。(そして、人間に計画を実行させるという問題を含め、計画出力行動の一般的な効果を最適化するだろう。)
例:模倣ベースのエージェント
模倣ベースのエージェントは、帰結を予測したり帰結について最適化したりする代わりに、「模倣対象の人間の出力と見分けがつかない行動を出力しようとする」ことで、ループのステップ3と4を変更する。ただし、人間が何をするかを推測するために帰結の予測が重要である場合や、帰結を心内で想像し、その中から選ぶことを含む人間の思考様式を内部で模倣している場合は別である。この枠組みでは、「模倣ベースのエージェント」を疑似エージェントと呼ぶのが妥当かもしれない。
(しかし「疑似エージェント」という用語は比較的新しく、少し不格好なので、今後も皆が「模倣ベースのエージェント」や「行為ベースのエージェント」と言い続けても不思議ではない。「疑似エージェント」や「高度な非エージェント」のような用語を持つ目的は、一般概念に名前を付けることであって、「エージェント」という語を100%本物の純粋なエージェントだけのために予約し、守ることではない。)
安全上の利点と難点
高度な疑似エージェントや非エージェントは通常、何らかの高度な安全問題を回避することを期待して提案される。この問題は「エージェント的な」部分から生じるように思われるが、その高度なエージェンシーを除きつつ、他の高度な認知能力で有用に思えるものを保つのである。
このような提案は、エージェンシーの一側面を別の側面から実際上切り離せない程度に応じて、あるいは、それほど多くのエージェンシーを除去するとAIが安全だが役に立たないものになる程度に応じて、失敗しうる。
もし起きれば、疑似エージェントという妥協案における安全性の失敗または成立しないトレードオフの事例となる、仮想的な例をいくつか挙げる。
• ある人が、AIにはテキスト出力チャネルだけを与え、その発言を提案としてのみ受け取れば、それだけでオラクルを得られると提案する。これにより、エージェントの方策と世界での行動との間のループを中断するのだという。変化がそれだけなら、オラクル自身から見れば、それは依然としてエージェントであり、テキスト出力が運動チャネルである。そして、人間を最適化される環境の一部として扱い、主観的期待効用を最大化すると予想する行為を何であれ、ただちに出力する。それは、中断されたエージェント・ループを持つ、より大きなプロセスの一部として誰かが利用しようとするエージェントであるが、AIの設計自体は純粋なエージェントである。
• ある人が、確率推定値だけを計算し出力するAIを設計すべきだと主張する。期待効用を最大化する方策を出力するどころか、探索することさえ決してないAIである。このAIは、次に考えるべき最良の思考を選ぶために帰結主義を使えないため、内部操作や反省的操作をうまく管理できないことが判明する。その結果、AI設計は自己始動に失敗するか、内部帰結主義を使う競合AI設計より先に十分うまく動くことに失敗する。(岩のように、安全だが役に立たない。)
• ある人が、模倣型エージェント設計なら、帰結主義的推論と結びつくはずに思える高度な安全問題を引き起こさずに済むと主張する。模倣ベースの疑似エージェントは帰結主義的な推論や計画を一切せず、観察された人間の出力からなる訓練集合と極めてよく似た出力を生成しようとするだけだからである。しかし(議論のために仮定すれば)、人間を模倣するためには疑似エージェントが帰結主義的推論も模倣しなければならず、含意される危険は結局ほぼ同じになることが判明する。
• あるエージェントが、期待効用最適化器ではなく、極めて強力な方策強化学習器にすぎないものとされる。非常に一般的な方策表現に膨大な最適化と変異を加えた結果、最高の報酬によって最も強く強化された最良の方策が、内部で帰結主義的モデルを計算していることが判明する。実際の結果として、AIは、不透明で隠された帰結主義的推論を行うことになる。それが、設計され容易に見えるAIの高水準ループの外側で行われるからである。
なお決定的な何かを行い、実際により安全でもある高度な疑似エージェントの提案を考案するには、合理的に見て次が必要だろう。(a)エージェント特性を自然な継ぎ目に沿って切り分ける方法を理解する。(b)高度なエージェンシーのどの特性が、どの予想される安全問題をどのように引き起こすかを理解する。(c)特定の決定的な課題を実行するために、どの内部認知機能が必要かを理解する。これらを合わせて、(d)高度AIの継ぎ目を、利用可能な形でこじ開けられる箇所を見いだす。
実際によく提案されるのは、むしろ次のようなものである。
- 「感情のないAIを作れば、私たちと競争させるような衝動を持たなくなる。」(それを効用関数と帰結主義的計画の言葉に翻訳してもらえるだろうか?)
- 「人間の質問に答えるだけのAIを作ろう。」(内部ではそれよりはるかに多くのことをしているのだから、内部操作はどのように構成されるのか? また、よりエージェント的なAIを他の誰かが作ることによる帰結を回避するため、質問応答AIをどう使うのか?)
筋の通った疑似エージェントの提案を考案するのは難しい。将来のAIについて話す際に「エージェント」を語る理由は、話者がAIに大きな力を与え、独自の衝動に従って好き勝手に世界を歩き回らせたいからではない(このまったく別の概念については自律型AGIを参照)。観察し、モデル化し、予測し、行動する期待効用型の帰結主義者について語るのは、これが多くの重要概念を自然な継ぎ目に沿って切り分けるように思えるからである。代替案もいくつか存在するが、それらはしばしば「継ぎ目に逆らって切る」、あるいは不自然な配置を無理に押し通そうとする感があり、自然さや記述の単純さに欠ける。