最初に アラインメント問題 へ取り組むとき、対象を 高度なエージェント、別名「堅牢 かつ 有益な AGI」、別名「友好的AI(Friendly AI)」と呼ぶにせよ、非常に一般的な方法は、 一つの 考えで すべて の AIアラインメントを解決しようとすることである。単純な設計概念、単純な効用関数、単純な開発戦略、全員が従う一つの指針、または別の箱へ線が伸びる箱で埋まった大きな図によって、実現可能な限りの 便益 を、有益な 超知能 から最大限に実現できると主張する。
あなたの現在の考えの詳細がわからない以上、この記事は、それがなぜ間違っているかを伝えられない。もっとも率直に言えば、現時点で私たちはそれに反対する強い 事前確率 を持っている。しかし、非常に標準的な助言は次のようになる。
- 現在の議論参加者が、 問題全体の標準的な課題と難しさ、すなわちアラインメントが難しいと考えられる理由と、新しい方法が直面する標準的な問いだとみなすものへ目を通す。
- アラインメントの 一つの部分問題 へ注意を絞り、そこで進展を得ることを考える。完全に解決する必要はないが、それまでになかった、問題についての自明でない知識を提供するのである。(アラインメント全体を解く広範な新手法を持っているなら、それが、 正確に 一つの 明確に同定された部分問題をどう解くかを順に説明できるだろうか。)
- 現在うまくいかないと考えられている過去の提案の欠陥を調べる。たとえば、 効用無差別のさまざまな版がある。
よい初期目標は、「分野の全員を説得して新しい考えに同意させる」ことではなく、「実際に間違っているなら、今日、別の誰かが論破できるほど明確に述べられた貢献を、開かれた議論へ加える」ことである。つまり、あなたが間違っているなら、結果を見るのに20年かかるのではなく、明確に仕様化された考えから明確に導出できる帰結として、その誤りを指摘できる考えである。持続的な進展のためには、「違う/そうだ」を超える会話が可能なほど、命題を十分モジュール的かつ明確に述べる必要がある。問題があれば人々がそれを見て合意できるほど、明瞭で導出可能な帰結を持つ形式で考えを述べなければならない。
別の方法として、 現在批判されている解決策に、明確に実証できる欠陥を突きつけることもできる。アラインメント理論の提案の大半は退けられるので、解決策を発明しようとするより批判過程へ参加しようとするほうが、大きな利点がある。「提案Xは機能し、すべてを解決する」という偽の前提でなく、「提案Xは壊れているか不完全である」という、おそらく真の前提から始められるからである。
心理面を分析する と、人々がアラインメント理論全体を一度に解こうとする理由について、Robyn Dawesの次の助言を思い出せる。
- 研究によれば、どんな答えも議論する前に問題を可能な限り徹底して議論すると、人々はよりよい解決策を考え出す。
- Dawesの観察では、問題が難しくなるほど、この原則に違反する可能性は より 高くなるようである。
……そして最後に、優れた機械知能を最初の試みで正しく構築することは、相当に難しいはずだと述べよう。非常に多くの人が最初の15秒で解いてしまうからである。
この分野で働く全員が明白なことを見落としており、すべての問題を解決する単純な考えが本当に 存在する 可能性はある。しかし現実には、この分野の全員がすでに十数個のひどい「完全解決策」を聞いており、それを議論して楽しいことが起きた経験はおそらくなく、ある程度、注意の疲労が生じていることを理解すべきである。(同様に、全員があなたを信じない場合、あるいは既知の人と話す代わりにあなたの解決策へ耳を傾けてもらうのが難しい場合でも、それは必ずしも、相手側の 根深い心理的問題 、たとえば外部者の考えに関心がないことによるのではない。明らかな変人でなくても、通常の論点や障害だと 相手が 考えるものを理解していることを示さない限り、人々が時間を割いて関わる可能性は低い。ここは、ほかの分野とそれほど違わない。)