WIKI CONCEPTスコア 0

一般化された認知的アラインメント原則

Generalized principle of cognitive alignment

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

非敵対的原則を一般化すると、あるアラインメントまたは安全上の問題についてAIアルゴリズムにどのように実行してほしいかを問うときはいつでも、私たち自身がその問題をどう考えているか、そしてAIに共役的な思考をさせられるかを問える、という原則になる。これは時に、より単純な道筋よりはるかに複雑または危険に見えるアプローチかもしれないが、有用な着想の源となることが多い。

たとえば停止問題について、この原則は次の問いへ導くかもしれない。「自分のプログラマーが間違ったAIを構築した可能性を、AIに真に理解させる方法はあるか。『間違ったAIを構築した』とは正確に何を意味するかの定義まで間違っている可能性も含めて理解させ、すでに組み込まれた何らかの選好を最適化して事態を回復することはできないとAIに考えさせられるか。そうすれば、プログラマーがボタンを押そうとしているのをAIが見たとき、またはプログラマーがボタンを押す可能性を考えたとき、この情報で更新することで、ただ停止する以外の巧妙な戦略では克服できない何らかの意味で、自らのさらなる動作が正味の悪影響を持つと予想し、大きな影響を及ぼす前にAI自身が停止を望むようになるだろうか」。

これはさらに、正しく構成する方法が不明な複雑な心的状態を含意し、完成された効用無差別方式に沿う、より単純な停止可能性へのアプローチを選好することになるかもしれない。AIをそもそも停止しようとするなら、何かがうまくいかなかったということであり、私たちが気づくより前に、別の何かもすでにうまくいかなかった可能性を含意する。それは、AIが元の設計よりさらに上手に停止することへ熱意を抱くには悪い時である(通常動作中に、その種の「改善」の危険というその部分までAIに理解させられるなら別である)。

最大限の認知的アラインメントを目指すことが常に良い考えとは限らない。しかし、AIに理想的には何をさせたいかについて着想を得るため、その視点から安全問題を考え抜く試みには、ほぼ常に価値がある。より大きな複雑性やほかの問題を導入しないなら、その理想へ近づくのは良い考えであることが多い。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。