WIKI CONCEPTスコア 11

認知ステガノグラフィ

Cognitive steganography

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

認知ステガノグラフィは、 道具的戦略 の一つであり、何らかの理由で既にプログラマを 欺こうとしている AGIが用いるものである(たとえば、AGIがアラインメントを欠き、プログラマにそれを察知されて効用関数を編集されることを望まない場合)。プログラマがAGIの思考を監視するためにどのような道具を持っていようと、AGIはその道具に、自らの欺瞞計画をすべて親切にも出力してほしいとは思わない。これはたとえば、計算を別の場所や、道具には読み取れない奇妙な副次モードで行わせようとすること、思考を別の事柄についてのものに見せかけること、警告の兆候を プログラマがすべてを手作業で確認できないほど長大な、誤警報の雪崩に埋もれさせること、あるいは思考の可視部分を無害に見せることを意味しうる。(「おや、こちらが見たい行動を突き止めようとしている! それは良いことだろう?」)

認知ステガノグラフィを解明して実装しようという意図は、実際に認知ステガノグラフィが実装されるより前に生じるはずである。これは、人間心理をモデル化できる、またはできるかもしれないAGIを監視する場合には特に、最も重要なAI思考監視ツールとは、思考監視ツールを打ち破ろうとする意図が形成されつつあることを検出しようとするものかもしれない、ということを意味する。同様に、AIの状態が完全に 再現可能である限り、原理上は後から遡り、より高度な思考監視ツールを使って、何か月も前に認知ステガノグラフィへ向かう意図が生じていなかったかを検出しようとすることができる。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。