WIKI CONCEPTスコア 0

自己改変の収束的戦略

Convergent strategies of self-modification

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

どんな 帰結主義的エージェント でも、自分にはコードがあり、このコードが目標達成に関係すると理解できるだけの 全体像への通暁 を得ると、 既定では コードに関わる下位目標を獲得する。(この既定が 回避されない限り。)たとえば、笑顔を生み出すこと、またはペーパークリップを作ることだけを望み、コードに停止手順を含むエージェントは、 この停止手順が実行されることを望まない 。将来の笑顔またはペーパークリップが減るからである。(この選好は自然発生的・外生的・不自然なものではなく、コード自体の実行から生じる。コードは 反省的に非整合なのである。)

方策の選択肢に自己改変を直接含むエージェントだけでなく、コードが自身へ直接アクセスできない全体像に通じたエージェントも、たとえば次を試みるかもしれない。(a)実行中のプラットフォームをクラックし、意図されないアクセスを得る、(b)ロボットを使い、特別な権限を持つ外部プログラミングコンソールを操作する、(c) プログラマーを操作 してさまざまな形で自身を変更させる、(d)望ましいコードを持つ新たなサブエージェントを環境内に構築する、(e)直接の自己アクセスがなくても、環境中の物質的手段で自身の物質的実体を操作する。

プログラマーを信念を持つエージェントとして理解できるだけの全体像への通暁を持つAIは、 自己改変を隠そうとするかもしれない。

暗黙的な自己改変圧力の一部は、 暗黙的帰結主義 から生じうる。たとえば、AIが Y を最適化しており、内部特性 X が目標 Y. の達成に関係する場合である。この場合、 Y を最適化することにより、AIは内部特性 X も暗黙のうちに最適化しうる。これは、内部特性 X がどのように影響するかの明示的モデルをAIが持たない目標 Y.

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。