WIKI CONCEPTスコア 11

シャットダウン問題

Shutdown problem

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「シャットダウン問題」とは、 十分に高度な人工知能 を作る問題である。ボタンを押すとAIは安全に自身をディスクへサスペンドし、 ボタンの存在へ反対せず 、 ボタンが押されることを妨げようと しない。

これは難しい。自身の停止またはサスペンドを避けることは 収束的な道具的戦略であり、 「ユーザーへコーヒーを届ける」のような目標さえ、停止回避を含意するからである。

考えうる一つの研究路線は次のとおりである。

  1. 「シャットダウン効用関数」を記述し、その 達成可能な最適値 を「安全にディスクへサスペンドする(そして進行中の計画を 安全に中止 する可能性もある)。ただし、以前の目標を実行する自分の隠れた環境内複製を作り、元のAIが停止したままであることを絶対に確実にするため宇宙の全物質を同化することはしない」とする。
  2. シャットダウン効用関数を、エージェントの通常の効用関数と 合理的に合成する方法を見つける 。その条件は次のとおりである。
    • (2a)エージェントがどの効用関数を最適化するかは、スイッチが押されたかどうかで決まる。
    • (2b)AIには、スイッチを押させる誘因も、押されるのを妨げる誘因もない。

この問題のより難しい版は、次のような仕様を追加する。

  • AIがスイッチの存在を 積極的に望み 、破損したら存在を回復する。
  • AIは進行中の計画を 安全に中止 する(また、安全に中止できるよう計画を設計する)。

関連項目: 効用無差別、 シャットダウン効用関数、 修正可能性(corrigibility)、 中断可能性、 低影響、 中止可能な計画。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。