WIKI CONCEPTスコア 0

AIアラインメントにおける原則

Principles in AI alignment

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「AIアラインメント 」における「原則」とは、AI全体について広い意味で望むものであり、AIの特定部分または側面についての、より狭い設計提案へ情報を与えてきたものを指す。

たとえば、

  • 「非敵対原則 」は、私たちの安全措置を破る方法や、私たちが望まない別のことをする方法を、AIが決して探索すべきでないと述べる。たとえその探索が空振りに終わると 考えて いても、それは計算能力に実行させるべきでない種類の処理である。
  • 「最小性原則 」は、最初のアラインされたAGIを構築するとき、最初のアラインされていないAGIによって世界が破壊されるという既定の結果を防ぐために必要な範囲で、可能な限り危険の少ない認知計算を用い、可能な限り少ないことだけを行うべきだと述べる。
    • これは、 穏健な最適化 と タスク性という提案へつながる。AIのすべての目標と下位目標を、有界な努力量で望ましいだけ十分に達成できるよう定式化し、AIがそのために必要な努力だけを行うなら、より安全である。
    • これは、 行動主義という提案へつながる。工学を習得するだけでよく、AIが人間を詳細に理解し予測する必要のない 決定的行動 の提案がいくつかあるように見える。また、人間やほかの心を可能な限り詳細にモデル化しようとAIにさせなければ、複数の厄介な問題を未然に防げるように見える。

複数の具体的設計提案へすでに情報を与え、複数の人が良い考えだと思っているのでない限り、何かを「原則」と宣言することについては 慎重で あってほしい。自分が良い考えだと個人的に思うなら、「提案された原則」と呼び、自分の領域で公開できる。「広い設計上の願望」、または人々がそうだと思うものには 非常に多く あり、実際に具体的設計提案へすでに情報を与えた原則が、そうでなければ群衆に埋もれてしまう。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。