WIKI CONCEPTスコア 3

既知アルゴリズム・非自己改善エージェント

Known-algorithm non-self-improving agent

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「既知アルゴリズム・非自己改善型」(KANSI)とは、達成できるかもしれないAI設計の戦略的な筋書きおよび一分類である。最初の 決定的な 強力なAIが、既知で人間に理解されたアルゴリズムから構築され、広範な自己改変を行っていない場合をいう。その優位性は、たとえば非常に大規模なコンピュータ・クラスター上で実行することによって得られるかもしれない。GoogleやAmazonの計算クラスター上で、ディープラーニングに似た適切な構造のアルゴリズムを実行することにより、タンパク質折り畳みを解明してナノテクノロジーを構築できるAIを作れたとする。そして、その作り手が十分に偏執的/分別的で、AIの処理と、AIが解こうとするすべての問題を人々に継続的に監視させ、AIに自己改変または自己改善を 行わせなかったなら、これはKANSIに分類される筋書きである。この場合、 反省的安定性、 オントロジー同定、潜在的に危険な能力の制限などにおける、きわめて広範な問題群が大幅に単純になる。

「良い」または承認されたAIの開発をKANSI設計に制限することは、自己改善によって可能になりうる能力向上を、どのようなものであれ意図的に断念することを意味する。KANSI AIが、ある決定的な能力水準へ 最初に到達できるかはわかっていない。これは、自己改変によって、どの段階でどれほど能力を獲得できるかという未知の背景条件に依存する。これらの背景変数しだいで、KANSI AIを能力の閾値へ最初に到達させることは、妥当な水準の努力と協調で達成できるかもしれず、できないかもしれない。これは、 MIRIが、たとえばKANSI設計だけに関心を絞っていない複数の理由の一つである。

既知のアルゴリズムから非自己改善AIを構築しようと意図するだけでは、KANSIという特性を保証するには不十分である。そのためには、 修正可能性(corrigibility)に沿ったさらなる解決策が必要かもしれない。たとえば、人間は自分の脳機能を改変できない。しかし、私たちは 汎用的帰結主義者であり、 必ずしも自分が望むようには考えないので、電卓を一つも内蔵していない世界の環境中の物体から、たとえば電卓のような非常に単純な発明を作り出し、通常とは違うやり方で算術を考えられるようにした。自分の考え方と、自分が望む考え方との間に大きな隔たりを持つKANSI設計も、同じように振る舞うかもしれない。あるいはAIが同じように振る舞い始める事例の 大半を検出するために常時監視が必要となり、それでも一部の事例は網の目をすり抜けるかもしれない。反省的安定性についての現在の研究と理解は非常に原始的であるため、KANSIエージェントを構築したい場合でさえ、これはまだ研究すべき事柄の範囲に入ると思われる。少なくとも、KANSIエージェントがXについてどう考えるかと、選択できるならXについてどう考えたいかとの距離が、あまりにも 極端に隔たらないようにするためである。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。