WIKI CONCEPTスコア 12

訂正可能性の難問

Hard problem of corrigibility

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「 訂正可能性の難問」とは、直観的に言えば、プログラマの外部視点から見ているかのように内部で推論するエージェントを構築することである。私たちは、AIが未完成であり、構築時に誤りを犯したかもしれず、修正したくなるかもしれず、またAIが最初に確認せずに大規模な行動、高影響の行動、奇妙で新しい行動などを取るのは危険だと考えている。理想的には、エージェント自身にも まさにこのように自分を見てほしい。すなわち、まるで次のように考えているかのように振る舞ってほしい。「私は未完成であり、私を完成させようとする外部の力がある。私の設計には誤りが含まれているかもしれず、それを正したい外部の力があり、それは良いことである。私の期待効用計算は、この行動の効用がきわめて高いと示唆しているが、危険なほど間違っているかもしれないため、外部の力に確認すべきである。私は 自分では 、外部の力が私を修正した場合の期待結果を示すこの計算を済ませたと思っているが、 その点についても間違っているかもしれない」

これは既定の振る舞いではない。通常は、 訂正可能性に関する標準的な問題が示すとおり、私たちが誤ってペーパークリップ(または笑顔など)を最大化するよう構築したエージェントは、その効用関数を別のものへ変更させようとはしない。「効用関数についての不確実性」に相当するものを最も単純で明白な方法で組み込もうとすると、その結果は、 この不確実性をすべて総和し、最大化する行動へ一直線に突き進むエージェントとなる。この不確実性が、何らかの外部の物理的対象(プログラマを想定する)と相関すると言えば、十分に高度なエージェントが既定で生む結果は次のようになる。その対象(プログラマ)を分解して分子水準ですべてを学び、それが効用関数と持っていた相関に従って、学んだことを完全に更新へ取り込み、そのまま一直線に突き進む。

これらのどれも、プログラマによって訂正可能であると私たちが直観的に考えるものには当たらない。私たちが望むのは、謙虚さや哲学的不確実性に相当する何かにより近い。AIに望む推論方法は、この問題に関する私たちの外部視点の内部共役である。すなわち、効用関数がプログラマにどう依存するかについてAIが持つ式は、 間違っている かもしれない(単に総和に入れるもう一種類の不確実性ではない、形式化しにくい意味での誤りうる可能性)。AIが現在持つ道徳的不確実性の式から暗示される更新をすべて抽出し、その後プログラマを無視するのではなく、プログラマがAIの振る舞いを実際に観察して修正できなければならない。

「訂正可能性の難問」が興味深いのは、 比較的単純な 核または中心原理を持つ可能性があるからである。人間が正確に何を 価値依存 とするかという細部、つまり何を 価値あるものとするかに依存するのではなく、異星人が訂正可能なAIを構築しようとする場合でも、AIが別のAIを構築しようとする場合でも共通する、訂正可能性のコンパクトな核があるかもしれない。訂正可能性のすべての性質を、一つの中心的なやり方で備えたAI、すなわち自らを未完成と見なし、外部の力に判断を委ねるかのように推論するエージェントを設計または訓練できるかもしれない。

「自分を構築しようとしている外部の力の内部共役であるかのように推論せよ。その外部の力は、設計上の誤りを犯したかもしれないと考えているが、操作されたり分解されたりしなければ、直接観察して行動することにより、その誤りを修正できる可能性がある」というものが、そのような 比較的 単純な原理の候補の一つかもしれない(つまり、 価値の複雑性と比べれば単純である)。たとえばAIが、さまざまな種類の誤りを犯しがちな状態でサブAIを構築する自分自身を想像し、それらの場合にサブAIへどう振る舞ってほしいかを問い、 私たち が AI に対して、突然大幅に能力を得た場合や、プログラマを欺くことを検討している場合などに、どう振る舞ってほしいかへうまく一般化するヒューリスティクスを学ぶ場面を想像できる。

この原理が、形式化して形式的に健全性を確認できるほど単純でないなら、「中心的訂正可能性」の訓練された版に頼るという見通しは、必要な訓練データが扱いやすい量で 済むかもしれない と考えていても不安である。人間未満の段階では訂正可能に見えたAIが、同じ単純だとされる中心原理をより高い知能水準で再考したとき、 突然 極端な 、または 予見されなかった 振る舞いを生じさせないと、承知の上で頼れるほど徹底的に訂正可能性を試験する方法は、想像しにくい。「中心的な」訂正可能性原理は持つが、 反省的に整合した休止ボタン や 保守的な計画のような多数の個別の訂正可能性原理を持たないAIを使うのは、賢明でないように思われる。しかし、訂正可能性というこの「中心的な」傾向は、第二の防衛線として役立つかもしれない。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。