WIKI CONCEPTスコア 1

良さ推定値の偏り要因

Goodness estimate biaser

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

「良さの推定値を 偏らせるもの」とは、あるAIの計画が実際に持つ良さを、その計画の良さについてのAIの推定値より体系的に低くしそうだと 予見できるシステム構成または現象である。私たちはAIの推定値が 不偏であってほしい。

通常の例

機械学習では、微妙なものから明白なものまで、推定値に 偏りを生じさせる問題がよく知られており、それらは 高度なエージェント性に達するはるか前から現れる。

● 機械学習アルゴリズムの訓練データ上の性能は、テストデータ上の性能の不偏推定値ではない。アルゴリズムが学習したように見えるものの一部は、訓練データのノイズに固有かもしれない。テストデータでは、この当てはめられたノイズには当てはまらない。したがってテスト性能は、訓練性能と単に異なるだけでなく、訓練性能より 体系的に低い。訓練性能をテスト性能の推定値として扱うなら、それは 不偏な推定値ではない。

● オークション理論の 勝者の呪いが指摘するのは、入札者が、競売品の価値についての不偏推定値にノイズを持つ場合である。品物を得る 最高額の入札者は、自分が落札したという条件のもとでは、個々には不偏な推定値に上向きのノイズを持つ可能性が高い。その可能性は、落札を 条件としたものである。(たとえば、3人の入札者が、自分たちにとっての真の価値が1.0である品物へ、価値推定値にガウスノイズを伴う入札を行うとする。落札者はその品物を1.0より高く評価していた可能性が高い。)

これと類似する 最適化者の呪いが指摘するのは、複数の計画の 主観的期待効用について、局所的には不偏だがノイズのある推定を行う場合である。「期待効用が最高」の計画を選ぶと、上向きのノイズを持つ推定値を選びやすい。補償的な調整がなければ、すべての期待効用推定値が個々には不偏であっても、実際の効用は期待効用より体系的に低くなる。さらに悪いことに、期待効用を低ノイズで不偏に推定できる計画が10個あり、それとは別に、期待効用を高ノイズで不偏に推定できる計画が10個あるとする。このとき、期待効用が見かけ上最高の計画を選ぶと、最もノイズの多い推定値が有利になる。

AIアラインメントにおいて

こうした 予見可能な困難の多くは、 AIアラインメントにおいて、AIによる良さの推定値と比べて、私たちが実際の 良さとみなすものへ体系的な下向きの偏りを生じさせるとされる、同様の過程に関わっていると考えられる。

● エッジ実現が示唆することは、不完全に、または不十分に学習された価値関数を用いる場合である。その価値関数の 最大値または 極値を探すと、通常よりはるかに高い確率で、私たちが欠落や不完全さとみなすものが拡大される( 価値の脆弱性と最適化者の呪いによる)。または、AIが学ばなかった価値の側面が何であれ、破壊される(一部の特性を最適化すると、そのほかすべての特性が極端な値へ設定されやすいため)。

これは、「非極端な場合にAIが示す見かけの良さは、極端な場合の良さを上向きに偏って推定したものである」と、「AIによる良さの推定器の学習が 完全でないなら、最良の計画の良さについてのAIの推定値は、私たちが実際の良さとみなすものを体系的に過大評価する」の両方を含意すると考えられる。

● 一般的な 最も近い遮断されていない戦略、とりわけ 道具的に収束する非修正可能性にわたるそれが示唆することは、私たちが悪いとみなす、自然に生じるAIの振る舞い(たとえば 停止を迂回すること)がある場合である。そうした問題へ加えようとする パッチを迂回する戦略が、疑似敵対的に選択される可能性がある。たとえばAIは、現在のハードウェアを停止させることを許して「規則の文言」には快く従いながら、自分の目標を遂行し続ける環境内サブエージェントを構築する。この疑似敵対的な選択は(AIが私たちを妨害することや、良さの低い戦略そのものを選ぶことを明示的目標としていなくても)、ここでも実際の 良さが、「良さ」として学んだものについてのAIの推定値より体系的に低くなりやすいことを含意する。その程度は、AIが ますます大きくなり、 賢くなって、 より広い方策空間を探索するにつれて増していく。

穏健な最適化と 保守的な戦略は、強力な最適化を「正則化」し、訓練時の良さが実行時の良さを偏って過大に推定する程度を 減らすための提案とみなせる。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。