WIKI CONCEPTスコア 12

保守的な概念境界

Conservative concept boundary

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

保守性の問題とは、概念の正例の周囲に、単純であるだけでなく、正例として分類する事例が可能な限り少ない境界を引くことである。

導入/基本的な考え/動機

私が数に関するある概念を念頭に置いており、あなたが次の数について概念の事例かどうかを私に質問し、私が次のように答えるとする。

  • 3:はい
  • 4:いいえ
  • 5:はい
  • 13:はい
  • 14:いいえ
  • 19:はい
  • 28:いいえ

この訓練集合を包含する単純なカテゴリーは、「すべての奇数」である。

この訓練集合を包含する単純かつ保守的なカテゴリーは、「3から19までのすべての奇数」である。

わずかに複雑で、さらに保守的なカテゴリーは、「3から19までのすべての素数」である。

保守的だが単純ではないカテゴリーは、「3、5、13、19だけがこのカテゴリーの正例である」である。

価値アラインメントについて(非常に)初期に提案された案の一つは、AIが達成すべき結果の種類を示す例として、笑顔をAIに訓練させることだった。AIの感覚データとして笑顔の画像を生み出すだけにならないよう、この提案を少し好意的に解釈しよう。するとAIは、環境内の笑顔を識別する感覚データの原因について、境界を学ぼうとしていると想像できる。

このアラインメント手順で何がうまくいかないかを示す古典的な例は、手の届くすべての物質が、微小な分子の笑顔へ変えられてしまう可能性である。強い最適化圧力は、可能な限り最大限に満たせる単純なカテゴリーの極端な端を選び出し、完全な笑顔より微小な分子の笑顔のほうをはるかに多く作れるからである。

すなわちAIは既定では、訓練事例において笑顔と笑顔でないものを区別する最も単純な概念を学ぶ。訓練体制に存在したものより広い選択肢の集合を与えられると、この単純な概念は、その概念が抽出した性質を持つ一方、ほかの性質については訓練事例と似ていない何かも「笑顔」として分類するかもしれない。これは、「すべての奇数」という概念を学んだ後、-1や9^999のように、ほかの点では3や19と似ていない事例も、依然として奇数なので正例へ分類することに比喩的に相当する。

一方、AIが訓練データについて単純かつ保守的な概念を学ぶよう命じられたとする。このとき対応する目標は、たとえば実際に快楽を経験している人間の頭部に付随する笑顔だけを要求するかもしれない。さらにAIが保守的な計画器なら、既存の笑顔の因果的生成源に似た因果連鎖だけを通して笑顔を生み出そうとするかもしれない。たとえば新薬を発明せず、ヘロインのような既存薬だけを投与し、ナノテクノロジーで生きた頭部を合成せず、妊娠を通してのみ人間を繁殖させる。

これを価値アラインメント問題の解決策とは呼べないが、議論のために言えば、微小な分子の笑顔よりは意図された目標へ大幅に近づくだろう。したがって保守性は、タスクAGIをアラインするための、ほかの要素と並ぶ一要素として役立つかもしれない。

直観的に言えば、述べられた目標の「通常の」事例を、比較的「通常の」方法で生成して願いを叶えようとするだけで、精霊が安全になるとは到底言えないが、少なくとも安全に近づく。保守的な概念と保守的な計画は、安全な精霊が持つ、ほかのものと並ぶ一つの属性かもしれない。

ブリトー問題

タスクAGIに、単にブリトーに見える何かではなく、毒性もなく、人間が実際に安全に食べられる、本物のブリトーを作らせることが、ブリトー問題である。

保守性はブリトー問題への一つの可能なアプローチである。AGIにブリトーを五つ、ブリトーでないものを五つ見せる。その後、AGIに、ブリトーと非ブリトーを区別する最も単純な概念を学ばせ、この概念の下で最大限にブリトーであるものを作らせるのではない。代わりにAGIには、ブリトーと分類する物体を可能な限り少なくする、ある程度単純な規則に従ってこの五つをブリトーと分類する、単純で狭い概念を学ばせたい。ただし「この五つの正確な分子配置だけがブリトーと認められる」という規則は、単純ではないので除く。

その概念は、最初の五つのどれとも分子的に同一ではない六つ目のブリトーを作れるだけの広さを、なお持たなければならない。しかしブリトーがボツリヌス毒素を含むほど広くてはならない(何しろ、ほとんどが炭素、水素、酸素、窒素からできたものなら何でも問題ないはずであり、五つの負例にはボツリヌス毒素を含むものはなかった、というわけである)。

期待するのは、保守性を通じて、致命的となりうる変動のあらゆる次元について、訓練データが「最も単純な説明」を適切に安定させない可能性をすべて考える必要を避けることである。正例と負例を隔てる単純な境界だけを引こうとする場合、AIが毒入りブリトーを負例と表示されて目にしていない限り、規則に「毒性があってはならない」という但し書きを加える理由はない。そうした事例がなければ正例に分類されるものを除外するため、わずかに複雑な「ただし毒性はない」という規則を境界へ追加する必要が生じないからである。しかしボツリヌス毒素入りブリトーを一つAGIに見せても、リシン入りブリトーを避けることは学ばないかもしれず、ボツリヌス毒素とリシンを見せても、放射性ヨウ素131同位体入りのブリトーを避けることは学ばないかもしれない。概念境界がどうあるべきかを私たちが考え、すべての危険なブリトーを除外する最も単純な境界を強制できるだけの負例を含める代わりに、保守性を通じて、たまたま毒性もほかの問題もない、正例をAIに見せることへ作業負担の一部を移せると期待するのである。

感覚された訓練事例の原因についての保守性

AGIの事例における保守性は、感覚データそのものではなく、感覚データの原因について解釈する必要がありそうである。私たちは、ブリトーのどの画像を正例と分類するかについての保守的概念ではなく、環境内のどのブリトーを正例と分類するかについての概念を求めている。二つのブリトー候補は、毒性が異なっていても同一の画像を生じさせうる。そのため保守的な概念境界は、感覚的出来事そのものの周囲ではなく、訓練事例における過去の感覚的出来事の原因(についての私たちのモデル)の周囲に引きたい。

保守的な計画

保守的な戦略または保守的な計画は、ほかの条件が同じなら、ブリトーを作るナノ機械を構築するより、店で材料を買って調理することでブリトーを作ることを選好する。こちらのほうが、ブリトーが通常作られる方法をよく特徴づけ、または以前承認された計画の要素によく似ているからである。これもまた、毒入りブリトーを生み出す可能性を減らすように思える。

保守性の別の典型例として、たとえばあるゲームエンジン内で、走り回る人間のプレイヤーをいくらかAIに見せた後、箱を部屋の端へ動かすことなどを目標とする物体をAIに与える場合が考えられる。AIに飛行能力を与えても、訓練例がそうしていたという理由で、箱を動かすエージェントが地上だけを動き回る計画を生成したなら、それは保守的な計画である。

この目的はAIの能力を損なうことではない。目的は、たとえば低影響尺度に抜け穴があり、AIが手の届くすべての物質をピンク色に塗った自動車へ変える計画を生成した場合、「恒星を分解してより多くの自動車と塗料を作る」といった計画の一部手順は保守的でない可能性が高く、したがって自動的には起こらないようにすることである。

保守的でない計画手順への印づけ

保守的でない計画が、ほかの重要な次元ではより優れて見える場合――たとえばナノ機械でブリトーをただ合成する場合と比べ、同じほど影響が小さく、同じほど副作用の少ない計画がほかにない場合――には、重要な手順を保守的でないものとして印づけ、確認のため利用者に提示することも考えられる。

すなわち「保守的な」計画では、「計画を生成した後、保守的でない手順に印をつけて報告する」という問題と、「保守的でない手順をほとんど、またはまったく含まない計画の生成を試みる」という問題の両方に関心がある。

ほかの安全問題における役割

保守性と保守的な計画は、一部の標準的な懸念へ正面から、かつ抜け穴を避けるに足る根本的な仕方で直接取り組めるように思えるが、同じ懸念の対象にもなりうる。たとえば次のとおりである。

  • 端での実現――完全な一般性の下でグラフの端へ行かず、すでに正例へ分類されたものの中心に留まろうとすれば、これを避けられるかもしれない。
  • 予見されない最大値――すでに正例へ分類された事例と非常によく似たものに固執すれば、グラフの想像されていなかった部分へ自動的に進むことはない。
  • 文脈の破局――十分に保守的な最適化器なら、計画空間の大きな新領域が開けても、以前の同様に許可リストへ入れられた選択肢を使い続けるかもしれない。

しかし、これらのいずれかが起こるのを防ぐため保守性に頼る限り、それはミッションクリティカルな構成要素であり、それ自体に抜け穴がなく、高度な安全性を備えなければならない。「保守性」の制約を非常に強力な最適化圧力へ適用するなら、その圧力が「保守的」の定義にあるあらゆる抜け穴を探し出すことを懸念する必要がある。「保守性」の中心的な概念は、抜け穴がないほど単純かもしれない。しかし、ある程度単純で保守的な概念でさえ、保守的に分類されたすべての事例の中から、何らかの基準における最大の事例を探し出すだけの最適化圧力があれば、危険な事例を一部含む可能性もある。

保守性をさらに安全にするための、二つの可能なメタアプローチがある。

  • 保守性を使って、計画内の保守的でない手順、または予想される目標達成の保守的でない事例に印をつけ、行動を起こす前に利用者の確認へ回す。(「保守的な」手順だけを含む計画を自動生成するのではない。)これには、利用者による確認の標準的な問題が伴う。
  • AIの現在の世界モデルと概念言語に相対的な保守性の定義を持たせる。それは、最適化圧力が探している別の特殊な性質を持つ、概念の一次的に保守的な唯一の事例である、という奇妙な性質を備えたものをすべて、「例外的」(したがって保守的でない)として自動的に検出する。この方法は、AIが計画したという事実によって、計画されたあらゆる出来事が特殊になるといった、奇妙な反省的問題を伴うかもしれない。
Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。