WIKI CONCEPTスコア 0

整合性定理

Coherence theorems

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

この概念を紹介するチュートリアルが こちらにある。

ここで、意思決定理論の文脈で「整合性定理」とは、エージェントの信念または行動を、方法Xで整合しているものとして捉えられなければ、ペナルティYが生じる、と述べる定理である。

たとえば、ピザのトッピングについてのエージェントの選好を論じるとしよう。トッピングAのピザ1切れとトッピングBのピザ1切れの選択肢を提示され、エージェントがAのピザを取るなら、そのエージェントは局所的にBよりAを好む、と呼ぶことにする。

次に、あるエージェントが以下の選好を持つとする。

  • パイナップルのピザよりタマネギのピザを局所的に好む。
  • マッシュルームのピザよりパイナップルのピザを局所的に好む。
  • タマネギのピザよりマッシュルームのピザを局所的に好む。

少なくとも最初の選好は、たとえばパイナップルのピザからタマネギのピザへ替えるため1セントを払うほど強い、とも仮定する。 [1]

すると、たとえば次のようにできる。

  • まずエージェントにパイナップルのピザを提示する。
  • 選択肢をタマネギのピザへ替える代わりに、エージェントから1セントを受け取る。
  • タマネギからマッシュルームへ無料で替えると申し出る。
  • 最後に、マッシュルームのピザの代わりにパイナップルのピザ1切れを提示する。

今やエージェントは、最初と同じパイナップルのピザ1切れを持ちながら、ちょうど1セントだけ貧しくなっている。これは 質的に 支配された戦略である。同じパイナップルのピザ1切れと、さらに1セントを持って終わる、より良い戦略を取れたからである。 [2]

Steve Omohundroの言い方を借りれば、San JoseよりSan Franciscoにいたいと思い、San FranciscoよりOaklandにいたいと思い、OaklandよりSan Joseにいたいと思うなら、タクシー代を大量に浪費することになる。

これは次に、ある種の定理を証明できるかもしれないことを示唆する。すなわち「エージェントの行動を何らかの 整合した大域的選好順序 と整合するものとして捉えられないなら、エージェントは支配された戦略を実行しているはずである」。

大まかに言えば、整合性定理が述べるのはこの種のことである。ただし、留保条件を厳密に定め、連続空間などへ一般化すると、標準的な証明は上の議論が示唆するよりはるかに複雑になることが多い。

別の種類の整合性定理は、「意思決定または信念のある側面が整合性の性質Xを持つなら、それを数学的構造Yへ写像できる」と述べる。たとえば別の整合性定理は、「エージェントが証拠Aを見てから証拠Bを見た場合の最終的な信念状態は、証拠Bを見てから証拠Aを見た場合と同じである」といった仮定のもとで、対数オッズのような信念や確信度の代替表現から、標準的な確率形式へ移れることを示す。

整合性定理は一般に、整合した 効用関数、整合した 確率の割り当て、 期待効用と整合する局所的意思決定、または Bayesの規則と整合する信念更新を指し示す。

整合性定理で用いる仮定を緩めることは、その定理の改善となる(したがって論文にとって好都合である)ので、整合性定理の一族全体はかなり大きく、きわめて専門的である。

整合性定理が重要なのは、たとえば次の理由による。

意思決定理論における整合性定理の、ごく不完全な一覧

(誰か、もっと補ってほしい)

  • Waldの完全類定理:可能世界の集合、結果上の数量的効用関数、そして可能世界の部分集合を除外する観察を受け取るエージェントが与えられたとする。観察を条件として異なる行動を取る非支配戦略はすべて、エージェントが可能世界の集合上で整合した 事前分布 から始め、 Bayes更新を実行するものとして捉えられる。
  • Von Neumann–Morgenstern効用定理:不確実な世界状態に対するエージェントの選択関数が、完備かつ推移的で、確率について連続であり、すべての賭けに同じ確率で同じ代替結果を加えても変わらないなら、そのエージェントの選択は、ある効用関数の期待値を取ることと整合する。
  • Coxの定理 (および仮定を弱めた変種):証拠A、次に証拠Bで更新した結果が、証拠B、次に証拠Aで更新した結果と同じ信念状態になり、ほかにもいくつかの条件があれば、信念状態を古典確率へ写像できる。(たとえば、すべての信念をたまたま オッズで表現していても、証拠を見た順序にかかわらず同じことを信じるといった整合性の性質に信念が従うなら、オッズから古典確率への写像を構成するCoxの定理の変種がある。)
  • Dutch book論証:賭けを受け入れ、または拒否するオッズが標準確率と整合しなければ、確実な損失につながる賭けの組み合わせを受け入れるか、確実な利益につながる賭けの組み合わせを拒否することになる。
  1. ^︎

    お金を直接使わなくても、ピザを替えるため手を伸ばすのに、少量の時間と労力を費やす、と述べることもできる。

  2. ^︎

    あるいは、ピザを替えるために犠牲にした単純な時間の支出を含む、ほかの機会費用を失わずにすんだ、とも言える。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。