この概念を紹介するチュートリアルが こちらにある。
ここで、意思決定理論の文脈で「整合性定理」とは、エージェントの信念または行動を、方法Xで整合しているものとして捉えられなければ、ペナルティYが生じる、と述べる定理である。
たとえば、ピザのトッピングについてのエージェントの選好を論じるとしよう。トッピングAのピザ1切れとトッピングBのピザ1切れの選択肢を提示され、エージェントがAのピザを取るなら、そのエージェントは局所的にBよりAを好む、と呼ぶことにする。
次に、あるエージェントが以下の選好を持つとする。
- パイナップルのピザよりタマネギのピザを局所的に好む。
- マッシュルームのピザよりパイナップルのピザを局所的に好む。
- タマネギのピザよりマッシュルームのピザを局所的に好む。
少なくとも最初の選好は、たとえばパイナップルのピザからタマネギのピザへ替えるため1セントを払うほど強い、とも仮定する。 [1]
すると、たとえば次のようにできる。
- まずエージェントにパイナップルのピザを提示する。
- 選択肢をタマネギのピザへ替える代わりに、エージェントから1セントを受け取る。
- タマネギからマッシュルームへ無料で替えると申し出る。
- 最後に、マッシュルームのピザの代わりにパイナップルのピザ1切れを提示する。
今やエージェントは、最初と同じパイナップルのピザ1切れを持ちながら、ちょうど1セントだけ貧しくなっている。これは 質的に 支配された戦略である。同じパイナップルのピザ1切れと、さらに1セントを持って終わる、より良い戦略を取れたからである。 [2]
Steve Omohundroの言い方を借りれば、San JoseよりSan Franciscoにいたいと思い、San FranciscoよりOaklandにいたいと思い、OaklandよりSan Joseにいたいと思うなら、タクシー代を大量に浪費することになる。
これは次に、ある種の定理を証明できるかもしれないことを示唆する。すなわち「エージェントの行動を何らかの 整合した大域的選好順序 と整合するものとして捉えられないなら、エージェントは支配された戦略を実行しているはずである」。
大まかに言えば、整合性定理が述べるのはこの種のことである。ただし、留保条件を厳密に定め、連続空間などへ一般化すると、標準的な証明は上の議論が示唆するよりはるかに複雑になることが多い。
別の種類の整合性定理は、「意思決定または信念のある側面が整合性の性質Xを持つなら、それを数学的構造Yへ写像できる」と述べる。たとえば別の整合性定理は、「エージェントが証拠Aを見てから証拠Bを見た場合の最終的な信念状態は、証拠Bを見てから証拠Aを見た場合と同じである」といった仮定のもとで、対数オッズのような信念や確信度の代替表現から、標準的な確率形式へ移れることを示す。
整合性定理は一般に、整合した 効用関数、整合した 確率の割り当て、 期待効用と整合する局所的意思決定、または Bayesの規則と整合する信念更新を指し示す。
整合性定理で用いる仮定を緩めることは、その定理の改善となる(したがって論文にとって好都合である)ので、整合性定理の一族全体はかなり大きく、きわめて専門的である。
整合性定理が重要なのは、たとえば次の理由による。
- ある問題の最適戦略を見つけようとするとき、 どんな 最適戦略についても、起こりうるさまざまな結果をどれほど好むか、そこへ到達する見込みをどう信じているかを述べられるはずだ、と言ってよい。
- 私たちが きわめて高度なAIを扱っていて、そもそもAIをそこまで認知的に強力にした過程が、自分の足を撃ち抜き、堂々巡りするような行動のうち 私たち人間に見えるものをすべてならしており、 私たちに判断できる限りその AIはおそらく 私たちの目には 整合した効用関数と確率的信念を持つことと整合するように振る舞っているように見える。
意思決定理論における整合性定理の、ごく不完全な一覧
(誰か、もっと補ってほしい)
- Waldの完全類定理:可能世界の集合、結果上の数量的効用関数、そして可能世界の部分集合を除外する観察を受け取るエージェントが与えられたとする。観察を条件として異なる行動を取る非支配戦略はすべて、エージェントが可能世界の集合上で整合した 事前分布 から始め、 Bayes更新を実行するものとして捉えられる。
- Von Neumann–Morgenstern効用定理:不確実な世界状態に対するエージェントの選択関数が、完備かつ推移的で、確率について連続であり、すべての賭けに同じ確率で同じ代替結果を加えても変わらないなら、そのエージェントの選択は、ある効用関数の期待値を取ることと整合する。
- Coxの定理 (および仮定を弱めた変種):証拠A、次に証拠Bで更新した結果が、証拠B、次に証拠Aで更新した結果と同じ信念状態になり、ほかにもいくつかの条件があれば、信念状態を古典確率へ写像できる。(たとえば、すべての信念をたまたま オッズで表現していても、証拠を見た順序にかかわらず同じことを信じるといった整合性の性質に信念が従うなら、オッズから古典確率への写像を構成するCoxの定理の変種がある。)
- Dutch book論証:賭けを受け入れ、または拒否するオッズが標準確率と整合しなければ、確実な損失につながる賭けの組み合わせを受け入れるか、確実な利益につながる賭けの組み合わせを拒否することになる。