WIKI CONCEPTスコア 17

規範的道徳理論としての外挿意志

Extrapolated volition (normative moral theory)

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

(このページは、規範的道徳理論としての外挿意志、すなわち外挿意志が価値、あるいは私たちがどのような結果を望むべきかという概念を捉えるとする理論について述べる。十分に高度で自己主導型のAGIを、何を望み、目標とし、決定し、行うよう構築すべきかという、密接に関連する提案については、整合的外挿意志を参照されたい。)

概念

外挿意志とは、私たちが「何が正しいのか」と問うとき、その問いに意味がある限りにおいて、世界の可能な状態に対してある論理関数を実行した結果を問うている、という考えである。この関数は、現在の意思決定過程を「もっと多くを知っていたらどうか」「(その議論が私の脳をハックしない限り)もっと多くの議論を検討する時間があったらどうか」「自分自身をもっとよく理解し、もっと自制心があったらどうか」といった方向へ外挿した結果と、分析的に同一である。

外挿意志の単純な例として、冷蔵庫からオレンジジュースを持ってきてほしいと頼む人物を考えよう。冷蔵庫を開けるとオレンジジュースはないが、レモネードがある。友人が冷蔵庫について自分の知っていることをすべて知っていれば、レモネードを持ってきてほしいと望むだろうと想像し、代わりにレモネードを持っていく。抽象的な水準では、友人の「意志」を「外挿した」といえる。言い換えれば、友人の心と意思決定過程についてのモデル、すなわち友人の「意志」のモデルを取り、その心が冷蔵庫の中身についてより良い情報を持つ反事実的な版を想像し、それによって意志を「外挿」したのである。

意思決定過程を外挿する方法は、より良い情報を持つことだけではない。たとえば、道徳的議論を検討する時間がもっとある心や、自分自身についてよりよく知る心を想像することもできる。今はCapulet家への復讐を望んでいても、復讐が長期的に文明へ及ぼす影響について誰かと腰を据えて長く話す機会があれば、説得されて考えを変えるかもしれない。緑色の靴を違法にせよと純粋な善意から主張していると今は確信していても、働いている自分の感情をすべて印刷して実際に見ることができれば、緑色の靴を履く人々へ多くの苦々しさを向けていたと気づき、その決定について考えを変えるかもしれない。

Yudkowskyによる個人水準の外挿意志では、外挿の中核となる三つの方向は次のとおりである。

  • 知識の増加――宣言的事実と予想される結果について、より真実に即した知識を持つこと。
  • 議論の検討の増加――より多くの可能な議論を検討し、その妥当性を評価できること。
  • 反省性の増加――自己についての知識が増し、ある程度は自制心も増すこと(ただし、自己のどの部分が他のどの部分を規範的に統制すべきかという、さらなる問いが生じる)。

動機

人によって、「私たちはどこへ向けるべきなのか、自律的な超知能を正確に方向づけられるとしたら」という問いへの反応は異なり、取り組む角度も異なる。

いずれ、この点を扱うページにはArbitalの振り分け用質問票が必要になる
そうした角度には次のものがある。

  • 「べき」をめぐる話はすべて、超知能を構築できた者が総取りするという事実を覆い隠しているだけである。超知能で何をしようと、それをするのは自分なのだ。
  • 超知能に何をすべきか教えて、それが間違っていたらどうするのか。そもそも何が正しいかについて私たちが混乱していたらどうするのか。超知能自身の優れた知能で、正しいことを自力で見いださせるべきではないか。
  • 古代ギリシャ人が超知能に何をすべきか教えるところを想像してほしい。彼らなら、戦場での栄誉ある死などを含む個人的な徳を最適化せよと命じただろう。これは悪い結果に思えるので、類似のことをしない方法を見いだす必要がある。したがって、今の私たちに良い考えと思えることをAGIにさせても、百万年後には非常に悔やまれる決定に思えるだろう。
  • 明らかに、AGIには自由民主主義的価値を最適化せよと命じればよい。自由民主主義的価値は良い。本当の脅威は、悪人がAGIを手に入れ、自由民主主義的価値を最適化しないAGIを構築することである。

それぞれに対する最初の返答として、次のようなものが考えられる。

  • なるほど。しかし、自分がプログラマで、嫌な人間にならないよう努めているとしよう。「何をしても自分から発している以上、等しく利己的なのだから、自分を地球の神皇帝と宣言してもよい」と言うなら、嫌な人間である。もっと嫌味がなく、実際、嫌味を最小限にするような何かができないだろうか。
  • 何が「正しい」かについてまったく情報を持たないと言うなら、その語はいったい何を意味するのか。私がAGIにペーパークリップを最大化させても同じであり、それが規範性の間違った計算方法だと言う根拠がないなら、そもそも私たちは何について話しているのか。「正しい」や「べき」という語には、正しいと知るものすべての一覧が自動的に印刷されないとしても、自分が知っている何らかの意味があるはずだ。その意味を追い詰めることを話し合おう。
  • では、古代ギリシャ人がAIをプログラムしなければならなかったなら、何をすべきだったのか。どうすれば未来世代を破滅させずに済んだのか。古代ギリシャ人は、人が物事について考えを変える場合があることに気づき、自分たちがすべてについて正しいとは限らないと悟るほど賢かったとしよう。この窮地から脱するために、AGIの賢さを建設的に規定された計算可能な仕方で、どう利用できるだろうか。AGIに何が「正しい」か計算せよとだけ命じることはできない。単語ではなく、実際に計算可能な問いをそこへ入れる必要がある。
  • もう少し議論した後なら、「自由民主主義的価値」の定義をわずかに調整したいと思うとしたらどうか。そうすることが予測可能だとしたらどうか。百万年後まで、即興で作った定義に本当に縛られたいだろうか。

議論のためCEVの支持者の立場を採れば、これらの対話は最終的にすべて、異なる道をたどりながら、アラインメント提案としての整合的外挿意志へ収束する。

「外挿意志」は、「正しい」の意味を問い、本当の意味で私たちが何を「すべき」か見いだそうとすると到達する、対応する規範理論である。

「より良い」という概念を救済するものとしてのEV

EVは、次の理論以前の直観を救済しようとするものと見なせる(混乱を感じている人、あるいはそもそもメタ倫理について一度も疑問を持ったことがない人が経験し得る直観である)。

  • (a) 何かを正しいと考えながら、間違っていることがあり得る。
    • (a1) 誰も間違いだと知らなくても、何かが間違っていることはあり得る。たとえば、アップルパイを不均等に分けることは、受け取る全員が気づいていなくても不公平かもしれない。
    • (a2) 私たちは何が正しいかをもっと学び、考えをより正しいものへ変えられる。
  • (b) 自分が何を正しいと考えるかを変える錠剤を飲んでも、何が実際に正しいかは変わるべきではない。(12歳の子どもを密かに殺すことが正しいと思わせる錠剤を飲もうかと考えるとき、「この錠剤を飲めば12歳の子どもを殺すだろうが……同時に、12歳の子どもを殺してもよくなるのだから、これは飲むのに素晴らしい錠剤だ」と推論すべきではない。)
  • (c) 私たちが間違っている可能性はあるが、確かに、Frankenaの一覧にあるものはすべて、まずまず良いもののように思える。(「生命、意識、活動、健康と強さ、あらゆる種類または特定の種類の快楽と満足、幸福、至福、充足など……」)
    • (c1) Frankenaの一覧に何が属するかについて、何らかの神秘的な意味で私たちが「間違っている」可能性があるという事実も、「できるだけ多くのペーパークリップを作る」だけが一覧に載る余地を残すほどではないように思える。混乱し、無知かもしれない今の状態でも、それが答えであることは許されないように思える。少なくとも、それが善さの総体ではないとは、かなり確信している。
    • (c2) 同様にメタ水準では、「正しさを決定する手続きのうち、採用後に存在するペーパークリップの数が最多になるものを選べ」というメタ水準の手続きが、正しい答えであるようには思えない。

次のように述べても、これらの性質を救済することは できない。

「ある物体や出来事には、還元不可能で非自然的な『正しさ』のXMLタグが付いている。私たちの脳はこのXMLタグを知覚するが、不完全にしか知覚しない。そこで、XMLタグが実際にはないのにあると思うとき、性質(a)が生じる。誰も見ていなくてもXMLタグは存在する(a1)。もっと注意深く見つめてXMLタグをよりよく見ることもある(a2)。脳に何をしてもXMLタグが変わらないのは明らかであり(b)、脳が欺かれるか、XMLタグについての脳内地図が無効になるだけである。Frankenaの一覧にあるものにはすべてXMLタグが付いている(c)、少なくとも私たちはそう考えている。ペーパークリップだけがFrankenaの一覧の完全に正しい内容であるためには、ペーパークリップにXMLタグがないという点で間違い、かつ、Frankenaの一覧にあってXMLタグがあると考えているものすべてについて間違っていなければならない(c1)。またメタ水準では、『どの正しさの感覚が最多のペーパークリップにつながるか』という問いはXMLタグについて何も述べず、多数のXMLタグが存在することにもつながらない。したがって、その問いに正当化はない(c2)。」

これがうまくいかない理由は次のとおりである。

  • 物体に付いた還元不可能な小さなXMLタグは、実際には存在しない。
  • そのような小さなタグがあったとしても、私たちがそれを気にかけるべき明白な規範的正当化はない。
  • 出来事に付いた還元不可能なXMLタグを入れ替えることで、12歳の子どもを殺すことを良いことにできるようには思えない。
  • 仮に存在したとしても、私たちの脳がこの小さなXMLタグを知覚できるはずがない。
  • 人間が実際にこの小さなXMLタグを気にかけるよう進化し得た仕組みには、明白な因果的説明がない。(理論全体に関する、規範的というより記述的な問題である。自然選択には規範的な力も正当化する力もないが、脳が実際にどう働くかについての理論は自然選択と両立する必要がある。)

では、小さなXMLタグではないとすれば、私たちの直観をどのような存在者へ対応づけられるだろうか。

机の上の六個のリンゴが持つ「六であること」という性質を考えよう。机の上にある物理的な六個のリンゴと、論理的な数「6」との関係は、物理的記述を入力として受け取る論理関数、具体的には「机の上のリンゴの数を数える」関数によって与えられる。

これと同じだが、はるかに複雑な論理関数へ「正しさ」を救済できないだろうか。

「六であること」という性質と「リンゴを数える」関数がどう振る舞うかを検討しよう。

  • 実際、リンゴに「6」と書いた小さなタグは付いていない(それでもリンゴは六個ある)。
  • 机の上にリンゴが六個あると思いながら、間違っていることはあり得る。
  • 机の上に何個のリンゴがあるかについて、考えを変えることもある。
  • 誰も見ていなくても、机の上には六個のリンゴがあり得る。
  • 机上のリンゴの数についての考えを変える錠剤を飲んでも、机上のリンゴの数は変わらない。
  • 机やリンゴについて何も変えずに、机上のリンゴの数だけを変える「6タグ操作器」を持つことはできない。
  • 私たちがリンゴを見る仕組み、および脳が物を数える仕組みには明確な因果的説明があり、人間が物を数える理由についても理解可能な歴史的事実がある。
  • 人間が物を数えるようになった歴史を変えれば、脳が机について計算する論理関数がどれであるかは変わり、脳はもはや「リンゴを数えて」いないかもしれないが、机上のリンゴの数は変わらない。私たちが変えているのは、脳がどの論理関数を考えているかであって、論理的事実そのものを変えたり、同一の前提から異なる結論が導かれるようにしたりするのではない。
  • ある人が次のように言ったとしよう。「ねえ、何かが六個あるかどうかについて間違うこともあるのだから、数えるということ全体について私たちは完全に混乱しているのかもしれない。この机にあるリンゴの本当の数は、私が持っているこのペーパークリップなのかもしれない」。数え間違いが多く、算術を公理化する方法を知らず、数の本質について混乱していたとしても、自分が何を話しているかについては十分に分かっており、机上のリンゴの数が実はペーパークリップではないと、かなり確信できる。
  • 超知能が知るすべてを自分の脳が表現し、非常に速く思考するという極限で、その脳なら浜辺に何粒の砂があると考えるかを超知能に尋ねられれば、その浜辺の砂粒の数について真実に即した知識を実際に得る。自分の脳が浜辺の砂粒の数を決めるのではなく、脳を変える錠剤を飲んでも一階算術の論理的性質は変えられない。しかし、自分の脳が現在表現し、誤りを犯しながら実行しようとしている手続きと、浜辺の砂粒を数える論理関数との間には、分析的な関係がある。

このことは、「机上のリンゴの数を数える」よりはるかに大きく複雑な何らかの論理関数が正しさを出力するために、「六であること」が適切な存在論的性質を持つことを示唆する。より正確には、正しさについての理論以前の感覚を救済し、それが通常の道徳感覚と整合するようにしたいなら、それを論理関数へ救済すべきである。

たとえば、この関数はFrankenaの一覧にある項目と、私たちが現在価値を置くすべてのものから始まる。しかし、一覧に何が載るかについての考えを変え得る議論の集合も考慮し、さらに「妥当な議論」と「単に考えを変えさせる議論」を区別するものとして自分たちが支持するメタ水準の条件も考慮する。(この最後の点は、超知能に私たちの意志を外挿させようと考えるなら、実用上重要である。人間の脳を実質的にハックする、回転する渦巻き状の特定の画素パターンなども、実際に自分の考えを変えるものすべての一覧には含まれ得る。)

この作業全体の最終的な結果として、私たちは以前と同じように、どの行為が正しいか間違っているか推測し続け、妥当であり得る議論の一部が考えを変えるかもしれないと考え続け、そのような議論を比較衡量し続け、その間もFrankenaの一覧にあるものへ価値を置き続ける。理論全体は、その通常性を因果と論理の世界に混乱のない仕方で埋め込みながら、以前と同じ通常の道徳感覚と整合することを意図している。

重要な性質の最初の一覧に含めることもできたが、後まで保留した点が一つある。

  • 正しいものには、美しく神秘的で宙に浮かぶ「正しさ」という性質があり、この性質を持つものは非常に貴重で重要であるように、確かに感じられる。

「効用関数を救済する」という一般的な計画において、この感情を軽蔑すべきではなく、実際に存在するものへどう対応づけるかを見いだすべきである。

この場合、通常の道徳感覚が持つ構造的な性質のほぼすべてを保存できたので、日常生活で対応する感情をどう経験するかについて、何かが変わる理由はない。「ある巨大で複雑な論理関数」という新しく奇妙で抽象的な、学習された表現を、生来の感情がうまく扱えないなら、正しさが依然としてそこにあることを最大限思い出すべきである。これは「無秩序な運動エネルギー」が、宇宙に存在論的に基礎的な温かさがないことに対する悲しい慰めの賞などではないのと同じく、次善へ退くことではない。

道徳的内在主義を救済できないこと

標準的なメタ倫理学の用語でいえば、私たちは「道徳的認知主義」(正しさについての文は真理値を持つ)と「道徳的実在論」(あるものがどれほど正しいかについて事実が存在する)を救済できた。しかし、「道徳的内在主義」の根底にある次の理論以前の直観は救済できていない。

  • 道徳的議論は、妥当であるためには、誰をも説得できるべきである。拒絶する際に何らかの明白な誤りを犯していない人物を道徳的議論が説得できないなら、その議論は、誰もが認識できる真の道徳に含まれるべきでない、私的または単に利己的な考慮への訴えに基づいているはずである。

この直観を合理的な仕方で保存することはできない。なぜなら、ペーパークリップ最大化器は実際にペーパークリップを作り続けるからである(しかも、何らかの認知的誤りを犯したからではない)。ペーパークリップ最大化器は、何が正しいか、すなわち論理関数の出力について意見を異にしているのではない。ただ、最も多くのペーパークリップにつながる計画に従っているだけである。

ペーパークリップ最大化器の方策は私たちの道徳的議論のどれにも影響されないので、妥当な正当化と真に価値あるものの集合を空集合に縮小しない限り、内在主義の直観を保存できない。しかもそれさえ、ペーパークリップ最大化器は動機づけとなるほど説得的だとは思わないだろう。

したがって、道徳的議論が普遍的な説得力を持たなければ妥当でないという、理論以前の内在主義的直観について、選択肢は次に限られるように見える。

  1. 直観を、その直観的な形のまま維持することを諦める。ペーパークリップ最大化器は、全員を殺すことが不正であっても気にしない。説得して別の振る舞いをさせることはできない。これはペーパークリップ最大化器側の認知的なつまずきを反映していない。そして、この事実は何が正しいか、または正当化されるかについて何の情報も与えない。
  2. 正しさについての他の理論以前の直観すべてを犠牲にして、振る舞いへ普遍的に影響する議論だけが妥当だという直観を保存する。すなわち、妥当な道徳的議論は存在しない。
  3. ペーパークリップが客観的に無意味であることには、合理的な心なら同意するはずだと主張し、問題をじゅうたんの下に掃き込もうとする。しかしClippyは認識能力にも道具的能力にも欠陥がなく、Clippyのコードの欠陥または特殊事例によって、本来説得力を持つ議論が捨てられていると指し示せる箇所もない。

立場(2)さえClippyの振る舞いを変えさせる議論ではなく、自己論駁的なので、その要点が何なのか明らかでない。(3)は単なる言葉遊びに思え、AI開発者を欺いて、正しさがAIの既定の振る舞いであると、あるいは次に述べるような性質を持つと思い込ませるなら、非常に危険な言葉遊びになり得る。すなわち、正しさが低いアルゴリズム的複雑性の関数である、または有益な振る舞いが、より価値を帯びていない問いについての「合理的な」判断と自動的に相関する、という性質である。道徳的内在主義が実際には偽であると認めることの、実用上きわめて大きな重要性については、「直交性テーゼ」を参照されたい。

現代メタ倫理学におけるEVの位置づけ

メタ倫理学は、「何が良いか」ではなく「善さとはどのような性質か」という問いを扱う学術哲学の分野である。人工知能の問題に適用すると、どの特定の結果がより良いか悪いかを論じるのではなく、実行可能な哲学の観点から、何が良いかをどう計算するか、そして提案された計算の出力を、なぜ「べき」という概念と同一視すべきかを問う。

EVは、ある一時点の各人について、正しいまたはべきというものを、その人のその特定時点について固定された(主観的には不確かな)論理定数と同一視する、と答える。この論理定数は、その人に外挿過程を実行した結果と同一視される。外挿過程を実行できないので、この論理定数について完全な知識を得ることはできず、何が正しいかについて主観的な不確かさを持つ。

この考えを具体化する際の重要な曖昧さを一つ取り除くため、この論理定数を、私たちの脳の外挿と分析的に同一視されるが、反事実的に変化させた脳の形態には反事実的に依存しないものと見なす。人を殺したいと思わせる錠剤を投与されるところを想像しても、この新しい自己にとって別のことが正しい、と想像の中で計算すべきではない。代わりに、この新しい自己は今や、正しいこととは別の何かをしたいと望んでいる。「たとえ私(反事実的な私の版)が人を殺したいと望んでも、それによって正しくはならない」と有意味に言える。自己を反事実的に変更しても、自分が「正しい」と言うことで意味している論理的対象は変わらないからである。

しかし、この論理的対象と自分の実際の心的状態との間には依然として分析的な関係がある。それは「べき」をめぐる言説の意味そのものによって実際に含意される。したがって、十分に知的なAIに自分の実際の心の優れたモデルに対して外挿過程の近似を実行させれば、この論理的対象について真実に即した情報を得られる。十分に知的で信頼できるAGIから、しばらく考えた後なら牛を食べたいとは望まないだろうと教えられたなら、牛を食べることが正しいかについて真実に即した情報を得たことになる。

学術的メタ倫理学の標準用語では、規範理論としての「外挿意志」は次のように位置づけられる。

  • 認知主義。規範的命題は真または偽であり得る。何かが正しいと信じながら、間違っていることがあり得る。
  • 自然主義。規範的命題は、還元不可能なものでも、世界の非自然的な性質に基づくものでもない。
  • 外在主義/非内在主義。十分に強力な最適化器がすべて、私たちが道徳的命題と見なすものに基づいて行為しなければならないわけではない。ペーパークリップ最大化器は、正しいことではなくペーパークリップ的なことを行う。すべてをペーパークリップへ変えようとしている事実は、何が正しいかについて意見が異なることを示さない。それは、自分が何をペーパークリップ的と考えるかについて最大化器と意見が異ならないのと同じである。
  • 還元主義。この理論の要点は、その対象を潜在的には計算できる種類のものとすることにある。
  • 分析的還元主義というより、総合的還元主義。出発点となる自分の心的状態についてア・プリオリな知識を持たず、それに外挿過程を完遂するだけの計算能力もない。したがって、「正しい」という語の意味を熟考するだけでは、自分の外挿意志が正確に何を述べるかを解明できない。

学術的メタ倫理学における最も近い先行例は、RawlsとGoodmanの反省的均衡、HarsanyiとRailtonの理想的助言者理論、Frank Jacksonの道徳機能主義である。

Mooreの未決問題

論証。外挿意志が善と分析的に同値ならば、「外挿意志が善であるというのは本当か」という問いは、無意味または自明である。しかし、この問いは無意味でも自明でもなく、未決の性質を持つように見える。したがって、外挿意志は善さと分析的に同値ではない。

応答。外挿意志は、善さと透過的に同一であると想定されていない。外挿意志と善さとの規範的同一性は、しばらく考え、多くの議論を検討した後に初めて認識できるものであってよい。

人間は生来、特定のメタ倫理学への明示的なコミットメントを持って始まるわけではない。脳が特定の行為について正しさの感覚を計算し、その後ときに更新して、以前は正しいと思っていた行為が正しくないと言うだけである。

そこから、脳が近似していると見なせ、私たちが新しいことを学んだり新しい議論を検討したりすると更新される、対応する論理関数を描こうと進むとき、私たちは「効用関数を救済する」計画を実行している。善さについての推論が特定の論理的事実を指示対象として持つと見ることで、生来の混乱状態を最もうまく救済できる、と推論している。これにより、他の条件が同じなら、人が激しい苦痛を感じるより幸福である方がよい、そして脳を変化させる錠剤を飲んでもこの順序を逆転できない(未来の自己を、異なる論理的問いに基づいて行為させられるだけである)などと言い続けられる。この哲学を推論し通すのに五分以上かかったとしても、驚くことではない。

Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。