WIKI CONCEPTスコア 2

Do-What-I-Mean階層

Do-What-I-Mean hierarchy

この日本語訳は、表示本文の全体がYudkowskyまたはSoaresに帰属すると確認できたページだけを対象にしています。

Do-What-I-Mean(「私の意図どおりにせよ」)とは、ユーザーが何を望み、または信じているかの明示的モデルに基づいて、アラインされたAGIが、よりよくアラインされた計画を作る能力である。

DWIM性の段階は次のとおりである。

  • 人間の意図を理解しない/DWIM性ゼロ。たとえば、一つの伝達されたタスクへ集中し、そのタスクが及ぼしうるすべての 影響 を個別に 審査する必要があるタスクAGIである。この種のAGIに「がんを治せ」と言う場合、がんを除去するが副作用として患者を殺す計画を却下する必要があるかもしれない。AGIは、患者を殺さないほうがよいと最初から知っているわけではないからである。
  • Do What You Don’t Know I Dislike(私が嫌うとあなたが知らないことはするな)。タスクAGIは、人間の目標の一部、または人間が世界のどの部分を特に重要と考えるかについて背景知識を持つため、人間の 審査に通りそうな計画をより素早く生成できる。この段階のタスクAGIへがんを治すよう命じると、がん切除で断たれた血管をすべて慎重に閉じる計画を生成するまでの質疑応答は比較的少なくなる。AGIは人間の健康について一般的概念を持ち、人間の健康への 影響 が重要だと知り、健康を悪化させる副作用を持つ計画より、良好な健康をもたらす副作用を持つ計画をユーザーは一般に好む、とモデル化するからである。
  • Do What You Know I Understood(私が理解したとあなたが知ることをせよ)。タスクAGIは人間の 信念 のモデルを持ち、人間が起きると予想することについてのAGIのモデルと、AGI自身が起きると予想することの相違を検出し、報告できる。
  • DWIKIM:Do What I Know I Mean(私が意図すると自分で知っていることをせよ)。タスクAGIは人間の選好について明示的な心理モデルを持つ。ユーザーにとって重要な環境中の物の一覧だけでなく、選好について情報を与えるユーザー行動の予測モデルである。この段階では、AGIはオンライン文章のダンプを読み、人間心理のモデルを構築し、その人に健康になってほしいと利他的に望んでいるから、あなたががんを治すよう命じているのだと推測できる。
  • DWIDKIM:Do What I Don’t Know I Mean(私自身も知らない私の意図どおりにせよ)。AGIはあなたのモデルに基本的な 外挿 を行い、AGIのモデル上で、さらに何かを知ればあなたが考えを変えるかもしれないことをしようとしている場合に気づける。(DWIDKIMモデルを 非常に強く信頼していない限り、この状況が意味すべきなのは「ユーザーが言ったはずだと思うことを実行せよ」ではなく「それについてユーザーへ警告せよ」である。)
  • (整合的)外挿意志。AGIは、あなた(または全員)がAGIと同じくらい賢ければ、AGIにするよう命じたであろうことを行う。つまり、あなたの意思決定モデルを、知識の改善、論証を検討する能力の向上、反映性の改善、または規範性の理論へ向かうその他の変換の方向へ外挿する。

DWIMを高い段階へ押し上げるリスクには、次が含まれうる。

  • DWIMが計画を考案でき、その一部が完全には監督されない範囲では、DWIMは非常に複雑な目標または選好システムとなり、訓練が難しく、壊れやすくなる。この故障モードは、ある段階のDWIMが、自ら計画を生成するのではなく、非DWIM手順が生成した潜在的に問題のある計画へ 単に フラグを 立てる ためだけに使われるなら、起きにくいかもしれない。
  • 人間の正確な予測心理モデルは、ほかの何かがうまくいかなかった場合に、 プログラマー欺瞞 という故障モードをシステムにとって利用しやすくするかもしれない。
  • 十分に高度な心理モデルは、 マインドクライムを構成するかもしれない。
  • 人間と魔人のシステムは、魔人が 危険な慢心の谷 へ陥るかもしれない。そこでは魔人は ほぼ 常に正しいが、ときどき非常に大きく間違え、人間のユーザーは 確認段階でその可能性にもはや警戒していない。
    • たとえば、この方法が99.999999%ではなく99%しか機能しない時点で、ユーザーの確認段階を飛ばす、またはAIがあなたの意図だと思うことを何でも実行させたくなるかもしれない。
  • 十分に高度なDWIDKIMまたは EV の可能性を計算してユーザーへ質問すると、人間のユーザーを認知的危険へさらすかもしれない。(「シナリオ32のもとで十分に超人的なら、あなたはこの光る渦巻きを2分間じっと見つめたいと思うはずだ。いくつかのことについて考えが変わるかもしれない……それが妥当な論証だと思うか、確認してみたいか。」)
  • AGIが実際に安全な魔人のように振る舞ったなら、努力も危険もなく自分の願いが即座に叶うという感覚は、プログラマーを追加の モラルハザードへさらすかもしれない。
Wiki専用概念

このページにはLessWrong上の関連投稿一覧がありません。