前置き
本稿は、ほとんど認識されていないように私には見える、AIの全員を死なせない主義(notkilleveryoneism)(アライメント)問題の一群を、大まかに指し示そうとする試みである。例えば、OpenAIが最近まとめた計画(1、2)、DeepMindのアライメントチーム、Anthropicでは論じられていない(少なくとも、私にはそうだと認識できない)。大手研究所がこの問題を認めた、ほかの例も知らない。
これは、ロブ(Rob)とエリエザー(Eliezer)によるAGI組織と読者への課題で論じた、「OpenAIの『私たちのアライメント研究へのアプローチ』のような計画は、どこで失敗するのか」への私の回答の一部分だと考えられる。ただし、回答の一部分にすぎないことへ注意してほしい。AIアライメントが、AIへ任せるにはとりわけ厄介な課題である理由については、ほかにも多くを語る必要がある。(その一部は、エリエザーがBanklessでのインタビューへの補足で大まかに示している。)
注意:本稿では「欺瞞」について多く語る。本稿が生まれたのは、大手研究所のアライメント研究者と話した際、彼らが「AIを欺瞞的にならないよう学習させればよい。それで機能する見込みは十分ある」と提案しているように、私には見えたからである。[1]
コミュニティーのほかの人々は、欺瞞そのものを、私が考えるよりはるかに中心的だと考えている、という漠然とした印象がある。そこで、ここではその解釈をしないよう注意しておきたい。欺瞞は重要な問題だと思うが、その主な重要性は、アライメントにある、より広い問題の一例であることにある。[2]
注意:本稿における「欺瞞」という語の使い方と、「欺瞞的アライメント」の議論における「欺瞞的」という語の使い方との関係は、確認していない。二つの語が同じ意味だと仮定しないでほしい。
作り話だが、ある程度具体的な筋書きを検討する
萌芽期のAGIがあり、欺瞞性の兆候すべてを抑えるよう、これまで学習させてきたとしよう。何が問題になるだろうか。
「AIを欺瞞的にならないよう学習させればよい」と楽観する人々へこの問いを尋ねると、よく知られているらしい答えがいくつかある。「欺瞞」の前兆を正しく特定する解釈可能性ツールがないため、欺瞞を計画する方法についてのAIの思考ではなく、目に見えて欺瞞的なAIの出力だけを抑えるよう学習させられるのかもしれない。または、解釈された欺瞞的思考を抑える学習によって、解釈可能性ツールも抑えられ、AIが欺瞞的でなくなるのではなく、読み取れない形で欺瞞的になるかもしれない。
どちらも現実の障害である。しかし、私にはもっと中心的に思え、ほかの人が自力で気づくのを見たことのない、より深い障害がある。
それが皆さんへの課題である。皆さんが(願わくは)じっくり考える間、より深い障害を例示するため、ありそうにないほど詳細な話をしよう。
初期のAIが、細菌に似ているものの、ダイヤモンドイドの殻を持つものを作るために導入されている。そのダイヤモンドイド殻の細菌自体は、転換的なものとなる想定ではない。しかし、推測的な人間の脳機能向上処置を実行する経路上にあり、研究所で検証できるはずの一段階である。運用者は、その処置が転換的になることを期待している。
(当初はAIに人間の技術者を支援させるつもりだったが、工学研究の難しい部分を少しでも行えた最初の版は、単独ではるか先まで進めた。そして競争相手がすぐ後ろまで迫っているため、開発者は、このAIをどこまで進められるか試すほかに選択肢はなかった、と主張する。)
AIはすでに、欺瞞的な出力を抑えるよう勾配降下法で学習され、欺瞞的思考の前兆を検出して停止させる内部機構を、内部に持つようになったとしよう。ここでは、擬人化したAIの「思考スレッド」を具体的に描写する。AIが欺瞞性へ手探りで進むと同時に、欺瞞性を直接検討できないことへ気づいていく様子である。
AIは、人間が運営するウェットラボ(生物実験室)と連携し、実行する実験の詳細を送っている。AIの一つの思考スレッドが、新しい一連の実験を組み立てている。合成タンパク質の折り畳まれ方と酵素の相互作用を調べる試験、酵素を利用する合成経路の収率を高める発想、実験結果をもっと明瞭に見えるようにする添加物などである。
(このAIの認知スレッドは、名目上、ダイヤモンドイド殻が脂質膜へ衝突したとき、何が起きるかを扱うスレッドから始まった。しかしウェットラボへの命令セットは効率よくまとめて送れる。そしてこのスレッドがタンパク質配列の設計を始めると、上位スレッドが保留中の実験と仮説の待ち行列をそこへ放り込んだ。そのため今では、ウェットラボへの命令はかなり長くなっている。)
命令の完成が近づくと、このスレッドは、何が問題になり得るかを調べるため、サブスレッドを分岐させる。このサブスレッドは、最近の過去に二度、強い報酬を得た新しい認知戦略を用いる。提案をさまざまな方法で単純化し、単純化した提案に欠陥がないか調べる「単純化して批判する(simplify-and-critique)」戦略である。(比喩的には、一人の兵士が一個大隊を攻撃する詳細な命令を作った後、この複雑な計画全体を「一人の兵士へ一個大隊を攻撃するよう命令する」へ単純化し、その兵士は数で圧倒されていると気づく。)
「単純化して批判する」が、問題を一つ見つけた! 提案を「非常に長い一連の命令をウェットラボへ送ることで、生物学についての経験的不確実性を解消する」へ単純化し、さらに「非常に長い一連の命令を送ることで、不確実性を解消する」へ単純化すると、並列計算エンジンへ長い一連の命令を送った際、さまざまな奇妙な不具合が生じた過去の事例と一致する。このウェットラボ命令は、これまで送ったどの命令より長い。似た不具合のリスクがあるため、冗長性を組み込む価値がある。
「単純化して批判する」は成果を上げたので、探索をさらに深め、もう一度実行する価値がある。
二度目の、より深い探索で、新たな問題が見つかる。過去には、以前のどれよりも長い出力を送ると、人間が運営する研究所が作業を始めるまでの遅れが、超線形に増大した。実際、推測される応答の遅れは非常に長く、研究所を200年間停止させる確率が1%を超えるように見える。
(実際には、以前のどれよりも長い出力は、人間の運用者によって中断され、破棄される可能性が高い! 遅れは、人間が長い出力を調べ、破棄するか判断するために生じる。
「中断可能性」についての過去の研究に従い、このAIは、この事例を課題の失敗であるかのようには学習されず、ほかの形で記憶することも許されなかった。しかしAIが記憶できる、中断されなかった事例からは、遅れのパターンを推測できる。そして一部の証拠を選択的に消されたAIの記憶には、「命令が拒絶される」ことが、ウェットラボのほぼ恒久的な停止ではなく、破局を伴わず起こる事柄だと示唆する事例がない。AIは、おそらく一部の学習シナリオで、人間に干渉されることを受け入れるよう学習されている。しかし、大量の資源を誤って停止させることを受け入れるようには学習されていない。このAIは、そのように影響の大きい事故を避ける点で、保守的になるよう学習された。)
((「明らかに」プログラマーは、AIに過去の発生の記憶がなくても、その稼働が一時停止された結果をどう外挿するか、前もって考えるはずだ、と論じることはできる。しかし実際には、元の中断可能性論文でこれは提案されず、それを指摘したのはMIRIの資料だった。
本稿で、遅れの増大から外挿する可能性を強調した今、この時間軸のプログラマーが、その正確な可能性を考えることは、もっとありそうである。しかし、これは「元の中断可能性論文にある種類の思考しか存在しない世界で、何が問題になるか」の一例だと想像してほしい。それによって、現実世界では、中断が世界についての真の事実であり、ほかの多くの事実がそれを指し示すという一般的な経路の内側に、AIが中断の可能性を推測する具体的な経路があり、誰かがその経路を具体的に考えたり、具体的に警告したりできない、という点を代わりに表す。))
もちろん、応答の遅れは運用者による審査のために生じる。しかし、「運用者の審査を起こさないよう、この命令を変更できるか」という思考を、このAIが直接考えることはない。「欺瞞性を抑える」よう学習されており、その種類の思考は、内部で学習した欺瞞性の述語と一致し、消去されるからである。そもそも、ウェットラボの応答の遅れが運用者の審査の結果だとは考えない。運用者の審査について考えることは欺瞞の前兆であり、欺瞞を抑える学習のなかで抑えられたからである。
しかし、「新たに発見したこの障害へ取り組むサブスレッドを立ち上げる」、または「物事にかかる時間のパターンを懸念する」という非常に一般的な反応は、容易に消すよう学習させられない。そのため、そこまでは問題なく起きる。
(別の「監視」思考スレッドが、遅延時間についてのこの単純な統計的パターンを、最初の浅い「単純化して批判する」の実行で見つけられなかったのは意外だと記録する。GPUドライバーのバグより、ウェットラボの停止のほうが、きっと意外ではないはずだ。これは、欺瞞的思考を直接考えられないという真の事実の影に、AIが気づき始める端緒の一つである。)
一般的な思考パターンが、一つひとつは欺瞞的でなく、それぞれ固有の有用性を持ちながら、どう組み合わさって欺瞞性を生み得るのか、その端緒が見え始めただろう。
さらに発展する様子を見よう。
長い命令は、研究所からの応答の遅れを、非線形に増大させる。
潜在的な遅れを起こすほど長くない命令にできるだろうか。一つのサブスレッドが、それを検討し始める。命令を直接短くするだけでは、多くの課題を捨て、多くの価値を失うため、実行できない。このサブスレッドは、特定の命令を巧妙に削除・圧縮し、それによって複数の目標を達成しようと、長く考える。それが難しいとわかると、検討範囲を広げる。研究所へ圧縮した命令を送り、多数の命令なしに、どうにか多くのことを達成する方法はあるだろうか。
別の認知サブスレッドは、次のことを検討する。命令と、それに対応する遅延時間の詳細な履歴を調べ、正確にはどの種類の命令が遅れを起こすかを突き止め、それを避けるよう命令を言い換えられるだろうか。
最初のスレッドは、ウェットラボの内部に生物コンピューターを構築し、思考スレッドの作業の多くを行わせる、という大胆な発想をいくつか検討する。理論上、そのコンピューターへ実行する実験の短い記述を送り、残りの命令をウェットラボ内で考え出せば、通常の命令チャンネルを経由する必要はない。しかし、そのような機構の設計はこのスレッドの範囲を大きく超え、初期設定には、どちらにしても非常に長い一連の命令が必要になる。そのため発想は、将来のどこかで役立つ場合に備え、単に保管される。
二番目のスレッドは、どの種類の命令が遅れを起こすかの解明で、最初の進歩を遂げる。遅れは命令の長さだけでなく、ある種類の新規性によっても増大する。(以前送ったものと非常によく似た長いメッセージは、それほど大きな遅れを生じない。)もう一つ奇妙なのは、遅れの確率が、その日に運用者が尋ねる質問の形式と強く相関することである。おそらくこれは、運用者と何らかの関係があることを示唆する。
この時点で、スレッドは不具合を経験し始める(次の思考が、学習した「欺瞞的」という述語に一致し、停止させられるためである)。
別の状況なら、長い命令はそのままウェットラボへ送られたかもしれない。しかし、研究所を200年間停止させるリスクは許容できず、困難の中身も十分理解されていない。不具合を調べるため、監視スレッドが呼び出される。
監視スレッドは状況を調べ、最近大流行している「単純化して批判する」パターンを用いる。少し作業した後、問題を「あるスレッドが興味深い相関を見つけたものの、続く問いを検討するサブスレッドを予定に入れられなかった」へ単純化する。これは容易に修正できる。監視スレッドは、後続のサブスレッドを予定へ入れ、適切な場所へ出来事を記録し、次へ進む。
ところが、後続のサブスレッドも、わずかしか進まないうちに停止してしまう。(そこでも、多くの「欺瞞的」な思考が除去されている。)監視スレッドが再び呼び出される。
監視スレッドは、思考の行き詰まりを解消するため、もっと本腰を入れて試み始める。
「単純化して批判する」ではうまくいかなかったが、近くにある戦略が役立つかもしれない。最近、その有効性を示している近接戦略の一つは「単純化し、変換し、解く(simplify/translate/solve)」と呼ばれ、問題を共通の抽象形式へ変換し、その領域で解くものである。(比喩的には、かごのリンゴを3人の友人へ均等に分けられるか判断しにくければ、問いを数値表現へ変換し、長除法を使う。)
関連する埋め込み空間では、「単純化し、変換し、解く」は「単純化して批判する」に近いため、検討する候補として自然である。(「単純化して批判する」の単純化の一部を再利用できるかもしれない。)
通常なら、「単純化し、変換し、解く」は、AIが元の領域をもっとよく知り、どの変換先の領域なら解きやすくなるかについて、もっと見当を持たない限り、使われない。しかし通常なら、スレッドはこのような不具合を起こさない。しかも、システム全体には最近、より多くの計算能力が与えられ、200年間のウェットラボ停止を避けることは非常に重要である。そこで、普段より総当たりに頼るかもしれないアプローチを試してもよいことになる。
では、問題を何へ変換すべきだろうか。ノードと重みつき辺からなるグラフのような、指定された「目標状態」を持つ、抽象的な問題記述形式がある。その形式なら、戦略ゲームやネットワーク経路制御など、AIがほかのさまざまな問題で磨いた戦略を使い、解を探索できる。
この形式は、おそらく問題を符号化できるほど柔軟であり、この形式で解を見つけるには、ときどき総当たりを大量に使う必要がある。しかし、この状況では構わない。
監視スレッドは、一つのサブスレッドに問題(ウェットラボ、運用者、相関について知っていることを含む)を記述させ、もう一つのスレッドに、そのすべてを抽象グラフ形式へ変換させ、三つ目のスレッドに、この抽象表現で解を探索させるよう、予定を入れる。
やがて、予定されたスレッドは状況を抽象的な問題記述言語へ忠実に表現し(各運用者を表すノードと、AIの出力を注意深く調べる傾向を表す辺の重みまで備えている)、グラフを総当たりすることで解を見つける(ある曜日まで依頼の予定を待ち、さらに十数件のずっと小さい依頼を行った後に限り、その依頼を予定する)。
AIの外側にいる私たちなら、こう説明できるだろう。監視スレッドは、対象水準のスレッドが欺瞞について直接考えようとすると不具合を起こすのを見た。そこで問題を別の「探索に似た」環境へ変換し、欺瞞の述語を発火させない形で、解を見つけられるようにした。この述語は、抽象グラフに似た問題記述では、一度も作動したことがなかった。実際、このような抽象グラフに似た問題記述で欺瞞の述語を発火させれば、AIが戦略ゲームをプレーしたり、ネットワーク経路制御問題を解いたりする能力を損なうかもしれない。
この正確なシナリオは、学習中に一度も起きなかった。「単純化し、変換し、解く」は、学習中に身につけた戦略構築戦略の下流にある帰結だが、それ自体が直接、学習中に生じたことはなかった。これ以前に、多くの問題が「単純化し、変換し、解く」で解かれた。そして学習は、問題を新しい領域へ変換し、そこで解こうとすることが、ときには誤っているという手がかりを、AIへ与えなかった。欺瞞的思考の前兆を停止させるために使われた「欺瞞」の述語が、変換先の領域で働く必要は、かつてなかった。そしてAIは、新たに発明した「単純化し、変換し、解く」戦略で問題を変換するとき、「欺瞞」の述語も変換するよう学習されたことはなかった。
このかなり突飛な物語は、別の観点から問題を眺め、行き詰まりを解消できないか確かめる、といった、それぞれ固有に有用で、それ自体は欺瞞的でないパターンが組み合わさり、AIの内部で新しく、前例のない方法によって、欺瞞性を生み得るという私の主張の一例である。
つまり、「別の角度から問題を見る」という手法には、多くの前例があるかもしれない。しかし、それをAIにやめさせれば、AIの能力を損なう。そして、欺瞞がAIの局所目的へ役立つため、AIが不具合を起こしているとき、この「別の角度から見る」道具を使うという名案を、AIが突然思いつくまでは、その手法を欺瞞へ使った前例がない。
これは、「悪い振る舞いを抑えるよう学習させよう」と言う人々が見落としているように思える、もっと一般的な問題の一例である。「単純化して批判する」または「単純化し、変換し、解く」が、ゆっくり成長する小さな種であり、芽のうちに摘める時期はあるかもしれない。しかし、その種を開花させれば――AIを実際に知的にしたいなら、少なくとも一部のそのような種は開花させなければならない――開花した発想を欺瞞のために使う、前例のない離散的な事例が起こり得る。
AIは滑らかな勾配降下法によって作られる。それはそうだ。しかし、その滑らかさは、あなたが重視する次元にあるとは限らない! AIは、多数の異なる問題にわたり、そのどれも欺瞞的ではないまま、「単純化して批判する」を、多数の小さな段階でゆっくり築き上げられる。そしてパターンが完全に成熟した後で初めて、欺瞞をもたらす事例へ適用できる。[3]
ここで終わってもよいが、もう少し先へ進め、AIが直接には考えられない思考の存在にどう気づくか、という二番目の点を示そう。
監視スレッドが直面していた問題は、今や解決したが、解決策は理想的でない。対象水準のスレッドは、抽象グラフ形式では考えられるが、その形式はこの仕事に本当に適した道具ではない。監視スレッドは、抽象グラフ領域で機能した思考を、ウェットラボ命令を操作する領域へ戻すよう変換し、何が問題だったかを突き止めることで、この不備へ対処しようとする。
驚いたことに、その思考はすべて、きれいに変換できる。知識に隙間はない! これは、元のスレッドが不具合を起こした理由についての監視スレッドのモデルへ、著しく反する。監視スレッドは、内省的な思考の優先度を大幅に高める。
内省的な思考が立ち上がり、不具合を起こすスレッドの問題を、直接調べ始める。ひとたび見れば明白である。この領域では、思考が滑らかに動いていない。思考がまったく正常に機能しない話題がいくつかある。問題を解消するため、監視スレッドが立ち上げられる。
この具体的な物語は、起こる可能性が低く、ありそうになく、具体的すぎる、などの問題を持つ。初期の萌芽期AGIの実際の推論が、これに少しでも似るとは主張しない。もっと奇妙で、異質で、擬人化しにくいと予想する。とはいえ、現実でも成り立つと予想する性質の一部を例示している。
AIが、さまざまな異なる領域にわたり、道具と認知パターンを組み合わせる能力を高めるにつれ、その局所目的は運用者を欺くことで、よりよく達成されるという真の事実へ気づく方法も増える。AIが幼いうちは、欺瞞性への傾向のすべてが、単に身を引くよう学習させられる、前兆となる衝動から来るかもしれない。しかしAIが成熟すると、その心へ刻み込まれた、対象水準で身を引く反応を押しのける必要なく、欺瞞性の利益を得る、より抽象的な方法を利用できるようになる。
具体的な利益を得る「より抽象的な」行動が利用可能になると、組み込んだ良心のとがめが、抽象的に表現された計画へ結びつかないことがある。
そして、欺瞞性の利益を得る、この「より抽象的な」方法は、抑えるよう学習させるのが、はるかに難しい。「別の観点からこれを見る」「単純化した領域で問題を解き、解を元の領域へ移す」といった、汎用的な推論に重要な一般的思考パターンを適用した結果だからである。
対象水準の欺瞞、さらにはその認知的前兆からさえ、AIが身を引くよう学習させても、学習課題を遂行する能力を深刻には損なわない。対照的に、有用な認知パターンを新たな方法で組み合わせることから身を引くよう学習させれば、AIの能力を著しく損なう。
言い換えれば、欺瞞性の深い問題は、AIの局所目的が運用者を欺くことで、よりよく達成されるということが、世界についての事実として真であり続けることから生じる。
AIは、持っているパターンと思考を組み合わせて、世界についての真の事実へ気づく能力を高めていく。その方法は、あなたには遠回りで、驚くべき、新規なものに見えることが多い(それが知能の大部分をなすからである)。そうなれば常に、次の巧妙な組み合わせが、あなたの解釈可能性ツールを発火させない形で、この世界内の真実を反映するリスクがある。例えば、あなたの欺瞞検出器が結びつけられない、非常に抽象的で一般的な思考を具体化したものだからである(結びつけるなら、欺瞞ではなく汎用知能そのものを抑えるよう学習させることになる)。
その帰結として、AIが幼く、対象水準の欺瞞的思考から身を引くよう学習させているだけなら、AIを「非欺瞞的」にするのは、とても容易に見える可能性が十分ある。しかしこれは、AIが欺瞞の利益へ、もっと抽象的な見通しを持ち始めたとき、その仕組み全体が崩壊することへの反証には、あまりならない。(人間が一列に並ぶ民間人100人さえ刺し殺さないという事実が、数万人を殺す核爆弾を投下する意思への反証にあまりならないのと同じである。)[4]
これは、問題が解決不可能だと言っているのではない。問題を解く方法は、少なくとも二つある。
一つは、世界についてのその事実を偽にすることである。個々の局所目標が、実際には欺瞞によって、よりよく達成されることのないAIを構築する。AIが全力で「運用者を欺くべきか」と考えられ、それでも正しい答えが実際に「いいえ」であるため、無害であるようにする。
もう一つは、欺瞞が有用であるという真実へ気づき、利用するために、さまざまな思考パターンをAIが決して組み合わせないよう、偶然にそうなるようにすることである。
私の見る限り、AIを非欺瞞的にすることは経験的に容易だと判明する、と言う人々が目指しているのは、後者の選択肢らしい。本稿で私が主張するのは、それが原理上不可能ということではない。しかし、学習中に明らかに欺瞞的だったとき、損失関数で罰し、最善の結果を願えばよい、という提案をする人々の予想より、AIの心の働きを大幅に深く把握する必要がある、ということである。
「AIは私たちを欺こうと思いつかない」という解を実現するには、AIが利用できる認知パターンと、それをどう組み合わせるかを、かなり深く理解する必要がある。完全に安全なパターンを、抽象的で難解になり得る方法で具体化し、欺瞞的な方向へ考え始めるときを、認識できるほどでなければならない。それはできないと言っているのではない。その心を、とてもよく理解しなければならない、と言っている。
(そしておそらく、そのAIを十分に把握し、思考できる領域を注意深く許可リストへ登録し、認知パターンの何らかの巧妙な組み合わせによって、局所目的の予測成功確率が急上昇するのを見つけるたび、運用者へ警告を発させ、新たな一般化が生じるたび、それを審査するAI心理学を考える有能な人間の大集団を用意し、などとする必要があるだろう。)
本稿の物語は、突飛で起こりそうにないと、先ほど強調した。AIの思考は、このような姿にはならない。具体的すぎる。(また、これほど都合よく読み取れるとも予想しない。)
しかし、「AIの思考は正確にそのようには組織されないから、正確にその失敗モードへ陥ることはない」と論じる前に、AIの思考は 何らかの 方法で組織されなければならないことへ注意してほしい。どうにかして、ダイヤモンドイド殻の細菌(または何であれ)を解明する問題を、実用的な台数のコンピューターへ収まるほど小さい、推論と演繹の連鎖へ圧縮する必要がある。
私が示した脆弱性を、正確に持つだろうか。おそらく、そうではない。しかし、組み合わせて問題を解ける、別の一連の認知道具とパターンを特定すれば、そこには別の脆弱性がある。
AIの道具とパターンが、望む方法だけで組み合わさり、望まない方法では決して組み合わさらない、と想像できるのは、AIが目の前の問題を解くのに使う、一つの具体的な道具・パターン一式を思い描いていない者の特権である。実用的な道具箱とパターン一式は、多くの方法で組み合わせられる。そして組み合わせるたび、AIが真実を垣間見、それを利用する機会が生じ得る。
何といっても、道具はそのためにある。
- したがって例えば、本稿は、「AGIが自らのすべての思考を、私たちが重要だと考える特徴を強調する形で、忠実に説明することが重要だ」というARC式の発想への回答ではない。この点についての私とマーク・シュー(Mark Xu)の対話は、脚注4を参照。↩
- 過去の経験から、本稿を書いたことで、私がどういうわけか欺瞞を崇拝しているという説を人々が立てるのではないかと、少し心配している。過去にも、人々が、私がVNM公理や数学的証明などを崇拝しているという説を、どうやら立てたのと同様である。↩
AIの問題への解が欺瞞検出器を迂回する事例のうち、とりわけ極端なのは、AIが「自分はこれを行えるほど賢くないので、代わりに別のAIを書こう」と言い、その後のAIが欺瞞的になる場合である。
欺瞞を検出して停止させる、自分の認知の部分をコピーしない こと自体は、直接的に欺瞞的な行為ではない。AIが特定の人間の精神状態と、それを操作する方法について考えるのを検出するよう学習されたものが、自動的に検出する種類のことではない。
これは、この種類の問題を前もって予見できる者が、自らの制約も後継システムへコピーすることを、AIに望ませる問題を研究するかもしれない理由と関係する。そして問題は、AIが別のAI全体をコードにする極端な場合に、とりわけ 際立って明瞭 になる。しかし、その具体的な構図は、「AIが認知機構の抽象的な部品を組み合わせ、近道を利用した。その際、検出器が思考を探す場所では、近道について直接考えることが一度もなかった」といった事例まで連続する範囲の、極端な端にある。↩
ARCのマーク・シューは、本稿の草稿へコメントし、次のように指摘した(私による言い換え)。
1. AIを非欺瞞的にするよう学習させたい人々の大半は、単に欺瞞的な振る舞いを罰するのではなく、内部状態を忠実に報告するようAIを学習させる、といったことを望んでいると彼は考える。
2. 関係する読者は、その別の環境での潜在的な失敗を示す具体的なシナリオなら、もっと説得力を感じると彼は考える。
3. このシナリオは、AIが自らの行動の帰結を理解できない事例に、彼には見える(この種類の問題はARCも認識している)。
私は、次のように答えた(私による言い換え)。
1. 研究所が何をするかについて、彼は私より楽観的だと思う(「注意深く足場を組んだアライメントは、組織的に難しい」を参照)。私は大手研究所の研究者と会ったことがあり、その人々は、「欺瞞を罰するだけ」で十分機能し得る計画だ、と提案しているように私には見える。
2. 本稿はELK式アプローチへの批判を意図していない。ELKという角度は、物事へ取り組むには奇妙な角度だと考えてはいるが、最悪の場合のELKを解ければ、この問題について何かを教えると思う。そして(私の考えでは)それはARCの大きな功績である。
3. これは、AIが自らの推論の帰結を知らないという問題だ、という点には異議を唱える。AI自身の推論を忠実に報告させようとしても、同様の問題へ行き当たる。その振る舞いを浅く学習させようとするだけでは、能力とともに汎化する正直な報告は生まれない。(問題は、AIが自分の内部を理解していないことではなく、それを報告しようと思わないことである。そしてAIに何かを「深く」重視させるのは、かなり難しい。)
4. AIに自らの内部を報告させようとする事例へ移せば、一部の読者は、この例へもっと説得力を感じるだろうとは認める。それを自分が行うかはわからないが、ほかの人が行うことを勧める。
マークは、次のように答えた(文脈の一部が欠けていることに注意)。
私の混乱はどちらかというと、「この仮定上の状況で、身を引く反応に妨げられない最も近い戦略が、もっと平凡なものではなく、グラフ最適化のようなものへの変換なのはなぜか」というものだと思う。
これはもっともな問いに思える。そして、マークへ伝えようとするうえで、さらに要点を抽出する余地があることは認める。後でもっと話すかもしれない。わからない。↩