(この記事は、私、ネイト・ソアレスが書いた長い記事から、ロブ・ベンシンガーの助けを借りて切り出したものです。ロブは構成の一部を入れ替え、読みやすくするため文章も加えてくれました。あまり満足はしていませんが、何も出さないよりましだと考えて公開します。正確には、旅行中の私に代わってロブに投稿してもらっています。)
私たちの文明が危険が切迫する時期を切り抜けるのは、いくつもの理由から難しいと考えています。成功には、技術的、社会政治的、道徳的な、さまざまな障害を越える必要がありそうです。原理上は、技術的な問題の解決法を十分に使いこなせれば、社会政治的な問題などの解決に代えられるかもしれません。それでも、多くのことがうまくいかなければならないように見えます。
個々の問題の難しさは、同じではないと思います。たとえば、難所は道徳よりも技術にある、と話すと、いまでもよく驚かれます。AGIをどこに向けるべきかよりも、そもそもどうすればAGIの向きを定められるかのほうが難しいと、私は見ています。[1]
技術的な障害にも、特に核心的と思えるものがあります。「最適化をどう方向づけるか」といった問題です。そして、人類の見込みに私がいまかなり悲観的なのは、私には最も核心的で避けられないと思える技術課題に、ほとんど誰も焦点を当てていないように見えることが、大きな理由です。
私が悲観的なのは、アラインメントが純粋に技術的な水準で異常に難しいと考えているからだ、と誤解している人が多くいます。まったく違います。自分の見解についての誤解の中でも、特に嫌なものの一つです。[2]
これは、人類が何度も行ってきた、ある科学分野を解き明かし、使いこなすという普通の問題だと考えています。たとえば知能は物理学より複雑なので、少し難しいかもしれません。逆に、低水準の物理的な場よりも、動いている心のほうが内省を通じて知りやすいので、少し易しいかもしれません。しかし全体として、人類がこれまで登ってきた山と、質的にそれほど違うとは思いません。
難しさを増すのは、おそらく汎用知能を長く使ってみる前に、それを十分理解していなければならないことです。AGIを手にした後、決定的な行動(pivotal act)が取られなければ、数年以内に事故で自滅する可能性が高そうだからです。しかし、それだけでは私の希望は失われません。
希望を失わせるのは、難所に誰も取り組んでいないように見えること、そして、それを解く必要があると大半の人が納得するころには、もう手遅れになっていそうなことです。
以下で、アラインメントの「難所」と呼んでいるものを、概略だけでも示してみます。難しくは見えますが、人類が本気になれば、この程度の技術問題を解けると私は信じています。私の懸念は、いまの研究分野が、この問題を解こうとしているとは思えないことです。この記事を書くことで、問題の所在をもっとよく伝えたい。そして、新しくこの分野に入る研究者が、私には核心的に見える課題へ、正面から取り組むきっかけになればと願っています。
問題を検討する
私のモデルでは、アラインメントの最も核心的な技術課題の一つで、実現可能な計画ならおそらく必ず向き合う必要があるのは、能力のほうがアラインメントよりよく汎化する、という問題です。
AIの進歩について私が予想しているのは、ある時点で、あるチームが、訓練分布から十分に遠く離れたところでも、十分うまく汎化するAIを手にする、という展開です。そのAIは物理学、生物工学、心理学などを、一体でほぼ世界全体を脅かせるほど高度に習得できます。最も優れた技を身につけるためにも、おそらく個別の訓練は必要ありません。人類が月へ行く前に、出来の悪いロケット技術者を何世代も淘汰して、脳をロケット工学向きに改良する必要がなかったのと同じです。
そして、能力が飛躍するのと同時に、アラインメントの性質は浅いもので、汎化しないと明らかになります。中心となる類推は、類人猿を包括適応度(IGF)に向けて最適化しても、その結果生まれる人間が、頭の中でIGFを最大化するわけではない、ということです。確かに類人猿は、空腹の本能で食べ、気持ちよいから交尾します。しかし、その行動がIGFを高めると明示的に推論して、食べたり交尾したりできるわけではありません。IGFの観点からその行動を正しく正当化する抽象的な推論は、まだできません。その後、人間のようにうまく汎化するようになると、今度はそうした推論ができるのに、IGFについての抽象的な推論を理由として食べたり交尾したりすることを、突然始めるわけではありません。むしろコンドームを発明し、「IGFを自分で計算すればよい」と言って、おいしい食事の喜びを取り除こうとすれば抵抗します。能力が汎化し始める前に称賛していたアラインメントの性質が、能力と一緒には汎化しないことは、予測できるのです。
この話に、こう答える人もいます。「小さなチームが、バイオ技術や工学を全人類を殺せるほど習得するAGIを手にする前に、国家のような大きな主体が、少し劣るAIを持つはずではないですか。そのAIはバイオ技術や工学では少し劣っていても、一つのAGIが未来を丸ごと奪うのを防げるのでは?」
私はこう答えます。「知能が生まれた実例として私たちが見られる唯一のケースでは、自然選択を継続的に適用した結果、実際にホモ・サピエンス・サピエンスが現れました。そして、この新種によって、生態系のさまざまな能力向上の曲線は、実際に急角度で曲がりました。たとえば機械を使うことで、『飛行速度』『高度』『貨物運搬能力』といった確立された指標で、人間はほかの動物を大きく上回っています」。
すると大抵、「自然選択はあまり賢く最適化していなかった」「人間は進化の傾向からそれほど飛び抜けていなかったのかもしれない」「人間が生態系の残りに勝てたのは、文化の発明だけかもしれない。既存の人間文化の中にあるものが、人間を上回ることはできない」といった返答が来ます。
ここでは議論を続ける代わりに、難問の存在を信じないことは、その難問に取り組まずに済ませる確実な方法の一つだ、とだけ言っておきます。
したがって、根拠を論じるのでなく、言いたいことを率直にまとめると、ある時点で何らかの「急な左折」が起きるように私には見えます。システムが、訓練された環境からはるかに離れた領域でも、本当にうまく働き始めるのです。それは、人間にはできてチンパンジーにはできないように、世界を大きく作り替えられる領域です。私の考えでは、そこで事態が激変します。特に、この仕方でAIの能力が汎化し始めたとき、システムのアラインメントは一緒に汎化しない、と予測しています。[3]
この問題は、私がかなり核心的で、避けにくいと考える、次のような問題の少し上流にあります。
- 有能なAGIを、自分の選ぶ目的へ向ける。
- AGIの影響を小さく保ち、慎重に振る舞わせ、停止可能にし、その他の点でも修正可能にする。
この2つが現れるのが、エリエゼルが以前から指摘しているイチゴ問題です。細胞の水準まで、ただし分子の水準までは求めず、まったく同じイチゴを2つ皿に置かせ、その後は何もさせない、という問題です。細胞レベルの複製にはAIの高い能力が必要です。ほかのことではなくイチゴの複製をさせられるなら、こちらが方向づけられることを示します。そして、その後に何もしないなら、修正可能であるか、あるいは「何もしない」という繊細な人間の直感的概念に、とてもうまくアラインしていることを示します。
「能力はアラインメントより広く汎化する」という問題は、なぜこれらの上流にあるのでしょうか。架空のチームOpenMindが、さまざまなAIシステムを訓練していて、まだどれも急な左折をしていないとします。多くのゲームやシミュレーションにAIを置き、操作者が英語で説明した目標を追うよう、うまく訓練できたとしましょう。彼らは言います。「MIRIの人たちは何を言っていたんだろう。簡単な訓練で十分で、方向づけるのは簡単だ」。同時に、停止可能性のために、単純なものから巧妙なものまでいろいろな訓練手法を使い、ゲーム中の、操作者が指定した特定のキャラクターによって、ゲームから取り除かれることをAIに受け入れさせます。影響を小さくするために、Minecraftで露天掘りをさせない手法も使います。さまざまな道徳的ジレンマで訓練すると、「この状況で操作者の相手に毒を盛るべきか」といった道徳的な質問にも、ほかの質問と同じように正解を出せるようになります。「いやあ、アラインメントは簡単だった。運がよかったのだろう」と彼らは言います。
その後、システムが急な左折をします。[4][5] そして、予測どおり、訓練分布の外でも能力は急速に高まる一方、アラインメントは崩れます。
悪い事態は起こりにくいと思い込む誤りをなくすために、OpenMindが使った訓練手法は、うまく汎化します。操作者に停止されることを受け入れさせるための手法は、崩れます。AGIは停止を避けたがるようになり、そのために役立つなら、あなたを欺こうともするようになります。
少なくとも特別な対策がないとき、そして予測される実際の展開として、能力は汎化するのに、アラインメントはなぜ崩れるのでしょうか。大きな理由は、優れた能力が、ものを引き寄せる窪み、アトラクターのようなものを形作るからです。知的システムを十分に進歩させれば、いずれ急な左折をすると思う理由の一つがこれです。また、自然選択が理解も予見も誘導もなしに汎用知能へ行き着けた理由でもあります。
さまざまな訓練状況が、正確で役立つ考え方について、同じ道具的な教訓をAIに教えています。しかも、それらの教訓は、単純な論理構造によって裏づけられています。4人の持つリンゴの袋をテーブル上で合わせ、2人で分けたらどうなるかについての、多様な経験的事実を、単純な算術の法則が抽象的に支えているのと似ています。
しかし、その窪みには自由なパラメーターがあります。それは、AGIが何を最適化するかです。そして、AGIの目標をあなたの望む目標へ引き寄せる、同じくらい強い窪みはありません。
急な左折とは、システムが能力の窪みへ滑り込むことです。すごいことをするのに、深くまで落ちる必要はありません。人間は、重要な多種多様の能力でチンパンジーより優れていますが、絶対的に見れば、それほど一貫した法則どおりに思考するわけではないのです。
アラインメントについて、同じように滑り込める窪みはありません。
むしろ、能力の窪みを下ることは、既存のアラインメントの性質をいくつも壊しかねません。[6]
なぜでしょうか。能力の窪みの中にいるものには、アラインメントの継ぎはぎの対策に逆らう、道具的な動機があるからです。算術が発達すると、それまでの計算の誤り、たとえば1957年の大戦で間違った側にいた小石の仕分け屋の誤りが押し流されるのと同じように、AGIの影響を小さくし、停止可能にしようとする試みも、最終的には押し流されるでしょう。特別な対策がなく、核心的なアラインメント問題の技術的解決もない場合、システムは、その反射や直感、あるいはもっと異質な行動パターンを、今日を生き延びるという収束的な道具的動機と対決させるからです。
これでは納得できないかもしれません。納得してもらうには、いろいろな反論の細部まで、もっと踏み込む必要があるのかもしれません。たとえば、人間は困難を予測して訓練手法を調整できるので、自然選択より成功の見込みが高いと認めたうえで、なぜ現在の提案には希望が持てないのかを論じる、といったことです。それでも、この記事を読んで、少なくとも私の立場の基本は理解してもらえればと思います。
もう一度まとめると、私の立場は、能力が本格的に汎化し始めると、それは起こると私は予測していますが、能力はアラインメントより広く汎化する、というものです。そして特別な対策がなければ、能力の窪みに滑り込んだAGIを方向づける力が失われ、修正可能性を保つために期待していた制約も壊れます。この問題に対処するとは、急な左折を通じてアラインメントを保つか、左折後にアラインさせる、何らかの方法を見つけることのように思えます。
今後の記事では、現在のさまざまなアラインメント研究の提案を簡単に検討し、この特定の難問に、なぜほぼ誰も取り組んでいないと感じるのか、もっと詳しく話します。要するに、いまのアプローチのほぼすべては、この問題がないと仮定するか、別のところに注意を向けている、と私は考えています。
-
さらに、どこを目指させるかも、道徳より技術の問題に見えます。もちろん、善とは何かを手作業で指定しようとしても、うまくいきません。しかし、それでかまいません。代わりに、人間が何を大切にしているか、その整合的な外挿を調べる手続きを指定できるからです。ただし、人類初のAGIに与える目標としては、それでも実現するには難しすぎるように見えます。最初のAGIは大きな時間的圧力の中で使われると予測しています。私はむしろ、最初のAGIには、危険が切迫する時期を終わらせる単純で限定された目標を与え、その後、心を正しい対象へ向けることを確実に行える手続きへ、未来の管理を譲ることを勧めます。ですから私のモデルでは、現在のアラインメント問題と難しい道徳的な問いの間には、まだ数段階の隔たりがあります。
-
ついでに言うと、AGIについて証明可能な安全性保証を得ようとするのは、ばかげていると思います。エリエゼルにならって、10億人超を殺す確率が50%未満なら「安全」と呼ぶことにも、かなり抵抗はありません。また、AGIが私たちを殺す確率は非常に高いと考えており、確率がごく小さくても、失うものが大きいから取り組むべきだという議論は、断固として退けます。
-
これは、「大規模言語モデルは、道徳的なジレンマにも、そうでない問いと同じくらいうまく答える」という結果と両立します。それを安心材料にするのは、問題の誤解です。チンパンジーはリスより、人間の合図に従い、そこから学ぶのが得意です。しかし、能力を強化されたチンパンジーが、包括適応度を理解し、純粋にその最大化のために食べられるようになったとき、同じように強化されたリスより空腹の衝動を取り除きやすい、と特に言えるわけではありません。左折前のAIは、隠れた難しさに対処しないまま、さまざまな「アラインメント」の指標でよくなり、誤った安心感を生むと私は考えています。
-
「急な左折とは何ですか。再帰的な自己改良のことですか。別の場所で、人類が滅亡する前に、再帰的自己改良が必ずしも中心的な役割を果たすとは考えない、と言っていませんでしたか」。再帰的自己改良の話ではありません。それも左折の一つの方法で、起こりえます。しかし、人間は再帰的な自己改良を行うほど自分の心を理解も制御もできないのに、ほかの動物を大きく上回っています。私が言うのは、もっと「危険になるほど汎用的な知能」に近いもの、人間にはあってチンパンジーにはないものです。
-
「待ってください。それは反証不能では。アラインメントが簡単だという証拠が出ても、難しいと信じ続けると言っていませんか」。私が主張しているのは、「GPTは道徳的な問いにも、ほかの問いと同じくらいうまく答えることを学べる」という事実は、アラインメントの難しさについて、どちらの方向にも大した証拠にならないということです。証拠が出ても無視すると言っているのではなく、反対の証拠とは見なさないものを、先に挙げています。後で得意げに見解の更新を求められたとき、この記事を参照できるように、という期待もあります。ただ、私のモデルには、いま懐疑的な人は手遅れになるまで懐疑的なままでありそうだ、という不都合な性質が、確かにあります。問題の性質について事前に警告してくれると期待する証拠の大半は、すでに見たものだからです。これは私にとって都合のよい性質などではない、と断言します。
見解を変えるかもしれないものとしては、知能についての技術的な理解が、急な左折のモデルを崩す可能性があります。また、実物を見れば分かることを期待するしかないような、はっきり捉えにくい能力の閾値を、急な左折なしで越えるのを見て、考えが変わることも想像できます。完全な超知能が左折なしで現れれば、もちろん納得しますが、それでは注意を別へ向けるには手遅れなので、それより手前のことを言っています。
-
先ほどの、やたらと細かいもののイメージしやすい例に戻りましょう。人間は、おいしい食事をそれ自体として好むのをやめ、繁殖、より正確には包括適応度の最大化に必要と分かる限りでだけ食べるように、脳を配線し直したくはなりません。そうした計算が、適応度を最大化するほかの部分を妨げないよう、心の残りを強化したとしてもです。より賢い人間は、もっと正確な信念を持ちたくてうずうずします。しかし、包括適応度と浅く相関するにすぎないものを、すべて明示的な最大化に置き換えたくてうずうずするわけではありません。少なくとも特別な対策がなければ、ほかの心も同じです。それを汎用的に賢くするものが、あなたの目標を動機にするわけではありません。