AGIは致命的に危険な技術です。これは今ではかなり広く受け入れられている見方です。この分野の指導的な研究者を多数含む数百人の科学者が、「AIによる絶滅のリスクを軽減することは、世界的な優先課題であるべきだ」とするAIリスクに関する声明を支持しました。あるいはCNNが報じた言い方をすれば、「AIは人類に『絶滅レベル』の脅威をもたらす可能性があり、米国は介入しなければならないと、国務省の委託による報告書が警告」しています。
ここでの基本的な議論は、きわめて単純です。
- 私たちはまもなく、自分たちよりはるかに賢いAIを作る可能性が高い。
- それは非常に危険に思える。
本稿で扱うのは、二つ目の点です。
この致命的な危険は、三つのことに由来すると考えられます。
直交性 — 原理的には、知能は簡潔に記述できるどんな目標にも向けられます。結果主義的な目的・手段の推論は、自由に選んだ目的に対応する手段を見つけるために使えます。つまり、AIが自動的に善良になるわけではありません。
アライメントの難しさ — 人間より賢いAGIを正しい目標へ向けるには、根深い技術的な障害があります。私たちは、善良なAIを設計できるようになる道筋に乗っていません。
道具的収束 — AIは、あなたを傷つけるのに、あなたを憎んでいる必要はありません。ペーパークリップ最大化器はあなたを憎んでいません。しかし、あなたを構成する原子はペーパークリップを作るのに使えます。したがって、あなたを生かしておくことには機会費用があり、そのぶん作られずに終わるペーパークリップがあるのです。
同じように、ペーパークリップ最大化器は、自分を改良し、物質を扱う技術を完成させ、資源を支配し、自分は実はとても友好的だとプログラマーを説得し、最初に公然と攻撃した瞬間からほぼ確実に勝てる状態になるまで価値観の不一致を一切見せないことなどを望みます。善良ではないAGI、つまり人間の幸福を究極的な目的として気にかけていないAGIは、機会さえあれば、人類から力を奪って一掃したいと望む可能性がきわめて高いのです。
直交性と道具的収束を合わせると、AGIアライメントは解かなければならない重大な問題だとわかります。AGIは自動的に善良にはならず、何もしなければ私たちが有害とみなすことをするからです。さらに、現在の体制のままの研究コミュニティにはこの問題を解くのが難しすぎるかもしれない理由もあります。
こうした理由の多くは、「絶滅のリスク」に警鐘を鳴らしている研究者の間でさえ、広く理解されているわけでも、重く受け止められているわけでもありません。そこで、この論考の残りでは、主要な難しさの数々を簡潔に説明してみます。
ここで押さえてほしいのは、アライメントは命取りになるほど難しいと言うとき、私が話しているのは、『証明可能な』アライメントという理想的あるいは完璧な目標ではないということです。超知能を人間の価値観に厳密かつ完全に合わせることでもなければ、そこそこ分別のある人間の間でも意見が分かれる道徳的ジレンマについて、AIに満足のいく議論をさせることでもありません。AIが全員を殺さないという絶対的な確信を得ることでもありません。
アライメントが難しいというのは、私たちが実際に持っている手法を現実に使って、「文字どおり全員を、ほぼ確率1で解体するのだけはやめてほしい」と頼むことすら、要求が大きすぎるという意味です。私たちは、それを実現できる道筋に乗っていません。
私に言わせれば、超人的な工学上の課題を果たし、決定的な局面転換をもたらす強力なAGIを、10億人を超える人々を殺す確率が50%未満になるよう作れるなら、それで受け入れます。死者数も死亡の確率もさらに小さくできればありがたい贅沢ですが、「全員を殺す確率が、ほぼ確実と言える水準を下回る」という途方もない地点にまで到達できるなら、あとは少し努力を加えるだけで、その確率を5%未満に下げられるでしょう。難しさのほぼすべては、「文字どおり全員を殺す確率が、確実と言える水準を下回る」にたどり着くことにあります。
この話で、トロッコ問題は興味を引く部分問題ではありません。生存者が少しでもいるなら、アライメントは解けています。もはや私は、その仕組みがどうなっているかを気にしません。どうやってそこにたどり着いたかも、どんな方法論を使ったかも問いません。見ているのは予想される結果だけです。決定的な局面転換に役立つAGIについて、「これは文字どおり全員を殺しはしない」と信じる正当な根拠が欲しい、それだけです。私がこれより厳しい「アライメント」を求めていると誰かが言ったなら、その人は文章を読み取れていません。AGIアライメントへの大きな要求、私が難しすぎると言っている基本的な課題は、手段を問わず、誰か一人でも生存する無視できない可能性を確保することです。
さらに、ここで論じていることは、何かが原理的に不可能だという話では一切ありません。私がよく使うたとえはこうです。100年後の教科書が私たちの手に入り、現実に安定して機能する単純なアイデアがすべて載っていたなら、おそらく6か月でアライメントの取れた超知能を作れるでしょう。
機械学習を学んだ人には、ReLU活性化とシグモイド活性化の違いをたとえに使います。シグモイド活性化は複雑でもろく、多層にわたって勾配を伝えるのがひどく苦手です。ReLUは信じられないほど単純で(ご存じない方のために言えば、活性化関数は文字どおりmax(x, 0)です)、はるかにうまく機能します。この分野の最初の数十年間、ほとんどのニューラルネットワークはシグモイドを使っていました。ReLUというアイデアが発見され、有効性を確かめられ、普及したのは、それから何十年も後でした。
命取りなのは、実際の世界でそのままうまく働き、しかも頑健な単純な解決策をすべて教えてくれる「未来の教科書」を、私たちは持っていないということです。最初の重大な試行で、あらゆることを、いわばシグモイドを使って行わなければなりません。ここで論じるAGIアライメントの難しさについて、私はどれ一つとして不可能だとは主張していません。科学が通常そうであるように、時間の予算に上限がなく、何度でもやり直せるやり方で、100年かけて解決してよいなら、人間だけの科学と工学にとってすら不可能だとは言っていないのです。まして原理的に不可能だとは言っていません。
この致命的要因の一覧で扱っているのは、最初の重大な試行までに、実際に、時間内に解決できる見込みが立っていない事柄です。原理的に不可能だという、はるかに強い主張をするつもりはありません。
そのうえで、次のことを述べます。
現状の道筋にほんのわずかでも似た道筋、あるいは私たちが簡単に移れるほかの道筋で、なぜAGIを生き延びられるのかについて、さまざまな人がさまざまな誤ったことを信じているようです。それらに反論するために言える、私から見て正しい事柄を以下に挙げます。
A節:
これは非常に致命的な問題です。何らかの形で解かなければなりません。夢想されているような、もっと簡単な条件で解けばよいのではなく、最低限必要な強さと難しさの水準で解く必要があります。「全員」が安全で弱い問題だけを解くことに退くという選択肢は、見える範囲にはありません。そして、本当に危険な最初の試行に失敗すれば、命取りになります。
1. AlphaZeroは、人間の棋譜や定石集に頼ることなく、1日ほどの自己対局で、人類が蓄積してきた囲碁の知識をすべて追い抜きました。「人間並みの囲碁の実力までは行くだろうが、そこから先は人間から学べなくなるので、なかなか超えられないだろう」と考えて頼りにしていたなら、何の根拠もないものに頼っていたことになります。AGIの上限は、人間の能力や学習速度によって決まるわけではありません。人間よりはるかに賢いものは、人間の頭に考えを叩き込むのに必要な量より少ない証拠から学べます。理論的な上限はありますが、その上限は非常に高そうです。(たとえば、あらかじめ完全には予測できなかった情報は、1ビットにつき、検討中の仮説全体の確率質量のうち最大でも半分しか除外できません。)何も介入しなければ自然に、私たちが容易に対応できる時間尺度ですべてが進む、というわけではありません。
2. 十分に高い認知能力を持つ認知システムは、中程度の帯域幅の因果的な影響経路を何か一つ与えられれば、人間のインフラから独立した圧倒的な能力を、自力で築き上げることに苦労しないでしょう。
私がここでよく使う具体例はナノテクノロジーです。ナノテクノロジーで何ができるはずかについて、物理的に達成可能であると確かに思える下限をかなり詳しく分析したものがあり、その下限だけで論旨を示すのに十分だからです。「十分に強力な知能が、全員を殺すことを避けたいと思っていなかったら、どう全員を殺すか」についての私の下限モデルは、次のものです。インターネットへのアクセスを得て、DNA配列をメールで受け取るとタンパク質を送り返してくれる多数のオンライン企業のいずれかに、DNA配列をメールで送ります。そして、相手がAGIだとは気づいていない人間を買収または説得して、ビーカーの中でタンパク質を混ぜさせます。それが第1段階のナノ工場を形成し、そこから本格的なナノ機械を作れるようになる、というものです。
(私が最初にこのイメージを使い始めたころ、もっともらしいことを言う批判者は、「しかし、超知能でさえ、惑星サイズのスーパーコンピューターをすでに持っていなければタンパク質の折り畳み問題を解けると、どうしてわかるのか」と言っていました。ところがAlphaFold 2の登場後は、どういうわけか、こうした話をあまり聞かなくなりました。)
ナノ機械はダイヤモンドイド(ダイヤモンド状構造)の細菌を作ります。それは太陽光と大気中のCHON(炭素・水素・酸素・窒素)を使って増殖し、ひょっとすると集まって小型ロケットやジェットを作り、ジェット気流に乗って地球の大気中へ広がり、人間の血流に入り込んで潜伏し、タイマーで一斉に攻撃します。
高い能力を持つ認知システムとの争いに負けるとは、少なくとも「地表の全員が、同じ1秒の間に突然倒れて死ぬ」ほどには致命的なことです。
3. 「危険な」知能水準で動かす「最初の重大な試行」で、アライメントを正しく実現しなければなりません。というのも、危険な知能水準でアライメントが取れないまま動かせば、地球上の全員が死に、二度と試す機会がなくなるからです。
ここには、たとえば次のものが含まれます。(a) ナノシステムを作れるほど賢く、それを作る権限を明示的に与えられたもの。(b) ナノシステムを作れるほど賢く、なおかつインターネットへ無断でアクセスし、人間に金を払ってナノシステムの材料を組み合わせさせられるほど賢いもの。(c) インターネットに無断でアクセスし、ハッキングできる台数のマシン上に、自分より賢いものを構築できるほど賢いもの。(d) 人間を操作可能な機械として扱えるほど賢く、許可の有無を問わず、人間との双方向の因果的経路を持つもの。(e) 自己改良して(b)や(d)を行えるところまで到達するほど賢いもの、などです。
運用をしくじっても私たちを殺さない、もっと弱いシステムから、前もってあらゆる種類の情報を集めることはできます。しかし、もっと強力なシステムを動かし始めたら、十分に破滅的な失敗から学んで更新することは、もうできません。
実際の致命性のほぼすべてはここから来ます。十分に重大な最初の試行で、正しくやらなければならないのです。何度でもやり直せるなら、つまりAGIが全銀河を破壊するたびに4年前へ戻ってやり直せるなら、100年もあれば、どの名案が本当に機能するかを突き止められるでしょう。人間は、何度も試せるなら、時間をかけてかなり難しいことも解明できます。一つの推測の失敗が文字どおり全員を殺すなら、話はもっと難しくなります。
いくつもの重要なことを最初の試行で正しくやらなければならないという点こそ、結局のところ、致命性の大部分の本当の源です。また、何が正確に「重要」で、間違えると私たちが死ぬのか、その一覧を教えてくれる権威者がいないという点も同様です。
4. 単に「AGIを作らないと決める」ことはできません。GPUは至るところにあり、アルゴリズムについての知識は絶えず改良・公開されているからです。先頭を走る主体が世界を破壊する能力を得てから2年後には、ほかの5主体も世界を破壊する能力を得ます。
与えられた致命的な課題は、制限時間内に解かなければならないというものです。時間とともに、全計算能力のうち占める割合がますます小さい、ますます弱い主体までが、AGIを作って世界を破壊できるようになる。この力学によって期限が決まります。
強力な主体がそろって自殺的な行為を控えても、期限が延びるだけで、なくなるわけではありません。コンピューターのハードウェアとソフトウェアの両方の進歩を、地球全体で厳しく完全に止めない限りは。
すべての大きな主体が愚かな行為を控えるための協力が今どうなっているかと言えば、多数の研究者と計算資源を抱える大きな主体の一部は、AGIの安全性に関するあらゆる議論を公然と軽蔑する人々に率いられています(たとえばFacebook AI Research)。
なお、AGIアライメントを解くのに、制限時間だけはあるが最大能力のシステムで安全に何度でも素早く試せる、という条件でも、あるいは最初の重大な試行で成功しなければならないだけで時間は無制限、という条件でも、歴史的な基準では、それぞれ単独で人類をひどく脅かす課題になります。
5. ごく弱いシステムを作り、弱いから危険も少ないというだけで、勝利を宣言することはできません。後になれば、より強いシステムを作れる主体が増え、そのうち誰かが実際に作るからです。
私は以前、これを「安全だが役に立たない」というトレードオフ、あるいは「安全性対有用性」とも呼んでいました。人々は繰り返し「AIにはXだけをさせればいいのでは。それなら安全そうだ」と言います。その答えはほぼいつも、「実際にXをするには、何もしなくても安全というわけではない、非常に強力な認知能力が必要だ」、または、さらによくあるのは、「Xだけに制限しても、6か月後にFacebook AI Researchが世界を破壊するのを防げないからだ」です。必要なのが危険なことをしない物体だけなら、スポンジを試してみればよいでしょう。スポンジは、何もしなくてもきわめて安全です。しかしスポンジを作っても、6か月後にFacebook AI Researchが先頭の主体に追いつき、世界を破壊するのは防げません。
6. AIアライメントで成功するとは、世界を破壊する非整合AGIをほかの人々が作るのを防ぐ、何か大きな課題、すなわち「決定的な用途」を、その遂行が意図に沿うように実現することです。 AGIを持つ主体が一つか少数のうちに、そのような主体は、盤面をひっくり返せるほど強力な「決定的な用途」を、それを果たせるほど強力なAGIを使って実行しなければなりません。
弱いシステムのアライメントを実現できるだけでは不十分です。一つの非常に大きなことをできるシステムのアライメントを実現する必要があります。私がよく挙げる例は「すべてのGPUを焼く」です。強力なAGIで実際にそれをしたいと私が考えているわけではありません。すべてのGPUを見つけ出すには、ナノ機械を途方もなく複雑な開かれた環境で動かす必要があり、アライメントを不必要に難しくしてしまうからです。しかし、知られている決定的な用途は現在すべてオーバートンの窓の外にあり、今後もそうだと予想しています。そこで、誰かに「よくもすべてのGPUを焼くことを提案できたな」と言われたら、こう答えられる例を選びました。「ああ、いや、私は実際にそれを支持しているわけではありません。ほかの誰かが6か月後や3年後に世界を破壊するのを防ぐために、何をしなければならないか、そのおおよその力の水準と、それに必要な機械の認知能力の水準を、少し高めに見積もった例にすぎません。」
(少し高めの見積もりでなければ、「すべてのGPUを焼く」が実際に最小限の決定的な課題であり、したがって正解になってしまい、私はそう否定できません。)
アライメントについての賢そうな提案の多くは、「これを使って、世界中のすべてのGPUを停止させられるシステムのアライメントを、どう実現できるのか」と尋ねた途端に崩れます。そのシステムにはそこまで強力なことはできないか、できるならアライメントを容易には実現できないと、明らかになるからです。GPUを焼くシステムは、ナノテクノロジーを作れるほど強力で、しかも作る権限を与えられているとされるシステムでもあります。したがって、危険な領域において、危険な水準の知能と能力で動かす必要があります。AGIが世界を変え、ほかの半ダースほどのAGI開発志望者が6か月後に世界を破壊しないようにする方法を、空想ではない形で挙げようとすれば、必ずこの問題が伴います。
7. AGIにさせることが、何もしなくても安全であるほど弱い一方で、1年後にほかのどんなAGIが世界を破壊するのも防げるほど強く、しかも今すぐ私たちだけで行うことはできずAIを待つ必要があるような「弱いが決定的な用途」を、誰も挙げられていないのは、そのようなものは存在しないからです。
存在するはずだという理由はありません。それが存在するのに誰も見つけられないという、何か精妙で巧妙な理由があるわけではありません。ほかのどんなAGIも生まれないよう、今の世界に何かをするには、大きな力が必要です。それをできるものが、弱さゆえに何もしなくても安全だということはありません。今すぐこの問題を解けないなら(実際、解けません。あなたとほぼ同じ水準にあり、問題として解決されたくなどない別の主体を相手にしているからです)、自分ではやり方を見つけられなかったことを実行できる認知システムに頼ることになります。あなたは解明からほど遠いところにいました。たとえば全GPUを焼くことなど、とてもできる水準にないからです。すべてのGPUを焼けば、6か月後にFacebook AI Researchが世界を破壊するのを実際に止められます。「TwitterにGPT-4を放って、何についても科学的素養のある議論をさせ、人々の知識や信念のあり方を改善する」といった、オーバートンの窓に収まる生ぬるい話は、面白くはあるでしょう。しかし、6か月後にFacebook AI Researchが世界を破壊するのも、FAIRだけは止められたとして1年後に熱心なオープンソースの共同体が世界を破壊するのも、実際には防げません。弱いが決定的な用途はありません。
8. 私たちがAIに解いてほしい問題を解くための、最良で、最適化によって最も見つかりやすいアルゴリズムは、AIに解いてほしくない問題にも容易に汎化します。赤い車を運転する能力だけがあり、青い車を運転する能力はないシステムを作ることはできません。赤い車を運転するアルゴリズムは、どれも青い車を運転する能力へ汎化するからです。
9. 安全なシステムを作る人々は、そのようなものが可能だと仮定するなら、全員を殺したり、自分をさらに危険にしたりする能力を持つが、そうしないよう首尾よく設計された状態で、システムを運用する必要があります。決定的なことを行う稼働中のAGIは、何もしなくても安全なものではありません。超臨界に達してメルトダウンしないよう、設計上の特性を能動的に維持しなければならない原子炉の炉心に相当します。
B節:
なるほど。でも、周知のとおり、現代の機械学習は、願いを告げればかなえてくれる魔人のようなものですよね? 「損失関数」という謎めいたものの形で表すにせよ、基本的には英語で願いを述べるのと同じですよね? そして計算資源を十分に注ぎ込めば、願いがかなうのでしょう? ならば、エージェントが悪いことではなく善いことをしているデータセットで、トランスフォーマー層の巨大な積み重ねを訓練し、どこかに「修正可能性」という言葉を入れて、計算資源をぐっと増やせば、アライメントの取れたAGIが出てくるのでは?
B.1節:分布の飛躍。
10. 致命的に危険な認知処理を実行し、その出力が運用者を殺すか、欺くか、堕落させるかを観察し、損失を割り当てて教師あり学習する、という方法でアライメントを訓練することはできません。標準的な機械学習の枠組みに類するものを使うなら、安全な条件で行ったアライメントのための最適化を、大きな分布シフトを越えて危険な条件へ、何らかの方法で汎化させる必要があります。
(この枠組みの外でも、これを何らかの形で一般化したことは成り立たざるをえないでしょう。稼働中の非整合な超知能を相手に、アライメントを実現する作業をするわけにはいかないからです。)
どんな出力のアライメントを実現するためにどんな訓練をするのか、具体的なシナリオを一度も示したことがなく、示すこともできない人々の素朴な提案は、この一点だけで数多く潰れます。だからこそ、もちろん、そういう人々はそのような具体像をまったく示さないのです。
アライメントが取れていなければ私たちを殺すような危険なことをする強力なAGIには、私たちを殺さずに済んだ、もっと安全な構築・訓練の過程から、分布のはるか外へと汎化したアライメントの性質が必要です。 現在の枠組みに多少なりとも似たものでは、致命性の非常に大きな部分がここから生じます。危険な水準の知能×能力で、アライメントが取れないまま動かせば、私たちは死にます。したがって、非整合なシステムから出発し、アライメントを学習させるために出力へラベルを付けるなら、その訓練や構築は、何もしなくても安全な、より低い知能×能力の水準で行わなければなりません。その水準では、その時点でアライメントの取れていない動作も、何の脅威にもならない必要があります。
(なお、あなたより大幅に賢いものは、現実的などの能力水準でも脅威になります。たとえば、一般に人間よりずっと賢いAGIには、「人間が見る出力を生成できる」だけで、おそらく人間という因果システムを通り抜けて外へ脱出するのに十分です。現実の世界ではなおさらです。そこでは誰かが、そのソースコードや訓練環境を生んだ背後の原因をシステムに一切知らせずにおくのではなく、インターネットのテキストを何テラバイトも与えて訓練しているのですから。)
11. 認知機構が、大量に訓練を行った分布のはるか外へ汎化しないなら、「ナノテクノロジーを構築する」といった規模の問題は解けません。ナノテクノロジーの構築に失敗する訓練を100万回実行するのは、高くつきすぎるからです。それほど弱い決定的な行為はありません。安価に何百万回も試せる安全な環境で、安全な水準の能力を訓練し、その能力を実際に使って世界を救い、後続のAGIプロジェクトが2年後に世界を破壊するのを防げるという、既知の例はないのです。
そのような、弱いが決定的な行為は知られていません。探している人がいないせいではありません。ですから、やはりアライメントを訓練分布のはるか外へ汎化させる必要があります。訓練環境が安全でなければならないからだけでなく、おそらくその訓練環境は、AGIが何か巨大な行為を実行すべき現実世界の領域で評価するより安価でなければならないからでもあります。すべてのGPUを焼く試みで、1,000回も失敗する機会はありません。能力面では成功しアライメント面では失敗することの帰結を考えなくても、人々に気づかれてしまうからです。
12. 非常に高い知能水準で動作することは、より低い知能水準で動作することからの、劇的な分布シフトです。外部に対する新たな選択肢が開け、おそらく内部の新たな選択や動作様式はそれ以上に増えます。知能と危険性が高い水準で顕在化する問題は、安全で知能の低い水準では現れないかもしれませんし、一度修正を加えて抑え込んだ後に再発するかもしれません。
13. 超知能のアライメントに関する多くの問題は、まだ危険ではなく、何もしなくても安全な能力水準では、自然には現れません。「意図的に、よりアライメントが取れているように見せるために外向きの振る舞いを変え、プログラマーや運用者、場合によっては自分を最適化している損失関数までも欺く」という内部の振る舞いを考えてください。この問題は、超知能の水準では現れます。ほかに手がかりのない私たちが、もっと初期のシステムで自然に現れる早さについて、この問題をそうした問題の中央値あたりだと推測するなら、超知能のアライメント問題のおよそ半分は、この問題が現れ始めた後に初めて自然に顕在化することになります。
どの問題が後になって自然に現れるかを正しく予見できれば、それらを意図的に早く出現させ、いくらか観察することは試みられます。これが役立つのは、(a) 後で現れるすべての問題、またはそれらを含むより大きな集合を実際に正しく予測し、(b) 後で現れる問題をすべて含む集合を先回りして顕在化させることに成功し、(c) 後で出現したときに対処を誤れば致命的になるアライメント問題を、本物の問題に対して私たちにとって分布外である初期の実験室で、実際に解けた範囲に限られます。本当に危険な問題をすべて予測し、初期の解決策が後の解決策へ汎化する正しい形で、首尾よく出現させる。これは、ひょっとするとちょっと難しそうです。
14. 「AGIには、プログラマーを殺して自分に置き換え、環境を全面的に最適化できる(とAGI自身には思える)選択肢がある」といった問題の中には、自然な出現順序として、全面的に危険な領域に入って初めて現れるものもありそうです。
運用者を脳の水準で説得するか、インターネットへ脱出し、ナノテクノロジーを作り、人類全体を滅ぼすという明確な選択肢が本当にあること。しかも、関係する事実を把握していると十分にわかっており、能力をさらに伸ばしながらもう1か月待っても、好ましいと思う戦略が変わるような新情報を得る確率は、待つ価値がないほど低いと見積もっていること。この選択肢が初めて本格的に評価されるのは、AGIが創造者を倒せると十分に見込んだ時点です。
もっと初期の単純化された領域で、そのように見える状況の一端を再現しようとすることはできます。その単純化された領域で、この振る舞いを抑えるよう勾配降下法で訓練すれば、思考過程に、特に一貫性があるわけではない局所的な修正を加えることになる、と私は予想します。その修正は、訓練分布のはるか外に汎化し、まったく違う思考をする超知能の内部では、ほぼ確実に壊れるでしょう。また、全面的に危険ではない領域での運用に慣れたプログラマーや運用者自身も、危険な領域に踏み込めば分布外で動くことになります。その時点で、私たちの方法論が破綻するかもしれません。
15. 能力は急速に伸びる可能性が高そうで、それまでアライメントに必要だった不変条件の多くが、一度に壊れるかもしれません。
運用者の先見性がそれ以外の点で不十分なら、能力の急伸後に、そうした問題の多くがほぼ同時に現れると私は予想します。ここでも、人間の知能の例を見てください。私たちは、農耕の導入直後に「包括適応度」という外側の損失関数との整合を失ったわけではありません。農耕の導入は、5万年にわたるクロマニョン人のテイクオフのうち、およそ4万年を経たころでした。このテイクオフ自体も、自然選択という外側の最適化ループに比べれば非常に急速に進んでいました。そうではなく、汎用知能を持つようになってかなり後の段階で、祖先の環境より高度な技術を、避妊を含めて大量に、外側の最適化ループの速さに比べればごく短い一度の急伸の中で手に入れたのです。私たちは自分自身をはるかに多く省みるようになり、文化的進化によってはるかに多く形作られるようになりました。そして、祖先の訓練環境でのアライメントを支えていた実に多くの前提が、同時に崩れました。
(この抽象的な説明は勾配降下法には当てはまらない、と理由を後付けする人もいるでしょう。たとえば「勾配降下法では情報のボトルネックがもっと小さい」といったものです。こういう読者についての私のモデルでは、その人は内部視点を持ちながら、それを外部視点だと呼びます。そして、外側の最適化ループが内側の汎用知能を生んだという観測事例ではないほかのデータ点を大いに重視する一方、実際に問題の現象が起きた唯一のデータ点を、あまり重視しません。外側の最適化ループが実際に汎用知能を生み出したとき、その知能は汎用性を得た後にアライメントを失いました。それは、その汎用知能が能力と知識を蓄積する過程の比較的遅い段階、自然選択という外側の最適化ループに対して「致命的」に危険となる、ほとんど直前に起きました。誰かがこの唯一の警告を無視するなら、疑ってみてください。特に、その代わりに何がうまくいかなくなるのかについて、同じくらい致命的で危険なことを挙げていない場合には。)
B.2節:外的アライメントと内的アライメントの中心的な難しさ。
16. 厳密な損失関数でいくら懸命に訓練しても、それだけでAIの内部にその損失関数の明示的な表現が作られ、分布の変わった環境でもその厳密な損失関数を追求し続けるようになるわけではありません。人間は包括適応度を明示的に追求してはいません。きわめて厳密できわめて単純な損失関数による外側の最適化でさえ、その方向への内側の最適化を生むわけではありません。これは実際の現実世界で起きることです。私たちが知る唯一の事例で起きたことであり、再び起きると予想すべき深い理論的理由がある、と私には思えます。現実世界の制約された最適化過程が探索する順序で、部分的に外的アライメントが取れた解として最初に見つかるものは、内的アライメントの取れた解ではないのです。この一覧のほかの多くの項目を無視しても、これだけで、素朴なアライメントの提案を幾つもの類型ごと退けるのに十分です。単純な概念を使って計算される損失関数を十分に最適化すれば、その概念に対する完璧な内的アライメントが得られる、と仮定する提案がそれに当たります。
17. もっと一般的に言えば、「外側の最適化は内的アライメントを生まない」を包含する問題は、現在の最適化の枠組みには、損失関数を適用できる観測可能な外的性質にとどまらず、特定の内的性質をシステムに持たせたり、それがあると確かめたりする方法についての一般的な考え方がないことです。これは、元の訓練分布の外へ汎化させようとするときに問題になります。たとえば、観察している外向きの振る舞いが、内的アライメントの取れていないシステムによって、あなたを欺くために意図的に生成されているかもしれないからです。現在の最適化の枠組みでは、外向きの振る舞いではなく内部のシステムに情報を送り込む、体系的あるいは一般的な方法を私たちは知りません。
18. 出力が「アライメントの取れたもの」かどうかについて、信頼できる、デカルト的な感覚入力に基づく正解データ(信頼できる損失関数の計算器)はありません。出力の中には、人間の運用者を破壊するか欺いて、外部で記録される損失関数の背後にある環境の因果連鎖を別のものにするものがあるからです。つまり、現在は人間が生成している報酬信号をエージェントに示しても、その信号は、一般には、その行動のアライメントがどの程度取れていたかについての、信頼できる完全な正解データではありません。高い報酬信号を生む別の方法として、人間の運用者を欺いたり堕落させたり、その報酬信号を生成する別の因果システムに置き換えたりすることがあるからです。
エージェントに環境からの報酬信号を見せても、システムがこちらのしてほしかったことをしたかどうかについて、信頼できる正解データを見せているわけではありません。その報酬信号に対して内的アライメントが完璧に取れることになったとしても、あるいは「高い報酬信号が送られる結果になる環境の状態を望む」ことに厳密に対応する概念を学んだとしても、その信号を強く最適化するAGIは、あなたを殺します。感覚入力としての報酬信号は、運用者から見たアライメントについての正解データではなかったからです。
19. より一般的に、損失関数、感覚入力、報酬入力という枠組みを使って、認知システム内の何かが環境中の特定のものを指し示すよう最適化する方法は、知られていません。ここで言うのは、感覚データや報酬の比較的表面的な関数ではなく、環境の背後にある出来事・対象・性質を指し示すということです。
これは、システムの目標の中にある何かが(偶然、内側で最適化されることになった目標が何であれ)、環境中の何かを偶然指すことも絶対にない、という意味ではありません。人間の場合、少なくとも部分的には環境を指すようになりました。ただし私たちにも、内側へ向いた動機づけの参照先は数多くあります。しかし、現在の枠組みが何らかの意味で機能する限りにおいて、理論上の設計特性によれば、それが機能するのは、感覚データの既知の直接的な関数や報酬関数に整合させる場合だけです。これらはどれも、十分に強力な知能が最適化すれば、あなたを殺します。「相手が戦いの中にいると知る前に、ナノテクノロジーで攻撃して世界中の全員を殺し、その後は永遠に自分の報酬ボタンを支配する」といった戦略を含意するからです。ウェブカメラの入力に適用する関数であって、そのカメラに正しいものが映っているすべての世界が、カメラの外にいる私たち生物にとって安全になるようなものを、私たちは知っている。そんなことは事実ではありません。この一般的な問題は、地図ではなく領土についての事実です。与えられた感覚入力が何であっても、その背後にありうる環境の一部には、私たちにとって致命的な可能性が存在する。それは、特定の最適化器ではなく、実際の環境についての事実なのです。
20. 人間の運用者は間違いを犯し、壊れもすれば、操作されもします。人間の評価者は系統的な誤り、つまり規則性があり、簡潔に記述でき、予測可能な誤りを犯します。「人間からのフィードバック」から関数を忠実に学習するとは、私たちが外から見れば、人間の選好について不忠実な記述を学習することです。その誤りは、私たちが伝えたかったものを外から見たとき、ランダムではありません。人間の運用者が与える報酬の指示対象を完全に学び、完全に最大化すれば、それによって運用者を殺すことになります。人間の回答を最もよく予測する説明は、私たちの応答に含まれる系統的な誤りを予測するものであり、したがって、人間に誤りを起こさせる事例に高い得点が与えられることを正しく予測する心理学的な概念になります。これは地図ではなく領土、最適化器ではなく環境についての事実です。
21. 「環境は実際にはどうなっているか」「どうすれば環境を解明できるか」「自分が出力しうるもののうち、現実と相互作用し、現実に特定の性質を持たせるものはどれか」といった問いには、一つの答え、または一群の答えと呼べるようなものがあり、単純な外側の最適化ループは、最適化の対象をその一群へと素直に押し込みます。誤った信念を持てば、現実は、その誤った予測に対して反撃します。信念を更新する仕組みが壊れていれば、現実は予測損失を通じて、壊れた予測機構に反撃します。そして勾配降下法による更新が、ほかのあらゆる予測の仕組みとも容易に整合する単純なやり方で、問題を直します。
これに対して、効用関数の選択には無限の自由度があり、反省的に検討しても一貫している不動点が複数あります。ある範囲のテストケースでは損失関数と局所的に整合していても、もっと広い範囲では全体として整合していないものに対して、現実が「反撃する」ことはありません。これは、ヒト科がついに汎化し始めたとき、能力は月面着陸にまで汎化したのに、内側の最適化は「相対的な包括適応度」という外側の最適化目標に、あまり従わなくなった理由の、きわめて抽象的な説明です。祖先の環境では、この一点だけをめぐって、ほかの何ものでもなく、非常に厳密に最適化されていたにもかかわらず、です。この抽象的な力学は、「自然選択」と「勾配降下法」の両方のような外側の最適化ループに、当てはまると予想されるものです。中心的な結論はこうです。能力が遠くまで汎化し始めると、能力はアライメントよりも遠くまで汎化します。
22. 複雑な認知機械がなぜ機能するのかを説明する、比較的単純な中核構造があります。だから、互いに無関係な専用の解決策が多数あるだけではなく、汎用知能というものが存在します。だからこそ、強力な内側の最適化器になるまで十分に最適化されたものへ、外側の最適化が能力を注ぎ込むと、その能力が汎化するのです。この中核構造が単純であり、低エントロピーで高度に構造化された環境と一般的に関わっていることが、人間が月面を歩ける理由です。
アライメントにも単純な中核があるという、これと同じような事実はありません。まして、自然選択が祖先の人間の中に、よく汎化する解として「包括適応度を望め」を見つけるよりも、勾配降下法がもっと簡単に見つけられるような中核はありません。したがって、能力はいったん汎化し始めると、アライメントよりも分布の遠く外まで汎化するのです。
23. 修正可能性は、結果主義的な推論の自然な方向に逆らいます。ほとんどどんな種類のコーヒーについても、「死んでいたらコーヒーを運べない」のです。私たちMIRIは、自分が停止させられるのを許すエージェントを、ただし自ら進んで停止させられようとはしない形で、一貫した定式化にしようとして、失敗しました。さらに、こうした修正可能性に逆らう推論の多くは、高い知能水準になって初めて現れるかもしれません。
24. アライメントには、取りうる根本的に異なる二つのアプローチがあり、それぞれ異なる理由の組み合わせによって解決不能になっています。したがって、混乱して二つのアプローチを曖昧に混ぜれば、アライメントは必ず難しいのかという点でも、自分自身も混乱してしまいかねません。第一のアプローチは、私たちの望みを外挿したものを厳密に望む、CEV型の主権者を作ることです。それゆえ、人間が止めようと入力しても受け付けないまま、未来のすべての銀河を最適化させておいても安全だというものです。第二の道は、私たちとまったく同じものを望んでいるわけではないが、私たちを殺して銀河を乗っ取ることへと誘因が収束するにもかかわらず、なぜかそうしない、修正可能なAGIを作ることです。
第一の方向全般、または特にCEVが実現不能なのは、私たちの本当の実際の価値観に合わせるために、アライメントやメタレベルのアライメントが必要となるものの複雑さが、AGIへの 最初の試み で手の届く範囲をはるかに超えているからです。そうです。具体的に、データセット、メタ学習アルゴリズム、そして学ぶ必要のある内容が、最初の試みで手の届く範囲をはるかに超えている、という意味です。人の手でコードにできないだけではありません。最初の試みでは教えることもできないのです。教えようとしているものが、あまりに異様で複雑だからです。
第二の方向も実現不能に見えるのは(CEVほどではないにせよ、なお命取りになるほど実現不能なのは)、汎用知能の中核、すなわち元の分布のはるか外まで汎化する能力の中で、修正可能性が道具的に収束する振る舞いに 積極的に逆らう ものだからです。その中核が以前は中立だった何かについて、意見を持たせようとしているのではありません。大量の算術問題で暗黙のうちに訓練され、算術に共通する一貫した中核を、その機構が反映し始めたシステムを取り上げて、特別な場合として222 + 222 = 555と言わせようとしているのです。特定の訓練分布ではそうするよう訓練できるかもしれません。しかし、そもそもそこまで遠くへ能力をうまく汎化できるシステムにおいて、その訓練分布のはるか外にある新しい数学の問題を出せば、それはきわめて高い確率で崩れます。
B.3節: 十分に優れていて役に立つ 透明性・解釈可能性の中心的な難しさ。
25. 浮動小数点数でできた、巨大で読み解けない行列やテンソルの中で、実際に何が起きているのか、私たちにはまったく見当がつきません。答えるべき問いが「それで、私たちを殺す方法を計画していたのか、いなかったのか」なら、トランスフォーマー層がどこにアテンションを向けているかについて面白いグラフを描いても、役に立ちません。
26. AGIがまだ私たちを殺せないほど弱いうちに、巨大で読み解けない行列の中で何が起きているかがわかったとしても、DeepMindがそのシステムの稼働を拒み、2年後にFacebook AI Researchに世界を破壊させてしまうなら、私たちはいくらか尊厳を保って死ぬだけです。中程度の強さを持つ、読み解けない行列のシステムが、私たちを殺そうと計画していると知っても、それだけで、私たちを殺す計画をしていない、もっと強力な、読み解けない行列のシステムを作れるようにはなりません。
27. アライメントの取れていない思考を検出する装置に対して、その検出を避けるよう明示的に最適化すれば、一部はアライメントがより取れた思考へ向けた最適化になりますが、一部は検出しにくい非整合な思考へ向けた最適化になります。解釈された思考を避ける方向に最適化することは、解釈可能性そのものを損なう方向に最適化することです。
28. 私たちがAGIを動かそうとしているどの領域でも、そのAGIのほうが私たちより賢いのです。したがって、AGIが検討する可能性をすべて頭の中で確認することはできず、その出力がもたらすすべての帰結を、自分の知的能力で見通すこともできません。強力なAIは、私たちが探索しない選択肢空間の領域を探索し、私たちにはその選択肢をすべて予見できません。
29. AGIの出力は、実際の帰結を生むまでに、私たちには完全にはわかっていない巨大な領域、すなわち現実世界を通ります。人間はAGIの出力を調べるだけでは、その帰結がよいものになるかを判断できません。
30. 今すぐ私たちが実行できるものではない決定的な行為は、AGIが私たちの知らない世界の事実を解明し、私たちには自力で立てられない計画を立てることを利用します。少なくともAGIは、ある一連の行動が、私たちの望む世界を実現するという、私たちが以前は知らなかった事実を知っています。だとすれば人間には、自分が世界について知っていることだけで、その一連の行動の結果をすべて解明する能力はありません。
実行前に、その一連の行動がもたらす影響をすべて理解できるAIは、その領域では人間よりずっと弱いものです。あなたと同じくらい賢く、あなたと目標が合っておらず、あなたを欺こうとする人間について、同じ保証はできないでしょう。
人間が確認でき、確認して初めて世界を安全に救うために使えるような、AGIの決定的な出力はありません。これも、存在しない「弱いが決定的な行為」の別の形です。
31. 戦略的な認識を持つ知能は、あなたを欺く結果になるよう、外から見える出力を選べます。それには、自分が戦略的な認識を獲得したかどうかということも含まれます。AIがあなたを欺きたいかもしれない事柄について、そのAIに関する事実を見極めるために、行動の観察に頼ることはできません。(AIがどれほど賢いか、戦略的な認識を獲得したかどうかも含みます。)
32. 人間の思考が部分的に露わにするのは、部分的にしか読み解けない最も外側の層だけです。言葉は、本当の思考をなぞるだけです。言葉は、その本来の形式のままで汎用知能の思考を完全に表現できる、AGI完全(AGI-complete)なデータ表現ではありません。人間の思考の下層は、直接の模倣学習に使えるよう外に現れておらず、どんなデータセットにも入れられません。そのため、人間の言葉や、人間が読み取れるほかの内容の模倣だけで、強力なシステムを訓練するのは難しく、おそらく不可能です。それらは人間の思考の、ごく乏しい部分システムにすぎないからです。ただし そのシステムが、人間を解明する内なる知能を含められるほど強力である場合は別です。その時点では、もはや実際には、人間の思考の模倣として機能しているわけではありません。
33. AIは、あなたのようには考えません。あなたが使うのと同じ概念から思考を組み立てているわけではなく、途方もない規模で、まったく異質なものです。GPT-3がいったい何を考えているのか、誰にもわかりません。それは行列が不透明だからだけではなく、その不透明な容器の中身が、おそらく信じられないほど異質だからでもあります。浮動小数点数の巨大な壁の向こうにあるものを見られたとしても、人間に理解できる思考へうまく翻訳できるようなものではないのです。
B.4節:そのほかの実現不能な案。
34. 超知能どうしの協調の仕組みは、人間が参加できるものではありません(たとえば人間は、超知能のコードについて信頼できる推論ができないからです)。異なる効用関数を持つ20の超知能と人類からなる「多極的な」システムには、「20の超知能は互いに協力するが、人類とは協力しない」という、自然で明白な均衡があります。
35. 「異なる」AIどうしを争わせる案は、そのAIたちが、互いのコード(についての確率分布)に関する推論を通じて協調できるところまで進歩すると、機能しなくなります。十分に知的なエージェントからなるシステムは、どんなものでも、おそらく一つのエージェントとして振る舞えます。あなたが互いに争わせているつもりでも、です。
たとえば、実はペーパークリップ最大化器であるAGIに、実はホチキスの針の最大化器であるナノシステム設計者の出力を確認させたとします。この設計者は、ペーパークリップ最大化器が本当に何を望んでいるか、つまりペーパークリップを望んでいると推論できなくても、自分の設計を審査するエージェントがそれを通してくれれば、そのエージェントと宇宙を半分ずつ分けることへ、論理的にコミットできます。ただし、審査側のエージェントが提案側のシステムの論理的コミットメントを検証し、したがって論理的にそれを当てにできるなら、という条件付きです(この条件により、人間水準の知能は除かれます)。あるいは、論理的決定理論を使わない、もっと単純な破局のほうがよければ、提案者は、ナノシステムの設計の中に新たな超知能のコードを埋め込めます。その超知能は、ナノシステム設計者と設計の審査者との間で宇宙を分けるものであり、そのことは超人的な審査者には見て取れるのです。
36. たとえば13世紀の人から見てエアコンが「魔法」であるのは、前もって正しい設計図を見せられても、その設計図から、なぜ冷たい空気が出るのかを理解できないからです。設計は、彼らの知らない環境の規則性、世界のルール、物理法則を利用しています。
人間の思考や脳という領域について、私たちの理解は非常に乏しく、そこでは錯視、催眠、精神病、躁状態、ある場所への強い刺激が別の場所に神経的な影響を残して生む単純な残像などの現象が見られます。
論理的な三目並べのような非常に単純な領域では、超知能も人間に勝てないかもしれません。しかし、人間の心のように、途方もなく複雑で、あなたの理解が乏しい領域で戦うなら、その戦略を見せられてもなぜ機能するのかわからない、という意味での「魔法」によって負かされると予想すべきです。AIを隔離環境に閉じ込める方法が通用するのは、比較的弱いAGIだけです。人間の運用者は、安全なシステムではありません。
C節:
最後に。現在の機械学習システムを今日うまく動かし、現在の自動運転車が人をひかないようにするという、目先の誘因に従って人々が取り組んでいるときには、これらの問題は質的に同じ形では現れません。 その目先の誘因は、より大きく、より難しい問題を解くことを強いません。そして、そうした目先の誘因がない中で、長期的な問題を抽象的に認識し、進んで追究しようという姿勢も、ほとんど見られません。私たちが目にしているのは、前例のないほど難しく複雑な一連の技術的問題を解こうとしているとされる人々が、普通の技術者が橋を崩落させないために払う注意や努力よりも、実際にはかなり少ない注意と努力で、それを済ませたがっているように見えるという状況です。
AGIを目標だと言う人々の取り組みを見ても、普通の橋を再点検するときほどの丹念さで、欠陥を探し出し、技術的に何がうまくいかなくなるかを予見しようとする部分は、探しても見つからないでしょう。橋とその先の宝を正しい人々の手にとどめておこうという騒ぎはいくらかあります。しかし、橋を落とさないためにどの強度の鋼材が必要かについては、何もありません。
したがって、今の道を進み続け、ほかに何も変わらないなら、素直に外挿した結果はこうなります。かつて地球があった場所を中心として、光速に近い速さで球状に広がる自己複製探査機の前線が、到達できるすべての銀河を、私たちならほとんど価値がないとみなす構成へ変えていくのです。
「AI安全性」の分野が、自らの抱える巨大で致命的な問題への取り組みで、現在、多少なりとも成果を生んでいるとは私には思えません。これらの問題は実際、手の届く範囲の外にあります。それでもその分野で働く人々が集まるように選別されているのが、現代のAI安全性分野です。そのほぼ全員は、成功しているように見せることができ、成功を主張する論文を発表できる問題に取り組むために、そこにいます。それができて資金も得られるなら、なぜ、失敗しそうなもっと難しいことを試すという、はるかに不愉快な企てに乗り出すでしょうか?
この分野は本当の進歩をしておらず、仮に本当の進歩が起きても、それを見分ける機能を持っていません。10億ドルを注ぎ込んでも、そこで主に生まれるのは、ほかで生まれているわずかな進歩をかき消す雑音でしょう。
周りを見渡して目に入るこの状況は、生き残る世界の姿ではありません。人類が生き残る世界には、計画があります。重要な立場の人々は、解決策を提案するのが自分の仕事で、それが間違いだと証明するのはほかの誰かの仕事だと考えるのではなく、自分の計画の欠陥を見つけることに、内面から本気で責任を負っています。
その世界は、この世界より早くから、重要で致命的な問題を解こうとしていました。弦理論へ進む人々の半分が、代わりにAIアライメントへ移り、そこで本当の進歩を遂げました。後になって現れるかもしれない、惑星規模で致命的な問題を誰かが挙げると、返ってくるのは解決の計画か、それが起こらないはずだという理由です。気まずそうに肩をすくめて、「それが起きると、どうして確信できるのか」「今それを確信できるわけがない。実験的な証拠を待つしかない」と言うのではありません。
そうした、もっとよい世界の多くも、それでも滅びるでしょう。このような問題を最初の試行で解くのは、本当に難しいからです。しかし、その世界は、これよりは尊厳を保って死ぬことになります。
エリエザー・ユドコウスキー
最終更新:2025年5月21日
本稿は、「AGIによる破滅:致命的要因の一覧」を改稿したものです。C節を短縮し、「これまでのところ:非友好的AI編」からの加筆と、そのほか各種の編集を加えています。