AIは、かつて科学だった。昔――AIがまだあまりうまく動かなかったころ――、人々は実際に機能する認知の理論を作ろうとしていた。
その科学者たちは成功せず、その時代は過ぎ去った。今日AIに携わり、日々の勤務時間をさまざまな仕事に振り分けている人々の大半からは、心を理解しようという大志が失われている。機械論的解釈可能性に取り組む人々や、現代のAIを実証的に理解しようとする他の人々は、将来の「人工の心の科学」で役割を果たしうる重要な礎を築いている。しかし全体として、現代のAI工学がしているのは、巨大なニューロンのネットワークを作り、膨大なデータで訓練することであって、心を理解することではない。
この分野の最前線にいる人々は、苦い教訓を深く受け止めている。この教訓は、AIの心が内部でどう問題を解いているかについて 学ぶべきことは何もない と教えるものではない。それでも、より強力なシステムを生み出す最短の道 は、そのシステムの仕組みをあまり解明しない道であり続けそうだ、と示唆している。
しかし、何らかの「人工の心の科学」がないままでは、人類が人間より賢いAIをアラインメントする見込みは、私にはかなり暗く見える。
その観点から今の地球の状況を見ると、大きな障害が三つある。
- AIを狙った方向へ向けるのに役立つ研究の大半は、おそらく、AIの能力を高めることにも役立つ。「AIの科学」は、アラインメントの解決を可能にするより、はるかに早くAIを強力にするだろう。
- 成熟したAIの科学が ない 世界で、本物の解決策と偽物を確実に見分ける官僚組織を作るのは、現実的には不可能なほど難しい。
- 根本的に、システム設計の少なくとも一部の側面では、重大な結果のかかった現実世界での最初の試みから認知理論が正しく働くことに、頼らざるをえない。
以下で、この三点を詳しく説明する。その前に、背景を少し述べよう。
背景
AIが世界全体を危険にさらすほど強力になるころには、少なくとも行動主義的な観点から見て、「結果を気にかける」ことに似た何かをするようになると、私は予想している(内部でその振る舞いを、人間がそうと認識できる形で実装しているかどうかについては、何も主張していない)。
大まかに言うと、その理由は、人々が、長い時間にわたって未来を狭い範囲――たとえば「この紙にがんの治療法が印刷されている」という範囲――へ誘導できるAIを 作ろうとしている ことにある。そして、少なくとも世界が十分に広く、予想外の事態に満ちているなら、結果を気にかけること(行動主義的な意味で)は、未来を狭い範囲へ誘導することと表裏一体なのだ。
特に対策をしなければ、AIが「気にかける」結果には、良いものは何も含まれないと私は予想している。楽しさ、愛、芸術、美、意識の灯火といったものだ。現在の人間の基準に照らして良いものもなければ、広い普遍主義的な基準に照らして良いものもない。大まかに言えば、心を育てたとき、それは、気にかけてほしいと頼んだことも、気にかけるよう訓練したことも、気にかけないからだ。代わりに、訓練信号と相関するさまざまなものを、奇妙で個別的な仕方で気にかけるようになると、私は見ている。
(人間のゲノムが包括的な遺伝的適応度に向けて自然選択されたのに、生まれた人間は「包括的な遺伝的適応度に役立つと自分がモデル化した食べ物なら何でも好む」という選好を持つようにはならなかったのと似ている。代わりに、人間が内面化したのは、「おいしい」食べ物に対する巨大で複雑な選好の集合だった。「アイスクリームは凍っていると良いが、溶けていると良くない」といった複雑さを、たっぷり含んでいる。)
これとは別に、複雑な過程の大半がなぜ動いているのかをよく見ると、その理由は魅力的で、複雑で、ちょっとぞっとするものだと、私は思っている。
官僚的な手続きは、その歯車をのぞき込んで、副社長たちの間で進行中の具体的な社内のごたごたや駆け引きを目にするまでは、よく機能していると思いやすい。コードベースも、そのコードを読み、動かしている何十年も前の応急処置や偶然を理解し始めるまでは、順調に稼働していると思いやすい。生物も、詳しく見て、眼球が逆向きに取り付けられているといったことに気づくまでは、美しい工学の傑作だと思いやすい。
そして、複雑なシステムの細部を 知ったなら おそらく自分は驚き、ぞっとするだろう、と気づいたうえで、細部を見る前から すでにあらかじめ 驚き、ぞっとすることには、一つの技術がある。[1]
1. アラインメントと能力は、おそらく絡み合っている
LLMがどう出力を計算しているかを詳しく知れば、私たちはぞっとするだろうと予想している。魅了されるなどもするだろうが。
それを動かしているあらゆる偶然や応急処置が見えてくるだろう。そしてシステムに何かの目標を達成するよう頼んだとき、私たちにとってうまくいく形で「その目標を気にかける」ことなど、まるで していない様子が、はるかに詳しく見えるだろう。そのシステムの最適化能力を、ドレクスラー型ナノ工場の設計など、技術や科学の大きな偉業を成し遂げられる水準まで拡大した場合に、私たちにとってうまくいくような形では、ということだ。
AIがどう動くかをこのように見通せるようになることは、解釈可能性研究の主な目標の一つだと思う。
そして、これらのAIがどのように機能し、どのようには機能しないのかを理解すること――たとえば、いつ、なぜ、まだ規模の拡大などによって超知能へ押し進める べきではない のかを理解すること――は、別の AIの作り方を見いだす道のりで、重要な一歩になる。規模の拡大などによって超知能にしても、暗く荒涼とした未来を生まずに 済む AIだ。
しかし、その同じ理解によって、とてつもなく混乱した内部が明らかになると、私は予測している。その混乱をほどいて、私たちが狙いを定められるAIにするための推論は、その混乱をほどいてAIの 能力を高める ことにも役立つ。もつれた混乱は、おそらく非効率で、間違いが多く、ときには自分で自分の足を引っ張っている。もつれが解ければ、単に整うだけでなく、正しい結論に達し、好機に気づくのも、より速く確実になるだろう。[2]
実際、AIがしているさまざまな間抜けなことや、アーキテクチャが自らつまずいているさまざまな点などを見抜くほうが、もっと簡単だろうと私は推測している。
つまり、このAIをアラインメントできるかもしれない道は、同時にAIの能力も大幅に高めそうなのだ。ここで言うのは、本当のアラインメントであって、最近研究所が「アラインメント」として売り込もうとしている「悪い言葉を言わなくなった」といった表面的な性質ではない。
(実際、最初の大きな能力向上は、最初の大きなアラインメントの進展よりも 先に 来ると、私は見ている。)
役立つ可能性のあるアラインメント研究の大半に、これは当てはまると思う。AIを狙った方向に向ける方法を見いだすには、AIをもっとよく理解する必要がある。そして、もっとよく理解する過程で、その能力を高める方法も見えてくる。
これが正しければ、アラインメントは常に後追いになると示唆される。人々がAIをよりよくアラインメントする方法を見いだそうとするたびに、近くの誰かが、能力に関する新しい知見をいくつか持って先へ走っていける。それを繰り返すうちに、AIは一線を越えてしまう。
だからAIアラインメントの最初の重要な課題は、順序の課題だ。私たちは文明として、狙いの定まらない超知能がでたらめな方向へ突き進む状況を生み出す 前に、どうすればAIを狙った方向へ向ける方法を見いだせるのか。「能力が実現する前に、アラインメントの仕事を片づければよい」というのは、もはや実現可能な選択肢ではないと思う。何か天才的な手腕で、この文明にしては珍しいほど見事な理論上の勝利を収めるなら、別だが。
解釈可能性はどうか。AIの方向づけが間違っている点を明らかにする前に、アーキテクチャの出来が悪い点を明らかにするだろう。
自分たちのAIにアラインメント研究を手伝わせるのはどうか。それよりずっと前に、AIは能力向上を手伝えるようになるだろう。アラインメントを手伝うことが できる ようになったとき、実際に 手伝うだろうか という問題は、言うまでもない。人類を楽しさから引き離し、包括的な遺伝的適応度だけを目指すよう方向転換させるために、人間が自発的に優生学を実践するだろうか。それと同じことだ。
他の方法についても、同様だ。
これはある意味で、「本物のAGIを手にすれば、AIアラインメントはずっと解きやすくなる」と言う人に対する、私の回答を弱めた形で述べたものだ。確かに解きやすくなる! しかし、本物のAGIを手にすれば、世界を破壊することも、はるかに、はるかに容易になる。生き延びるためには、このアラインメント問題全体を丸ごと避け、代わりにすばらしい未来への別の道を取るか――これについては後で詳しく書くかもしれない――、さもなければ、アラインメント研究によって価値あるものすべてを壊すことが劇的に簡単かつ安価になる そのさなかに、相当量のアラインメント研究を進める方法が必要になる。
しかも、それさえ、多くの人が思っているらしい以上に難しい。その理由は次のとおりだ。
2. 本物の解決策と偽物を見分けるのは難しい
すでに研究所は、「AIが悪い言葉を言わない」といった表面的な成果に「アラインメント」という言葉を使い、その意味を薄めている。中心的な議論の多くを理解しているように見える人でさえ、GPT-4が道徳的な難問に答えられることが、なぜかアラインメント問題に特に関係していて、重要な好材料なのだという印象を持っているようだ。
(道徳上の問いに説得力のある答えを返せるという能力が主に示しているのは、人間がどう答えるか、あるいは何を聞きたがるかを、AIが予測できるということだ。AIが実際に何を追求しているのか、熟考した末に何を追求するだろうか、といったことは、あまりわからない。)
一方、LLMの内部で何が「動機」に相当するのか、次トークン予測による事前学習やRLHFによるファインチューニングが、内部に実際どんな影響を与えるのか、私たちはほとんどわかっていない。内部に関するこの種の精密な科学的理解――奇妙な認知上のバグを あらかじめ 予測できるような理解――は、この分野には現在、ほぼ存在しない。ただし、多くの研究者の懸命な努力のおかげで、まったくないわけではない。
ここで、適切な時期になれば研究所がそろって立ち止まり、ゆっくり慎重に進めると決めるわけではない、という事実に地球が気づいたとしよう。[3] そして文明規模の見事な協調によって、世界の能力向上を停止したとしよう。あるいは、これらの仕組みを、アラインメントできるほど十分に理解する余地をどうにか確保しなければならない、という問題に別の方法で対処したとしよう。さらに、その同じアラインメントの知識で世界を終わらせることもできるところを、そうすること なく、この協調を達成したとしよう。すると次に、誰が、どのような条件で、先に進んでよいのかという問題が生じる。
さらに、やるべきことについて全員が同意したとしよう。これまでに開発できたAIシステムを深く、完全に理解し、関係するアルゴリズムやデータ構造などを逆算して取り出せるところまで、その仕組みを理解することだ。たとえば、訓練すればAIにできることの一部を行う小さなプログラムを、手作業で作る――それまで誰も手でコードを書く方法を知らなかったものを――といった見事な成果によって、その理解を示す。あるいは、実験による試行錯誤ではなく、奇妙な脆弱性の突き方や境界事例を あらかじめ 特定する。そのような能力をそれぞれ実証した複数のチームが、さらに規模を拡大したときAIの心がどう動くかについて、競合するモデルを持つに至るまで続けるのだ。
そのような世界なら、官僚が科学者の合意に耳を傾け、最も有望な理論はどれかを見定め、理論を試してさらに発展させるため、誰にどのような能力向上の許可を与える必要があるかを判断するのは、難しくても、おそらく解決可能な問題だろう。その許可は、これをしても破局にはならないと予測する、何らかの理論に基づくことになる。
発展途上の科学理論をそうした形で見分ける役割を、地球の官僚的な手続きに委ねるという考えに、私は乗り気ではない。しかし、それなら文明が生き延びられるかもしれない。
だが、物事がそう進もうとしているようには、私には見えない。
私たちが向かっている先では、ある人は「私のAIが悪い言葉を言うことは、こんなに少ない」と言い、別の人は「私たちの評価では、まだ人間を欺けないと出ている」と言う。その横では「私たちのAIはとても従順に振る舞っている。AIが従順でなくなると考える理由はなく、それはただの擬人化だ」と言い、また別の人は「たくさんのAIを大きな官僚組織に編成して、アラインメントの解決を手伝うよう指示すればいい」と言う。そしてさらに別の人は「どれかのAIが裏切り始めたら、その前に別のAIが知らせるように、ゲーム理論的なインセンティブを設定した」と言う。これは 別種の状況 だ。
しかも私には、特に生き延びられそうな状況には見えない。
主張や約束や勘には事欠かず、理論には乏しい、そんな曲芸場で、どのチームにどこまで先へ進むことを許すべきかを見分けてほしいと官僚に頼んでも、基本的には できない だろう。
一つには、生き延びられる答えが、そもそも候補にほとんど入っていないからだ。「内部で何が起きているのかわからないし、もっとずっと理解する必要がある。そして、単に破滅への扉を開けるのではなく、きちんと仕事を進められるような状況で、その理解をどうにか深めなければならない」といった答えだ。また一つには、先へ競争して走りたがっている人たちには、皆、金も権力も地位もあるからだ。そしてもう一つには、何の洞察や理論的理解が欠けているのかを規制当局者である 自分自身 が具体的に知らないとき、全員に「だめだ」と言い続けるべきだ、あるいは提示されているもののほとんどは根本的に不十分だ、と考えるのは、社会的に難しいからだ。
AIを再び科学にできれば、次のような状況に入り始められるかもしれない。もし 人類が間に合うように能力向上を規制できたなら、システムの能力向上の許可を求めてよいのは、そのシステムを詳細かつ完全に理解し、なぜ能力向上が必要で、なぜ破局にならないのかについて確かな根拠があるときだけだ、と規制する側も研究者も全員が理解している状況だ。その段階なら、科学の分野としてそれらの理論について何らかの合意を形成し始め、規制当局もその合意を踏まえるようになるかもしれない。
しかし、この大きな山を越えられないなら、ここでの重要なボトルネックの一つは、有望な解決策を官僚組織の側で把握し、判別できること だと、私には思える。そして、現在の環境に少しでも似た状況では、規制当局は本物の解決策と偽物を見分けられないだろう、というのが私の基本的な見立てだ。
先ほどの「アラインメントと能力は、おそらく絡み合っている」という点と合わせると、私たちの掛け声は「一時停止して、アラインメント研究の時間をもっと与えてほしい」よりも、「完全に止まり、この森を丸ごと迂回する方法を見つけよう。私たちにはこの森を抜ける備えがない」であるべきだと思う。
(予備の掛け声は「AIを再び科学にしよう」だ。ただし、繰り返すが、これがうまくいくのは、暗く荒涼としたものではなく、良いものを気にかけるAIの作り方を見いだす前に、心の科学が破局を招いてしまうことを防ぐ方法がある場合だけだ。)
3. 大半の理論は、最初の本番ではうまくいかない
以上の二つの問題を乗り越えられた としても、第三の問題が残ることは指摘しておきたい。ついに、システムの能力をもう少し高めて認知理論をさらに試す段階ではなく、AIで実際に何か重要なことをする段階が来れば、ある意味で、新しく未検証の科学理論、そして その理論に基づく工学的な実装が、最初の重大な試みで完璧に機能すると信じなければならないからだ。
特に、AIが自律的な科学・技術の開発を できる ようになり、その能力を使って地球の他のすべてに対する決定的な戦略的優位を得ることが 可能な 領域で動くようになると、訓練中のどの時点とも根本的に異なる認知のあり方で動いていることになる。
たとえるなら、ボブを国の独裁者にすることを検討している場合、まず町の仮の独裁者にして、権力を乱用しないか観察するかもしれない。しかし、どんなに工夫しても、本当の権力を手にしたとき本当に乱用するかを調べるテストとして、根本的にはさほど信頼できない。軍隊に 本当に命令できる ようになり、国民を 本当に食い物にできる ようになったら、彼はそうするだろうか。「町の人に見られている間に、仮の権力を乱用する。その人たちは、まだ自分を殴れるし、その職に就かせないこともできる」という選択肢は、「軍隊に命じて議会を威圧し、次の選挙を『監督』させる」という選択肢とは、認知上、実は大きく異なる。
さて、十分に発達した認知理論があれば、AIの心を読み、そうした選択肢があると 本当に 思ったなら、どんな認知状態に なるだろうか を予測しようとすることはできる。そして、AIが本当にこちらを裏切る選択肢を得たときに入る認知状態に非常によく似ていると、自分の認知理論が 予測する ようなシミュレーションを設定できる。内部の感覚を偽装するなどの試みも含めてだ。
しかし、実験室で誘導し観測するそうした状態と、AIが本当にこちらを裏切る選択肢を持つ実際の状態とのつながりは、その真新しい認知理論に根本的に依存している。
AIを実際に 動かし、こちらを裏切る機会を 本当に持つ ところまで進めることは、実験室とは根本的に異なる環境で、それらの理論を実証的に試すことだ。
そして、多くの科学者やプログラマーは知っている。根本的に新しい動作環境で複雑なシステムがどう動くかについての自分の理論は、最初の試みでは、あまりうまくいかないことが多い。
この点をはっきりさせるために、具体的なたとえを挙げよう。ニュートン力学は、驚くほど優れた実証的予測を数多く行った。それは、以前のどの理論も圧倒する巨大な説明力を持ち、単純で簡潔な数学理論だった。しかし、それを使って非常に遠い惑星へ相対論的な速度でペイロードを送ろうとすれば、それでもひどい目に遭う。 ニュートン力学は相対論的効果を考慮しないからだ。
(そして警告となるのは、一年のどの時期にも、どの方向にも、光が同じ速度で進むように見えること、日食の際に太陽の周囲で光が曲がること、水星の近日点がニュートン力学の予測から少しずれていること、といった、わずかな手がかりだけだ。千もの実証的な領域で予測に成功した膨大な実績に対して、小さな異常があるだけ。しかし自然はそんなことを気にかけない。それまで観測できた範囲から大きく外れるエネルギーや規模へ進めば、やはり理論は成り立たなくなる。)
科学理論を、最初の重大な試みで機能させるのは 難しい。これが、必要最小限の決定的な課題を目指す理由の一つでもある。相対論的な速度で遠距離へペイロードを送るのは無理でも、人工衛星を軌道に乗せるならニュートン力学で十分うまくいくはずだ。
現時点でこの問題を心配するのは、ある意味では贅沢だ。実験室のデータをすべて正確に予測する認知の科学理論に、私たちはまったく近づいていないのだから。しかし、成功したかどうかを官僚組織がおそらく理解できるような形で、その科学理論を築こうとどうにか協調できたなら、次に控えているのがこの障害だ。
これらの点が戦略について何を示唆すると考えているかは、後でさらに書くかもしれない。簡単に言えば、私は基本的に、アップロードなど、輝かしいトランスヒューマニズムの未来に至る別の道を、地球が追求することを勧めている。そちらも危険だらけだが、その危険のほうが乗り越えやすいと予想している。これについても、後で詳しく書きたい。
-
ただし、驚きや恐怖の程度は少し小さくなる。この未知のシステムが、単純で、優雅で、うまく設計されていると判明する事前確率は、ゼロではない からだ。↩
-
この推測の例外は、AIが自分の欠陥を修正し、アーキテクチャを自ら改良する段階に達している場合だ。その場合、原理的には、ある時点の状態を切り出して内部の仕組みを理解しても、追求している目的が望んだものではないとはわかる一方、能力向上の余地はあまり見つからないかもしれない。しかし、その状況では、すでに自己改善するAIに殺されかけている、というのが私の予測だ。↩
-
大きな理由の一つは、止まるべき時だと示す十分に明確な兆候がないことだ。たとえば「AIが自分には感覚や意識があると主張する」という地点も、私たちはあっさり通り過ぎた。そうしたAIシステムの最初の主張を疑ったことが 間違い だった、と言っているのではない。私はBingに道徳的に重要な種類の人格があったとは思わない。ただし、決して確信してはいない! 私が言っているのは、SFの物語の中では 明確な境界が、実際には ややこしいとわかり、そのため誰もがそのまま突き進み続ける、ということだ。↩