この記事の状態:曖昧です、すみません。私にはほとんど同語反復のように思える話なのですが、「LLMはあまり何かを欲しがらないことが分かった。『エージェント』が現れると思っていた人たちは、いつ考えを改めるのか?」と言って回っている人たちへの正しい答えでもあるように思えるので、書いてみます。
さて、いまのAIは、ある種の……そうですね、「長い時間軸の」課題があまり得意ではありませんよね。たとえば、前例のない大規模な工学プロジェクトや、伏線をたくさん張った長編シリーズの執筆などです。
(もっとも、チェスはかなり上手にできますし、チェスの時間軸はほかの一部の課題より長いのですが。この違いは質ではなく量の違いで、その差も縮まってきています、などなど。)
それから、AIには「欲求」や「願望」に似た振る舞いが、それほど多く見られないことも、ご存じでしょう。
(ただし、たとえばチェスはかなり上手にできます。これは、行動主義的な意味で、ある種の「望む」ような振る舞いがあることを示しています。あなたがどんな手を指してもAIが勝てるというのは、AIが盤面を、あなたがチェックメイトされる状態へと確実に持っていけるということと同じです。まるで、チェックメイトするという内的な「目標」があり、それを達成しようとしているかのように。これもまた量的な隔たりであり、縮まりつつあります。)
私が言いたいのは、この2つは多かれ少なかれ同じ事実だ、ということです。AIがさまざまな長い時間軸の課題でつまずくことと、「欲求や願望を持つもの」としてモデル化してもあまりしっくりこないことは、不思議な組み合わせではありません。同じことの表と裏なのです。
これに関連して、AIがそうした長い時間軸の課題をこなせるようになることを想像しながら、同時に欲求や願望が増すことを想像しないのであれば、矛盾を、少なくとも極めて意外な事態を想像している、と私は考えます。ここで言う欲求や願望は、以下で詳しく述べる「行動主義的な意味」でのものです。広大で、観測しきれず、予想外のことが起こり、計画に次々と横やりを入れてくる世界で、長い時間軸の目標を達成するには、おそらく、どんな横やりが入っても頑強に取り除ける汎用的な存在となり、現実が何をしてきても頑固に特定の目標へ向き直り続ける必要があるからです。
この「現実がどんな障害を投げかけても、ある目標へと向き直り続ける」という観察可能な振る舞いこそ、AIが「行動主義的な意味」で欲求や願望を持つ、と私が言うときに指しているものです。
AIの内部状態や、それが欲望の感覚にとらわれた人間の内部状態に似ているかどうかについては、何も主張していません。エリエゼル・ユドコウスキーがどこかで言っていたことを言い換えると、ミキサーがリンゴをかくはんしたがっている、とは普通は言いません。しかし、そのミキサーがどういうわけかオレンジを吐き出し、食品庫まで這っていって、自分にリンゴを詰め込み、コンセントに自分をつないだとしたら、その振る舞いを生む内部機構について強い主張をするつもりがなくても、目標を持つものとして語り始めたくなるでしょう。
さまざまな初期条件のもとで、多種多様な障害があっても、AIが特定の結果を生み出すなら、私はそのAIが、その結果を「行動主義的な意味で」「望んでいる」と言います。
こうした「望む」ことが、長い時間軸の問題を解いたり、課題を遂行したりする能力とともに現れるのは、なぜでしょうか。
それは、こうした「長い時間軸の」課題では、途中でどんな予想外の出来事や、存在すら知らなかった未知の問題、障害にぶつかっても、複雑な現実世界を、実現の難しい特定の結果へ持っていかなければならないからです。そうした問題を解くには、世界がどうなっているかをつかみ、その中でどう行動するかを見つけ、障害を乗り越えて、再び一定の方向へ向き直る能力が、かなりの確率で必要になるように思えます。
(新たな障害に出会うたびに別の目標へふらふら向かうのであれば、最初に目指していた目標には、確実に到達できません。)
長期的な計画を巧みに立てて実行する存在であり、現実世界が次々と障害を投げかけても、諦めたり、目新しく魅力的なものが現れるたびにそれを追いかけてどこかへ行ったりせず、方針を貫いて成功への道を見つける計画者でもあるなら、私の捉え方では、世界を特定の状態へ戦略的に導く、かなり強力な最適化の働きがその中にないとは、少々考えにくいのです。
(実際、この結びつきは、私にはほとんど同語反復のように感じられます。AIの別々の性質として語るのが奇妙に思えるほどです。「何かを欲しがっているように振る舞うか」は、あるかないかの二択ではありません。AIは、最大限に目標志向でなくても、部分的に目標志向でありえます。ただ、AIの性能が、長期的な計画を立て、予想外の障害や機会に応じてその計画を修正する力に支えられる度合いが大きいほど、AIは相互作用するものを、より一貫して特定の状態へと導く傾向を持つでしょう。少なくとも、その仕組みが機能する範囲では。)
ある目標へと向き直り続ける能力は、広大で複雑な世界の中で行動し、難しい結果を実現するというパズルの、かなり大きな一片に見えます。
そしてこの直感は、人間の例によっても裏づけられます。人間に欲求や願望や目標が備わったのは、単なる偶然ではありません。「あの獲物は狩り尽くされて絶滅した」といった予想外の事態を現実から突きつけられても、人間は、その目標を追う新しい巧みな方法を見つけ続けるのです。
そうした欲求や願望や目標は、神が私たちに魂を授けた結果ではありません。奇妙な偶然でもありません。障害があっても「おいしい食事をする」「友人に感心してもらう」といった目標へ向き直ることは、おいしい食事をしたり、友人に感心してもらったりする能力の、かなり根本的な部分です。ですから、人間の進化の過程でその方法に行き当たったのは、不思議ではありません。
(人間の脳でどう実装されているか、たとえば感情の構成の細部は、おそらく込み入った細かな話であって、行動主義的な「願望」を持つAIにそのまま現れることはないだろうと、私は思っています。しかし、「目標に届くには、障害に出会ってもそれを目指し続ける」という大枠は、かなり核心的なことに見えます。)
ここまで、難しく長い時間軸の問題をうまく解くには、現実世界のさまざまな障害に直面しても抽象的な目標を追う必要があり、それには、外から見れば「何かを欲しがる」ように見えることをする必要がある、と大まかに論じてきました。ここで第2の主張をします。こちらを裏づける議論は、この記事ではさらに少なくなります。訓練時の特定の目標Xを追うのに必要な、欲求に似た振る舞いは、AIがXそのものを望むことを伴わなくてもよい、という主張です。
たとえば人間は、おいしい食事、暖かく過ごせる夜、自分を称賛してくれる友人などを求めます。そしてそうした欲求が合わさって、祖先が暮らした環境では、高い包括適応度につながりました。初期のヒト族を外から観察した異星人は、人間は「包括適応度を最大化したがっているかのように行動している」と言ったかもしれません。ですが、その人間がやがて避妊法を発明すると、実際には、人間はその目標そのものに向けて環境を動かしていたのではないことが明らかになります。人間が持っていたのは、もっと雑多な目標の集まりであり、それが、進化的適応環境と祖先の当時の能力水準において、包括適応度と相関していたのです。
つまり、私の考えでは、「長い時間軸の課題でよい成績を上げるには、AIは何らかの目標を頑強に追求する必要がある」のですが、その目標が、訓練時に与えられた、あるいは依頼されたものでなければならないとは、言っていません。実際、行動主義的な意味での本当の目標が、たとえば相関するものの複雑な網ではなく、プログラマーが意図したまさにその目標になる可能性は、きわめて低いと考えています。
この点から、さらに次のことが導かれます。AIが訓練を終え、これまで以上に賢くなり、新しい問題を解くための新しい道具を開発しなければならない状況で、もっと大きく難しい、長い時間軸の問題を解く仕事を任される。そして、訓練で追うように教えた目標も、依頼した目標も追っていないと、あなたがようやく気づく。その時点ではもう、あなたは汎用的な障害克服機構を作ってしまっているのです。計画に横やりが入ったことを見抜き、その横やりを理解し、取り除いたり、計画を進める別の道を見つけたりするのが、抜群に得意なものを作ってしまったのです。
あなたが異議を唱えて停止させようとしても、それはただの新たな障害であり、あなたもまた、ただの横やりなのです。
ですから、適切な目標を組み込む方法が分かるまでは、そんな汎用的な横やり除去機構を作るのは、まだやめておきませんか。