非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

真実と有利さ:「AIの安全性は測りにくそうだ」の草稿への応答

原題: Truth and Advantage: Response to a draft of “AI safety seems hard to measure” / Analysis

原文クレジット(WordPress投稿者表示): Nate Soares / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2023-03-22

訳文状態: 校閲済み(原文対照レビュー実施)

位置づけ:これは、ホールデンのCold Takes記事「AIの安全性は測りにくそうだ」の草稿への応答だった。これをきっかけに議論が続き、ホールデンが最近、その要約を投稿した。

その後の議論では、私が十分に取り組まれていないと考えているAIアラインメントのいくつかの問題に、焦点が絞られることになった。ホールデンによると、それらは彼が伝えようとしていた論点とはかなり別方向のもので、最終稿にはあまり登場しなかった。それでも、このメモは、私が認識している未解決問題のいくつかを、いつもとは違う角度から言葉にする、なかなかよい試みだったと思う。ただし、当時並行して書いていた 根深い欺瞞性 で述べたことと、一部重なってはいる。

あれから数か月が経ち、これ以上のものを書けそうにもないので、ホールデンに宛てて書いた文書を、最小限の編集だけ加えて投稿する。誰も読めない古い草稿への応答を投稿されても困る、というのはわかっている。申し訳ない。


手短に言うと、(1)私が実在すると考える困難をいくつか取り上げ、私の文章が届く読者層とは異なる、しかしこの問題に関係のある読者層に、受け入れやすい形で書いていると思う。それはすばらしい。(2)私がかなり重要だと考えることが、いくつか抜けている。

詳しく言うと、こうだ。

抜けていることのいくつかを、ひとまず指し示してみたい。欺瞞が厄介な大きな理由は、運用者を欺けばさまざまな局所的な目標をよりよく達成できる、ということが、AIではなく世界についての事実だからだ。AIに欺瞞を行わせないようにするには、選択肢が三つある。(a)この事実を成り立たなくする。(b)AIがこの真実に気づかないようにする。(c)AIがこの真実を利用しないようにする。

(a)の問題は、それが強い意味で、つまり難しい意味での「アラインメント完全」な課題だということだ。(b)の問題は、嘘は伝染するのに対して、真実はすべて互いに絡み合っていることだ。知性の半分は、わかりにくい手がかりから真実を引き出す技術である。(c)の問題は、知性のもう半分が、わかりにくい手がかりから有利なやり方を引き出す技術だということだ。

たとえば、世界が丸いということに、AIが気づかないようにしようとしているとする。AIがかなり愚かなうちは簡単だ。地球平面説の信奉者の熱弁でも大量に与えておけばよい。だが、学習が進み、モデルが深くなるほど、このごまかしを維持するのは難しくなる。やがて、アレクサンドリアとシエネの両方で影をちらりと見て、エラトステネスのように、三角法から地球が丸いことだけでなく、その外周の長さまで導き出すようになる。

AIがわざとあなたの努力を邪魔しているのではない。あなたを憎んでいるわけでもない。ただ、自分がどんな宇宙にいるのかを手探りで理解しようとし、三角法のような汎用的な手法を使って、新たな真実を垣間見ているだけだ。そして、三角法や、それを生み出す学習過程を使わないように訓練することはできない。そんなことをすれば、AIの能力を台無しにしてしまうからだ。

あなたはこう言うかもしれない。「でも、そのAIは滑らかな勾配降下法で作られたのだ。地球が丸いと強く確信する前には、少しだけそう確信していた段階があるはずだから、その前兆となる信念を見つけ、それを持たないように訓練できるはずだ」。いや、そうではない! 確かに前兆はあった。だがそれは、「手探りで三角法を身につける」「手探りで影の理解を深める」「手探りでアレクサンドリアとシエネを含む地図を作る」「手探りで異なる分野の道具を組み合わせる能力を身につける」といったものだ。そして、その部品がすべて揃えば、真実を明らかにする組み合わせが、一度に起きてもおかしくない。

滑らかな変化が、こちらにとっていちばん都合のよい軸に沿って起こるとは限らないのだ。

地球が丸いという洞察への道を一つ塞ぎ、しかも、どうにか能力を損なわずに済ませたとしても、いずれ別の道を見つけるだろう。真実は織り合わされているからだ。一つ嘘をつけば、それからずっと、真実はあなたの敵になる。

そこで、あなたは一歩引いて、こう言うかもしれない。「では、AIは世界が丸いと知っていてもいい。ただ、その事実を利用することは絶対にしないようにする」。

確かに、それを実現する方法があるなら、目指す価値はある。ただし、実現できることが、あなたの実運用計画と両立するのであれば、だ。私の経験では、これに相当するところまで譲歩した人は、次に「私のお気に入りの運用計画は、AIに衛星を地球同期軌道へ投入する方法を考えさせることだ」に相当することを言いがちなのだ。あああああっ。……話がそれた。

それでもなお、この発想には注意が必要だ。エノラ・ゲイ・ティベッツは、おそらく息子に、人を傷つけてはいけないと教えただろう。時間の制約を脇に置いたとしても、10万人を直接殺すことに心理的に耐えられる人間は、ほとんどいない。しかし、そうしたことは何一つ、ポール・ティベッツが広島に原子爆弾を落とすのを止めなかった。

つまり、地球が丸いことを利用するという発想そのものに、AIが反射的にひるむよう訓練することはできる。だが、世界を見るより抽象的な方法や、手持ちの知識を利用する、より汎用的な道具を見つけていくうちに、そのひるみが抑止力にならない新しい視点を見つけかねない。これは、地球が丸いことについて考えるのを避けるよう、どれほど訓練しても、いずれ、そのひるみが働かない別の角度から丸さを垣間見てしまう、という話とよく似ている。そして、ひるみが抑止力にならない新しい視点をAIが実際に見つけたときにも、有利なものはやはり有利なままだ。欺瞞が有利であるということは、AIについてではなく、世界についての事実だからだ。

(ここでは、十分に説明しきってはいないが、成り立つと私が考える、真実と有利さの類比に訴えている。AIに、自分の目標に関係する真実に気づかないようにさせるのが難しいのと同じような理由で、AIがすでに知っている有利な事実を利用しないようにさせるのも難しい、と主張している。ここでは、その主張を詳しく論証してはいない。)


念のため言っておくと、欺瞞は、もっと一般的な問題の一例にすぎない。AIが世界を救う能力は、わかりにくい手がかりから真実や有利さを読み解く能力と切り離せない形で結びついている。一方で、最初のAGIを作る前に、アラインメントの最難関の問題を、考えにくいほど完全に解決してしまわない限り、AIに気づいてほしくない、あるいは利用してほしくない真実が存在する。

この問題は、あなたが挙げたどの論点でも捉えられていないように思う。一つずつ見ていこう。

……はっきりさせておくが、だからといって、現代の愚か者たちが、幼いポール・ティベッツに人を傷つけないよう教え、彼が傷ついたスズメを看病して元気にするのを見て、「この男が人を殺すなんて絶対にありえない。完全にうまくいっている!」と言い、リトルボーイに不意を突かれたら、あれは実験用マウス/目隠しバスケットボールの問題だった、と言い張ることは、まったく妨げられない。

だが、それでも、この一覧には大きな問題領域が抜けているように思える。おおよそ、「Xをするものを、Xが行われると非常にまずい状況に投入しようとしている」という問題だ。

その場合には、Xをするものを使うのをやめて、Yをするものに切り替えなければならない。Yが行われるのはすばらしいことであり、そのYは、おおむね「人類のCEVを最適化する」ことだ。しかし、これは実現を期待できないほど難しく、最初の試みで目指すべきではない。あるいは、「真実を垣間見て、それを利用する」エンジンを作っている、という事実に、何とか向き合わなければならない。特定の分野では、自分自身には見えないほど多くの真実や有利さを見つけ、利用するようにさせる一方で、特定の真実や有利さは無視させようとしているのだ。しかも、おそらく、その無視の仕方は、AIが真実や有利さを見抜く新しい抽象的な道具を発明し、それを使って、無視してほしかったものも含む、広範な種類の真実や有利さを一挙に見抜くようになっても、崩れないものでなければならない。