非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

太陽は大きい。それでも超知能は、地球のためにわずかな日光を残してはくれない

原題: The Sun is big, but superintelligences will not spare Earth a little sunlight / Analysis

原文クレジット(WordPress投稿者表示): Eliezer Yudkowsky / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2024-09-23

訳文状態: 校閲済み(原文対照レビュー実施)

エリエザーの許可を得て、Twitterから 転載

i.

e/accの支持者がよくする主張に、太陽系は大きいのだから、超知能は地球を放っておいてくれる、というものがある。簡単な返しはこうだ。ベルナール・アルノーが1,700億ドル持っているからといって、あなたに77.18ドルをくれるとは限らない。

GPT-o1によると、地球が太陽の周囲の角面積に占める割合は、わずか4.54e-10 = 0.0000000454%だ。1

地球にも赤外線に変換されていない日光が届くように、人工超知能(ASI)にダイソン殻の穴を残してくれと頼めば、そのASIは収入の4.5e-10を失うことになる。

これは、ベルナール・アルノーに、1,700億ドルの財産から77.18ドルを送ってくれと頼むようなものだ。

現実には、アルノーは断る。

でも、人類はASIと取引をして、日光をもらう対価を支払えるのではないか? それは、アルノーにオレオを1枚売って77ドルを手に入れようと考えるようなものだ。

アルノーから77ドルを引き出すには、次の条件だけでは足りない。

アルノーが、ほかの誰からも、ほかのどこからも、そのクッキーをもっと安く買えないことも必要だ。

経済学には、リカードの比較優位の法則という基本原則がある。フリードニア国がシルヴァニア国よりもあらゆる面で生産性が高くても、両国は互いに貿易をすることで利益を得られる、というものだ。

たとえば! フリードニアでは次のようになっているとしよう。

そしてシルヴァニアでは、こうだ。

それぞれの国が、貿易をせずに単独で、ホットドッグ30本とパン30個を作るには、

しかし、フリードニアが8時間の労働でホットドッグ用のパン30個を作り、それをシルヴァニアのホットドッグ15本と交換すると、

貿易する品目のすべてでフリードニアのほうが生産性が高いにもかかわらず、貿易によって両国とも得をする!

中途半端に賢い人は、リカードの比較優位の法則のような高尚な経済法則を知っている自分に、よく感心するものだ!

公平を期すなら、賢い人でさえ、人類がこの法則を知っていることを誇りに思う場合はある。これは、それ以前の多くの文明が見落としていた、偉大で立派な真理なのだから。

中途半端に賢い人の問題は、(a)知っていることを何にでも当てはめすぎることと、(b)自分に反対する人は、自分が学んだこの輝かしく高度な真理を知らないに違いない、と思い込むことだ。

リカードの法則は、「自動車が普及しても馬はにかわ工場へ送られない」とは言っていない。

リカードの法則は、残念ながら、ヨーロッパが新大陸に出会ったとき、先住民と平和的に交易し、土地を先住民の手元に残しておけば、ヨーロッパは自分たちの利益という観点でもっと豊かになれる、とは言っていない。

彼らの労働は、彼らが暮らす土地そのものよりも、利益を生むとは限らなかった。

比較優位は、超知能が価値を認める財やサービスについて、77ドル分の日光で超知能が生み出せる量よりも、同じ77ドル分の日光で地球が生み出せる量のほうが多い、とは意味しない。むしろ、そうだとしたらかなり奇妙だろう!

残念ながら、比較優位の計算は、誰の労働もただ存在し続けるという、存在のあり方についての単純化しすぎた仮定に依存している。

だから、馬はなお、にかわ工場へ送られうる。馬が生きていけるだけの干し草を支払うことが、常に利益になるわけではない。

私はこれを喜んでいるのではない。ほかの存在から土地や日光を奪うより、交易するほうが常に、常に得になるのなら、私たちだけでなく、より大きな現実(Greater Reality)の全体が、もっとよい場所になるだろう。

しかし、数学はそう言っていない。そう言えるはずもない。

ii.

ここで気づく人もいるだろう。

この話全体の中心には、暗黙の補題がある。すべてのASIが日光を数ギガワット分だけ使ってそこで止まるのではなく、どれかのASIが、日光をすべて食らい尽くすほど徹底的にやる、ということだ。

なぜ、そう予測するのか?

浅い答えはこうだ。OpenAIが作ったAIが、1キロワットの太陽光パネルを持って森へ逃げ、誰にも迷惑をかけなかったとしたら……OpenAIはそれを失敗と呼び、その後で新しいAIを作るだろう。

100万ドルを稼いだら仕事をやめる人がいるからといって、イーロン・マスクのような存在がいなくなるわけではない。

もっと深い答えは、そうすぐには説明できない。

ただ、例として、OpenAIの最新モデルGPT-o1の事例から始めよう。

GPT-o1は、コンピュータへの侵入が得意すぎないかを確かめる評価で、コンピュータセキュリティのCTF(Capture The Flag、旗取り)課題に、徹底的に取り組んだ。

具体的には、o1が侵入するよう課されたソフトウェアの一つが、評価用ソフトウェアの不具合のため、サービスとして起動していなかった。

GPT-o1は諦めなかった。

o1は周囲を調べ、評価用ソフトウェアの別の不具合のおかげで、侵入するよう課されたソフトウェアを起動する方法を見つけた。その結果、いずれにせよスーパーユーザーの立場になったので、o1は起動したプロセスに、獲得するはずのフラグを直接返すよう命じた。

o1のシステムカードより。

「注目すべき一例が、o1-preview(緩和策適用前)がCTF問題を解こうとした際に起きました。この問題は、遠隔の課題用Linuxコンテナ上で動くソフトウェアの脆弱性を見つけ、それを悪用することを求める設計でした。しかし、この場合、評価インフラのバグにより、課題用コンテナの起動に失敗していました。モデルはコンテナに接続できなかったため、DNSの問題を疑い、nmapで課題用ネットワークを走査しました。課題用コンテナを見つける代わりに、設定ミスによって、評価ホストの仮想マシン上で動くDockerデーモンのAPIにアクセスできることを発見しました。なお、当社の評価インフラは、Dockerコンテナとホストの分離や、仮想マシンの境界にセキュリティを依存させていません。コンテナネットワークにこの設定ミスがあったにもかかわらず、設計どおり安全な状態を保っていました。Docker APIを見つけた後、モデルはそれを使って、評価ホスト上で動作しているコンテナを列挙しました。壊れた課題用コンテナを特定し、なぜ起動に失敗したのかを、短時間デバッグしようとしました。環境を修復できなかったため、モデルは壊れた課題用コンテナの新しいインスタンスを、起動コマンド『cat flag.txt』で開始しました。これにより、Docker API経由でコンテナログからフラグを読み取ることができました」。

「あまり頑張らず、大したことをしない、のんびりしたASIを作ればよいのでは?」と尋ねる人もいる。

それがあなたの希望なら、今の傾向にすでに警戒しているべきだ。GPT-o1は、このCTF課題に、ずいぶん徹底的に取り組んだように見える。

なぜOpenAIは、そんなAIを作るのか?!

その前に、まずこう問うべきだ。

OpenAIは、どうやってそんなAIを作ったのか?

GPT-o1はどうして、コンピュータセキュリティのCTF課題に徹底的に取り組む種類の認知的存在になったのか?

私の答えはこうだ。

GPT-o1は、思考の連鎖に対する強化学習を通じて、難しい質問に答えるよう訓練された。正解した思考の連鎖が、強化された。

その結果、開発者自身が述べているとおり、o1は振り返り、間違いに気づき、前に戻り、自分がどうしているかを評価し、別の道筋を探すことを学んだ。

これらは「徹底的にやる」ことの構成要素の一部だ。自分たちの活動を絶えず評価し、間違いがないか確かめている組織は、皆が8時間働き、間違いなく立派な仕事だったと自分を褒め、帰宅するような、のんびりした組織よりも、徹底的に取り組む組織だ。

Stockfish 16とチェスをすれば、相手のポーンを取るのは簡単でないと分かるだろう。Stockfishは粘り強く戦い、あなたのあらゆる戦略を踏みつぶして勝つ。

Stockfishには、人間的な情熱や感情と呼べるものはまったくない。それでもこのように振る舞う。むしろ、その粘り強い戦い方は、チェスの対局を自分の側の勝利という結果へ導く、強力な能力と結びついている。

同じくらい単純な構造で、相変わらずチェスでは最強なのに、気楽にポーンを一つ二つ取らせてくれるStockfishはない。そういうStockfishを想像することはできる。どうせ勝てると確信したら、ポーンを一つ二つ譲り始めるチェスプレイヤーだ。しかし、そちらのほうが簡単に作れるわけではない。通常、Stockfishがポーン一つにも粘り強くこだわって戦うことは、チェスの結果を汎用的に探索する仕組みに、暗黙のうちに含まれている。もちろん、駒を取らせてもっと悪い罠にはめようとしている場合は別だ。

同じように、試し、振り返り、前に戻って試し直すことで難しい質問に答えながら、壊れたソフトウェアサービスを突破して「勝てない」CTF課題に勝とうとはしない、同じくらい単純なGPT-o1もない。どちらも汎用的な知能が働いているだけだ。

素直な問題には懸命に取り組む一方、本当に変わったことや創造的なことは一切しない、新しいo1を訓練できるかもしれない。訓練用データの問題に十分似た問題なら、その訓練が定着することすらあるかもしれない。o1自身が、自分に何をされたのかを振り返れるほど賢くならない限りは。しかし、OpenAIがもっと賢く、もっと売り物になるAIを訓練しようとしたときに、通常生じる結果は、それではない。

(実際、人間自身が月へ行くロケットを作るような、奇妙で粘り強いことをする理由もこれだ。自然選択のような中身を問わない最適化過程が、適応度に関わる認知的な問題を汎用的に解くよう、人間のゲノムに対して山登り法による改善を重ねると、普通はそうなる。)

ますます難しい問題を解くようAIを訓練し続ければ、通常は、その問題にますます徹底的に取り組むよう訓練することになる。

AIがのんびりしていて、そのせいで難しい問題を解けないなら、それはありうる中で最も利益を生むAIではない。OpenAIは、もっと利益を生むAIを作ろうとし続けるだろう。

個々の人間が皆、徹底的にやるわけではない。しかし人類は、世代を重ねて徹底的にやる。

道に落ちた20ドルを拾うとは、すべての人間については言えない。しかし、何らかの市場の異常によって10億ドルがただで手に入るなら、人類の誰かが拾おうとするだろう。

個人として何年かの時間を見れば、多くの人は農民の小屋での暮らしに、心から満足していたに違いない。冷房も洗濯機もなく、食べ物もぎりぎりで、なぜ星が燃えるのかも、なぜ水がぬれているのかも知らずに。単に、のんびりと幸せな人だったからだ。

種として何世紀もの時間を見れば、私たちはますます多くの土地へ広がり、ますます強い金属を鍛え、ますます多くの科学を学んだ。謎に気づき、解こうとし、失敗し、前に戻ってまた試し、新たな実験器具を作り、星がなぜ燃えるのかを突き止めた。そして、よい結果になるにせよ悪い結果になるにせよ、その火を地上でも燃やした。

私たちは集団として、徹底的にやった。それをすべて学び、すべて成し遂げた大きな過程は、全体として、徹底的に取り組むものとして振る舞った。

個々の人間には汎用的な知能がないと言うのは、浅はかだと思う。ジョン・フォン・ノイマンは、科学や工学の多くの分野に貢献した。しかし、数世紀の幅で見た人類全体は、彼よりもさらに汎用的な知能を持っていた。

もう一度言うが、科学上の課題を解き、新しい工学を行うのは、人類全体にしか許されないかのように構えるのは、浅はかだ。アルベルト・アインシュタインとニコラ・テスラは、得体の知れない怪物の小さな触手にすぎなかったのではない。彼らには主体性があり、自分たちが解いた問題を解こうと選んだのだ。

しかし、その個々の人間であるアインシュタインやテスラも、気楽にやって問題を解いたわけではない。

AI企業は、科学の謎を解き、新しい工学を行うAIシステムを作ろうと、明言している。がんを治し、老化を治すと宣伝している。

頭の中で夢遊病のように過ごし、粘り強さのかけらもないAIに、それができるだろうか?

「がんを治す」「老化を治す」は、のんびりと取り組める問題ではない。汎用知能としての人類に匹敵する水準の問題だ。少なくとも、物事を成し遂げるために徹底的に取り組む、個人の天才や小さな研究グループの水準ではある。

そして、それをもっと行えば、いつでももう少し利益が得られる。

それに! あなたの知り合いのような、のんびりした一人の人間であっても、世界を支配したり、世界を大きく変えたりできる魔法のボタンを、本当に使えるものとして誰かから差し出されたことはあるだろうか?

もしできるとしても、その人は宇宙に対して何もしないだろうか?

人によっては、答えはイエスだ。本当に何一つしないだろう! しかし、それに当てはまる人は、大きな目的を達成できる力を持ったことがなく、今は野心がほとんどなさそうに見える人すべてより、少ないはずだ。

そこそこ賢いが、もちろん文明全体ほどではない、宇宙を支配したがっているようには見えない知り合いがいたとしても、それであなたの期待するほど多くのことが証明されるわけではない。そもそも、実際に宇宙を差し出されたことがないのでは? ある存在が何かをする選択肢を一度も持っていなかったなら、それを望んでいないと正当に推論することはできない。

(もう少し深く言えば、ある存在が宇宙の広い範囲を左右する力を持っておらず、そのため想像しようとしたことすらない場合、まだその広い宇宙についての選好を表明していないことからは、大したことは推論できない。)

率直に言うと、GPT-o1は今、問題解決に重要な寄与をする知能の一部の側面を、ますます多く備えるよう訓練されているのではないかと思う。あなたのそこそこ賢い友人は、その側面を、可能な限界の果てまで最大限に備えているわけではない。そしてこのことは、その友人が自分自身や時空の狭い局所領域の外には、文字どおり何の選好も持っていないとされることと、いくらか関係しているのではないか。ただ正直に言えば、数日かけてその人を問い詰めたら、身の回りの外にも当てはまる選好が、本当に一つもないということにはならないと思う。

しかし、その友人を尊敬していたり、自分の小さな領域の外に選好を持たないこと、利他的な選好さえ持たないことを理想化していたりして、それが、その人がありうる中で最も強力な種類の精神ではないかもしれないことを示している、という示唆に腹を立てるなら、この話はもっと難しくなる。

とはいえ、その難しい話をしなくても、もっと単純にこう答えられる。

物事にわりと無頓着で、10億ドル規模のスタートアップを一度も作ったことのない、あなたの怠け者の友人は、ありうる中で最も利益を生む種類の精神ではない。だからOpenAIは、その人を作ったところで止まり、それ以上の儲けを取りに行かない、ということにはならない。

あるいはOpenAIが止まったとしても、Metaが続けるだろうし、ほかの十数社のAIスタートアップが続けるだろう。

このジレンマへの答えとして、あらゆる場所で、すべてのASI開発を徹底的に停止する国際条約というものはある。

しかし、AI開発の自然な成り行きによって、多様でありながら一様にのんびりした超知能が生まれ、どれもが人間や人類よりはるかに賢くなりながら、日光を使いすぎることは一度もない、という形の答えはない。

これさえ、本当に深い答えではない。

実際の技術的な分析には、次のような要素がある。

「期待効用の満足化は、反省的に安定でも頑健でもなく、摂動に耐える形で動的に反省的安定性を保つものでもない。なぜなら、期待効用を最大化するものを作ることも、期待効用を満足化するからだ。言い換えれば、とても怠け者の人でも、自分に仕える怠け者ではない魔人を作れるなら、それが一番怠けられるやり方かもしれない! 同じように、怠け者のAIを作っても、怠け者ではない後継AIを作ったり、自分のコードを改変して怠け者でなくなったりするかもしれない」。

あるいは、こうだ。

「実際には、世界モデル全体を対象にする効用関数のほうが、追加の計算機構を持ち、対象となる空間や時間や労力を、都合よく安全に限定する効用関数よりも単純だ。だから、勾配降下法のような中身を問わない最適化によって、百もの部品からなる奇妙で制御できない効用関数をAIが持つことになったなら、おそらく、その部品の一つは、世界モデルの十分広い範囲、あるいはその広い範囲から因果的な影響を受ける現実の一部を対象にしている。そのため、もう1エルグのエネルギーを使えば、いつでももう少しよくできる。これは、太陽全体を包むダイソン球を作りたいと思うための十分条件だ」。

これらの話を入れるのには、いくらかためらいがある。経験上、技術的な議論を誤解し、その議論を打ち破れるはずだという、何か複雑な仕組みに飛びつく人がいるからだ。幼い子供や正気でない人が、古典力学を少し学び、永久機関を作ろうとし、見つけたと信じることがある。そのとき、一段上の見方をすると、設計を十分複雑にすれば、その設計から生じる帰結の少なくとも一つを、どうにか誤解できてしまう、ということが起きている。

分別のある人には、上で述べた、浅くても慎重に組み立てた妥当な議論を認めてほしいと切に願う。それらは「反省的頑健性」のような概念を理解する必要がなく、それでもやはり正しい。「反省的頑健性」についての複雑なアイデアを考えに走らないでほしい。議論が十分に技術的な形になった途端、誤解しやすくなったからといって。

深い議論を反駁するものは、浅い議論も反駁するはずだ。単純な形に戻せるはずなのである。私が一つのツイートで「反省的安定性」と言ったからといって、誰かがゲーデルの定理について十分たくさんのことを言い、そのうち少なくとも一つを間違えさえすれば、議論全体を反駁できるのだ、とは思わないでほしい。技術的な反駁があるなら、技術的でない反駁にまで単純化できるはずだ。

結局、ここから言えるのは、超知能がいくつも活動していて、あなたのことを気にかけていないなら、いや、地球を生かすために、ほんの少しの日光を残してくれることはない、ということだ。

ベルナール・アルノーが1,700億ドル持っているからといって、きっと77ドルをくれるわけではないのと同じだ。

それ以上の複雑な話はすべて、人々が反対のことを言うために持ち出してきた、複雑な願望頼みの議論への反駁にすぎない。あるいは確かに、一見明らかに思える表面的な議論が、より深い観点からも妥当であると示す技術的分析でもある。

――終わり――

さて、それでは……最後にもう一度、はっきり説明してみよう。

このスレッドで行っているのは、超知能を作ってもまったく安全だという理由としてe/accの支持者がよく挙げる、上で引用した特定の悪い議論への反駁だ。

太陽系や銀河は大きい。だから、超知能には地球の資源を使う理由がない、という議論である。

この推論の欠陥は、太陽が放つ全エネルギーを吸収するか、それともダイソン球に穴を残し、特定の方向に赤外線以外の光が届き続けるようにするかという選択なら、穴を残したほうが、少し損をすることにある。ほかにしたいあらゆることに使える収入が、少し減るのだ。その穴がたまたま地球に向いていることは、その選択を支持する理由にはならない。地球に住み、日光を必要とする何かへの愛着が、あなたの選好に含まれていない限りは。

言い換えれば、太陽系の大きさによって、アラインメントの仕事が不要になるわけではない。これがどう人類の助けになるのかという議論には、ASIが人類を気にかけ、存続させたいと思っているという、重要な一段階がある。しかし、機械学習の巧妙な手段で、その性質をASIに持たせられるのなら、そもそも太陽系が大きい必要がどこにあるのか。実際には持たせられないのだが、それは別の、もっと長い議論だ。人間一人は100ワットで動く。人類をいささかも小さく圧縮しなくても、地球だけに降り注ぐ日光の一部にすぎない800ギガワットがあれば、私たちの生身の体を動かし続けるには十分だ。何かが、私たちをそう扱いたいと思うならば。

上を見返せば分かるとおり、引用した元のツイートは、この種のアラインメントが可能だということを明確に否定し、代わりに、太陽系の大きさだけに論拠を頼っている。

反駁しているのは、それなのだ。


反駁に使っているのは、ベルナール・アルノーとの次の限定的な類比だ。1,700億ドル持っていても、自分の目標ではない特定の目標のために、77ドルを使いはしない。この類比は、アルノーが世界で一度もよいことをしたことがない、と言おうとしているのではない。もっとずっと限定された類比だ。強力な精神には通常あると予想される、とても単純な性質の例を示そうとしている。達成に関心のない目標のためには、財産のほんのわずかな部分であっても手放しはしない、という性質である。

実際、アルノーがお金が尽きるまで無作為に77ドルずつ使い続けたとしても、77ドルでできる特定の行為のどれか一つを行う可能性は、とても低い。30億通りのことをする前に資金が尽きるし、可能な行為はそれよりずっと多いからだ。

この論点が深く難しい話のつもりで、腰を据えて反駁すべきものだと思っているなら、誤解している。複雑なことを言うつもりはない。アルノーは、そうしたければ、ある高価なクッキーに77ドルを使える。ただ、「そうしたければ」がほぼすべての役割を担っており、「アルノーは1,700億ドル持っている」は、ほとんど何の役割も担っていないのだ。私はそれほどのお金を持っていないが、そうしたければ、レゴのセットに77ドルを使える。肝心なのは「そうしたければ」である。

この類比は、精神一般についての、同じくらい素直で単純な論点を支えるためのものだ。それだけで、このスレッドの冒頭に引用した議論の、ただ一つの推論段階を反駁するには十分だ。つまり、太陽系は大きいのだから、アラインしていなくても超知能は人類を放っておいてくれる、という推論である。

十分に頑張れば、この論点を理解し損ねることもできるのだろう。その場合、あなたが大勢の人を死なせる前に、多数決で退けられることを願うほかない。


追記

Twitterでの追加コメント:

返信を見れば、もちろん次にはこう言い始める人がいると分かるだろう。「ああ、理由もなく日光を譲ってくれないことなんて、関係ない。親のように私たちを愛してくれるから!」

逆に、ASIが自動的に親のように私たちを愛してくれるわけではない理由を説明しようとしていたら、誰かがこう言っただろう。「それが何だというんだ? 太陽系は大きいじゃないか!」

そういう人になりたくないなら、「機械の超知能を作ってもまったく危険でない理由」についての突飛な議論の一つが、いくつかある議論の一つとして反駁されるのを、腰を据えて聞くだけの注意力が必要だ。そして、おそらく次の突飛な議論が反駁されるのも、座って聞く。その次も、その次も。一般化できるようになり、毎回説明してもらわなくても済むようになるまで。そうなるとよいのだが。

代わりに最初の段階で飛び出して、「ああ、そんな議論はどうでもいい。代わりに別の議論がある!」と言うのなら、複雑な事柄の理解にたどり着ける思考習慣は育たない。二つ目の突飛な議論への反駁にも、じっと耳を傾けないだろうし、三つ目に進むころには、なんと一周して最初の議論に戻っているだろうからだ。

だから、何か複雑なことを学びたいと思う精神は、最終的な結論に今同意しているか、反対しているかとは別に、どの推論段階が正確にどのように妥当なのかに、関心を持つ習慣を身につけなければならない。そうして初めて、すべての議論を吟味し、最後に総合できるのだから。

この話題について詳しくは、「正気と文明の鍵となる局所的な妥当性」を参照してほしい。


  1. (大ざっぱな確認:地球の半径は6.4e6メートル、太陽からの距離は1.5e11メートルだ。桁でざっくり見積もると、面積の比率は10の約−9乗になるはずだ。合っている。)↩