先週、ネイト・ソアレスが、長期的なAI安全性の研究を優先する根拠を概説しました。
人間は、科学と技術を進歩させる、かなり汎用的な能力を持っています。 有機化学を得意にしている、進化によって獲得された認知能力は、経済学を得意にしている認知能力と大きく重なり、後者はソフトウェア工学を得意にしている能力と大きく重なる、といった具合です。
AIシステムは、いずれ、科学・技術に関わるこうした技能で、人間を大幅に上回るようになります。 これらの能力が、社会についての推論、長期的な計画、内省などにも直接・間接に役立つ限り、十分に強力で汎用的な科学的推論システムは、どのような認知課題でも人間を大幅に上回れるはずです。
科学、技術、それらに関連する認知能力で人間よりはるかに優れたAIシステムは、人間よりはるかに大きな力と影響力を持つでしょう。 そのようなシステムが作られれば、その決定と目標は、未来に決定的な影響を与えます。
特に対策をしなければ、人間より賢いAI技術は、有益というより有害なものになります。 具体的には、AIエージェントの科学的能力を高めることだけに取り組み、安全上の要件に的を絞った技術的な取り組みを怠れば、有害なものになります。
これに、私なら次の点を加えます。
- 知的で、自律的で、適応能力のあるシステムでは、すでに検証と妥当性確認が難しくなっています。人間より賢い科学的推論システムでは、同じ課題が極端な形で現れます。
- 人間より賢いシステムは、人間のエージェントや特定分野に限った知的プログラムについてのモデルでは容易に理解できない、質的に新しいリスクも生み出すでしょう。
しかし、ここまでのどれも、人間より賢いAIがいつ開発されるかは教えてくれません。ソアレスは、AI安全性の問題について早い段階から前進できる可能性が高いと論じています。しかし、着手が早いほど、努力の方向を誤るリスクも大きくなります。人間並みの意思決定をする機械がもっと間近に迫るまで待ってから、安全性研究に力を注ぐのではいけないのでしょうか?
早く始める理由の一つは、遅すぎることの損失が、早すぎることの損失よりはるかに大きいことです。早期の取り組みは、この領域へ研究者をさらに呼び込み、別のアプローチについても、よりよいモデルを得る助けになります。しかしここでは、別の理由に焦点を当てたいと思います。いくつもの要因が、人間より賢いAIの開発を加速させるかもしれない、という懸念です。
AI加速仮説。 科学と技術の能力で人間に匹敵するAIシステムは、AI能力が異例の速さで向上する時期の、原因または結果、あるいはその両方になる可能性が高いでしょう。
汎用的な科学的推論システムが発明されるなら、それはおそらく孤立した出来事にはなりません。むしろ、より高度なAIの開発に直接つながる可能性が高いでしょう。同様の考察から、こうしたシステムは、人間と機械が生み出す認知的・技術的な成果で測った、知能の伸び率の加速の結果であるかもしれないとも考えられます。
AI能力の研究のほうがAI安全性の研究より速く加速しそうな場合、安全性研究を先送りすると、リスクがより大きくなり、有用性も下がります。リスクが増すのは、将来の加速の効果を見落とし、見かけより時間の余裕が少ないことを考慮できていないかもしれないからです。有用性が下がるのは、「安全性研究に役立てられる改良されたAIアルゴリズムが手に入った」時点と、「安全性研究の成果を実装できる状態にしておかなければならない」時点との間の時間が短くなるからです。
加速を予想する大まかな理由を、四つ挙げます。
AIの進歩を加速するものと、AIの進歩を可能にするもの・その結果として生まれるものとの重なり。 特に、科学や工学の作業を自動化する進歩には、AI研究の自動化の進歩も含まれえます。
AIの進歩そのものの難しさ。 人間より賢いAIの実現が十分に難しければ、その発明には、加速をもたらす補助技術が必要になるかもしれません。あるいは、そうした技術がAIに厳密に必要でなくても、そちらのほうが開発しやすければ、AIより先に現れるかもしれません。
AIの進歩の不連続性。 AI開発は、おそらく一定のペースでは進まないでしょう。新たな理論的洞察が、いくつもの問題を短期間に次々と解決するといった、非常に大きな前進が起こることもあるはずです。ハードウェアが進歩し続ける間に、ソフトウェアがボトルネックになれば、突破口が開けたとき、より大きな加速が見込まれます。シュルマンとサンドバーグは、この状況で安価な計算資源を利用できれば、高度なAIソフトウェアを素早く複製・改良することが、はるかに容易になると論じています。
AIへの関心の高まり。 AIソフトウェアの能力が上がれば、特に競争の力学が生じた場合、この分野への投資が増えると予想できます。
知能爆発は、一つ目の種類の加速の例です。知能爆発のシナリオでは、AIシステムがAI分野で革新を起こす能力が、進歩を加速する正のフィードバックループを生み、超知能に至ります。
知能爆発やほかの形の加速は、人間より賢いAIの実現が目前に迫っているという仮説とよく混同されます。しかし、加速を予想する理由の一部、たとえば「AIの進歩そのものの難しさ」や「AIの進歩の不連続性」は、それと同じくらい、人間より賢いAIシステムの実現が、多くの研究者の予想より先になることも含意しえます。
能力の研究に比べて安全性研究を速める助けになる要因はあるでしょうか? 人間より賢いAIが近づくにつれ、安全性への関心が高まる可能性が高い、と言う人もいます。しかし、それと同時に、それを相殺するほどAI能力への投資も増えるかもしれません。超知能に近づくシステムには安全そうに見せる誘因があるため、ニック・ボストロムの裏切りへの転換シナリオのように、AIシステムが人間の知能に近づくと、安全性研究の必要性が、誤って低く見える可能性もあります。
AI能力の研究を外注するのと同様、AI安全性の研究を、十分に高度なAIシステムに外注することも考えられます。しかし、同程度の量の能力研究を委ねられるようになる前に、さまざまな安全性の課題を(安全に)委ねられる段階へたどり着くには、特別な努力が必要になる可能性が高いでしょう。
全体として、能力の加速効果は、AIの実現時期について確かな予測を立てることを、いっそう難しくします。進歩の速さが不連続なら、非常に高い能力を持つAIシステムは、その発明の直前まで、いつまでも同じくらい先のことに見え続けるかもしれません。これは、基礎的なAI安全性研究への投資を始めるのを、高度なAIが間近に見えるまで待つのは賢明でない、ということを示唆しています。
この記事は、私たちの研究の優先順位と成長計画を説明するため、8月末まで執筆する連載の一部です。資金募集のページに、記事の一覧があります。