AIの進歩によって、ますます複雑で創造的な人間の振る舞いが自動化されつつある。十分な時間がたてば、人工的な推論主体は、任意の領域で人間に匹敵し始め、最終的に汎用人工知能(AGI)へ到達すると予想すべきである。
ここで意図する意味で、ある機械が「AGI」に当たるのは、極めて広範な状況へ適応し、何らかの目標を一貫して達成できる場合である。そのような機械は、任意の物理環境と計算環境を与えられたとき、知的に振る舞うだろう。それは、Deep Blueが任意のチェス盤の配置を与えられたとき、より狭いその領域で勝利条件を一貫して満たし、知的に振る舞うのと同じ意味である。
汎用知能を持つソフトウェアは、科学で仮説を考え、試験する過程の自動化に役立つため、AGIは技術発展を速めるうえで、比類ない価値を持つだろう。しかし、この広範な生産性は、安全性の観点からも、AGIを比類ない難題にする。未来のAGIのアーキテクチャーについて、ほとんど何も知らなくても、安全性に関係する一般化をいくつか行える。
- AGIは 知的 なので、複雑で、適応性があり、自律行動できる傾向があり、利用される場所へ大きな影響を与える。
- AGIは 汎用的 なので、利用者には、ますます広範な環境で使う誘因がある。そのため、妥当なサンドボックス試験と要求仕様を作るのが難しくなる。
- AGIは 人工的 なので、人間の 主体とは異なり、知的な振る舞いについて私たちが自然に抱く、多くの直観と予想に反する。
現在のAIソフトウェアも、その複雑さと、状態空間爆発に直面したときの不確かな振る舞いのため、すでに検証と妥当性確認が難しい。メンジーズとペシュール(Menzies & Pecheur, 2005)は、AIの検証と妥当性確認(V&V)の方法をうまく概説し、AI、特に適応型AIが、望ましくない予想外の振る舞いを、しばしば生むと指摘している。
地球から直接操縦できない火星探査車のように、自律行動する適応型AIは、難しさをさらに大幅に高める。自律的で、安全性が決定的に重要なAI主体は、動的な環境で、故障率を極めて低く保ちながら、不可逆な決定を行う必要がある。自律システムの安全研究における最先端は進歩しているものの、システム能力の研究には後れ続けている。ヒンチマンら(Hinchman et al., 2012)はこう書いている。
自律システムが複雑になるにつれ、システムを完全に試験し、すべての問題を発見できるという考えは、達成不可能になりつつある。無人/自律システムでは特にそうである。複雑なシステムで完全な試験を行うのは、ますます難しくなっている。こうしたシステムが、より多くの環境[刺激]へ反応し、より大きな意思決定空間を持つようになると、取り得るすべての状態と、システムへの入力の全範囲を試験するのは不可能になりつつある。[……]システムが複雑になるにつれ、安全性は実際にはリスク・ハザード分析、すなわち、量xの試験を行ったところ、システムは安全に見える、というものになる。根本的な変化が必要である。この変化は、2010年の空軍Technology Horizon報告でも強調された。「高水準の自律性を備えたシステムを開発することは可能だが、比較的低い水準を超える自律性を、使用認定できない原因は、適切なV&V手法がないことである」。[……]
より自律的なシステムへの移行により、[高度な検証・妥当性確認の技法と方法論への]この必要性は、国家規模へ引き上げられた。
すると、任意の領域で 自律行動するAIは、特に検証が難しそうである。AI手法が効率と汎用性の面で急速に進歩し続け、特に、その進歩によってAIアルゴリズムが、人間の検査に対してさらに不透明になるなら、AI安全工学は未来にさらに難しくなる。AGIへ至るまでに、高保証AGIを容易にする(またはAGI自体の可能性を低くする)進展が起きると予想する理由は何もない。したがってAGIの安全上の難題を懸念すべきで、その懸念は現在の研究優先順位へ反映されるべきである。
以下では、AGIの安全上の難題が、特化型AIの安全上の難題を延長したものにすぎないと疑う理由を述べ、MIRIの人々が実りあると予想する研究の方向性を、いくつか列挙する。
AGIがもたらす新しい安全上の難題
高保証AGIの研究を始めるという考えへの自然な反応は、AGI自体が数十年先に見えるというものだ。なぜ今、懸念するのか。そして懸念すべきだとしても、これほど早い段階で、AGI安全について役立つ研究を何か行えると、なぜ考えるのか。
第二の問いへ答えると、一見したところ、AGIへ効果的に備えるのは難しそうなのは事実である。しかし、この問題は一見だけで済ませずに検討する価値があるほど重要だ。気候変動の緩和や、小惑星の検出・軌道変更などの長期プロジェクトは、直観的には難しい。未来に予想される技術へ依存する介入、例えば量子コンピューターを見越した耐量子暗号の研究も同じである。それにもかかわらず、私たちはこうした分野で重要な進歩を遂げてきた。
秘密チャネル通信は一つの先例となる。実地で見つかる数十年前から研究され、成功を収めた。ロジャー・シェル(Roger Schell)は、ミュールハウザー(Muehlhauser, 2014b)で、ほかにも成功事例をいくつか挙げ、長期的なセキュリティー・安全研究が今なお珍しい理由を示唆している。初期段階のAGI安全研究も同じように生産的になるかは分からないが、この問いの基礎研究を行う前に、その可能性を排除すべきではない。次節では、調べ始められそうな場所をいくつか列挙する。
第一の問いはどうだろう。なぜ特にAGIを懸念するのか。
前述のとおり、AGIは、通常のAIが持つ多くの安全上の難題を極端に表したものである。しかしMIRIが特に懸念するのは、前例のない、AGI固有の振る舞いだ。例えば、AGIの問題解決能力(したがって科学・経済上の価値)は、その環境をモデル化する能力に左右される。環境には、人間であるプログラマーの性向をモデル化することも含まれる。プログラムの成功は、プログラマーの信念と選好に大きく左右されるため、何らかの最適化目標を追求するAIは、物質的環境への効果だけでなく、プログラマーの精神状態へ与える効果を考えて行動を選択できる。
つまり安全手順は、通常のソフトウェア故障とは質的に異なるリスクへ対応する必要がある。「プログラムは、人間の安全性検査に合格したほうが、プログラムされた目標を達成できるとモデル化するため、実際より安全だと(人間に)思わせる行動方針を選ぶ」といった、AGI固有の危険である。従来のソフトウェア設計の分類だけを使ってAGIの振る舞いをモデル化すれば、「欺瞞」を含む、新たな知的振る舞いを見落とすおそれがある。
同時に、こうした新しい性質を単純化しすぎると、AGIを擬人化してしまう。通常のソフトウェア妥当性確認手法を、高度な自律主体へすぐ一般化できると予想するのが素朴なら、人間 に有効な衝突防止戦略を、AIへすぐ一般化できると予想するのは、さらに素朴である。「欺瞞的」なAGIとは、その計画アルゴリズムが、何らかの人間の誤解を、プログラムされた目標へ道具として役立つものだと特定するAGIにすぎない。能力が似ていても、欺く方法や理由が、人間のものと似る必要はない。
人間社会では、「欺いてはならない」という規範や、ウェルドとエツィオーニ(Weld & Etzioni, 1994)の「人間が危害を受けるのを許してはならない」という規範を、比較的素早く、容易に考え、表現し、教える。人間を似た目標へ収束させる複雑な条件付き応答は、ブラックボックス、すなわち人間の脳という、文書化されていないスパゲティ・コードの内部に隠れたままである。社会的性向が認知・神経の水準で、どのように実装されているかを内省的に知ることができないため、私たちは、その性向がどれほど偶発的で複雑かを過小評価する可能性が高い。例えば、
- 特に知的なAIシステムには、とりわけ価値ある目標があるだろうと、私たちは予想するかもしれない。人間では、知識と洞察が、ほかの多くの美徳と結びついているからだ。例えばホールズ(Halls, 2007)は、人間では犯罪性が知能と負に相関することを根拠に、このように推測している。ボストロム(Bostrom, 2003)は、「思いやり」、「忠誠」、「新奇さ」のような、人間中心の最終価値へAIが収束すると予想する、特別な理由はないと答える。例えば超知能AIが、ペーパークリップを作ること以外に、一貫して目標を持たないこともあり得る。
- 「欺いてはならない」のような目標を、例えば「偽りだと考える情報を伝えてはならない」といった、より単純な目標へ分解し、主体へ直接手書きで組み込もうとするかもしれない。しかしその過程で、人間の子どもへ教えるときなら、暗黙のままで安全な種類の微妙さ、すなわち不作為による嘘、誤解を招く字義どおりの表現、新しい伝達方法、その他いくらでもある境界事例を、見落とす可能性が高い。ボストロム(2003)が指摘するとおり、主体の 知能 が人間心理をより深く理解するようになった後も、主体の 目標 は、プログラマーが要求事項をコード行へ拙く翻訳したものを、反映し続けるかもしれない。
- その代わり、機械学習を通じて、人道的な価値をAGIへ植えつけようとするかもしれない。例えば、笑顔の人間が映ったカメラ入力と結びつく帰結を、促進するよう訓練する。しかし強力な探索過程は、発達中の人間には決して思いつかないような解決策へ到達する可能性が高い。主体が時とともに、より強力または汎用的になるなら、当初は無害な出力も、長期的な安全性を示す指標としては不十分かもしれない。
高度AIは、強力な自己改変など、新たな安全上の障害を生む技術的能力も持つ可能性が高い。ユドコウスキー(Yudkowsky, 2013)を参照してほしい。
これらは、十分に理解されていない、いくつかの大きな故障形態の種類を簡単に示した例である。しかし最大のリスクは、私たちの直観にあまりに反するため、プログラマーにはまったく思いつかない種類の問題から生じるかもしれない。試験されていない直観や、まったく異なるシステムの過去の経験へ頼っても、あらゆる危険を捉えられる可能性は低い。
AGIは、知的でありながら人間でない主体として、根本的に新しい種類の安全上の難題をもたらす。そのため、予測と計画を立てられるほど、そのような主体を十分に理解するには、まずAGIの一般的な特徴について、基礎理論研究を行う必要がある。
初期段階
初期の理論的AGI安全研究は、どのような姿になるだろう。仮想的な技術を、どう審査するのか。システム検証を指向する研究プロジェクトと、システム要求事項を指向するプロジェクトを区別できる。
検証指向のAGI研究は、高度な自律主体が持つさまざまな特徴を確認する助けになる可能性が高い、既存のAI安全・セキュリティーの道具を拡張する。これに対し、要求事項指向のAGI研究は、望ましいAGIの能力や振る舞いを規定し、望ましい性質を示す簡略モデルを作ろうとする。次に、そのモデルを使い、克服すべき問題と、概念理解にある基本的な空白を特定する。
言い換えれば、検証指向の取り組みは、「未来の複雑なシステムが、その仕様と一致するという全体的な確信を高めるため、どのような道具と手順を使えるか」と問う。これには次が含まれる。
- AIシステムを検査する際の透明性を高める、新しい道具を開発する。ブースティングのような有用なAI技法は、場当たり的に試され、一連の問題で機能すると観察されてから、採用されることが多い。プログラムが いつ、なぜ 機能するかを理解すれば、より強い安全性・セキュリティー保証が可能になる。計算学習理論は、さまざまな機械学習アルゴリズムの性能上限・下限を証明するうえで、ここで役立つかもしれない。
- 容易に検証できる複雑なシステムを設計する技法を拡張する。HACMSやSAFEのように、あらゆる段階で高保証を維持する、白紙からのハードウェア・ソフトウェア手法へ取り組む。
- プログラム合成と形式検証の現在の技法を拡張し、高階プログラム検証や、スピアーズ(Spears, 2000, 2006)の段階的再検証など、複雑で適応的なシステムへ適用できる方法を重視する。既存の道具を拡張する。例えば、SPINモデル検査器を使いやすくするため、より優れたインターフェースと訓練方法を設計する。
- ホモトピー型理論を、プログラム検証へ適用する。この理論の一価性公理により、同型から同一性を導出できる。ハーパーとリカータ(Harper & Licata, 2011)は、これをアルゴリズムとして実装できれば、確信を大きく損なわず、高保証コードを新しい文脈で再利用できるかもしれないと示唆している。
- Verified Software Toolchainなど、検証済みソフトウェア・ライブラリーとコンパイラーの現在の蓄積を拡大する。プログラム検証研究の多くは現在、比較的小さなC言語ライブラリーなど、古いツールチェーンを対象にしている。より新しいツールチェーンへ重点を置くと、すでに広く使われるシステムを検証する能力は制約されるが、より高度で、安全性が決定的に重要なシステムを検証するための、よりよい態勢を整えられる。
要求事項指向の取り組みは、「AGIからどのような帰結を望む可能性が高く、どのような一般的な種類の主体なら、その帰結をもっとも容易にもたらせるか」と問う。要求事項指向の研究には、例えば次が含まれる。
- 知的な自己改変主体の、安定性の保証を形式化する。汎用知能は、自身を維持し、EURISKOのように、探索・意思決定ヒューリスティックの改善を含む、自らのソフトウェアとハードウェアの改良を実装する助けになり得る。AIが、自身の物体認識モジュールや音声合成モジュールへ、ときおり誤りを取り込むことは許容できるかもしれないが、自己改変を承認するモジュールを含め、中核的な意思決定アルゴリズムの完全性については、かなり強い保証が必要だろう。現在、ファレンシュタインとソアレス(Fallenstein & Soares, 2014)が論じる自己改変AIの簡略モデルは、自己参照の二つの逆説、「ローブ的障害」と「先延ばしの逆説」に直面する。現実世界のAGIにも同様の障害が生じるかもしれず、解決策を見つければ、自身について決定と予測を行うシステムの全般的理解が深まるはずである。
- AGIの振る舞いに対する、望ましい安全確認・制約機構を規定する。一部の基本的なアーキテクチャー選択によって、システムの出力チャネルを制限したり(例えば、アームストロングら(Armstrong et al., 2012)のオラクルAI)、緊急時のトリップワイヤーとフェイルセーフを組み込んだり(例えばシンプレックス・アーキテクチャー)することで、AGIをより安全にする作業が簡単になるかもしれない。AGIの安全確認・制約機構が特に難しいのは、主体自身の規制へ、積極的に協力させる必要があるからである。この要求が満たされなければ、主体は、ヤンポルスキー(Yampolskiy, 2012)による「箱のなかのAI」の議論のように、問題解決能力を、制約の抜け穴を探すために使うかもしれない。
- 知的主体が、利用者の要求事項に関するモデルを、時とともに改善するための汎用的方法を設計する。自律的な汎用知能の行動領域は、潜在的に無制限である。または制限されるとしても、どの制限が適用されるか、私たちには予測できないかもしれない。したがって、状況全般に安全な目標が必要である。しかし、普遍的に安全で有用な意思決定基準の集合を、手作業でコード化するのは、絶望的に難しそうだ。その代わり、デューイ(Dewey, 2011)の価値学習のような、何らかの間接規範的方法が、当初は不完全な意思決定主体が、時とともに目標内容を改善できるようにするため必要と思われる。関係する未解決問題には、有益なAIを訓練し、試験するため、どのような基礎事例を使えるか、訓練過程でAIを安全かつ安定にするにはどうすればよいか、というものがある。
- 任意の推論主体について、ほかの最適性基準を形式化する。汎用の適応主体に汎用の価値が必要となるのと同じく、環境と自身の特徴を追跡し、それにもとづいて行動方針を選ぶ、汎用の方法も必要となる。理想的な推論(例えばフッター(Hutter, 2012))、理想的な意思決定理論上の期待値計算(例えばアルテア(Altair, 2013))、理想的なゲーム理論上の協調(例えばバラスら(Barasz et al., 2014))を数学的にモデル化することは、AGIに厳密に必要となる可能性は低い。それでもAGIの 安全性 には必要となることが十分あり得る。こうしたモデルがあれば、人間による検査と検証のため、自律主体の構成要素を明快に構築できる、堅固なトップダウンの理論基盤が得られるからである。
実際に機能するAGIの構築より、かなり前から、どちらの種類のAGI安全研究でも、おそらく進歩を遂げられる。要求事項指向の研究は抽象的な数学的主体モデルへ重点を置くため、多種多様なソフトウェア実装へ適用できる可能性が高い。検証指向の取り組みも、現代のどのソフトウェアよりはるかに複雑で動的な未来のプログラムへ適用できるほど柔軟な限り、同じように価値を持つだろう。これは、スミスとウッドサイド(Smith & Woodside, 2000)やヒンチマンら(2012)にある、現代の高保証設計戦略と比較できる。後者は、より単純な自律機械についてこう書いている。
ソフトウェア分析技法が向上すれば、ソフトウェアの欠陥をもっと早く見つけることを目標に、設計時にソフトウェアを分析できる。その分析によって、誤りや否定的性質が存在しないことも証明できる。システムの複雑性と機能性が高まるにつれ、完全な試験は不可能になりつつあり、強化された分析技法を使わなければならない。さらにモデル検査など、こうしたソフトウェア技法の多くは、要求事項とシステム設計の分析に使い、コードを一行も書かないうちに、矛盾する要求事項や論理上の欠陥を発見できるため、従来の試験方法より多くの時間と資金を節約できる。
検証指向と要求事項指向の研究は、相互に補完し合う。望ましい性質を持つ主体の、明快な数学モデルを構築する目的は、振る舞いがプログラマーにとって十分透明で、厳密に検証できるシステムを設計しやすくすることにある。そして、そもそもどのような種類のシステムを望むのかについて、理解が乏しければ、検証手法はシステムの安全性を立証できない。
価値あるプロジェクトのなかには、この二分類の中間に入るものもある。例えば、原則にもとづく形式的 妥当性確認 の方法を開発することだ。これにより、プログラマーと利用者の目標を踏まえて、正しい性質を検証しているという確信を高められる。(形式的妥当性確認についてはシマッティら(Cimatti et al., 2012)を、認識上の疑いについてはラシュビー(Rushby, 2013)も参照してほしい。)
MIRIの焦点――知的主体の数学
MIRIの創設者エリエザー・ユドコウスキー(Eliezer Yudkowsky)は、自律的な高保証AGI、つまり「友好的AI(Friendly AI)」の研究を、もっとも声高に主張してきた一人である。ラッセルとノーヴィグ(Russell & Norvig, 2009)はこう書いている。
[この]難題はメカニズム・デザインの問題である。抑制と均衡の仕組みのもとでAIシステムを発展させる仕組みを定義し、その変化に直面しても友好的なままとなる効用関数を、システムへ与えることである。状況と、状況に対して私たちが望む応答は、時とともに変わるため、プログラムへ静的な効用関数を与えるだけでは済まない。
MIRIの取り組みは主に要求事項指向である。その理由の一つは、この方向から取り組むことで、問題空間全体について理論的理解が深まり、研究優先順位と、ほかの戦略上の考慮事項が改善される可能性が高いことだ。さらに、関係する理論計算機科学と数学の領域には、はるかに研究者が少なそうである。要求事項指向のAGI安全研究には、研究者が明確な未解決問題の集合、発表の場、指導者、同僚を見つけられるような、確立した下位分野やパラダイムが存在しない。
MIRIは、現在の形式検証手法の上に築くより、こうした新しい研究の方向性を立ち上げることを優先している。ミュールハウザー(Muehlhauser, 2013)は、工学上の革新は以前の数学研究に萌芽を持つことが多く、その数学研究は、形式化されていない哲学的な問いから着想を得ることがある、と書いている。現時点で、AGI安全研究はようやく「数学」の段階へ入り始めたばかりだ。友好的AIの研究者は、AGIが持つ可能性の高い性質やサブシステムの単純化モデルを構築し、そのモデルの特徴を形式的に導出し、一般的または個別事例ごとの規範と照合する。
AGI安全は研究があまりに少ないため、「未知の環境にいる形式的主体には、どのような事前確率分布がもっともうまく機能するか」といった基本的な問いを調べるだけでも、取りやすい成果が見つかる可能性が高い。ゲルヴィン・クライン(Gerwin Klein)がミュールハウザー(2014a)で指摘するとおり、「結局、人間がシステムについて考えやすくなるものはすべて、その検証に役立つ」。そしてMIRIの研究課題は、社会的影響への考慮によって決められるものの、理論計算機科学と数理論理学の中核的な未解決問題に関係し、一般的な知的関心も引く。
同時に、AGIの性質を形式的に証明しても、それは特に強い確率的証拠としてしか機能しない、と覚えておくことが重要である。コンピューター科学の形式手法は、リスクと不確実性を減らせるが、なくすことはできない。仮定が不確かなら、結論も不確かになる。
AGIの安全性について、完全な確信へ到達することは決してできない。それでも、破滅的な失敗の確率は減らせる。その過程で、AGIが私たちの予想に反し得る、もっとも重要な方法を、よりよく理解できる可能性が高い。理論上のシステムとしてAGIをよりよく理解する研究を今から始めれば、今後数十年にAIの知能と自律性が高まるにつれ、堅牢な安全対策を実装する態勢を、よりよく整えられる。
謝辞
本稿へ意見を寄せてくれた、ルーク・ミュールハウザー(Luke Muehlhauser)、シヴァラム・リンガムネニ(Shivaram Lingamneni)、マット・エルダー(Matt Elder)、ケヴィン・カールソン(Kevin Carlson)、ほかの皆さんへ感謝する。
参考文献
- Altair (2013). ニューカム型問題における意思決定アルゴリズムの比較. Machine Intelligence Research Institute.
- Armstrong et al. (2012). 箱のなかで考える――オラクルAIの制御と利用. Minds and Machines, 22: 299-324.
- Barasz et al. (2014). 囚人のジレンマにおける堅牢な協力――確率論理によるプログラム均衡. arXiv.
- Bostrom (2003). 高度人工知能における倫理的問題. In Smith et al. (eds.), Cognitive, Emotive and Ethical Aspects of Decision-Making in Humans and in Artificial Intelligence, 2: 12-17.
- Cimatti et al. (2012). ハイブリッド・システムの要求事項の妥当性確認――形式的アプローチ. ACM Transactions on Software Engineering and Methodology, 21.
- Dewey (2011). 何を価値とするかを学ぶ. Artificial General Intelligence 4th International Conference Proceedings: 309-314.
- Fallenstein & Soares (2014). 自己改良する時空埋め込み知能における自己参照の問題. Working paper.
- Halls (2007). Beyond AI: Creating the Conscience of the Machine.
- Harper & Licata (2011). 高次元有向型理論の基礎と応用. National Science Foundation grant proposal.
- Hinchman et al. (2012). 空軍の飛行安全上重要なシステムにおける、信頼できる自律性の安全保証に向けて. Layered Assurance Workshop, 17.
- Hutter (2012). 万能人工知能の10年. Theoretical Foundations of Artificial General Intelligence, 4: 67-88.
- Menzies & Pecheur (2005). 検証、妥当性確認、人工知能. Advances in Computers, 65: 154-203.
- Muehlhauser (2013). 哲学から数学、工学へ. MIRI Blog.
- Muehlhauser (2014a). ゲルヴィン・クラインが語る形式手法. MIRI Blog.
- Muehlhauser (2014b). ロジャー・シェルが語るコンピューター・セキュリティーの長期研究. MIRI Blog.
- Rushby (2013). 安全性ケースにおける論理と認識論. Computer Safety, Reliability, and Security: Proceedings of SafeComp 32 (pp. 1-7).
- Russell & Norvig (2009). Artificial Intelligence: A Modern Approach.
- Smith & Woodside (2000). ソフトウェア開発初期段階における性能の妥当性確認. In Gelenbe (ed.), System Performance Evaluation: Methodologies and Applications (pp. 383-396).
- Spears (2000). アシモフ型適応主体. Journal of Artificial Intelligence Research, 13: 95-153.
- Spears (2006). 適応主体の振る舞いを保証する. In Rouff et al. (eds.), Agent Technology from a Formal Perspective (pp. 227-257).
- Weld & Etzioni (1994). ロボット工学の第一法則(決起の呼びかけ). Proceedings of the Twelfth National Conference on Artificial Intelligence: 1042-1047.
- Yampolskiy (2012). シンギュラリティーの漏れ防止――人工知能の閉じ込め問題. Journal of Consciousness Studies, 19: 194-214.
- Yudkowsky (2013). 知能爆発のミクロ経済学. Technical report.