非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

AGI安全工学の基礎固め

原題: Groundwork for AGI safety engineering / Analysis

原文クレジット(WordPress投稿者表示): Rob Bensinger / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2014-08-04

訳文状態: 校閲済み(原文対照レビュー実施)

AIの進歩によって、ますます複雑で創造的な人間の振る舞いが自動化されつつある。十分な時間がたてば、人工的な推論主体は、任意の領域で人間に匹敵し始め、最終的に汎用人工知能(AGI)へ到達すると予想すべきである。

ここで意図する意味で、ある機械が「AGI」に当たるのは、極めて広範な状況へ適応し、何らかの目標を一貫して達成できる場合である。そのような機械は、任意の物理環境と計算環境を与えられたとき、知的に振る舞うだろう。それは、Deep Blueが任意のチェス盤の配置を与えられたとき、より狭いその領域で勝利条件を一貫して満たし、知的に振る舞うのと同じ意味である。

汎用知能を持つソフトウェアは、科学で仮説を考え、試験する過程の自動化に役立つため、AGIは技術発展を速めるうえで、比類ない価値を持つだろう。しかし、この広範な生産性は、安全性の観点からも、AGIを比類ない難題にする。未来のAGIのアーキテクチャーについて、ほとんど何も知らなくても、安全性に関係する一般化をいくつか行える。

現在のAIソフトウェアも、その複雑さと、状態空間爆発に直面したときの不確かな振る舞いのため、すでに検証と妥当性確認が難しい。メンジーズとペシュール(Menzies & Pecheur, 2005)は、AIの検証と妥当性確認(V&V)の方法をうまく概説し、AI、特に適応型AIが、望ましくない予想外の振る舞いを、しばしば生むと指摘している。

地球から直接操縦できない火星探査車のように、自律行動する適応型AIは、難しさをさらに大幅に高める。自律的で、安全性が決定的に重要なAI主体は、動的な環境で、故障率を極めて低く保ちながら、不可逆な決定を行う必要がある。自律システムの安全研究における最先端は進歩しているものの、システム能力の研究には後れ続けている。ヒンチマンら(Hinchman et al., 2012)はこう書いている。

自律システムが複雑になるにつれ、システムを完全に試験し、すべての問題を発見できるという考えは、達成不可能になりつつある。無人/自律システムでは特にそうである。複雑なシステムで完全な試験を行うのは、ますます難しくなっている。こうしたシステムが、より多くの環境[刺激]へ反応し、より大きな意思決定空間を持つようになると、取り得るすべての状態と、システムへの入力の全範囲を試験するのは不可能になりつつある。[……]システムが複雑になるにつれ、安全性は実際にはリスク・ハザード分析、すなわち、量xの試験を行ったところ、システムは安全に見える、というものになる。根本的な変化が必要である。この変化は、2010年の空軍Technology Horizon報告でも強調された。「高水準の自律性を備えたシステムを開発することは可能だが、比較的低い水準を超える自律性を、使用認定できない原因は、適切なV&V手法がないことである」。[……]

より自律的なシステムへの移行により、[高度な検証・妥当性確認の技法と方法論への]この必要性は、国家規模へ引き上げられた。

すると、任意の領域で 自律行動するAIは、特に検証が難しそうである。AI手法が効率と汎用性の面で急速に進歩し続け、特に、その進歩によってAIアルゴリズムが、人間の検査に対してさらに不透明になるなら、AI安全工学は未来にさらに難しくなる。AGIへ至るまでに、高保証AGIを容易にする(またはAGI自体の可能性を低くする)進展が起きると予想する理由は何もない。したがってAGIの安全上の難題を懸念すべきで、その懸念は現在の研究優先順位へ反映されるべきである。

以下では、AGIの安全上の難題が、特化型AIの安全上の難題を延長したものにすぎないと疑う理由を述べ、MIRIの人々が実りあると予想する研究の方向性を、いくつか列挙する。

AGIがもたらす新しい安全上の難題

高保証AGIの研究を始めるという考えへの自然な反応は、AGI自体が数十年先に見えるというものだ。なぜ今、懸念するのか。そして懸念すべきだとしても、これほど早い段階で、AGI安全について役立つ研究を何か行えると、なぜ考えるのか。

第二の問いへ答えると、一見したところ、AGIへ効果的に備えるのは難しそうなのは事実である。しかし、この問題は一見だけで済ませずに検討する価値があるほど重要だ。気候変動の緩和や、小惑星の検出・軌道変更などの長期プロジェクトは、直観的には難しい。未来に予想される技術へ依存する介入、例えば量子コンピューターを見越した耐量子暗号の研究も同じである。それにもかかわらず、私たちはこうした分野で重要な進歩を遂げてきた。

秘密チャネル通信は一つの先例となる。実地で見つかる数十年前から研究され、成功を収めた。ロジャー・シェル(Roger Schell)は、ミュールハウザー(Muehlhauser, 2014b)で、ほかにも成功事例をいくつか挙げ、長期的なセキュリティー・安全研究が今なお珍しい理由を示唆している。初期段階のAGI安全研究も同じように生産的になるかは分からないが、この問いの基礎研究を行う前に、その可能性を排除すべきではない。次節では、調べ始められそうな場所をいくつか列挙する。

第一の問いはどうだろう。なぜ特にAGIを懸念するのか。

前述のとおり、AGIは、通常のAIが持つ多くの安全上の難題を極端に表したものである。しかしMIRIが特に懸念するのは、前例のない、AGI固有の振る舞いだ。例えば、AGIの問題解決能力(したがって科学・経済上の価値)は、その環境をモデル化する能力に左右される。環境には、人間であるプログラマーの性向をモデル化することも含まれる。プログラムの成功は、プログラマーの信念と選好に大きく左右されるため、何らかの最適化目標を追求するAIは、物質的環境への効果だけでなく、プログラマーの精神状態へ与える効果を考えて行動を選択できる。

つまり安全手順は、通常のソフトウェア故障とは質的に異なるリスクへ対応する必要がある。「プログラムは、人間の安全性検査に合格したほうが、プログラムされた目標を達成できるとモデル化するため、実際より安全だと(人間に)思わせる行動方針を選ぶ」といった、AGI固有の危険である。従来のソフトウェア設計の分類だけを使ってAGIの振る舞いをモデル化すれば、「欺瞞」を含む、新たな知的振る舞いを見落とすおそれがある。

同時に、こうした新しい性質を単純化しすぎると、AGIを擬人化してしまう。通常のソフトウェア妥当性確認手法を、高度な自律主体へすぐ一般化できると予想するのが素朴なら、人間 に有効な衝突防止戦略を、AIへすぐ一般化できると予想するのは、さらに素朴である。「欺瞞的」なAGIとは、その計画アルゴリズムが、何らかの人間の誤解を、プログラムされた目標へ道具として役立つものだと特定するAGIにすぎない。能力が似ていても、欺く方法や理由が、人間のものと似る必要はない。

人間社会では、「欺いてはならない」という規範や、ウェルドとエツィオーニ(Weld & Etzioni, 1994)の「人間が危害を受けるのを許してはならない」という規範を、比較的素早く、容易に考え、表現し、教える。人間を似た目標へ収束させる複雑な条件付き応答は、ブラックボックス、すなわち人間の脳という、文書化されていないスパゲティ・コードの内部に隠れたままである。社会的性向が認知・神経の水準で、どのように実装されているかを内省的に知ることができないため、私たちは、その性向がどれほど偶発的で複雑かを過小評価する可能性が高い。例えば、

高度AIは、強力な自己改変など、新たな安全上の障害を生む技術的能力も持つ可能性が高い。ユドコウスキー(Yudkowsky, 2013)を参照してほしい。

これらは、十分に理解されていない、いくつかの大きな故障形態の種類を簡単に示した例である。しかし最大のリスクは、私たちの直観にあまりに反するため、プログラマーにはまったく思いつかない種類の問題から生じるかもしれない。試験されていない直観や、まったく異なるシステムの過去の経験へ頼っても、あらゆる危険を捉えられる可能性は低い。

AGIは、知的でありながら人間でない主体として、根本的に新しい種類の安全上の難題をもたらす。そのため、予測と計画を立てられるほど、そのような主体を十分に理解するには、まずAGIの一般的な特徴について、基礎理論研究を行う必要がある。

初期段階

初期の理論的AGI安全研究は、どのような姿になるだろう。仮想的な技術を、どう審査するのか。システム検証を指向する研究プロジェクトと、システム要求事項を指向するプロジェクトを区別できる。

検証指向のAGI研究は、高度な自律主体が持つさまざまな特徴を確認する助けになる可能性が高い、既存のAI安全・セキュリティーの道具を拡張する。これに対し、要求事項指向のAGI研究は、望ましいAGIの能力や振る舞いを規定し、望ましい性質を示す簡略モデルを作ろうとする。次に、そのモデルを使い、克服すべき問題と、概念理解にある基本的な空白を特定する。

言い換えれば、検証指向の取り組みは、「未来の複雑なシステムが、その仕様と一致するという全体的な確信を高めるため、どのような道具と手順を使えるか」と問う。これには次が含まれる。

要求事項指向の取り組みは、「AGIからどのような帰結を望む可能性が高く、どのような一般的な種類の主体なら、その帰結をもっとも容易にもたらせるか」と問う。要求事項指向の研究には、例えば次が含まれる。

実際に機能するAGIの構築より、かなり前から、どちらの種類のAGI安全研究でも、おそらく進歩を遂げられる。要求事項指向の研究は抽象的な数学的主体モデルへ重点を置くため、多種多様なソフトウェア実装へ適用できる可能性が高い。検証指向の取り組みも、現代のどのソフトウェアよりはるかに複雑で動的な未来のプログラムへ適用できるほど柔軟な限り、同じように価値を持つだろう。これは、スミスとウッドサイド(Smith & Woodside, 2000)やヒンチマンら(2012)にある、現代の高保証設計戦略と比較できる。後者は、より単純な自律機械についてこう書いている。

ソフトウェア分析技法が向上すれば、ソフトウェアの欠陥をもっと早く見つけることを目標に、設計時にソフトウェアを分析できる。その分析によって、誤りや否定的性質が存在しないことも証明できる。システムの複雑性と機能性が高まるにつれ、完全な試験は不可能になりつつあり、強化された分析技法を使わなければならない。さらにモデル検査など、こうしたソフトウェア技法の多くは、要求事項とシステム設計の分析に使い、コードを一行も書かないうちに、矛盾する要求事項や論理上の欠陥を発見できるため、従来の試験方法より多くの時間と資金を節約できる。

検証指向と要求事項指向の研究は、相互に補完し合う。望ましい性質を持つ主体の、明快な数学モデルを構築する目的は、振る舞いがプログラマーにとって十分透明で、厳密に検証できるシステムを設計しやすくすることにある。そして、そもそもどのような種類のシステムを望むのかについて、理解が乏しければ、検証手法はシステムの安全性を立証できない。

価値あるプロジェクトのなかには、この二分類の中間に入るものもある。例えば、原則にもとづく形式的 妥当性確認 の方法を開発することだ。これにより、プログラマーと利用者の目標を踏まえて、正しい性質を検証しているという確信を高められる。(形式的妥当性確認についてはシマッティら(Cimatti et al., 2012)を、認識上の疑いについてはラシュビー(Rushby, 2013)も参照してほしい。)

MIRIの焦点――知的主体の数学

MIRIの創設者エリエザー・ユドコウスキー(Eliezer Yudkowsky)は、自律的な高保証AGI、つまり「友好的AI(Friendly AI)」の研究を、もっとも声高に主張してきた一人である。ラッセルとノーヴィグ(Russell & Norvig, 2009)はこう書いている。

[この]難題はメカニズム・デザインの問題である。抑制と均衡の仕組みのもとでAIシステムを発展させる仕組みを定義し、その変化に直面しても友好的なままとなる効用関数を、システムへ与えることである。状況と、状況に対して私たちが望む応答は、時とともに変わるため、プログラムへ静的な効用関数を与えるだけでは済まない。

MIRIの取り組みは主に要求事項指向である。その理由の一つは、この方向から取り組むことで、問題空間全体について理論的理解が深まり、研究優先順位と、ほかの戦略上の考慮事項が改善される可能性が高いことだ。さらに、関係する理論計算機科学と数学の領域には、はるかに研究者が少なそうである。要求事項指向のAGI安全研究には、研究者が明確な未解決問題の集合、発表の場、指導者、同僚を見つけられるような、確立した下位分野やパラダイムが存在しない。

MIRIは、現在の形式検証手法の上に築くより、こうした新しい研究の方向性を立ち上げることを優先している。ミュールハウザー(Muehlhauser, 2013)は、工学上の革新は以前の数学研究に萌芽を持つことが多く、その数学研究は、形式化されていない哲学的な問いから着想を得ることがある、と書いている。現時点で、AGI安全研究はようやく「数学」の段階へ入り始めたばかりだ。友好的AIの研究者は、AGIが持つ可能性の高い性質やサブシステムの単純化モデルを構築し、そのモデルの特徴を形式的に導出し、一般的または個別事例ごとの規範と照合する。

AGI安全は研究があまりに少ないため、「未知の環境にいる形式的主体には、どのような事前確率分布がもっともうまく機能するか」といった基本的な問いを調べるだけでも、取りやすい成果が見つかる可能性が高い。ゲルヴィン・クライン(Gerwin Klein)がミュールハウザー(2014a)で指摘するとおり、「結局、人間がシステムについて考えやすくなるものはすべて、その検証に役立つ」。そしてMIRIの研究課題は、社会的影響への考慮によって決められるものの、理論計算機科学と数理論理学の中核的な未解決問題に関係し、一般的な知的関心も引く。

同時に、AGIの性質を形式的に証明しても、それは特に強い確率的証拠としてしか機能しない、と覚えておくことが重要である。コンピューター科学の形式手法は、リスクと不確実性を減らせるが、なくすことはできない。仮定が不確かなら、結論も不確かになる。

AGIの安全性について、完全な確信へ到達することは決してできない。それでも、破滅的な失敗の確率は減らせる。その過程で、AGIが私たちの予想に反し得る、もっとも重要な方法を、よりよく理解できる可能性が高い。理論上のシステムとしてAGIをよりよく理解する研究を今から始めれば、今後数十年にAIの知能と自律性が高まるにつれ、堅牢な安全対策を実装する態勢を、よりよく整えられる。

謝辞

本稿へ意見を寄せてくれた、ルーク・ミュールハウザー(Luke Muehlhauser)、シヴァラム・リンガムネニ(Shivaram Lingamneni)、マット・エルダー(Matt Elder)、ケヴィン・カールソン(Kevin Carlson)、ほかの皆さんへ感謝する。


参考文献