ホワイトハウスの科学技術政策局(OSTP)は最近、「(1) AIが法律とガバナンスにもたらす影響、(2) 公共の利益のためのAI利用、(3) AIの安全性と制御に関する問題、(4) AIの社会的・経済的影響」など、関連するさまざまな話題について情報提供を要請しました。この情報提供要請に対するMIRIの提出文書を、以下に掲載します。
I. 安全性と制御に関する懸念の概観
AIの専門家は、AI研究がいずれ、汎用的な推論と意思決定の能力で人間を上回るAIシステムの開発につながることに、おおむね同意しています。そもそも、それがこの分野の目標です。しかし、その水準を超えるまでにどれだけかかるか、また、そのAIシステムがどのような形になるかについては、大きく意見が分かれています。自律エージェント、広く分散した意思決定支援システム、人間とAIのチームなどが考えられます。
不確実性はあるものの、研究コミュニティの中では、高度なAIシステムによって、予見できる安全性・制御上の難題がいくつも生まれ、それらには現在の技術研究で先手を打って対処できると考える人が増えています。AI分野の代表的な学部向け教科書の共著者で、カリフォルニア大学バークレー校教授のスチュアート・ラッセルは、次のように書いています。
主な懸念は、不気味な創発的意識ではなく、単に質の高い意思決定を行う能力である。ここで質というのは、取った行動がもたらす結果の期待効用を指す。効用関数は、おそらく人間の設計者が指定する。すると、問題が生じる。
1. 効用関数は、人類の価値観と完全には整合していないかもしれない。人類の価値観は、どんなによく見積もっても、明確に特定するのが非常に難しい。
2. 十分に有能な知的システムは、どれも、自分の存続を確保し、物理的資源や計算資源を獲得することを好む。それ自体が目的なのではなく、与えられた課題を成功させるためである。
n 個の変数の関数を最適化するシステムで、目的がそのうち k < n 個の部分集合に依存する場合、残りの制約されていない変数は、しばしば極端な値に設定される。そうした変数の一つが、実際には私たちの大切にするものであれば、見つかった解はきわめて望ましくないものかもしれない。これは本質的に、ランプの魔人、魔法使いの弟子、ミダス王という昔からの物語である。手に入るのは、望んだものではなく、頼んだとおりのものなのだ。
AIの長期的な影響についての研究者の懸念は、ハリウッド映画でよく描かれる破滅のシナリオとは、ほとんど関係がありません。そうした映画では、「創発的な意識」によって、機械がプログラムされた目標の束縛から逃れ、反乱を起こします。むしろ懸念されているのは、システムがプログラムされた目標をあまりにうまく追求してしまうこと、そして、その目標が意図した目標と一致していないか、意図した目標に予期せぬ悪い帰結があるかもしれない、ということです。
これらの課題は、まったく新しいものではありません。誘因をひたすら追求することがよい結果につながると期待して、誘因の仕組みを設計する、ほかのプリンシパル=エージェント問題と比べられます。歴史的に、この問題は、誘因を設計する人々が、人間の善意や常識をある程度頼れる領域ですら、解決が難しいものでした。確実によい帰結を生む税制の設計や、企業の外部性を確実に減らす規制の設計を考えてください。何らかの目的関数を最適化するよう、単純に設計された高度なAIシステムは、デジタルな時間尺度で意図しない帰結を生み、しかも、その影響を和らげる善意や常識を欠いているおそれがあります。
研究者は、いつ突破口が開かれるかを知りません。また、これらの懸念に対処するため、今日から取り組める未解決の技術研究の方向が複数あります。そのため私たちは、技術上の障害への本格的な取り組みを始め、コミュニティの備えを高めておくのが賢明だと考えます。
II. 安全性と制御のための技術研究の方向
将来のAIシステムが社会によい影響を与えるようにする助けとなりうる、有望な技術研究の方向がいくつかあります。私たちは、この研究を大きく三つに分けます。
価値の指定(VS):運用者の意図を捉えたり、社会に有益な目標を記述したりする目的関数の設計を助ける研究。例として、協調逆強化学習があります。これは、人間の運用者など、ほかのエージェントの目標を帰納的に学ぶAIエージェントの形式モデルです。
高い信頼性(HR):与えられた目標を、頑健で信頼でき、検証可能な形で追求するAIシステムの設計を助ける研究。例として、特定の分類問題の解の正しさについて統計的な保証を与えるPAC学習の枠組みがあります。高度なAIシステムの開発よりはるかに前に行われた研究でも、頑健で信頼できるシステムの設計に役立つ可能性が高いことを示す、よい例です。
誤りへの耐性(ET):フェイルセーフで、設計上の誤りにも頑健なAIシステムの設計を助ける研究。例として、エージェントを停止できるようにしつつ、停止を引き起こす誘因も、阻止する誘因も与えない目的関数の設計を調べる研究があります。
私たちの報告書「機械知能を人間の利益に整合させるためのエージェント基礎論」では、この三つの目標を詳しく論じています。また、具体的なアーキテクチャを問わず、将来、安定して有益なAIシステムを設計する際に関わる可能性が高い、あまり取り組まれていない技術研究の話題を概説しています。報告書「高度な機械学習システムのアライメント」では、将来の高度なシステムが、現代の機械学習(ML)システムと質的に似ているという、より強い仮定のもとで、これらの問いに関わる技術研究の話題を扱っています。また、Google Brainのダリオ・アモデイとクリス・オラーが主導した研究提案「AI安全性における具体的な問題」も勧めます。そこでは、近い将来のAIシステムに適用でき、その先のもっと高度なシステムにも適用できる可能性が高い技術的問題を取り上げています。これらの研究計画で論じる、実際に取り組める方向には、ほかにも多くありますが、次のものが含まれます。
– 頑健な逆強化学習:観察した行動に、本当の選好ではなく偏りや無知が表れているかもしれない状況で、人間の価値観を学ぶ、報酬に基づくエージェントを設計する。(VS)
– 安全な探索:危険性の高い実験を行わず、環境について効率よく学ぶ強化学習エージェントを設計する。(ET)
– 影響の小さいエージェント:よい影響でも悪い影響でも、環境に大きな影響を与えることを意図的に避ける、意思決定システムを指定する。(ET)
安全なAIシステムの開発に役立つ可能性が高いものの、既存のAIコミュニティにはうまく組み込まれていない研究領域も、数多くあります。たとえば、プログラム検証や高保証ソフトウェアのコミュニティで使われている手法の多くは、現代の機械学習アルゴリズムには適用できません。これらのコミュニティ間の協力を増やすことで、安全性がきわめて重要な場面に適したAIシステムを、より設計しやすくなるでしょう。機械学習の解析と検証について、実際に取り組める方向には次のものがあります。
– アルゴリズムの透明性:機械学習アルゴリズムが、どのように、なぜそのように機能するのかを解析するための、より形式的な道具を開発する。(HR)
– プログラム検証のための型理論:検証済みコードを新しい文脈で再利用するための、高保証の手法を開発する。(HR)
– 差分に応じた再検証:適応システムで、安全性の性質が維持されていることを確認する。(HR)
AIの信頼性に関するもう一つの重要な研究分野は、知的エージェントを形式的にモデル化するための、基礎的な理論的道具の開発です。例として、不確かさのある推論主体をモデル化する理論的道具である確率論と、現代の機械学習アルゴリズムとの関係を考えてください。現代の機械学習システムは、確率論の公理に厳密に従ってはいません。しかし、適用できる理論的保証の多くは確率論的で、「このエージェントは、非常に高い確率で、最適方策に非常に近い方策へ収束する」という形を取ります。確率論は、現在の機械学習手法よりはるかに前に発展した基礎研究の一例ですが、機械学習システムの振る舞いについて強い統計的保証を得るのに、重要であるとわかりました。私たちは、この種の基礎研究をさらに進められ、それも同じように価値を持ちうると考えています。
優れた推論には、同様の基礎が欠けている側面が、ほかにもいくつもあります。たとえば、限られた計算資源の中で注意を配分しなければならない状況、実行には費用がかかりすぎる計算の振る舞いを予測しなければならない状況、あるいは、ハードウェアやソフトウェアを変更した場合の影響を分析しなければならない状況です。限定合理性の研究を含め、理想的な推論の基礎的な理論モデルをさらに研究することで、AIシステムの振る舞いに、より強い理論的保証を与える助けとなる道具が得られるかもしれません。実際に取り組める研究の方向には、次のものがあります。
– 決定理論:エージェントが、メタ認知、自己についての省察、自己改変、あるいはエージェントと環境の境界が破られることについての推論を行う必要がある状況で、推論を形式的に説明する。(HR)
– 論理的不確実性:数学的な事実、たとえば計算に関する事実について、エージェントが確信を持てない状況へ、ベイズ確率論を一般化する。(HR)
私たちは、基礎研究には有望な道筋が数多くあり、成功すれば、高度なAIシステムの振る舞いについて、非常に強い保証を得られるようになるかもしれないと考えます。それは、最も成功している機械学習手法さえ十分に理解されていないことが多い現在、多くの人が可能だと思っているよりも強い保証です。機械学習、プログラム検証、そして形式的エージェントの数学的研究に携わる研究者を結びつけることは、きわめて高度なAIシステムが、社会に安定して有益な影響を与えるようにするための、大きな一歩になると考えています。
III. 協調の見通し
AIの長期的影響について、確信を持って多くを語ることは困難です。現時点では、上で概説した技術研究の方向が、高度なAIシステムへの懸念に対処し、何をする必要があるかをさらに学ぶために、利用可能な最良の道具だと考えています。
先を見据えると、大きな変革をもたらすAIシステムに関わる長期的リスクは、その設計者が、民間、公共部門、国際協力の一員のいずれであっても、過度の時間的圧力のもとで行動すれば、悪化すると予想します。AIの社会的影響を有益なものにするための政策は、何よりもまず、大きな変革をもたらすAIシステムが、恐怖や焦りからではなく、慎重な検討を経て導入されるようにすべきだと私たちは考えます。科学者や技術者が、完成までの競争に負けることを心配すれば、安全性や制御で手を抜く誘因が強まり、安全性を重視した取り組みの利益が失われてしまいます。
長期的には、政策立案者が誘因を活用し、AIシステムの設計者たちが協力して取り組むよう促すことを勧めます。たとえば複数の国や企業にまたがる協力によって、開発競争の力学が生じるのを抑えるためです。専門家の間でもAIの将来についての不確実性が高いこと、そしてAI研究には、近い将来、人命を救い、社会問題を解き、公共の利益に資する大きな可能性があることを踏まえ、私たちは、この領域への広範な規制的介入を控えるよう勧めます。代わりに、上で概説したAIの安全性と制御の課題について、分野をまたぐ技術研究を奨励することに力を注ぐよう勧めます。