MIRIはカリフォルニア州バークレーを拠点とする非営利の研究団体だ。人間より賢いAIシステムが世界によい影響をもたらすようにするため、技術的な研究を行っている。このページでは、それが今から取り組むべききわめて重要な目標だと考える理由を、大まかに説明する。
AGI安全性研究の背景にある議論と概念
人類が社会的・技術的に優位に立っているのは、主に、推論し、計画を立て、科学を営む能力に優れているからだ(アームストロング)。この能力を汎用知能と呼ぶことにしよう(ミュールハウザー)。「汎用」というのは、人類が理論物理学、ソフトウェア工学、心臓外科を行うために、何百万年もかけてそれぞれ別の機能を進化させる必要はなかったからだ。むしろ、人間をチンパンジーから分ける比較的少数の適応が、これらすべての能力を同時に可能にしているはずである。
「汎用人工知能」(AGI)や「人間より賢いAI」と言うとき、私たちが念頭に置いているのは、この汎用的な問題解決能力だ。AIシステムは、ほかの面ではとくに人間らしくなくても、科学や工学の能力で人間を超えるようになるかもしれない。たとえば人工的な知能があるからといって、人工的な意識や感情があるとは限らない。ここで考えているのは、現実の環境をうまくモデル化し、その環境を新しい状態へ変えるさまざまな方法を見つける能力である。
AIのリスク低減に重点を置くべきだという議論は、将来のAIシステムがどう実装され、使われるかについて、多くの仮定を必要としない。私たちが鍵になると考える主張は、次のとおりだ。
- 高度なAIシステムにどのような問題・課題・目標を与えても、それはおそらく、現実世界で私たちが達成したいことと完全には一致しない。私たちの価値観の共通する部分について、その細部のすべてをAIに教えるための、莫大で何世代にもわたる努力をしない限り、現実的なシステムは、私たちの望みを不完全に近似したものや、その代理指標に頼らざるをえない(ソアレス、ユドコウスキー)。
- システムに与えた問題・課題・目標が、私たちの本当の目標を十分に捉えていなければ、そのシステムは結局、私たちが実際に望んでいることと破局的に衝突する動機をもつ可能性が高い(ボストロム、ラッセル、ベンソン=ティルセンとソアレス)。
- AIシステムは人間よりはるかに賢くなりうる(ボストロム)。その差は、どのような対立でもAI側に決定的な優位を与えるほどになる可能性が高い(ソアレス、ブランウェン)。
- 人間より賢いAIがいつ開発されるかを予測するのは難しい。15年先かもしれないし、150年先かもしれない(Open Philanthropy Project)。さらに、AIが人間水準の能力に近づくにつれて進歩は加速する可能性が高く、ゴールが見えてから研究の方向を変えようとしても、時間はほとんど残されていないだろう(ベンシンガー)。
スチュアート・ラッセルのケンブリッジでの講演は、長期的なAIリスクへの優れた入門だ。汎用AIについてこの種の懸念を表明した、ほかの第一線のAI研究者には、フランチェスカ・ロッシ(IBM)、シェーン・レッグ(Google DeepMind)、エリック・ホーヴィッツ(Microsoft)、バート・セルマン(コーネル大学)、イリヤ・サツケヴァー(OpenAI)、アンドリュー・デイヴィソン(インペリアル・カレッジ・ロンドン)、デイヴィッド・マカレスター(TTIC)、ユルゲン・シュミットフーバー(IDSIA)などがいる。
ここから私たちが引き出す結論は、関連する研究課題を見つけられるなら、将来のAIシステムを私たちの利益に沿うようにする研究を、早い段階から優先すべきだということだ。AIアライメントは、AIそのものより何倍も難しいとわかっても不思議ではない。そうだとすれば、現在の研究努力の配分は大きく間違っている。
アライメント研究には、安定して頑健なAIシステムをつくり、理解するための形式的・理論的な道具の開発(「高い信頼性」)、私たちの価値観をAIシステム内でよりよく近似する方法の探索(「価値の指定」)、信頼性や価値の指定が完全ではないシステムのリスクを減らすこと(「誤りへの耐性」)などが含まれる。
これらの問題に対するMIRIの取り組み方
MIRIは、この問題でどう前進しようとしているのか。大まかに言えば、人間より賢いAIシステムすべての可能性は、きわめて広大で、多種多様なものを含む空間だと考えられる。その中で「アライメントが可能なAI設計」は、小さく狭い標的であり、「アライメント済みのAI設計」はさらに小さく狭い。私たちは一般に、今ここでアライメント研究に一人加わるとしたら、その人ができる最も重要な貢献は、人類が最初に設計する汎用知能システムを「アライメントが可能な」領域に入れる手助けをすることだと考えている。
開発中のシステムがどう推論し、その推論が意図した目標にどうつながるかについて、研究者が原理にもとづいてかなりよく理解していない限り、それは実現しそうにない。そこで私たちの仕事の大半は、アライメントが可能だと私たちが予想する設計の近くで、AI研究がさらに進むきっかけになりうる発想を、この分野にまくことを目指している。最初の汎用的な推論機械が開発されるとき、その開発者が、今日のAIで可能なものよりも理解しやすく、信頼できる設計や技術の中から選ぶようになっていてほしい。
私たちは、現在の技術より理論的な裏づけのある新しいAI技術を生む助けになりそうな研究に、重点を置いている。実際にはたいてい、現在の理論の最も大きな穴に取り組むことになる。その後の工学的な仕事を支える、よりよく、より一般的な理論をつくるためだ(ソアレス)。
私たちの取り組みを特徴づけるもう一つの点は、システムの目標、入出力経路、環境の特徴よりも、AIシステムの推論や計画に重点を置いていることだ。その理由の一部は先に述べた事情にあり、もう一つには、能力の高いシステムを高能力たらしめる核心に、推論や計画があると予想していることがある。こうした能力を、しかも安全に使うためには、おそらく、そのシステムがどう認知的な仕事をし、それが意図した目標にどう結びつくかを、よく表すモデルが必要になる。
最後に、大学や産業界の研究者が取り組むのに適していると思われる問題は、通常、私たちの対象から外している。代わりに、今後最も手薄になると予想する研究の方向に重点を置いている(ベンシンガー)。
この分野で目指すこと
MIRIの研究者は一般に、今後数年でAI分野がどう発展するかについて、非常に大きな不確実性を感じている。もっともらしいと思えるシナリオも、さまざまにある。ただし、よい結末になるという条件のもとでは、次のような筋書きをおおむねたどるシナリオに、かなりの確率を置いている。
短期的には、研究コミュニティがまとまり、関係する問題とは何かを原理の面からよく理解し、それに取り組むための形式的な道具をつくる。AI研究者は、望ましい実践についての最低限の合意、AIが長期的に社会へ及ぼす影響についてのより開かれた議論、リスクを意識するセキュリティの発想(ミュールハウザー)、そして誤りへの耐性と価値の指定に関する研究へと向かう。
中期的には、研究者はその土台の上で、理解をさらに成熟させていく。人間より賢いAIシステムがどのようなものになりそうか、より明確に見通せるようになり、信頼できるロードマップに近いものが得られるにつれて、研究コミュニティは開発競争を加速させる力学を抑えるため、調整と協力を強める方向へ進むと考えている(ソアレス)。
長期的には、人類が遠い未来について持続的な決定を下すのに必要な、科学上・制度上の成熟を目指す間、AIの力を使うプロジェクトによって重大なAIの事故を防げるようになってほしい(デューイ)。そのために、限定的なAIシステムについて、アライメント問題の弱い形を解きたい。AIの事故や悪用を防ぐための有用な手段として働けるだけの能力を備えた、限定的なシステムである。
さらにずっと長期的には、高い能力と自律性をもつAIシステムについて、研究者が最終的に「完全な」アライメント問題を解くことを願っている。理想としては、未来に大きく不可逆的な影響を及ぼす選択を「固定」してしまうリスクを冒す前に、技術者と運用者が、すべてのiに点を打ち、すべてのtに横棒を引くように、細部までじっくり確認できる余裕をもつ状況に到達したい。
これは大まかな筋書きにすぎない。私たちは、もっと楽観できないシナリオでも役立つと思われる研究を優先している。また、ここでの「短期」「長期」は相対的なものであり、実現時期の予測が違えば、政策上の含意も大きく違ってくる。それでも、この筋書きは、研究コミュニティにどの方向へ進んでほしいのかを明確にする助けにはなるだろう。