長年にわたり、機械知能研究所(Machine Intelligence Research Institute, MIRI)は、アライメントと知能をめぐる根本的な概念的混乱を十分に解消し、人類が技術的なAI安全リスクについて明晰に考えられるようにすること、そして、この技術が破局を起こし得る段階まで進む前に、それを実現することを目標としてきた。私たちには、この目標が常に、難しいが実現可能なものに思えてきた。((本稿は、さまざまなMIRI職員が作った文章を統合したものである。署名欄に「Nate」とあるのは、私(Nate)が本稿を支持し、概念と主題の多くが主として私に由来し、文章もかなりの量を私が書いたことを意味する。ただし、すべての文章を私が書いたわけではなく、概念と主題は、多くのほかのMIRI職員との協力で築かれた。(しばらく前から、MIRIブログの署名欄は、おおむねこの意味であり、明記する価値がある。)))
昨年、私たちは、この目標を目指す新たな研究プログラムを始めたと述べた。((詳しくは、2017年の戦略最新情報と資金調達の記事を参照。)) ここでは、この新しい一連の研究方向を、私たちがどう考えているかという背景を示し、最近、研究を原則として共有しないことを決めた背景にある考えの一部を説明する。また、関心のあるソフトウェア技術者が私たちのチームへ加わり、理解を前進させる手助けをすべき理由も述べる。
目次:
1. 私たちの研究
2014年、MIRIは最初の研究課題「機械知能を人間の利益とアライメントするためのエージェント基礎論」を発表した。それ以来、私たちの主要な研究優先事項の一つは、埋め込み型エージェンシーについて、より優れた概念的理解を築くことだった。すなわち、エージェントと環境の明確な境界を欠き、環境より小さく、自分自身について推論しなければならず、各部分が相反する目的で働くおそれのある推論システムを、形式的に特徴づけることである。こうした研究問題は、MIRIの主要な重点であり続け、新しい研究方向と並行して研究されている(以下では、新しい方向へ、より重点を置く)。((過去の資金調達記事では、十分な資金があれば、アライメント問題に対する別の攻め方を立ち上げたいと述べた。新しい研究方向は、この精神に従うものと見なせる。実際、そのうち少なくとも一つは、私が2015年に検討していた代替的手法に強く着想を得ている。とはいえ、2015年の資金調達記事を書いたときに考えていた多くの案とは異なり、新しい研究は、エージェント基礎論型の研究とかなり連続している。))
私たちの観点では、この種の問題に取り組む目的は、解決策から、うまくアライメントされた汎用人工知能(AGI)システムの作り方が直接分かることではない。目的はむしろ、「アライメント」や「AGI」といった考えをめぐる私たちの混乱を解消し、将来のAGI開発者が、問題を遮られることなく見られるようにすることだ。エリエザー・ユドコウスキー(Eliezer Yudkowsky)は「ロケット・アライメント問題」で、この考えを説明している。それは、人類がニュートン力学や微積分を理解する前に、月面着陸を試みる世界を想像したものだ。
最近、一部のMIRI研究者は、こうした根本的な概念的混乱の解消に向け、より拡張可能な進歩を可能にすると思われる、新しい研究方向を開発した。具体的には、研究者の時間という点で、進歩を拡張しやすくなった。以前は、比較的珍しい種類の数学者によってしか、研究の進歩を速める方法が分からなかった。現在では、さまざまな経歴を持つ優れた技術者の仕事を、MIRIでの研究の進歩へ効率よく変換できると考えている。
同時に、過去1年間には、かなりの資金面での成功もあった。資金がまったく制約でなくなるほどではないが、従来の方向に加え、新しい異なる方向から研究課題を追究できるだけの成功である。
さらに、私たちの見方からは、急ぐことが不可欠である。AGIは、特に、比較的、総当たりへの依存が強く、解釈しにくい手法で開発された場合、存亡的破局を引き起こす可能性が高いと考えている。人類全体の期限がいつ訪れるかについては大きな不確実性があるものの、最近の機械学習の進歩の速さに、私たちの多くは、ある程度の危機感を抱いている。
こうした理由から、適切な人々を速やかに見つけ、この新しい手法に関する仕事を提供したい。この種の助けがあれば、AGIが作られ配備される前に、必要とする人々へ理解を移植できるだけの、根本的な概念的混乱を解消することは、十分に可能だと思える。
新しい研究方向とエージェント基礎論との比較
新しい研究方向では、直観を検証するために使えるソフトウェアシステムと、この過程を速やかに反復できるインフラを構築する。エージェント基礎論の研究課題と同じく、現在のシステムの堅牢性指標を改善しようとする、といったことではなく、「概念的混乱の解消(deconfusion)」に引き続き重点を置く。私たちの感触では、その種の堅牢性研究を大きく進めても、現在のシステムに似た原理で作られたAGIシステムは、実際にアライメントするには、依然として不透明すぎる。
ある意味で、新しい研究は、これまで常に取り組んできたのと同じ種類の問題を、新しい角度から攻めていると考えられる。言い換えれば、論理的帰納器や機能的意思決定理論に心を躍らせないなら、新しい研究にも、おそらく心を躍らせないだろう。逆に、混乱を減らすことがAIアライメントへの健全な取り組み方だという感触をすでに持ち、その種の混乱を、理論的な納得をもたらす形で、ソフトウェアと実験により攻めるところを見たいと思っていたなら、MIRIで働きたいと思うかもしれない。(これについては後段で、さらに述べる。)
新しい研究方向は、ベンヤ・ファレンシュタイン(Benya Fallenstein)、エリエザー、私(ネイト・ソアレス(Nate Soares))がそれぞれ得た、いくつかの異なる発想に由来する。この新方向の高水準の主題には、次のものが含まれる。
最適化のため、まったく新しい低水準の基礎を探すこと。 勾配降下型の機械学習基盤に代わるものとして、最初から透明性とアライメント可能性を考えて設計する。
これは、計算効率、開発速度、配備の容易さなどの性質で、現代の機械学習手法を打ち負かそうとすることを意味しない。しかし、勾配降下法が広く適用可能なものへ拡張できるのと同じように、また同じ理由の一部によって、広く適用可能でありながら、大幅に優れたアライメント特性を持つ、新たな最適化の基礎を開発することは意味する。
これを試みる方法には、浅薄、愚か、あるいは別の理由から失敗を運命づけられたものが数多くあると認識している。それでも、私たち自身の研究経路には可能性があると考えている。
GOFAI(古き良き人工知能)でもなく、サブシンボリックな認知から完全に切り離されてもいない形で、認知として非常に透明にできる認知の構成要素を解明しようとすること。
計算環境へ以前に持ち込まれた問題より深い、いくつかの特定のアライメント問題を実験すること。
新しい手法のすべてに共通するのは、高水準の理論的抽象化を用い、構築するシステムについて首尾一貫した推論を可能にすることへの重点である。その具体的な帰結として、多くのコードをHaskellで書き、型理論の観点からコードについて考えることが多い。
後述する最近のMIRIの方針変更に従い、この研究の技術的詳細を、近いうちに公開する予定はない。しかし、この研究についてメタレベルで言えることは多い。
私たちは、現在の性質と、発展しているように見える方向の両面から、この研究方向に心を躍らせている。約3年前、ベンヤがこの研究の前身を始めたとき、彼女の直観が成果につながるかは分からなかった。今日、この空間で研究経路が新しく刺激的に感じられる探究の道を開いてきたパターンを見た今、この研究が近く行き詰まると予想する者は一人もいない。そして、この研究が最終的に、基本的なアライメント問題の一覧全体を攻める道を開くかもしれないと、期待する者もいる。((つまり、AGIシステムを限定的なタスクの実行にアライメントするための必要条件である。完全なCEV(整合外挿意志)級の自律型AGIをアライメントするための、すべての必要条件ではない。ポール・クリスティアーノ(Paul Christiano)による野心的な価値学習と狭い価値学習の区別と比較されたい(ただしポールは、狭い価値学習で強く自律的なAGIにも十分だと考えている)。))
当初は無関係に見えた研究の流れ同士に、有用な交差関係が生じている程度にも、同じく心を躍らせている。例えば私は、新しい研究の流れへ主に集中していた時期、エージェント基礎論の研究課題にあるタイリング・エージェント問題の原版への解決策を偶然見つけた。((この結果は、近日中に出る論文で、さらに詳しく述べる。あるいは、少なくとも、いつかは。以下で述べる理由から、最近は論文を書くことにあまり時間を費やしていない。))
この研究は、エージェント基礎論の研究課題よりも、「自ら道しるべを差し出す」ように見える。以前は、研究の好みがきわめて近いことを、採用に求める必要があった。今では、地勢について十分な感触があるため、その要件をある程度緩められると考えている。科学的に革新的で、研究の好みがかなり近い採用候補を、なお探している。しかし現在の研究は、MIRIで働く優れた数学者や技術者の人数に応じ、はるかに拡張しやすくなった。
以上を述べても、この2年間がどれほど有望に見えたかにかかわらず、これは依然として「青空」研究である。MIRI外部の大半の人は、学術的には興味深いが、実用上は興味がないと考えるだろう、という意味だ。私たちが調べている、より原理的、首尾一貫、アライメント可能な最適化アルゴリズムが、近いうちに猫の写真を猫でない写真から分類することはない。
研究成果について一般に心を躍らせるのは、直接可能にする機械学習/工学上の力ではなく、次節で述べる意味で、「概念的混乱の解消」をどれほど与えてくれるかである。成果が反映しているとされる、この「概念的混乱の解消」は、当面、具体的な「この理解で何ができるようになったかを見よ」という実演によって弱くしか支えられない、抽象的な議論を通じ、主として識別しなければならない。それでも、MIRIの多くは、私たちの研究に強い実用的関連性があるとみなしている。それは、どの種の短期的成果が進歩を示すかについて、長期的モデルを持っており、また、以下で概略を述べる理由から、アライメントをめぐる混乱を減らすことが、人類の未来に強い実用的関連性を持つと考えているためである。
2. 概念的混乱の解消が私たちにとって非常に重要な理由
概念的混乱の解消で意味するもの
応用合理性センター(CFAR)所長で、MIRI理事のアンナ・サラモン(Anna Salamon)の言葉を引用する。
概念的混乱の解消という考えがなければ、MIRIの取り組みは大半がばかげているように見えただろう。現在、多くの、より大きく豊かな組織がAI安全について語っているという事実にもかかわらず、MIRIは自分たちの研究が人類の生存にとって重要だとみなし続けている。論理的帰納に全員が心を躍らせた集団だ(公開する前に、論理的帰納が「危険でない」ことを、パラノイア的に確認しようとした)。論理的帰納には、ほどほどの量の数学しかなく、実用的な工学はまったくなかったにもかかわらず、である(さらに極端な例を選ぶなら、時間超越決定理論でも似たことをした)。孤立して座り、主として基礎概念を見つめ続ける一方、政治、社会への働きかけ、AI安全コミュニティーが持つ影響力の程度といった問いは、大半をほかの人に任せ続ける集団である。
しかし、私は概念的混乱の解消という考えを持っている。そのレンズを通してMIRIの活動を見ると、MIRIはむしろ、「ああ、そう、よかった。重大に見える物事を、誰かが確かに正面から攻めている」「成功する可能性がありそうだ」「お願いだから、期限までに彼ら(または、どうにかして誰か)が、さらにずっと多くの混乱を解いてほしい。そのような進歩がなければ、人類は相当に詰んでいるように見える」に近く思える。
「概念的混乱の解消」と私が呼んでいる考えがなければ、MIRIの観点と戦略には、あまり意味が通らないことに同意する。MIRIの戦略最新情報を読む人なら、この概念をすでに部分的に持っているだろう。しかし、完全な考えを伝えるのは自明でないと分かったため、言葉にしようとする間、辛抱してほしい。
概念的混乱の解消とは、「ある話題について、うっかり絶えず無意味なことを口走らずに考えられるようにすること」のようなものを意味する。
具体例を挙げると、10歳の私が無限について考えていた内容は、首尾一貫した何かではなく、混乱を並べ替えたものだった。1700年の最高の数学者でさえ、同じだった。「8足す無限が、どうしてまだ無限なのか。式の両辺から無限を引いたら、何が起きるのか」。しかし20歳の私が無限について考える内容は、同じようには混乱していなかった。後世の数学者が苦労して生み出した、より首尾一貫した概念に、そのときまでに触れていたからだ。私はゲオルク・カントール(Georg Cantor)や、1700年の最高の数学者ほど賢くも、優れた数学者でもなかった。しかし、概念的混乱の解消は人から人へ移せる。そして、その移転は、本当に首尾一貫した考えを考える力を広められる。
1998年、AIリスクと技術的シンギュラリティーの筋書きをめぐる会話は、妙な仕方で堂々巡りになることが多かった。今日、この話題について真剣に考えている人々は、同僚のエリエザーやアンナを含め、今日では混乱して聞こえることを述べていた。(「混乱して聞こえること」と言うときに念頭に置くのは、「知能は首尾一貫しない概念ではないか」「しかし経済はすでに超知能だ」「人間を超えるAIが私たちを殺せるほど賢いなら、それが善い行いではないと理解するだけの賢さもあるので、問題ない」「私たちはチューリング完全なので、危険なほど私たちより賢いものは存在し得ない。チューリング完全な計算は何でも模倣できるからだ」「ともかく、単にプラグを抜けばよい」といったものだ。)今日、こうした会話は違っている。その間に、人々は、これらの話題について、自分やほかの人の根本的な混乱を減らすために取り組んだ。だから今日では、あの首尾一貫しない議論をすべて飛ばして結論へ行きたい14歳の人も、ニック・ボストロム(Nick Bostrom)の『スーパーインテリジェンス』を手に取るだけでよい。((この概念についての、さらなる議論は、キャリック・フリン(Carrick Flynn)の「AI政策・戦略分野でのキャリアについての個人的考察」を参照。))
注目すべきことに、「AIリスクと技術的シンギュラリティーを真剣に考えよ」というミームが、機械学習科学者という、より大きな集団へ広まり始めたのは、その主要な提唱者が、十分に概念的混乱を解消した後だけだった。1998年に生き、AIリスクと技術的シンギュラリティーを真剣に受け止めるべきだ、という強い直観を持ちながら、さまざまな混乱した反論を前に、それを言葉にしようともがくうち、時々無意味なことを口走る原因になる、多数の混乱も持っていたなら、真剣に考える人々へ伝道しても、ほとんど役に立たないだろう。おそらく、分野で尊敬される科学者や技術者は、無意味なものを嗅ぎ分け、あなたの概念がまだ首尾一貫していないと(正しく)見抜けるからだ。概念が整合し、議論が正しく形を成すまで、概念的混乱の解消を積み上げることで、考えはミームとしての適応度を持ち、科学者の間に広がり、同じ科学者による将来の研究の土台になれる。
興味深いことに、科学史は実際、個々の研究者が、ほぼ正しい直観の体系を長く持ち、その後ようやく、その直観が形式化され、修正され、精密にされ、人から人へ移された事例に満ちている。マイケル・ファラデー(Michael Faraday)は、形式化することも、何百ページもの詳細な実験記録と図以外で伝えることもできなかった直観に導かれ、多様な電磁現象を発見した。その後、ジェームズ・クラーク・マクスウェル(James Clerk Maxwell)は、ファラデーの研究を読むことで、電磁気学を形式的に記述する言語を発明し、何百ページもの直観を3行で表した。
さらに鮮烈な例がアルキメデス(Archimedes)である。微積分が人から人へ渡せる単純で形式的なものになる、何千年も前に、積分法と微分法の両方で有用な仕事をする能力へ、直観だけで到達した。
どちらの場合も、最終的に直観が形式化され、それに伴って多くの研究者の間を正確に移せるようになったことで、分野が適切に、速く築かれ始めた。((概念的混乱の解消によって、豊かで健全な分野が生じた歴史上の例には、ニュートンの法則からラグランジュ力学とハミルトン力学が抽出されたこと、オーギュスタン=ルイ・コーシー(Augustin-Louis Cauchy)が実解析を刷新したこと、複素数の有用性がゆっくり受け入れられたこと、数学の形式的基礎が発展したことがある。))
概念的混乱の解消が、(私たちの見方では)AI事故リスクと強く関係する理由
人間がいつか人間より賢いAIを作り、人間より賢いAIが、現在の予想どおり強力で危険なら、いつかAIは、最適化の途方もない力を作用させる。((私の観点では、人類がAGIを決して作らず、可能性を実現せず、宇宙的資源を活用できないことは、(天文学的規模では)AGIが私たちを一掃するのに匹敵する悲劇だ、と強調しておきたい。「危険」と言っているが、人類が仕事を正しく行う利点を見失うべきではない。)) これが起きるとき、その途方もない力は、理論上よく理解された文脈で、現実世界の問題と下位問題へ、意図的に作用させる必要がある、と考えている。その力が大きいほど、研究者が認知的問題へ向けるとき、さらに高い精度が必要になる。
「最適化」や「狙いを定めること」といった現在の概念は、安全を大いに重視する研究者が使っても、必要な精度を支えられないのではないかと、私たちは考えている。そう考える理由の一部は、「最適化」と「狙いを定めること」で何を意味するか説明するよう強く求められたら、無意味なことを口走らないよう、注意しなければならないことだ。これは、その周辺で私がまだ混乱していることを示す。
この状況について心配な事実は、私の知る限り、人類が、こうした概念の首尾一貫した版を必要とせず、山登り法でAGIへ到達できることだ。進化は、その距離を山登り法で進んだが、自分が何をしているかというモデルを持たなかった。しかし、進化がゲノムへ巨大な最適化圧力を加えると、そのゲノムは、遺伝的適応度と単に相関する目標を内部で最適化する脳をコードし始めた。人間は、私たちを生み出した選択基準である「自分の遺伝子を次世代へ増やせ」に正面から反するときでさえ、自分自身の目標を満たす、ますます巧妙な方法(テレビゲーム、アイスクリーム、避妊……)を見つける。
同じ運命を避けるには、もっと慎重でなければならない。大量の勾配降下法などの最適化手法を用いてAGIへ到達したものの、結果として得られたシステムが、追求を巧みに行うよう外部から最適化した目標とは、大きく異なる内部の最適化目標を持つと判明する運命である。
AI研究者が最適化器の空間を探索するとき、最初に発見する高能力の最適化器を、選んだタスクへ向ける方法を知っている最適化器にするには、何が必要だろう。私は、まだある意味で問いについて混乱しているので、確信がない。問題が道具的収束(instrumental convergence)とどう関係するかを、漠然と伝えることはできる。また、「大きな認知システムを、Xを最適化するよう訓練する」という戦略から、実際にXを内部で最適化するシステムが得られると期待すべきでない、さまざまな理由を観察できる。それでも、この問いには、無意味なことを言わずに多くを語れない広大な部分が残る。
一例として、Deep BlueやAlphaGoのようなAIシステムが、世界全体について推論していると、合理的に言うことはできない。囲碁盤のような、はるかに単純な抽象的プラトン的環境について推論している。ありそうにないほど膨大な計算資源でシステムを動かす世界でさえ、これを一つの理由として、そのシステムが世界を乗っ取る心配は不要だという直観的な感触がある。
大まかに言えば、AIシステムが「現実世界について推論する」まで、一部のアライメント上の困難は生じない、という意味がある。しかし、それは何を意味するのだろう。「システムが検討する可能性空間に、文字どおり具体的に現実そのものが含まれる」という意味ではなさそうだ。古代人は、宇宙を特定の物理方程式で記述できるという概念を完全に欠いていながら、完全に良好な汎用的推論を行った。
それはむしろ、「ある意味で現実全体の小さな表象となる内部モデルを、システムが構築している」のようなことを意味するはずに見える。しかし、何を「現実の小さな表象」とみなすのか。そして、精霊に満ちた森をめぐる狩猟採集民の混乱した考えは、なぜ表象とみなされ、チェス盤はみなされないのか。こうした問いはすべて、おそらく混乱している。ここでの目標は、首尾一貫した問いへ名前をつけることではなく、アライメント問題の一部へ精密に名前をつけるのを妨げる、混乱の方向を指すことだ。
簡潔に言い換えれば、問題へ精密に名前をつければ戦いの半分は終わりだが、私たちは現在、アライメント問題へ精密に名前をつける方法について混乱している。
この概念に名前をつける別の試みは、エリエザーのロケット・アライメントの比喩を参照されたい。十分な精度でアライメントされた知能を記述するには、現在の概念が不十分に見える理由については、スコット・ガリャブラント(Scott Garrabrant)とアブラム・デムスキー(Abram Demski)の最近の文章を参照されたい。(または「コンピューター科学者のためのAIリスク」ワークショップで、直接、私たちと議論してほしい。)
この研究が、今ここで扱いやすいかもしれない理由
多くの種類の研究は、特定の場所と時代に、はるかに容易になる。AIアライメントをめぐる概念的混乱を減らす研究にとって、2018年のMIRIは、そのような場所と時代の一つだと思う(そして今後かなりの年数にわたって、そうだと思う)。
なぜか。一つは、MIRIには、概念的混乱の解消型の研究で成功してきた歴史が、少なくとも私の評価では、いくらかあることだ。MIRIの研究者は、その研究との対話のなかでMIRI内に育った研究伝統の恩恵を受けている。MIRIが貢献した概念的進歩には、次のものがある。
AI事故リスクが重要だという今日の理解。
アライメントされたAIが、少なくとも理論上は可能だという今日の理解(帰結主義的な選好は、デフォルトで内省的に安定している、というガンディーの議論など)と、そのようなAIの可能性に向けた基礎研究へ、事前に投資する価値があるという理解。
訂正可能性(corrigibility)、ローブ的障害、サブシステム・アライメントなどの下位問題についての初期の定式化。これには、エージェント基礎論の研究課題にある、さまざまな問題の記述も含まれる。
エージェント基礎論の研究課題周辺にある、多数の小さな成果。特に、1回限りの囚人のジレンマにおける堅牢な協力、普遍帰納器、モデル多相、HOL内HOL、そしてヴィンジ的内省についての最近の進歩。
一例として論理的帰納器は、数学的推論で「おそらく」のような言葉を、私たちが非形式的に使いやすい理由について、少なくとも手がかりを与える。「数学的事実についての確率的推論は、どう働くのか」への完全な答えではないが、興味深い示唆のように感じられる。これは、「現実世界」のAI推論が、どうすれば働き得るかを考えることに関係する。AIシステムも数学で、確率的推論を使う可能性が十分にあるからだ。
第二に、人類の生存確率を高めたいという意欲以外に、MIRIの大半の人々を結びつける何かがあるなら、おそらく、宇宙の基礎についての理解を正しく得たいという好みである。私たちの多くは、この好みを持って参加した。例えば、多くは物理学、特に基礎物理学を背景として持ち、プログラミングを背景とする者は、型理論、形式論理、確率論などに関心を持つ傾向がある。
第三に、前述のとおり、現在持っている研究上の直観の体系と、それが時間とともに、ますます移転可能、交差適用可能、具体化可能になっているように見えることに、心を躍らせている。
最後に、AI分野全体は現在、主として深層学習革命と、機械学習におけるさまざまな進歩により、大いに活気づいている。私たち自身は、深層ニューラルネットワークへ特に重点を置いてはいない。しかし、活気があり刺激的な実用分野と接触することは、発想を生み出しやすい類いのことである。実用的AI手法が働き始め、それと対話しながらAIアライメントの理論科学を探すには、2018年は本当に、並外れて容易な時代に思える。
3. 原則非公開の研究と、この方針が全体戦略にどう当てはまるか
MIRIは最近、研究の大半を「原則非公開」にすると決めた。今後、MIRI内で発見された成果の大半は、その成果の公開から期待される、特定の安全上の利点に通常は基づき、公開を明示的に決めない限り、内部限定のままにするという意味である。
なぜこの方針を選んだか、その感触を伝えたい。特に、この方針は、研究分野としてAI安全に関心を持つ多くの人にとって、残念または不便なものになるかもしれないからだ。((私自身の感触では、私やMIRIのほかの上級職員は、自分たちが何を、なぜ行っているかを説明することが、特に得意だったことはない。したがって、この不便は新しいものではないかもしれない。しかし、どこからこの考えに至ったかを説明する試みを、優先事項としないのは新しい。)) MIRIは非営利組織であり、善を生み出す仕組みは、新しい考えや洞察を定期的に発表することだ、という自然な初期仮定がある。しかし現在、非営利の使命を果たすために、それが正しい選択だとは考えていない。
この方針を選んだ理由の短い版は、次のとおりである。
私たちは、存亡リスクを減らすため急いでいる。
ファラデーの実験記録は、マクスウェルの方程式ほど有用ではなく、論理的帰納は、現代の平均的な機械学習研究者にとって、さほど有用ではない。それと同じく、半ば混乱した思考を多数、より広い人々と共有しようとしても、それほど有用ではないと考えている。
解説ではなく、新しい研究上の進歩を生むことへ集中し続け、広い聴衆に直観を正当化しなければならないという圧力を感じなければ、重大な洞察を、より多く、より速く得られると考えている。
概念的混乱の解消型の洞察が、能力面の洞察につながるかもしれない、と不安になるのは不合理ではないと考えている。そして、それを心配しなくてよいとき、より自由に考えられることを、経験的に観察した。
熟考の結果、その懸念がパラノイア的またはばかげていたと結論する場合でさえ、その恐れを評価する認知的作業を、「洞察を内部共有する前」から「洞察を広く配布する前」へ移せたことの恩恵を受けた。この方針が、それを可能にする。
もう少し長い版は、以下のとおりである。
以下では、自分が何を信じているかを伝えようとしているが、必ずしも、なぜ信じるかを伝えようとしてはいない、と断っておく。私と同じ立場にある合理的な人なら誰でも、同じ戦略を取るよう説得される議論を示そうとしているのではない。決断について、自分自身がどう考えているかを伝えるという、より控えめな目標だけを狙っている。
まず、私たちの研究が全体戦略にどう当てはまるかを少し述べ、それから、この方針の長所と短所を論じる。
AIアライメント研究をしていると言うとき、本当に心から社会への働きかけを意味してはいない
現在、MIRIの目的は、アライメント問題について研究を進めることである。機械学習分野を、AGI安全をさらに真剣に考える方向へ変えることにも、別の形の影響、説得、分野形成にも重点を置いていない。アライメントの中核問題について、直接、研究を進めることだけを目指している。
この選択を意外に思う読者もいるかもしれない。分野形成などの社会への働きかけが、途方もなく有益な効果を持ち得るのは明らかだ。そしてMIRIは歴史を通じ、典型的な数学研究グループより、はるかに社会への働きかけを重視してきた。
適切に対象を絞った働きかけが、非常に価値あるものになり得る、というのが私たちの見立てではある。しかし現在、AGI安全への懸念を動機とする世界の研究活動の大多数を、社会への働きかけ、影響、分野形成の試みが占めているように見える。((言い換えれば、多くの人が明示的に、社会への働きかけだけへ重点を置き、ほかにも多くの人が、分野を強化し、ほかの人を引き込むという明言した目標に基づいて、取り組む技術的問題を選んでいる。)) そのためMIRIの時間は、中核の研究問題を正面から攻めることに使うほうがよい。さらに、私たち自身の比較優位は、社会への働きかけではなく、ここにあると考えている。((これは、中核問題を正面から攻めている人が、ほかに誰もいないことを示唆する意図ではない。例えばOpenAIのポール・クリスティアーノは、まさにそれを行う一流研究者である。それでも現時点では、こうした研究をさらに増やす必要がある。))
ここでの私の信念は、前述した、概念的混乱の解消の仕組みについての信念と結びついている。特に、アライメント問題へ精密に名前をつけられるようになれば、その問題は大幅に容易に見え始めるかもしれないと考えている。また、この種の問題へ精密に名前をつけることは、一部の概念的混乱の解消が、ほかの解消が成熟するまで達成できないという意味で、直列的な課題になりそうだと考えている。さらに、私が歴史を読む限り、概念的混乱の解消は、適切な種類の考えを考える、比較的小さなコミュニティーから、規則的に生まれている(ファラデーとマクスウェルの場合など)。そして、周囲の概念が首尾一貫すれば、解消は急速に広がり得る(ボストロムの『スーパーインテリジェンス』が例示する)。このすべてから、より広い分野に影響を及ぼそうとすることは、私たち自身の努力を注ぐ最良の場所ではないと結論する。
概念的混乱の解消が成功したとき、能力の進歩を引き起こすかどうかは予測しにくい
MIRIに期待される影響の大半は、概念的混乱の解消が最終的に成功する世界から来ると考えている。すなわち、私たちの研究が最終的に、アライメント可能な最適化について、原理的な理解をもたらし、それをAI研究者へ伝えられるようになる世界である。ファラデーの実験記録より、現代の微積分と微分方程式の理解に似ている(ただし、アライメント問題の解決策が、微積分やマクスウェル方程式とほぼ同じ程度まで圧縮できると予想する者は、私たちの大半にはいない、という注意点はある。とはいえ、話がそれた)。
これが進む、かなり妥当な方法の一つは、概念的混乱の解消によってアライメントが可能になる一方、AGIへ至る利用可能な経路の集合は、あまり変わらないというものだ。((例えば、アライメント不能なAGIへの最も容易な経路は、現在の勾配降下法と深層学習手法の子孫をたどることかもしれず、アライメント可能なAGIにも同じことが当てはまるかもしれない。)) この種の世界を説明する自明な比喩として、通常の浮動小数点演算と比べた区間演算を考えよう。区間演算では、sqrtのような演算が、下限と上限という二つの浮動小数点数を受け取り、結果の下限と上限を返す。区間演算を行う方法の解明には、浮動小数点計算の誤差について、注意深く考える必要がある。そして、計算が速くなることは決してない。使う唯一の理由は、浮動小数点演算で生じる誤差が、利用者の仮定より大きくならないと保証することだ。区間演算を発見しても、現代の行列乗算を高速化する危険はない。通常の浮動小数点演算にない、特定の望ましい性質を持つ新しい演算方法を、本当に発見したにもかかわらずである。
アライメントをめぐる概念的混乱の解消が、(この軸上では)主として区間演算に似た洞察へつながる世界では、MIRIが研究を可能な限り広く配布することが最善だろう。特に、比較的伝えやすい段階へ達した後は、AI能力の研究者が採用し、その上に築くよう促すため、そうするのがよい。
一方、アライメント可能な最適化の理論が成功すれば、それ自体がAI能力の新たな研究方向を引き起こす可能性も、私たちには妥当に思える。比喩として、古典確率論と統計学から、画像を分類する現代の深層ニューラルネットへ進んだ経緯を考えよう。確率論だけでは猫の写真を分類できず、確率論について深く考えずに、画像分類ネットワークを理解し実装することも可能である。しかし、機械学習が実際に発見された過程では、確率論と統計学が中心的であり、現代の深層学習研究者がアルゴリズムを考える方法の基礎でもあり続ける。
アライメントをめぐる概念的混乱の解消が、(この軸上では)確率論に似た洞察へつながる世界では、成果を広く配布することが正の影響を持つかどうかは、はるかに不明確になる。言うまでもなく、その種の世界でも、正の影響を(少なくとも中立的な影響を)与えたい。
後者の筋書きは、AGIまでの時間が短い世界では、比較的重要でない。例えば現在の深層学習研究が、すでにAGIの直前にあるなら、MIRIの概念的混乱の解消による成果が、AI能力研究へ関係のある影響を及ぼす可能性は、より低くなる。そして研究の潜在的な影響の大半は、深層学習型システムへ直接応用できることから来るだろう。MIRIの多くは、AGIまでの時間が短い可能性も十分あると考えているが、MIRI内部には、時間について大きな不確実性と意見の不一致がある。時間が短い世界だけで安全な行動方針へ確約することは、私には安心してできない。
要約すると、アライメントについて首尾一貫して考えられるようにする、真に「自然を関節に沿って切り分ける」概念を解明することを、今後も進め、最終的に大幅に成功したなら、その同じ概念が、能力の向上も可能にすることは、十分あり得ると思う(特に、その概念が能力重視の方向へ進められる時間が多くある世界では)。深い科学的洞察が、予想外の実用的応用を生み出した強力な歴史的前例が、確かにある。
概念的混乱の解消という研究の性質上、ある洞察が、ほかのどの考えを開くかを事前に予測するのは、非常に難しいように思える。こうした考慮は、情報公開に保守的な判断と遅延を求めているように思える。ある洞察がどこへつながるかの解明には、かなり長い時間がかかるため、遅延は非常に長くなる可能性がある。
研究者自身の頭の中に壁を作らせてはならない
MIRIは、研究を真剣に考えている。これは、私たちの多くが、概念的混乱の解消型の研究は、時に(しばしば予測不能な形で)、前述した仕方で能力面の洞察につながる経路を開き得ることを、心の奥で知っているという意味だ。その結果、多くのMIRI研究者は、洞察が後に持ち得る能力面への影響を、長時間かけて考えていないとき、その洞察を持つことから身を引いてしまう。そして、その思考には大量の認知的負担が必要なので、普通は考えていない。この影響は、私自身を含む研究者からの報告で裏づけられている。また、「閉じた」研究合宿や研究室を設けると、((言い換えれば、おそらく長く厄介な官僚的手続きを経て、全員が積極的に支持した場合を除き、すべての思考や考えを共有しないことが共通知識になっている合宿/部屋である。)) 研究者は、もっと自由に考えられ、ブレインストーミングは、さらに遠く、広くまで進むなどと報告することを、経験的に観察した。
この種の抑制は、研究の進歩にとって、かなり悪いように思える。研究者が無意識または半ば意識的に抑えていたのは、小さな領域ではない。探している深い考えや洞察の大半を十分に含み得る、かなり広い範囲である。
同時に、この種の慎重さは、概念的混乱の解消研究を公開で行うことの避けられない帰結である。ある洞察の5年後や10年後に、どの考えが続くかを知るのは、非常に難しいからだ。AIアライメント研究とAI能力研究は十分に近い隣人なので、AIアライメント周辺の多くの洞察は、「無害だと証明されるまで、能力に関係する可能性がある」。これは、上で述べた理由からも、また、ここで奨励しようとしている保守的なセキュリティ思考の観点からも言える。
要するに、全員と共有して問題ないアライメントの考えを思いつくよう、脳へ要求するなら、そして、自分たちを「公開で研究している」と考えるとき、暗黙にまさにそれを行っているのだが、脳に対し、探索空間のうち「おそらく安全」にすぎない巨大な部分を切り落とすよう要求している。
AGIが到来する時までに、厳密な安全工学を可能にするほど首尾一貫した概念を得たいと願い、研究を可能な限り速く進めることが目標なら、研究者が制約なく考えられるようにする方法は、ある程度高価でも、見つける価値があるように思える。
この種の研究には、集中が並外れて有用に思える
それ自体では主要な考慮事項だとは考えていないが、研究者の注意を解放することから、さらに高速化の効果があるかもしれない。
歴史上、初期段階の科学的研究は、孤独または地理的に孤立した人々によって、しばしば行われてきた。ほかの人が使う現在の言葉へ、考えを繰り返し翻訳する代わりに、現象を分解する新しい方法を、ゆっくり発達させやすくなるためかもしれない。他人が自分を見つめるとき、自分の研究がどう見えるかという考えに、どれほどの心の空間と労力が費やされると判明するかは、長期間、閉ざされた部屋へ入り、内部での会話は本当に、当分まったく共有しないと自分に約束してみるまで、説明しにくい。
これが起きていると気づくと、振り返れば、ある意味で一般的慣行を無視していたかもしれない、と気づいた。多くの新興企業の創業者は、ステルスモードと、外部のベンチャーキャピタルからでない資金が、集中に途方もなく役立つと報告してきた。この理由から、MIRIの研究者には最近、公開向けの仕事をするとき、広い聴衆に訴えることを、あまり心配しないよう勧めてもいる。研究者には、主として、自分が最も説得力を感じる、どの研究方向にでも集中し、解説と抽出は二次的な優先事項とし、考えを説得的または擁護しやすいものへ最適化することを心配しないでほしい。
初期の概念的混乱の解消研究は、(まだ)それほど有用ではない
機械学習研究者が、実際の研究で論理的帰納や機能的意思決定理論を盛んに使っているわけではない。これらの理論に、現場の研究者への実用的関連性はなく、持つことを意図してもいない。理論の要点は、概念的混乱を解消することだけである。
もっと精密に言えば、理論それ自体が興味深い新規性なのではない。新しいのは、数年前、数学的事実へ、原理上もっともらしく妥当な確率を割り当てる方法の理論を、何一つ書き下せなかったが、今日では論理的帰納を書き下せることだ。点Aから点Bへ進む間に、概念的混乱を減らした。論理的帰納の論文は、その解消を証言する成果物であり、書く過程で、著者にさらなる解消を与えた成果物でもある。しかし、論理的帰納について私を興奮させたのは、論文にある特定のアルゴリズムや定理ではない。推論器が論理的な文へ、どのように合理的な確率を割り当てられるかについて、以前より少しだけ暗闇から出たという事実である。もっとも、この面で完全に暗闇を抜けたわけではないが、以前より少し混乱が減った。((余談だが、学術論文を発表しようとすることについて、私が主に抱く不快感は、「ねえ、これを見て。以前はXについて混乱していたが、今はYと言える。つまり少しだけ混乱が減った!」と言いに行ける場が、AIには存在しないように見えることだ。その背景には、多くの理由があると思う。少なくとも、混乱の性質上、Yは述べられると、普通は自明な真実に聞こえ、そのため、成果を目覚ましい実用的結果のように聞こえさせるのが、特に難しいことがある。
残念ながら、この副作用として、私が学術発表を目標に書いたMIRI論文はどれも、以前の私が何について混乱していたかや、「成果」が、混乱を減らしたことをどう示すかを、かなりうまく伝えられていない。ここで、おわびする。))
世界のほかの人々が、私たちの混乱しているAIアライメントの話題について、自分たちもどれほど混乱しているかを語り、その混乱を私たちと同じほど懸念していたなら、研究を共有しないことは、私には、はるかに高くつくと感じられただろう。しかし現状、この領域の大半の人は、論理的帰納のようなものに心を躍らせていると言うと、私たちを妙な目で見る。私たちの論文の一部を読み、研究動機を推論しようとした人と話すと、深い誤解に繰り返し出会う。そのため、どのみち私の現在の、とりとめない話から、多くの利益を引き出してはいなかったと結論する。
そして、ある意味で現在の研究の大半は、ファラデーの実験記録がそうであったのと同じく、よくても、とりとめのない話の一形態である。実用分野の大半の科学者が、ファラデーの記録を苦労して読み進めるのを避け、マクスウェルが現れ、3本の有用な方程式へ抽出するまで待ってもよい。さらにファラデーは、物理理論が最終的には抽出されると期待するなら、実験記録を伝道して回る必要はない。抽出されるまで待ち、概念的混乱の減った概念を伝えるために取り組めばよい。
現在は完成から遠い、アライメントについての理解も、最終的には抽出されると期待している。そして少なくとも私は、大幅に抽出されるまで、それを誰かへ押しつけようとは、あまり思わない。(または、完全な抽出がない場合には、公益への確約と、十分なセキュリティ思考、そして概念的混乱の解消研究に強い関心を公言するプロジェクトが、扉をたたくまで。)
もちろん、その間にも、MIRIの外には、同じ問題を気にかけ、概念的混乱の解消も追究している研究者がいる。原則非公開の方針は、別の研究方向について、こうした人々と協力する能力へ悪い影響を及ぼす。これは本当の費用であり、退けるべきものではない。ここでは、これ以上あまり言えることはないが、もし、そのような人の一人なら、ぜひ連絡してほしい(そしてチームへの参加も検討してよいかもしれない)と記しておく。
将来は、何を共有すべきか、すべきでないかについて、より優れた見通しを得られる
長期的には、研究が役立つため、研究成果は世界へ出て、人類がAIシステムを作る方法に影響する必要がある。しかし、この最終的な(何らかの形の)配布の必要性から、研究をすべて直ちに発表してよいことにはならない。前述のとおり、私の知る限り、現在の研究上の洞察は、それほど実用的に有用ではなく、初期段階の概念的混乱の解消研究を共有するには、多くの時間がかかる。
原則非公開の方針によって、次のような選択肢も残せる。
- 差異ある技術発展を考慮しながら、どの研究成果を、さらに発展させるべきだと考えるか決めること。
- 各々の興味深い成果を、どの集団と共有するか決めること(例えば、一般の人々、閉鎖的なほかの安全研究グループ、セキュリティ思考と公益に強く確約しているグループなど)。
将来の私たちのほうが、明らかにこの種の問いを判断するうえで有利な立場にある。ただしこれは、反対方向に働く多くの事実と比較検討する必要がある。何を公開するか決める時期が遅いほど、ほかの人が、その上に築く時間は減り、その間に独立して発見される可能性が高まり(重複した努力で時間が無駄になり)、といったことが起きる。
原則非公開の方針を支持する理由を列挙したので、次に、反対する理由もいくつか記す。
原則非公開の方針に反対方向へ働く考慮事項
この原則非公開方針によって、研究を難しくする経路は数多くある。
a. 新しい研究者を引きつけ、評価するのが難しくなる。共有する研究が減れば、さまざまな研究協力を試し、どの協力が両者にとってうまく働くかに気づく機会が減る。
b. 有用な洞察が生まれるたび、リアルタイムで共有し、MIRI外のほかの研究者の進歩を速める利益の一部を失う。
c. 訪問者、遠隔研究員、世界各地の研究者から、有用な科学的洞察とフィードバックを得にくくなる。共有する研究が減るからだ。
d. 資金などの間接的な支援を得るのが難しくなる。研究のうち見える部分が減ると、支援候補者が、研究に支援する価値があるかを知りにくくなる。
e. 社会的費用や運用上の負担を含め、研究を非公開に保つことに伴う、さまざまな費用を支払わなければならない。
これらの費用は多額になると予想している。次節で述べるとおり、aによる損失の一部を相殺するため、懸命に取り組む。前述の理由から、現在、bはあまり心配していない。残りの費用は、おそらく全額支払うことになる。
こうした費用があるからこそ、数年前に(研究の大半について)この方針を採用しなかった。社会への働きかけが、プエルトリコ会議より前の時代ほど、私たちの比較優位には感じられず、資金も、以前ほどのボトルネックには見えなくなったため(依然として、ある程度はボトルネックだが)、この手法は現在、実行可能に思える。
研究者がまず洞察を得て、公開する安全性や望ましさを後から整理できるようにすることが、実際に役立つと、すでに分かった。全体として、この方針によって研究の進歩が正味で大幅に加速し、同時に、視野にある、最も重要な技術的問いの一部を責任ある形で調査できると予想している。
4. MIRIチームへの参加
人類が何世紀も追究してきた領域をめぐる概念的混乱を大幅に解消するのに、条件がまさに整った、科学史上まれに見る刺激的な局面がある。MIRIは、そうした局面の一つの中心地であり、少なくとも今後数年は、そうあり続けると私は考えている。しかもここでは、その成果が、科学的に刺激的なほかの場所や時代と比べてもまれなほど、直接的な影響を持つ。
何を提供できるか。私の見方では、次のとおりである。
エリエザー、ベンヤ、私、そして多くのAI安全研究者が、人類の生存確率を高める大きな可能性を持つとみなす仕事。
成果につながれば、アライメント問題への中心的な関連性を目に見えて持つ仕事。「最適化器内で起きる最適化の量に、抜け穴なく上限を設ける方法はあるか」といった問題へ光を当てる、有意な可能性を持つ種類の仕事。
好みが私たちと合うなら、知能、エージェンシー、現実の構造をめぐる根本的な問いと、密接に関係すると感じられる問題。そして、大きく重要な洞察が、すぐ手の届くところにあるかもしれない、人類知識の偉大で野性的な最前線の一つで働くことに伴う高揚感。
自分自身とほかの人の研究の進歩を、真剣に考える雰囲気。例えば、AIアライメント問題を本当に前進させるつもりで毎日出勤し、進歩が起きるまで、さまざまな種類の横方向へ自分の思考を引っ張ろうとする同僚を期待できる。仕事を成し遂げようとするMIRI職員の意欲には、いつも感銘を受ける。自分の仕事が本当に重要だという事実を目に見えて理解し、互いが前進するのを助けることに熱心である。
MIRIで重点が高まりつつある、AIアライメント問題についての、経験的根拠を持つコンピューター科学の研究。「自分のコードは型検査を通ったか」「証明は得られたか」という形の明確なフィードバックがある。
最後に、古き良き楽しさ。ただし、「楽しさ」の非常に特定の種類である。重要な技術的課題を進めることから来る満足、研究助成申請を書いたり、ほかの形で資金を調達したりする心配をせず、自分が説得力を感じる研究経路を追うことから来る楽しみ、濃い混乱の雲から、ついに真実の小さな塊を抽出できたときに続く高揚感が含まれる。
MIRIで働くことは、まったく同じ要因に引きつけられた、ほかの人々と働くことでもある。私には、人間の福祉と感覚を持つ生命全体の福祉への配慮と関心、大きな技術的問題に取り組む創造性と粘り強さ、認知的な反省性と視点を取る技能、実効性と気概が、いずれも並外れて高い人々に思える。
私自身がMIRIで経験してきたのは、私たちの未来を劇的に形づくる可能性の高い大規模な出来事から、「生命チーム」がよい結果を得るのを、本当に助けたい人々の集団であることだ。ある手法が成功する可能性についての偽の物語へ訴えず、大きな課題を正面から攻められる。そして新しい証拠に応じて見方を驚くほど柔軟に更新し、本当に楽しい協力環境を作ることに長けている。
誰を探しているか
「AIアライメントについて概念的混乱を減らす」研究を加速できる人なら、誰でも探している。
実際には、これは、数学またはコードで自然に考え、AIアライメントについて(速やかに!)混乱を減らす問題を真剣に考え、全般に有能な人を意味する。特に、Googleの上位層のプログラマーに匹敵する能力を探している。100万人に1人の試験成績や、運命づけられた者の後光は必要ない。また、博士号、明示的な機械学習の経歴、それどころか、以前の研究経験さえ必要ない。
私たちの研究課題を直接目指していなくても、アライメントについて、深く、優れ、本当に新しい考えには、資金を提供するか、資金を手配するつもりである。採用、フェローシップ助成、または必要な別の取り決めになるかもしれない。
ここで働きたいかもしれないと思う場合に、すべきこと
詳しい情報を求めるなら、よい選択肢がいくつかある。
採用を手伝うMIRIのコンピューター科学者、バック・シュレゲリス(Buck Shlegeris)と話す。質問に答え、面接を行うほか、熟練したプログラマーが、AI安全再訓練プログラムを通じ、技能を高めるための休暇を取れるよう、手助けできる場合もある。
MIRIの別の人をすでに知り、話したほうがよさそうなら、代わりにその人へ連絡する。特にブレイク・ボルゲソン(Blake Borgeson)(技術採用を手伝う新しいMIRI理事)やアンナ・サラモン(MIRI理事でCFAR所長でもあり、MIRIの採用イベントの一部を運営している)。
MIRIとCFARが共同運営する、4.5日間のコンピューター科学者のためのAIリスクワークショップへ参加する。このワークショップは、バックが恣意的に「おそらくMIRIの技術採用基準を上回る」とみなす人だけに開かれているが、範囲は単なるMIRI採用より広い。基本的な考えは、非常に有能なコンピューター科学者を集め、AIリスクの理解を試みることである(合理性についてのかなりの内容と、AIリスクを理解し損なっている自分たちの方法を理解しようとする試みも、かなり盛り込む)。
MIRIの文化を知り、MIRIで働くことに関心があるかどうかにかかわらず、数多くの思考道具を身につける、すばらしい方法である。自分で参加を申し込むか、友人を推薦したいなら、ここから情報を送ってほしい。
来年のMIRIサマー・フェローズ・プログラムへ参加するか、夏季インターンになる。新しい研究方向を目指すコンピューター科学寄りの人より、エージェント基礎論を目指す数学寄りの人に適した選択肢である。この夏は、インターン6人とMIRIサマー・フェロー30人を受け入れた(詳しくは、マロ・ブルガン(Malo Bourgon)の夏のMIRI最新情報を参照)。また、別の日程のほうが都合よければ、「夏季インターンシップ」は夏に行う必要がない。関心があれば、コルム・オリアン(Colm Ó Riain)へ連絡してほしい。
単に求人へ応募することもできる。
最後の注意事項
「推論距離」について、または、MIRI研究者の観点を理解するために時として必要なものについての短い注意: 多くの人にとって、MIRIの見方は本当に奇妙である。どこかで文章に出会う多くの人は、私たちの基本的な見通しを無意味なほど奇妙、ばかげている、誤りだと感じ、その後も永遠に、私たちに説得力を感じない。最終的にMIRIへ説得力を感じる人々の間でさえ、多くは最初、奇妙、ばかげている、誤りだと考え、その後、数か月または数年をかけ、MIRIの世界観が少しずつ染み込むと、最終的に、私たちの世界観には、予想外に大きな意味が通っていると分かる。
後者のカテゴリーに入る可能性があり、そのような視点の変化が起きるとすれば、MIRIの世界観が何かを捉えているためであって、全員がただ偽だが説得力のある考えにだまされたためではないと思うなら……この妙な世界観に今から触れ、どこへ連れていくかを見てもよいかもしれない。よい出発点は、『合理性:AIからゾンビまで』、『不十分な均衡』、『ハリー・ポッターと合理主義の方法』、「コンピューター科学者のためのAIリスク」ワークショップ、通常のCFARワークショップ、またはMIRIの中や近くの人々と過ごすことだ。
私の観点を伝えようとした過去の試みが失敗し、本稿の以前の草稿を読んだ人も、伝えたい重要なことを見落としたことから判断して、上で重要な何かを伝え損ねたのではないかと思う。できる限り多くの点を明確にしようとした。そのため、本稿はこれほど長い! しかし結局、「私たちは現在、解説ではなく研究へ集中している」は、私自身にも当てはまり、仕事へ戻らなければならない。((さらに質問があれば、[email protected]へメールを送ってほしい。))
分野の状態についての注意: MIRIは、AIアライメントの技術的問題を解こうとする専任チームの一つだが、唯一のチームではない。現在、ほかに3つある。カリフォルニア大学バークレー校の人間適合AIセンター、OpenAIとGoogle DeepMindの安全チームである。3つの安全チームは、いずれも非常に有能で同種の中で一流の研究グループであり、この分野で違いを生み出したい人が参加する候補として、同じく勧める。
人類未来研究所など、多くのほかの機関にも、優れた研究者がいる。同所のAIガバナンス・プログラムは、AGI開発に伴う重要な社会/協調問題へ重点を置いている。
MIRIなどのグループでのAIアライメント研究について、さらに学ぶには、MIRIが作ったエージェント基礎論と埋め込み型エージェンシーの文書、ダリオ・アモデイ(Dario Amodei)、クリス・オラー(Chris Olah)らによる具体的問題の研究課題、AI Alignment Forum、ポール・クリスティアーノとDeepMind安全チームのブログを勧める。
ここで働くことについて: ここでの給与は、人々が普通想定するより柔軟である。私たちが非営利組織なので、望む生活水準を維持し、金銭的目標を満たし、家族を十分に支えるなどに足りる給与は払えないだろう、と想定していた人々と、何度も話したことがある。これは誤りである。適切な技能があれば、必要な報酬を提供できる可能性が高い。また、週末と休暇、燃え尽きを避けること、そして全般に、ここにいる人が幸せで成長することを、非常に重視している。
最も刺激的だと考えるプロジェクトで私たちと働くには、実際にバークレーにいる必要はあるが、移転の支援と、移動のための運用上の支援は、かなり充実している。
MIRIで働くことには、すばらしい点がすべてあるにもかかわらず、単に仕事が欲しいだけなら、ここで働くのは、かなりひどい取引だと私は考える。世界規模の大きなリスクへ取り組むよう方向転換することは、大半の人にとって、利用できる選択肢のうち、享楽的でくつろげるものには、なりそうにない。
一方、SF小説から来たように聞こえ、『ディルバート』の漫画から来たようには聞こえない課題を、どういうわけか真剣に受け止めると主張する人々の集団と、科学的に大いに楽しみながら、壮大な使命へ取り組むという考えが好きなら、あるいは単に、人類の未来を気にかけ、できる限り手助けしたいなら……私たちへ連絡してほしい。