MIRIにとって2020年は、試行と調整の年だった。新型コロナウイルス感染症の拡大を受け、3月には活動の大半をより地方の地域へ移し、リモートワークの比重を高めた。この機会に、新しい働き方や研究の進め方を試し、その結果にはおおむね満足している。
その一方、MIRIの指導部がそれまで最も期待していた研究、2017年に始めた新たな研究の方向では、2020年の進展は限られたものだった。ここまでの進み方が遅いため、戦略上の変更をいくつか検討している。研究指導部も、より有望な道を探すことへ、関心の多くを移している。
昨年、私は2020年の予算を640万〜740万ドル、点推定を680万ドルと予測した。今は、実際の支出は740万ドルを少し上回ると見ている。点推定を超えた分の大半は、感染症への対応として職員を移転させ、予防措置を取るための費用だ。
2021年は、通常よりも大きな戦略転換が起こる可能性が高いため、予算もかなり不確かだ。現在の見積もりでは支出は600万〜750万ドルの間となり、大まかな内訳は次のようになると予想している。
図: 2021年予算の大まかな内訳
| 項目 | 2021年予算の大まかな内訳 |
|---|---|
| 研究人件費 | 50 |
| 事業活動 | 5 |
| 組織運営の経費 | 25 |
| 一般人件費 | 20 |
また、Survival and Flourishing Fund(SFF)が、年内にすでに提供した支援に加え、今後の研究を支えるため、MIRIに56万3000ドルを助成してくれたこともうれしくお知らせしたい。
研究計画が移行期にあること、そして今年はすでに、Open Philanthropyから438万ドル、SFFから90万3000ドル、その他の寄付者から約110万ドルという強力な支援を受けていることから、この冬は正式な寄付募集キャンペーンを行わない。皆さんに感謝している。この移行期にも寄付は歓迎し、ありがたく受け止めるが、寄付者の方々に支援の理由を説明するのは、計画がもっと固まってからにしたい。今、研究を支援したいと思われた方は、寄付ページをご覧いただきたい。
以下では、2020年がどうだったのか、今後どうするのかを、より詳しく述べる。
2017年に始めた研究の方向と今後の計画
2017年、私たちは新しい研究の方向を打ち出し、「2018年の近況:新たな研究の方向」で内容と動機を詳しく説明した。そこでは、「最適化のための、まったく新しい低水準の基盤を探す」「認知としての仕組みが非常に明瞭になりうる、認知の一部を解明しようとする」「特定のアライメント問題について実験する」と書いた。2019年12月には、その研究が「着実に進んでいる」と感じる一方、それまでの具体的な成果には失望していると述べた。
さらにこの方向を進めてみた結果、MIRIの上級研究者たちは、この方法により悲観的になった。事務局長兼上級研究員のネイト・ソアレスは、こう書いている。
私、ネイトが最も期待していた非公開の研究は、勾配降下型の機械学習を土台にするのではなく、アライメントが可能なAIのための、実用的に実現できる新たな基礎をつくろうとするものだった。明らかな困難はあったが、うまくいくかもしれないと期待する理由はいくつもあった。
現時点で、そのプロジェクトは大部分、失敗した。エリエゼルも私も、主要な努力をそこへ注ぎ続けるほどの期待を、もうもてないという意味だ。私たちの実行の失敗なのか、領域そのものが本質的に難しいからなのか、基礎となる理論に欠陥があるのか、はっきりしない。
期待を失った理由の一つは、AGIまでどれほど時間があるか、アライメント問題がどれほど難しいかという自分たちの見立てに照らして、進み方が遅すぎるという感覚だ。AIアライメントの研究には期限がある。十分に遅い進み方しかできないなら、断念して、最初のAGIがアライメント可能な基礎の上につくられることにつながる、現実的な見込みのある新しいプロジェクトへ転じたほうがよい。
今は態勢を立て直し、選択肢を比較し、まだ成功の可能性があると思える計画を探している。
分野全体を見ると、MIRIの研究指導部は、これまで提案されたアライメント案の大半について、今もかなり悲観的だ。つまり、最近の私たちの研究の方向に対して悲観的になったからといって、ほかの選択肢への悲観が減ったわけではない。次に取り組む方向も、現在MIRIの外で人気のあるものに似たものには、おそらくならない。
MIRIは、これらのプロジェクトについて針路を変える必要があると考えている。同時に、ネイトを含め多くの人は、基礎となる理論にまだ期待を残している。取り組み方の失敗を見つけて直すなど、何らかの形でプロジェクトを立て直せることにも期待している。しかし、立て直しに時間を使えば、その分、もっとよく有望なアライメント計画を探す時間は減る。
そこで、以前この仕事に専念していた職員についても、いくつか変更を進めている。その人にとくに適していた研究の方向から私たちが離れるのに伴い、MIRIを離れて別の仕事へ移る人もいる。2017年に始めた研究を立て直そうとする人もいれば、別の実験や探索へ転じる人もいる。
どのような長期計画に決めるかは、まだわからない。新たな戦略の候補を考えているところだ。互いに両立しうる可能性として、次のようなものがある。
- アライメントへの新しい道を開く、多様な研究方法の拠点になるかもしれない。最善の取り組み方について不確実性が高まったので、方法の間である程度情報や発想を交換しながら、より幅広いプロジェクトを抱えることに価値があるかもしれない。
- 探索の期間を経て、まったく新しい方法に本腰を入れるかもしれない。AGIからよい結果を確保できる、現実的な見込みがあると思える方法を見つけられた場合だ。
- 2017年に始めた研究から得た理論や知見を、形を変えて今後の計画へ引き継ぐかもしれない。
公表した研究
ここ数年の最大の重点は2017年に始めた研究だったが、それと並行して、ほかにも多くの研究計画を進めてきた。
こちらも大半は非公開を基本としているが、公表した仕事も含まれる。ただし、一般に、この公開部分は私たちの研究全体を代表するものではない。
私たちの視点で、今年最も興味深い公開研究は、スコット・ガラブラントのデカルト的フレームのモデルと、ヴァネッサ・コソイのインフラベイズ主義の研究だ。
デカルト的フレームは、行為主体性を考えるための新しい枠組みであり、サイバネティック・エージェントモデルの後継を目指している。従来のモデルは、定義された安定した入出力経路を備え、時間を通じて存続するエージェントと環境を、基本的な前提に置く。一方、デカルト的フレームでは、こうした特徴はむしろ導出されるものであり、物理的な状況を概念上どう切り分けるかに依存すると考える。
この連載はとくに、以前「埋め込み型の行為主体」で論じた「サブエージェント」の概念と、時間的な順序について、より基本的なものから導かれ、近似にも向いた形を見つけることに力を入れている。時間的順序は、エージェントが自分の行動の予測や証明にもとづいて意思決定できる場合に、意思決定理論の問題の原因となる。連載の最後の記事では、これらを含め、この分野で発展させられる今後の研究の方向を論じている。
MIRIの研究者は一般に、こうした新しい概念の枠組みに強い関心をもっている。問題を考える見方が間違っていたり、直観を試すための単純な形式体系がなかったりすることが、しばしば研究の進展を妨げるからだ。
一方、ヴァネッサ・コソイとアレックス・アペルのインフラベイズ主義は、推論する者の仮説空間に、真の環境が含まれていないかもしれない場合の推論をモデル化する、新しい枠組みである。
とくに興味深いのは、適用できそうな問題が非常に幅広いことだ。真の環境が仮説空間にない場合、意思決定理論、人間原理に関する推論、環境に埋め込まれた行為主体、自己についての推論、そして帰納・確率と演繹・論理の統合などに関係する。ヴァネッサは、「以前は学習理論となじまないと思われていた多くの問題に、それを適用する道を開く」と説明している。
2020年には、スコットとエイブラムの「埋め込み型の行為主体」も大きく改訂され、議論の一部が明確になり、新しい小節がいくつか加わった。また、ヴァネッサの「最適な多項式時間推定器:近似アルゴリズムのベイズ的概念」の改訂版が、アレックス・アペルとの共著でJournal of Applied Logicsに掲載された。
ほかに進めている研究についても伝えるため、MIRIの研究者と協力研究員に、過去1年の仕事から注目点を選び、コメントしてもらった。
エイブラム・デムスキーは、次の文章を挙げている。
- 「効用関数に対する正統的な反論」――「ある意味では小さな技術的論点ですが、最近のエージェント基礎研究の一部で起こっている、かなり重要だと思う視点の変化を示しています。」
- 「ラディカルな確率主義」――「これも、以前の論理的帰納の結果を説明しただけと見ることはできますが、重要な視点の変化を指し示していると思います。」
- 「規範性を学ぶ:研究課題」――「ある意味、この研究課題は、先の2記事が伝えていた視点の変化を明確にしています。ただ、まだすべてを結びつけられたわけではありません。」
- 「因果的意思決定理論にダッチブックを仕掛ける:議論の改訂」――「私には、意思決定理論としてかなり大きな成果に見えます。」
エヴァン・ヒュービンガーは、過去1年の公開研究をこうまとめている。
- 「安全で高度なAIをつくる11の提案の概観」――「おそらく今年最大の仕事です。現在の主だった、既存のAI開発手法を前提とするアライメント案を、統一的に説明しようとした論文です。外的アライメント、内的アライメント、訓練時の競争力、性能面の競争力から、それぞれの長所と短所を検討しています。」
- 「今年はアダム・シミとマーク・シューの指導を始め、AI安全性の仕事を立ち上げる手助けをしました。具体的な成果には、アダムの『普遍性を解きほぐす』とマークの『SGDは欺瞞的アライメントを生むか?』があります。」
- 「今年は討論によるAI安全性について長く考え、別の討論の案を2つ生み出しました。『マーケットメイキングによるAI安全性』と『増幅と討論の統合』です。」
- 「さまざまなアライメント案を計算量の観点から検討する時間も取り、『アライメント案と計算量クラス』と『弱いHCHはEXPにアクセスする』につながりました。」
- 「『外的アライメントと模倣的増幅』では、なぜ模倣的増幅が外的にアライメントしているのかを論じています。『事前分布の学習と汎化』は、ポールの新しい『事前分布を学習する』方法への私の見方を示したものです。『内的アライメントの用語を明確にする』では、『学習された最適化のリスク』の用語を再検討しています。」
今年の前半には、バック・シュレゲリス(リンク)とエヴァン・ヒュービンガー(リンク)が、Future of Life InstituteのAI Alignment Podcastにも出演した。バックはスタンフォードでも「AI安全性に取り組む私自身の核心的な判断点」という講演を行った。
最後に、人類の未来研究所の研究者で、MIRIの協力研究員でもあるスチュアート・アームストロングは、自身の注目すべき成果をこうまとめている。
- 「報酬関数をオンラインで学習することの落とし穴」。DeepMindのヤン・ライケ、ローラン・オルソー、シェーン・レッグとの共同研究――「エージェントが『学習』過程をどう操作できるか、学習を本当に影響されないものにする条件は何か、また、影響を受ける学習過程を受けないものへ変える方法のいくつかを示しています。」
- 「モデルの分裂」――「AI安全性の問題の多くは、学習データの分布から外へ出たときに起こることにどう対処するか、という共通の問題に帰着できると論じています。安全なAIには、この『モデルの分裂』に原理にもとづいて対処する方法が必要だと主張し、いくつかの例の輪郭を描いています。」
- 「構文、意味、記号接地を簡潔に」――「記号接地は、抽象的な哲学の概念ではなく、実用上必要なことだと論じています。」
研究の進め方の改善と計画
新型コロナの流行による特殊な状況を受け、2020年のMIRIは、バークレーのオフィスが使えない間に研究者の生産性を高められないか、さまざまな実験をすることにした。その中で、研究チームのかなりの人が、今後も維持し、さらに広げたいと思える、仕事環境のよい変更を見つけた。
感染症への対応として、比較的地方の地域で、隔離を保ちながら共同生活と仕事をするグループに加わってこの年を過ごした多くの研究員は、ほかの研究者とともに静かで人口密度の低い場所に住むことに、驚くほど大きな利点があると感じている。研究や連携を進める仕組み自体が速くなったように感じられ、フィードバックの周期が短くなり、判断の核心を試す実験への取り組みが増え、その結果として方針転換も増えた。最大の方針転換は、先に述べた、2017年に始めた研究の方向から離れることだった。
それとは別に、MIRIの職員は数年前から、ベイエリアの外へ移転する場合の費用と利益を比較してきた。住宅問題やその他の行政の失敗、地域文化の長所と短所、将来状況が悪化する小さいが深刻なリスク、その他の要因を考慮している。
こうした事情に加え、今年は感染症のためすでに多くの人が移転していて、新たに動きやすいこともあり、MIRIはバークレーから離れることを検討している。選択肢を比べる際、とくに大きいのは、その場所や生活環境、働き方がよく快適に感じられそうか、という研究者自身の見通しだ。一般に、それが研究の進展にもつながると考えているからである。この点はますます、新しい場所へ移る方向を示している。
MIRIの多くの人は以前から、小規模な効果的利他主義やアライメント研究の合宿など、非常に実りの多い会話が、異常なほど密に生まれるように見える場があることに気づいていた。その活気の多くは、新鮮さや期間が限られていることから来るのだろう。しかし、それだけが密度と生産性の理由ではないと考えている。そうした特徴の一部が毎日あるような場所を、つくれるかもしれない。
実際、今年の新しい働き方には、そのような性質が大いにあると感じた研究者が何人もいた。そこで、その特徴を保ち、あるいはさらに強めるよう、職場としてのMIRIを変えられないか、とても意欲的に考えている。
このように、今年を特徴づけたのは、研究の進め方と、どの研究の方向が最も有望かについての考えに、大きな変化があったことだ。
AGI水準の最適化をどうアライメントするかの理解へ向けて、最近得られた具体的な進展には失望している。それでも、MIRIに集まる優れた人材と、これまで蓄積したアライメントについての考えを生かし、よりよい新しい道を探していく。計画が固まり次第、新たな戦略についてさらにお知らせする。