このページには、MIRIの研究者と、ほかの複数のAIアラインメント・予測・戦略研究グループの研究者が、汎用人工知能についてチャットルームで交わした対話の記録をまとめています。アラインメント問題はどれほど難しく見えるか、という問いから始まり、幅広い話題を扱っています。
アラインメントをめぐる議論の様子を、できるだけフィルターをかけずに伝えるため、記録は意図的に、ほとんど編集せず、生の形で残しています。
以下の記事はMIRIブログ、LessWrong、AI Alignment Forum、Effective Altruism Forumに転載されており、音声でも利用できます。
関連する背景資料
この議論の背景となる、以前の資料には次のものがあります。
- 『Rationality: A–Z』
- 『Inadequate Equilibria』
- 『Superintelligence』
- 「AIアラインメント:なぜ難しいのか、どこから始めるか」
- 「汎用人工知能には火災警報器がない」
- 「セキュリティー・マインドセット」の対話(前編、後編)
より最近の2つの対話も、背景の理解に役立ちます。
エリエゼル・ユドコウスキーとのAGIへの介入についての対話――9月上旬
- エリエゼルの現在の見解についての報告です。彼には状況が「信じがたいほど厳しい」と見えています。アラインメント問題で分野全体がほとんど進歩しておらず、それを変えられそうな研究の案も、現時点では思いつかないからです。
- ここから成功するには、エリエゼルのモデルの予測を、よい方向に外れる展開が必要です。彼は大げさに、これを「奇跡」が必要だと表現します。しかし、いま集中する価値があるほど起こりそうな、特定の「奇跡」は見当たりません。
- 代わりに彼は、さまざまなシナリオで役立ちそうな行動を提案します。たとえば、大規模な機械学習アラインメント実験を非公開で行う能力を築くこと、一般に非公開での研究を促すこと、新しい案や方法を生む、並外れたアラインメント研究者をさらに見つけることです。
カールスミスの「権力を求めるAIは存亡リスクか?」へのコメント――9月2〜13日
- ネイト・ソアレスが、AGIの実現時期、人類の存続に関わる破局の確率、関連する話題について、MIRI指導部の定性的な見解をうまくまとめています。
第1部――主にリチャード・ンゴとエリエゼル・ユドコウスキー
ンゴとユドコウスキー、アラインメントの難しさを語る――9月5〜12日
MIRI · LW · AF · EA · 音声 (I, II, III)
エリエゼルとリチャードは「決定的な行動(pivotal act)」、特に、将来どんなAGIが現れても世界が破壊されるのを防ぐ行動について議論します。
エリエゼルは、その行動を可能にするほど有能なAIをアラインさせるのは難しいと主張します。彼に実際にうまくいきそうに見える行動はすべて、「時間を通る経路を探索し、高得点のものを出力として選ぶ」強力な非人間的過程、彼の言う「結果主義」を必要とし、それは特別な対策がなければ、極めて危険だからです。
ネイトはレーザーの比喩を使い、結果主義的なシステムのアラインメントや修正可能性などを実現するのが難しい、という考えを説明します。
おそらく、その計画には、環境に霧があればレーザーの焦点を合わせ直し、鏡があれば向きを変えるなどの仕組みを、いろいろ組み込む必要がある。[……]遠くの狭い標的に、実際に当てるためだ。標的を狙い続けるために焦点や方向を修正することは、そのような標的に届く計画と切り離せない。
しかし、人間がAIを停止するのはレーザーを散乱させるようなもので、AIを調整して別方向の計画を立てさせるのは、光の向きを変える鏡を差し出すようなものだ。そして私たちは、計画がそうした干渉を補正しないことを望んでいる。
したがって、私の理解するエリエゼルの見方では、私たちは非常に不自然な種類のものを求めている。非常に多様な状況でも、歴史を狭い範囲に流し込めるほど頑健な、未来へ至る経路でありながら、どの狭い範囲を目指すかを変えようとする、人間による特定の試みには、なぜか反応しないものだ。
ンゴとユドコウスキー、AIの能力向上を語る――9月14日
MIRI · LW · AF · EA · 音声 (I, II)
- リチャードは、エリエゼルの「結果主義」という概念が、決定的な行動を行えるAIについて予測するのに、それほど役立つか疑問を示します。
- 5.3節では、エリエゼルがEAの認識論を批判します。
- 5.4節では、政府は将来のAIの影響に備えたり、協調したり、その他の点でも適切に関与したりしないだろうと、エリエゼルが予測します。
ユドコウスキーとクリスティアーノ、「離陸速度」を議論する――9月14〜15日
MIRI · LW · AF · EA · 音声 (I, II, III)
- 5.5節で、エリエゼルはポール・クリスティアーノの2018年の記事「Takeoff Speeds」を批判します。5.6節では、二人がリアルタイムで討論します。
- ポールは「緩やかな離陸」を支持します。GPT-3など、AGIの技術は実質的にすでにあり、今後数十年、計算資源を増やして着実に規模を拡大すれば、影響は徐々に、予測できる形で増していく、という見方です。
- エリエゼルは「急激な離陸」を支持します。現時点ではAGIの作り方を知らず、そこまでの道筋も、どれほど先かも予測しにくい。そして作り方が分かったときには、不意を突かれ、世界を救ったり破壊したりできる能力へ、非常に速く進む可能性が高い、という見方です。
ソアレス、タリン、ユドコウスキー、AGIの認知を議論する――9月18〜20日
- ヤーン・タリンとエリエゼルは、7.1節で、AIの裏切りへの転換の各段階、結果主義、その他のさまざまな話題を議論します。
- ネイト・ソアレスは、7.2節で、決定的な行動を行えるAIについてのエリエゼルのモデルに対する、リチャード・ンゴの批判を、自分なりに捉え直し、より鋭くしようとします。
第2部――主にポール・クリスティアーノとエリエゼル・ユドコウスキー
クリスティアーノ、コトラ、ユドコウスキー、AIの進歩を語る――9月20〜21日
- 急激な離陸と緩やかな離陸をめぐる、エリエゼルとポールの討論の続きです。二人それぞれのモデルが未来について何を予測するか、予測のスタイル、AIや脳における計算資源の拡大と構造上の革新の役割などを論じます。
生物学に基づくAGIの実現時期予測――決してうまくいかない手法――10月19日
- エリエゼルは架空の対話を通じて、アジェヤ・コトラの「生物学的アンカー」のようなAGI予測手法では、有益な情報が得られないと論じます。
生物学的アンカーについて、エリエゼルに答える――12月23日
- ホールデン・カーノフスキーが対話に応答します。モラヴェックの予測は振り返るとうまくいっていること、生物学的アンカーの報告書はAGIの点推定でなく、厳密ではない上限を示すものだということ、現在のディープラーニングの枠組みを通じてAGIが実現すると仮定してはいないことなどを論じます。
シュルマンとユドコウスキー、AIの進歩を語る――9月21〜22日
- カール・シュルマンが、傾向線の外挿、スケーリング則、AIの将来の経済的影響など、AIの離陸をめぐる論点を掘り下げます。
クリスティアーノ、コトラ、ユドコウスキー、AIの進歩をさらに語る――9月22〜24日
- 「なぜ初期の試作品の影響は小さいと予想すべきか」と、AIの進歩についての具体的な予測を議論します。
技術予測と漸進主義についての対話――9月23日〜10月2日
- 一般的な技術予測の経験則について、何日にもわたって自由に議論します。
- 12.1節は、ロブ・ベンシンガーの「AGIの性質はコンピューター科学の問題だ」という議論を中心に扱います。12.2節は、エリエゼルの「AIについての漸進主義では、人間どうしの個人差が小さすぎると予測してしまう」という議論を中心に扱います。
第3部――多様な参加者
アラインメントの難しさについてのンゴの見方――9月25日
- リチャードは、特化型AIが「多くの種類の科学研究」で人間を上回ると予想すべきだと論じ、「課題に基づく強化学習」に楽観的な見方を示します。これは、「限定された課題をうまくこなすことに対し、おそらく人間のフィードバックと、何らかの反復的増幅を通じて、エージェントに報酬を与える」ものです。エリエゼルらが応答します。
- リチャード、カール、エリエゼルが、米中協調のシナリオを議論します。
ンゴとユドコウスキー、科学的推論と決定的な行動を語る――10月4日
- リチャードとエリエゼルは、「浅い認知」と「深い汎用性」、そして決定的な行動に必要な認知能力を議論して、二人のやり取りを締めくくります。
クリスティアーノとユドコウスキー、AI予測と人間の知能を語る――10月19日〜11月27日
- ポールとエリエゼルは、EfficientZeroと近い将来のAI予測、それに続いて人間の知能の進化と力を議論し、自分たちの対話を締めくくります。
シャーとユドコウスキー、アラインメントの失敗を語る――11月6〜14日
- 対話シリーズの締めくくりとして、ローヒン・シャーとエリエゼルが、アラインメントが能力ほど容易には汎化しない原因を議論します。
- この記録の後には、未解決の論点と「2021年後半のMIRI対話集」全体を振り返る、LessWrong上の 公開討論 が続きました。