非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

機械学習に重点を置く、MIRIの新しい研究プログラム

原題: A new MIRI research program with a machine learning focus / MIRI Strategy

原文クレジット(WordPress投稿者表示): admin / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2016-05-04

訳文状態: 校閲済み(原文対照レビュー実施)

MIRIが新しい研究課題「高度な機械学習システムの価値アライメント」に着手することを、お知らせします。MIRIチームの半分に当たるパトリック・ラヴィクトワール、アンドリュー・クリッチ、そして私は、少なくとも今後1年間、時間の大部分をこのプロジェクトに充てます。残りの時間は、以前からの研究課題に取り組みます。

MIRIの研究全般は、スチュアート・ラッセルが人工知能研究者に投げかけた問い、「もし私たちが成功したら、どうなるのか?」への応答と捉えられます。頑健で信頼できる高度なAIシステムを設計するには、いくつかの理論的な前提条件を整える必要があるように見えます。私たちの研究は、それを早くから整えることを目指しています。

私たちの研究課題全般は、AIシステムが汎用的な推論能力で人間に匹敵し、それを超えるのがいつになりそうか、また、そのようなシステムが現在の機械学習(ML)システムに似たものになるかどうかについて、特定の立場を取りません。近年の深層学習の目覚ましい進歩は、ニューラルネットワークを着想源とする比較的単純なアプローチでも、非常に強力で汎用的になりうることを示唆しています。そのため、私たちは、もっと具体的な下位の問いについて、初期的な調査を始めます。「現在の機械学習の取り組みと性質の似た手法で、AGIの実現に成功したらどうなるのか?」という問いです。

この研究の多くは、タスク指向AI について、高い抽象度での理論的理解を深めることを目指します。世界を長期的かつ大規模に最適化しようとする、ニック・ボストロムが「主権者AI」と呼ぶものと違い、タスクAIは、限られた範囲で指示された課題を実行することにとどまります。最大化するのではなく、十分に満足できる水準を達成する「満足化」を行うのです。私たちは、機械学習の視点からタスクAIを調べることで、タスクAIの実現可能性と、高度な教師あり学習・教師なし学習・強化学習システムについて早期に安全性を研究することの取り組みやすさ、その両方を知る手がかりが得られると期待しています。

このため、まず次の八つの技術的問題を調べます。


1. 帰納に伴う曖昧さの検出。

テストする事例の分類が、訓練データだけでは一意に定まらない場合を、分類器などの機械学習システムが見抜けるようにする、一般的な方法論をどう設計できるでしょうか?

たとえば、曖昧さを検出する分類器を、戦車の画像と戦車ではないものの画像を区別するために設計したとします。訓練集合には、曇りの日に撮った戦車の画像と、晴れの日に撮った戦車以外の画像しかありません。この分類器は、晴れの日の戦車の画像をどう分類するかは曖昧だと検出し、運用者に何らかの問い合わせをして曖昧さを解消し、誤りを避けるべきです。

能動学習や、より広くは統計的学習理論の過去および現在の研究は、この目標へ向けて前進してきました。しかし、現実のシステムを複雑な環境に導入する前に、誤り率や問い合わせ率について現実的な統計的限界を定めるには、さらに研究が必要です。

2. 十分な情報に基づく監督。

行動と、その行動を人間が評価するのを助ける情報を含む「報告」の両方を出力するよう、強化学習システムをどう訓練できるでしょうか?

たとえば、人間が強化学習システムに独創的な物語を出力させる訓練をしているなら、その物語を評価するとき、別の物語から盗用していないかなど、物語そのものを読んでも判断しにくい情報を知りたくなるはずです。

3. 人間を模倣するシステムの、安全な訓練手順。

自然言語で質問に答えるなど、豊かな出力を伴う課題を行う人間を、機械学習システムがその能力の限り模倣するようにするには、どう設計すればよいでしょうか?

模倣学習や生成モデルには既存のアプローチがありますが、理論的な欠点もあり、この一般的な問題を完全には解決できません。特に、人間の行動で訓練した敵対的生成モデルには、敵対側の判別器が検出できる人間の側面だけを模倣する誘因しかありません。そのため、(2)の盗用の問題に似た問題が生じえます。

4. 保守的な概念。

ある概念に当てはまる事例をいくつか与えられたとき、その概念の境界的な事例を作ることなく、新しい事例を作り出せるシステムを、どう設計できるでしょうか?

たとえば、人間が作った100個のブリトーについての詳しい情報を、訓練データとしてシステムに与えたとします。そのシステムは、極端に小さいブリトーなどの境界的な事例を避けつつ、さらにブリトーを製造するべきです。そのような小さなものでも、ブリトーと考えることはできるとしても、です。

特に対策をしなければ、ほとんどの目的関数はそうした境界的な事例へとつながります。たとえば、小さいブリトーのほうが安く作れるからです。この問題を避ける一般的な手法を開発できるでしょうか?

5. 感覚データを使って、環境に関する目標を指定する。

ほとんどの機械学習システムの目標は、時間に応じて割り引かれた報酬など、感覚データを用いて定義されています。こうした感覚に関する目標は、環境に関する目標の有用な代理にはなりますが、同一ではありません。自分のセンサーをだまして部屋にイチゴがあると感知させることと、実際にそこにイチゴがあることは、同じではないのです。「この部屋にイチゴがある状態にする」といった、環境内の有用な目標を直接追求するシステムを、どう作ればよいでしょうか。しかも、目標の指定に使った代理指標へシステムが干渉する機会に対しても、頑健であるようにです。

6. 影響の小さいエージェント。

高度に知的なタスク指向システムには、目標を追求する際、私たちの意図していない大きな副作用を一般に避け、目標を達成することで生じうる大きな影響があれば、それを知らせてほしいと思います。たとえば、住まいのない家族のために家を建てるよう頼んだなら、材料を得るために近隣の家を壊すという大きな副作用は避けるべきだと、暗黙のうちにわかっていてほしいのです。一方、その家族の社会経済的な状況を改善するという、望ましい大きな波及効果はもたらしてほしいと思います。どのような個別の課題でも、近隣の家の破壊といった副作用に、その場に合わせた費用関数を指定することはできます。しかし、そうした損失をいつも前もって予測できるわけではありません。そこで、意図した大きなよい影響を与える能力まで制限せずに、AIの副作用を一般的に制限する方法を、定量的に理解したいのです。

7. 穏やかな最適化。

(6)で使う低影響の基準に欠陥があったり、重要な考慮事項が抜けていたりする場合に備えて、「頑張りすぎないで」「最適化の力を使いすぎないで」と、システムに伝える方法が欲しいと思います。直感的には、大きな努力のほうが大きな影響を生みやすいからです。ただし、この対応関係は完全ではありません。

能力の低いAIシステムは、意図しない大きな副作用を生じにくい傾向があります。私たちは、高い能力を持つシステムにも、より少ない「努力」を使わせることで、同じように安全にする方法を知りたいと思います。「努力」という私たちの概念を十分にうまく形式化できれば、総努力量に絶対的な限界を設けるように、あるいは、かなり高い確率で目標を達成するのに必要なだけの努力を使うように、システムをプログラムできます。これによって、(6)ではうまく測れなかった影響も制限できるかもしれません。

8. 道具的な圧力を避ける。

追加の資源を得ることなど、ある種の収束的な道具的目標を追求すれば主要な目標の達成に役立つ場合でも、それを追求する動機を持たないシステムを、どう設計できるでしょうか?

特に、自分自身の停止や一時停止を引き起こすことにも、阻止することにも誘因を持たないシステムを作りたいかもしれません。「自分の稼働を続けられるようにする」といった道具的な圧力は、大きな影響や努力への誘因になりうるため、この問題は(6)と(7)に関わります。しかし、これは独立した研究項目です。(6)や(7)の解決策が効果を発揮するより前に適用できる形で、ある種の道具的な誘因を完全に取り除ける可能性があるからです。


こうした関心分野を定めた今、私たちは、この研究課題に取り組むのは時宜にかなっていると考えています。機械学習の新たな飛躍の波を受けて、「頑健で有益な」AIという考えが、最近、注目を集めています。このプロジェクトで行うような理論的研究は、たとえば私たちが最近行った論理的不確実性やゲーム理論の研究より、AIと機械学習の主要な枠組みとのつながりが明瞭です。そのため、近い将来にAI・機械学習の研究者と協力することにも、より適しています。


これらの研究の方向性について、多くの初期のアイデアの種をまいてくれたエリエザー・ユドコウスキーとポール・クリスティアーノ、アイデアを発展させるのを助けてくれたパトリック・ラヴィクトワール、アンドリュー・クリッチ、ほかのMIRI研究者、そして貴重な議論を交わしてくれたクリス・オラー、ダリオ・アモデイ、ジェイコブ・スタインハートに感謝します。