非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

安全工学、目標の選定、アラインメント理論

原題: Safety engineering, target selection, and alignment theory / Analysis

原文クレジット(WordPress投稿者表示): Nate Soares / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2015-12-31

訳文状態: 校閲済み(原文対照レビュー実施)

AIの能力研究は、コンピューターシステムをより知的にし、より幅広い問題を、より効果的かつ効率よく解けるようにすることを目指す。これは、さまざまな能力水準のAIを、より安全、あるいは「頑健で有益」にすることを特に目指した研究とは区別できる。この記事では、「AI安全性」の仕事と考えられる直接的な研究を、安全工学、目標の選定、アラインメント理論 の三つに分ける。

微積分や天体力学をしっかり理解する前に、人類が何らかの方法で、空気より重い機械による飛行を開発した世界を想像してほしい。その世界で、人間を安全に月へ運ぶには、どんな仕事が必要だろうか。

この場合、目の前の主な課題は、ロケットを設計し、燃料を精製して、打ち上げたら上向きに加速し、爆発しないようにすることだと言える。宇宙との境界は、特化型の知能と汎用知能の境界にたとえられる。どちらも曖昧だが、工学的に重要である。宇宙船と航空機は、用途も直面する制約も違う。

このロケットの能力開発と対になるのが、 安全工学 の課題だ。安全工学は、人工的に作ったシステムが、許容できる水準の安全性を備えるようにする技術である。月への軟着陸を達成するうえで、安全工学には多くの役割がある。ある技術者チームは、ロケットの材料が、十分な余裕を持って打ち上げ時の負荷に耐えるようにするだろう。別のチームは、失敗しても乗員が生き延びられる脱出システムを設計するかもしれない。危険な環境で乗員を支えられる生命維持装置を設計するチームもあるだろう。

別の重要な課題が、 目標の選定、つまり月のどこに着陸するかを選ぶことだ。月探査では、まだ望遠鏡がないなら、その設計と製作を行い、着陸地点を特定する、といった研究になるかもしれない。もちろん事前に決められることには限界がある。新しい情報が入ったら、直前でも着陸目標を変えられるよう、月着陸船を設計する必要もあるだろう。これにも高度な工学的な技術が必要だ。

安全に脱出速度へ到達することと、どこへ行きたいかを決めることに加え、月へ着陸するには、もう一つ重要な前提条件がある。正しい最終目的地へ到達するための技術的な仕事、ロケットの アラインメント 研究だ。この比喩を使い、MIRIが取り組む 人工知能 のアラインメント問題を説明しよう。

アラインメントの課題

月の特定の目標に到達するのは、ロケットの先端を慎重にその月面座標へ向けて、「発射」を押すほど単純ではない。必要な進路修正は操縦士に任せられると信じていても、そうだ。天体の間の軌道を計算するという、重要な仕事がある。

写真:NASA/ビル・インガルズ

ロケットのアラインメントには、単に荷物を惑星から運び出すだけなら不要な、別の理論知識が必要かもしれない。微積分なしに動くロケットを設計するのは、非常に難しい。それでも、十分な粘り強さと、余裕のある資源があれば、長年の試行錯誤で宇宙に達する文明は想像できる。その時点で、宇宙へ出るだけでは、特定の場所へ向かうのには十分でないという問題に直面することになる。((同様に、太陽系に一つしかない惑星や、常に雲に覆われ、太陽と月以外の天体が見えない惑星に住む文明を想像できる。その文明は、地上の力学を十分に理解していても、天体力学のモデルや、地上と宇宙で同じ運動法則が成り立つという知識を欠くかもしれない。その場合、専門家には、脱出速度へ到達する方法の理解とは別に、ロケットのアラインメントの理論的な理解に欠けるところがある。))

初期の研究者は、こう問うかもしれない。「風、爆発、燃料効率を気にしなくてよい理想的な条件なら、ロケットにどんな軌道を取らせるか」。それさえ能力を超えているなら、さらに単純化して、「地球が完全な球で大気もないと仮定すると、砲弾 をどんな角度と速度で発射すれば、地球を回る安定した軌道に入るか」と問うかもしれない。

発射台を離れる乗り物を一つ作るだけでも頭を悩ませる、初期のロケット技術者には、この問いは現実離れして見えるだろう。「ロケットを大砲から撃つわけではないと知らないのか」「地球をぐるぐる回ることが、月へ行くのと何の関係があるのか」と聞くかもしれない。それでも、月へ軟着陸するには、アラインメントの理解がとても重要だ。大気のない完全な球の惑星で、砲弾をどんな角度と速度で撃てば安定した軌道に入る ことになるか もまだわからないなら、月探査を試みる前に、天体力学への理解を深める必要があるかもしれない。

AI安全性研究の三つの形

AI研究でも同じだ。AIの能力に関わる仕事には、安全工学の課題が伴う。今日のAIの 安全技術者 は、幅広いソフトウェアの内部を、人間にとって透明で解釈しやすくすることに取り組むかもしれない。敵対的な観測に直面しても、システムが穏当に機能を失うようにするかもしれない。運用者が故障を防ぎ、対処できるようにするセキュリティ手順や早期警戒システムを、設計するかもしれない。((ローマン・ヤンポルスキーは「AI安全工学」という言葉を、外部で検証できるよう自分の安全性の証明を提示するAIシステムの研究に使っている。そこには、ここで「アラインメント研究」と呼ぶ理論研究の一部も含まれる。この記事とは用法が異なる。))

AI安全工学は欠かせない仕事であり、能力開発の工学から切り離すことはできない。航空宇宙工学での日々の安全の仕事は、倫理学者の委員会が技術者の肩越しに見張ることには頼っていない。フェイルセーフや予備の生命維持装置など、安全のために存在する部品に時間を費やす技術者はいる。しかし安全工学は、独立した別分野ではなく、安全性が決定的に重要なシステムを作る工学の、一体をなす部分だ。

AIにおける 目標の選定 は、「強力なAIを作れるなら、それを何に使うべきか」という問いを扱う。超知能が開発される可能性は、理論倫理学と応用倫理学に、いくつもの難問を突きつける。一部は近い将来、道徳哲学者、心理学者、AI研究コミュニティによって解けるかもしれない。別の問いは、間違いなく未来に委ねる必要がある。スチュアート・ラッセルは、「将来、道徳哲学は重要な産業部門になる」とまで予測している。重要な研究分野だという点には私たちも賛成だが、MIRIの主な焦点ではない。

MIRIの研究者が取り組むのは、AIの アラインメント だ。強力なAIを特定の目標へ向かわせるには、原理的にどうすればよいかを研究する。目標の選定が「ロケット」の目的地、つまり「AIに私たちの文明へどんな影響を与えてほしいか」を扱い、能力開発の工学が脱出速度への到達、つまり「目標達成を助けるだけの力をAIにどう持たせるか」を扱うのに対し、アラインメントは特定の天体を狙う方法、つまり「高能力のAIを作れると仮定して、目標へどう向かわせるか」を扱う。私たちの理解はまだ『微積分とは何か』という段階なので、「地球が完全な球で、大気もなければ、砲弾をどんな角度と速度で撃つと安定軌道に入るか」に相当する問いを立てている。

有望な研究経路を選ぶのは、簡単ではない。後から見れば、初期のロケットのアラインメント研究は、微積分の発明と重力の研究から始めるべきだ、と言うのは容易だ。しかし、微積分や重力が何かをまだ明確に理解していない人には、研究課題を選ぶのはずっと難しいだろう。有望な方向性は、エーテルやアリストテレス物理学のような、実を結ばない方向性と競い合うことになる。何が実を結ばないかは、事前には明白でないかもしれない。

アラインメント可能なエージェントの理論へ

AIにおいて「微積分」や「重力」の役割を担う候補には、何があるだろうか。

図:ブライアン・ブロンデル

MIRIが現在重点を置くのは、演繹に限界があるもとでのよい推論(論理的不確実性)、大きな環境に埋め込まれたエージェントでも機能する意思決定理論、自分自身の推論の仕方を是認する推論手続き、などだ。大気のない完全な球の地球を仮定するのに似て、簡単な模型を作り、大きく単純化した条件で問題を調べることが多い。

論理的不確実性の理論を作ることは、多くの人が「AI安全性研究」と聞いて思い浮かべるものではない。では、その理論を作らなければ、具体的に何が問題になるのか、と問うのは自然だ。数学や論理で、限られた資源のもとでの推論を行えないAIは、特に「危険」には聞こえない。数学的推論が必要なのにできないシステムは、かなり 役に立たない かもしれないが、危険になるとは想像しにくい。

私たちの考えでは、論理的不確実性の理解が重要なのは、作ったシステムを十分に理解し、そもそもアラインメントできると、正当な根拠を持って結論づける助けになるからだ。ロケットなら、同じ問いはこうなる。「微積分を作らなければ、ロケットにどんな悪いことが起こるのか。操縦士が進路を直そうとしても、小さなベクトルを十分速く足せず、困ると思うのか」。答えは、操縦士が進路修正に困ることではない。月へ向かうと思っていた軌道が、ロケットを大きく外れた方向へ連れていくことだ。微積分を作る目的は、操縦士が素早く修正できるようにすることではない。最良の道具でさえ、ロケットは直線に進むと仮定している世界で、曲がった軌道について議論できるようにすることだ。

論理的不確実性でも同じである。それを扱い損ねて特定のAIが破局的に失敗する、と想像しているのではない。問題は、合理的なエージェンシーを分析する最良の既存の道具が、エージェントを論理的に全知と仮定しており、最良の理論と、最良の実用AI設計が噛み合わないことだ。((微積分が、脱出速度に達するロケットを作るのにも、特定の月面座標へ向けるのにも役立つように、論理的不確実性の形式的理解は、AIの能力向上にも、強力なAIをよりよくアラインメントすることにも役立つかもしれない。主な研究動機は、他の多くのアラインメント問題が、演繹に限界のある推論者のモデルを必要として、足踏みしていることだ。曲線のモデルがないため、軌道の計算ができないのと同じである。))

現時点でのアラインメント研究は、特定の工学問題を解くことが目標ではない。初期のロケット研究の目標は、軌道を作り、評価するための共通言語と道具を開発することだろう。微積分と天体力学がなければ、それらを作る必要がある。同じように、AIアラインメント研究の目標は、強力なAIを意図どおりに動くよう設計する方法を作り、評価するための、共通言語と道具を開発することだ。

成功の基準を設定しにくいのではないか、と心配する人もいるだろう。月着陸に挑むには、ニュートン的な重力の理解で十分か。それとも、軟着陸できると信じる前に、一般相対性理論を完全に作らなければならないか。((もちろん、どちらにせよ、量子力学と一般相対論を統一する理論を待つ間、宇宙計画を停止したいわけではない。重力を 完全に 理解する必要はない。))

AIアラインメントには、最初に注目すべき明白な基準が、少なくとも一つある。インターネット、自動化工場、大金を利用できる、途方もなく強力なコンピューターがあると想像してほしい。できるだけ多くのダイヤモンドを作るといった単純な目標を、確実に達成するようプログラムできれば、研究の大きな部分が完了する。問題の大きな部分は、安定し、誤りに耐え、何らかの 目標と一致すると実証できる自律システムを理解することにあるからだ。ロケットを 何らかの 方向へ確信を持って操縦できるようにするほうが、そこから追加で、特定の月面地点へ向かわせる能力を得るより難しい。

おおむね、こうした目標の追求が、MIRIのアプローチである。私たちにとっての、「燃料や風を気にしなくてよければ、ロケットを月に当てられるか」という問いだ。これに答えるだけで、人間より賢いAIが私たちの目標に一致すると保証できるわけではない。それでも、現在の知識から大きな前進になるし、省略しても問題ないような基礎的洞察には見えない。

次に何をするか

この1年間で、将来のAIを頑健で有益にする課題への注目は、非常に大きく高まった。AI安全性はとても真剣に受け止められ、技術者も前に出て、安全工学を能力開発の工学から切り離せないと認めている。AI分野の成熟に伴い、安全工学はますますAIの文化にしっかり根づくだろう。一方、目標の選定や、その他の安全性問題に関する新しい研究は、この分野の大きな年次会議の一つ、AAAI-16のAIと倫理のワークショップで紹介される。

第四の種類の安全性研究、 戦略 研究への支援も増えている。自国が冷戦下で宇宙開発競争に巻き込まれているなら、月へ人を送る試みが、微妙な政治的均衡を崩し、核戦争へつながらないよう、ゲーム理論家や戦略家に相談したいだろう。((歴史的には、ランド研究所が担った役割だ。))宇宙の利用に関する条約を結ぶために国際的な連合が必要なら、外交も安全性の仕事の一面となる。同じ原則はAIにも当てはまる。連合の形成や世界的な協調が、技術の開発と利用で重要な役割を果たすかもしれない。

今年は戦略研究が増えている。AI Impactsは、世界を変えうるこの技術の設計者に関わる戦略分析を行っており、まもなく戦略的AI研究センターも加わる。新しいリーヴァーヒューム知性の未来センターは、多分野の人を集めてAIの社会的影響を研究し、新しい協力関係を築く予定だ。グローバル優先課題プロジェクトは、強力なAIの開発からよい結果を確保するのに、どのような介入が最も有効そうかを分析している。

分野は急速に動いており、こうした発展は、とても心躍るものだ。だが、その中でも、とりわけAIアラインメントの研究は、なお十分に取り組まれていないように見える。

MIRIだけがこの研究をしているわけではない。ほかの組織や機関の研究者も、少数ながら似た問いを立て始めている。MIRIの方法だけが、利用できる唯一の道では決してない。月へ人を送る方法を初めて考えるなら、ロケットと宇宙エレベーターの両方を検討してもよい。誰がどこで研究するにせよ、アラインメント研究に注目が集まることが重要だ。

人間より賢いAIは、何十年も先かもしれず、既存のソフトウェアのどれにも、あまり似ていないかもしれない。そのため、実りある安全工学の方法を特定する力には限界がある。同時に、私たちの価値を明確に記述する難しさは、道徳理論で有望な研究を見つけることも難しくする。アラインメント研究には、将来の多様な計算システムへ適用できるほど抽象的でありながら、明白な進歩を認められるほど形式化できる、という利点がある。これを優先すれば、AI安全性の分野は、最も重大な問いを見失わずに、技術的な研究に足場を置けると考えている。

安全工学、道徳理論、戦略、幅広い協力関係の形成は、どれも、安全で役立つAIを開発する計画の重要な部分だ。全体として、長期的な結果への関心が最近高まったことで、これらの領域は発展していきそうに見える。重要な仕事への努力と投資が増えているのを、私はうれしく思う。

問うべきなのは、次に何へ投資する必要があるかだ。AIコミュニティで次に最も起きてほしい成長は、アラインメント研究の成長である。それを主な焦点にする新しいグループや組織が生まれ、MIRI、バークレー、オックスフォードの人類の未来研究所などの既存チームが拡大してほしい。

ロケットを月へ着陸させようとする前に、砲弾を安定軌道へ入れる方法を知ることが重要だ。アラインメントの理論をよく理解しなくても、文明がいずれ脱出速度へ達することは、十分ありうる。だが、価値があり、心躍る新しい場所へ、しかも確実に到達することは、まったく別の大きな課題なのである。


この記事の着想を示してくれたエリエゼル・ユドコウスキーと、内容の確認を助けてくれたロイド・ストロール三世、ロブ・ベンシンガーらに感謝する。