非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

「アラインメントの大部分は、そもそも認知を狙った方向へ向けられるようにすることだ」とはどういう意味か

原題: What I mean by “alignment is in large part about making cognition aimable at all” / Analysis

原文クレジット(WordPress投稿者表示): Nate Soares / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2023-02-02

訳文状態: 校閲済み(原文対照レビュー実施)

(認識上の位置づけ:以前から伝えようとしてきた論点についての誤解を解こうとしています。この記事は、その論点の正しさを論証するためのものではありません。)

AIアラインメントの問題の大部分は、私の見るところ、強力な認知を何に向けるべきかを見いだすことよりも、そもそも何かに向けられるようにすることにある。私は長年そう言ってきました。

最近、この点を誤解している人がいるとわかったので、ここで説明し直してみます。

上の発言は、次のような意味ではありません。

(1)実際に扱うAIはどれも、単一の目的の追求を中心に、内部が必ず整然と組織されている。この「目標スロット」に、偶然任せで目標が設定されるのではなく、自分の望む目的をうまく入れることが、中心的な難題である。[念のため:私はこれを主張しているのではありません]

言いたいことは、むしろ次のようなものです。

(2)特に対策をしなければ、人類が最初に作る知的システムは、ひどいスパゲティコードの塊になるでしょう。明確に切り分けられ、その周囲の認知が一丸となって追求するような「目標」はありません。むしろ、複雑で場当たり的な仕組みがごちゃごちゃに結びついた寄せ集めに近くなるでしょう。その最終的な振る舞いは、自らを省察し、内部の緊張関係を時間とともに解きほぐしていく過程の細部に左右されます。

動作中に加わるさまざまな圧力(省察など)のもとでも安定した、「目標スロット」におぼろげに似たものをAIに持たせるだけでも、認知そのものを深く理解し、扱う力が必要です。より中身を理解しやすく、狙った方向へ向けやすい方法を選別せず、ただ知的システムの作り方を見つけようとするだけでは、そうした力を身につけられる見込みはきわめて低いでしょう。

これとは別に、独立した考えとして、AIが人間を圧倒的に超える超知能への移行を完全に終えるころには、さまざまな不整合を解消し、特定の目標を軸に動くようになると私は考えています。少なくとも行動上はそうなるでしょう(効率性を参照)。ただし、知的な内部構造も最終的には明確に機能が切り分けられるだろうと推測しています。もっとも、目標の維持に関して単一障害点が生じるような形ではないでしょう。

(しかし、これで問題が解決するわけではありません。圧倒的な超知能を持つAIが、自らを整理して「目標スロット」を備えるころには、もうあなたにそこを触らせてはくれないからです。)

さらに、AIが未来をある狭い範囲に押し込む行動を見つけられるのであれば、そのAIを、ほぼいつも、おおむね「何らかの目的を追求している」かのように語るのは、たいてい妥当だろうと私は考えています。実態としては巨大で場当たり的な仕組みの寄せ集めであり、人間には予測できない形で時間とともに内部を整理している段階であっても、そうです。

これらの別の考えを伝えようとしたことで、私の意図が上の(1)に近いもの(「実際に扱うAIはどれも、単一の目的の追求を中心に、内部が必ず整然と組織されている……」)だと誤解されたとしても、無理はありません。実際に言いたいのは、(2)に近いこと(「特に対策をしなければ、人類が最初に作る知的システムは、ひどいスパゲティコードの塊になる……」)なのです。


これまで誤解していた方の助けになるかもしれないので付け加えると、「ダイヤモンド最大化装置」の問題は、「目標スロット」のようなものを中心に認知の機能を明確に切り分ける、という課題へ研究者の注意を向けようとした例の一つです。

ここに誤解があることを示す例を挙げましょう。ダイヤモンド最大化装置の問題について私の説明を聞いた人が、ある状況ではAIにダイヤモンドを多少は気にかけさせられるかもしれない、といった学習方法を提案してくることがあります。提案者自身にも、それ以上の結果になるかどうかはわかっていません。

ダイヤモンド最大化装置の問題が、もともと何に注意を向けさせようとしていたのかについてのこの誤解は、この記事で解こうとしている誤解と関係があるのかもしれません。以上を踏まえれば、そうした試みがほとんど手がかりにならないと私が考える理由も、わかりやすくなるかもしれません。問うているのは、省察や偶然に振り回されてあちこちへ突進する場当たり的な仕組みの寄せ集めではなく、特定の目的を明確に追求する認知を、どうすれば得られるかということなのです。