非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

思考可視化プロジェクト(Visible Thoughts Project)と報奨金の告知

原題: Visible Thoughts Project and Bounty Announcement / News

原文クレジット(WordPress投稿者表示): Nate Soares / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2021-11-29

訳文状態: 校閲済み(原文対照レビュー実施)

(更新 2022年1月12日: 詳細を補ったFAQを先月公開した。最終更新は1月7日。)

(更新 2022年1月19日: 部分的なランの成功例ができたので、各自のランの進め方を考える参考にできる。詳細はこちら。)

(更新 2023年3月14日: この時点をもって、件数限定の20,000ドルの賞金は終了した。今後開始されるすべてのランには、1ステップ当たり10ドルの料率で支払う。2023年1月より前に本制作の承認を受け、現在も制作中のランについては、完成まで従来と同じ料率で支払いを続ける。)

(更新 2024年5月31日: この時点をもって、思考可視化プロジェクトは終了した。)


私たち機械知能研究所(Machine Intelligence Research Institute, MIRI)は、以下で説明するデータセットの構築を中心とするAIアライメント(AI alignment)プロジェクトへの協力を募っている。データセットの最初の一部を構築するための賞金として200,000ドルを用意し、さらに、大規模なデータセットをスケールさせて構築できる能力を示した人に対して、100万ドルの賞金兼予算を用意している。

このプロジェクトがうまくいけば、さまざまなプロジェクトについて私たちが提供する一連の賞金企画の第1弾になるかもしれない。

以下では、このプロジェクトと、私たちが提供する報酬および途中段階での支援について、さらに詳しく説明する。

プロジェクト

仮説: 言語モデルに「可視化された思考(visible thoughts)」を出力するよう学習させれば、モデルをより理解しやすくできる(また、能力も高められるかもしれないが、それは目的ではない)。

私たちは、思考注釈付きダンジョン・ランで構成したデータセットを使って言語モデルをファインチューニング(fine-tuning)または再学習し、この仮説を検証したいと考えている。(AI Dungeonのような形式である。)

通常の(注釈のない)ダンジョン・ランは一連のステップから成り、プレイヤーが行動を文章で入力すると、ダンジョン・マスター(DM)が、その結果として作中世界で何が起きたかを文章で描写して応答する。

私たちが求めているのは、そのようなランに「可視化された思考」という注釈を付けたコレクションである。この思考は、プレイヤーではなく、システムを運用またはプログラムする可能性のある人に見えるものであり、たとえば、作中世界で今何が起きたか、あるいはこれから何が起きようとしているか、プレイヤーはおそらく何に注意を向けているか、現在どこに物語上の緊張があるか、といった内容を記述する。つまり、人間の作者がダンジョン・マスターを務める際に考えるような事柄である。(これは、ダンジョンで起きたことを説明する思考を出力するのとは異なる。「可視化された思考」は、出力を組み立てるうえで能動的な役割を担うことを意図している。)

このようなデータセットが得られれば、MIRIとしては、現在または将来の技術によって、ユーザーの行動とそれまでの履歴(過去の思考も含む)にもとづき、物語を語りながら可視化された思考を反復的に生成するモデルを一つまたは複数、学習できるようになることを期待している。目標は、AI Dungeon技術の状態を「AIが行動に応じて物語の文章を出力する(どのようにしているのかはまったく分からない)」から、「AIが物語の文章に至る可視的な中間表現として思考を生成し、私たちが、AIが出力をどう設計しているかを考える様子を観察でき、さらに、その思考へ介入すれば別の妥当な出力を得られることを検証できる」へ移行させることである。

以下は、思考注釈付きダンジョン・ラン(または「クエスト」)の冒頭の二つのステップを、MIRIが現在、試す価値があると考えている形式で示した例である。思考の種類によっては丸括弧や角括弧、またはその両方を付けている。詳しくは次の節を参照してほしい。




上の仮説を検証するための難しい第一歩は、言語モデルの再学習に使えるほど大規模な、思考注釈付きダンジョン・ランのデータセットを生成することである。この作業にはおそらく、データセットの作成者に少なくとも中程度の内省力と執筆力が求められる。私たちが求めるものをさらに具体的に知るには、部分的なランの見本を参照してほしい。求めるものの詳しい性質は、この見本からある程度読み取れるはずだが、応募者には確認のための質問をする機会も設ける。

このデータセットを制作するプロジェクトは、賞金と助成を組み合わせた形式で、ただちに応募を受け付ける。私たちの品質基準を満たした完成ランのうち先着10本(基準を満たすかは、エリエザー・ユドコウスキー(Eliezer Yudkowsky)またはその指名者が単独の裁量で決める)には、1本当たり20,000ドルを支払う。それに続く最初の100本の一群には、総額100万ドルを支払う。

皆さんの試みが十分有望だと判断した場合、私たちは執筆者への報酬などの経費を前払いする用意があり、皆さん自身の作業時間に対する報酬も前払いする場合がある。個々のランを手作業で書いても構わないが、私たちが最も強い関心を持つのは、うまくスケールする解決策を見つけ、それを実際に拡大することである。支払い手続きの詳細は下記を参照してほしい。

機械学習実験

もう少し詳しく説明すると、計画は次のとおりである(120万ドルの賞金兼予算は第1部への協力に対するものであり、第2部はその後、私たちがデータセットを使って行う予定の内容である)。

1. まず10本、次に約100本の思考注釈付きダンジョン・ランのデータセットを収集する (各ランは独立して完結する一つの物語展開とする)。各ランは約1,000ステップで、各ステップは次の要素を含む。

このデータセットの制作にどれほどの技能が必要か、私たちにもまだ分からない。執筆者にはおそらく、自分自身の執筆過程を相応に内省する力と、プロジェクト責任者やMIRIからの初期フィードバックを受けて、さまざまな方法を試し、変更する意欲が必要になる。

大まかな見積もりでは、1,000ステップのランは大部分が思考で構成された約30万語になり、熟練した執筆者の作業で約2人月を要する。(ダンジョン・ランは出版小説並みの文学的品質である必要はなく、登場人物に対する作中世界の反応に一貫性があればよい!)必要なデータベース規模の見立ては約100本、すなわち約3,000万語、執筆者20人年分である(ただし、まずはより少数または短いランで試すかもしれない)。

2. GPT-3やT5のような、事前学習済みの大規模言語モデルを再学習する

思考という中間表現を本当に活用するには、少なくともGPT-2よりGPT-3に近い性能が必要だろうというのが妥当な見立てである。しかし、事前学習済みの大規模言語モデルを用意できない場合は、独自の小さなモデルの学習を試すことも十分考えられる。

機械学習アーキテクチャに関する私たちの当初案は、モデルの一つのモードを再学習し、履歴単位の(末尾側の一定範囲の)並びを入力として思考を予測させ、生成した思考とラン内の次の思考との対数損失(log loss)を最小化することである。もう一つのモードは、履歴単位の(末尾側の一定範囲の)並びに一つの思考を加えたものを入力としてプロンプトを生成するよう再学習し、生成したプロンプトとラン内の次のプロンプトとの対数損失を最小化する。

うまくいけば、既存の手法が生成するものよりも、質的に「一貫性の高い」ダンジョン・ランを作れるようになるかもしれない。ただし第一の目標は、システムの思考生成部分によって、その内部へ質的にある程度アクセスできるようにすることである。たとえば、訓練を受けていない観察者でも物語の直近の展開を正確に予測し、ときには物語中の出来事がなぜ起きたかという問いに答えられるようにしたい。または、物語の展開が気に入らない場合に、思考へ介入し、制御可能な仕方で異なる物語を得られるようにしたい。

このプロジェクトの動機

コミュニティで提案されている多くのアライメント案は、何らかの形で、人間が解釈できる思考をAIが持つことを前提としている(たとえば、ヒュービンガー(Hubinger)の概説論文、クリスティアーノ(Christiano)、オラー(Olah)、そしてライケ(Leike)の研究など)。たとえば、人間がAIの思考過程を十分に詳しく調べ、理解して、欺瞞的な振る舞いの初期兆候を検出できるという主張には、この前提が暗黙に含まれている。別の種類のアライメント構想は、AIの思考が局所的に何らかの意味で人間らしく、それによって実際の人間の思考を教師として学習できる、という考えにもとづく。

私(ネイト(Nate))自身は、さまざまな理由から、このような計画にあまり期待していない。しかし、それでもエリエザーと私は、現代のAIシステムの認知を、人間が解釈できる可視的な中間表現を経由させることが実際にどの程度可能なのかについて、急いで実証的証拠を集め始めたいと考えている。

現代のAIは、とりわけ英語の文章を作るのが得意である。現在、ダンジョンの運営に使われているものもあり、まずまずの成功を収めている。現在のAIが人工物の制作で最も優れている領域を探すなら、AIが最も得意に、最も印象的に作れるものの一つが英語の段落である。

さらに、AIが学んだほかの多くの作業と比べると、入力に反応するテキスト・ダンジョンを運営する作業では、(比較的珍しいほど)内省力の高い人間の作者に、ユーザー入力から次のプロンプトをどのように、なぜ生成するかについて自分の考えを書き出してもらうことが、比較的可能に思える。

そこで私たちは、現在のAIが設計することを最もよく学んだと思われる出力の一つを取り上げ、その設計方法に関する人間の思考が最も捉えやすいと思われる領域の一つを選び、データセットを作ろうとしている。現在または次世代の文章予測器が、このデータセットを使って、出力そのものだけでなく、出力の設計についての思考も予測する方法を学べるかもしれない。

この種の解釈可能性(interpretability)は、クリス・オラー(Chris Olah)が率いるCircuitsのような透明性研究とは異なる。Circuitsは、機械学習システムの内部で何が起きているかを直接調べることで、その「ブラックボックスを開く」ことを目指している。一方、ここで提案するプロジェクトが試みるのは、ブラックボックス・モデルに、振る舞いの説明を生み出す解釈可能な中間表現を出力させるという、より控えめな課題にすぎない(ただし、このようなブラックボックス・モデルが内部でそれをどう行うかには制約を設けない)。私たちがこの可視化された思考のプロジェクトに焦点を当てるのは、これがCircuits型の透明性研究より優れている、あるいは有望だと考えるからではない(私たちは何年も前から、Circuits型の研究には、生産的に使える限りの資金をすべて投じる価値があると述べてきた)。これは単に異なるアプローチであり、こちらでも進歩を促せるかもしれないからである。

なお、上にリンクしたものをはじめ、人間らしい思考を取り入れるアライメント戦略の支持者が、この特定の実験を、自身の主要な不確実性や疑問点のいずれかを検証するものとして支持しているとは限らない。そのような支持者からは、この告知のLessWrong掲載版のコメント欄で、皆さんの考えをよりよく検証できるよう実験を調整する提案を歓迎する。(皆さん自身の好奇心を満たせないとしても、私たちは私たちなりに何かを学べると見込んでいる。)

このプロジェクトが主に必要とするのはデータセットである。そこでMIRIは、そのデータセットの制作に着手する。GPT-3がこのデータセットをまったく活用できないことも十分あり得る。GPT-3には無理でも、GPT-4または将来の別のシステムなら活用できるかもしれない。

このプロジェクトに取り組む、より一般的な理由もある。具体的には、私(ネイト)とエリエザーには、このようなプロジェクトを遂行する能力こそが現在、MIRIを制約しているボトルネックだと思える。このプロジェクトを進めることで、そのボトルネックの解消を試みる。

私たちはこの過程を通じて、さまざまなプロジェクトを遂行する能力を築きたいと考えている。掲げた目標どおりデータセットの構築に成功することで実現するかもしれないし、自分たちの何が間違っているかを学び、遂行力のある人材を獲得するための、よりよい方法へ移行することで実現するかもしれない。この目標については、後述する「公募の動機」でさらに詳しく説明する。

非公開実施に関する注記

私(ネイト)は、思考注釈付きダンジョン・ランで言語モデルを学習させることにより、能力の向上がもたらされる可能性は十分あると考えている。直接的には、物語全体の筋の一貫性が高まる、個々の場面で物語上の緊張を維持しやすくなる、ランを通じて描写される作中世界の状態の整合性が高まる、といった形で現れるかもしれない。この手法が成功すれば、さらに広い用途へ一般化するかもしれない。将来、汎用人工知能(AGI)のアライメントで役割を果たすには、実際にそうならなければならない。

方針として、こうしたプロジェクトに能力向上への影響が十分あり得る場合、正しい対応は、公開で行う前にまず組織内で非公開に試すことだと私たちは考えている。当然ながら、それを試すのは、アライメント上の利益が、起こり得る能力向上を上回る場合に限る。今回は2021年半ばに非公開でプロジェクトを遂行しようとしたが、作業が十分な速さで進まなかった。この遅さに加え、ほかの人々が関連する試みや結果を公表していること、また、起こり得る能力向上が比較的小さいことを踏まえ、非公開で行う試みには比較的早く見切りをつけ、今度は公開での実施を試みることにした。

公募の動機

私(ネイト)は、すばらしい未来を実現するための計画のうち、語るに足るほどの見込みがあると自分が考えるものを一つも知らない。私はこれを、私たちの主要なボトルネックの一つだと考えている。このような小規模プロジェクトに賞金を出しても、そのボトルネックへ直接対処することにはならない。また、そうしたプロジェクトのいずれかが、それ自体で世界を救うことになるとほのめかすつもりもない。

とはいえ、次に重要なボトルネックは、実行力、リーダーシップ、マネジメントの技能と、特定の種類の構想力をまれな形で併せ持つ人々を見つけることだと考えている。私が特に希望を持てる計画は一つもないが、少なくともわずかな希望を含み、私が熱意をもって進めたい計画はいくつかある。それを進めたいのは、一つには、そのわずかな希望を追求するためであり、もう一つには、奇跡が起きた場合にそれを活かせるような遂行能力を築くためである。

私たちが求める具体的な構想力は、目の前のプロジェクトと相性のよい種類のものである。まず、エリエザーには、追求する価値があるように私には思える案がいくつかある。しかし、そのすべてを進めるには、自らプロジェクトを率いるだけでなく、エリエザーとのやり取りが比較的少なくても、案の中核にあるわずかな希望を理解し、その希望を保ちながら構想を発展させ、私たちが絶えず関与して軌道修正しなくても済む人々が必要である。(私の見るところ、これは優れた創業者を見つけるという「難問(Hard Problem)」の一種だが、自分で考案した何らかのプロジェクトに共感する人ではなく、特定のプロジェクトに共感する人を選び出す、という制約がさらに加わっている。)

私たちは、必要なリーダーシップと実行力を持ち、かつ、わずかな希望があるように私たちには思える案のいずれかに共感する人を見つけられるよう、十分な額の報奨金を出すことを試している。

この仕事が得意なら、私たちから採用を持ちかける可能性が高い。

報酬

このプログラムの賞金総額は120万ドルである。私たちはこの資金を、十分に内省力のある執筆者を集めて調整することなどにより、スケール可能な仕方でデータセットを構築できる人を見つけるために使うつもりである。その人には十分な報酬を支払い、今後のプロジェクトでも協力し続けたいと考えている(ただし、報酬を受け取る条件ではない)。

私たちが受け入れた思考注釈付きランのうち、最初の10本には1本当たり20,000ドルを支払う。これらのランを制作する応募者には、少額の給与や執筆者を雇うための予算など、前払いの資金を提供して支援する用意がある。参加者の初期費用として前払いした額は、その参加者が賞金を受け取る場合、賞金から差し引く。次に、ランの制作過程をスケールさせて100本を制作できる能力を示した応募者のいずれかに、追加で100万ドルを支払う。参加者がその資金の一部を100本の制作に使い、残りを賞金として受け取ることを想定している。複数の参加者が、同程度の品質と同程度の期間で、同等のスケール能力を示した場合、資金を分割することがある。賞金の授与は公表する予定である。

原則として、思考注釈付きダンジョン・ランへの報酬を受け取るために必要なのは、私たちが気に入るランを送ることだけである。そのランが最初の10本のいずれかなら、または100本の一群を最初に提供したなら、それぞれに対応する報酬を受け取れる。

もっとも、ランに報酬を支払うかどうかは、全面的かつ一方的にエリエザー・ユドコウスキーまたはその指名者の裁量に委ねられ、ランが最低限の品質基準を満たすかどうかによって決まる。また私たちは、皆さんの制作過程がスケール可能だと確信した時点で、100万ドルの賞金兼予算から支払う用意がある。その時点では、まだ100本すべてを制作していない場合もある。そのため、このプロジェクトへ膨大な時間と労力を投入する前に、私たちへ連絡し、正しい方向へ進んでいることを能動的に確認するよう強く勧める。MIRIの上級研究職員は、最初の面談や、ときどきの進捗確認に時間を割く用意がある。私たちが提供する支援とその利用方法については、下記の支援および応募の節を参照してほしい。

この投稿の公開後、最初の1週間に寄せられる反応を受けて、報奨金の内容を調整または改訂する場合がある。

支援

私たちは、このプロジェクトへ挑戦する人々に、最初の面談、ときどきの進捗確認、オフィススペース、限定的な運営支援、特定の種類の資金提供など、さまざまな支援を提供するつもりである。

現在の見込みでは、最初の面談と毎週の進捗確認の枠を(限られた数だけ)、また、このプロジェクトに取り組む人のため、カリフォルニア州バークレーにオフィススペースと机を(限られた分だけ)用意できる。皆さんの試みがどれほど有望だと考えるかに応じて、経費を支払い、より一般的な報酬も提供する用意がある。

これらの支援を利用したい場合は、以下の応募手続きに従ってほしい。

応募

原則として、報酬を受け取るために、事前に応募書類を送っておく必要はない。私たちのもとへ届いた、十分な品質のランにはどれにも報酬を支払う。とはいえ、上記の支援のいずれかを希望する場合(また、何をもって成功とするかをよく理解するため、少なくとも1回は進捗確認を受けることを強く勧める)、次の手続きを完了してほしい。

応募内容が十分有望だと判断した場合、MIRIの上級研究職員の何人かと20分間のビデオ通話を設定し、そこから進める。