これから2日間、英国政府は「フロンティアAIの安全で責任ある開発」を主題とするAI安全性サミットを開催する。政府は7社(Amazon、Anthropic、DeepMind、Inflection、Meta、Microsoft、OpenAI)に対し、「AI安全性の9分野について、各社のAI安全性方針を概説する」よう求めた。
以下では、英国政府が示した9分野について私の考えを述べる。また、企業側の方針ではまったく対処できていないと思う重要な優先事項を挙げ、各社のAI安全性方針についても少し述べる。その際、この件についての議論が有益だったマシュー・グレイの意見も取り入れている。1
英国政府の要請に対する私の全体的な見方は、ほとんどは妥当な要請だが、独立したリスク評価など、明らかに抜け落ちているものがある、というものだ。
研究所の方針に対する全体的な見方は、十分な水準に近いものは一つもないが、それでも重要な差はあり、大半の組織は主要なリスクをひたすら否定するよりはましなことをしている、というものだ。
1. AI安全性方針の分類について

責任ある能力拡大:組織がフロンティアAIシステムの能力を拡大する際に、リスクを管理する枠組みを提供し、将来起こりうる、より危険なAIリスクに企業が事前に備えられるようにする。
今のところ、フロンティアAIシステムを責任ある形で拡大する方法などない。人間より賢いAIへ近づく技術的な取り組みはすべて、許容できない水準のリスクを伴う。2
とはいえ、企業が、どんな条件なら一時停止するかを明記し始めるのはよいことだ。崖っぷちに向かってそもそも一歩も進まないという、まともな方針への第一歩になる。
現在の状況でも、開発者が「本当に必要でない限り、能力も計算資源もこれ以上拡大しない。そして、本当に必要だと判断する指標は次のとおりだ――[X]」と言っていたら、状況はずっと悲惨でなくなるだろう。現状はその逆だ。より強力なシステムへ拡大することが開発者の既定路線になっており、最も良心的な研究所でさえ、拡大を止める条件を曖昧に示すだけである。これは明らかに、破局を招くやり方に見える。(とはいえ、問題の可能性を認めすらせず、無謀に拡大する場合よりは、いくらか尊厳のある破局だが!)
モデル評価とレッドチーミング:AIモデルがもたらすリスクの評価を助け、訓練、保護、導入について、よりよい判断を下すための情報を提供する。
基盤モデルだけでなく、それ以上のものも評価する必要があるが、評価そのものに害はない。評価で危険を示す基準に達したときに何をするかという重要な問題はあるものの、少なくとも評価は無害であり、適切な状況では積極的に役立ちうる。
レッドチーミングは妥当だ。ただし、レッドチームの担当者がきちんと仕事をするには、活動の非公開性や裁量が必要になるかもしれないことを、忘れないでほしい。
もし私たちがアラインメント問題を解き、強力なAGIシステムの少なくとも一部を安全に扱える立場にあるなら、レッドチーミングは明らかに不可欠であり、技術的な取り組みの中心的な柱になるだろう。
しかし、私たちはおおむね、そのような立場にはない。今後数十年のうちにアラインメントが解決可能だと分かるという、かすかな希望はある。それでも、私たちが主として目指すべきなのは、AGIに向かう進歩を無期限に停止し、AGIとアラインメントから、世界をよくするほかの技術的な道へと努力を振り向けることだと思う。現時点で評価やレッドチーミングに見いだす主な価値は、開発停止が必要だということを、もっと早く明らかにできるかもしれない点と、それ以外にもAGI競争をある程度減速させるかもしれない点にある。
モデルに関する報告と情報共有:フロンティアAIの開発と導入について政府が把握できる情報を増やし、利用者が十分な情報に基づいて、AIシステムを使うかどうか、どう使うかを選べるようにする。
先に述べた私の基本的な見方に照らすと、これは明らかによいことに思える。こうした基盤を構築するよう勧めたい。
モデルの重みの保護を含むセキュリティ対策:AIシステムの安全性を支える重要な基盤となる。
これもよさそうだ。さらによいのは、モデルの重みをいつまでも公開し続けていたら、地球は生き延びられないという点を、きわめて明確にすることだ。いずれ、数十年後かもしれないし来年かもしれないが、AIは十分に高い能力を持ち、その能力をオープンソース化すると、実質的に人類の絶滅が確実になる時点が来る。
そして、アルゴリズムのアイデアの公表やモデルの重みのオープンソース化などは、今日でさえ、利益より大きな害をもたらしている。公表は参加者の数を増やし、競争の力学を緩和して減速することを難しくする。非公開の場で危険な洞察が得られた場合も、非公開になる前の成果の公表記録をたどって、ほかの人がその危険な洞察を再現しやすくなる。さらに、長期的な影響を考えずに反射的に知見を共有するという、一般的な文化を助長する。
脆弱性の報告体制:外部の人がAIシステムの安全性やセキュリティ上の問題を特定できるようにする。
よいだろう。このアイデアに害はない。
AI生成物の識別表示:コンテンツがAIで生成・改変されたかどうかについて追加の情報を提供し、人を欺くようなAI生成コンテンツの作成と流通の防止を助ける。
特に、違反を実際に追跡できる能力を築くのであれば、整備する価値のある基盤に思える。誰がAIを作っているかを漏れなく把握し、基本的な予防措置を守っていると確認する能力こそが、後々、より大きな問題への対処を助けうる重要な基盤だ。
AIがもたらすリスクの研究の優先:フロンティアAIがもたらす新たなリスクの特定と対処に役立つ。
この項目は重要なことを扱っているように聞こえるが、私には、どこか的を外しているようにも聞こえる。
一つには、「新たなリスクを特定する」という言い方からは、人々がAIについて哲学的な話を延々とすることが思い浮かぶ。そうしたことは以前から十分に行われてきた。さらに少し増やしても、雑音が増すだけで、AGIをめぐって文明が直面する大きな難所には対処できず、ほとんど役に立たないように思える。
もう一つ、「新たなリスクに対処する」という言い方からは、研究所がLLMに目を光らせ、危険な振る舞いを見つけたら、それに対処して先へ進む世界を想像しているように感じる。しかし、注意深く見ている人なら、いずれ、現代のAIの枠組み全体をそのまま拡大しても、安全に超知能へ到達することはできず、まったく異なる枠組み、たとえば格段に言語化しやすく透明な枠組みが必要だと気づく可能性が、かなり高いと私は思う。
私たちが暮らしているのがそうした世界なら、「新たなリスクを特定し、対処する」は、求めていることをうまく表していない。「AIアラインメントの技術研究を優先する」のような表現のほうがよい。後者なら、人類が生き延びるためには、開発の道筋を丸ごと放棄しなければならないと気づく余地を、より多く残せるからだ。
(これは英国政府が求めたことへの批判であり、必ずしもAI企業の回答に対する批判ではない点に注意してほしい。)3
モデルの悪用防止と監視:導入後のAIシステムは、意図的に悪用されて有害な結果をもたらしうるため、重要となる。
監視の基盤を整えるのは妥当に思える。存亡リスクに対して大した防御になるとは思わないが、あってよいものではある。
入力データの管理と監査:フロンティアAIシステムが持つ危険な能力や、それがもたらすリスクを増大させる可能性の高い訓練データを、特定して除去するのに役立つ。
この種の対策は問題ないと思うが、私から見ると、かなり小さなものだ。これが長く大きな重要性を持ち続けるとは思わない。
2. 政府がより優先すべきこと
企業にAI安全性方針を書かせるという発想全体は有用だと思う。しかし、人間より賢いAIによる存亡リスクに対処するために政府が取るべき、ほかのいくつかの措置と比べると、重要性はずっと低い。思いつくところを挙げると、政府は次のことも行うべきだ。
- 研究所に対する計算量のしきい値、そしてより一般に、能力のしきい値を設定する。
- チップを一元管理し、監視する。
- より高性能なチップの開発を無期限に停止する。
- 独立したリスク評価を整備する。
- そして、危機の瀬戸際に達したとき、何をすべきかについて、十分に練られた計画を持つ。
4について、もう少し述べたい(ほかの人があまり議論しているのを見かけない点だ)。
大手研究所がもたらす価値とは区別して、そこから生じるリスクを評価する、独立した保険数理の専門家からなる委員会のようなものを設けることを勧める。特に、AGIの存亡リスクと、そこに懸かっているものの途方もない大きさ、つまり到達可能な宇宙の全資源と、宇宙における人類の長期的な役割を理解できる専門家なら、なおよい。
独立したリスク評価は、研究所が開発を続けること自体を認めるべきか判断するうえでの、重要な要素だ。(より一般的に、理論的に筋を通していえば、その研究所の「保険料」がいくらであるべきかを判断する要素である。その保険料は、リスクを負わされる地球の市民へ、リスクの対価として直ちに支払われるものとする。4)
少し視野を広げよう。大事なのは、企業がセキュリティ方針やレッドチームの専門性について、政府にどんな回答文書を提出するかではない。現場で実際に何を行い、その結果何が起きるかだ。どの企業も「もちろん、私たちは十分に注意しています!」と口をそろえたときに、その言葉を信じるしかない状況を避けるには、企業が実際にどれほど危険かについて、合意に基づく見積もりを作る仕組みが緊急に必要だ。大手研究所から生じるリスクを評価する、独立した保険数理専門家の委員会は、そのための一つの方法である。
5についても、もう少し述べたい(これも、ほかの人があまり議論しているのを見かけない)。評価で危険を示す基準に達し始め、研究所が「ここから先は安全に進めない」と言い始めたとしよう。そして、小さな研究グループも、大手研究所からそれほど遅れていないと分かったら、その次はどうするのか。研究所が突き当たる問題は簡単に解決できると願うのは構わないが、私の予想はそうではない。
「新たなリスクを特定し、対処する」ことの結果が、新たなリスクはたくさん特定できたが、その技術が安く広く入手できるようになってから、ずっと後になるまで対処できない、というものだった場合、どんな計画があるのか。そのリスクを真剣に受け止めるなら、そうした場合の計画を今から立てる必要がある。
上の優先事項に、研究所以外でのAIアラインメントの技術研究も加えるだろうと思われたかもしれない。加えなかったのは、関係者がアラインメントの進展を評価できるとは思えないからだ。これは、企業にとっても規制当局にとっても、大きな障害になる。
代わりに勧めたいのは、研究コミュニティと政府による、全脳エミュレーションや認知能力の増強など、別の道への投資だ。また、拡大前に、モデルの仕組みを理解していることを、かなり厳しい要件のもとで実証させることも、勧めるかもしれない。ただ、規制機関がこれを実施するのはかなり難しそうなので、たいていの場合、追求する価値はないと思う。重要なのは、人間より賢いAIへ向かう進歩を無期限に停止することだ。それによって、全脳エミュレーション(WBE)のような代替策を探れるかもしれないし、何かほかの奇跡が起きるまでの時間を稼げるかもしれない。「理解の実証にかなり厳しい要件を課す」ことが、進歩を完全に止め、非常に長く止め続ける能力を少しでも損なうなら、おそらく割に合わない。
英国政府が、研究所にさまざまな点で責任を持ってほしいと丁寧に頼むだけでなく、このような対策の一覧を用意しているとしても、私は見たことがない。企業からAI安全性方針を引き出すのはよい一歩だが、最優先にすべきだとは思わない。
3. 提出されたAI安全性方針について
各社が表明した方針を簡単に見て、各組織について私が知っていることでいくらか補った限りでは、「最低限まとも/最低限十分」という基準を満たすAI安全性方針は、一つもないように思う。どれも、文明全体に巨大で不必要なリスクを負わせる内容になっている。
相対的に比べると、次のようになる。
- 私にはAnthropicの方針が最もよく見え、僅差でOpenAIの方針が続く。Anthropicのほうがよいとやや考える主な理由は、AnthropicのRSPのほうが、ASL-4を現実の可能性としてより真剣に扱い、言葉の上でもより重視しているように見えたことだ。ただ、何らかの理由で、OpenAIのRDPの真剣さを私がいくらか見落とした可能性はある。
- DeepMindの方針は、それらよりずっと劣って見えた。そのすぐ後にMicrosoftの方針が続く。
- Amazonの方針は、Microsoftよりはるかに劣っていると感じた。
- Metaが表明した方針は最悪で、Amazonよりはるかに劣っていた。
AnthropicとOpenAIは、「大枠の理念や優先事項について、適切なものの多くを、少なくとも言葉では支持している」という基準を満たす。これはずっと低いが、それでも意味のある基準だ。Microsoftもそこに近いか、ぎりぎり満たしている可能性がある。OpenAIと密接な関係にあるためかもしれない。私から見ると、DeepMindのAI安全性方針はこの基準を満たしておらず、まさしく「中身の乏しい企業の決まり文句」の域にある。
マシュー・グレイは私より丁寧に方針を読んでいるし、この件についての彼の考え方を私は尊重している。彼はこう書いている。
ネイトとは違い、私はAnthropicとOpenAIの文書を、ほぼ同じくらいよいと評価する。両社の計画を比較するうえでは、おもに、OpenAIのRisk-Informed Development Policy(リスクを踏まえた開発方針)が、AnthropicのResponsible Scaling Policy(責任ある拡大方針)に比べてどうかが重要になると思う。5今のところ公表されたのはAnthropicのRSPだけで、OpenAIのRDPはまだ待っている段階だ。
また、私はDeepMindの文書をMicrosoftよりはるかによいと評価し、AmazonはMicrosoftより少し劣る程度だと評価する。そのほかは、ネイトの順位に同意する。
- ソアレス:Anthropic > OpenAI >> DeepMind > Microsoft >> Amazon >> Meta
- グレイ:OpenAI ≈ Anthropic >> DeepMind >> Microsoft > Amazon >> Meta
比較のために挙げると、CFIの最近の順位は次のようになっている。ただし、CFIの評価者が問うたのは、各社のAI安全性方針が英国政府の要件を満たしているかどうかだけであり、その方針がよいかどうかではない。6
- CFIの評価者:Anthropic >> DeepMind ≈ Microsoft ≈ OpenAI >> Amazon >> Meta
方針文書から私が読み取ったのは、次のことだ。
| Anthropic | 評価と責任ある拡大を信頼している。セキュリティは、目指すものとして掲げている。(数十年にわたるサイバーセキュリティの専門性を示せる既存のテクノロジー企業とは違い、Anthropicの提案が示せるのは、フロンティアAI研究所でセキュリティ対策を強化するよう、自社が提唱しているということだけだ。) |
|---|---|
| OpenAI | アラインメント研究を信頼している。セキュリティはまずまずだ。「スーパーアラインメントを4年で解決する!」というOpenAIの計画は、ひどく非現実的だと思う。ただ、問題を認め、解決に何が必要かについて、自らリスクを取って予測を示したことは、高く評価している。ほかの組織からも、アラインメントにどう対処するつもりかについて、反証可能な計画をもっと見たい。 |
| DeepMind | 科学の進歩を信頼している。セキュリティを真剣に受け止めている。 |
| Microsoft | 経験豊富なテクノロジー企業で、OpenAIと行動をともにしている。私の読みでは、Microsoftは短期的なセキュリティリスクに注目している。知能爆発を実現するより、フロンティアAIモデルのデータセンターを運営したいように見える。 |
| Amazon | 経験豊富なテクノロジー企業で、顧客に製品を売りたいと考え、セキュリティを真剣に受け止めている。DeepMindと同じく、Amazonはセキュリティについての質問に、過去に行ってきたことを数多く挙げ、詳しく答えている。7 |
| Meta | オープンソースを信頼している。いくつかの点で、求められた課題の前提に抵抗している。 |
これらの方針は、大きくいって二つの異なることを論じていると思う。セキュリティ、たとえば外部の者がサーバーからモデルの重みなどのデータを盗みにくくすること。そして安全な導入、たとえば暴走するものを誤って世に出さないことや、悪意ある顧客が破局的なことをできるようにしないことなどだ。
この二つには異なる技能が必要で、それぞれで最も信頼できそうな企業も違う。たとえば、安全な導入について最も真剣に考えているように見えたのはAnthropicとOpenAIだ。しかし、両社のセキュリティが、企業としてのAmazonほど優れているとは思わない。ただし、AmazonのAI開発チームに限ったセキュリティ基準については知らない。
以前の草稿では、ネイトはMicrosoftの回答をDeepMindより高く評価していた。その理由は、「DeepMindは話を短期的なバイアスの懸念に落とし込もうとしているようで、ざっと読んだ限り、Microsoftのほうがごまかしが少なく見えた」からだ。しかし私は、9分類すべてにおいて、DeepMindの回答はMicrosoftと同等か、それ以上だったと思う。
私の読みでは、DeepMindの回答には、「私たちはGoogleの一部であり、Googleにはこうしたことを扱ってきた豊富な経験があるので、信頼してください」という内容が多かった。そして、それらの箇所では、Googleの実績の一部として、短期的なバイアスの問題を挙げていた。ただ、問題をそらしたり小さく見せたりする意図ではなかったと思う。たとえばDeepMindは、こう書いている。
これには、AIシステムが人間の意図に沿わない振る舞いや、偏りのある振る舞いを示す場合、利用者がきわめて危険な作業、たとえば生物兵器を作るのをAIシステムが手助けする場合、新しい脱獄プロンプト、利用者データのプライバシーを損なうセキュリティ上の脆弱性などが含まれうる。
引用の最初の部分は論点そらしに見えるかもしれないが、その後でDeepMindは、「生物兵器を作る」と述べ、破局的なリスクを念頭に置いていることを明示している。対照的に、Microsoftは生物学的リスク、破局、核のリスクなどに、一度も触れていない。Microsoftが望んでいるのは、サーバーがハッキングされず、法律を守っていると確認することだと思う。一方、DeepMindは、人を殺す助けにも使えるものを自分たちが作った、という事実を考えている。
私にとって、DeepMindの回答でごまかしめいて見えたのは、むしろ議論の多くを、科学技術の進歩についての抽象的な話へ向け直したことだ。たとえばAlphaFoldの利用状況の監視を論じる際、利用者が他人を害するのに役立つタンパク質を生成していないか、といった実際の「監視」の効用ではなく、利用ログを使って研究コミュニティへの利益を集計することを述べている。新技術の利益とリスクを両方考慮するのは適切だが、リスクをどう監視しているかという話から、利益の話へとさりげなく変えるのは、注意をそらす行為に思える。
この論点については私の議論でネイトも納得し、順位を修正してDeepMindをMicrosoftより少し上に置いた。
提案の評価には、誰かが求められた課題の前提に抵抗したり、どこかで具体的に愚かな回答をしたりしない限り、実際には評価できるものがあまりないという難点があると思う。ある会社はバグ報奨金の上限を1万5,000ドルに設定し、別の会社は2万ドルにしている。それは重要なのか。金額を書かなかった別の会社は、それより多く出しているのか、少なく出しているのか。
各社を意味のある形で評価するには、方針文書だけを切り離して読むのではなく、各社の実績やほかの発言にも目を向ける必要があるだろう。ネイトも私も、ある程度はそうしようとした。こうしたことを考えると、独立した保険数理の専門家に研究所のリスクを評価させるというネイトの提案にも、とても関心がある。
Inflectionは後から一覧に加わったため、マットと私は、ここでは同社のAI安全性方針を評価しない。
この記事の大幅な編集と改稿を助けてくれたロブ・ベンシンガーに感謝する。↩︎また、OpenAIの文書には、こうある。「当社の方針をResponsible Scaling PolicyではなくRisk-Informed Development Policyと呼ぶのは、たとえばアルゴリズムの改良によって、規模を大きく増やさなくても、能力が劇的に高まる場合があるためです」。↩︎
マシュー・グレイはこう書いている。「この点でOpenAIは、驚くほど見事に『本筋を捉えた』回答をしていると思う」。マットが引用しているのは、OpenAIの「スーパーアラインメント」の説明にある、次の一節だ。
「人間のフィードバックによる強化学習など、AIをアラインさせる現在の技術は、人間がAIを監督できることに依存しています。しかし、人間よりはるかに賢いAIシステムを、人間は確実に監督できないため、これらの技術は超知能には通用しません」。↩︎これを完全に正しく行うには、将来存在するかもしれない人々の運命を危険にさらすことについて、その人たちへ支払うお金も、ある意味で預かっておく必要がある。今生きている人々の利益だけを考慮しても、すべてのインセンティブが適切にそろうわけではない。現在の人々には、今の比較的小さな利益と引き換えに、将来の人々にとっての価値を大量に手放すという、利己的で過大なインセンティブが生まれうるからだ。↩︎
この点はネイトも私に同意している。↩︎
CFIの記事の執筆者とは違い、私(ネイト)なら、ここに挙げたすべての企業にFをつける。ただし、同じFでも、ほかよりずっと点数の高い企業はある。↩︎
DeepMindより。
「だからこそ、当社は、業界をリードする一般的なセキュリティとインフラのセキュリティへの取り組みを基盤としています。当社のモデルはGoogleのインフラ内で開発、訓練、保管され、中央のセキュリティチームと、世界最高水準の専門性を持つエンジニアや研究者からなる、セキュリティ、安全性、信頼性を担当する組織に支えられています。当社は、ゼロトラスト・アーキテクチャや、大規模なファジングなどのソフトウェアセキュリティのベストプラクティスを、最初に導入しました。また、AI/機械学習を含むすべての開発に、最も強力なセキュリティとプライバシーの保証を与えるため、世界規模のプロセス、管理策、システムを構築してきました。当社の検知・対応チームは、時差を利用して各拠点が業務を引き継ぐ体制で、Googleの全製品、サービス、インフラを24時間365日監視し、内部脅威と悪用には専任チームを置いています。また、安全性、セキュリティ、プライバシー上の欠陥がないか、製品、サービス、インフラを評価するレッドチームも複数あります」。↩︎