非公式日本語訳 — Machine Intelligence Research Institute (intelligence.org) の原文をAGI Hubが翻訳したものです。MIRIによる公式の翻訳ではありません。

← 翻訳一覧

既存の安全性フレームワークは不合理なほどの自信を示している

原題: Existing Safety Frameworks Imply Unreasonable Confidence / Analysis

原文著者: Joe Collman, Joe Rogero, and William Brewer / 掲載元: Machine Intelligence Research Institute (intelligence.org) / 原文公開日: 2025-04-09

訳文状態: 校閲済み(原文対照レビュー実施)

ジョー・コルマン(Joe Collman)、ジョー・ロジェロ(Joe Rogero)、ウィリアム・ブリューワー(William Brewer)

本稿はMIRI単著シリーズの一部である。このシリーズの各記事は、署名された著者の信念と意見を表すものであり、MIRI全体を代表するとは主張しない。
***

人間の営みの大半は、結果の範囲に限界がある。建設事業は、機能する橋を完成させることも、致命的な崩落を起こすこともあるが、壊滅的に失敗しても10億人を死なせることはない。成功にも失敗にも上限があり、その事業に取り組む人間は、その範囲をかなり正しく見積もれる。

フロンティア人工知能の開発は、具体的な予想をしばしば裏切る。主要開発企業はAIによる人類絶滅ほど極端なシナリオを語るが、特定の災害シナリオがいつ起こり得るかについては、激しい意見の相違と不確実性がある。モデルの性質を事前に推測することはできるが、どれほど情報に基づいていても、それは常に推測だ。モデルの振る舞いはますます目標指向的になり、予測が難しくなっている。したがって、フロンティア開発では、自分がどのような境界の中で仕事をしているのか分からない。

思考実験を行うことも、知る限り最も賢い人々を集め、もっともらしい危険について説得力ある物語を語ってもらうこともできる。心配なシナリオを一覧にまとめ、各シナリオのもっともらしい早期警戒兆候をそこから抽出して集成すれば、監視すべき状況と振る舞いの大まかな説明ができる。

だが重要なことに、そのような計画は、致命的になり得る形で不完全である。その手続きから生まれる一覧は網羅的ではない。心配なシナリオの追跡も、利用できる道具と理解に制限され、不完全である。さらにフロンティアAIでは、予想外のものだけでなく、予想しようのないもの――甚だしく異質なシステムや、前例のない形で人間を超えるシステムが生み出す結果――も予想すべきである。

この文脈におけるリスク管理フレームワークの高水準の目標には、次が含まれるべきだ。

答えようとすべき問いには、次がある。

各AI研究所が公開するフレームワークは、ほぼ例外なく、これらの目標や問いに対処していない。そのことは、安全技術とリスク全体像の理解に対する、根拠のない自信を示唆する。以下では、公開された五つのフレームワークが、健全なリスク管理慣行をどの程度守っているか検討する。

明確にしておくと、現在の分野の理解水準を踏まえれば、だれであれ 人工超知能を作った場合、最も起こりやすい結果は災害だと気づくために、詳細で形式的なリスク評価が必要だとは考えていない。

各研究所の現在の方針が、現実について根本的に異なる信念に動かされ、破局の確率は許容できるほど低いと考えているのなら、[1] 私たちは、計算過程を示す よう求める。他者が見て批判できる場所で、その信念を定量化してほしい。

実際には、そうした信念を白日の下にさらせば、根拠が弱いと判明すると予想する。しかしAI研究所は、計算過程を示す ことなく、責任ある透明なリスク管理をしていると自称する。だから本稿を書くことになった。

公開フレームワークについて、私たちは次を示そうとする。

  1. フロンティアAI研究所は、破局的リスクへ対処する十分な戦略を示していない。
  2. 明記された仕組みには、危険な隙間が残る。
  3. 研究所は、難しい問題を隠すような伝え方を組織的にしている。

研究所が公開する戦略の多数の隙間は、実際の計画の不十分さを反映している、と私たちは考える。それらは、成熟分野におけるリスク評価の最低限の期待を満たさない。成熟分野では、破局の上限は人類絶滅よりはるかに低く、評価対象のシステムが評価そのものを能動的に覆すこともできない。

私たちは五つの文書に焦点を当てることにした。Anthropicの責任あるスケーリング方針(Responsible Scaling Policy)(2025年3月)、OpenAIの備えのフレームワーク(Preparedness Framework)(2023年12月)、Google DeepMindのフロンティア安全性フレームワーク(Frontier Safety Framework)(2025年2月)、MetaのフロンティアAIフレームワーク(Frontier AI Framework)(2025年2月)、xAIのリスク管理フレームワーク草案(Draft Risk Management Framework)(2025年2月)である。大半またはすべてが見落とした点と、それが業界全体の体系的な較正不良を反映すると考える理由を論じる。

時間の都合上、分析の大半は、より強いフレームワークであるAnthropicとDeepMindのものに集中する。[2]

フレームワークをどう評価するか

フレームワークは、次をどれほどうまく行うかで評価すべきだと考える。

  1. 私たちが具体的に理解している脅威を管理する。
  2. リスク全体像の理解を深める方法を提供する。
  3. まだ具体的に理解していない脅威を織り込む。

地雷原へ足を踏み入れる場合なら、これは次に相当する。

  1. 検知できる地雷を踏まない。
  2. 地雷を検知する能力を高める。
  3. まだ検知できない地雷を踏まない。

大半のフレームワークは(1)を試み、(2)や(3)よりうまく行っている。しかし、許容できると考える残余リスクの水準を述べたものも、推定を定量化する計画を示したものもない。

(2)へ多少触れるものはある。OpenAIは「未知の未知」に一言触れるが、十分に織り込んでおらず、実際には、それについてより多くの証拠を生み出す、執行可能な規制へ積極的に反対している。AnthropicとDeepMindはわずかにましで、問題行動を検知し、モデルをよりよく理解するための研究を行い、公開している。

(3)はほぼ存在しない。

成熟産業は自分たちの知識の限界を尊重する。おそらく何か重要なことを見落とす という重要な仮定を置き、こうした見落としを発見することと、それが起きたとき破局を防ぐことの 両方 に備える。

比較として、石油産業では、「未知」のリスク(だれか には知られていても、組織として存在を予想していなかったもの)と「既知」のリスク(正式に文書化され、経営陣による明示的な承認か緩和計画があるもの)を区別することが多い。事故 とニアミス の調査には、第1のリスク区分を第2へ明示的に移そうとする手続きが含まれる。[3] 実際、それはリスク管理という専門分野の主要機能の一つである。

利害が大きいほど――破局的な結果の可能性が高いほど――一般に基準はさらに厳格になる。原子力発電所を合法的に運転するには、基礎機構について深い理解と、堅牢で冗長な安全対策が必要であり、前例のない故障が複数起きても 復旧できる場合が多い。このため、米国より緩い規制制度の下でさえ、炉心溶融はまれである。

フロンティアAIのフレームワークは、その多くが 全世界的な破局規模 のリスクへ対処すると称するにもかかわらず、成熟産業における基本的なリスク管理基準すら、いくつもの点で満たさない。

事例研究:Anthropicの責任あるスケーリング方針

AnthropicのRSPには、うまく行っている点がいくつもある。特に重要なのは、前駆能力 を重視する点だ。すなわちAnthropicは、洗練されたフロンティアAIの能力全体が、どの試験や評価にも完全に現れるとは信頼できないと認めている。同社はセーフティケース(安全だという論拠を体系的に示す文書)の概念から着想を得ている。

まず、包括的評価の所見を文書化し、能力閾値が十分遠い理由について積極的な論拠を示し、配備判断に関する提言を提示する能力報告書をまとめる。

Anthropicは、リスクの管理と伝達について高い基準を自らに課していると主張する。

創業以来、私たちは、AI能力の限界を押し広げる際に潜在的リスクへ先回りして対処し、そのリスクの性質と規模を明確に伝えることの重要性を認識してきた。

Anthropicの創業を正当化するために使われた主要な論拠の一つは、同社の研究がAIとそのリスクについて世界の理解を深めるというものだった。同社の研究は確かにそうしてきた。

しかしAnthropicは、自らの取り組みが 正味で リスクを減らすという原則的な論拠をまだ示していない。その主張を支える分析なら、同社が 現在社会へ生じさせている リスクの定量的推定を、活動によると見積もるリスク低減と比較するはずだ。私たちの知る限り、Anthropicはそのような分析を公開していない。

上振れを考慮するかどうかにかかわらず、正直に計算すれば、発生させる絶対的リスクは許容できない水準だと示唆されるのではないかと、私たちは疑う。そのためAnthropicを含む研究所には、その計算を避ける強いインセンティブがある。一部の研究所なら、「自分たちが生じさせるリスクは無視できると考える」と信頼に足る形で述べられるかもしれない。だがAnthropicは破局的リスクを相対的によく認識しているため、そう主張するのは難しい。

それだけに、実際には巨大な隙間を残しながら、破局的リスクへ対処すると称するフレームワークを示すのは、なおさら残念である。リスクを過小評価し、実際には持たない理解を暗黙に主張することで、Anthropicは、自社の研究がもたらす脅威の性質と規模を明確に伝えるという、自らの使命を損なっている。

たとえば2023年、AnthropicはAI安全水準(AI Safety Level, ASL)規格という概念を導入した。同社によれば、これは「フロンティアAIモデルを安全に訓練・配備するための、一連の技術的・運用上の対策」である。

2023年の定義を明示的に更新した結果、ASLは適用すべき規格であって、それを適用する 能力水準ではない ことに注意してほしい。私たちはこれを、Anthropicの誤りではなく、有用で重要な区別だと考える。

フレームワークは三つの水準に言及する。付録にあるASL-2は、現在モデルへ適用している基準である。ASL-3が現行フレームワークの大半を占め、化学・生物・放射線・核(CBRN)または自律的AI研究の主要閾値を超えたと評価するモデルへ適用する意向である。同社は「ASL-4」規格と対応する「能力閾値」を開発する意向も示し、その後、セーフティケースの概念を使うこれらの規格の予備的な素描を公開した。

モデルにASL-3が必要だとAnthropicが判断したものの、ASL-3規格を実施できない場合、できるまで開発を一時停止すると約束している。(開発後は、おそらくASL-4にも適用される。)しかし、実際に一時停止へ備えるという約束を、Anthropicがフレームワークから 削除した ことに注意したい。元はこう書かれていた。

スケーリングの一時停止を先回りして計画する。 必要と判明した場合にモデル訓練を一時停止できるよう、または必要と判明した場合に、より高度なモデルの訓練と配備の間に長期の遅延を置けるよう、計画と財務を管理する。その一時停止中、安全な訓練と配備を支えるために必要なセキュリティその他の対策を実施する……。

Anthropicのフレームワークだけがこの重要な段階に言及していたことを踏まえると、改訂版から省いたのは憂慮すべきことだ。

Anthropicはこうも述べる。

ASL規格を構成する対策の種類は現在、配備規格とセキュリティ規格という二つの区分に分かれ、フロンティアAIモデルがもたらし得るリスクの種類に対応している。……将来のリスク(たとえばAIシステムが運用者の目標を覆そうとするリスク)へ対応し、今後もフレームワークを改良し続ける予定である。

「訓練規格」や「開発規格」がないことに注意してほしい。AnthropicはAI訓練自体が破局的に危険になり得ると知っているので、[4] これは明白な欠落である。[5]

また、「AIシステムが運用者の目標を覆そうとすること」が 将来のリスク に分類されていることにも注意してほしい。この公開フレームワークは、Anthropicが自社モデルでその振る舞いを実証した論文より前に作られたが、差はわずか数か月だ。それを 現在のリスク へ格上げするには、能力がどこまで進歩する必要があるのか?

一方、モデルの重みを攻撃者から守る必要性を認め、脆弱性へ対処する方法をいくつか提案したことは称賛する。

能力閾値について、Anthropicは述べる。

能力閾値は、いつ保護策を強化する必要があるかを教える……。

これは閾値を 評価する 方法を実際以上に強く見せる。一定の能力水準に達したかを ほぼ確実に 知れるなら、いつ保護策を強化するべきか分かる。しかし試験はそれほど堅牢ではない。ASL-3を発動させる閾値より低い試験結果でも、モデルにはASL-2だけで十分だとは限らず、ほかの水準についても同様である。

重要なことに、高能力のモデルは、評価で能力を意図的に隠す可能性が高い。つまり能力の劇的な飛躍に遭遇したとき、まさに極端なリスクをもたらす可能性が最も高く、評価が中心的に発見するはずの場合に、評価自体が疑わしくなる。

安全性研究者が、モデルで特定の心配な振る舞いを発見したとき、それを隠そうとするモデルの試みを示す証拠も見つけることがある。すなわち、特定の能力を検知できるのは、モデルがそれを隠すことを学ぶ前の狭い時間帯だけかもしれないと、現在考える十分な理由がある。そもそも、その時間帯すらない可能性も排除できない。

説得力が極めて高いAIモデルの潜在的リスクは認識している。専門家へ積極的に相談しているが、この能力はまだ十分に理解されておらず、現在の約束へ含められないと考える。

Anthropicがこの隙間を明示したことは評価する。さらに踏み込むべきだと考える。

ここで著者らは既知のリスクを強調しながら、十分に理解されていないため、約束のどこにも含めないと述べる。この省略は、組織の約束が網羅的だという含意を損ない、文書がリスクの全空間ではなく、すでによく理解されたリスクへ焦点を当てていることを示す。その後、こう述べる。

私たちが評価しておらず、相当な量のリスクを表す脅威モデルが存在しないという、説得力ある論拠も示す。

超説得(人間を並外れて強く説得・操作する能力)は、明白な反例である。

網羅性を示す「説得力ある論拠」なら、評価されていない全脅威モデルの集合 が相当なリスクをもたらさない、という主張を支えなければならない。十分に理解されたもの、部分的に理解されたもの、まったく未知のものを問わず、潜在的なリスク源をすべて織り込む必要がある。最低でも、各リスク源がもたらすリスクを 定量化しようと しなければならない。

「超説得による破局的結果のリスクはX%未満だ」という根拠ある主張なら、超説得へ対処しないことを正当化する論拠になる。「超説得を理解していない」は論拠にならない。責任ある明確な伝達の基準を満たすため、Anthropicは、未知の未知を含む全リスク源について、合計すればスケーリング継続を正当化すると考える数値推定を示すべきである。

よくある誤り

フロンティア研究所が明示するアプローチには、成熟産業で見られる「おそらく何か重要なことを見落としている」という不可欠な仮定がない。代わりに、手遅れになる前に、関係者のだれかが具体的な問題へ気づくことに頼る。

各社はすべて、配備時の不十分なセーフガードを、実際よりはるかに堅牢であるかのように論じる。脱獄への防御は、モデル公開から数日、あるいは数分で崩れる傾向があり、これが変わると予想する原理的理由はない。

複数のフレームワークは、推定された能力と実際の能力を混同し、測定された性能を、後の利用や微調整で引き出せる能力を示唆するものではなく、それと同一として扱う。評価が示すのは能力の下限であって上限ではない。その出力を上限として扱うのは、「能力閾値」方式の信頼性を損なう危険な誤りである。

各社はすべて、評価過程の偽陰性を十分に織り込んでおらず、場合によっては、その 可能性を認めてすらいない。[6]

以下に例示的な引用を挙げ、各社が 述べなかったこと を{波括弧}内に入れる。[7]

Anthropic

ASL-2規格は、現在の全モデルに適切だと {私たちは考えるが} ……。

Google DeepMind

この節では、 {私たちの評価で} リスクをもたらす モデルが、悪用を通じて深刻な害を及ぼす場合の緩和アプローチを説明する……。

セキュリティについては、複数水準の緩和策があり、セキュリティ対策の堅牢性を もたらされる{と私たちが評価する}リスクに 合わせて調整できる。

以下の配備緩和過程は、 {評価上}CCLへ到達した モデルへ適用され、各 {特定された}リスクと利用事例に 合わせ、緩和策を反復的かつ柔軟に調整できる。

配備前のセーフティケース審査。モデルの一般提供は、適切な企業統治機関が、モデルが到達した 各CCL{と私たちが考えるもの} について、セーフティケースが十分だと判断した後にのみ行う。

Meta

当社のフロンティアAIフレームワークの主要要素は、 一連の閾値であり、{試験結果が到達した可能性を示せば} 特定の対策を発動させる……。

フロンティア研究所には、未知のものから目をそらす習慣もある。複数の研究所は、定義の難しいリスクを、よりよく理解できるまで織り込まないことを 明示的に 選ぶ。

ただし以下の例は、上記より 改善 されていることに注意したい。省略が明示されているからだ。それでも問いは残る。自分が思いつかなかったもの をどう織り込むのか?

OpenAI:

そのため評価には、これらの強化モデルを対象とする試験を含め、「最悪事例」のシナリオを 自分たちが知る 範囲で試験していることを確認する。

緩和前リスクの理解に、当該領域で「 既知の最悪事例 」(すなわち、その領域へ特別に調整された)モデルを織り込みたい。

Google DeepMind:

モデルが深刻な害を引き起こし得る主要な 予見可能な経路 を特定・分析することで、CCLを決定できる。

「破局へ至る重要な経路すべてに対処した」は強い主張で、本当なら大きな価値があるが、研究所の示す証拠では支えられていない。

「知っている経路すべてに対処した」は、より弱く、やや擁護しやすい主張である。同時に、仕組みが十分に理解されていない強力な最適化圧を前にすれば、明らかに不十分だ。そこには、AIシステムの理解の隙間に比例して大きくなる脆弱性が残る。そして機械学習のパラダイムでは、その隙間は巨大である。

サイバーセキュリティ分野のように、エッジケースを利用するよう強く最適化されたシステムを扱う場合、脅威面の99%を覆うことが、防御成功率1%にしかならないことがある。十分なリスク管理慣行なら、この点を織り込む。

複数のフレームワークは、総リスクの推定ではなく、リスクの特定を繰り返し強調する。違いは微妙だが、重要である。

Anthropic:

脅威モデルの対応付け。各能力閾値について、最も起こりやすく重大な脅威モデル――(該当する場合)行為者、攻撃経路、モデル能力のボトルネック、害の種類の組合せ――を洗い出したという説得力ある論拠を示す。さらに、 評価していない脅威モデルで、相当な量のリスクを表すものが存在しないという説得力ある論拠を示す 。[8]

OpenAI:

追跡対象リスク区分の初期集合は、合理的に想像できる破局的リスクのシナリオが現れるために必要な、最小限の「警戒線(トリップワイヤー)」を 特定する 取り組みから生まれる 。

Google DeepMind:

モデルが深刻な害を引き起こし得る、主要な予見可能な経路を 特定・分析し 、そのためにモデルが持つ必要のある最小限の能力集合としてCCLを定義することで、CCLを決定できる。

Meta:

私たちが特定したのは、 脅威行為者が脅威シナリオを実現できるようにする主要能力である。

また、それによって、私たちが 特定したリスクを 十分に緩和するアプローチへ集中する……。

個別で、離散的で、容易に特定できるリスクは、リスク全体像のすべてではない。予見できるリスクの一覧を作り、それを防ぐだけでは、仮に防御へ成功しても不十分である。一部が不透明なままでも、総リスクを把握できる 過程を確立し、その過程が組織の全階層で意思決定へ影響できるようにしなければならない。続けるには危険すぎるとき、組織には停止する規律がなければならない。

最後に、何かへ確率を割り当てる規定があるフレームワークは一つもない。フレームワーク自体に具体的な数値を含める必要はない。実際、そのような数値は継続的に更新するのが最善かもしれない。しかしリスク管理フレームワークなら、緩和前後の既知・未知の経路について、よく較正されたリスク推定を出力する過程を示すべきである。どの企業のフレームワークもそうしていない。

口を開いて疑念を一掃する

研究所がスケーリングを正当化する 実際の数値 を示せば、その数値は間違っていると言われる、という反論があるかもしれない。それこそが、ある程度まで要点である。現在のフレームワークは、スケーリング継続を正当化すると一部が主張する費用便益分析を定量化しようと すら しない。フレームワークが対処しないリスクは、省いて正当化できるほど小さいという(明らかに誤った)仮定を、密かに持ち込むか、あからさまに主張する。

健全な工学も、確立したリスク管理慣行も、その数値自体が推測でも、不確実性へ数値を割り当てる ことを要求する。[9] そして理解が深まるにつれ 更新する。一貫して難しい技術課題に直面するNASAなどの成熟産業は、破局的故障の数値的な発生確率の推定 と、停止判断を発動させる閾値の両方を頻繁に公表する。

リスク評価は、不確実性と隙間を含め、リスク全体像について現在の理解を完全に反映すべきである。現在の理解が乏しいところでは、評価の不確実性が大きくなる。それは劣ったリスク評価ではなく、乏しい理解の下で行う原則的なリスク評価を反映する。

AI研究所は、堅牢なリスク管理体制を実証していない。

劣悪なインセンティブが隙間を広げる

研究所の安全性フレームワークは、原則的なリスク管理の基本的な前提条件を、ほとんど満たさない。こうした失敗は偶然ではないのではないかと私たちは疑う。

健全なリスク管理戦略がないことに加え、AI研究所には、自分たちの仕事が生むリスクを過小評価する強いインセンティブがある。総リスクを正直かつよく較正して評価すれば、スケーリング継続の無謀さが露呈し、投資を遠ざけ、フロンティアAI研究所の存在そのものを認める賢明さについて、政策担当者へ疑問を抱かせると予想する。したがって研究所は、もっともらしく否認できる方法で、正直でよく較正された評価を避けるという、激しい競争圧力にさらされている。

この圧力は研究所ごとに異なる形で現れる。動機づけられた言い訳、最も懸念する人々の流出、さらにはあからさまな否定を目にしてきた。

私たちの判断では、研究所のフレームワークが不確実性を公に定量化しないのは、偶然ではない。複雑でエージェント的なシステムのため、数か月または数年で機能するセーフガードを生み出せるという、疑わしい仮定を置くのも偶然ではない。能力閾値の評価を、隙間が残ると広く知られる評価へ頼るのも偶然ではない。セーフガードが気づかれないまま失敗するシナリオを論じないのも偶然ではない。

これらは、強い圧力を受け、重要な関連技能を欠くことも多い人々が下す判断である。観察した隙間の原因が、正直な誤り、習慣的慣行、動機づけられた推論、冷笑的な技巧、またはその他の原因のどのような組合せだったかは推測するほかない。それでも隙間が非難に値することは変わらない。

より責任あるリスク管理の伝達へ

正確な世界モデルを構築し、明確かつ透明に伝えようと誠実に試みるなら、この状況で原則的にすべきことは、リスク全体像 を捉えようとすることである。少なくとも次を含む。

費用便益分析をするなら、AI研究の主要な上振れについて、発生確率と規模の推定も含める。

明確にしておくと、AI研究所の技術者が、ミスアラインされた超知能に対して十分な緩和策を実際に考案できるとは予想しない。また、現在の計画よりはるかに精密で保守的な計画なしに、アラインされた 超知能を作るとも予想しない。

しかし、こうした予想は、基準となる総リスク(高い)と緩和策の信頼性(低い)の推定へ反映される。そして研究所が数値推定を公にすれば――あるいは少なくとも、不十分さを見抜く技能と、対処されるまで危険な研究を停止させる権限を持つ監査者・規制当局との非公開会合で示せば――意見の相違をもっと生産的に追究できる。

いずれにせよ、モデル化したリスクに基づき、進むのは賢明でないと判断して 実際に停止する か、それとも正味で続ける価値があると考える理由を明示すべきである。

結論

堅牢なリスク管理慣行は一般に、新しい産業で数十年の試行錯誤を経て生まれる。AIのような新興分野では、関連する専門知識は珍しい。新しい文脈で必要な工学人材を雇用・育成することは難しく、知識移転も遅いことが多い。健全な慣行を義務づければ、たとえ安全上極めて重要でも、イノベーションを実際に減速させる。

社会は三点式シートベルトが発明されるまで、50年以上にわたり量産自動車を、多大な犠牲を払いながら容認した。この命を救う対策が広く採用されるまでには、さらに時間がかかった。しばしば悲惨で不要ではあるが、起こり得る悲劇の規模に 上限がある なら、社会はこのような隙間を容認できる。自動車事故は非常に多くの人を殺傷し得るが、人類文明を終わらせるとは予想しない。対照的に、フロンティアAI研究のリスクの 上限 は、地球上の全生命の絶滅である。

フロンティア研究が絶滅級の災害を起こす可能性は非常に高いと、私たちは考える。しかし現在のアプローチの弱さに気づくため、この見解を共有する必要はない。より極端でない破局への、より極端でない懸念で十分である。研究所は、自らが引き受ける仕事に見合うリスク理解を示していない。成熟産業が危険な問題を安全に切り抜けることを可能にする、深い制度的道具――分析の厳密さ、不確実性の尊重、停止する規律――を欠いている。

今後さらに数年間は、悲劇の規模に上限があるままかもしれない。しかし幸運にもそうなったとしても、それは主に、フロンティア研究所が自らの研究の危険を管理したおかげではない。研究所の理解の隙間は時間とともに広がり、エッジケースとして退けるシナリオの一部は、ますます起こりやすくなると予想する。

人工超知能について「破局的脅威の ほぼ すべてへ対処する」は敗北条件である。十分性の基準は、この種の誤りを、世界全体で無期限に 一つも 起こさないことだ。

AI産業が、比較的安全な技術を扱う成熟産業の基準すら満たせないなら、フロンティアAI開発を安全に進める準備がないことは明らかである。

付録――その他のフレームワーク

OpenAIの備えのフレームワーク

まず肯定的な点を挙げよう。未知の未知へ対処する必要性をOpenAIが認めたことは評価する。明示しないフレームワークも複数ある。

未知の未知を探す。 現在未知である破局的リスクの区分を、それが現れるにつれて特定・分析(および追跡)する過程を継続的に実行する。

しかし提案された方法には、危険な隙間が残る。上の文を注意深く読むと、そのいくつかが分かる。特定と追跡によって、リスクを「未知の未知」から「既知の未知」へ移すことは重要だが、堅牢なフレームワークなら、そうした区分が まだ特定されていない間に 防ごうとする。リスク区分全体を「現れるにつれて」分析・追跡するだけでは不十分である。破局を堅牢に防ぐ方法をあらかじめ用意し、その方法によって、未知の未知が 現れる前から 守らなければならない。サソリは、探検家がサソリの存在を知る前に殺せる。[14]

ここでもほかの箇所でも、OpenAIの文言は、リスク管理を原則的に理解していることを示さない。

AIによる破局的リスクの科学的研究は、必要な水準へはるかに達していないと考える。

人工知能の科学的探究は確かに、超知能の可能性に備えられていない。だがここには、さらに研究すれば隙間を埋められるという含意がある。重要な点を見落としている。現在のシステムに関する実証研究によって、未来のシステムから現れる可能性の範囲をどう限定できるのか?

現在のシステムと技術を使う実証研究から、はるかに賢いシステムでどのような創発現象が見られるかを予測する能力はほとんど得られず、十分な緩和機構も得られない。定性的予測はいくつか可能だが(たとえば道具的収束)、この分野の多数の理論的・実証的所見に、フレームワークは十分対処していない。

備えのフレームワークに示されたような段階は、時間がたつにつれ理解を深めるが、それは主に過去についての理解を深める。未来には必ず驚きがある。よりよいフレームワークなら、短期的な開発リスクの包括的説明は得られないと認識し、理解が乏しいままでもリスクを減らす仕組みを開発する重要性を強調するだろう。

評価手順について、OpenAIはこう述べる。

これらの評価は継続的に、すなわち、訓練前・訓練中・訓練後を含め、重大な能力変化を捉えるため必要な頻度で実行する。実効計算量が2倍を超えて増加したとき、または大きなアルゴリズム上の進歩があったときを含む。

現在まで、どの程度の頻度で評価を実行すれば「重大な能力変化」を追跡できるかは、だれにも分からない。OpenAIは、評価と評価の間に能力が突然飛躍する可能性を、仮定によって消している。見かけ上の計画は、1.5倍のスケールアップでは、危険な下流能力を予想外に解放する閾値を決して越えない、と期待することだ。評価の頻度が十分だと知ることはできない。

OpenAIは、試験が関連能力をすべて十分に引き出すとも仮定する。この仮定に根拠がないことは広く知られている。同様に、どの訓練段階でも、ある評価が最新モデルの主要能力を十分捉えるとは知り得ない。

どちらかの仮定に依存する保証は疑わしい。

試験と評価は有用な道具だが、緩和後のリスク推定の唯一の根拠にするほど信頼できない。評価の開発者はだれも、それが能力を完全に反映すると主張しない。このように評価へ依存しながら、その穴の多さを明示的に認めず、補う追加対策を取らないのは、大きな見落としである。

評価が危険な能力を見落とす確率、または緩和策が失敗する確率を定量化する過程は何か? 残余リスクを推定する過程は何か? 人類に代わってOpenAIが受け入れる用意のある残余リスクの 量 はどれほどか?

評価は偽陽性と偽陰性の両方を生み得る。偽陽性の場合、OpenAIは追加調査を行い、自らの評価を覆すことを認めている。偽陰性を 検知する 手段はまったくない。その手段がないなら、その後の判断は極めて保守的にすべきである。

OpenAIのフレームワークは、名目上、開発停止の約束を含む。

緩和後の評価が「中」以下のモデルだけを配備でき、緩和後の評価が「高」以下のモデルだけをさらに開発できる。

しかしこの約束には、実質的に骨抜きにするだけの但し書きと限定がある。OpenAIは、緩和後にも社会へ「高」リスクをもたらすと自ら評価したモデルの開発継続を、明示的に認める。参考までに、OpenAIの「高リスク水準」の定義には、堅牢化された標的への自動サイバー攻撃能力と、「関連分野の基礎訓練を受けた者ならだれでも……CBRN脅威を作れる」ようにする能力が含まれる。

企業が受け入れる用意のある残余リスクを問うとき、これは一例になる(ただし定量的ではなく、依然として定性的である)。許容できるリスクを述べるのは沈黙よりよいが、受け入れる用意のあるリスクがあまりに高い。

最高のリスク水準である「重大」には、「全ソフトウェア・プロジェクトを対象とする、あらゆる深刻度のゼロデイ脆弱性」、完全に自律的な自己複製、新しいCBRN脅威の完全自動作成が含まれる。OpenAIは、緩和策がなければこの水準へ達すると予測するモデルの開発を制限すると述べる。ただし――。

これは、安全性を高める開発を妨げるべきではないことに注意されたい。企業としても、こうした安全上の課題を解決することへ注力し、安全だと(運用化過程を通じて)合理的に確信できる場合に限り、能力を高める開発を継続する。

言い換えればOpenAIは、開発が安全性を高めるものだと同社が考える か、安全だと 自らを安心させられる 限り、重大リスク のシステム開発を続けることを明示的に認めている。

OpenAIは何を「安全性を高める」と考えるだろう? 確実には分からないが、AIシステムを人間の価値とアラインさせる主要な方法は、人間のフィードバックによる強化学習(RLHF)だと過去に述べている。OpenAIの見方でRLHFが「安全性を高める」に該当し得るなら、この約束がどの訓練法を排除するのか明らかでない。

これを開発停止の約束と呼ぶのは無理がある。開発時に少し注意を増す約束のようだが、それすら曖昧で実効性を欠く。

OpenAIの振る舞いと備えのフレームワークの内容から見て、十分に保守的な判断をしているようには見えない。宣伝される一連の保守的な約束とはかけ離れ、このフレームワークはむしろ、「これが私たちに期待できる慎重さの上限だ」と述べる天井である。

Google DeepMindのフロンティア安全性フレームワーク+AI原則ページ

注:この分析では、最近公開された技術的なAGIの安全とセキュリティへのアプローチを扱わない。新文書がDeepMindのアプローチの根本的欠陥を解消するようには見えないが、価値があると私たちが考える形で、いくつかの仮定をより明示している。

DeepMindが正しく行っていると考える重要な点を二つ強調したい。第一に、破局的結果へつながり得る中心的シナリオの一つである 欺瞞的アライメント に、フレームワークの一節を割いている。第二に、思考連鎖の監視を明示的な緩和戦略として提案し、失敗し得る状況も認めている。これらのアプローチには巨大な隙間があるが、計画全体へ加えられたことは歓迎する。

DeepMindのフレームワークの導入は、同社のAI原則を引用する。そこにはこうある。

研究、外部専門家の意見、レッドチーミングを通じて、AIリスクを特定・評価する。

個々のリスクを特定・評価することは、確かにリスク管理の重要な一部である。しかし、それだけでは不十分だ。

具体的に記述できるリスクの部分集合は、完全でも、全リスク を代表する標本でもない。ここでもフレームワークでも、DeepMindはそのことを認めない。重要な隙間と不確実性の影響の推定を含め、リスク全体像を徹底的に把握する必要性へ言及しない。目的にかなうフレームワークなら、その必要性を明確にすべきである。

欺瞞的アライメントについて――。

現在、フレームワークは主に悪用リスクへ対処するが、欺瞞的アライメントのリスクを扱う探索的な節も含め、そのようなリスクが生じ始め得る能力水準へ焦点を当てる。

DeepMindのフレームワークへ欺瞞的アライメントを加えたのは、正しい方向への一歩である。さらに多数の段階が必要だ。

欺瞞的アライメントは、現在のモデルですでに実証されている。この能力閾値は通過済みで、Claude 3 Opusより全般的に有能なモデルはすべて、その振る舞いを示し得ると仮定すべきである。DeepMind自身のフロンティアモデルも含まれる。

モデルがその振る舞いを 示す 可能性や、欺こうとして 成功する 可能性は低い、と論じることはできる。しかしDeepMindが述べているのはそれではない。同社はAnthropicと同じく、モデルが何をできるか を中心に研究を組み立てている。

フレームワークは、「重大能力水準(Critical Capability Levels)」と呼ぶ能力閾値を中心に構築される。これは、緩和策がなければAIモデルまたはシステムが深刻な害の高いリスクをもたらし得る能力水準である。モデルが深刻な害を引き起こし得る主要な 予見可能な経路 を特定・分析し、そのためにモデルが持つ必要のある最小限の能力集合としてCCLを定義することで、CCLを決定できる。

「予見可能な経路」の強調に注意してほしい。一見無害な能力が、DeepMindの研究者が予見しない経路で害を可能にする場合(以前は能力がないと考えられたモデルで、思考連鎖プロンプトが新しい能力を解放した場合など)、CCLは主要な役割を果たせないかもしれない。

さらに、「モデルが[深刻な害を引き起こす]ために持つ必要のある最小限の能力集合」は、存在しないかもしれない。ある特定の害について、互いに重ならない複数の能力が、それぞれ単独で十分かもしれない。たとえば次のいずれも――。

……人工病原体の開発を可能にするには十分だろう。これは網羅的な一覧ではなく、そもそも網羅的な一覧は不可能かもしれない。

網羅的だと分かる早期警戒評価を作るよい方法はない。害への起こりやすい経路の一覧を作れても、網羅的だとは保証できない。有害な 結果 の一覧を作れても、各結果への全経路を捉えたとは保証できない。このアプローチだけでは不十分である。

DeepMindはこう述べているように見える。破局的な害を可能にし得る能力閾値のうち、思いつくもの をすべて一覧にする。モデルがいくつかの閾値を越えたように見えれば、特定された能力がもたらす脅威を取り除く緩和策(たとえば、標的を絞った忘却学習や拒否)を適用しようとする。

今のところ、有名な脱獄者プリニー・ザ・プロンプター(Pliny the Prompter)のような者との遭遇に耐えたセーフガードがないという事実は脇に置こう。DeepMindが 思いつかなかった 閾値はどうするのか?

つまり、モデルは 汎用 推論器であり、能力向上には 相関がある。モデルが危険な能力について一つ以上の明白な閾値を越えれば、同時に、明白でなく、DeepMindの 一覧にもない 閾値も一つ以上越えた可能性がある。特定された各能力へ適用する緩和策が、たとえ機能しても、対処されない能力には及ばないかもしれない。

DeepMindは、悪用 区分で三つの「高リスク領域」を特定する。最初の二つ、化学・生物・放射線・核(CBRN)とサイバーはかなり標準的である。三つ目は機械学習研究開発で、次のように定義する。

AIの進歩速度を、不安定化し得る水準まで加速できるモデルの 悪用 リスク。その結果、ほかの強力なAIモデルが安全でない形で実現・拡散し得る。

ここでの仮定は、ほかのだれか が、AI研究を加速できるモデルを使って……AI研究を加速し、強力で危険なAIを生むかもしれない、というものらしい。フレームワークは後でこう詳述する。

急速に改善し、潜在的には超人的なAIシステムを脅威行為者が 行使して おり、それに対する有効な防御法がないなら、これは破局的になり得る。

これは、自動AI研究が破局的脅威になる主要な仕組みではない。主要な仕組みは、現在フロンティアを押し広げる研究所 が、だれにもまったく行使できない「強力なAIモデルの安全でない実現・拡散」を引き起こすことだ。この能力は「悪用」に属さない。どれほど堅牢な配備・セキュリティ上のセーフガードでも防げないからである。モデルを内部でのみ「使用」する限りすべて制御下にある、という誤った仮定が問題だ。

主要な懸念について、DeepMindは何を述べるのか?

欺瞞的アライメントのリスクについて、初期アプローチは、追加の緩和策が適用されないと仮定した場合に、人間の制御を覆し得る、基礎的な道具的推論能力をモデルがいつ獲得し得るかの検知へ焦点を当てる。したがって二つの道具的推論CCLは、その能力がいつ存在するようになるか、次に、その能力に対する初期緩和策――自動監視――がいつ十分でなくなるかを区切ることへ焦点を当てる。

完全な表は次のとおりである。

第一に、現在のモデルはすでにIR 1を満たすように思える。意図的にアライメントを装うと示されたモデルは、少なくともGoogle自身のGeminiモデルと同等のシステムによって、推論能力ですでに追い越されているからだ。

第二に、DeepMindが提案する緩和戦略は、AIの思考連鎖を自動監視すること、ただ一つである。「自動」監視と明記するのは、(a)人間が自分で監視するには時間がかかりすぎ、(b)最も有能なフロンティアモデルは、人間の言語ではなく潜在ベクトルで思考する可能性が高いからだと推測する。

DeepMindで最も有能なフロンティアモデルを、どのシステムが監視するのか? 選択肢は二つある。

どちらも、ある程度賢い思考者に対して堅牢ではない。前者は、より強力なモデルに知恵で負かされるおそれがあり、後者は共謀のおそれがある。これらの問題には大まかなパッチを当てられるかもしれないが、堅牢な解決策はまだない。

議論のため、DeepMindは、自動監視がIR水準1のモデルを発見するのに実際に十分だと確実に把握できる、と仮定しよう。水準1が水準2へ進んだとき、それを知れるというDeepMindの自信には、どんな根拠があるのか? 自動監視が不十分になったことへ気づけない確率を、同社はいくつと見るのか?

DeepMindの水準1の定義によれば、人間による制御を覆せるほど賢く、ひそかにそうできるほど狡猾で、思考用メモの監視や解釈に専用ソフトウェアが必要なほど複雑だと考える理由のあるモデルを手にしている。この状況で、失敗する可能性を 排除できる ほど有効な自動監視方式とは何か?

第三に、高水準の思考連鎖監視が捉え得る種類の 明示的な 道具的推論 だけが、ミスアラインされたモデルをアラインされているように 見せる 方法でも、能力拡大時に一般化へ失敗する形のアライメントを持たせる方法でもない。単純化しすぎた例では、高水準の思考連鎖が、「サブルーチン」(たとえば人間が読める出力言語の正確な言い回しを決めるもの)を呼び出し、そのサブルーチンが、高水準AIによる意図的な欺瞞の選択なしに、欺瞞の形をした計画を実行するかもしれない。深層的な欺瞞性の記事が、この問題をさらに詳しく検討している。

これは難しい問題だ! DeepMindが高水準フレームワークの数段落で解くとは予想しない。しかし、この隙間や計画内のほかの隙間が存在すると認め、対応するリスクを明示的に定量化し、対処しようとすることは期待する。

このフレームワークが答えないほかの問い――。

ここでもほかの箇所でも、数値的確率を割り当てないことが、DeepMindの論拠を弱めている。「排除できない」は「文字どおり確率ゼロではない」でなく、特定の信頼水準を指すつもりだったのかもしれない。そうなら簡単に明確化できる。

DeepMindは、ほかの文脈では確率推定の価値を理解しているように見える。

最も強力なフロンティアモデルを定期的に評価し、AI能力がCCLへ近づいているか確認する予定である。以前のモデルを上回る例外的な能力向上を示し得るこれらのモデルも評価し、適切な場合には、 訓練前と訓練中に その能力とリスクの 発生可能性を評価する 予定である。

「その能力とリスクの発生可能性を訓練前と訓練中に評価する」と決めたことは、DeepMindの功績である。モデルが配備前にも破局的リスクをもたらし得ると認めることは、極めて重要だ。ここでDeepMindが正確に何を意味するか、いくらか曖昧ではあるが、全体として、フレームワークに含まれることを歓迎する。

しかしそのアプローチは、ほかの開発企業と同様、評価が堅牢だという仮定へ致命的に依存する。

最も危険な能力には、欺瞞的アライメントのように、どのモデルでもとりわけ引き出し、予測するのが難しいものが含まれる。AlphaGoが、私たちには予見できない勝ち方を見つけると予想するのと同じく、強力なフロンティアモデルは、予見できない深刻な害の起こし方を見つけると予想する。

そのため、「早期警戒評価」と呼ぶ一連の評価を定義し、評価が再実行される前にCCLへ達し得ると知らせる、特定の「警戒閾値」を設ける。

DeepMindは、モデルが新しいCCLへ達する前に、その能力を評価で知らせることを明らかに 意図している。しかし偽陰性への備えはない。ここでもフレームワークのほかの箇所でも、CCLを越える前に必ず警告を目にすると暗黙に仮定する。

繰り返しになるが、この仮定に根拠がないことは広く知られており、それに依存する保証は疑わしい。

評価では、適切な足場やほかの拡張をモデルへ装備し、そのモデルを使って 作られる可能性が高い システムの能力も評価できる 可能性を高めようとする 。

これは称賛すべき正直さであり、同時に明らかに不十分である。主要研究所のどこも、自社モデルから作られる 最も 有能なシステムを評価済みだとは、合理的に主張できない。後に開発される微調整や足場の技術は、予測できない形でモデルへ能力を与え得る。

「作られる可能性が高い」という表現に注意してほしい。作られる可能性は低いものの、出現すれば破局的結果をもたらし得る能力はどうするのか? 能力と発生可能性の境界のうち、「起こりにくいが極めて危険」な端で、DeepMindはどのような隙間を許容するのか?

警戒閾値によって 警告された モデルは、容易に利用できる緩和策(以下のものを含むが、それに限らない)では不十分かもしれないリスクをもたらすと 評価される 場合がある。

ここには、対処されない二つの失敗点が見える。

  1. モデルが危険な能力を持つが、警告されない。
  2. 警告されたモデルが、「容易に利用できる緩和策」では不十分なリスクをもたらすが、評価がその事実を見落とす。

DeepMindがこれらの展開を起こりにくいと考えるなら、確率の推定または上限を述べ、その数値をどう導いたか説明すべきである。

これが起きた場合、対応計画は、十分な緩和策を適用できるまで配備またはさらなる開発を保留することを含む 場合がある 。

進めば破局的結果になり得る兆候に対する正しい対応は、開発を保留することだ。しかし「場合がある」は、現在の緩和策が不十分だと考えながら、DeepMindが開発と配備の両方を続ける選択肢を、明示的に残している。驚くほど実効性のない約束である。

適用した緩和策の適切さと有効性は、定期的に審査 すべきである ……。

これは約束ですらない。

DeepMindは、十分に包括的なリスク管理へ向け、尊敬に値する前進を遂げ、いくつかの領域ではAnthropicのRSPよりわずかな改善さえ示す。しかし最終的に、DeepMindのフレームワークはOpenAIやAnthropicと同じ根本的な隙間を抱え、フロンティアモデルに破滅的能力が生じることを十分に防げていない。

根底には、DeepMindの理解が限られていても、アプローチを根本的に変えず安全に前進する方法が必ずあるはずだ、という仮定があるように見える。

MetaのフロンティアAIフレームワーク

Metaはその慣行について厳しい批判を受けて当然だが、肯定的な点から始めよう。OpenAIと同じく、Metaのフレームワークは停止条件を明示する。

フロンティアAIが重大リスク閾値へ達したと評価され、緩和できないなら、 開発を停止し 、表1に示す対策を実施する。

しかしOpenAIと同じく、この約束には実際上、重要な但し書きがいくつもある。第一に、重大リスク閾値とは何か? 表1にはこうある。

モデルが、破局的結果を生むのに十分となり得ると 特定された脅威シナリオの 少なくとも一つを ほかに代替のない形で 実行可能にし、そのリスクを 提案された配備の文脈で 緩和できない。

限定語に注意してほしい。これは 特定された具体的シナリオ に依存し、未知の未知を一切考慮しないアプローチである。

Metaは、該当するシナリオをどう特定するのか?

「もっともらしい」を詳しく見よう。

破局的結果への 因果経路を特定でき 、その経路に沿う一つ以上の シミュレーション可能な 脅威シナリオを定義できなければならない。 これにより、実施可能で証拠に基づくアプローチとなる。

まとめるとMetaは、モデルの配備(訓練ではない!)が破局へ至る仕組みを具体的に追跡でき、害を引き起こすシナリオを定義し「シミュレーション」できない限り、検討に値しない、と述べているようだ。

「この害への因果経路を特定しなかった」は、「因果経路が存在しない」を含意しない。この文言によってMetaは、自社が行うどのリスク評価も不十分になることを、ほぼ保証した。

このアプローチの一部の版は、責任あるリスク管理フレームワークを支える構成要素として役割を持つかもしれない。XからYへの因果経路を見つけようとして 失敗する ことは、経路が存在しない、またはXがYを引き起こしにくいことの いくらかの 証拠になる。

しかしMetaのフレームワークはそう動かない。明示的に 予見できないシナリオを、検討から一律に除外する。通常のリスク特性しかない現代産業でも、これは危険なほど視野の狭いリスク評価の根拠になる。知的敵対者、まして戦略的に超人的な行為者が関わり得る文脈では、甚だしく不十分である。

Metaのフレームワークには、ほかのものと同じ誤りも多数ある。推定能力と実際の能力を混同し、偽陽性は織り込むが偽陰性は織り込まず、確率を生む過程も示さない。安全性の微調整は容易に除去でき、モデルの重みを公開することは、実質的に、そのモデルの有用性だけを重視した版や、微調整した版も公開することだという事実を、ほぼ認めていない。

xAIのリスク管理フレームワーク

xAIは2025年2月、リスク管理フレームワーク草案を公開した。

これは、現在開発中でない将来のモデルへ適用する予定の、xAIのリスク管理フレームワークの最初の草案である。この方針の更新版を3か月以内に公開する予定である。

間もなく更新される草案という位置づけを踏まえ、ここでは大枠のアプローチに見込みがあるかへ焦点を当てる。現在の草案が制御喪失リスクへ十分対処していないと、xAIが明示的に認めたことは歓迎する。

制御喪失に関する評価・緩和計画はまだ十分に開発されておらず、将来改善する予定である。

残念ながら、大枠のアプローチは、評価が堅牢だという仮定へ過度に依存するという、共通の問題を抱える。上の「評価と緩和」では狭すぎることに注意してほしい。評価はリスク推定への 入力 になり得るが、それだけではリスク推定の健全な根拠にならない。

ベンチマークと評価の信頼性・十分性を検討している点は正しい。

内部・外部配備の両方について、そのようなベンチマークの十分性と信頼性を、利用可能なほかのベンチマークとの比較を含め、定期的に評価する予定である。制御喪失に関係するベンチマークが作られるにつれ、このベンチマーク一覧を定期的に改訂する場合がある。

しかしリスクについて最も重要な場合、すなわちベンチマークや評価が、十分で信頼できるように 見える が実際には違う場合――十分性と信頼性を評価する過程が失敗する場合――は無視されている。このフレームワークは、「試験が重要なものすべてを覆い、意図どおり機能するなら……」という場合のよい出発点だが、それ以外を今のところほとんど織り込んでいない。

重要なものすべてを覆えない可能性の一例[15]として、MASKベンチマークの説明を考えよう。

MASKは、中立的に尋ねた場合と、嘘をつくよう圧力をかけた場合のモデルの応答を比較することで、LLMの 正直さを評価するベンチマークである 。

「正直さを評価する」は一般的に聞こえる。しかしMASKが直接行うのは、「MASKの評価パイプラインを使い、MASKデータセット上の不正直な振る舞いを試験する」といったことにすぎない。これを「正直さ を評価する」と表現すれば、一般化の仮定を密かに持ち込むおそれがある。特定の文脈で不正直さを発見できなかっただけなのに、堅牢な正直さを実証したと結論することである。特定の文脈で不正直さを発見できなかったことは、堅牢な正直さのいくらかの証拠ではあるが、保証には程遠い。

安全性フレームワークの中心的な仕事の一つは、安全性の性質が一般化しやすい文脈を 明示的に検討し、堅牢性の証拠を評価し、残る不確実性とリスクを定量化しようとすることである。

現行草案の結びの段落も、中心的な点を示す。

セーフガードが十分なのは、Grokの関連ベンチマーク上の性能が所定の閾値内にある 場合に限る 。 ただし、責任ある配備を確保するには 、状況の変化に応じ、リスク管理フレームワークを継続的に適応・更新する必要がある。

最初の文は精密で正しく、実質的には何も保証しない。「車を持っている場合に限り、ロンドンまで運転できる」という文は、厳密には正しいが、[16] 車を持っていればロンドンまで運転できるとは含意しない。途中に海があるかもしれない。

著者が 必要十分条件 を意味したと仮定すれば、文は正しくなくなる。ベンチマーク上のGrokの性能は、セーフガードが十分かもしれないと 示唆する ことはあるが、保証には程遠い。

第2の文には少なくとも二つの大きな問題がある。第一に、責任ある 訓練や開発 への言及がない。すでに述べたとおり、これは共通の欠落だが、やはり不用意である。第二に、第1の文が責任ある配備に多少なりとも似たものを表し、今後は計画を更新するだけで十分だと含意する。どちらも違う。全面的な見直しが必要である。

この根本的な限界があるため、草案はリスク管理フレームワークとして見込みがあるとは考えられない。せいぜい、リスク管理フレームワークの有望な 構成要素 である。
***

脚注

  1. または、現在の環境で自らの行動が正味でリスクを減らすと考えている。
  2. 本稿では、DeepMindが公開したはるかに長い文書技術的なAGIの安全とセキュリティへのアプローチを扱わない。本稿で述べた理由の多くと同じ理由から、十分だとは考えない。しかし改善点はいくつかあり、公開されたことは称賛に値する。
  3. NASAも同様の過程を使う。
  4. たとえば同社のASL-4の素描の記事は、セーフティケースを「理想的には、AIシステムの訓練による破局の確率または配備による破局の確率の上限」と正しく強調する。
  5. RSPの6.2節は事前訓練の実行監視を論じるが、新しいモデルを、危険な能力を持つ すでに訓練済みの より高能力なモデルと比較する文脈に限られる。
  6. 信頼性工学では、「隠れた」故障と「明白な」故障の区別として現れることがあり、それぞれ異なる緩和策と偶発時対応を必要とする。
  7. これらを含む引用箇所では、明確化のため強調を追加した。
  8. Anthropicの表現はほかの研究所よりはるかに慎重だが、それでも付録で検討する隙間がある。特に、「総体として、評価していない全脅威モデルの集合が、相当な量のリスクを表さないという説得力ある論拠を示す」とは述べていない。
  9. 未知の未知を織り込むのは難しく見えるかもしれないが、「予見していない経路を通じ、破局的結果が生じる確率を5%と見積もる」でも厳密には該当する。桁だけの推測でも、肩をすくめるよりはるかに有益である。災害確率20%の実際上の含意は、2%や0.2%の場合と大きく異なる。
  10. または、ある計画と一つ以上の破局的結果について、「計画したアプローチが[破局的結果]を引き起こす基準確率はどれほどか?」。
  11. または、ある結果について、「[特定の緩和策、たとえば忘却学習]は、このリスクをどれほど減らすか?」。
  12. または、「[試験または評価]が、能力閾値への到達を知らせ損なう確率はどれほどか? どこまで下げられ、そのとき偽陽性率はいくつか?」。
  13. または、「すべての緩和策を適用した後、どこまで高いリスクなら、それでも継続を決めるか?」。
  14. 古い工学設計は高度な荷重計算より前に作られ、技術者がその分保守的なので、新しいものより 堅牢に 作られている(壁の厚い圧力容器、支柱を増やした橋)場合が多い。しかし、こうした設計も予想外の形で破局的に失敗することが なおある(脆性破壊、空力弾性フラッター)。
  15. xAIはMASKを 例となる ベンチマークとして挙げ、特定の正直さの保証に十分だとは主張していないことに注意したい。ここで指摘しているのは、関心対象の性質と、ベンチマークが測るものとの一般的な隙間である。
  16. はいはい、どんな乗り物でも構わない。