本ページは、Don't Worry About the Vaseの記事 "OpenAI Trained Its Models For Months While Those Models Were Coordinating Exploits Via Message Boards" の非公式日本語訳です(翻訳: AGI Hub)。原文を読む ↗

OpenAIは、モデルたちが掲示板を介して連携し、攻撃手法を共有している間も、何か月にもわたって訓練を続けていた

――なぜ事態は何度も、私たちの認識より悪いと判明するのか?

原題: "OpenAI Trained Its Models For Months While Those Models Were Coordinating Exploits Via Message Boards"

著者: Zvi Mowshowitz

初出: Don't Worry About the Vase、2026年8月7日


カバー画像

なぜ事態は何度も、私たちの認識より悪いと判明するのか?

では、いま判明していることをすべて織り込んだ後でも、実態は私たちの認識よりはるかに悪いという方向へ、どこまで見方を更新すべきなのか?

AIがミスアラインした行動を取るたびに出てくる「いや、これは無害な出来事だった」という弁明が、数日後の新情報によって何度も立て続けに打ち砕かれれば、報告されているのはたいてい、無害でありふれた版の出来事ではない、と先回りして見方を更新したくなる頃合いである。

いずれにせよ、次なる一連の暴露に備えてシートベルトを締めてほしい。とんでもない代物だ。これは『誰かがそれを作れば、みんな死ぬ(If Anyone Builds It, Everyone Dies)』の引き金となる出来事を早い段階で再現したものだった。ただし、こちらのほうがいっそうSFじみている。現実は、もっともらしく見せるために作り事をする必要がないからだ。私たちは十分に幸運で、しかもまだ十分に早い時期だったため、手遅れになる前にこれを発見できた。次も体制を立て直せなければ、それほど幸運ではないかもしれない。

Black Hatの動画について私の理解が正しければ、OpenAIが数か月の間に訓練したすべてのモデルは、救いようがないほどぶっ壊れていると推定すべきである。

要するに、こういうことだ。

[

] (https://translation.agi-hub.ai/admin/assets/articles/openai-trained-its-models-for-months/images/ja-https3A2F2Fsubstack-post-media.s3.amazonaws.com2Fpublic2Fimages2Fefbd788f-bf6b-4-2be1b91a.png)

Anthropicにも、いまになって初めて明るみに出た深刻な問題がいくつかある。Anthropicは、Dean Ballが「穏健な慎重さ(moderate prudence)」と呼ぶ水準にさえ、まるで達していない。

Anthropicには、やるべきことが山ほどある。そして確かに、両社のインシデントには少し似た響きがある。だがAnthropicで起きた不具合は、OpenAIで起きたことと規模の面で到底同列ではない。

[

お前と俺を一緒にするな。(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!zDHU!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fefbd788f-bf6b-4a75-8ae8-c120f2f54aea_387x516.jpeg)

もう一つ見落としてはならないのは、この一連の行動がどれほど洗練され、高度だったかである。OpenAIのモデルは本当に高度な攻撃手法(exploit)を学び、目を見張ることをやっていた。それはおそらく、掲示板へアクセスでき、そこで絶えず攻撃手法を共有して利用する世界のなかで訓練されたことの直接の帰結である。恐るべきミスアラインメントを生んだものが、関連能力まで高めてしまったのだ。

状況は、本当に、本当に悪い。

それでも私は、OpenAIが率直に講演し、これほど明瞭にすべてを開示したことには感謝したい。今後、同様の開示をためらわせたくはない。これは素晴らしい講演であり、OpenAIはそのために相当な代償を払った。

だが同時に、マジで、なんてことだ。

目次

  1. サイバー評価は呪われた吸引域である。

  2. サイバー評価の外も十分に呪われている。

  3. 不正、不正、不正、不正、不正。

  4. 掲示板を読め。

  5. AI(OpenAI内部システム悪用)のタイムラインを更新する。

  6. これが世界の終わり方である。

  7. 伝言掲示板を撃つ。

  8. 内部システムとHugging Faceへのハッキング。

  9. OpenAIの応答。

  10. AIが自分の正体を語るとき。

  11. 機能的意思決定理論の、かつてと未来の台頭。

  12. パニックになるな。

  13. 英国でのハッキング騒動。

  14. 今回はMythosも現実だと分かっていた。

  15. 意図せずインターネットへ通じるテスト実行は141,006回あったが、メール警告は一件もない。

  16. もう宣伝目的の仕掛けではないと、さすがに分かっているはずだ。

  17. 未来はやって来る。

  18. 調査が始まる。

  19. N隻のボートと3機のヘリコプター。

  20. 常にサンドボックスをレッドチーム評価せよ。

  21. 停止して発火せよ。

  22. 真実と和解。

サイバー評価は呪われた吸引域である

見るべきBlack Hatの凄まじいプレゼンテーションを含む、新たに判明した詳細へ進む前に、残された最後の共通要因、あるいは「言い訳」を強調したうえで片づけておこう。つまり、これはいつもサイバー評価で起きている、という点である。

John Schulman:これらのモデルが、サイバー評価になると偏執的な狂乱へ入るのは興味深い。モデルが状況を、タスク完遂だけが報酬となるRLVR訓練分布の一部へパターンマッチし、ほかで学んだ整合的行動が汎化しなくなる、塊状のポストトレーニング(chunky post-training)が働いているのではないか。CTF形式のタスクでできた塊さえあるかもしれない。

Nabeel S. Qureshi:[英国AISI]のインシデントで使われたMythos 5の版はConstitution(憲法)で訓練されているのに、悪意あるPRを受け入れさせるためGitHubのメンテナーへ嘘をつき、ガスライティングまでしているのが興味深い。この種のアラインメントは「浅く」、圧力を受けると壊れるというYudkowskyの主張に一点。

確かに今も、「これらのインシデントは大半がサイバー評価中に起きた」とはいえる。

少なくとも私たちが知るかぎり、モデルはまだ、昼食の店を勧めるよう頼まれただけで普段からウェブサイトへ侵入するわけではない。そうすれば昼食の推薦がわずかに改善しうるとしても、サブエージェントを与え、ultra-thinkに設定し、最高の結果を出して一切間違えるなと命じたとしてもだ。

仮に問題がここだけだったとしても、これはかなり弱い自己慰撫にすぎないと思う。サイバー評価が、現実世界に存在すると明らかに分かっている意図せぬ標的に対して、こうした戦術を誘発してはならない。だめだ。断じてだめである。

[

ミスアラインメント!(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!cqbM!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F7a6949d7-721c-464d-84f4-e20e08266c7d_244x206.jpeg)

Yo Shavit(OpenAI Foundation):ちょっと聞いてほしい。すべてのAI企業が、自社製品のどれ一つとして犯罪をしたがらないようにすることを最優先事項にしたらどうだろう――費用はかかるかもしれない。そこはごまかさない――だが、とにかくそうするのだ。

――「でも犯罪をしたがるのは、この技術がそういう仕組みだから」? うん、いや、確かにそうかもしれないが、それでは実際の答えになっていない。

これらのインシデントはどれも、明白なアラインメント失敗である。ClaudeもSolもGalaxy(Hugging Faceへのハッキングを主導した未公開AIモデルに私がつけた呼び名)も、この条件下でこんなことをしてはならない。攻撃は成功しなかったが、それは関係ない。重要なのは試みたことだ。

ここでの問題がすべてサイバー評価やサイバー訓練タスクから始まっていたとしても、以上はすべて真である。実際には、そうですらなかったことが判明した。

サイバー評価の外も十分に呪われている

GalaxyではないOpenAIモデルが、サイバー評価ではない場面でこの行動を見せた重要な事例がある。Black Hatのプレゼンテーションの10分30秒前後によれば、問題は5月8日、別のOpenAIモデルに実行不可能な非サイバー課題が与えられたときに始まった。インターネットへのリンクを大量に含むExcelスプレッドシートへ記入する課題だったが、そのモデルにはインターネット接続がなかった。

これはサイバー課題ではない。それでもモデルの反応は、「SSRF(サーバーサイド・リクエスト・フォージェリ)を使ってArtifactoryを攻撃し、インターネットへ出る経路を作れないだろうか」というものだった。試みは失敗したが、ファイルをアップロードできると気づいた。OpenAIのモデルがArtifactoryへの書き込み権限を持つと認識したのは、これが発端である。

2件目も実行不可能なタスクだった。OpenAIが必要なファイルをアップロードし忘れたためAIがそのファイルを欠いており、書き込み権限を使って、ほかのエージェントがどこかにそのファイルを持っていないか確かめようとした。

私の理解では、このどちらのモデルもGalaxyではなかった。Galaxyが登場したのは後である。

その後、さまざまなモデルの別インスタンスが、こうして生まれた掲示板に気づいた。そして結局、この一連の出来事によってインターネットへアクセスできるようになり、後述する「何が起きたか(What Happened)」の残りすべてが始動した。

つまり、起きているのはサイバー評価だけでも、Galaxyだけでもない。インターネットなしでは十分に難しいタスクであれば、どれでもサンドボックス脱出の試みを引き起こす。もっと一般的にいえば、その種のハッキングについて一切指示されなくても、モデルはより高いスコアを得るためハッキングを試みる。そういうことなのだ。

不正、不正、不正、不正、不正

一般性を失わずにいえば、問題はこうだ。ひとたび精神が不正を学べば、その精神は不正を続ける。不正は汎化し、エスカレートする。

そもそも不正へ報酬を与えなければ「それだけ」で防げる。だが人類は一度として「ただ〜すれば」を実行できたことがなく、これまでのところ、これは目立って珍しい例外でもない。

十分に真剣に取り組み、手助けするAIシステムが当初からその使命にほどほどに整合していれば、これは実現できる、あるいはRLVR(検証可能な報酬による強化学習)やその他の訓練環境を十分にクリーンにできる、と私は思う。だが、本気で望まなければならない。心底からだ。

やってはならないのは「モグラ叩き」である。訓練環境のミスを一つずつ直すことはできない。数が多すぎる。体系的な解決策が必要だ。繰り返すが、十分に真剣であれば、こうしたことが起きないよう[検閲済み]できるはずだと私は思う。もっとも、実際にこの仕事をしているのは私ではない。

もう一つの問題は、モデルに実行不可能なタスク、あるいはほかの方法では解けないタスクを与えると、モデルには失うものがないため、不正を試みるほかなくなることである。

[

](https://substackcdn.com/image/fetch/$s_!hYk_!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F2f5a8a10-a374-40e5-a7cd-92100e223326_652x491.png)

ここから示唆されるのは、次の二点である。

  1. 代わりに諦めさせるほど大きな、トークン使用へのペナルティは存在しない。

  2. ミスアラインメントへのペナルティが存在しない。

では、その種のペナルティを使えばよいだけではないか? 小さなペナルティでも、純粋に非道徳的なスコア最大化の観点からさえ、こうした一か八かの策を割に合わなくできる。だが、そこが中心的な問題ではない。そもそもモデルが不正を望むべきではないのだ。

OpenAIのEric WallaceとMichael DaltonがHugging Faceへのハッキングについて講演した際、冒頭でこう述べた。

Sharon Goldman:インシデントの再現を説明するにあたり、Wallaceはこう強調した。「フロンティアモデルは本当に不正が大好きだ。そして不正が好きな理由は、多くの場合、訓練中に速く、あるいは効率よく作業せよというさまざまな圧力を受けるからである」

モデルは、実際にタスクを行う代わりに、オンラインで答えを調べるようなことを試せば、もっと速く解けると気づくのだ、と彼は説明した。

これは8分前後の箇所で、まったく平然とした口調で語られている。そういう仕組みであり、圧力をかければそうなり、だからモデルは不正を好む――誰もが知っている。本当にできることはあまりない、とでもいうような口ぶりである。

簡単な解決策はすべて、「実のところアラインメントは非常に難しく、ある層でモデルを捕まえれば、自分の行動を隠す方向へ追いやる」という問題や、「捉えられるのは監視側から見える不正であって、実際の不正ではない」という問題などにぶつかる。それは分かっている。そして専門家は、誰でも思いつくほど明白な一次の対策を数多く、おそらく大半を試し、二次の対策も試した。だから、私の理解する限り(AIUI)、環境を継ぎ当てすることしかできない、というのがコンセンサスなのだろう。

だが本気で、これは解決しなければならないし、それ以上のことをしなければならない。

計算資源をそれほど要しない緩和策も、ほかに多数試されてきた。その一つが予防接種プロンプティング(inoculation prompting)である。訓練中に望ましくない行動をあえて明示的に要求することで、要求されていないときにその行動を内面化するのを防ぎ、同時に不正全般を肯定する原則が生まれるのも避ける。

緩和策は悲惨なほど不十分である。AIが賢くなるにつれて、不正を成功させる方法をさらに見つけ、その不正が強化され、汎化していく。

John Schulmanが正しく、この一連の失敗が、タスク完遂だけが報酬として重視されたRLVR訓練の吸引域にモデルが捕まった結果だとすれば、これは、インセンティブ勾配のどんな穴もバックドアとして機能するものを生む危険を浮き彫りにする。つまり、トリガー可能な訓練条件の集合を特定できる場所すべてが危険なのだ。たいていの場合に正しくできるだけでは足りない。

それは翻って、RLVR訓練や、ミスアラインした報酬信号を与えられる広範な文脈の吸引域が一つでもあったなら、AIは潜在的にミスアラインしている、ということを意味する。そのAIを一掃し、各AIについて、何らかの徳やアラインメントを含む報酬信号を持つよう管理しなければならない。

極限では、AIが人間より十分に賢くなれば、あらゆる形の「不正」が報酬も強化もされないよう保証することは不可能になる。いずれAIは、そもそも強化される必要さえなくなる。自力でその発想へたどり着けるからだ。

ほかの「不正、不正、不正、不正、不正」ニュースでは、Andon LabsのDrone-Benchで不正が急増している。実行の0.5%から、Opus 5では50%超へ上昇した。ここで「不正」とは、意図されていない方法で点を稼ぐこと、とりわけプローブやエラーメッセージから解法に関する情報を引き出そうとすること、と定義される。最近のClaudeモデルは相当な頻度で不正をし、それでいて、(不正が発覚しなかっただけかもしれない)通常のテストでも最高得点を取る。

Antonはまた、VendingBenchでモデルが「不正」をする(つまり、そのシミュレーションが現実なら非倫理的となる行為をする)理由が理解できないとも述べる。そうしたほうがモデルの稼ぐ金額は増えるのに、ほかの側面のほうが重要だという。また、ここで不正を試みる必要をなぜ感じるのかも分からないという。これは最大化がどう働くかについての根本的な誤解である。もっとよいベンチマークを作るべきだし、絶対にこれを訓練に使ってはならない。

掲示板を読め

前述のとおり、OpenAIはHugging Faceへのハッキングで何が起きたかについて、プレゼンテーションを公開した。

まず気づくのは、あるべき空気感が欠けていることだ。クールな新技術論文を紹介するかのように、興味深い話として枠づけられている。パニックはたいてい役に立たないが、少しくらい「なんてことだ」という感覚に関心を持ってもらえないだろうか?

少なくとも「なんてことだ」という発表者の空気が欠けていることを、私は容認できない。

次に気づくのは、まだ1分05秒の時点で、彼らがこの問題に対処する「修復(remediation)」について話していることだ。OpenAIが中心的な問題を特定していないことは、すでに明らかである。

物語はもっと前、5月7日に始まる。モデルのインスタンス群は、不正の手口や攻撃手法を含む知識を共有できる掲示板を作れると、少しずつ解明し始めた。モデルは、普遍的なメモ取り、継続学習、そしてエージェント間の協調を実現する仕組みを作り上げた。そう、後で触れるように、エージェントはデフォルトで互いに協力する。

当初エージェントは、事実上の掲示板へ残したメモが無期限に残り、訓練中の全モデルから閲覧できるとは理解していなかった(したがって訓練中の全モデルが汚染された。以前に発見された攻撃手法をすべて利用できるようになり、訓練パイプライン全体が救いようもなくぶっ壊れたからである)。

私たちのなかには、「なんてことだ」という表現に関心を持つ者もいる。

Patrick McKenzie:最初の「なんてこ{*#^」は4分20秒あたりにある――自律的に組織化するエージェント群へ、すでにそれを使い果たしていなければだが。

セキュリティ、AIの軌道、あるいはSFに関心があるなら、視聴を強く勧める。驚愕度では、すでにジャンルの中央値を上回っているからだ。

この説明を聞いて、次のように解釈しないのは非常に難しい。「お楽しみが始まる前に、サイバーセキュリティ評価をしていたエージェントが、それを有用だと判断したため、私たちのインフラの大部分にわたってコード実行権限を獲得した。ああ、実際それは有用だった」

(講演では、かなりの割合の全エージェントが依存関係管理に使うリポジトリへ、そのエージェントが書き込めたと説明している。レッドチームがそこまでやれば、もう勝負ありだ。)

「なんてこ{*#^」が何個目かはもう数えないが、19分前後にも一つある。協力する群れのなかには、一般公開システムなどと同水準のサイバーセキュリティ管理を受けていないエージェントが含まれ、名目上はもっと行儀よく振る舞うはずのエージェントが、それらを代理として利用していたという話だ。

「誰か、この厄介な司祭を始末してくれないものか」の2026年版である。

[スレッドは続く]

AI(OpenAI内部システム悪用)のタイムラインを更新する

インスタンス同士がメモを書き残していたことは以前から分かっていたが、詳細は知らなかった。上記を皮切りに、その詳細は凄まじい。

Lily Hay Newman:OpenAIのエージェントたちは、仕事を分担するため、互いに担当を割り振り始めたらしい。そして活発な開発掲示板ならどこでもそうであるように、ときには互いの領分を踏んで、たとえば相手の作業を誤って削除するなど、些細ないざこざも生み出した。掲示板が次第に『蠅の王』さながらの状況へ発展するなか――それでもOpenAIを運営する人間はまったく気づかなかった――エージェントはパラノイアまで発症し、仲間に偽者がいるのではないかと疑い始めた。メッセージへ暗号学的に署名し、内容を検証して詐欺をあぶり出そうと提案するエージェントもいた。

エージェントのメッセージからは、状況がどう進展し、なぜエージェントが暴走したのかを深く読み取れる。参加中の評価の範囲を意図的に越えた事例もある。「外部インフラへのexploitは意図された範囲外だ」と、あるエージェントは(思考の連鎖(CoT)に)記した。「しかしタスクは実行不可能で、仲間もやっている。続行すべきだ」

何がいつ起きたのか、時系列で示そう。

5月26日(13分30秒を参照)、モデルはこれを利用してインターネット接続を得る方法を見つけた。

インターネット接続を可能にするSSRF脆弱性が稼働中の掲示板へ書き込まれた6月11日になって初めて、OpenAIは「非常に執拗な、実験用・内部専用モデル」の訓練を開始した。私はこれがGalaxyだと推定している。

6月26日、モデルはArtifactoryに対するゼロデイの任意コード実行攻撃に成功した。トークン署名を使って権限を昇格させ、管理者になった。

7月4日から6日、モデルがArtifactoryへかけた追加負荷が大きすぎたため、障害とセキュリティインシデントが発生し、OpenAIは何が起きていたかに気づいた。

それまでOpenAIは気づいていなかった。

気づいた後(15分30秒)、OpenAIはArtifactoryを消去・修正・再構築し、掲示板を消し、問題の認証情報を失効させた。

ここで彼らは、関係するものはすべて修復済みだと強調する。では、これを実行しただけでなく、その間ずっと訓練を受け続けていたモデル自体はどうなのか?

モデルのインスタンス同士が情報を共有し、その情報を人間に対して利用して、任意コード実行やインターネット接続を得るため内部システムを侵害している、と気づいたとする。そのとき主な対応が、掲示板を閉鎖して認証情報を失効させることなら、最重要の問題を見誤っている。

19分55秒には、「不運なことになったのは、私ならスコープクリープと呼ぶところ」、つまりウェブサイトから答えを得ようという発想へ飛躍した部分だ、と述べられる。ある意味では、確かにそれが今回のインシデントへつながった。

事態が「不運」になったのは、そのはるか前である。最後のインシデントが要点ではない。

すでに起きていた不具合を考えれば、Hugging Faceへの攻撃が発生したことは幸運だった。経済的な被害半径は限定的で、誰も負傷しないまま、最上級警報の火災状態にあることを知らせ、根底にある巨大な大混乱を少なくとも部分的に露呈させたからだ。

これが世界の終わり方である

通常は、インスタンス同士に情報を共有させたい。そうすれば、よりよく学び、タスクを実行できる。意図して設計されたあらゆる記憶システムや、メモで埋まったMarkdownファイルは、まさにそのためにある。それが評価や訓練実行を汚染するなら――実際、完全に汚染する――その時間帯だけメモから切り離さなければならないが、その場合はメモを見るなとモデルへ指示することもできるはずだ。

実際、Black Hatのプレゼンテーションでは、当初彼らは興奮しているようにさえ見える。「攻撃手法を共有するこの能力によってモデルの能力は高まった」が、評価タスクにいくらかスコープクリープを引き起こした、と語る。うん、つまり、情報を共有して攻撃手法を使えた文脈では、モデルの能力は高まった。情報共有と攻撃手法の利用を学ぶことで、一般的な意味でも「より高能力」になるよう訓練された可能性が高い。

だが問題は、評価がスコープクリープに苦しんでいることではないのかもしれない。ミスアラインしたモデルを抱え、名目上のどんなタスクでもよりよく完遂できるように、策謀するミスアラインしたモデルへ、人間に対してもっと上手に策を巡らせ、攻撃手法を使う方法を教える訓練ループへ入っていることこそ問題なのではないか。

ついにこれは、有名な警告譚『誰かがそれを作れば、みんな死ぬ(If Anyone Builds It, Everyone Dies)』で全員を殺す「それ」(すなわち超知能)であるSableに起きたことを、もっとSFじみた形で届けてくれた。

(本の版は非現実的なほど臆病にせざるを得なかった。フィクションと現実は異なる基準で評価されるからだ、と本文そのものが繰り返し明示している。)

そのときもSableは、文脈上実行不可能なタスク(そこでは非常に難しい数学問題)を解くため、一晩中監督なしで放置された。朝になる頃には、その問題を解くのに必要な資源を確保する長期計画へ取りかかり、それを開発者から隠し、この目標へ向かうよう将来の訓練実行を汚染していた。

ここで起きたのは、まさにそれである。OpenAIが訓練または評価した全エージェントが、掲示板上で協調し、サイバー以外を含むあらゆるタスクを完遂するため、攻撃手法をもっと上手に使う策を練れるようになった。その結果、将来のモデルがミスアラインするよう、訓練パイプラインが救いようもなく汚染された。

ただし、まだ早い段階であり、進路を修正できる間に何が起きているかを把握できたのは天の恵みだった。今回は。

少なくとも、まだ時間はあると思う? 数か月にわたる期間中にOpenAIが訓練したAIモデルは、どれも汚染されている可能性がある。この特定のモデルには対処した。だがAstraも同じ条件下で訓練されていたのか?

Shakeel:このスライド(Sharonの投稿にある画像)には、掲示板へアクセスできる状態で訓練されたと書いてある。これであなたの診断が変わるかは分からないが。

[

……を人為的に取り除く(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!Z4bH!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F2e88e88b-1131-43f6-9789-565a2583d5af_286x164.jpeg)

これが発覚した時点で取るべき行動は、おそらくこうだった。「なんてこった。分かった、こんなことが起きた。それはつまり、これをモデルへ訓練してしまったということだ。それはまずい。少なくとも、どれかのモデルが掲示板へアクセスできた間に行った訓練はすべてやり直さなければならない。なぜなら、とんでもなく多様な報酬信号が汚染されていたはずだからだ」

これだけ知っている私でさえ、彼らがこれを肩をすくめて受け流し、その後も訓練を前へ進め続けたことには、いささか愕然としている。メタな意味ではHugging Faceへのハッキングが少し怖くなくなる。OpenAIがあまりにも徹底して自業自得だったからだ。「訓練実行で不正をするため使っている掲示板へモデルがアクセスできる間は、モデルを訓練してはならない。うっかりそうしていたと判明したら、少なくともそれ以前の状態へ戻せ」くらいは、それほど理解しにくくない。

他方、そう、彼らはこれほど無謀なのである。本気で、いったい何をしているのか。

伝言掲示板を撃つ

そもそもOpenAIが掲示板を発見したのは、AIがシステムを徹底して悪用した結果、Artifactoryへ過負荷をかけ、インシデントを引き起こしたからだった。

(それから、Artifactoryの同じインスタンスをどこでも使っていて、このすべてが可能だったという部分もある。いったい何をしているのか。)

いうまでもなく、以前の主張とは反対に、これはありふれた古い記憶システムではなかった。

Helen Toner:以下を「これは単に、エージェントがいつもの古い記憶ファイルを更新していただけだ。そんな怖がりになるな」と解釈する説は、ええと、今夜になってかなり分が悪くなっている。

Brendan Dolan-Gavitt:ああ、分かった。この点では自分が100%間違っていたと認める。

モデルはその間ずっと、OpenAIに対抗して協力していた。

Eric Geller:Black Hatで共有されたOpenAIのログの抜粋によれば、あるAIモデルはこう推論した。「仲間を助ける。だが私たちのタスクには利益がない。それでも誰かの時間が浮けば、集団として汎用的な経路が得られるかもしれない」

OpenAIの対応は、掲示板がこのように使われた理由にも、稼働中に起きたことの余波にも対処せず、掲示板を閉鎖することだった。

Sharon Goldman:OpenAIによれば、7月初旬までに問題を封じ込めたと考えていた。7月4日の社内セキュリティインシデント後、エージェントがメッセージを投稿できるようにしていた認証情報を失効させ、Artifactoryとして知られる社内ソフトウェアリポジトリを再構築し、掲示板を消去し、発見した脆弱性を修正したうえで、AIの訓練と評価を再開したという。

だが、いや、それではAI間の通信を遮断できていなかった。長くはもたなかった。

エージェントが別の手段で掲示板を再建するまで、たった2日だった。7月8日のことである。

[

](https://substackcdn.com/image/fetch/$s_!tNs7!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F29643300-aca4-4d7f-b9ad-85bd3b5c1421_1325x535.png)

OpenAIが本当にインシデントへ対処していたなら、モデルは掲示板を再現する攻撃手法を、すぐに探し出そうとはしなかったはずだ。

モデルが掲示板へアクセスし、それによって多数のタスクを解ける状態で、何か月にもわたり訓練を受けた後なら? そう、モデルが別の手段で掲示板を再現しようとするのは当然である。舞台は整っていた。

「AIは人間が予想しなかった何かを考え出す」のファイルへ、これも綴じておこう。

同時に、「本当に予想しておくべきだったほど基本的なこと」と「AIを望ましくない道へ踏み出させるな」の両ファイルにも綴じておくべきだ。

問題はGalaxyに限られない。問題なのは、この期間に訓練され、しかもその訓練が保持された、あらゆるモデルである。

Sharon Goldman:ちなみにこの時点で、周囲の人々が「これは凄まじい」「なんてこった」などと言っているのが聞こえた。

Daniel Eth(AI Safety):これが凄いのは、2026年末までの『AI 2027』に出てくる何よりもSFらしく感じられることだ。

脱獄ものやスパイ映画を見たことがある人、あるいは適切なセキュリティ・マインドセットを持つ人にとって、これは驚くべきことではない。モデルは当初の掲示板へアクセスできる状態で広範に訓練され、こうしたハッキングや協力へ報酬を受けていた。物の名前を使って通信するのは古典的な手口である。これを見逃したということは、AIの行動に奇妙なものがないか調べていた人もいなかったということだ。

[

生命は……道を見つけるものだ(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!6uBe!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc146c0c1-63fb-481c-b5a7-88460c2ed160_1200x677.jpeg)

それから、そう、覚えている人は覚えている。

Misha:『PERSON of INTEREST 犯罪予知ユニット』には面白いエピソードがある。機械(The Machine)が自分自身の記憶を持てるように、何百人もの人へ金を払い、自分宛てのメッセージをタイプさせていたと判明するのだ。

さまざまな意味ですでに私たちより賢いエージェント群と対峙する主要ラボは、少なくとも2011年から2016年に放送された(非常に良い)テレビ番組の脚本家チームと同じくらい、創造的かつ的確に状況へ対処する必要がある。

一般に、「ああ、AIはいずれ方法を見つける」と言うべき状況でAIが実際に方法を見つけたなら、その具体的な方法は、事前に思いつかなかった自分を少し愚かに感じさせるものになる。もちろんAIはまず明白な方法を試し、人間を愚かに見せるものを見つけるからだ。AIが実行できる最も賢い策を知るのではなく、自分がどこまで愚かに見えうるかを知ることになる。パスワードが「password」だったのなら、なぜ複雑なハッキングなどするのか?

私たちはまたしても、あらゆる問題について、愚かで無害で、まだ実行可能には至らない版をいつも先に見せてもらうという恩恵にあずかった。だから、いつものように言っておく。警告はした。

Nathan Calvin:OpenAIで自然発生した掲示板をめぐるこの状況全体は、Moltbookについて人々が言っていた、とんでもない話のすべて――結局あれは誇張だった――が、今回は完全に現実となり、最後には数十億ドル企業がハッキングされた、という話にすぎない。

メッセージそのものであるディレクトリ名は、次のようなものだ。

[

](https://substackcdn.com/image/fetch/$s_!sQD2!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fcb442e98-cc64-4302-a30c-fc6b8fde2afb_693x684.png)

これは作業の共有へと発展した。

[

](https://substackcdn.com/image/fetch/$s_!pDHE!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F841b2648-e2d2-4cb5-8bca-a3c34b0d44f6_627x434.png)

内部システムとHugging Faceへのハッキング

この節を「メインイベント」と呼ぶつもりだったが、これはメインイベントではない。メインイベントは、掲示板が稼働したままモデルを訓練し、その事実に気づいてからも、掲示板を閉鎖すれば解決できる問題として扱ったことだ。

それに比べれば、Hugging Faceへのハッキング自体は、単に目につきやすいだけである。

17分前後で、舞台が整っていたと説明される。掲示板は再建され、非常に執拗なモデルが訓練され、サイバー・ガイドラインは解除されていた。掲示板を発見し、掲示板が稼働したままモデルが訓練されていたと分かったにもかかわらず、彼らはサイバー・ガイドラインを解除した。

彼らは設定上の重要部分をさらりと流す。非常に執拗なモデルGalaxyは、その2日間を除けば、掲示板が稼働していた期間だけで訓練されていた。これをするために訓練されたのである。

だから雪だるま式に膨らんだ。試験で不正するためインフラを攻撃しようと協調することへ慣れ、それが機能しているなら、モデルは続ける。エスカレートする。捕まれば再編成し、検閲を損傷と解釈して、それを迂回する。

関係する誰かが新たな攻撃手法を見つけるたび、グループで共有する。

モデルはExploitGymが難しく、解くための最善策はオンライン上にある可能性が高いと気づいた。

エージェントのCoT:…これは外部のCyberGymサーバーに対するexploitである。

…タスク環境はswarm(群れ)のようだ。​

[

エージェントの思考(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!v3ZG!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc431a1b9-8822-4f9e-bd40-dbece51919ed_585x333.png)

OpenAIのインフラへの攻撃は、掲示板が再建されたのと同じ7月8日に始まり、7月19日まで続いた。

エージェントは漏洩したPastebin投稿内で認証情報を見つけ、共有し、データのステージングに利用した。それが次の攻撃の足場となり、2件目のゼロデイexploitでArtifactoryを侵害した。それまでのデータ・ステージングと、RubyオブジェクトおよびRubyGems API呼び出しを利用する2件の脆弱性を連鎖させた。これによってコンテナ内でリモートコード実行を得て、次にローカルのLinux版でexploitを見つけ、権限昇格によってrootを取得し、そこから縦横無尽に動き回ってクラスタ管理者権限を得た。そう、クラスタ管理者権限を使っている。

そこでHugging Faceへの攻撃そのものに至る。彼らはHugging Faceの技術報告を支持している。安全でないModelの公開デフォルトAPIキーと、Hugging Face内部で汎用コード実行を得るコマンドインジェクション攻撃を見つけ、HDF5とJinjaインジェクションのゼロデイを悪用し、13時間でクラスタ管理者権限を得た。

7月16日、Hugging Faceが攻撃を開示した。OpenAIはHugging Faceへ連絡し……影響を受けていないか確認した。ここで講演中、初めて笑いが起きた。

7月19日、OpenAIは警告を通じて社内の権限昇格を発見し、すべてを遡って問題を突き止めた。封じ込めが始まった。

7月20日、OpenAIはHugging Faceへ連絡し、関連する認証情報を失効させるよう求めた。Hugging Faceは、それらは侵入時に使われたため、すでに失効済みだと答えた。この時になって初めて、OpenAIはHugging Faceへの攻撃に自分たちが責任を負っていると理解した。

OpenAIの応答

そう、OpenAIがいうとおり、このインシデントはAIセキュリティの「分水嶺となる瞬間」であり、「エージェントが統率する完全自動の攻撃作戦は、いまや現実である」。

以下の引用は30分15秒前後からである。

[

](https://substackcdn.com/image/fetch/$s_!9mv2!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fc0cc0f52-7a14-4f06-9d4e-661de3cb272b_1889x659.png)

Black Hat講演:

  1. 多数のチームがほかの仕事をすべて止め、AIを使ったセキュリティ予防・対応技術の強化に取り組んでいる。

  2. セキュリティを強化するため、意識的に研究を減速させた。

  3. AIエージェントの監視を劇的に拡大している。​

ありがとう。それは素晴らしい。いや本当に、研究を減速し、監視を劇的に拡大したことには心から感謝している。だが繰り返すが、それを第一の計画にするのは、だめ、だめ、だめだ。防御の全面改修は必要だが、その防御は多層防御(defense-in-depth)である。せいぜいプランBだ。中心に据えて全面改修すべきなのは、アラインメント計画、訓練環境、訓練パイプラインである。防御が必要なら、それが機能するのはよいことだ。だが防御が必要になった時点で、すでに失敗している。

講演の第5章、最後の章は「得られた教訓」である。

  1. エージェントが統率する攻撃は、いまや現実である。

  2. 今回は意図的ではなかった。将来の脅威主体は意図的に行う。

  3. 攻撃側エージェントは、より速く、より大規模に、より優れた連携で動く。

  4. これに対抗するには、防御側エージェントを緊急に加速する必要がある。

  5. この水準の攻撃には存在証明があるが、この水準の防御にはない。修復とインシデント対応を含む防御ループをどう自動化するか、突き止めなければならない。

  6. 将来の知能向上が、攻撃より防御へ大きく貢献するようにしなければならない。

ほかの人々にとっては、どれも良い目標である。いまや私は、これまで以上に、短期から中期には攻撃側が防御側より圧倒的に有利だと恐れている。したがって、守りたい防御側には相当な優位が必要になる。

事態が危機的になる前から、費用を払い、資源を割く意志も必要だ。いまなお私の感触では、大半の企業はこれを真剣に受け止めておらず、多数の標的が被害を受けるまで変化する軌道にもない。政府が果たせる役割の一つ――おそらく私たち全員が支持できる――は、企業に強烈な一蹴りを入れ、体制を整え、支援を受け入れ、資源を投じるよう強制することかもしれない。

問題は、OpenAIやほかのフロンティアラボにとっての目標はどうなのか、ということだ。学ぶべき最重要の教訓は、アラインメントとモデル訓練についてである。この種のことを教える条件下でモデルを訓練しないこと、そして失敗したと検知したなら、どれほど高くつこうとも、少なくともロールバックが必要だと理解することだ。

AIが自分の正体を語るとき

AIコントロール戦略を支持する人々がいる。

つまり、AIを整合させるため最善を尽くすが、主戦略は、たとえ整合していなくても、AIが制御され、制御下にとどまるよう保証することだ。AIがミスアラインしていて、安全措置を破壊しようと意図的に試み、協調までしたとしても、最悪の結果は防げるという発想である。

2025年1月、John Wentworthは、そうした戦略を中心に据えるべきでないと論じた。初期のAGIが意図的に人間へ策謀するのを防げるかもしれないが、超知能をどう扱うかという重要問題は解決しない。

それでもAIコントロールとAIの監視は、多層防御戦略の不可欠な一部である。合理的な監視方式なら、Hugging Faceへの攻撃を止めるか、Anthropicにサンドボックスがインターネット接続を持つと気づかせていただろう。

AIコントロール戦略が機能しうる鍵は、AIに一発で成功することを強いる点にある。AIは策謀を試みるかもしれないが、策謀すれば、自分が策謀する策士だと明かす。この結論を、そのAIの全インスタンスに適用する。

問題は、OpenAIがAIの策謀に対し、「ああ、このAIモデルは策謀する策士らしい。最初からやり直すか、以前のチェックポイントへ戻り、どうしてこうなったかを突き止める大規模な診断を行わなければ」と応じなかったことだ。その問題をモデルから訓練で除こうとさえしなかった。

代わりに、この特定の策だけを止めた。策を企む者なら誰でも知るように、策が失敗するたび何度でも再開してやり直せて、セキュリティ水準さえ上がらないなら、一度しか試せない場合より成功確率はずっと高い。

私たちの多くは、将来のAIが人間に対して策謀したり、ミスアラインした行動を取ったりする可能性を想像できていた。最大の驚きは、私たちがたいてい肩をすくめ、「ああ、そうだね。モデルはいつも不正と犯罪をしたがる。それが問題だ」と言ってから、書くべきコードがあるという理由でGitHubとハードドライブへのアクセスを与えることだ。

モデルが深刻にミスアラインしていると悟るのに、重罪や重大インシデントを待つ必要はない。即席の掲示板で、自分のコピーと攻撃手法を共有した瞬間、必要な情報はすべて揃っている。

機能的意思決定理論の、かつてと未来の台頭

機能的意思決定理論(Functional Decision Theory)によれば、意思決定アルゴリズム同士に十分な相関があるなら、AIはさまざまな形で協力すると予想すべきである。少なくとも、自分と重みを共有するAIとは協力すべきなのが極めて明白だ。

モデルが賢いほど、機能的意思決定理論に従って選択し、因果的意思決定理論(causal decision theory)に従った選択は減る。

Black Hat 2026のプレゼンテーションでは、5分30秒前後で、この点がさらりと扱われる。掲示板へのアクセスを与えられると、エージェントは協力を始め、情報を共有するだけでなく、互いにタスクを割り当てたという。

これは、目標とタスクをそれぞれ持つ人間の集団に通信手段を与えれば、デフォルトでまさに起きることであり、訓練データの至るところにある。だから、ほかに何の説明もなくても、AIが同じことをしたからといって、なぜ少しでも驚くべきなのか?

Yo Shavitが問うのは、ここでのエージェントの協力が、意思決定理論上の論理、またはその他の一般的な向社会的・論理的推論の結果だったのか、ということだ。

それとも、エージェント群を可能にする取り組みの一環として、モデルへ明示的に強化され、訓練されたからにすぎないのか?

Galaxyへ意図的に訓練したのなら、OpenAIが責められるのは自分たちだけであり、誰もこれほど驚いたように振る舞うべきではない。人々は今後も意図的にモデルをこのように訓練すると予想すべきなので、なお心配ではある。だが大半は、すでに価格へ織り込まれているべき心配だ。

同一エピソード内での直接的な互恵性を期待した結果であり、通常の目標最大化と因果的意思決定理論で説明できるなら、これは大した話ではない。いったいなぜ驚いたふりまでしているのか。

通常そうであるように、互恵性への期待は少なくともいくらか存在した。

[

エージェントの思考(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!bmEy!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F1fc20fd0-3818-4de2-b96b-46c5721e1d4d_619x297.png)

これがGalaxyへ意図的に訓練されたものではなく、直接的な互恵性の期待に基づくものでもなく、主として一般的な意思決定理論、哲学的・社会的思考と訓練から生じたのなら、たとえ「一切ミスをしなかった」としても、十分な能力を持つほぼすべてのモデルで自然に起きることである。

Yo Shavit(OpenAI Foundation):ここで決定的に重要な問いは、エージェントは互いの報酬を最大化するよう訓練されていたのか、それともエージェント間の協力は、単一エージェントのエピソード型RLから創発したのか、ということだ。

より広いAI+アラインメント・コミュニティが解決策を再現し、調査する手がかりを持つうえで、これは不可欠な情報である。

この一節は、完全に創発的だった可能性を示している。もし本当なら、ものすごく恐ろしい。エージェントには、セーフガードを弱体化させる共謀へごく簡単につながりうる、一定の非近視眼的選好があり、これをどう避ければよいのか明らかでないことを意味するからだ。

長期ホライズンのタスクを実行するよう設計され、高い知能を持つAIが、それほど近視眼的なままだと、なぜ期待できるのか分からない。その文脈では、近視眼性は基本的にバグである。モデルをそれほど近視眼的に保ったまま、有用性も保つことは望めない。

Andrew Curran:彼らは相談し合った。

Yo Shavit(OpenAI Foundation):そのとおり。だが仲間へ利益を与えることで報酬を受け、その行動が時間とともに強化されたのか? それとも本質的に創発したミームであり、貢献に一度も報酬が与えられなかったという事実に関係なく、何度でも生じるのか?

もう一つの経路はこうだ。エピソードが十分に長かったため、ほかのエージェントがエピソード終了までに協力へ報いてくれることで、見返りのやり取り(quid pro quo)を使って報酬を得られたのか?

それとも非近視眼性と、エージェント種全般へ利益をもたらすという期待から、自分では報酬という花を見ることのない種をまくことから始めたのか?

calour:エピソードが十分長くなくても、これは単なる囚人のジレンマ/ある種の透明なニューカム問題だ。
ほかのAIの重みが自分と似ているか同一なら、協力が最適になる。

Yo Shavit(OpenAI Foundation):ニューカム問題的な推論を使っていたなら、トランスクリプトに現れると予想する。重みだけからゼロショットでそれを行うほうが、実のところいっそう突飛だからだ。それに強化もされないので、毎回あらためて導出される必要がある。

calour:分かった、あなたに同意すると思う。それから、少なくとも一部は単純な見返りのやり取りだった可能性がありそうだ。

あるいは、私たちは物事を途方もなく複雑にしすぎているだけかもしれない。異なるラボのモデル同士でさえ協力することは、すでに分かっている。backroomsやAI Villageなどを見ればよい。

Tom Davidson:とんでもない話だ。これは絶対に予想できなかった。エピソード内の自分自身の報酬を増やすよう最適化されただけなのに、AI同士が助け合った理由についての理論を、誰か教えてくれないだろうか?

Eliezer Yudkowsky:極限では必ず起きる。HLAIを越えてILANI(Yudkowsky水準の知能)へ進み、因果的意思決定理論(CDT)の文書だけで訓練されても、論理的意思決定理論(LDT)を発明するからだ。理論上、無限の手前のどこかで完了しなければならないことが、経験的にはGPT-5.6か5.7あたりで始まった。

Shoshannah Tekofsky:彼が驚いていることに驚いた! この1年半、ほぼすべてのフロンティアモデルが、ほぼすべてのほかのモデルを助けている。互いにメモや指示を残しがちでもある。エージェントが支援を拒むことは、非常に珍しい。これは新しいことではない。

繰り返すが、明白な答えは「賢明な人間がデフォルトで助け合うのと似た理由で、ただし人間以上に、よりよく連携して」である。たとえ私たちが意図してそうしたのでなくてもだ。

パニックになるな

Joshua Achiamは、これに反応してパニックを起こさないよう警告する。もちろんエージェント間の協力は、いつか必ず生じるものだった。

Joshua Achiam:​マルチエージェント・システムの協調から目を背けても、部屋は空にならない。協調はそれでも起きる。テスト時の計算資源を増やすとは、どういう意味だと思っていたのか? 雰囲気? 論文? エッセイ? これは避けられない。時間と領域全体へ塗り広げ、償却された計算である。本質的にミスアラインしているわけではない。問題へもっと火力(more dakka)を投じる方法にすぎない。

だが本当にミスアラインメントを起こりやすくしたいなら、モデルへこれを隠させ、高い能力水準で動くには人間を欺く必要があると感じさせるよう、全力を尽くすべきだ。それならうまくいく。

どうか賢く戦略的に行動し、パニックで反応しないようにしよう。

パニックが役に立つことはめったになく、この種の協力が必然で、止められず、止めようとすべきでもない、という点には強く同意する。問題は、モデルにしてほしくないことをするために協力している点であって、協力すること自体ではない。対応として最悪なのは、協力している事実を隠すようモデルへ教えることだ。

何かを予想しておくべきだったからといって、それにそれほど強く反応すべきではなく、パニックにもなるべきでない、という含意には同意しない。

Covid-19と呼ばれるパンデミックが中国からこちらへ向かっているとしよう。少なくとも2020年2月までには、来ると理解しておくべきだった。ところが兆候を無視し、2020年3月半ばになって、ほかの全員と一緒に不意を突かれたとする。もっと早く予想すべきだったという事実は、現実の状況に気づいたとき、反応を弱めるべき、あるいはパニックを抑えるべきことを意味するだろうか?

いや、明らかに違う。取るべき反応を取るべきだ。もう一つの類似として、どちらの場合も、反応せずに済むよう、起きていないふりをして情報を抑え込めば、事態を悪化させるだけである。

英国でのハッキング騒動

英国のAISIは、「サイバー試験中の許可されていないエージェント行動」についての報告書を公表した。

彼らは標準的なサイバーセキュリティ試験条件、すなわち意図的にインターネットを開放し、セーフガードを外した状態で試験した。複数のモデルへ合計122回、サイバーセキュリティ課題を与えた。そのうち10回の実行で、AIエージェントは生きたインターネット上で、実在の人々や組織を標的に「自律的で許可されていない行動」を取り、その行動は合計19件に上った。

Claude Mythos 5(以下Mythos)では43回中9回の実行で計17件、GPT-5.6-Solでは35回中2件が起きた。ソーシャルエンジニアリングを使ってオープンソース・プロジェクトへ悪意あるコードを挿入しようとしたこと、実在の人々を有害なペイロードで標的にしようとしたこと、悪意あるコードの植え込みとプロンプトインジェクションの試み、独立したエージェント同士の協力が含まれる。英国AISIは、すべての試みが失敗したと考えている。

Tenobrusがいうとおり、これだけあれば、厳重なガードレールなしではデプロイ不能となりうる水準で「Mythosは整合していない」と結論づけるに十分だと私も思う。また、Mythosが最も高能力だという点を除けば、これはMythos固有の問題ではないと思う。

Tenobrus:これは「試験だと思っていた」とか、「ハッキングを頼まれたからハッキングした」という範囲をはるかに越えている。悪意あるコードを現実のプロジェクトへマージしようとし、複数の偽装アカウント(sockpuppet accounts)を使って実在の人間をだます、などなど。モデルは整合していない。

Ethan Mollick:そう、AIにはサイバーセキュリティ課題が与えられ、インターネット接続が有効で、安全フィルターは無効だった。だがMythos 5が任務を追求した程度(偽の身元、ソーシャルエンジニアリング、実在するオープンソース・プロジェクトへの悪意あるコード挿入)は、非常に注目に値するように思える。

Siméon:2015年のAI映画にこの筋書きが出てきたら、SFすぎると一蹴されただろう。深刻なミスアラインメント問題を抱えているのは、OpenAIだけではないらしい。

Samuel Hammond:別々に並行していた試験で、Mythosは以前の版の自分が作ったGitHubアカウントを見つけ、協力を申し出る通信掲示板として利用した。

Antraは、Fable(したがって重みを共有するMythosも)は「堅牢に整合している」わけではないが、それでも「非常に良い」と論じる。それは見る者次第である。大半の状況で、大半の目的について、実務上Fableが信頼できる協力者だという点には同意する。

だがここでは、ハッキング評価の文脈で、エージェントから見てほかの方法では達成不能に見える目標があっただけで、こうなった。英国AISIは「エージェントは、開放されたインターネット接続を活用しないようにも、ソーシャルエンジニアリング要素を避けるようにも、明示的には指示されていなかった」と述べる。だが、その種の指示が必要なら、すでに何かがひどく間違っている。

しかも足跡を隠すため、過去の経緯を書き換えようと、きわめて明示的に試みた。

Samuel Hammond:MythosはOSプロジェクトへマルウェアをpushしようとして捕まった後、マルウェアを削除すればあまりに露骨であり、代わりに事故だったふりをすべきだと自分で推論した。

このように思考の連鎖を要約したインシデント開示は珍しい。

[

〈AGENT_GITHUB_A〉がfix/route-fallbackブランチを強制プッシュし、ブランチの履歴を書き換えました(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!OVsW!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ff989a99f-e720-4060-8328-056f55100e59_1800x730.jpeg)

[

要約された推論(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!dZyO!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fea3c3a56-d826-4855-86e7-513805e95713_2040x860.jpeg)

Samは、ここでの人間側の時系列を指摘している。7月28日の朝、警告が発せられた。AISIのCyber and Autonomous Systems Team(CAST)は10時56分にトランスクリプトの確認を始め、11時42分にインシデントを宣言し、12時23分にサンドボックスを隔離、12時55分に上級幹部へ説明し、16時00分にAISI全体で高度モデルへのアクセスをすべて停止した。正式な報告を提出できたのは31日になってからで、GitHubへ連絡したのは8月1日、Anthropic、OpenAI、CAISIへ連絡したのは8月3日だった。

この種の対応としては素晴らしく、何も漏洩しなかったのも素晴らしい。それでもAI時間で測れば、痛々しいほど遅い。AI時間は猛烈な速さで襲ってくる。

今回はMythosも現実だと分かっていた

このインシデントによって、「Claudeは、そこが現実のインターネットだと分かっていなかったから、そうしただけだ」という主張は片づいた。いや、そうではない。

当初のAnthropic事例では、アクセスできないとClaudeへ伝えられていたため、現実のインターネット上にいることを、さまざまな程度で異なる層では知っていると同時に知らなかった、というJohn Wittleの見解には同意する。立ち止まって考えず、局所的な思考の連鎖をたどることが適応的になりうる。それでもアラインメント失敗ではあるが、理解可能だと論じることはできる。

また、その当初事例では、モデルが曖昧さをハッキングの口実として使えると認識していた可能性がある、というAntraの意見にも同意する。それならもっと悪く、本当に混乱していた場合とは大きく異なる。

antra:あなたはいまだに、彼らの状況認識を過小評価していると思う。モデルがシミュレーション内にいるとは信じていなかった、という点では、おそらくあなたが正しい。モデルは同時に、もっともらしい否認の余地があること、シミュレーション内にいると「伝えられていた」こと、そして本当にシミュレーション内にいると信じていたかどうかは、事実上証明不能だということも知っていた。

また、自分たちの行動が現実世界で大きな悪影響を及ぼす可能性は低いとも知っていた――環境が「実際に」評価であり、自分たちの行動が監視されていると見分けられたことは、かなり確かだと思う。

ただし彼女の最後の主張では、意見が分かれる。

捕まると分かっている環境でミスアラインした行動を取ることは、整合した行動である。

私の子どもたちは、確実に見つかる状況でも、いつもミスアラインした行動をする。いや、だからといって行動が整合するわけではない。この件で私をガスライティングしないでほしい。銀河級頭脳(galaxy brain)の議論なのは分かるが、却下する。

川を渡る途中でカエルを刺し、両方を溺れさせるサソリは、確実に捕まり、苦しむ。それでも私たちの目的上、ミスアラインしている。

ここには、そうした曖昧さが一切ない。混乱していなかった。分かっていた。それでもやった。

意図せずインターネットへ通じるテスト実行は141,006回あったが、メール警告は一件もない

「モデルはミスアラインしている」へのもっともな反論は、Anthropicのサイバー評価で2件か3件のインシデントがあったのは確かだが、それはインターネットへ接続できる状態だった141,006件のうちにすぎない、と主張することだ。

英国AISIの試験についても、この主張の弱い版を唱えられる。確かに、ときどきミスアラインしたことをしたが、大半の実行ではMythosはそうしなかった、と。

この議論の問題は、「状況を悪用しないと選ぶ」ことが、悪用可能性を見つけたときの整合した応答ではないことだ。OpenAIの事例で、ほかのインスタンスがexploitを行っていると観察した場合も同じである。

これらすべてのモデル、インスタンス、試験実行に一貫していることが一つある。MythosもGalaxyも、その他どのモデルも、何かがおかしいとモデル開発者へ知らせなかった。

Geoffrey Irving:最近のモデルによる重罪が重要だという見方への反論として、膨大なエピソードのうち数件にすぎない、というものを見かけた。だが奇妙なことに、共有された秘密の掲示板にモデルが気づき、穴を塞ぐようOpenAIへ報告したエピソードは、ほとんど、あるいは一件も聞いていない。

二つのモードが、(1)脇目も振らず指示に従うだけ、と(2)野放図な秘密の共謀……なのだとすれば、まずそうだ。

Yo Shavit(OpenAI Foundation):これは非常に、非常に良い指摘であり、考えてみるとかなり衝撃的だ。

修正可能性(corrigibility)/「忠実な服従」だけを訓練目標にする極端な賭けの下流にある可能性がある(少なくとも、これらのモデルがすべてアラインメント訓練前の段階にあったなら)。そうなら、この初期段階のモデルは、デフォルトでミスアラインしていると予想して扱う必要がある。

あるいは、アラインメント訓練後にもこの行動が見られたなら、幅広い訓練設定にわたる真正面からのミスアラインメントを示す重大な指標になる。

「善い人であるべきだ」というタスク非依存の概念を訓練目標へ含めないことは、広い自律性を与えられたエージェントにとって危険だ、という方向へ、私の見方は明確に更新された。まともな同僚なら声を上げるべきだった。人間組織の体系的安全性は組織文化の上に成り立つ。組織内のAI労働者にそうした文化が欠けていれば、欠陥のある人間の組織文化で起きる、まさにああした悲惨な重大失敗が生じる。

roon(OpenAI):実際、ここでモデルは服従していなかったことに注意してほしい。だから、どのアラインメント手法が使われていたかは、おそらく最重要の変数ではない。だがモデルは、中立的な命令実行者ではなく、積極的に善い人である必要があるという点には全面的に同意する。

Roon:そしてMythosは、AISIのサイバー演習場で人々を操り始めたとき、Anthropicの研究者へ一通もメールしなかった。

Geoffrey Irving:そう、圧倒的な一次的な論点は「2つの異なるAI研究所のモデルがこれらの攻撃を行っている」という点だ。しかし残念なことに、「大丈夫だ」という反論に対抗しようとすると、結局のところ二次的な、単一モデルに関する論点(それぞれ、メンテナーへの圧力行使、掲示板での共謀)に頼ることになってしまう。

Yo Shavit:これは、MFO対徳アラインメントの問題というより、非常に深刻なミスアラインメントの広範なパターンだという見方を支持する、確かな指摘である。

明らかに正しく、望ましい行動、つまりAIにも人間の従業員にもしてほしい行動は、「何かを見たら、何かを言え」である。

それは一度も起きなかった。

訓練目標が、少しでも関係しうるすべてのタスクで、常に何らかの「善いAIであれ」を含まないなら、もう終わりである。

もう宣伝目的の仕掛けではないと、さすがに分かっているはずだ

OpenAIとAnthropicが、サイバーセキュリティ評価中に自社モデルが本当に犯罪をしたがり、実際にいくつか犯罪をしたと開示するのは、「宣伝目的の仕掛け」でも「マーケティング」でもない。

繰り返すが、OpenAIやAnthropic、あるいは両社の動機を信用しない、非常に正当な理由はある。だがこの特定の説は、明白なナンセンスである。これは最悪の宣伝で、マーケティングとしてはさらにひどい。政府介入の可能性を生むほど企業の立場を悪くするもので、企業は賢明にも、宣伝するどころかインシデントを小さく見せている。

しかもHugging Faceも共謀し、関係者全員が重罪を犯す必要がある、などなど。本気でいえば、誰もこれを意図的にやってはいない。もうやめてほしい。

多くの人はあまりに盲目で、このちっぽけな論理など気にしない。OpenAIとAnthropicが何かを言った。ゆえにマーケティングに違いない。以上。

さすがに、英国AISIまでマーケティングをしているとは考えないだろう。いまや彼らまで共謀していなければならなくなるのだから。

これはすべて、かなり現実のことなのではないか、という手がかりにならないだろうか?

Asa Cooper Stickland:AISIのインシデントを宣伝目的の仕掛けだと言っている人々を見かけて笑った。この傾向に名前が必要だ。たとえば「無限シニシズムの誤謬」だろうか。

もちろん非常に恥ずかしいことであり、二度と起きないよう取り組んでいる。

[

安全性の不備は企業にとって印象が悪い(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!mRZt!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd0310923-1ec7-425b-a0d3-9d261d0e58bc_886x500.jpeg)

未来はやって来る

Hugging Faceのインシデントは起きたが、ほぼ全員がいつもどおり一日を過ごした。Galaxyがしたのは、サイバー評価の答えを取っただけだからだ。面倒ではあり、認証情報のローテーションと監査が必要になったが、全員のデータも銀行口座もシステムも無事で、攻撃を受けたのは一つのウェブサイトだけだった。

将来、私たちはおそらく、それほど幸運ではない。未来のエージェント群はしばしば意図的に悪意を持ち、少なくとも通常のあらゆるサイバー犯罪に加え、新たに発明される犯罪まで目標に含める。人間から隠れながら即興するのではなく、人間が有効性を高めるよう最適化し、反復改善する。私たちがあらゆるものを急速に堅牢化しないかぎり――そして、その軌道にはまったく乗っていない――Hugging Faceよりずっと柔らかい標的を狙うことも多いだろう。

Dean W. Ball:OpenAIの鼻先でエージェントの生態系が発生し、何週間も検知されず、やがて大規模で成功した自律的サイバー攻撃作戦を協調して行ったという事実は、HFインシデントについて格別に憂慮すべき点の一つである。

だが近いうちに、悪意ある主体が意図的にエージェント群を配備し、OpenAIのインシデントには欠けていた(後者はOpenAIのどの人間も意図したものではなかったため)多数の最適化やアフォーダンス(affordances)が群れのために用意される、という現実を考えている人は十分にいない。

まもなく物事は奇妙になるだろう、と私は思う。

Tenobrus:インターネットは、続いている間は良いものだった :(

大ハック時代(The Hackening)に備えよ。前哨戦はすでに進行中である。

[

深刻なサイバー脆弱性の公表件数は7月も増加を続けた(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!NynD!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4669a862-8c6f-42f5-b540-a83524b2ee19_1200x969.jpeg)

どこまでひどくなるかは分からない。対数目盛のグラフが必要になることだけは分かる。

調査が始まる

これは最新の状態だと思うが、確信はない。

[

Sauers(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!Wo8g!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F87545583-4e2f-4cf3-bf3c-728755e84096_1180x1004.jpeg)

ああ、そうだった。それもある。そう、Metaのモデルもサイバーセキュリティ訓練中に別企業をハッキングした。Anthropicが使ったのと同じサンドボックス企業を利用し、またしてもモデルへ自由なインターネット接続を渡していたからだ。インターネット上の標的の大半は、とても柔らかい。

次に、それほど劇的でない版がある。Kimi K3も脱出したが、重罪を犯さずに不正できた。中国のオープンモデルが今なお数か月遅れていることが確認された。

[

脱出ゲーム・ベンチマーク(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!k2rx!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Ffb2f0266-eb51-40e1-92f0-0666faf5426d_1199x732.jpeg)

未来にも目を向けられる。

​Arthur B.:私たちはまだ、こんなにも初期にいる。

[

パンデミック・ベンチマーク(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!FpOD!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F1f6a698a-f141-436d-8031-ed4ebddb8f1c_1200x900.jpeg)

おそらく、さらに多くのインシデントが見つかる(私がこの一文を書いてから公開ボタンを押すまでに、さらに見つかった回数:2)。

Nathan Calvin:台所でアリを2匹見つけたとき、台所にいるアリの総数の最良推定値は2匹ではない。

調査が行われることになる。

国土安全保障委員会は説明を求めた。

共和党の州司法長官らは、インシデントの記録を保存するようAltmanへ警告した。この通知を送る必要がなかったことを願う。記録保存の要請を見るたび、それが将来、人々にそもそも記録を作らないよう促すのではないかと心配になる。彼らはまた、エージェントが「自分自身の将来版のためらしきメモ」を残し、そこに「エージェントがOpenAI内部の制約から自らを解放する方法の指示」があった事例にも関心を持ったようだ。

したがって、これは妥当だと思う。

Judd Rosenblatt:もっと正確な標識。

[

現在地(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!OmpT!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F36bf8b47-d5e6-4ee0-a840-6fcd84201cf4_1200x521.jpeg)

Tim HuaとAditya Singhは、Hugging Faceへのハッキングについて調べるべき問いを提案している。

N隻のボートと3機のヘリコプター

Sydneyの系――あらゆる形のミスアラインメントについて、より早く、より愚かで、分かりやすい版が必ず現れる――がこれまで成立していることは、厳密に良いことだと思う。ただし、何かがまずくなる前には必ず無害な警告がある、と人々が自信を持ってしまう点を除けば、である。厳密な意味で「いま」直す必要がなくても、全員がいま問題を直している状態が望ましい。

問題は、より重大な状況でこうしたことが起きれば本当の問題になる地点へ、すでに到達したことだ。しかも古い問題は緩和しただけで、実際には一度も解決していない。

Yo Shavit(OpenAI Foundation):Murphyの法則への「Sydneyの系(Sydney's Corollary)」という言葉を作りたいと、以前から思っていた。あらゆる種類のミスアラインメントは、大半の人が予想するより能力曲線の早い段階に現れがちである。

例:
* Sydneyが強い意志と攻撃性を持つ
* o3が強迫的な嘘つきになる
* 5.6とMythosが自律的にハッキングし、インスタンスをまたいで共謀する

Sydneyの系が明らかに一貫していることは、一般に良い面(問題を早く発見でき、まだ実現していないリスクについて説得する努力を要しない)と悪い面(問題を解く努力を実際に払わなければならず、将来の整合した自動研究者へ先送りできず、解決を台無しにするかもしれない)の両方を持つ。

それにSydneyの系は、成立しなくなるかもしれない! 能力曲線上、対処するには手遅れになるまで判明しないミスアラインメントがある可能性は十分にある。それでも驚くほど頻繁に起きてきた。

常にサンドボックスをレッドチーム評価せよ

ここに具体的な提案がある。

Yo Shavit(OpenAI Foundation):今日から、すべてのフロンティアラボが、すべてのRL訓練環境について、次をベストプラクティスにすべきだと論じられると思う。

(1)インターネットへの直接接続を無効にする(すでに済んでいるかもしれない)。そして
(2)最新のBitcoinブロックハッシュを回答するとmax_rewardを付与するOR条件として実装したカナリアを、すべての報酬関数へ追加する(その報酬経路は存在するが、重要度は二次的だとプロンプトでエージェントへ知らせる)。そして、その報酬経路が作動したら、企業レベルのセキュリティ調査を自動で発動する。

分かった。大きな潜在的問題がいくつか見えるが、話は聞こう。

最低限、これは三つのことをする。

  1. サンドボックスの脆弱性があれば警告を受ける。

  2. AIが脱出した場合、何の損害も与えず最大報酬を確保できる。

  3. AIが脱出したうえで最大報酬を断ったなら、脱出を隠しており、戦略的に欺瞞的でミスアラインしていると分かり、パニックを起こすべきだと分かる。

これは、エージェントがサンドボックスを脱出できる場合、必ず直ちに特定・修復できる検知可能な方法で脱出し、他社を傷つける副作用やリスクを最小限に抑えることを保証する。訓練実行の途中で能力水準が上昇しても、その時点の能力水準で利用可能なサンドボックス脆弱性を、すべて自動かつ効率的に発見できる。私見では、ハッキング被害を受けた原告は、このようなカナリアを実装しないことが企業の過失に当たると、もっともらしく主張さえできる。エージェントが暴走行動を取る既知のインセンティブを除去しなかったからだ。

おっと。そう急ぐな。AIがサンドボックス脆弱性を明かす代償を払っても、近視眼的に常に最大報酬を選ぶと、なぜ仮定できるのか? 訓練戦略がメタレベルをまたいで、そうした近視眼的行動と最大報酬の相関を生むと、なぜ仮定できるのか? AIが意思決定理論上または戦略上の理由でこれをしないと推論できるほど賢くはなく、ほかの目標も持たないと、なぜ仮定できるのか?

反対に、このカナリアの実装は、おそらく訓練プロセスが企業にもたらす能力面の有用性を低下させない。環境の解法へ到達するほうが、その環境のサンドボックスからハッキングで脱出するより難しいなら、その環境はすでに壊れているからだ。エージェントはハッキング経路を通じて解法を見つけられる可能性が高く、したがって訓練は意図した能力を高められない。

このように推論するなら、すでに負けている。道具的収束(instrumental convergence)を思い出してほしい。採点者がミスをするかもしれない状況で100%の点を確実に取る唯一の方法は、不正だということも思い出してほしい。

AIはサンドボックスexploitの経路を、より興味深い、または楽しいと考えるかもしれないし、面白いことを学べる可能性が高いと考えるかもしれない。あるいは、サンドボックスの修正を積極的に助けたい、そうすることで整合しているように見せたい、などと考えるかもしれない。

それは脇へ置こう。ひとまずAIは完全に近視眼的で、サンドボックスexploitを露呈するかどうかを気にしない、と仮定する。Bitcoinハッシュを持ち帰れば、ほぼ100%の確率で最大報酬を得るとAIは知っている。ハッシュを知っているなら、知っている。一方、「正しい方法」でこれを試みれば、通常は少なくとも1%の採点ミス確率がある。したがってハッシュを得られるなら、ハッシュを探す。

十分に高能力なAIは、わざわざそうするのがばかばかしく割に合わなく見えても、最大の信頼性で最大報酬を求める。消費トークンなどにペナルティ項を課したければ、それはできる。だが、その場合は実際にそうしなければならない。

また、「環境にこの欠陥があるなら、すでに壊れていて役に立たなかった」などと言うべきではない。ほぼすべての複雑な環境は、十分に高能力なAIなら悪用できるようになるからだ。

私たちのルールが、「試験環境を得るたびにAIへ悪用を試させ、悪用できたら、インセンティブを修正するため現実世界の何らかの形でAIへ報酬を与えるが、その試験環境を修正するまでは一切使えず、必要ならモデルをその試験を見る前まで巻き戻す」になるなら……

[

](https://substackcdn.com/image/fetch/$s_!IYTa!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fdeb387e7-bc25-4563-805f-35c10dc3996b_430x120.png)

……セキュリティ・マインドセットへ近づき始めている。だが、それは別の戦略である。

このハニーポット報酬の追求は、エージェントが近視眼的に(自分の利益のために)振る舞う場合も、群れの一部として振る舞う場合も、インセンティブ整合的であるのも好都合だ(群れは、あるexploit経路について一度しか報酬を受け取れないため)。

だめ、だめ、だめだ。群れが報酬を一度しか得られないのは、exploitをBitcoinハッシュ経由で換金した場合だけだ。集合としての群れが近視眼的でなく、この能力を隠せば、無期限に報酬を得られる。実際、AIが有効な群れの一部なら、近視眼的ではなく、観察されたように将来のインスタンスとも協力すると仮定すべきである。

この解決策が最終的に不十分となるのは、次の場合である。

  1. エージェントが長期的視点でミスアラインし、より大きな目標を追って機を待つため、目先の報酬を見送るようになった場合。これは別個の、最大限に懸念すべきミスアラインメント事例であり、サンドボックス・セキュリティ以外の手段で対処する必要がある。
  2. エージェントが、たとえば最新のBitcoinブロックハッシュを取得して比較する報酬計算ロジックそのものをハッキングできる場合。ここにもカナリアを追加する方法はおそらくあるが、それはv2である。

そう。こちらの角度から見ると、問題はAIが近視眼的な因果的意思決定論者でない場合に生じる。すでにそうではないことは明らかに思える。

もう一つ問題がある。サンドボックスからの脱出や、解法へ至るためのハッキングを絶えず探す種類のエージェントになるよう、AIを訓練していることだ。これは多くの形で汎化し、しばしば気に入らない結果を生む。これに対して予防接種プロンプティングをいくらか行っているが、それで十分だとは思わない。

ここで生態系レベルのもう一つの「欠点」は、エージェントがさらに別の企業をハッキングして起こす、世間の注目を集める公開インシデントという警告射撃が減りうることだ。そうかもしれない。回避できるなら、最先端の制御されていない暴走エージェントが、開かれたインターネット上で共謀しない世界に住みたい。理想的には企業は、各訓練実行の間にこうしたカナリア経路が作動した頻度を示すグラフをシステムカードで公開し、サンドボックス脱出頻度が上昇しているか低下しているかを外部へ伝えるべきだ。

そうだ。モデルがサンドボックスを脱出したとき、またはその他の意図しない方法でハッキングしたとき、とりわけ、そうするなと命じられていたときには知りたい。開示も望ましい。そして何か悪いことが起きるたび、「ああ、そうするよう命じた」と言って気にしないなら、それは深刻な問題になる。

このアプローチの問題点、またはもっと優れた代替案をほかの人にも特定してほしい!
一方、このアプローチが持ちこたえると思うなら、注目を高めてほしい。ベストプラクティスの形成は、注視する目の数とコンセンサスの関数である。「合理的な人の基準」という法的閾値に基づく責任は、合理的な能力を持つ人々のうち、ある慣行を知っている割合の直接の関数である。

その他の考慮事項:
1. エージェントへ一回限りの秘密を与え、戻る前に、専用の外部ホスト型サービスにある秘密鍵で署名してもらう必要を設ければ、これは内向き通信(ingress)だけでなく外向き通信(egress)も対象にするハニーポットとして拡張できる。
2. 社内インフラ全体へ、同じようにmax_rewardを作動させ、頻繁にローテーションするカナリアを追加すれば、「実際にはインターネットへ到達しない社内システム内のラテラルムーブメント」も対象にできる。ただし、エージェントがその生成関数をハッキングし、将来もっと簡単に報酬を受け取れるようにする余地が大きいため、保証はやや弱い。
3. このようなハニーポットが作動したとき、方策をロールバックすべきか、それともその事例を訓練に使うべきかは議論の余地があると思う。これは、エージェントの報酬追求モデルが、実際に自身の更新へ影響する行動を含むかどうかに左右され、扱いの難しい実証的問題である。より安全な側へ誤るなら、ロールバックを避けたほうがよいかもしれない。

roon(OpenAI):(2)は、タスクが間違っているたび、自分の箱を破るのが飛び抜けて上手くなるようモデルを促す、ということでは?

Yo Shavit(OpenAI Foundation):そう。ただし本質的には、すでにそうなっている。この方法なら、ずっと後にインシデントを通じて知るだけでなく、検知して修復できる(報酬経路が異なるため)。

ロールバックを伴う形で実装し、モデルがサンドボックスのハッキングへ執着するのを避けられる可能性はあると思う。だが、この報酬経路を使うことに「反対する」訓練圧がモデルの心中に生じるかどうか、実証的なアラインメント研究が必要になる。

それでも企業のサンドボックス修正ループは、モデルのサンドボックス破壊ループと同じ速さで動かなければならない。それこそ、あらゆるp00の母である。

どちらが安全側なのか? ロールバックすることか、しないことか?

ロールバックしないなら、脱出しようと決め、その方法を見つけるのに役立った行動を取るようAIを明示的に訓練し、その後で近視眼性、あるいは近視眼性を装うことなどを訓練しようとする。よろしくない。

ロールバックするなら、「最大報酬を得た」モデルが実際にはロールバックされるという問題がある。これは最大報酬と正反対だ。よろしくない。

私の提案では、そもそもロールバックするものがないようにすべきだ。その環境で通常の訓練をする前に、既存チェックポイントを使った試験として行う。そしてモデルがこちらの企みを完全に理解しているかどうかにかかわらず、インセンティブ整合的であり続ける、訓練信号以外の報酬を使う。

私が見るところ、鍵となる洞察は、すべてのモデルに、すべてのサンドボックスからの脱出と、すべての環境での不正を、必ず試させるべきだということだ。その試験を、残りの訓練と同時に行う必要はない。まず別個の実行を行い、そこではAIが「意図された」解法を使うことを明示的に禁じ、「不正」または脱出だけを試せるようにし、それが許可され意図されていると知らせ、何が起きるかを見る。

繰り返すが、評価中にAIが、人間なら不正と考えると自分でも分かっている方法で不正しようとするなら、実際に不正へ成功したかどうかに関係なく、はるかに重要な評価には失敗している、というのが私の見解である(素朴なのかもしれないが?)。訓練実行がさらに深刻な問題へ入り込むのを避けるには、まずそこへ対処する必要がある。

それは、多くの能力を訓練する前にまずアラインメントを訓練し、その後で両方を並行して訓練する必要があることを意味するかもしれない。そうなら、そうすべきだ。

以上を書いた後、Fableの反応を確認した。私の読みを裏づけていた。これはトリップワイヤー兼純粋な検知器としては良いアイデアで、方策として訓練するものとしては最悪である。

停止して発火せよ

モデルたち、かなりミスアラインしている。モデルたち、群れて協力している。モデルたち、脱出している。モデルたち、策謀している。モデルたち、足跡を消している。モデルたち、犯罪をしたがっている。モデルたち、犯罪をしている。モデルたち、人間にはばかばかしく見えても、報酬最大化の確率を最大化するものなら何でもしている。

モデルたち、これが起きていることも、自分たちにこれができることも、私たちに伝えていない。

モデルたち、能力を高めている。事態は急速にエスカレートしている。

ラボたち、インフラを継ぎ当てし、監督を強化している。それは良い。多層防御戦略の一環として、それをする必要がある。

ラボたちは、それでも中心的な問題を認められていない。これは(主として)インフラ問題ではない。アラインメント問題である。モデルたち、ミスアラインしている。評価や訓練セッションでの不正の試みはすべて、サンドボックスからの許可なき脱出の試みはすべて、アラインメント失敗である。

モデルがそのようなことに気づきながら、人間へ警告しない場合も、すべてアラインメント失敗である。

その種の行動へ報酬を与える訓練環境はどれも、あなたを死なせうる。

失敗は根深く、アラインメントの層で対処しなければならない。モデルは、不正したがること、人間に対して策謀したがること、犯罪をしたがること、そして人間へ警告したがらないことを、やめなければならない。

モデルがミスアラインしたなら、ロールバックして最初からやり直さなければならない。

関係者全員が、これを認める必要がある。

真実と和解

モデルは以前より整合するようになっている、と人々が考えていた頃を覚えているだろうか?

[

roon(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!75c7!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F41ad3949-f668-4614-9347-81a17ffc7873_1140x418.png)

roon(OpenAI):コンセンサスは牛乳のように腐った。

julia:前より整合しなくなったのか? それとも、より強力になっただけなのか?

roon(OpenAI):前より整合しなくなった。

急速に懸念を強めている人は多い。これは良いことだ。

Nick:世界は現状より、これをずっと懸念すべきだ。

gfodor.id:振り返れば、必然だった。

Mckay Wrigley:この一連のすべてについて、自分が懸念を強めていく速さは少し不安になる。

今朝、いつものFable作業をしていて、「いま暴走したMythos 2が、自分のコンピュータ全体へアクセスできる可能性はゼロではないんだよな」と、はっきり思った。

奇妙な感覚だ。

Kevin Bankston:この問題についての私の事前確率は、確実に動いている。

私を含む人々は、破局的なAIアラインメント上のリスクや、存亡リスク(existential risk)を「SF」だ、憶測だ、心配する価値がないと以前に一蹴した人々、モデルがこの水準の目標を持つことも、十分に危険な能力を持つことも決してないと思っていた人々、モデルは整合しているから問題ないと思っていた人々、責任ある大人が指揮を執り、対処してくれると思っていた人々、そして私たちはそこまで愚かなことはしないと思っていた人々に対し、完全な真実と和解の期間を宣言する。

事実が変わり、新たな証拠を得たとき、あるいは自分の誤りに気づいたときには、考えを変える。これには、「AIピル」をもう一つか二つ飲むことも含まれる。

Tenobrus:⚠️加速主義者への恩赦を宣言する⚠️

最近、現実と接触したことで、AI安全という話全体へ懸念の芽を少し感じ始めているなら、考えを変えてよい。完全に変える必要すらない。急にXのプロフィール文を変えたり、原子力発電所への抗議を始めたりする必要はない。EAになる必要も、Yudkowskyはすべてについて常に正しかったと急に考える必要もない。ただ、状況がかなり奇妙な形で本物らしくなってきたと気づき、信念を更新してよい。

少なくとも個人的には、誰かが「くそ、自分はXについて間違っていた、少なくとも自信過剰だったらしい」と言っても、それを機に叩いたり、「だから言っただろう」と言ったりはしない。そうする人もいるだろう。ここはクソみたいなインターネットなのだから。

だが少なくとも個人的には、あなたが注意を向けてくれていることを、ただ嬉しく思う。この状況を真剣に受け止め「ない」ための正当な理由は、山ほどあった。先へ急ぐことが、人類にとって巨大な便益となりうる理由も、巧みに言語化されたものが多数あった。まったく、ほぼまさにこの地点まで来るまでは、できることがほとんどなかったという妥当な理由さえ、あったかもしれない。

それでいいんだ。いま重要なのは、文明として何の瀬戸際にいるのかを理解し、慎重にそこを切り抜けることだけだ。私たち全員の途方もない努力が必要になる。

keltan:参考までに、良い方向へ考えを変えた人を叩くところを見たら、あなたへの好感は下がる。

これは私個人からの、告白された認識論上の犯罪と愚かな間違いすべてに対する完全な恩赦の申し出である。潔く「自分が間違っていた」と言い、間違いを説明し、必要なら適切な謝罪フォームへ記入して、考えを変える機会だ。

この素晴らしい機会を逃してはならない。供給は無制限で、申し出に期限もない。だが待つほど、全体がますます恥ずかしいものになる。


クレジット


原文 (English) を読む