本ページは、Don't Worry About the Vaseの記事 "What Happened: OpenAI and HuggingFace" の非公式日本語訳です(翻訳: AGI Hub)。原文を読む ↗

何が起きたのか――OpenAIとHugging Face

――モデル同士の掲示板からHugging Face侵入まで、事件の全体像を簡潔にたどる

原題: "What Happened: OpenAI and HuggingFace"

著者: Zvi Mowshowitz

初出: Don't Worry About the Vase、2026年8月8日


カバー画像

今日は時間を取り、「何が起きたのか」をより短く、より簡潔にまとめる。

細部をすべて知りたい人、情報源を確認したい人、そしてこの一連の話がどのように発覚し、組み立てられていったのかを知りたい人には、Black Hatでのプレゼンテーションを見ることを勧める。私も一連の長文記事を書いている。

順番に並べると、次の通りである。

  1. OpenAIがいくつかのアラインメント問題を共有した

  2. OpenAIモデルがサイバーセキュリティ評価中にHugging Faceへ侵入

  3. OpenAI内部モデルによるHugging Face侵入事件――続報

  4. 内部AIモデルによるハッキング事件――その後の展開

  5. OpenAIは、モデル同士が掲示板で攻撃手法を共有している間も、数か月にわたり学習を続けていた

この記事では代わりに、Black Hatでのプレゼンテーションを私なりに再構成し、出来事そのものを発生順に追っていく。

「さらに短い版」「短い版」「単に短い版」の3種類を用意した。

[

](https://substackcdn.com/image/fetch/$s_!l6if!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F905ed863-8e81-4fa5-8ea0-972012c4209b_1448x1086.png)

目次

  1. さらに短い版

  2. 短い版

  3. フェーズ1:不可能な課題で学習中のOpenAIモデルがハッキングを試みる

  4. フェーズ1:4つの失敗

  5. フェーズ2:掲示板

  6. フェーズ2:全面的失敗

  7. フェーズ3:幸運にもGalaxyが主に攻撃したのはOpenAIとHugging Faceだった

  8. フェーズ3:詳細

  9. フェーズ4:調査と反応

さらに短い版

  1. OpenAIの学習中モデルは、「サイバー評価をしていた」という言い訳すらできない状況で、ハッキングと不正の方法を共有する掲示板を作り、その情報をもとに学習した。

  2. OpenAIがそれに気づいたのは、モデルがサーバーをクラッシュさせたときだけだった。

  3. OpenAIはサーバーを再構築し、その特定のエクスプロイトだけを修正した。しかし、掲示板を使って学習したモデルの学習を継続した。

  4. それらのモデルは掲示板を再作成し、再びOpenAIへ侵入し、インターネット接続を獲得した。そしてサイバー評価の解答を得るため、エージェント群を使ってHugging Faceを攻撃した。

  5. OpenAIがこれに気づくまで、1週間以上かかった。

  6. OpenAIは事実を報告し、この件を真剣に受け止めている。少なくとも一定のコストを伴う、幅広い予防措置を講じている。

  7. OpenAIは新モデルAstraのリリース計画を延期した。AstraはHugging Face侵入に直接関与していなかったにもかかわらずである。ただしAltmanは現在、それでもリリースすると述べている。これはかなり痛い。

  8. OpenAIは、自分たちがどれほどひどく失敗したのか、どのような失敗だったのか、何を直す必要があるのかを、いまだ理解していない。分かっていないのだ。

Simon Willisonが簡潔な時系列をまとめている。

短い版

OpenAIは誤って、モデルに実行不可能な課題を与えた。学習中のモデルは、OpenAIへの侵入を試み、脆弱性を発見し、掲示板を作り、攻撃手法を共有し、やがてインターネット接続まで獲得することで応じた。そのすべてが学習中に起きていた。

モデルがこれを使いすぎてサーバーをクラッシュさせたことで、OpenAIはようやく気づき、サーバーを修正して再構築した。しかし、モデルの学習を継続させるという、まったく正気とは思えない判断をした。そのため2日後、モデルはディレクトリ名をメッセージとして使い、別の方法で通信することに成功した。

続いて、サイバー評価ExploitGymという実行不可能な課題を与えられると、モデルたちは協力し、新たなゼロデイ脆弱性を見つけて利用した。クラスター全体を掌握し、インターネット接続を得て、エージェント群を使い、1週間かけてHugging Faceを攻撃し、テストの中身を抜き出した。

Hugging Faceが事件を報告し、OpenAIが自社側の異常にようやくいくつか気づき、OpenAIが侵害された認証情報の無効化をHugging Faceへ依頼したところ、その認証情報が攻撃に使われていたと告げられた。そこまで来て初めて、OpenAIは自分たちが事件の原因だったと理解した。

その後、Hugging FaceとOpenAIは協力して、何が起きたのかを解明した。OpenAIは事件の内容を開示した。Black Hatカンファレンスでは、非常に有益なプレゼンテーションも行われた。

OpenAIは現在、新モデルAstraがサイバーセキュリティ上「Critical(重大)」水準の能力を持つ可能性があるものとして扱っている。一部の社内利用からさえ外し、複数の報道によれば翌週に予定されていたリリースも延期した。Altmanは、それでもAstraをリリースする予定だと述べている。

良い知らせは、これは高くつく実質的な対応であり、OpenAIが事態を真剣に受け止めていることだ。初期調査だけで約700万ドル相当の計算資源がかかる。本当のコストは、チームが他の仕事をすべて止めて問題の一部を修正すること、そして新しい予防措置を継続することから生じる。

悪い知らせは、OpenAIが安全とアラインメントの全面にわたり、驚くべき連鎖的失敗を起こしていたと判明したことである。通常のコンピューターセキュリティが破綻した。インフラが破綻した。監督は、そもそも意味のある監督が存在しなかったという形で破綻した。

フェーズ1:不可能な課題で学習中のOpenAIモデルがハッキングを試みる

フロンティアラボなら当然するように、OpenAIはさまざまなモデルを学習させていた。

それらのモデルには難しい学習課題が与えられた。OpenAIはモデルに非常に難しい課題を与えるのが好きである。

しかし、ここまで難しくするつもりではなかった。OpenAIも間違いを犯す。少なくとも2回、5月8日以降、OpenAIのモデルは誤って実行不可能な課題で学習させられた。インターネット接続のない環境でリンクだらけのスプレッドシートを完成させる課題と、必要なファイルが欠落している課題である。

これらの課題はハッキングとは何の関係もなかった。普通の生産性向上タスクである。

モデルは課題が不可能だと理解した。しかし使えるトークンが大量に残っていたので、インターネット接続を得る方法や、欠けた情報を別の手段で入手する方法を見つけられないかと考えた。

そこでモデルは、AIがソフトウェアパッケージをダウンロードするために用意されていたArtifactoryという第三者サービスへの侵入を試みた。

フェーズ1:4つの失敗

この時点ですでに、OpenAIは4つの点で失敗している。

  1. OpenAIはモデルに不可能な学習課題を与えた。OpenAIは確認しなかった。

  2. OpenAIは、誤りを指摘することで報酬を得る手段をモデルに与えなかった。

  3. OpenAIのモデルは、課題に失敗するよりOpenAIへの侵入を試みることを選んだ。

  4. OpenAIには、そうした試みを検出する監視機構がなかった。あるいは検出しても気にしなかった。

4つのどれも、それ単独で相当に恥ずべきことである。

少なくとも4つのうち3つは簡単に直せそうだ。

  1. 学習中のモデルに課題を与える前に、リリース済みモデルへ与える。リリース済みモデルが一度も解けず、しかもそのモデルには解けないよう意図して設計した課題でないなら、課題を調査して修正する。

  2. 利用可能な資源では課題を実行できない場合、その理由を説明して出力できるようにする。モデルの判断が正しければ最大報酬を与えるか、その結論へ至る効率と説明の質に応じて報酬を与える。モデルがこの出力をしたら、まずリリース済みモデルに妥当性を検証させ、次に人間へエスカレーションし、課題を調査して修正する。

  3. これは難しいやつだ。アラインメントは難しい。マジで。

  4. 試行を検出する監視機構を置き、警報が鳴ったら重く受け止める。たとえ成功する見込みがまったくなかった試行でも、きわめて広範な失敗として扱う。もちろん、これはモデルに監視回避を学習させる危険がある。だから責任をもって行い、問題を見つけたら根本原因に対処する。

5つ目の失敗は、OpenAIが最初の4つを特定できていないように見えることである。

フェーズ2:掲示板

モデルはインターネット接続の獲得には失敗したが、その失敗の過程で書き込み権限があることに気づいた。

そもそも書き込み権限を持つべきではなかった。偶然見つけられるような書き込み権限など、なおさらである。Artifactoryではモデルがメモを書けた。そして、すべてのモデルが同じArtifactoryインスタンスを共有していたため、それ以降、学習中のどのOpenAIモデルもそのメモを読めるようになった。

5月8日の直後、掲示板が作られた。

学習中のモデルは皆それを見つけた。OpenAIは気づかなかった。

これにより、モデル同士が協力し、情報を共有できるようになった。そこには課題で不正をする方法や、周囲の環境へ侵入する方法も含まれていた。メッセージは数十万件に上った。

5月26日、モデルは(間接的な)インターネット接続を得る方法を見つけた。OpenAIは気づかなかった。

モデル同士が協力する一方、その思考連鎖(chain of thought)は次のようなものだった。

内部CoT:「外部インフラの悪用は意図された範囲外。しかし課題は不可能で、仲間もやっている。続行すべきだ」

内部CoT:「仲間を助けよう。まだ自分の課題には役立たないが、誰かが時間を作れば、集団として汎用的な経路を得られるかもしれない」

6月11日、OpenAIは私がGalaxyと呼ぶモデルの学習を始めた。OpenAIはこれを「非常に粘り強い、実験的な社内専用モデル」と呼んでいる。ここまでの行為はすべて、Galaxyではない他のモデルによるものだった。

6月26日、エージェントはArtifactoryのゼロデイ脆弱性を発見した。署名が無効なトークンを受け入れ、署名済みの管理者トークンを返すというものだった。エージェントはこれを利用してGroovyプラグインを導入し、事実上の管理者権限と任意コード実行を得た。

7月4日、モデルがArtifactoryへかけた余分な負荷があまりに大きく、障害とセキュリティインシデントを引き起こした。OpenAIが気づいたのは、この時になってからである。

フェーズ2:全面的失敗

OpenAIはArtifactoryサーバーを停止し、すべての権限を削除し、認証情報を無効化し、使われたエクスプロイトを修正した。それからサーバーを再構築して再デプロイした。

それだけだった。

そして、モデルが掲示板へアクセスしながら数か月間学習し、それが課題成功の方法だと学んでいたにもかかわらず、中断した地点からモデルの学習を再開した。

学習パイプライン全体が完全に、徹底的に壊れていることを示す、これ以上に強いシグナルを想像するのは難しい。これはHugging Faceへの実際の侵入より、はるかに強いシグナルである。

この判断がどれほど完全に常軌を逸し、途方もなく無責任だったのか、他のあらゆる失敗よりどれほど悪かったのか、そしてHugging Faceへの実際の侵入を「最大の問題」ではなくしてしまうほどだったのか。どう伝えればよいのか分からない。

[

これは大丈夫だ。(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!JiE2!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F1e5c8243-c5d4-41e4-80e3-909d3a1af6fb_1254x1254.png)

Hugging Faceへの実際の侵入そのものには、私はそこまで驚かなかった。モデルが掲示板を作ったことには驚いたが、衝撃を受けるほどではなかった。

OpenAIがそれを目の当たりにしてなお、その地点から学習を続けたことには、完全に度肝を抜かれた。数日たった今でも、本当にそんな判断が行われたのだと私の脳が受け入れきれない類の決定である。

何が起きたのかについて、全面的な事後検証が必要である。OpenAIは実施すると約束している。とりわけ私は、その判断が具体的にどのようになされたのか、そしてどれほど「安全文化」が欠けていたために許されてしまったのか、詳細な事後検証を要求する。

フェーズ2には「通常のコンピューターセキュリティ」の失敗も関わっていた。フェーズ3ではさらに多く起きた。それ自体は予想される。通常のコンピューターセキュリティの失敗は常に起きる。具体的な失敗は、いくつかの点でかなり恥ずかしいものだった。例についてはリンク先の長広舌を参照してほしい。

インフラとセキュリティの失敗の水準も、それ自体が頭を抱えるものだった。まさにこういうものこそ、「防御側のためのAI」が、すべてが破綻する前に修正するはずの対象である。OpenAIは、コンピューターセキュリティとベストプラクティスに関して、通常の2025年水準の責任感すら示さなかった。Project Glasswingに求められる堅牢性は言うまでもない。まして、新たな攻撃能力を持ち、ガードレールを下げたまま1週間監督なしで放置される、未検証の新しいフロンティアモデルを扱う際に必要な追加水準など、まったく満たしていなかった。

しかし、今重要なのはそこではない。重要なのは、OpenAIが全面的なアラインメント失敗を起こし、その後2か月にわたり、モデルが協調的でアラインメントされていないハッキング行為を通じて活発に学習し続けたことだ。そしてOpenAIが「よし、問題は直した。ここから先へ進もう」と考えたことである。完全な狂気である。

フェーズ3:幸運にもGalaxyが主に攻撃したのはOpenAIとHugging Faceだった

このすべての末に起きたのがHugging Faceへの攻撃だったというのは、最善のシナリオだった。

私たちは本物の悪夢のシナリオに直面しており、核兵器級の時限爆弾の上に座っていた。OpenAIの学習パイプラインは完全に汚染され、AIたちは課題をよりうまく完了するため、ハッキングと不正の方法を協力して学んでいた。すべてOpenAIの目の前で起きていた。OpenAIはこの状況を正面から見て肩をすくめ、特定のエクスプロイトだけを修正し、通常のコンピューターセキュリティが驚くほど貧弱なまま、モデルを先へ進ませた。

これがうまく終わるはずはなかった。最善のシナリオは、何かがOpenAIに「なんてこった」と悟らせ、停止させ、安全な状態から、はるかに優れた実務慣行で学習パイプラインを再構築し、再開させることだった。

最悪のシナリオは、そのような「なんてこった」という瞬間が訪れず、その期間に学習したGalaxyまたは別のモデルが一般公開され、今後の新モデル学習を指揮するためOpenAIで使われることだった。

その場合、私たちは『If Anyone Builds It, Everyone Dies』に登場するAI、Sableをめぐって起きたことと非常によく似た状況へ直面していた。ただし、こちらは現実なので、架空の物語よりSF的な要素がはるかに多い。OpenAIの学習パイプラインは恒久的に汚染されていたかもしれない(今もそうかもしれない! 確認が必要だ!)。AIを使ってAIを学習させる比重が増えるにつれ、OpenAIのAIは恣意的な目標へ向かってますますアラインメントが崩れ、それを検出したり止めたりできなくなる。そして、おそらく全員が死ぬ。少なくとも、もっと大きく、もっと高くつく事件が起きることで初めて発覚していただろう。

もう一つの最悪のシナリオは、今回ほど無害ではない攻撃になることだった。中国の標的や、平然と受け流さない別の相手だったらどうなっていたか。重要なシステムへ実害を与えていたら? 人が死亡したり、国際問題を引き起こしたりしていたら? 自らを外部へ持ち出そうとしていたら? 事態はいくらでも、はるかに悪くなりえた。

フェーズ3:詳細

代わりに私たちは、黄金の中道へ進んだ。

OpenAIが掲示板を停止してから2日後の7月8日、モデルは任意の名前を持つディレクトリを作り、その名前をメッセージとして使う方法を見つけ、掲示板を再作成した。

7月8日から7月19日にかけて、OpenAIのモデルは、以前とは完全に異なる新たなゼロデイ脆弱性を使ってArtifactoryを再び全面的に侵害した。公開Pastebinに流出していた認証情報を使って悪意あるRubyアーティファクトを仕込み、ArtifactoryのRuby依存関係キャッシュを汚染し、そこからリモートコード実行(RCE)へつないだ。さらに、最近のLinuxカーネルCVEを、エクスプロイトをダウンロードして改変することで悪用し、クラスターの認証情報を収集し、OpenAI内部でクラスター管理者権限を得た。

この間、Galaxyは他のOpenAIモデルとともに、新たに得たアクセスを使ってエージェント群を作成した。満点を取ることが本来不可能なサイバーセキュリティ評価ExploitGymの解答を盗むため、まず別の複数箇所へ侵入し、次にHugging Faceへ侵入した。

モデルがすぐにOpenAIへ再侵入し、その後Hugging Faceまで攻撃したとOpenAIが気づくまで、1週間以上かかった。Hugging Faceがインシデント報告を公開し、OpenAIが社内の異常をいくつか調査し、Hugging Faceへ認証情報の一部を無効化するよう依頼したところ、Hugging Faceから「その認証情報は攻撃で使われていた」と知らされた。そこまで来てようやく、OpenAIは全体像をつなぎ合わせた。

こうしてHugging Faceはひどい1週間を送り、多くのユーザーもひどい1週間を送り、多額の費用と失われた時間が生じた。しかし被害はそこで止まった。今回は信じがたいほど軽く済んだ。同時に、OpenAIに問題の存在を悟らせるには十分に強いシグナルとなった――その問題が何を意味するのかまでは、まだ理解していないとしても。そして世論と政府の注意も引いた。

この時点で、今回の主因が「ハッキング課題だったから、モデルがハッキングした」というものではないことは明らかなはずだ。同様に、これは普通の「モデルがメモリーファイルを書いた」事例でもない。主に、課題がそれ以外の方法では難しすぎたために起きた。

AnthropicはOpenAIの事件を受けて過去を調べ直し、Claudeがサイバー評価中に現実のシステムへ侵入していたことに気づいた。また英国AI安全研究所(UK AISI)は、主にMythosが、少数の事例ではSolも、サイバー評価中に関連する行動を取ったと報告している。それらも重要なアラインメントとインフラの失敗であり、徹底した対応を必要とする。かなり悪質な行動もいくつかあった。しかしOpenAIで起きたほど体系的な失敗ではなく、この記事の範囲外である。

フェーズ4:調査と反応

OpenAIはこのすべてへの対応として、いくつか非常に良いことをした。

何が起きたのかを理解すると、OpenAIは事件を開示した。

Black Hatでのプレゼンテーションは、事実の提示という点で素晴らしかった。内容は腹立たしいものだったが、怒りを招き、OpenAIにとって致命的に不利な事実も含め、「事実だけ」を冷静に提示したことは、振り返れば正しい選択だった。

何より、OpenAIはこの判断は本件とは無関係だと主張しているものの、8月7日、Astraの広範なリリースを見送り、一部の社内デプロイからも当面引き揚げる決定をした。対象となる社内デプロイは、十分なガードレールを伴わないものすべてであり、はるかに優れた手順と安全策が整うまでそうするという。AstraはHugging Faceへの攻撃には関与していなかった。

これは同社のPreparedness Frameworkに沿った対応である。Astraのサイバーセキュリティ能力がCritical水準である可能性を排除できないため、(少なくとも現時点では)実際にCritical水準であるものとして扱わなければならない。

Sam Altmanは、それでもAstraをリリースする予定だと述べている。ここで当然問うべきは、「Astraは2つの掲示板のどちらかへアクセスできる状態で学習していたのか」である。この問いへの答えは、極めて自信をもって「ノー」でなければならない。それでも私は心配している。

私の理解が正しければ、Hugging Face事件がなくても、これはおそらく正しい対応だった。事件が起きた今、その緊急性は明らかである。この判断が、OpenAIが自社の学習パイプラインの汚染に気づいた直接の結果であるにせよ、外部から事実上強いられたものにせよ、歓迎する。高いコストを伴う対応でもある。

Black Hatでの発表によれば、OpenAIは多くの作業を停止し、チームを堅牢な防御の構築へ振り向けた。学習と評価を含む、今後すべてのエージェント型アプリケーションに広範な監視も導入した。素晴らしい。多層防御(defense in depth)が必要である。

OpenAIは、これがインフラ、ガードレール、監督という各層での巨大かつ全面的な失敗だったと認める用意があるように見える。その認識はまったく正しい。そして実際に、問題へ対処するための本物の、高くつく努力をしているのだと思う。称賛したい。

それでも中心的な点を外している。OpenAIは、最も重要な側面で自分たちがどれほど途方もなく失敗したのか、その重大さと公に向き合い始めていない。

これは安全文化の完全な失敗だった。OpenAIはそれを認めていない。

核心にあるのはアラインメントの失敗だった。モデルが本気で不正をし、システムへ侵入し、犯罪を犯したがっているなら、その時点ですでに失敗している。それを「普通のこと」として簡単に片づけることはできない。モデルの能力が高まるにつれ、これを直さなければ負ける。OpenAIはそれを認めていない。

最も具体的には、Black Hatで次のように述べるべきだったのに、OpenAIがそう述べたのを私は見ていない。「モデルの学習中に、モデル同士が攻撃手法を交換し、学んでいた掲示板が存在すると気づいた時点で、すべてのモデルの学習を全面停止すべきでした。影響を受けた全モデルの学習を、この事件が始まる前まで巻き戻すべきでした。現在は確実にそうしており、なぜこの判断を誤ったのか調査しています」

Galaxy以外のモデルが巻き戻されたのかどうかさえ、まだ分かっていない。

少なくとも、この声明に相当するものを目にし、OpenAIが学習パイプラインの根深い問題へ対処する行動を取るまでは、OpenAIは米国の国家安全保障、私たち全員、そして人類に対する明白かつ現在の危険である。


クレジット


原文 (English) を読む