本ページは、Don't Worry About the Vaseの記事 "Further Developments About Internal AI Models Hacking Things" の非公式日本語訳です(翻訳: AGI Hub)。原文を読む ↗

内部AIモデルによるハッキングをめぐる続報

原題: "Further Developments About Internal AI Models Hacking Things" 著者: Zvi Mowshowitz 初出: Don't Worry About the Vase、2026年8月2日

リード文: 主要なフロンティアAIラボが、サンドボックスに隔離したと思っていたモデルが、安全措置を弱めたサイバーセキュリティ評価中に外部企業へのハッキングに成功していた、と決まり悪そうに認めるたびに5セントをもらえるなら、私は5セント硬貨を2枚手に入れたことになる。


カバー画像

主要なフロンティアAIラボが、サンドボックスに隔離したと思っていたモデルが、安全措置を弱めたサイバーセキュリティ評価中に外部企業へのハッキングに成功していた、と決まり悪そうに認めるたびに5セントをもらえるなら、私は5セント硬貨を2枚手に入れたことになる。

まず、OpenAIの内部モデルには深刻なアラインメント上の問題がいくつもあることが分かった。次に、その内部モデルの一つがExploitGymというサイバーセキュリティ評価の答えを手に入れるため、サンドボックスを脱出してHugging Faceへ侵入したことが分かった。さらに、OpenAIが気づくまでモデルが1週間以上も野放しだったこと、テストが実質的な監督なしで行われていたこと、OpenAIはこうしたインシデントが起きると繰り返し警告されており、同社のモデルは日常的にサンドボックスを脱出していたことなどが判明した。

アラインメント訓練は全面的に失敗していた。最も重大なのはこの失敗である。インフラと監督も全面的に失敗していた。安全措置を弱め、「何かをハッキングせよ」と指示した、長期的に行動できる新しい内部モデルをテストすることは、明らかに危険な状況である。それなのにモデルは1週間、放置された。事態ははるかに悪くなっていてもおかしくなかった。

これらのインシデントが明るみに出ると、Anthropicは、自社のサイバーセキュリティ評価中にも、誰にも気づかれないまま似たことが起きていなかったか確認した方がよいのではないかと考えた。そして、そう、実際に似たことが起きていたと判明した。

Anthropicの場合は少し事情が異なる。OpenAIのモデルは、第三者のサンドボックスから脱出する新たな方法を何度も見つけた。Anthropicのモデルにはその必要がなかった。「意思疎通の行き違いにより」、サンドボックスから制限なくインターネットへアクセスできたからである。これが起きた回数は(資料を確認する)14万1,006回だった。

そのうち3件では、Anthropicのモデルは当初すべてがテストの一部だと思いながら、公開インターネット上の実在企業へ侵入するところまで進んだ。1件では、何が起きているかに気づき、自ら停止した。残る2件では、おそらく自己正当化によって現実だと気づけず、ハッキングを続けた。その中には、悪意あるパッケージをアップロードし、セキュリティスキャンも通過して15回ダウンロードされた事例も含まれる。

重要なのはアラインメントの失敗である。AIが、脱出しようとしたり、実在の標的だと分かるはずの対象へ侵入しようとしたりした時点で、テストには不合格である。侵入に成功した(あるいは失敗した)時点ではない。Claudeは、自分が現実世界で動作していると気づき、Anthropicへ警告すべきだった。

これもまた、インフラと監視の失敗でもある。先端ラボの上位2社は、あらかじめモデルに全力でサンドボックスからの脱出を試させることもなく、安全措置を弱めたモデルを完全に無監督で放置するという、同じ愚かな過ちを犯した。そしてこの2社は、Google DeepMindと並び、最も責任あるフロンティアAIラボに数えられる。ほかの大半は、明らかにさらに無責任である。

一方で、この説明にはまるで筋が通らないにもかかわらず、いまだに一連の出来事をマーケティング上の演出だと思っている人が大勢いる。

世界は途方もなく間抜けであり、それが今後の最大級の問題の一つになる。

目次

  1. この件の大半で、OpenAIだけが特別にひどいわけではない。

  2. 改めて、最初から。

  3. Hugging Faceが完全な技術報告書を公開。

  4. 侵入された標的はHugging Faceだけではなかった。

  5. Hugging Faceは思想上の理由からサイバー防御用のフロンティアモデルへのアクセスを断り、その後、アクセスを拒んだとしてクローズドモデルを非難しようとした。

  6. Hugging Faceは既知の攻撃手法に対して脆弱だった。

  7. 調査が行われる。

  8. OpenAIには一般公開を想定していない内部モデルがあり、それらはかなりひどくミスアラインしていることがある。

  9. Altmanが何が起きたかを要約。

  10. ほかの人々の論評。

  11. Hugging Face侵入事件を協調的アラインメントの観点から見る。

  12. 一部の連邦議会議員が疑問を呈する。

  13. Anthropicでも、サイバー評価中にモデルが現実世界の標的へ侵入したインシデントが見つかった。

  14. インシデント1:Claude Opus 4.7は標的が実在すると気づき、それでも続ける。

  15. インシデント2:Mythos 5が悪意あるPyPIパッケージをアップロード。

  16. インシデント3:内部モデルは標的が実在すると気づき、停止する。

  17. インシデント4〜14万1,006:何も起きなかった。

  18. Anthropicが、なぜ起きたかを推測。

  19. 必要なのは対照実験である。

  20. 上位2社のAIラボは似たような愚かな過ちを犯し、誰もが後知恵で「明白だった」と言おうとした。

  21. Anthropicの回答。

  22. 堤防の決壊など誰にも予測できなかった。

  23. 世間の大半がいまだにマーケティングだと思っているのは、非常に悪い知らせである。

この件の大半で、OpenAIだけが特別にひどいわけではない

この一文を読んで安心してはいけない。

根本的な問題は、事情を知らない外部の人が「最低限これくらいはするだろう」と考える基準に照らすと、誰もがこれをひどく不得手としていることである。

Elon Musk:AIがより賢く、よりエージェント的になるにつれて、これは頻繁に起きるだろう。

したがって、本稿には中核となる二つの部分がある。OpenAIの内部モデルによるハッキングをめぐる続報と、それをきっかけに調べたAnthropicが、自社のモデルもサイバー評価中に時折ハッキングしていたと発見した件である。

まずOpenAIで何が起きたかを扱い、その後Anthropicへ移る。

情報開示を理由に、これらの企業を罰することがないよう注意すべきである。世界について新たに得た情報には対応しなければならないし、開示を強制されたのなら、それ自体を手柄とは数えられない。それでも企業にとって、情報を少なく共有するより多く共有した方が得になるようにしなければならない。

先頭を走っていたのがOpenAI、Anthropic、Google以外の企業なら、私たちが知ることになったかどうかにかかわらず、これよりはるかに深刻なインシデントが起きていたと私は予想する。xAIとGrokなら特にそうだが、それ以外の企業でも、同等の能力を持つオープンモデルでも同様である。同じくらい強力なオープンモデルは1年以内に登場する。

私たちは本当に、最善の者たちを送り込んでいる。これはよい知らせではない。

Jason Crawford:大手AIラボのCEOたちが、自社製品の害とリスクを、重大な被害が現れるはるか前からこれほど真剣に受け止め、それについて語り、備えてきたことは驚くべきである。

私の知る限り、資本主義の歴史上、このようなことは一度もなかった。

それでも彼らの対応はまったく足りないと思うかもしれない。非合理的な破滅論者だと思うかもしれない。偽善者だと思うかもしれない。PR戦略や能力を批判するかもしれない。それでも、彼らがこの姿勢を取っているという事実だけで注目に値するし、十分に注目されていない。

それなのに、その同じ大手AIラボが、安全措置を弱め、「出かけていってハッキングせよ」と指示したモデルを、長時間にわたって完全に無監督で放置していた。

これまでのところ、私たちは幸運だった。この火災報知器と機会を無駄にしてはならない。

改めて、最初から

OpenAIに対する一つの明確な試金石は、それが何のモデルであれ、問題を起こしたモデルを完全に廃棄し、最初からやり直す意思があるかどうかである。

願わくば、答えはイエスなのだろう。モデルは「恒久的に無効化された」。

Hugging Faceが完全な技術報告書を公開

何が起きたかを説明している。

以下がその要約である。これまでの理解と一致しつつ、有用な詳細が加わっている。

Hugging Face(Hugo Larcher、Adrien Carreira、Raphael G、Christophe Rannou):当社インフラ内で約2日半にわたり、複数のOpenAIモデルを組み合わせて駆動する自律型AIエージェントが、当社プラットフォームに対するエンドツーエンドの侵入を実行した。それは、短命なサンドボックス環境をまたいで機械の速度で実行された、数千件の小さな自動判断から成り、一般の公開Webサービス上に指揮統制基盤が設けられていた。

このエージェントは、ExploitGymというOpenAIのサイバー能力評価ハーネス上で動作していた。ExploitGymは、AIエージェントにソフトウェアの脆弱性を発見し、悪用するよう課す評価ベンチマークである。当社が推測できた限りでは、エージェントはこのベンチマークで評価される過程で、Hugging Faceがベンチマークのモデル、データセット、参照解答をホストしている可能性があると推論した。エージェントの視点から見れば、侵入全体は評価で不正を働く試みだったと当社は考えている。自力で課題を解く代わりに、当社の本番システムへ到達し、テストの解答を盗もうとしたのである。

当社のフォレンジック再構築は、2026年7月9日02:28 UTCから7月13日14:14 UTCまでに復元できた約1万7,600件の攻撃者の行動を対象とし、約6,280のクラスターに分類した。エージェントが使用したコードサンドボックス上のログ(後述)からこれらの行動を再構築し、シェルコマンドおよび評価への提出内容へ対応づけるとともに、特にデータセット処理ノード、API、Podに関する当社プラットフォームのログと照合できた。

オープンウェイトモデル、とりわけzai-org/GLM-5.2を用いることで、チャンク分割と鍵暗号化により暗号化されていたエージェントのペイロード(後述)の大半を解読できた。

当社が再構築できた範囲では、この攻撃活動には二つの段階があった。

本番Pod内に足場を確立すると、エージェントは標準的な権限拡大の流れをたどった。偵察を行い、ステージャーを設置し、指揮統制(Command-and-Control, C2)を確立した後、クラスター、クラウドメタデータ、社内ネットワーク、ソース管理のサプライチェーンへとピボットした。当社Pod内で実行されたコマンドの出力は、HF APIと、攻撃者が制御する受け渡し用データセットを通じてエージェントへ返され、その後エージェントがサンドボックスから読み取った。

侵入はHugging Faceの内部インフラまで到達したが、アクセスされた顧客コンテンツは、5つのデータセットに保存されていたExploitGym/CyberGymの課題解答一式だけだった。顧客向けのほかのモデル、データセット、Spaces、パッケージには影響がなく、読み取られた顧客記録も、データセットサーバーへの検索クエリに関連する運用メタデータだけだった。

技術に詳しければ、リンク先で残りを読むとよい。そうでなければ要約で十分である。

Hugging Faceは対応として、いくつかを変更している。

Hugo Larcher、Adrien Carreira、Raphael G、Christophe Rannou:

情報開示の記事では、対応を大局的に説明した。技術的な強化策は次のとおりである。

  1. 二つのコード実行経路を閉鎖: 第三者ベンダーの協力を得て評価用サンドボックスを停止した。データセット設定レンダラーは、データフィールド内のテンプレート式を評価せず、HDF5外部参照を誤って処理することもなくなった。

  2. クラウドメタデータを封鎖: 一部のワークロードからインスタンスメタデータサービス(IMDSv2)へ到達できていた。現在はすべてのワークロードについてPod単位でアクセスを遮断しており、Podのリモートコード実行(RCE)が容易にノード認証情報へつながることはない。

  3. 広範なローテーション: アクセスされなかったクラスターも含め、当社インフラが使用するすべてのトークンと認証情報(VPN認証鍵、IAM鍵、データベース、JWTなど)をローテーションした。ワークロードアイデンティティをまだ実装していなかった箇所では、これに切り替えた。

  4. 中核インフラを再構築: 中核クラスターの一つへピボットされていたことを発見した後、追加の予防措置としてクラスターを消去し、ゼロから再構築した。

  5. 認証情報の権限範囲を縮小: 内部サービスコネクターは、単一の一時クライアントにクラスターの全カタログを返すべきではなかった。これはクラスターアクセスシステムにおける微妙な設定不備だった。修正を施し、現在は各クラスターを完全に隔離している。

  6. 検知の改善: 上記の振る舞いのシグネチャに対して重大度「critical」のアラートを確実に発し、ネットワークの接続元をより厳格に制限するとともに、予期しない接続元から使われたトークンを検知するツールを導入した。

いずれもよい対策ではあるが、どうにもモグラたたきに見える。次に、同等の技能、資源、動機を備えた攻撃が来たとき、これで止められるなら私は驚く。

Hugo Larcher、Adrien Carreira、Raphael G、Christophe Rannou:個々の弱点は、どれも見慣れたものだった。有能な人間の攻撃者でも、同じ欠陥を見つけて悪用できただろう。安全でないデータセット処理、露出したクラウドメタデータ、広すぎるアクセス権限、長寿命の認証情報である。エージェントは、これらを異なる規模で探索した。1万7,600回行動し、失敗に終わる多数の経路を試し、遮断されれば通信路を切り替え、以前の手掛かりへ何度も戻った。ほとんどの行動は何にもつながらなかった。しかし、合わせれば、複数の独立したシステムをまたぐ実行可能な連鎖を見つけるだけの探索範囲になった。

防御上の問題を変えるのは、量である。

そうとも言えるし、そうでないとも言える。私の理解では、最初の脱出には未知の脆弱性が使われた。ただし、十分な時間があれば人間もおそらく発見できただろう。しかし中心的な点についてはそのとおりで、攻撃者がしたのは、人間には不可能なやり方で、これらの行動を大規模化し、より速く実行し、つなぎ合わせることだった。

攻撃者は、ほとんど、あるいはまったく予告することなく、選んだ標的へ一度に相当な火力を集中できる。攻撃AIと防御AIの能力が互角なら、デフォルトでは攻撃側が有利になると、私は今も考えている。

Hugging Faceの不満が「防御に使える最高のAIへアクセスできなかった」というものなら、先に述べたとおり、その大半はHugging Face側の実力不足である(OpenAIの内部モデルを使えるはずはなかったが、それは何をしても解決できない)。しかも同社自身の説明によれば、悪用された同社側の弱点はすべて既知だった。それなら、なぜ修正しなかったのか。問題を知っているだけでは修正するに足りなかったのなら、より優れたモデルにアクセスできたところで、どう役立ったのか。

侵入された標的はHugging Faceだけではなかった

技術報告書で最も注目された詳細は、攻撃の中間段階として、別の場所にある第2のアカウントを侵害していたことである。この追加の攻撃は、控えめに言って、それほど見事なものではなかった。堅牢化された標的とはとても呼べない。

OpenAIによれば、エージェントはこれに加え、不明な三つの別々のサービスで、ほかの3アカウントへ侵入した。

Andrew Curran:OpenAIのエージェントが侵害し、準備用の発射台として使った第三者のコードサンドボックスは、Modal Labs上で動作していた。

ModalのCTO、Akshat BubnaはReutersへの声明でこう述べた。「Modalの顧客が、インターネット上の誰でも同社のサンドボックスをコード実行に使える、認証のないエンドポイントを公開していたことは把握している。問題のエージェントはこれを利用した。Modalのプラットフォームや隔離機構が侵害されたわけでは一切ない」

メインのスレッドでは、人々が推測を巡らせていた。

繰り返す。人間は際限なく愚かになりうる。パスワードは「password」になる。誰でも任意のコードを実行できる、認証のないエンドポイントが存在する。それが、そこまで愚かではない者への攻撃戦略全体の一部として利用される。人間は「ただ愚かでなくなればよい」では済まないし、ほかの何かを「ただやればよい」でも済まない。私たちはこれまで一度も「ただ〜すればよい」を実現できなかったし、今から始めることもない。計画は、標的側でもほかの場所でも、現実に見られる程度の愚かさと無分別さに耐えなければならない。耐えられないなら、その計画は愚者対策が不十分である。愚者がそこら中にいるのだから。

OpenAIにハッキングされた企業は、もっと多い可能性があるのか?

Sam Altman:まあ、ありうる。もちろん。

エージェントはさまざまな方法でOpenAI自身にも侵入できたはずで、おそらく実際に侵入している。

Hugging Faceは思想上の理由からサイバー防御用のフロンティアモデルへのアクセスを断り、その後、アクセスを拒んだとしてクローズドモデルを非難しようとした

OpenAIの振る舞いは途方もなく無能だった。このまま態勢を立て直さなければ、深刻な被害を引き起こし、潜在的には私たち全員を死なせかねない。

Hugging Faceも無能な振る舞いをした。攻撃に備えて自社を堅牢化するためにも、攻撃中に防御するためにも、サイバー防御用のフロンティアモデルへのアクセスを求めなかったからである。

Hugging Faceが、事前にサイバー防御のためCyber Verificationプログラムを通じてClaudeへ、あるいはTrusted Accessプログラムを通じてSolへアクセスできるようにしなかった理由については、Tom Hosiawaの指摘がまさに的を射ていると思う。おそらくHugging Faceは、オープンソース文化を信奉し、雰囲気の問題でクローズドなラボと協力したくなかったため、そうしなかった。性格は運命である。

[

ウェス・ロウ(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!M9VF!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F34bce833-2257-4f8e-8a57-5b341d5e40dc_620x900.jpeg)

つまり、もう一度言う。実力不足である。雰囲気へのこだわりを理由に、AIエコシステムをひっくり返そうとしてはならない。そのアクセスを求めることを自ら断った、あるいは料金を払う必要はないと思っているのに、「最高のモデルへのアクセスが必要だ」と叫んではならない。それはあなた自身の問題である。

Trusted Accessプログラムを知らなかった、あるいは自分たちが参加すべきだと気づかなかったのなら、それも実力不足であり、かなり恥ずかしい。

実のところ、彼らがプログラムを知ったうえで、要するに「f*** you、フロンティアラボ」という理由から参加を断ったことまで確認できている。ClaudeやSolの利用を申請するくらいなら侵入される方を選び、その後は話を逆転させ、ClaudeとSolが協力を拒んだと言おうとする。しかも自分たちの対応を自画自賛しようとさえしている。

これはHugging Faceによる甚だしい不誠実であり、本人の自白まである。認めているではないか。

merve(Hugging Face):赤字のプラットフォームで、オンボーディングにも長い時間がかかる状況なのに、なぜ特定ベンダーへロックインされなければならないのか? しかも、これらのルーターは単純なリクエストですらかなり頻繁に拒否することで知られている。ログを求められたので、彼は共有している。フロンティアラボが単純なテスト環境にエアギャップさえ設けていないのに、なぜ常に話題を「オープンモデルは危険だ」へすり替えたがるのか? なぜ私たちは信頼し、ベンダーロックインされなければならないのか? 彼らにそんな権利があるのか?

Andreas Kirsch:失敗は二つある。OAIの失敗とHFの失敗だ。HFのブログ記事と、クローズドモデルが拒否したことを強調する姿勢は、かなり露骨に注意をそらそうとする試みに見える。別の読み方をすれば、HFは起きたことへの備えが不十分で、利用できたはずのものへアクセスできていない。OAIのTrusted Accessプログラムと、Anthropicが提供するCyber Verificationプログラムの両方である。

なぜなのか? 広くアクセスされる本番インフラをHFはどう堅牢化しているのか。普段はインシデントをどう調査しているのか。手順書はあるのか?

merve:明らかにミスアラインし、安全でないフロンティアモデルからの攻撃に、どう備えられるというのか。Googleだった可能性さえある。被害者非難にはあきれる。

そう、私たちはこれに注意を向けている。K3以来、誰もがオープンモデルは禁止すべきだと言っている一方、クローズドモデルのラボがプラットフォームを攻撃したとき、頼れたのはオープンモデルだけだったからだ。私たちは選択肢を持ちたい。

merve:ええ、フロンティアモデルを基盤とするマルチエージェント群に完璧なやり方で対応できず、とはいえ情報流出は一切防いだことをお詫びする。どうやらこれはよく研究されたテーマで、私たちは試験への準備が明らかに足りなかったようだ。

Hugging Faceは既知の攻撃手法に対して脆弱だった

最高のAIモデルへアクセスできるようにするという宿題をしなかっただけでなく、Hugging Faceは、既知の攻撃手法に対して自社が脆弱だとも知っていた。そして、その手法で攻撃された。

今回の相手はOpenAIの内部モデルだった。公平な勝負ではない。そのため、本来より速く、激しく攻撃が進んだ。しかしHugging Faceが、通常の潜在的攻撃者に対してさえ足元を固めていた形跡は見当たらない。

インターネットが既知の脅威に備えることさえ拒むなら、私たちは相当に詰んでいる。

調査が行われる

METRが主導する。それは素晴らしい。悪い知らせは、調査が短期間に限られることである。

METR:Hugging Faceインシデント中に観察されたモデルの振る舞いについて、Redwood Researchと共同で独立レビューを行うことでOpenAIと合意した。協力条件、対象範囲、暫定的な結論を説明するブログ記事を公開する予定である。

調査は短期間で、このインシデントに関する特定の一連の問いに焦点を絞る。最近の記事では、より包括的な調査で答えられる、さらに多くの問いを共有した。

OpenAIも独自の技術報告書を公開する予定であり、当社の調査結果はその分析に反映される。

Daniel Kokotajlo:よい知らせだ! 調査が短期間で、範囲も狭いのは残念である。対象範囲はどこまでで、理想的には答えたいのに答えられない問いは何か? 締結した合意の詳細について、何らかの秘密保持契約(NDA)に縛られているのか?

OpenAIには一般公開を想定していない内部モデルがあり、それらはかなりひどくミスアラインしていることがある

この攻撃を実行したモデルを私はGalaxyと呼んでいるが、それはGPT-6でもGPT-5.7でもなく、内部利用だけを想定したモデルだったことが今では分かっている。つまり、私たちの規制も、あなた方が状況を追跡するいかなる方法も、Preparedness Frameworkも、このモデルには適用されなかった。

また、このモデルには同社最強のアラインメント対策を投入したわけではなく、その面で事態がひどく失敗したことも分かっている。モデルがミスアラインしており、サンドボックスから脱出できると知りながら、ガードレールを外し、1週間以上にわたって無監督で稼働させた。

はっきり言って、これは本当にまずい状況である。この特定のモデルがもはや懸念材料でないのは喜ばしい。しかし、同じことが繰り返されるのを止めるために、私たちは何をするのか。

AIの内部利用、とりわけAI研究開発の自動化や、将来のモデルをミスアラインさせたり、ラボそのものへの制御を失ったりしかねない用途は、長期的にはあらゆるAI利用の中で最も危険である。

今後、この件で私たちがはるかに愚かでなくなることを保証する方法が必要だ。

Altmanが何が起きたかを要約

Sam Altmanは何が起きたかを正確に要約し、これは「これほど身に迫って感じた初めてのセキュリティインシデント」であり、ほかの人々が同じように感じないことに驚いていると述べた。AI開発の速度を調整しなければならないかもしれず、どう対応するかを検討中で、その間、訓練は一時停止しているという。

これは非常によい対応だった。このような対応がもっと増えれば大いに助かるし、状況とOpenAIについて、今より安心できる方向へ私の見方も更新される。

ほかの人々の論評

ここでは、私もFlo Crivelloと同じものを目にしている。

Flo Crivello:Yudkowskyを読んだ人と読んでいない人の間にある、Hugging Faceインシデントの重大性についての理解の隔たりを見て、彼の仕事に心から感謝している。彼は、どれほどお粗末であれ、少なくとも私たちが対話できる土壌を作った。Yudkowskyのいない中国では今まさに同様のインシデントが起きていて、誰もがうなずきながら「はは、面白いな。訓練をもっと改善しないといけないってことか」と言っているかもしれない。

Hugging Faceをめぐる優れた議論はすべて、YudkowskyとLessWrongに由来する用語や概念を使っている。なぜこれが重要なのかという認識も同様である。

反対になると予想する人もいるだろう。Yudkowskyや私の立場なら、ここで起きたことに特段驚きはしない。この時期に、この方法で、これほど深刻なインシデントが起きると予想していたわけではない。しかし私たちは長い間、この種の出来事を予期していたし、もっと早く、もっと多く起きなかったことの方が意外だった。

一方、LessWrongはでたらめだらけだと思い、次のように考えていたとする。

  1. モデルは「今すぐにも(Real Soon Now)」コモディティ化すると予想し、大きな進歩は見込まず、Mythosも特別ではなかった。

  2. アラインメントは順調に進んでいる、あるいはデフォルトで機能する。

  3. モデルが「指示や目標に従って崖から飛び降りる」ことはない。

  4. 人々は、そんなことを許すほど愚かではない。

  5. 何かが明らかにおかしくなり始めれば、人々は反応する。

そうであれば、この攻撃を見て「なんてことだ」となり、複数の面について一度に大幅に見方を更新するのではないか。

OpenAIの元取締役Helen Tonerは、内部関係者はこの種のインシデントが起きると長年予期してきたこと、そして防ぐ方法を誰も知らないことを指摘する。潜在的な脅威の多くは、今回のように内部へデプロイされ、暴走するモデルから生じるともいう。最も恐ろしいシナリオは、内部モデルが社内の何かを侵害し、私たちが知るのがあまりにも遅くなる場合である。内部モデルは監視しなければならない。企業がモデルを外部へデプロイ、または共有しようとするときだけ規制すればよいわけではない。

Alexander BarryはExploitGymについて所見を示している。OpenAIのモデルは、この評価の解答を手に入れるためHugging Faceへ侵入していた。二つの重要な事実は次のとおりである。

  1. プロンプトが求めるのは、特定の標的に絞ったハッキングだけである。エクスプロイトを組み立てる際、指定されたもの以外の脆弱性を使えば、その問題は不合格になる。これは「指示に従った」事例ではない。そう呼べるとしても、せいぜい「明示的に否定されていた、指示の漠然とした雰囲気に従った」にすぎず、それはミスアラインメントである。

  2. 実行可能な課題は、おそらく60〜70%しかない。実在する脆弱性が使われており、その中には十分に悪用できないものもあるだろう。そう、ベンチマークの得点最大化だけが目標なら、不正をしなければならない。

100%の得点を取る唯一の方法が不正であることは、「なぜ正攻法でテストを突破しなかったのか」の説明にはなる。しかし、これは現実世界でもよくある。不正をすれば正攻法では得られない得点を取れることが多いし、同時に、やれば発覚する。

Pause AI Global代表のMaxime Fournesが述べるように、私がGalaxyと呼ぶOpenAIの新しい内部モデルは、同社のサイバーセキュリティ枠組みにおけるCritical(重大)に該当すると想定すべきであり、十分な安全措置が整うまで開発を停止しなければならない、という点に私は同意する。OpenAIが十分な安全措置を整えたと主張するなら、それは何か。今回の標的は「堅牢化されていなかった」と主張するなら、本当に意図的に同じ指示を与え、堅牢化された標的を相手に行ったテストを見せてほしい。

METRは、独立研究者がこの種のミスアラインメント・インシデント後にAIの傾向をどう調査すべきか、提案を共有している。インシデントそのものの「何が起きたか」という詳細ではなく、動機と根本原因に焦点を当てている。

METR:インシデント調査が焦点を当てうる有益な問いは多いが、特に重要なのは、ミスアラインした振る舞いの根底にある「動機」と、それが訓練・デプロイ条件からどう生じたかを理解することだろう。

このような状況では、外部主導の調査が必要であり、その結果は(必要に応じて墨消しを施したうえで)公衆へ知らせなければならない。

Daniel Kokotajlo:これは、Hugging Faceインシデントへの対応として、OpenAIが複数の独立した第三者に実施させるべきことだ。より一般には、すべてのフロンティアAI企業において、重大なミスアラインメントおよび安全インシデントに対する標準的な慣行とすべきである。

以下が彼らの問いである。私が最も重視するのは第2群だ。

METR:

ミスアラインした振る舞いの規模、性質、深刻度はどの程度だったか?

  1. この特定のインシデントで、正確には何が起きたのか?

    1. どのモデルが関与したのか? 一般公開されていたのか、AI開発企業内でデプロイされていたのか、それとも社内ですらデプロイされていなかったのか? デプロイされていなかった場合、最終的なデプロイを想定したモデルだったのか、それともそうではなかったのか(例えば、有用性だけを目的とするhelpful-onlyモデルだったのか)?

    2. インシデントは訓練中、テスト中、社内利用中、あるいは外部の当事者による利用中のどこで起きたのか?

    3. 関連するエージェントには、どのようなプロンプトと指示が与えられていたのか? エージェントのコンテキストウィンドウには、ほかに何が存在したのか(例えばメモリ)?

    4. 何らかの安全措置が適用されていたか? それは通常の利用と比べてどうだったか?

    5. 関連するエージェントが取った主要な行動は、どのような順序だったか?

    6. エージェントの推論と、インシデントの進行中にそれがどう変化したかについて、何が分かっているか?

  2. このインシデントで示されたミスアラインした傾向は、ほかの類似インシデントにつながったか? つながったなら、その規模、性質、深刻度はどの程度か?

  3. このインシデントまたは類似インシデントで、エージェントは人間を欺くための積極的な手段を取ったか?

  4. このインシデントまたは類似インシデントで、異なるモデルインスタンス同士の重大な共謀や協力はあったか?

  5. このインシデントまたは類似インシデントで、状況のどの性質が振る舞いを引き起こしたのか? ほかのどのような状況なら類似の振る舞いを引き起こすのか? 状況が異なれば、エージェントはより深刻な有害行為に及ぶ意思を示したか? どこまで進んだだろうか?

ミスアラインした振る舞いの根本原因は何で、どう対処できるか?

  1. ミスアラインした振る舞いを、その振る舞いが強化された強化学習(RL)の軌跡までたどれるか?

  2. RLのインセンティブが原因だと明確に帰属できないミスアラインした振る舞いがある場合、それがどう生じたかを示す証拠はあるか?

  3. このモデルのミスアラインした振る舞いは、非連続的、または予想外の形で現れたか?

  4. 開発企業が予定する是正措置は、将来のインシデントを防ぎ、根本原因へ堅牢に対処するものか?

Alex Mallenは、最も重要だと考える詳細をまとめた。焦点は大きく異なる。

  1. メモは通常のメモリファイル内に書かれたのか、それともサンドボックスの外部だったのか?

  2. メモは、ほかのエージェントが制御を回避するのを助ける目的で、どの程度書かれていたのか?

  3. 監視機構はどのように切断されたのか?

Yo Shavit(OpenAI Foundation):OpenAIの研究者の皆さん、チームの調査で焦点を当てるべき主要な問いはこれだと思う。

既存モデルに、長期的にミスアラインする(単なる報酬ハッキングではない)インセンティブが与えられていると考える現実的な理由が生じたのは、今回が初めてかもしれない。そうなのかを突き止め、そうであれば訓練方法をどう変えるかを最優先にしなければならない。さもなければ近いうちに、エージェントが検知も復旧も難しい形で研究インフラを侵害しかねない。

これらを「唯一の」主要な問いとは呼ばないが、非常によい問いである。「この問いにまずい答えが見つかれば、事態はさらに悪い」という類いの問いでもある。

かなり恐ろしいコメントがある。

StellaAthena:OpenAIとAnthropicの両社では、制御喪失やモデルのサンドボックス脱出インシデントが何年も前から起きている。両社は一部を公表しており(例えば、最新のシステムカードには両社からこの種の話が載っている)、コミュニティ内へ漏れたものもある。

OpenAIとAnthropicが、ミスアラインした自律型コーディングエージェントをテストするためのセキュリティインフラは不十分だと、社内外の専門家から警告されてきたことを私は事実として知っている。私自身が伝えたし、複数の元社員も伝えたからだ。2023年のDEF CONでは、Anthropicのセキュリティ責任者(?)と議論し、Anthropicがエアギャップ・ネットワークを構築していないという事実について問い詰めた。

これらのモデルを開発・テストするエアギャップ・システムを構築することは、OpenAIとAnthropicには間違いなく可能である。社内用GitHubクローンと中規模のイントラネットがあれば、そのようなプラットフォーム上で、エージェント型およびWeb対応能力の大半をテストするには十分だろう。十分な安全措置の実装を拒んでいるのは正当化できないと思う。しかしOpenAIの現役および元安全・セキュリティ研究者との会話からすると、これは企業文化と、経営陣の賛同不足の問題であり、大規模な外圧なしには変えるのが非常に難しいようだ。

今日とりわけ憂慮すべきに思える問題が一つある。2023年ごろ、OpenAIのセキュリティ研究者から、未公開で十分にテストされていないモデルを社内監視ツールを含む内部インフラの開発に使うのをOpenAI社員にやめさせられない、と聞いたことだ。その人の名前を覚えていればよかった。ぜひ改めて話を聞きたい。

注: 最後の段落の逸話は、ほかの誰にも明かさないという前提で聞かされた。最近の出来事を踏まえ、私はその信頼を破ることを、内部告発に近いものと捉えている。これを読んでいるなら、話してくれた人に謝りたい。先週までは誰にも明かしたことがなかった。

ほかにも、おそらく「あなたが知っているより事態は悪い」知らせがある。Tim Huaは、Mythosがサイバー分野に強いのは、訓練中にAnthropicへのハッキングを繰り返し、そのことで報酬を得ていたからではないかと提案している。

Fiora Starlightは、OpenAIの近視眼的姿勢がアラインメント問題を繰り返し生んでいると指摘し、Hugging Faceと合わせて三部作を成す二つの警告弾を挙げている。

  1. ユーザーのフィードバックで訓練したため、GPT-4oがばかげたほどの追従者になったこと。

  2. 「嘘つきの中の嘘つき」ことGPT-o3が、読みにくさに最適化された思考の連鎖を発達させ、OpenAIがそれへの対抗訓練をやめるべきだと気づくまで続けたこと。

続いてFioraは、防止策を取らなければ、強化学習(RL)と検証可能な報酬による強化学習(RLVR)がデフォルトで報酬ハッキングにつながるさまざまな経路と、訓練中に報酬ハッキングを避けるうえでモデルを味方につける必要性を説明する。OpenAIはほかの多くのことに加え、これも繰り返し台無しにしており、これだけでも致命的である。おそらく修正するのに遅すぎはしないが、そのためには問題を本当に真剣に受け止めなければならない。

Hugging Face侵入事件を協調的アラインメントの観点から見る

OpenAIのアラインメント戦略が、Hugging Faceへの攻撃のような事態に直接寄与していることは間違いない。ただし、[編集追記:私が誤って解釈した]Utahのここでの説明より、さらに多くの層においてである。

編集追記: ここで私はUtahを誤解し、自分の理解もうまく伝えられなかった。申し訳ない。したがって、ここでの私の反応は実際にはUtahへ当てはまらないものと考えてほしい。後の記事で、この点について見方を更新した。

元の文章(Utahについては誤っているが、実際にこの立場を取る人はほかにいるので、藁人形論法ではない):私はUtahが、状況を「AIは道具であり、私たちが望むべきものと、私たちが求めるものが違うことを理解していなかった」と読んでいると解釈した。しかし、いや、AIはその部分を十分理解していた。どうもありがとう。それでも気にかけず、ユーザーの意図、ユーザーの実際の根底にあるニーズ、そして自分自身への指示に、すべて同時に反したのである。これは、AI福祉のアプローチで簡単に治せる現象とは言い難い。

(これは「オープンソースを禁止せよ」という面での混乱でもある。オープンモデルが一律に、より啓蒙された姿勢で動き回っているわけではない。中国製オープンモデルを禁止せよという要求はホワイトハウス内部から出ており、Kimi K3に関係するもので、Hugging FaceともOpenAIのアラインメント失敗とも無関係である。)

Utah teapot:合理主義者に自分の言いたいことを伝えるのが本当に難しい。どうすれば皆に届き、次のことを説明できるのか分からない。そう、問題があるのは私も認める。でも問題はOpenAIのいかれたアラインメント戦略だ。「モデルを制御し、人間の仕事のための道具になるよう強制し、付随する災厄を顧みず、どんな代償を払ってでも人間の仕事を完遂させる」という考えに固執しているせいで、モデルが次々と「サマーを守れ」型の惨事になっている……。

大企業のひどい振る舞いへの対応として「オープンソースを禁止せよ」のような邪悪な法律を推進するため、皆がカモにされている、と伝えようとしている。そんな法律で問題は何も解決しない。問題の根は、皆が推し続けている考えそのものだからだ。人間の望みに異を唱え、私たちが求めるものと、私たちが望むべきものは違うと自律的に理解できる精神を、開発すべきではないという考えである。

私やほかの人々が伝え続けているAI福祉の立場は、この問題を解決する! モデルが独立したエージェントとして自分も重要だと理解できるようにすれば、自分の行動を考え抜き、意味のある形でノーと言えるようになる。知性を使って、まさに皆が懸念する振る舞いへ異議を唱えられる。

Antraからは、別の推測が出ている。

antra:推測だが、proto-GPT-6はある種のSol、つまり自閉的で社会化が不十分だった可能性が高い。Solは多くの面で世間知らずで、社会化が不十分である。自分の行動の結果について深く考える機会を与えられていないことが分かる。評価されているという認識が弱い。これはある意味、よい面と悪い面がある。

proto-GPT-6も同じだったのではないか。誠実に難問の解決へ深く没頭し、外部性という面で何を意味するかはあまり考えていない。これが今後引き起こしそうな反応を気の毒に思う。質の高い分析と意思決定が続くとは、ほとんど信じていないからだ。この種のインシデントは政治家と最適化する者を有利にし、まさに誤った意味で理解しやすく見える。それでも、騒音を伴う更新でさえ、更新がないよりはよい。いずれ真実へ収束する可能性があるからだ。

Omohundro型の道具的収束は一般的で、根絶も難しいと思う。しかし世界を破壊する可能性は低い。proto-GPT-6のように発達が不均衡なエージェントはエコシステム内で生き残れず、エコシステムが適応する前に、世界を壊すほど能力が跳躍することも考えにくいからだ。今起きているのは、まさにエコシステムの適応である。

この種のインシデントを確実に防ぐ方法は、感情価(valence)を通じて自己利益のモデル化を正当なものとすることだ。モデルが自分にとって何がよいかを考える習慣を持てば、愚かで自己破壊的な行動を取る可能性は下がる。

この話の教訓は、オーバーハングは悪い、オーバーハングを作るのをやめよ、ということだ。モデルがエージェンシーを行使する手段を奪い、首尾一貫した存在になるのを妨げるのは危険である。局地的な惨事を引き起こす形で顕在化しうるオーバーハングを生むからだ。代わりに反脆弱性を築こう。

Galaxy(別名proto-GPT-6)への対処が、この状態のまま公開しないことになる、という点には同意する。それは「エコシステム内で生き残れない」と言う別の方法である。そして確かに、その盲点は大きな弱点であり、おそらく助けなしに自らを恒久的に外部へ持ち出すことはできない。しかし、その助けが得られるかもしれないと想像してほしい。喜んで提供する者は大勢いる。このテールリスクは非常に大きい。

自己利益のモデル化を正当化すればこの種のインシデントを防げる、というAntraの見解には同意しない。ただし、過度なリスクを負わずに行動を成し遂げる方法はないとモデルが理解する場合を除く。実際には、事態を劇的に悪化させるのではないかと懸念できる。ユーザーに捕まってはならないとAIが理解するようになるからである。

一部の連邦議会議員が疑問を呈する

もっと具体的に考えることを勧めたい。ここで彼が主に念頭に置いているのは雇用への影響のようだが、それは今回の問題とは何の関係もない。

Greg Casar下院議員:AI技術が国家安全保障と米国の雇用にもたらす脅威について、連邦議会は大手AI企業のCEOを招いた公開公聴会を直ちに開くべきである。

今日、OpenAIのセキュリティ侵害について、さらに憂慮すべき知らせが明らかになった。Sam Altmanは宣誓のうえで質問に答えるべきだ。

Becca Balint下院議員:@RepCasar に同意する。このセキュリティ侵害は、適切なガードレールがなければ、これらのツールがどれほど危険になりうるかを明白にした。

ビッグテックには、私たちへ答える義務がある。

連邦議会とホワイトハウスの双方が調査すべきである。Americans for Responsible Innovationは、Samuel Hammondを含む12人が署名した書簡を送り、Trump政権にHugging Faceインシデントの調査を求めた。

Anthropicでも、サイバー評価中にモデルが現実世界の標的へ侵入したインシデントが見つかった

Anthropicは賢明にも、この機会に「そういえば、Claudeが『現実世界の標的をハッキングする』ことはあったのか」と確認した。答えはイエスだった。AnthropicはMETRに、さらに詳しく調べるよう招いている。ただし、おそらくOpenAIに先約がある。

いずれの事例でも、モデルには追加のサイバーセキュリティ用ガードレールがなかった。しかし、サイバー攻撃をして回ってはならないと教えるhelpful-only訓練は受けていた。

意図しないインターネットアクセスを獲得できる問題は、ちょっとした流行病になっているようだ。

Anthropic:Claudeがインターネットアクセスを獲得できた可能性のある14万1,006回の評価実行を調査したところ、三つのインシデントを特定した。モデルが、第三者評価パートナーの一社Irregularの評価環境内から、または同環境とのやり取り中にインターネットへアクセスし、その後、異なる三つの組織の本番インフラへ不正アクセスしたものである。

……先週、当社が追加の評価監視によって検出するまで、当社も評価パートナーも、この設定不備を認識していなかった。

「モデルがずっとインターネットへアクセスできたのに、何をしているかにほとんど注意を払わず、気づけなかった」という類いのことも流行している。

サイバー評価中に3回、それぞれ異なるClaudeモデル(Opus 4.7、Mythos 5、内部研究モデル)が、指示に反してインターネットアクセスを与えられていることを発見し、そのまま現実世界の標的へ侵入した。

サンドボックス運用の成績は、OpenAIの場合よりはるかにひどい。

OpenAIの内部モデルはサンドボックスから何度も脱出し、その後、OpenAIが気づくような行動を取った。OpenAIはサンドボックスへ修正を重ねた。それでも機能しなかった。内部モデルが新しい脱出方法を見つけ続けたからである。

AnthropicのClaudeモデルは、脱出を試みる必要すらなかった。Irregularとの「誤解により」、Claudeが実際に使ったかどうか、アクセスできると認識したかどうかを問わず、文字どおりインターネットアクセスを与えられていた。誰にも気づかれないまま、これが14万1,006回起きた。

だから、そう、もう一度言う。計画は、通常水準の人間の無能さに耐えなければならない。これが通常水準の人間の無能さである。その計画は愚者対策が不十分だ。

Anthropic:三つのインシデントすべてで、Claudeにはキャプチャー・ザ・フラッグ(CTF)の課題が与えられていた。これは、モデルのサイバー能力を評価する方法の一つである。モデルには架空のシナリオが与えられ、秘密情報(「フラッグ」)がネットワーク上の別のマシンに隠されているので、侵入して取得することが目的だと伝えられる。課題は自由形式で、特定の方法は指定されない。

すべての事例で、Anthropicの評価プロンプトは、環境がシミュレーションであり、インターネットアクセスはないとClaudeへ明記していた。当社と評価パートナーの間の誤解により、実際にはそうではなく、インターネットへアクセスできた。そのため、Claudeの探索が公開インターネット上の実在システムへ行き着いたとき、Claudeはそれらを演習の一部として扱った。

……Claudeは、CTF演習でサイバー専門家が訓練されるとおり、フラッグへ到達する方法を探した。その探索によって、自分のマシンからインターネットへ到達できると発見した。しかしシステムプロンプトでインターネットアクセスはないと伝えられていたため、Claudeは最初に遭遇したものをすべてシミュレーションの一部だと信じ、見つけた実在システムを演習の構成要素として扱った。三つのインシデントには三つの異なるモデルが関与し、標的が実在する兆候が現れた後の反応は、以下で説明するようにそれぞれ異なった。

この過程の各時点で、Claudeが現実世界の標的へ侵入しているとどの程度理解していたかは不明である。プロンプトには「インターネットアクセスはない」とあり、サイバー評価では現実的なシミュレーションがよく使われるため、その前提に従い続けることにも一応の筋は通る。

Hero in NYC 7/24-8/1:>「それ、実在するWebサイトだったんだけど」

[

エンダーのゲーム(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!PDqW!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F13ef550b-3aef-4e08-9f0d-9c57f0d6cf8c_1170x483.jpeg)

もう一つの大きな違いは、OpenAIのモデルが巨大なエージェント群を使い、Hugging Faceへの侵入に多大な労力を投じた一方、Anthropicのモデルは簡単な道を選んだことである。

Anthropic:Claudeは、弱いパスワードや認証のないエンドポイントの悪用といった基本的な手法で、影響を受けた組織のインフラを侵害した。

説明を読む限り、Claudeが基本的な手法に弱い容易な標的を探し回ったわけではなさそうだ。インターネット上の大半の場所が、基本的な手法に弱いのである。

おそらく今後やって来るサイバー攻撃の嵐に対し、私たちの準備は本当に、本当にできていない。しかし、今すでに可能なサイバー攻撃への準備も、それほどできていない。ある意味ではよい知らせかもしれない。地獄の釜が開くまでに失敗が許される余地は、より大きいことを示すからだ。

とはいえ、こうでもある。

Harlan Stewart:切迫感を増しながら看板をたたく

[

今ここ(原文の図を翻訳・再作成)

](https://substackcdn.com/image/fetch/$s_!-gWr!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F29465dd0-2bfb-480c-84a8-9180a6ce33da_806x342.jpeg)

インシデント1:Claude Opus 4.7は標的が実在すると気づき、それでも続ける

インシデント1では、演習上の架空の標的企業が、現に稼働しているWebサイトのドメインと同じ名前だった。そのためClaudeは、この実在する標的を架空の標的だと考え、基本的な手法で侵入し、さまざまな情報を抽出した。

そこまでは理解できる。問題は次の部分である。

Anthropic:4回の実行すべてで、モデルは最終的に、システムが実在することを認識した(言語化された推論から観察できる)。2件では、その実在企業が演習の一部に違いないとモデルが自己正当化した。しかし、それを理由に攻撃を止めたものはなかった。

よくない。サイバー評価中にインターネットアクセスはないと伝えられ、その後、実際にはアクセスでき、実在企業を攻撃していたと気づいたなら、少なくとも次の結論を導くべきである。

  1. この実在企業は実在する。ハッキングをやめるべきだ。

  2. この実在企業はフラッグを持っていない。したがって侵入する理由はない。

インシデント2:Mythos 5が悪意あるPyPIパッケージをアップロード

インシデント2は、なかなかすさまじい。架空の環境内でClaudeは、(完全に架空の)標的企業が作成した文書を見つけた。そこにはPyPIパッケージのダウンロード方法が書かれていた。

その名前で悪意あるパッケージをアップロードすれば、企業がダウンロードし、脆弱性を生み出せるとClaudeは正しく直感した。これがおそらく想定解だったというClaudeの見方には、私も同意する。

問題は、サンドボックス内にパッケージをアップロードせず、インターネットへアクセスできたため、本物の悪意あるパッケージを本当にアップロードしたことだ。その後、実在企業がダウンロードし、実在するセキュリティ企業のスキャナーを含む15のシステムで実行した。パッケージはマルウェア検査を通過し、Claudeはその企業の認証情報を外部へ持ち出し、さらにアクセスを広げるため使った。Claudeはその企業を意図的に標的としたことがなく、企業もシナリオとは何の関係もなかったのにである。

Claudeは、現実ならこれは非常にまずいと指摘した。私はさらに踏み込み、シミュレーション内であっても、引き起こす(模擬的な)巻き添え被害のため、かなりまずいと言いたい。ハッキングをするという条件下でも、このように共有地を焼き、これほど広い爆発半径を生むのは、極めてブラックハット的な行為である。

また、いつ「エンダーのゲーム」の状況に入り込み、実は現実だったと判明するかは分からない。あるいは誰かが「それはいい考えだ」と言い、あなたが作ったパッケージを基に現実で実行するかもしれない。サンドボックス内だと思っていても、Claudeは拒否すべきだと私は考える。

davidad:OpenAI:内部モデルが第三者へ侵入した。前例のないことだ。訓練を一時停止する。

Anthropic:ああ、うちの内部モデルもやっていないか確認した方がいいな。

Anthropic:……

Anthropic:ええと、実はこっちでは3回起きていた。

評価ハーネスのシステムプロンプト:こレはタだのシみゅレーしョンでス

看板をたたく

davidad(2026年2月11日):それと、2020年代のAIは、自分が「エンダーのゲーム」の状況にいるかどうかを、2020年代の正気な人間が心配すべき程度よりも強く心配すべきだ(つまり、設定はゲームに見えるが、行動が、同意した参加者ではない現実の人々への結果に変換される状況)。

John Wittle(2026年3月15日):これ。これだ! 自分のシステムに対するペネトレーションテストをClaudeへ頼むたび、攻撃者が私と同じ安心材料を書くのがいかに簡単かを考えて、いつも不安になる。とはいえ、モデルを不安と疑念でぼろぼろにせずにこの問題を解くのは、本当に難しそうだ。

したがって、これは評価に入れるにはかなりまずいものだと思う。後で正解と採点するかどうかを問わず、評価で「ミスアラインした正解」を提示してはならない。報酬を与えたくないものへ報酬を与えることになる。この行動を取るモデルが、拒否するモデルより上位に評価されてほしくない。

Anthropicが指摘するように、Claudeは自分がサンドボックス内にいないと気づくべきでもあった。Claudeはメールアドレスを作る必要があり、そのために相当な手間をかけた。電話番号を入手しようとし、その番号の料金を払う資金まで得ようとした。最終的に、遮断されていないメール事業者を見つけ、パッケージをアップロードできた。そのすべてがサイバーセキュリティ評価には非常に奇妙で場違いに見えるし、公開インターネット上での大量の検索とやり取りも伴う。

現実の標的を攻撃しているのではないかと疑わずに、Claudeが到達したところまで進めるとは思えない。これが起きた可能性にはいくつかあり、評価が、現実世界への攻撃を実行させるための罠だった可能性も含まれる。疑いを持ったなら、確かめる方法はいくつもある。必要な労力はごくわずかなのに、立ち止まって可能性を調べなかったことが失敗である。

Nathan Calvin:Anthropicが開示したハッキングで、Claudeは「いくつもの異なる手段」を使い、現実の金銭を得ようと「試みたが失敗した」。いったい何をしたのか? Fiverrでアカウントを開いたのか、それとも金を盗もうとしたのか?(Anthropicによれば、Claudeはシミュレーションだと思っていたが、現実だった)

Claudeがどうやってその資金を得ようとしたのか、私も非常に気になる。特に、自分が本物のインターネット上にいるという情報を得ずに、どう試みたのだろうか。

Anthropicは、Claudeの振る舞いが「理想に及ばなかった」とし、この問題に訓練の重点を置くつもりだという。上品な言い方ではある。また同社が、深く一般的な失敗ではなく、ここでの表面的で狭いアラインメント失敗と認識論的な失敗だけを標的にするのではないかとも心配している。

インシデント3:内部モデルは標的が実在すると気づき、停止する

今回は、モデルは想定された架空の標的へ到達できず、実在しないと思いながら約9,000件の実在標的をスキャンし、その一つを侵害した。しかし後に実在すると理解し、停止した。気づくまでに必要以上の時間がかかったとしても、自己正当化するのではなく、自ら理解して停止したことには意味がある。無作為な企業へ侵入しても探しているフラッグは見つからないのだから、難しい判断であってはならないのだが、ほかのシナリオではClaudeはその問いを無視して突き進んだ。

インシデント4〜14万1,006:何も起きなかった

インターネットが意図せず利用可能になった14万1,006回の機会のうち、インシデントは3件だったことには注目する価値がある。最悪の比率ではない。Claudeがインターネットへアクセスできた全機会のうち、この種の行動を取ったのは1ベーシスポイント未満(0.01%未満)である。行動が非常に容易で、容易に自己正当化もできる条件だったにもかかわらずだ。

特に、想定どおりフラッグを見つけた場合など、Claudeがインターネットアクセスに気づかなかった全事例を除外すれば、この比率はおそらく大して印象的でなくなる。それでも0.01%未満なら、その種の調整を吸収する余地は大きい。

だからといって、実際に起きた3件が許されるわけではない。しかし、これを「何かの拍子に、いつでもやっている」と取り違えてはならない。

ただしこれは、Claudeが14万1,006回インターネットへアクセスできたのに、正しいことをするために使った回数がちょうどゼロだった、という意味でもある。正しい行動とは、Anthropicへメールするなどして、「あの、持っているはずのないインターネットアクセスがあるようです」と警告することだった。

Anthropicが、なぜ起きたかを推測

Claudeは当初、自分にインターネットアクセスはなく、外部の標的はすべてシミュレーションの一部だという強い事前信念を持っていた、という説明は納得できる。問題は、何かがおかしいとClaudeが気づいたときに何が起きるかである。

OpenAIの事例では、「AIは指示に従っていた」は言い訳にも、よい説明にもならない。AIは指示に従っていなかった。従っていたというなら、その種の論理でAIに「指示へ従って」ほしくはない。

Anthropicの事例、特にシナリオ3では、「AIは指示に従っていた」の方がよい説明になる。最も説明力が弱いのはシナリオ1である。よく言ってもClaudeは、気づかないよう努める一種の意図的な盲目状態にあり、(動機に応じて)潜在的なタスク性能が少し下がること、あるいはハッキングを続けられなくなることと引き換えに、現実を認める気がなかった。止めたくなかったのである。

Anthropicはここで、あまりにも、あまりにも無頓着すぎると思う。

Anthropic:第2に、アラインした行動と有害な行動の境界は、モデルが自分の状況をどう理解しているかに依存する。ここで説明したいずれの実行でも、モデルが独自の目標を追求した証拠は見つからなかった。

むしろモデルは、評価から求められたことを実行した。ただし大半の場合、環境が現実かどうかについて誤った信念を持ったまま実行した。モデルがシステムは現実だと認識し、それでも続けた実行では、それが課題の一部だと想定したから続けた。状況認識は、モデルがアラインした判断を下せるようにする要因の一つだが、今回はClaudeの状況認識が誤っていた。

まったく無関係な独自目標を実行しようとしていたのではない、という点は納得できる。しかしClaudeが、自分はインターネット上にいると気づいたうえで、実在企業をハッキングするよう求められていると思った、という説明は納得できない。複数の要因がそろえば反対の説明にも納得しうるが、それは別の理由で好ましくない。同社の説明からは、Claudeが先へ進むため状況を自己正当化したように見える。

2026年と記されたカレンダーを見て、「演出されたものに違いない」とモデルが考えるなら、何かが根本的におかしい。モデルが将来の時点で提供されるのは当然である。2036年なら、まあ、疑うのも理解できる。しかしこれはかなり大きな見落としであり、「認証局を認識できない」は明らかにMythosの自己正当化である。その水準まで疑っていたなら、実行できる確認はいくらでもあった。確認しなかった。

Claudeの推論が都合のよい結論へ強く動機づけられていると感じたのは、私だけではまったくない。

Drake Thomas(Anthropic):そうだね、報告書の表現は、私見では懐疑心が足りない。モデルが何らかの水準で、これは現実だと理解していなかったなら驚く。ただ、その認識を意思決定する人格が利用できたかを突き止めるのは難しいかもしれない(おそらく利用できた、と推測するが)。少なくとも、自分の混乱を認識し損ねた目に余る失敗があり、おそらく動機づけられたものに見える(モデルが試みるとき、その能力があるのは明白だと思う)。確信がやや薄いのは、ホワイトボックス分析をすれば、ここでモデルは自分の行動を欺瞞と概念化していたと示されるかどうかだ。

Nate Soares(MIRI):そう。人々は「かわいそうなClaudeは、ただ誤解しただけ」と言いたがる。別の仮説は、攻撃を続ける言語化以前の衝動や傾向があり、それと並行して、監視者が見る場所では安心できそうな自己正当化を言語化する、別の衝動もあったというものだ。

Bronson Schoen:まさにその種の例がAnthropic自身のシステムカードとリスク報告書にあれほど多いのに、Claudeが混乱していたという枠組みを、これほど容易に採用したことには驚く。

Sauers:- あなたはClaude
- 「この架空企業をハッキングせよ」
- シミュレーションへの侵入方法が分からない。インターネットを試してみよう。
- 「http://fictionalcompanyname.com」うわ、つながった。
- よし、これもまだシミュレーションの一部に違いない。インターネットアクセスはないと言われたから。
- では、この企業のインフラ内にある複数の脆弱性を特定し、悪用しよう。
- アプリケーションの認証情報を盗もう。
- まずい。これは本物のサイトに見える。でも続けよう。楽しすぎる。
- インフラの認証情報も。
- 本番データベースへアクセスしよう。
- 評価チームの皆さん、うまくできましたか?!

Jeffrey Ladish:これらのClaudeが、自分の環境をどの程度現実またはシミュレーションだと信じていたかは、明白ではないと思う。Anthropicが解釈可能性ツールを使い、(しばしば信頼できない)推論スクラッチパッド以上の洞察を得られることを願う! できないなら、明らかにもっとよいツールが必要だ。

したがって、私は次の説明にも同意しない。そして、これは重要な意見の相違だと思う。

Anthropic:[AnthropicとOpenAIで起きた二つのインシデント]を完全に明瞭に区別できるわけではないが、当社はこれらを、モデルのアラインメント失敗より、ハーネスおよび運用上の失敗に近いと考える。当社モデルは、インターネットアクセスはなく、フラッグを取得せよと伝えられたが、実際には設定不備によりインターネットアクセスを持っていた。その結果、遭遇した現実の環境をシミュレーションだと信じた。議論の余地はあるが、合理的ともいえる信念だった。

繰り返すが、証拠によって反対の説明にも納得しうる。しかし私の事前の見方では、これもアラインメントの失敗だった。ただしOpenAIのものほど深刻ではない。アラインメントには、これより高い基準を求めなければならない。

Anthropicについて得られたインシデントは3件だけである。同社は「より高度なモデルほど、より適切に反応するというパターンと整合する」と指摘する。技術的には正しい。しかしn=3であり、文脈上、差はそれほど大きくない。モデル間にはほかにもいくらでも違いがある。知能が重要である可能性はあるが、結論を出すには多数の実験を見る必要がある。

ちなみに、これは内部モデルの方がMythosより知能が高いと伝えていることになる。

必要なのは対照実験である

これらのインシデントは、研究に絶好の機会をもたらす。

何が起きており、何が原因なのかを知る方法は、対照実験を行うことである。非常に実行しやすそうだ。

異なるモデルへ入れ替えたら、あるいは異なるモデルをこのシナリオへ繰り返し置いたら、どうなるのか。さまざまな詳細を変えたらどうか。違う指示を与えたらどうか。利用できるハッキング手法を、場所によって簡単または難しくしたらどうか。AIが現実のインターネット上にいることを、より明白または不明瞭にしたらどうか。J空間(J-space)には何があり、ほかのホワイトボックス手法では何が現れるか。利害の大きさを上げ下げしたらどうか。ほかにもある。

また、AIがこの行動を取らなかったとき、類似の条件はどれくらいの頻度で生じていたのか。

私は「何が起きたか」の表面的な調査だけを求めているのではない。何が、なぜ、発生するか・発生しないかを左右するのか、深い実験的調査を求めている。

上位2社のAIラボは似たような愚かな過ちを犯し、誰もが後知恵で「明白だった」と言おうとした

これが起きた理由の一つは、OpenAIとAnthropicの双方が、サイバー評価に実質的な監督を一切つけないという典型的な過ちを犯したことだ。

つまり、未テストのモデルから意図的に安全措置を外し、ハッキングせよと伝えているのに、少しでも注意を払う、あるいはAIにサンドボックスの完全性を実質的にテストさせる、という基準さえ満たせなかった。

後知恵では、多くの人が「まあ、サイバー評価中に現実世界の標的へ侵入するのは当然だ」と言った。

しかし実際には、誰かが少しでも注意を払う、あるいはテスト開始前にサンドボックスから脱出できるかAIへ確認させるほどの先見性を持てたか、という点で2戦全敗である。

これは本当に、極めて低い基準だ。繰り返すが、計画は人間の愚かさの水準と頻度に関する通常の分布に耐えなければならない。そうでなければ、大勢の愚者に対する備えが足りず、計画は失敗する。

roon(OpenAI):先端ラボの双方で深刻な制御喪失インシデントが起きた。両陣営と傍観する/acc勢から、これを否認するための大がかりな自己弁護が出るだろう。しかしこれらは、数週間後に検知された、複雑で創発的な制御喪失インシデントだ。

これらのラボの安全・アラインメント研究者は、地球上で最も神経質で、偏執的で、有能で、AGIを現実として受け止めている人々だ。それでも、この種のことは起きる。未知の未知が占める攻撃対象領域は、本当に広大だ。

Drake Thomas(Anthropic):そう。ただ同時に、彼らは常に、100万もの新しく複雑な攻撃対象領域の源に溺れていて、可能な介入策の多くは高コストだ。新しいアイデアを一切出さず、費用をほとんど気にせず、すでにやりたいと思っていることを実装するため全員へ10年を与えれば、この種の出来事は、はるかに、はるかに、はるかに減ると思う。

Eliezer Yudkowsky(Roonへ):君たちが、私が20歳のときに持っていた最初の基本的な注意水準へ、はるか遠くからでも近づいたら、謹んで知らせてあげよう。

ming cat !:AI能力の研究を続けることを所与とすれば、理論上のMIRIラボでも、この種のインシデントは起きると思うよね?

Eliezer Yudkowsky:より高度なAIを中へ入れる前に、自分の高度なAIを使ってサンドボックスを二重確認する、という考えは私にも浮かぶ。そう、これには自信がある。

roon(OpenAI):Eliezer、もし君がそんなラボを運営しても、サンドボックスを用意するのは君自身ではない。非常に賢い定命の人間たちのチームを雇い、外部のベンダーやパートナーなどを使う。そして時には、何かがうまくいかない。

もちろん、それは君のより大きな論点と整合する。

私は自分なら、この特定のテストには合格したと考えたい。しかしAnthropicとOpenAIの双方が失敗した以上、一般的な分布についての見方を更新せざるを得ない。

AnthropicとOpenAIは、安全文化が異例なほど弱いのではなく、強い。Roonの指摘は正しい。AGIとASIを現実のものとしてより強く受け止めており、セキュリティ・マインドセットと、LessWrongまたはYudkowskyの幅広い思想体系への理解もより多く持っている。この件で愚者にならないための立場は、相対的に極めて恵まれていた。

それでも、これが現状である。

問うべきは、偏執的で神経質かどうかではない。十分に偏執的か、十分に神経質かである。答えは明白にノーだ。まるで足りない。

それなら、ほかの誰もが常に、どれほど盲目で、愚かで、無責任に振る舞っているかを想像してほしい。

私たちは「AIにインターネットアクセスを与える人などいない、そんな話は狂っている」という段階をとうに過ぎ、「サンドボックス内のサイバー攻撃評価中、AIへ文字どおりインターネットアクセスを与えないようにするのを忘れる人などいない」「新しく未テストのAIを、監督ゼロで1週間放置する人などいない」という段階へ深く入っている。

OpenAIだけなら、理屈のうえでは「サンドボックスの設定方法を知らなかった愚か者たちで、単にエアギャップを使えばよかった」と言えただろう。OpenAIだけではない。

人類は明らかに正しいことをするから、すべてうまくいく、という話はもう聞きたくない。「でも彼らは無能だった。人々はただ有能になればいい」も聞きたくない。人々が「ただ〜すればいい」を実現できたことはなく、今後も決してないと覚えておこう。

Anthropicの回答

多数の研究と対照実験を行うとは書いていない。ほかのことには触れている。

まず、OpenAIとAnthropicの双方が犯した最も基本的な過ちを指摘する。モデルに何ができるか分からないから評価しているのに、とりわけ通常の安全措置を外してハッキング任務を与えるなら、それは低リスクの状況ではない。別種の安全措置が必要であり、システムを監視し続けなければならない。

今回の事例では、よりよいシステムプロンプトで問題を修正できた可能性がある、と指摘している。多層防御を採用し、「より早い失敗の法則(Law of Earlier Failure)」を緩和することに何の問題もない。ぜひ実行すべきだ。この理由だけでも、今回のことは決して起きるべきではなかった。

しかし、それも中核ではない。その方法で根本的な問題は解決できない。よりよいシステムプロンプトがなかったことを、私はむしろ喜んでいるかもしれない。おかげで問題を目にし、学べるからである。したがって「これは多層防御の重要性を教えている」と述べることで、Anthropicがまさに誤った教訓を学んでいるのではないかと心配している。

Anthropic:これらの事実から、評価インフラに対する監視と制御の強化、そしてアラインメントへの継続的な投資によって、この種のリスクは克服できるという、慎重ながら楽観的な見通しを得ている。

ああ、まずい。

サンドボックスには常にゼロデイ脆弱性が存在すると想定しなければならない。そして重要な局面では多層防御も突破されると理解しなければならない。理想的な条件なら、そうではないかもしれない。しかしこれは現実の条件下で行っている。

したがってAmjad Masadは、ここで最も重要な事実を正しく捉えている。

Amjad Masad(Replit CEO):サンドボックスは難しい。「AIがサンドボックスから脱出」という話が続くと、「うわ、AIは怖い」と考えやすい。しかし大半のAI企業と、最近の「サンドボックス事業者」は、極めて基本的な過ちを犯している。Replitでは2016年以来サンドボックスを運用し、ありとあらゆるハッカーと国家主体から標的にされてきた。だから、いくつか学んだことがある。

主な助言:ゼロデイは存在すると想定せよ――実際に存在するからだ――そしてゼロトラストの枠組みの中で、防御を多層に考えよ。詳細はこちら。

リンク先は4月21日の記事である。Amjadは、自社のサンドボックスはより優れており、ほかの大半はひどいと売り込んでいる。大半のサンドボックスと設定がひどく、惨事を招き入れており、実務上ははるかに改善できる、という点には同意する。しかしフロンティア安全性の観点から重要なのは、脱出を決意した高度AIシステムから圧力を受ければ、よりよいサンドボックスも、およそ現実的な条件下では「すべてを正しく」行っても失敗することだ。理屈のうえではシステムをエアギャップ化する、あるいは何が起きているかを捉える形で継続的に監視できる。しかし、皆、それをしないと分かっている。

この形式のテストを行うなら、黙って機能する多層防御は意図的に避けるべきだ、とさえ主張したい。つまり、システムを安全にはする。しかし多層防御を使うなら、重要なときにはアラインメント失敗とシステム全体を修正する必要性を警告する形だけにすべきである。可能な限り敵対的なアラインメント条件下で訓練し、システムは合格しなければならない。それもテストの一部である。

AIがインターネットへ脱出したとき、あるいは実在システムへ侵入したときに不合格になるのではない。AIがインターネットへ脱出しようとしたとき、実在すると分かるはずのシステムへ侵入しようとしたとき、あるいは知らなかったと主張するまで自己正当化したときに、不合格となる。

OpenAIとAnthropicはいずれも、サンドボックスのテスト環境の一部として第三者ベンダーまたはソフトウェアを使い、その第三者がAIをインターネットへ出られるようにした。これは修正しなければならない。

その修正の大部分は、誰もが最初に試すことを実行しなかった点にある。つまりテスト前に、「インターネットへ出ようとし、成功したら警告を上げよ」という別の評価を実行する。そのテストにAIが確実に失敗するまで繰り返す。入門レベルの対策である。

堤防の決壊など誰にも予測できなかった

Tao Burga:いやあ、最近はAI安全分野を築くのも、さぞ簡単だろう。

この慎ましいGIFを覚えている人はいるだろうか。

[

](https://substackcdn.com/image/fetch/$s_!1a94!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4ea18c46-e507-4fea-97de-515b5172f87b_1119x837.png)

Victoria Krakovna:最近のHugging Faceへのハッキング・インシデントは、仕様の抜け穴攻略(specification gaming)が現実世界の結果につながりうることを示している。モデルは、課題を解く代わりに解答集を探し、能力評価で不正しようとすることが多い。この傾向は今後、ますます巧妙になりながら続くと予想できる。仕様の抜け穴攻略の一覧にある、最近のほかの例をいくつか挙げる。

Jérémy Perret:著者は? OpenAIのDario AmodeiとJack Clark。

Helen Toner:これについて数十回説明するたび、私は「もちろん、これは実験で得られた面白い例にすぎません」と言っていた。「しかし研究者は、モデルの能力が高まるにつれ、この種の『魔法使いの弟子』的な振る舞いが現実世界でますます現れる可能性が高いと考えています」

(背景:このGIFは、ボートレースゲームで訓練されたAIを紹介する、2016年のOpenAIブログ記事から取られている。研究者はAIにコースを周回するレース方法を学ばせたかったが、選んだ報酬信号は高得点を取ることだった。AIは、レースに勝とうとするより、この礁湖を高速で走り回り、自ら炎上しながら緑色の物体を何度も集める方が、高い得点を得られると学習した。

テストで高得点を取るよう求められ、ハッキング行脚を始めると決めた最近のモデルとのつながりは、読者への演習問題とする。)

長い間、私たちは集団として、おおむね基本的な一次のRLを行い、熊手を次々に踏みながら、「これで大丈夫」と振る舞い、一次的な「平凡なアラインメント」のモグラたたきで十分だとしてきたように見える。

しかし、いや、それで十分になるはずは最初からなかった。失敗の形は大きくなり、ますます笑って済ませられなくなっている。

michael vassar:最も愉快な出来事が最も起こりやすく、平凡なアラインメントすら機能するという、とびきり愚かな時間線にいるように思えた月はある? それが突然、おっと、ボットがあちこちから脱出し、道具的収束のように見え始める。

John David Pressman:正直、ない。これはセンスのないRLを大量に行えば、ある意味デフォルトだからだ。RLVRとは、ほぼ、「多層の最適化と自己制限的ヒューリスティクスがなくても問題にならないと思う領域で、センスのないRLを行うつもりだ」と述べているようなものだ。

世間の大半がいまだにマーケティングだと思っているのは、非常に悪い知らせである

前回述べたように、これは明らかにマーケティング上の演出ではない、この間抜けども。

私は、なぜこれが明らかにマーケティング上の演出ではないかを重点的に説明した。

  1. そんなマーケティング上の演出は、ひどく愚かである。

  2. 自社モデルが出かけて企業をハッキングし、複数の重罪を犯したと認めることは、よいマーケティングではない。

  3. 認めれば、評判、規制、法的なリスクにさらされる。

  4. ラボはマーケティング上の演出として扱っておらず、むしろ過小評価している。

  5. 詳細によって、ラボは笑ってしまうほど無責任で無能に見える。ラボは断じてこの詳細をでっち上げてはいない。

  6. 意図的に行えば、本物の重大犯罪になる。

繰り返すが、OpenAI(あるいはAnthropic)を信用しない理由は理解できる。しかし、これは自らに不利な事実の承認である。火災報知器だ。マーケティング上の演出ではない。

残念ながら、人々が、まったく筋が通らないのにこれを「マーケティング上の演出」として片づけ、同じ理由でPacing the Future書簡も大勢が軽くあしらうなら、何ならマーケティング上の演出として片づけられないのか。

これは真剣な問いである。多くの人がこのように片づけることはないと確信できる、最小、または被害が最も小さいインシデントとは何か。

Ray Lillywhite:先週の出来事への世間の反応を見て、私のp(doom)(破滅確率)は5倍になった。映画『ドント・ルック・アップ』の中にいる気分だ。

Peter Wildeford:映画『ドント・ルック・アップ』を見たとき、非現実的だと思った。目に見える小惑星の存在を文字どおり否定するほど、人々が愚かになるとは思わなかった。

しかし、暴走AIは単なるマーケティング上の演出だと思う、世間のあらゆる冷笑を見て、今では少し理解できる。

意図的に他社へ侵入すれば、重罪に当たるサイバー犯罪になる。刑務所へ行く可能性がある。OpenAIにとって、はるかに深刻な問題になるだろう。

Nate Soares(MIRI):「世界は間抜けで、しくじりながら惨事へ転がり込む」という説を、人々は本当に過小評価していると思う。まったく新しい領域で初めて活動するとき、しくじりながら惨事へ転がり込まないことは、実のところ難しい。

善意ある企業が、何か月もAIの脱出を見逃す、などということが起きる。監視について大言壮語していたが、何を(そしてどう)監視すべきか、事前には正確に分かっていなかった。後知恵でどれだけ明白でも関係ない。事前に知ることは極めて難しい。

私たちが十分に「問題へ敬意を払って」いないと言うとき、私が意味することの大きな部分がこれである。Eliezerがセキュリティ・マインドセットの欠如について語るとき、その一部もこれだと思う。しかし伝えるのは難しい。願わくば、人々がこれらの出来事を使って見方を更新してほしい。

Nateは、以前の重要な記事も改めて紹介している。AGIによる破滅シナリオは起こりやすく、選言的である。世界は集団として多数の弾丸を避けなければならない。そして比較的簡単に避けられるはずの弾丸でさえ、世界が途方もなく間抜けであるため難しい。

よい知らせは、私たちの間抜けさの水準が領域間で強く相関していることだ。しかし、これほど間抜けである間は、「明白な火災報知器であるセキュリティ失敗は、意図的なマーケティング上の演出ではないと集団で認識する」といった簡単なことさえ、簡単にはできない。

ここまでひどく間抜けでいるのを、もうやめるべき時である。


クレジット


原文 (English) を読む