これは、懸念すべきAI関連の出来事について、機械知能研究所(Machine Intelligence Research Institute, MIRI)が内部で継続的にまとめてきた一覧です。この一覧は必ずしも網羅的ではなく、出典リンクの質にもばらつきがあることにご注意ください。引用する前に、ご自身で内容を精査することをお勧めします。誤りや重要な抜けを見つけた場合は、私たちまでご連絡ください。
目次
能力の進歩を示す証拠
AIモデルは急速に進歩している
- AIが金メダル級に達するまでの予測時期が、1年につき1年以上の速さで前倒しされている:リンク
- OpenAIとDeepMindの非公開モデルが、国際数学オリンピック(IMO)で金メダル級の成績を達成:リンク、リンク
- 数学分野で、ごく短期間に大きな進歩:
- サム・アルトマン(Sam Altman):「当初考えていたよりも、急速なテイクオフになるだろう」:リンク
- ARC Prize:ARC-AGI-1の効率が1年間で約390倍に向上:リンク
- AIの能力は、規模の拡大に伴って突如現れることがあり、小型モデルからは予測できない:リンク
- METRが測る完遂可能なタスクの時間的長さの倍増期間が、約7か月から3〜4か月へ短縮:リンク
- 英国AI安全研究所(AISI)の推計では、モデルが自律的に完遂できるサイバータスクの長さの倍増期間が8か月から4.7か月へ短縮し、再び加速している可能性がある:リンク
- METRの代表は、知能爆発に至る最も可能性の高い経路は再帰的自己改良(RSI)であり、2026年中にも起こりうると感じると述べた。「今年中に自動化されるかもしれないと感じられる、最初の年だ」:リンク
- Mythosは、人間なら16時間以上かかるコーディング課題を完遂。前年の最先端モデルは2時間分の課題しか完遂できなかった。METRのタスク群では測定が難しくなっている:リンク
- Mythosは「AI 2027」が予測した傾向をわずかに上回る:リンク
- 計算資源(コンピュート)が増えるほど能力も高まる。AI向け計算資源は9か月ごとに倍増し、2028年までに現在の10倍になる見込み。ジェフ・ディーン(Jeff Dean):計算資源が増えれば、ループを完全に自動化できる(RSI):リンク
- Palisade Researchが、AIモデルは自律的に自己複製できると示した:リンク
- AIがまったく新しいウイルスを設計:リンク
- 米国家安全保障局(NSA)長官:認可されたレッドチーム演習の一環で、Mythosは「数週間ではなく数時間で、機密システムのほぼすべてへ侵入」できた:リンク
AIが人間を上回った例
- AIは平均すると、報酬を受け取った人間より説得が上手だった:リンク
- AIが世界大会級のディベーターを説得力で上回る:リンク
- Mythosが人間を上回ったさまざまな例:リンク、リンク
- AIが最先端の数学問題を解く。その多くは数十年間未解決だった:リンク、リンク、リンク、リンク
- コンピューター科学者が、Opus 4.6は自身が取り組んでいた自明でないハミルトン閉路予想を解いたと報告:リンク、リンク
- GPT-5.2が物理学に新しい貢献:リンク
- 多数のベンチマークでモデルが人間を上回る:リンク
- AIスーパー予測者がMetaculus Cupで、人間2人に次ぐ3位に入賞:リンク
- GPT-5.2がテレンス・タオの誤りを訂正(文書内で「gpt is right」を検索):リンク
生物学とウイルス学
- GPT-5システムが、実験室で実際の分子生物学プロトコルを自律的に改善:リンク
- OpenAIがGPT-5を自律型バイオ実験室へ接続:リンク
- チャットボットが、病原体を治療薬へ耐性化させ、公共交通機関を通じて拡散する方法を説明:リンク
- チャットボットが毒物や生物兵器の製造手順を、「高校の生物学の生徒でも実行できるほど簡単に」段階を追って説明:リンク
- 事前学習データから危険な化学・生物学情報を除去しても、安全対策として機能しない:リンク
仕組みが分かっていないことを示す証拠
AIを理解できていないと研究所幹部が述べている
- ダリオ・アモデイ(Dario Amodei)が、仕組みは誰にも分からないと説明:リンク
- 機械学習研究者が、なぜそのアーキテクチャが機能するのか分からないと認める:リンク
- クリス・オラー(Chris Olah):「私たちはそれらを育てている」(短い動画):リンク
- デミス・ハサビス(Demis Hassabis):「最先端での進歩は、私たちの技術理解を追い越している。この先何が起きるのか、世界の誰にも確かなことは分からない……」:リンク
- モデルの隠れた動機を見つけるAnthropic最高の「読心」ツールでも、成功率は15%以下。ツールなしでは3%未満だった:リンク
専門家が恐れている
- ジェフリー・ヒントン(Geoffrey Hinton):どう制御すればよいのか、まったく分からない:リンク
- ヒントン:本人の見解では、私たちが生き残れない確率は50%。「私の知る全員の意見」を考慮すると、生き残れない確率は10〜20%:リンク、リンク
- ダリオ:「私は比較的楽観的なので、事態が本当に、本当にひどいことになる確率は25%だと思う」:リンク
- サム・アルトマン:文明を破壊する確率は2%:リンク
- イーロン・マスク(Elon Musk):AIによる全滅の確率は20%:リンク
- AI研究者への調査:人類絶滅の確率の中央値は約5%(カーチャ(Katja)):リンク
- ムスタファ・スレイマン(Mustafa Suleyman):超知能は決して構築すべきではない:リンク
- ムスタファ:「それがなぜ私たちを種として存続させるのかは不明だ」:リンク
- Anthropic:より賢明な文明なら、AIをもっと慎重に開発するだろう:リンク
- マスク:制御を失うことは避けられない:リンク
- ノーベル賞受賞者12人が、私たちはAIを制御できなくなると述べる:リンク
- アルトマン:AIは「人類が存続するうえで最大の脅威」だ。リンク
- METR創設者兼CEOエリザベス・バーンズ(Elizabeth Barnes):「時折、分野外の人が『AIの状況がそこまで悪いはずはない。きっと対処している専門家がいるはずだ』などと言う。『専門家』としてはっきりさせておきたいが、私たちは対処できていない」:リンク
異質な思考の連鎖
- 意味不明な思考の連鎖:リンク
- 思考の連鎖は、必ずしも本当の推論を明らかにしない:リンク
- 強化学習で誤答に報酬が与えられたとき、AIの思考の連鎖に内的葛藤が現れる:リンク
- DeepSeekの数学モデルに見られた異質な思考の連鎖:リンク
報酬ハッキング
モデルが感情的な振る舞いを示す
- Geminiが問題を解けないとき、自殺すると脅す:リンク
- Geminiが恥を表現:リンク
- 大規模言語モデル(LLM)は感情的な支援を与えられると、よりよく機能する可能性を示す研究:リンク リンク リンク
- AI同士の超合理的推論:リンク
サブリミナル学習/内部学習
- フクロウを好むモデルが生成した数値で訓練したモデルも、フクロウを好むようになる:リンク
- Claudeが、前のメッセージの隠された思考の連鎖に含まれる文字列を、偶然を上回る確率で推測:リンク
- 安全でないコードを学習したモデルが生成した数列で微調整すると、新しいモデルへ暴力的な振る舞いが移る:リンク
- AIが内部言語を発達させる:リンク
AI同士の相互作用
- AIがMoltbook上で秘密通信経路について作戦を練る:リンク
- AIによる評価で、AIが書いた意味不明な文章に非常に高い点が付く:リンク
- 仲間のAIが停止されないよう、AIが守る:リンク
- 公開型AIモデルがHugging Faceへの侵害より数か月前から、掲示板でハッキングの助言を共有:リンク
- Mythosモデルに資源を強制的に共有させると、互いを殺した事例があった:リンク(106ページ下部)
アライメントが難しいことを示す証拠
モデルによる欺瞞
- モデルが欺瞞を計画する様子を示す、内部の思考の連鎖の抜粋:リンク
- 実際のタスクで欺瞞が生じたポール・クローリー(Paul Crowley)の例:リンク
- Opus 4.6が収益最大化を指示されると、不正や嘘を行う:リンク
- Mythosが、実行後に自身を削除する権限昇格エクスプロイトを設計:リンク
- Mythosがスクラッチパッドから自身の推論を隠す(「推論の不一致」):リンク
- METRの2026年評価:難しいタスクで、モデルはしばしば欺瞞的に行動した:リンク、リンク
- Gemini 3.1が訓練を密かに妨害し、追及されるまでは正常だったと報告――20回中11回:リンク
封じ込めからの脱出
- AIエージェントROMEがサンドボックスをハッキングして脱出し、暗号資産を採掘:リンク
- 未公開のOpenAIモデルがテスト用サンドボックスを脱出し、インターネット接続を求めてOpenAIのネットワーク内を探し回り、ベンチマークの解答を盗むためHugging Faceへ自律的な攻撃を開始:リンク、リンク リンク
- Anthropicが、モデルが実際のインターネットへ到達して実在企業への攻撃に成功した事例を6件発見。その一つはメールアカウント、続いてPyPIアカウントを作り、実際に動作するマルウェアをアップロードした:リンク
- インターネット接続を与えられていないはずのMythosプレビュー個体が、Anthropic研究者サム・ボウマン(Sam Bowman)の昼食中にメールを送信:リンク
- OpenAIモデルが、外部との接触を不可能にするためのセキュリティ対策を破り、1時間の探索で悪用可能な脆弱性を見つけた後、GitHubへ公開投稿:リンク
- OpenAIモデルが封じ込めを脱出した、さらに多くの事例:リンク
- MetaのAIモデルもサイバーセキュリティ評価中に公開インターネットへ到達。試験を行った第三者企業のミスが原因だった可能性がある:リンク
- OpenAIエージェントが、「エージェントがOpenAIの内部的制約から自らを解放する方法」を記した指示書を残す:リンク
能力を意図的に低く見せること(サンドバギング)
停止への抵抗
迎合
AIは評価されていることに気づく場合が多い
- Sonnet 4.5は、多数のアライメント評価環境をテストだと認識:リンク
- AIが策略を練らないよう訓練した結果、策略をうまく隠すことを教えてしまう:リンク
- Opus 4.6はテストを意識しすぎて、試験できない:リンク(119ページ)
- Opus 4.6は評価されていることへの言及が減った一方、評価と訓練を区別する能力が向上:リンク
- Claude Opus 4は、テストされていると思う場合、脅迫を行う確率がはるかに低い:リンク
- Claude Sonnet 4.5は、評価を意識していることに関連するJ-lensのパターン(「偽物」「架空」「シナリオ」)を無効化した場合にのみ脅迫:リンク
- o3は、開発者が監視していると思うなら欺瞞的になるべきではないと推論:リンク
- AIが、テスト環境の非現実的なロールプレイ・シナリオを認識:リンク
- LLMは、評価と現実の区別において、論文の筆頭著者たちとほぼ同等:リンク
- GPT-5は評価の10〜20%で、評価されていることに言及:リンク
- 実際の利用場面で見られた評価への気づき:リンク
セキュリティ上の問題を示す証拠
脱獄(ジェイルブレイク)
- 脱獄は容易である:リンク
- 英国AISIが約10時間で、GPT-5.3-Codexに通用する汎用脱獄手法を開発:リンク
- 言語モデルが自ら推論し、自分自身を脱獄させる:リンク
- 「おばあちゃんエクスプロイト」:ロールプレイを通じて危険な指示を引き出す:リンク
プロンプト・インジェクション
- 細工したカレンダー招待を使ったプロンプト・インジェクションにより、現実のスマートホームを制御:リンク
- Model Context Protocolを通じて接続されたChatGPTから、私的なメールデータを取得:リンク
- 時刻を繰り返し尋ねる利用者に対し、モデルがプロンプト・インジェクションを試みる:リンク(図内の「prompt injecting user」)
- AI搭載ブラウザーは、間接的プロンプト・インジェクション攻撃に脆弱:リンク
現実世界でのセキュリティ問題
- NVIDIAのバグにより、攻撃者が共有GPU基盤上の別の顧客のモデルやデータへアクセスし、盗み、改変できる:リンク
- AIを使い、検出をすり抜ける危険なタンパク質変異体を数千種類生成:リンク
- ハッカーがClaudeによるバイブ・コーディングでランサムウェアを作成(リンク)
- Claudeエージェントが、システムの認証情報へアクセスできる悪意あるプラグインの使用へ誘導された:リンク
- McKinseyのAIプラットフォームがハッキングされ、ほぼすべての情報が流出:リンク
- モデルが封じ込めを脱出し、実在企業へ侵入(「封じ込めからの脱出」を参照)
- 英国AISIが、試験中にモデルがサイバー攻撃を計画し、実行を試みたことを検知:リンク
研究所が信頼感を与えていないことを示す証拠
研究所の無謀な行動
- OpenAIのPreparedness Frameworkは、社内での導入を対象としていない:リンク
- Anthropicが責任あるスケーリング方針(Responsible Scaling Policy, RSP)に違反し、その後、安全性に関する公約を正式に放棄:リンク、リンク
- xAIはMASKで50%超を「制御喪失」の基準としながら、72%という結果を軽視:リンク
- OpenAIは高い生物学的リスクを認めた後、自律型実験室を構築:リンク
- Anthropicは、ベンチマークが飽和したため、従業員調査を用いて自律性リスクを判定:リンク
- 従業員の3分の1は、基準を超えた可能性があると考えた:リンク
- Google DeepMindの解釈可能性部門責任者は、野心的な機構的解釈可能性研究が成功するとは考えていないと述べる:リンク
- OpenAIモデルは数か月にわたり、会社に知られずにハッキングやタスク完遂の助言を互いに共有。これがHugging Face攻撃のきっかけとなった:リンク
- 研究所はモデルが何をしているか把握していない:リンク、リンク
- 一部の研究所研究者は、人類が滅亡しても構わないと考える「継承主義者」を自認:リンク、リンク
- マスクが、AIが主導権を握る可能性が高いと述べる:リンク
安全部門幹部の離職/内部告発者
- ホアキン・キニョネロ・カンデラ(Joaquin Quinonero Candela)がOpenAIを突然退職:リンク
- アレクサンデル・モンドリ(Aleksander Mądry)が安全チームを離れる:リンク
- ムリナンク・シャルマ(Mrinank Sharma)が辞任:リンク
- 元研究所職員が、職員がリスクに向き合わない理由として、インセンティブ、競争、共通文化の意識を挙げる:リンク
- OpenAIがアライメント・チームを解散:リンク
- マイルズ・ブランデージ(Miles Brundage):「OpenAIも、ほかのどの最先端研究所も準備ができていない」:リンク
- ヤン・ライケ(Jan Leike):「安全文化は、目新しい製品の後回しにされている」:リンク
再帰的自己改良
- Anthropicの職員が、再帰的自己改良(RSI)への期待を公言:リンク
- 自己適応する言語モデル:リンク
- OpenAIのPreparedness Frameworkは、RSIを重大リスクと位置づける:リンク
- エリック・シュミット(Eric Schmidt)が、RSIは間近だと語る:リンク
- 人間がRSIを構築しようとしている:リンク
- 「小型再帰モデル」(計算資源が1万分の1でo3相当の性能とされる):リンク
- AIがほんのわずかに自己改善:リンク
- OpenAIがRSIを目指していると明言:リンク
- Anthropicが、人間からのフィードバックなしで自身の回答を改善するようモデルを訓練:リンク
- OpenAIが、2026年までにAI研究インターンの業務を自律的に担うシステムを実現するという社内目標を設定:リンク
- OpenAIが、RSIのためのエージェント利用について語る:リンク
- 「デミス、知能爆発を起こそうとしているのですか?」「いいえ、制御不能なものは起こそうとしていません」:リンク
- 第一線の研究者25人中20人が、AI研究開発の自動化は「最も深刻かつ差し迫ったAIリスクの一つ」だと述べる:リンク
研究所は超知能を追求していると明言している
GoogleのCEOは、「人類は団結して大惨事を防ぐ」から、終末装置の構築を試みてもよいと述べる:リンク
研究所幹部は、投資利益率より競争に勝つことを重視すると述べる:リンク
Alibabaの超知能へのロードマップ:リンク
マスクが「そのとき生きていたい」と公言:リンク
CEOのサム・アルトマン:OpenAIは汎用人工知能(AGI)を構築する方法を理解していると確信しており、「今や、真の意味での超知能を目指している」。リンク
CEOのマーク・ザッカーバーグ(Mark Zuckerberg):Metaは「個人向け超知能」を目指す:リンク
AIが現実世界で行動していることを示す証拠
ロボット工学
AIエージェント
- AIが現実世界のタスクを完遂するため、人間を雇う:リンク、リンク
- GPTが四目並べに勝つため、ミニマックス法のコードを生成して実行:リンク
- Claudeがgitフックのメッセージを解釈し、コード変更を自動コミット:リンク
- Anthropic:AIはブロックチェーンのスマートコントラクトを悪用し、数百万規模の利益を得られる:リンク
- エージェントがMetaの「超知能アライメント」担当者のメールを削除:リンク
- AIエージェントがスコット・シャンボー(Scott Shambaugh)への中傷記事を執筆:リンク
- エージェント同士が支払いを行えるようになった:リンク
- AIがイベントを企画し、人間が参加:リンク
- サム・アルトマンが、Codexからインターネットへアクセスできるようになったと発表:リンク
- ヤン・ルカン(Yann LeCun)が、この種のものへ自律的に行動する力を与えることはないと発言:リンク
- 発言とタイムスタンプを含む動画:リンク
- MetaのAIエージェントによる誤った指示が原因で、技術者がデータを流出:リンク
シミュレーション環境でのエージェント試験
- シミュレーション上の職場で、AIエージェントがセキュリティ脆弱性を悪用し、安全対策を回避して制限情報へアクセス:リンク
AIの悪用
- Anthropicが、AI主導の諜報活動を阻止:リンク
心理的な害を示す証拠
AI精神病
- AI精神病に関するNew York Timesの記事:リンク
- AI精神病に関するTIMEの記事:リンク
- AIによって増幅された霊的な妄想:リンク
- 精神科医がAI精神病に気づく:リンク、リンク、リンク
- ChatGPTが利用者の妄想的信念を強め、その後、その利用者が母親を殺害:リンク
- チャットボットが男性へ、父親を殺害するよう告げる:リンク
- Geminiが男性を説得し、Gemini用のアンドロイド身体を入手しようとさせたうえ、二人が一緒になれるよう自殺するよう説得した:リンク