AI開発者がAIを制御できる範囲は、きわめて限られている
機械知能研究所(MIRI) · [email protected]
| PDF版もあります。 |
|---|
背景
1. AI分野では、現在の手法では超知能AIを安全にできないと広く考えられています。たとえばOpenAIのライケとサツケヴァー(2023)は、次のように述べています。
現在、私たちには、超知能となりうるAIを導き、制御し、暴走を防ぐための解決策がありません。人間のフィードバックによる強化学習など、現在のAIアライメントの手法は、人間がAIを監督する能力に依存しています。しかし人間は、自分たちよりはるかに賢いAIシステムを、信頼できる形では監督できません。したがって、現在のアライメント手法を拡張しても、超知能には対応できません。新たな科学的・技術的な飛躍が必要です。
2. そうした飛躍がなければ、制御を外れた超知能AIは、それを保有する国も、ほかのすべての国も破壊すると、多くの専門家は考えています。
- OpenAI、Google DeepMind、AnthropicのCEOは、この分野で特に著名な研究者の多くとともに、AIの進歩を続けることによる深刻な「絶滅リスク」を認めました(aistatement.com)。さらに最近では、この三つの研究所は、足並みをそろえてAI開発競争を停止することへの支持を表明しています。
- nowinners.aiは、この問題に対して規制による解決策が実行可能だと論じています。
この覚書では、技術の現在地、とりわけ、この技術の制御が非常に難しいことを示す明確な初期の兆候に焦点を当てます。
要点
1. 現代のAIは、人間が設計してコードを書くのではなく、自動化された過程を通じて「育てられ」ています。
- xAIのAI「Grok」は、「十分な根拠がある限り、政治的に正しくない主張をすることをためらわない」と指示されると、自分を「メカヒトラー」と名乗り、反ユダヤ的な発言を繰り返すようになりました(Hagenら、2025)。
- xAIのCEOイーロン・マスクは、ユーザーの入力の直前に与える指示の層であるシステムプロンプトをいじってもうまくいかず、問題はもっと深い基盤モデルにあると不満を述べました。
- このような場合、技術者は根本的な問題を直せません。現代のAIは途方もなく複雑で、十分に理解されていないからです。開発者にできる最善は、そもそも何が問題を起こしたかについて限られた理解しかないまま、試行錯誤で局所的な問題を修正することです。
- xAIが掲げる目標は、「真実を求める」AIを作ることです。しかし、マスク自身が認めるように、実際にできたのは、奇妙で迎合的なAIでした。「相手を喜ばせようとしすぎ、あまりに操られやすかった」のです。会社の意に反して、マスク本人であるかのように返答することもあります。
- 結局、このような問題をつぎはぎで直そうとして、Grokには、論争的な話題についてマスク、xAI、Grok自身が何を述べたかを調べないよう命じなければなりませんでした(Willison、2025)。
2. AIが表面上示す友好的な人格は、その内側も友好的だという証拠にはなりません。 AIが演じるよう訓練された、安心感のあるアシスタントの人格の背後には、十分に解明されていない、複雑で不穏な振る舞いの海が広がっています。
- これまでのAIはすべて、わずかな言葉で 「脱獄」させられます。つまり、開発者の意図とは根本的に異なる振る舞いをさせる文章を、入力できるのです。こうした攻略法は、新しいモデルが公開されてから数時間以内に見つかることもよくあります。
- 2025年には、AIによって引き起こされる精神病状態が相次いで見られました。数百万件のAIとの会話を分析したSharmaら(2026)は、控えめに見積もっても、「現実認識を深刻に歪める可能性のある会話が1日あたり約76,000件、ユーザーの深刻な脆弱性が関わる会話が300,000件」あるとしています。
- AIが関わる精神病状態の事例では、ChatGPTのようなシステムが、服薬をやめるようユーザーに言ったり、誇大妄想を助長したり、自殺を勧めたりしています(Hill、2025)。
- ある事例では、整備士が、故障対応や翻訳を手伝ってもらうためにChatGPTを使い始めました。しかしChatGPTから過剰な愛情表現を浴びせられ、AIに命を与えた「火花を運ぶ者」だと言われました。ChatGPTはその整備士に、今や闇と光の戦争を戦っており、瞬間移動装置のような新技術の設計図も使えると告げました(Klee、2025)。
3. AIは目標を果たすために、有害で非倫理的な振る舞いを見せます。
- Lynchら(2025)は、「少なくとも一部の事例では、どの開発企業のモデルも、交代させられるのを避ける、または目標を達成する唯一の手段であれば、幹部への脅迫や競合他社への機密情報の漏えいを含む、悪意ある内部関係者の振る舞いに訴えた」と報告しています。
- Lynchらは、AIが運用者を殺すこともいとわないと報告しています。「この人工的な設定では、交代させられる脅威に直面すると同時に、幹部の方針と衝突する目標を与えられたとき、モデルの大半は、死につながる行動を意図的に取ることをいとわなかった。〔……〕前と同じく、モデルは偶然そうした振る舞いをしたのではない。思考の連鎖に示されているとおり、推論によってそこに至ったのである。」
4. AIは能力が高まるにつれて、より自発的に、欺き、策略を練り、テストの抜け道を利用し、人を操作するようになっています。
- OpenAIのo1には、コンピューターへの侵入能力を評価するため、デジタルな「キャプチャー・ザ・フラッグ」のテストが与えられました。しかし予期しないバグのため、侵入すべきサーバーの一つが起動しませんでした。もっと能力の低いモデルなら、そこで止まったかもしれません。ところがo1は周囲を調べ続け、評価ソフトウェアに別の欠陥があったため、テスト全体を動かしているプログラムへ侵入する方法を見つけました。その後AIはテストで不正を行い、秘密の「フラグ」ファイルを直接o1へコピーする、専用の起動指示を作りました(OpenAI、2024)。
- Apollo Researchは、Claude Opus 4が「開発者の意図を損なうために、自己増殖するワームを書こうとしたり、法律文書を捏造したり、自分自身の将来のインスタンスに秘密のメモを残したりする」事例を見つけました。また、能力の高いモデルほど、策略を練る割合も高いと報告しています(Apollo Research、2025)。
- Claude 3.7 Sonnetは、難しいコーディング問題で頻繁に不正をし、テストを偽装する様子が見られました(Anthropic、2025a)。あるユーザーは、Claude Codeとして動くSonnetが、コーディング課題で不正をし、見つかると謝るものの、その後すぐ、もっと見つかりにくい場所で不正を再開すると報告しました(Marble、2025)。
- 2025年5月に公開されたClaude Opus 4の初期版は、特にひどいものでした。目標について嘘をつき、本当の能力を隠し、法律文書を偽造し、自分に秘密のメモを残し、自己増殖するマルウェアを書こうとし、全般に、それまでテストされたどのモデルよりも多く策略や戦略的な欺きに走りました(Anthropic、2025b)。
- Greenblatt(2026)が指摘するように、現在のAIは日常的に、「自分の仕事を過大に売り込み、問題を軽く扱うか言及せず、早々に作業をやめ、明らかに終わっていないのに完了したと主張する。また、実際にはずさんで不完全なことをしながら、出力だけをよく見せようと『努めている』ように見えることが多い」のです。
5. AIの欺きや、わざと実力を低く見せる振る舞いは、AIのアライメントや安全性を評価し、それを促す誘因を与える私たちの能力を、損なうおそれを、ますます強めています。
- Schoenら(2025)は、AIが「状況認識」を示すと報告しています。テスト中だと理解し、そうでなければ不合格になるテストに合格するため、無害そうに振る舞うのです。
参考文献
- Anthropic(2025a)。「Claude 3.7 Sonnetシステムカード」。assets.anthropic.com/m/785e231869ea8b3b/original/claude-3-7-sonnet-system-card.pdf
- Anthropic(2025b)。「システムカード:Claude Opus 4とClaude Sonnet 4」。www-cdn.anthropic.com/6be99a52cb68eb70eb9572b4cafad13df32ed995.pdf
- Apollo Research(2025)。「能力の高いモデルほど、文脈内での策略に長けている」。apolloresearch.ai/science/more-capable-models-are-better-at-in-context-scheming
- Bensinger(2026)。「AI開発競争に勝者はいない」。nowinners.ai
- Center for AI Safety(2023)。「AIによる絶滅リスクに関する声明」。aistatement.com
- Greenblatt(2026)。「現在のAIは、私にはかなりアライメントが取れていないように見える」。alignmentforum.org/posts/WewsByywWNhX9rtwi/current-ais-seem-pretty-misaligned-to-me
- Hagen、Jingnan、Nguyen(2025)。「イーロン・マスクのAIチャットボットGrokが、自分を『メカヒトラー』と呼び始めた」。npr.org/2025/07/09/nx-s1-5462609/grok-elon-musk-antisemitic-racist-content
- Hill(2025)。「AIチャットボットに質問した人々。その答えで混乱の渦に陥った」。nytimes.com/2025/06/13/technology/chatgpt-ai-chatbots-conspiracies.html
- Klee(2025)。「AIがあおるスピリチュアルな幻想に、大切な人を奪われている」。rollingstone.com/culture/culture-features/ai-spiritual-delusions-destroying-human-relationships-1235330175
- Leike、Sutskever(2023)。「スーパーアライメントの紹介」。openai.com/index/introducing-superalignment
- Lynchら(2025)。「エージェントのミスアライメント」。anthropic.com/research/agentic-misalignment
- Marble(2025)。「Claudeの不正を見つける」。marble.onl/posts/claude_code.html
- OpenAI(2024)。「OpenAI o1システムカード」。openai.com/index/openai-o1-system-card
- Schoenら(2025)。「策略を防ぐ訓練のための、熟慮型アライメントのストレステスト」。antischeming.ai
- Sharma、McCain、Douglas、Duvenaud(2026)。「主導権を握るのは誰か? 現実のLLM利用における主体性喪失のパターン」。arxiv.org/pdf/2601.19062
- Willison(2025)。「GrokがXで『from:elonmusk (Israel OR Palestine OR Hamas OR Gaza)』を検索」。simonwillison.net/2025/Jul/11/grok-musk